Interviews
Matt Hocking, Co-Founder von WellSaid Labs – Interview-Serie

Matt Hocking ist der Co-Founder von WellSaid Labs, einem führenden Unternehmen für AI-Voice-Generatoren im Unternehmensbereich. Er hat mehr als 15 Jahre Erfahrung in der Leitung von Teams und der Bereitstellung von Technologielösungen im großen Maßstab.
Ihre Vergangenheit ist ziemlich unternehmerisch geprägt, wie sind Sie ursprünglich in die AI-Branche eingestiegen?
Ich denke, ich habe mich immer als ziemlich unternehmerisch betrachtet. Ich habe mein erstes Unternehmen direkt nach dem College gegründet und mit meinem Hintergrund in Produktgestaltung habe ich mich immer wieder daran beteiligt, anderen bei frühen Ideen zu helfen. Im Laufe meiner Karriere hatte ich das Glück, mit einer Reihe von Start-ups zu arbeiten, die einige ziemlich unglaubliche Erfolge hatten. Während dieser Erfahrungen hatte ich die Gelegenheit, viele großartige Gründer direkt kennenzulernen, was mich wiederum inspirierte, meine eigenen Ideen als Gründer zu verfolgen. AI war für mich relativ neu, als ich zu AI2 stieß; jedoch bot mir diese Erfahrung die Gelegenheit, meine Produkt- und Start-up-Erfahrung auf einige wirklich erstaunliche Forschungsergebnisse anzuwenden und mir vorzustellen, wie diese neuen Fortschritte in den kommenden Jahren vielen Menschen helfen könnten. Mein Ziel seit Beginn an war es, echte Unternehmen für echte Menschen zu entwickeln, und ich glaube, dass AI das Potenzial hat, viele aufregende Chancen und Effizienzen in unserer Zukunft zu schaffen, wenn es sorgfältig eingesetzt wird.
Können Sie die Geschichte erzählen, wie die Idee für WellSaid Labs entstand, als Sie als Entrepreneur in Residence am The Allen Institute for AI tätig waren?
Ich trat 2018 dem Allen Institute for Artificial Intelligence (AI2) als Entrepreneur in Residence bei. Arguably das innovativste Inkubator der Welt, AI2 beherbergt die hellsten Köpfe in der AI, die Lösungen von der Spitze dessen, was heute möglich ist, auf greifbare Produkte anwenden, die Probleme auf der ganzen Welt lösen. Mein Hintergrund in Design und Technologie hat ein langjähriges Interesse an den kreativen Bereichen genährt, und mit dem AI-Boom, den wir heute erleben, wollte ich einen Weg finden, diese beiden Bereiche zu verbinden. Ich wurde Michael Petrochuk (Co-Founder und CTO von WellSaid Labs) vorgestellt, während ich an einer interaktiven Healthcare-App arbeitete, die den Patienten durch verschiedene sensible Szenarien führte. Während der Entwicklung des Inhalts für diese Erfahrung arbeitete mein Team mit Sprechern zusammen, um Tausende von Zeilen von Voiceover für den Avatar aufzuzeichnen. Als ich einige der Durchbrüche sah, die Michael während seiner Forschung erzielt hatte, sahen wir beide schnell den Wert, den menschliche Text-to-Speech-Technologie (TTS) nicht nur für das Produkt, an dem ich arbeitete, sondern auch für andere Anwendungen und Branchen haben könnte. Technologie und Tooling hatten Schwierigkeiten, mit den Bedürfnissen der Produzenten, die mit Voice als Medium arbeiteten, Schritt zu halten. Wir sahen einen Weg, diese Technologie in die Hände aller Kreativen zu legen und es ihnen zu ermöglichen, Voice zu einem integralen Bestandteil aller Geschichten zu machen.
WellSaid Labs ist eines der wenigen Unternehmen, das Schauspielern eine Möglichkeit bietet, in den AI-Voiceover-Bereich einzusteigen. Warum glaubten Sie, es sei wichtig, echte Stimmen in das Produkt zu integrieren?
Unsere Antwort darauf ist zweigleisig: Erstens wollten wir Lösungen entwickeln, die die Fähigkeiten professioneller Sprecher ergänzen und Chancen für Voice erweitern. Zweitens streben wir danach, das höchste Level an menschlicher Qualität in unseren Produkten zu erreichen. Unsere Sprecher sind langfristige partnerschaftliche Partner und erhalten eine Vergütung und einen Umsatzanteil für ihre Stimmdaten und den daraus produzierten Inhalt. Jeder Sprecher, den wir einstellen, um ein AI-Stimmen-Avatar auf der Grundlage seines Stimmtyps zu erstellen, wird auf der Grundlage dessen bezahlt, wie viel seine Stimme auf unserer Plattform verwendet wird. Wir ermutigen Talent, mit uns zusammenzuarbeiten; eine faire Vergütung für ihre Beiträge ist uns unglaublich wichtig.
Um die höchste Ebene menschlicher Qualität in unseren Produkten zu bieten, müssen wir streng darauf achten, woher wir unsere Daten erhalten. Dieser Prozess gibt uns mehr Kontrolle über die Qualität, da wir unsere Deep-Learning-Modelle darauf trainieren, sowohl menschliche Parität als auch spezifische kontextuell relevante Stile zu erreichen. Wir erstellen nicht nur eine Stimme, die den bereitgestellten Input vorträgt. Unsere Modelle bieten eine Vielzahl von Stimmen, die das auf der Seite Stehende ausführen. Ob Benutzer Voiceover mit einem Avatar aus unserer Bibliothek erstellen oder Voiceover mit einer benutzerdefinierten Stimme für ihre Marke erstellen, verwenden wir echte Stimmdaten, um einen nahtlosen Prozess und eine einfache Plattform zu gewährleisten. Wenn unsere Kunden unsere Stimmen in der Postproduktion manipulieren und bearbeiten müssten, um das gewünschte Ergebnis zu erzielen, wäre der Prozess umständlich und langwierig. Unsere Stimmen berücksichtigen den Kontext des geschriebenen Inhalts und liefern eine kontextuell genaue Lesung. Wir bieten Stimmen für alle Arten von Anwendungsfällen – ob es sich um das Vorlesen von Nachrichten, die Erstellung von Audio-Werbung oder automatisierte Call-Center-Unterstützung handelt – und die Partnerschaft mit professionellen Sprechern für jeden Anwendungsfall bietet uns sowohl Kontext als auch hochwertige Stimmdaten.
Wir aktualisieren und fügen unserer Avatar-Bibliothek regelmäßig neue Stile und Akzente hinzu, um sicherzustellen, dass wir die Stimmen unserer Kunden repräsentieren. In WellSaid Labs’ Studio können Kunden und Marken verschiedene Stimmen basierend auf Region, Stil und Anwendungsfall auswählen, was eine nahtlosere und einheitlichere Produktion von Audio-Inhalten ermöglicht, die auf die Bedürfnisse des Erstellers zugeschnitten sind. Sobald eine anfängliche Aufnahme sampelt wurde, können Benutzer bestimmte Wörter, Schreibweisen und Aussprachen anpassen, um sicherzustellen, dass die AI konsistent auf ihre Bedürfnisse eingeht.
WellSaid Labs beansprucht, das erste ethische AI-Voice-Unternehmen zu sein. Warum sind AI-Ethik für Sie wichtig?
Da die AI-Adoption zunimmt und mainstream wird, stehen Ängste vor schädlichen Anwendungsfällen und schlechten Akteuren im Mittelpunkt jeder Konversation – und diese Bedenken werden leider durch reale Ereignisse bestätigt. AI-Stimme ist keine Ausnahme; fast jeden Tag erscheint ein neuer Bericht über eine berühmte Persönlichkeit, einen öffentlichen Funktionsträger oder einen Politiker, der für Werbezwecke oder politische Zwecke tiefgefälscht wird, in den Nachrichten. Obwohl formelle Bundesregulierungen bezüglich dieser Technologie noch im Entwicklungsstadium sind, wird es zunehmend schwieriger, bösartige Akteure und Anwendungsfälle von synthetischen Stimmen zu erkennen und zu bekämpfen, da die Technologie weiter fortschreitet.
Kommend von AI2, wo AI-Ethik ein grundlegendes Prinzip ist, hatten Michael und ich diese Gespräche am ersten Tag. Die Entwicklung von AI-Sprachtechnologie geht mit erheblichen Verantwortungen in Bezug auf Zustimmung, Privatsphäre und allgemeine Sicherheit einher. Wir wissen, dass wir als Entwickler unsere Technologie sicher aufbauen, ethische Bedenken ansprechen und die Grundlage für die zukünftige Entwicklung von synthetischen Stimmen legen müssen. Wir erkennen das Potenzial von AI-Sprachtechnologie für Missbrauch und übernehmen die Verantwortung, den potenziellen Missbrauch unseres Produkts zu reduzieren. Wir müssen diese Grundlage von Tag eins an legen, anstatt schnell voranzuschreiten und unterwegs Fehler zu machen. Das wäre nicht richtig gegenüber unseren Unternehmenskunden und Sprechern, die auf uns zählen, um ein hochwertiges und vertrauenswürdiges Produkt zu bauen.
Wir unterstützen den Ruf nach Gesetzgebung in diesem Bereich voll und ganz; jedoch werden wir nicht auf Bundesregulierungen warten, um zu handeln. Wir haben immer Praktiken priorisiert und werden weiterhin Praktiken priorisieren, die Privatsphäre, Sicherheit, Transparenz und Rechenschaftspflicht unterstützen.
Wir halten uns strikt an unseren ethischen Kodex, der auf verantwortungsvoller Innovation bei jeder Entscheidung basiert. Dies liegt im besten Interesse unserer globalen Kunden – Unternehmensmarken.
Wie entwickeln Sie eine ethische AI-Voice-Plattform?
WellSaid Labs hat sich von Anfang an zu ethischer Innovation bekannt. Wir zentralisieren Vertrauen und Transparenz durch die Verwendung von internen Datenmodellen, expliziten Zustimmungsanforderungen, unserem Content-Moderierungsprogramm und unserem Engagement für Markenschutz. Bei WellSaid stützen wir uns auf die Grundsätze von verantwortungsvoller AI, um unsere Entscheidungen und Designs zu gestalten, und diese Grundsätze erstrecken sich auf die Verwendung unserer Stimmen. Unser ethischer Kodex repräsentiert diese Grundsätze als Rechenschaftspflicht, Transparenz, Privatsphäre und Sicherheit sowie Fairness.
Rechenschaftspflicht: Wir halten strenge Standards für angemessenen Inhalt ein und verbieten die Verwendung unserer Stimmen für Inhalt, der schädlich, hassvoll, betrügerisch oder darauf abzielt, Gewalt zu verursachen, ist. Unser Trust- und Sicherheitsteam hält diese Standards mit einem strengen Content-Moderierungsprogramm ein, das Benutzer blockiert und entfernt, die versuchen, unsere Nutzungsbedingungen zu verletzen.
Transparenz: Wir erfordern explizite Zustimmung, bevor wir eine synthetische Stimme mit den Stimmdaten einer Person erstellen. Benutzer können keine Stimmdaten von Politikern, Berühmtheiten oder anderen Personen hochladen, um eine Klone ihrer Stimme zu erstellen, es sei denn, wir haben die schriftliche Zustimmung dieser Person.
Privatsphäre und Sicherheit: Wir schützen die Identitäten unserer Sprecher, indem wir Stockbilder und Aliase verwenden, um die synthetischen Stimmen darzustellen. Wir ermutigen sie auch, Vorsicht walten zu lassen, wie und mit wem sie ihre Assoziation mit WellSaid Labs oder anderen synthetischen Stimmen-Unternehmen teilen, um die Gelegenheit für einen Missbrauch ihrer Stimme zu reduzieren.
Fairness: Wir vergüten alle Sprecher, die Stimmdaten für unsere Plattform bereitstellen, und bieten ihnen einen laufenden Umsatzanteil für die Verwendung der synthetischen Stimme, die wir mit ihren Daten erstellen.
Zusammen mit diesen Grundsätzen respektieren wir auch streng geistiges Eigentum. Wir beanspruchen nicht das Eigentum an dem Inhalt, den unsere Benutzer oder Sprecher bereitstellen. Wir priorisieren Integrität, Fairness und Transparenz in allem, was wir tun, und stellen sicher, dass unsere synthetische Sprachtechnologie verantwortungsvoll und ethisch eingesetzt wird. Wir suchen aktiv nach Partnerschaften mit Stimmen aus verschiedenen Hintergründen und Erfahrungen, um sicherzustellen, dass wir eine Stimme für jeden bieten.
Unser Engagement für verantwortungsvolle Innovation und die Entwicklung von AI-Sprachtechnologie mit ethischen Grundsätzen im Blick setzt uns von anderen in diesem Bereich ab, die versuchen, durch jeden möglichen Weg in diesem neuen, unregulierten Markt zu kapitalisieren. Unsere frühen Investitionen in Ethik, Sicherheit und Privatsphäre schaffen Vertrauen und Loyalität bei unseren Sprechern und Kunden, die zunehmend nach ethisch hergestellten Produkten und Dienstleistungen von den Unternehmen an der Spitze der Innovation suchen.
WellSaid Labs hat sein eigenes internes AI-Modell entwickelt, das es seinen AI-Stimmen ermöglicht, menschliche Parität zu erreichen, und dies, indem es die Unvollkommenheiten, die Menschen in Gesprächen haben, hinzugefügt hat. Was ist es an diesen Unvollkommenheiten, das die AI besser macht, und wie werden diese Unvollkommenheiten implementiert?
WellSaid Labs ist nicht nur ein weiterer TTS-Generator. Während frühe TTS-Technologie nicht in der Lage war, menschliche Sprachqualitäten wie Tonhöhe, Ton und Dialekt zu erkennen, die den Kontext und die Emotionen hinter den Worten vermitteln, haben WellSaid-Stimmen menschliche Parität erreicht und einzigartig menschliche Unvollkommenheiten in die AI-generierte Sprache gebracht.
Unser primärer Maßstab für die Qualität der Stimme ist und war immer menschliche Natürlichkeit. Diese Leitüberzeugung hat unsere Technologie auf jeder Stufe geprägt, von den Skriptbibliotheken, die wir aufgebaut haben, bis hin zu den Anweisungen, die wir dem Talent gegeben haben, und zuletzt, wie wir unsere Kern-TTS-Algorithmen iterieren. Wir trainieren auf authentischen menschlichen Aussprachen. Unser Sprechertalent liest seine Skripte authentisch und engagiert, wenn es für uns aufzeichnet. Sprechperfektion hingegen ist ein mechanisches Konzept, das zu einem roboterhaft perfekten, unnatürlichen Output führt. Wenn professionelles Sprechertalent auftreten, variiert seine Sprechgeschwindigkeit. Seine Lautstärke ändert sich in Übereinstimmung mit dem Inhalt, den es liest. Seine Stimmlage kann ansteigen, wenn es eine Passage liest, die eine aufgeregte Lesung erfordert, und wieder sinken, wenn es eine ernstere Zeile liest. Diese dynamischen Variationen machen eine engagierte menschliche Stimmdarbietung aus.
Indem wir AI-Prozesse entwickeln, die in Koordination mit den dynamischen Darbietungen unseres professionellen Talents arbeiten, haben wir eine wirklich natürliche TTS-Plattform aufgebaut. Wir entwickelten das erste Long-Form-TTS-System mit vorhersagbaren Kontrollen während des gesamten kreativen Prozesses. Unsere phonetische Bibliothek enthält eine vielfältige Sammlung von Audio-Daten, die es Benutzern ermöglichen, spezifische vocale Hinweise wie Ausspracheführung oder Kontrollierbarkeit in das Modell während der Produktionsphase einzubauen. In einer Plattform können WellSaid-Benutzer aufzeichnen, bearbeiten und ihre Voiceover ohne die Notwendigkeit, externe Daten zu importieren, stilisieren.
Können Sie einige der Herausforderungen bei der Aufbau eines Text-to-Speech (TTS)-AI-Unternehmens diskutieren?
Die Entwicklung von AI-Sprachtechnologie hat eine ganz neue Reihe von Hindernissen für sowohl ihre Produzenten als auch ihre Konsumenten geschaffen. Eine der Hauptherausforderungen besteht darin, nicht in den Lärm und die Hype zu geraten, die den AI-Sektor überschwemmen. Als neue, angesagte Technologie versuchen viele Organisationen, auf kurzfristige AI-Voiceover-Entwicklungen zu setzen. Wir wollen eine Stimme für jeden bieten, geleitet von zentralen ethischen Grundsätzen und Authentizität. Diese Bindung an Authentizität kann die Entwicklung und Bereitstellung unserer Technologien verzögern, aber sie festigt die Sicherheit und den Schutz von WellSaid-Stimmen und ihren Daten.
Eine weitere Herausforderung bei der Entwicklung unserer TTS-Plattform bestand darin, spezifische Zustimmungsrichtlinien zu entwickeln, um sicherzustellen, dass Organisationen oder einzelne Akteure unsere Technologie nicht missbrauchen. Um diese Herausforderung zu bekämpfen, suchen wir nach kooperativen, langfristigen Partnerschaften und sind vollständig in die Voiceover-Entwicklung involviert, um Rechenschaftspflicht, Transparenz und Benutzersicherheit zu erhöhen. Wir suchen aktiv nach Partnerschaften mit Sprechern aus verschiedenen Hintergründen, Organisationen und Erfahrungen, um sicherzustellen, dass WellSaid Labs’ Bibliothek von Stimmen ihre Schöpfer und ihr Publikum widerspiegelt. Diese Prozesse sind darauf ausgelegt, absichtlich und detailliert zu sein, um sicherzustellen, dass unsere Technologie so sicher und ethisch wie möglich eingesetzt wird, was die Entwicklung und den Startzeitplan verlangsamen kann.
Was ist Ihre Vision für die Zukunft von generativen AI-Stimmen?
Seit langem hat die AI-Sprachtechnologie nicht die Qualität erreicht, um es Unternehmen zu ermöglichen, bedeutungsvolle Inhalte im großen Maßstab zu erstellen. Jetzt, da Audio-Technologie keine teuren Geräte und Hardware mehr erfordert, kann jeder geschriebene Inhalt in einem Audio-Format produziert und veröffentlicht werden, um engagierte, multimediale Erfahrungen zu schaffen.
Heute können AI-Stimmen menschliche Audio- und Nuancen erzeugen, die erforderlich sind, um digitale Erzählungen zugänglicher und natürlicher zu machen. Die Zukunft von generativen AI-Stimmen wird allumfassende hörbare Erfahrungen umfassen, die jeden Aspekt unseres Lebens berühren. Wenn die Technologie weiter fortschreitet, werden wir zunehmend natürliche und ausdrucksstarke synthetische Stimmen sehen, die die Grenze zwischen menschlich erzeugter und maschinengenerierter Sprache verwischen – und neue Türen für Geschäfte, Kommunikation, Zugänglichkeit und unsere Interaktion mit der Welt um uns herum öffnen.
Unternehmen werden eine verbesserte Personalisierung in AI-Voice-Schnittstellen finden und sie verwenden, um Interaktionen mit virtuellen Assistenten immersiver und benutzerfreundlicher zu machen. Diese Verbesserungen finden bereits statt, von intelligenten Call-Center-Agenten bis hin zu Fast-Food-Drive-ins. Content-Erstellung, einschließlich Werbung, Produktmarketing, Nachrichten-Vorlesen, Podcasts, Hörbüchern und anderer Multimedia, wird durch die Verwendung von Tools zur Erstellung von engagierendem Inhalt effizienter, was letztendlich zu mehr Umsatz und Gewinn für Organisationen führt, insbesondere jetzt, da multilinguale Modelle es einem Unternehmen ermöglichen, von einem einzigen Punkt aus global präsent zu sein. Produktions-Teams werden großen Nutzen aus synthetischen Stimmen ziehen, um Stimmen zu erstellen, die auf die Bedürfnisse der Marke zugeschnitten sind oder für den Zuhörer personalisiert sind.
Bevor die Einführung von AI, fehlte der TTS-Technologie die entscheidende menschliche Emotion, Intonation und Aussprache, die erforderlich sind, um eine vollständige Geschichte im großen Maßstab und mit Leichtigkeit zu erzählen. Jetzt bietet AI-gesteuerte TTS mehr immersive und zugängliche Erfahrungen, einschließlich Echtzeit-Sprachfähigkeiten und interaktiver Konversationsagenten.
Das Erreichen menschlicher Sprechfähigkeiten war eine Reise, aber jetzt, da es erreichbar ist, sehen wir den vollständigen Umfang von AI-Stimme, um echten Geschäftswert für Organisationen zu schaffen.
Vielen Dank für das großartige Interview, Leser, die mehr erfahren möchten, sollten WellSaid Labs besuchen.












