Intervjuer

Matt Hocking, medgrundare av WellSaid Labs – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Matt Hocking är medgrundare av WellSaid Labs, en ledande företagsklass AI-röstgenerator. Han har mer än 15 års erfarenhet av att leda team och leverera tekniska lösningar i stor skala.

Din bakgrund är ganska entreprenöriell, hur blev du initialt involverad i AI?

Jag antar att jag alltid har betraktat mig själv som ganska entreprenöriell. Jag startade mitt första företag efter college och med en bakgrund inom produktutveckling, har jag funnit mig själv dras till att hjälpa människor med tidiga idéer. Under min karriär har jag haft turen att arbeta med ett antal startups som har gått vidare till att ha ganska otroliga framgångar. Under dessa upplevelser har jag fått exponering för många fantastiska grundare på nära håll, vilket i sin tur har inspirerat mig att följa mina egna idéer som grundare. AI var relativt nytt för mig när jag gick med i AI2, men den upplevelsen gav mig möjlighet att tillämpa min produkt- och startup-erfarenhet på några riktigt fantastiska forskningsresultat och föreställa mig hur dessa nya framsteg skulle kunna hjälpa många människor i framtiden. Målet från början har varit att utveckla riktiga företag för riktiga människor, och jag tror att AI har potentialen att skapa många spännande möjligheter och effektiviteter i vår framtid om det tillämpas på ett genomtänkt sätt.

Kan du dela historien om hur idén för WellSaid Labs föddes när du var entreprenör i The Allen Institute for AI?

Jag gick med i The Allen Institute for Artificial Intelligence (AI2) som entreprenör i residens 2018. Det är utan tvekan den mest innovativa inkubatorn i världen, AI2 har de skarpaste hjärnorna inom AI som tillämpar lösningar från gränsen för vad som är möjligt idag till tangibla produkter som löser problem runt om i världen. Min bakgrund inom design och teknik har närt ett långvarigt intresse för de kreativa fälten, och med AI-boomen vi alla bevittnar idag, ville jag utforska ett sätt att koppla samman de två. Jag introducerades till Michael Petrochuk (medgrundare och CTO för WellSaid Labs) medan jag utvecklade en interaktiv hälsoapp som guidade patienten genom olika känsliga scenarier. Under processen att utveckla innehållet för upplevelsen, arbetade mitt team med rösttalanger för att förinspela tusentals rader av röstöverlägg för avatarerna. När jag blev exponerad för några av de genombrott Michael hade uppnått under sin forskning, såg vi båda snabbt värdet av hur röst med mänsklig paritet kunde förvandla inte bara produkten jag arbetade med, utan också påverka ett antal andra applikationer och branscher. Teknologi och verktyg hade kämpat för att hålla jämna steg med producenternas behov av att skapa med röst som medium. Vi såg en väg för att lägga den tekniken i händerna på alla skapare, och låta röst vara en integrerad del av alla berättelser.

WellSaid Labs är ett av de få företagen som ger röstskådespelare en möjlighet att komma in i AI-röstområdet. Varför trodde du att det var viktigt att integrera riktiga röster i produkten?

Vårt svar är tvådelat: först ville vi skapa lösningar som kompletterar professionella röstskådespelares förmågor, och utöka möjligheterna för röst. Och andra, strävar vi efter att ha den högsta nivån av mänsklig kvalitet i våra produkter. Våra röstskådespelare är långsiktiga samarbetspartners och får ersättning och andel av intäkterna för både deras röstdata och det efterföljande innehållet som skapas med det. Varje röstskådespelare vi anställer för att skapa en AI-röstavatar baserad på likheten av deras röst, betalas utifrån hur mycket deras röst används på vår plattform. Vi uppmuntrar talang att samarbeta med oss, och rättvis ersättning för deras bidrag är otroligt viktigt för oss.

För att erbjuda den högsta nivån av mänsklig kvalitet på marknaden, måste vi vara noggranna med var vi får vår data ifrån. Denna process ger oss mer kontroll över kvaliteten, eftersom vi tränar våra djupinlärningsmodeller att tala både till mänsklig paritet och specifika kontextuellt relevanta stilar. Vi skapar inte bara en röst som upprepar den tillhandahållna inputen. Våra modeller erbjuder en mängd olika röststilar som utför vad som står på sidan. Oavsett om användare skapar röstöverlägg med hjälp av en avatar från vår bibliotek eller skapar röstöverlägg med en anpassad röst för deras varumärke, använder vi riktiga röstdata för att säkerställa en smidig process och en lättanvänd plattform. Om våra kunder hade varit tvungna att manipulera och redigera våra röster i efterproduktion, skulle processen för att få önskat utdata vara klumpig och lång. Våra röster tar kontexten av det skrivna innehållet och ger en kontextuellt korrekt läsning. Vi erbjuder röster för alla typer av användningsfall – oavsett om det är att läsa nyheter, skapa en ljudannons eller automatiserad kundtjänststöd – så att samarbeta med professionella rösttalanger för varje användningsfall ger oss både kontext och högkvalitativ röstdata.

Vi uppdaterar och lägger till nya stilar och accenter i vår avatarbibliotek regelbundet för att säkerställa att vi representerar rösterna från våra kunder. I WellSaid Labs Studio kan kunder och varumärken provlyssna på olika röster baserat på region, stil och användningsfall, vilket möjliggör en mer smidig och enhetlig produktion av ljudinnehåll som är anpassat till skaparens behov. När en första inspelning har sampats, kan användare koda specifika ord, stavningar och uttal för att säkerställa att AI:t konsekvent talar specifikt till deras behov.

WellSaid Labs hävdar att de är det första etiska AI-röstföretaget. Varför är AI-etik viktigt för er?

Så länge som AI-användningen ökar och blir mer mainstream, finns det en rädsla för skadliga användningsfall och dåliga aktörer i centrum för varje konversation – och dessa farhågor är tyvärr validerade av verkliga händelser. AI-röst är inget undantag; nästan varje dag kommer en ny rapport om en kändis, offentlig person eller politiker som blir deepfaked för annonser eller politiska syften i nyhetshuvudena. Även om formell federal reglering avseende denna teknik fortfarande är under utveckling, kommer det att bli allt svårare att upptäcka och bekämpa skadliga aktörer och användningar av syntetisk röst allteftersom tekniken fortsätter att utvecklas.

Från AI2, där AI-etik är en kärnprincip, hade Michael och jag dessa samtal från dag ett. Att utveckla AI-talsteknologi kommer med betydande ansvar avseende samtycke, integritet och allmän säkerhet. Vi vet att vi, som utvecklare, måste bygga vår teknik på ett säkert sätt, hantera etiska problem och lägga grunden för den framtida utvecklingen av syntetiska röster. Vi erkänner potentialen för AI-talsteknologi för missbruk och accepterar vårt ansvar för att minska möjligheten till missbruk av vår produkt. Vi behöver lägga denna grund från dag ett, snarare än att springa fort och göra misstag på vägen. Det skulle inte vara rättvist mot våra företagskunder och röstskådespelare, som förlitar sig på oss för att bygga en högkvalitativ och pålitlig produkt.

Vi stöder fullständigt uppmaningen till lagstiftning på detta område, men vi kommer inte att vänta på federala regleringar för att träda i kraft. Vi har alltid prioriterat och kommer att fortsätta att prioritera metoder som stöder integritet, säkerhet, transparens och ansvar.

Vi följer strikt vårt företags etiska avsiktsförklaring, som bygger på att bygga med ansvarsfull innovation i varje beslut vi fattar. Detta är i det bästa intresset för våra globala kunder – företagsvarumärken.

Hur utvecklar man ett etiskt AI-röstföretag?

WellSaid Labs har varit engagerade i etisk innovation från början. Vi centraliserar förtroende och transparens genom användningen av interna datamodeller, uttryckliga samtyckeskrav, vår innehållsmoderationsprogram och vårt åtagande för varumärkesskydd. På WellSaid lutar vi oss mot principerna för ansvarsfull AI för att forma våra beslut och design, och dessa principer sträcker sig till användningen av våra röster. Vår etiska kod representerar dessa principer som ansvar, transparens, integritet och säkerhet, samt rättvisa.

Ansvar: Vi upprätthåller strikta standarder för lämpligt innehåll, och förbjuder användningen av våra röster för innehåll som är skadligt, hatiskt, bedrägligt eller avsett att väcka våld. Vårt förtroende- och säkerhetsteam upprätthåller dessa standarder med ett rigoröst innehållsmoderationsprogram, och blockerar och tar bort användare som försöker kränka våra villkor.

Transparens: Vi kräver uttryckligt samtycke innan vi bygger en syntetisk röst med någons röstdata. Användare kan inte ladda upp röstdata från politiker, kändisar eller någon annan för att skapa en klon av deras röst, såvida vi inte har den personens uttryckliga, skriftliga samtycke.

Integritet och säkerhet: Vi skyddar identiteterna hos våra röstskådespelare genom att använda standardbilder och alias för att representera de syntetiska rösterna. Vi uppmuntrar dem också att vara försiktiga med hur och med vem de delar sin association med WellSaid Labs eller andra syntetiska röstföretag för att minska möjligheten till missbruk av deras röst.

Rättvisa: Vi kompenserar alla röstskådespelare som tillhandahåller röstdata för vår plattform, och ger dem en fortlöpande andel av intäkterna för användningen av den syntetiska röst vi bygger med deras data.

Tillsammans med dessa principer respekterar vi också strikt immateriella rättigheter. Vi hävdar inte äganderätt över innehållet som tillhandahålls av våra användare eller röstskådespelare. Vi prioriterar integritet, rättvisa och transparens i allt vi gör, och säkerställer att vår syntetiska talteknologi används på ett ansvarsfullt och etiskt sätt. Vi söker aktivt samarbeten med röster från olika bakgrunder och upplevelser för att säkerställa att WellSaid Labs bibliotek av röster representerar dess skapare och publik.

WellSaid Labs har skapat sin egen interna AI-modell som möjliggjort att deras AI-röster uppnått mänsklig paritet, och det har uppnåtts genom att bringa de ofullkomligheter som människor har i samtal. Vad är det med dessa ofullkomligheter som gör AI bättre, och hur implementeras dessa ofullkomligheter?

WellSaid Labs är inte bara en annan TTS-generator. Där tidig TTS-teknologi inte kunde känna igen mänskliga tal egenskaper som tonhöjd, ton och dialekt som förmedlar kontexten och känslan bakom orden, har WellSaid-röster uppnått mänsklig paritet och bringat unikt mänskliga ofullkomligheter till AI-genererat tal.

Vår primära mått på röstkvalitet är och har alltid varit mänsklig naturlighet. Denna ledande tro har format vår teknik i varje skede, från de manusbibliotek vi har byggt till de instruktioner vi ger talang, och nyligen hur vi itererar på våra kärna TTS-algoritmer.

Vi tränar på autentiska mänskliga vocaliseringar. Vår rösttalang läser sina manus äkta och engagerande när de spelar in för oss. Talperfektion, å andra sidan, är ett mekaniskt koncept som leder till en robotiskt fläckfri, onaturlig utdata. När professionella röstskådespelare uppträder, varierar deras talmönster. Deras högtalighet rör sig i takt med innehållet de läser. Deras röstton kan stiga i en passage som kräver en upphetsad läsning och sjunka igen i en mer allvarlig rad. Dessa dynamiska variationer utgör en engagerande mänsklig vokalprestation.

Genom att bygga AI-processer som fungerar i samordning med de dynamiska prestationerna från våra professionella talanger, har vi byggt en riktigt naturlig TTS-plattform. Vi utvecklade den första långformade TTS-systemet med prediktiva kontroller under hela den kreativa processen. Vår fonetiska bibliotek innehåller en diversifierad samling av ljuddata, som tillåter användare att införliva specifika vokala signaler, som uttalsvägledning eller kontrollerbarhet, i modellen under produktionsfasen. I en plattform kan WellSaid-användare spela in, redigera och stylize sin röstöverlägg utan att behöva importera extern data.

Kan du diskutera några av de utmaningar bakom att bygga ett text-till-tal (TTS) AI-företag?

Utvecklingen av AI-röstteknologi har skapat en helt ny uppsättning hinder för både dess producenter och konsumenter. En av de största utmaningarna är att inte fastna i bruset och hype som flödar AI-sektorn. Som en ny, buzzig teknik, försöker många organisationer att tjäna pengar på korta AI-röstutvecklingar. Vi vill ge en röst åt alla, guidade av centrala etiska principer och äkthet. Denna tillhörighet till äkthet kan fördröja utvecklingen och distributionen av vår teknik, men det stärker säkerheten och säkerheten för WellSaid-röster och deras data.

En annan utmaning med att utveckla vår TTS-plattform var att utveckla specifika samtyckesriktlinjer för att säkerställa att organisationer eller enskilda aktörer inte missbrukar vår teknik. För att bekämpa denna utmaning, söker vi samarbeten och långsiktiga partnerskap och är fullt engagerade i röstutvecklingen för att öka ansvar, transparens och användarsäkerhet. Vi söker aktivt samarbeten med rösttalang från olika bakgrunder, organisationer och upplevelser för att säkerställa att WellSaid Labs bibliotek av röster representerar dess skapare och publik. Dessa processer är avsedda att vara avsiktliga och detaljerade för att säkerställa att vår teknik används på ett så säkert och etiskt sätt som möjligt, vilket kan sakta ner utvecklingen och lanseringstiden.

Vad är din vision för framtiden för generativa AI-röster?

Under lång tid har AI-talsteknologi inte nått tillräckligt hög kvalitet för att möjliggöra för företag att skapa meningsfullt innehåll i stor skala. Nu, när ljudteknik inte längre kräver dyra utrustningar och hårdvara, kan allt skrivet innehåll produceras och publiceras i ljudformat för att skapa engagerande, multimodala upplevelser.

Idag kan AI-röster producera mänsklig liknande ljud och fånga den nyans som krävs för att göra digital berättelse mer tillgänglig och naturlig. Framtiden för generativ AI-röst kommer att vara allomfattande hörbara upplevelser som berör alla aspekter av våra liv. När tekniken fortsätter att utvecklas, kommer vi att se alltmer naturliga och uttrycksfulla syntetiska röster som suddar ut gränsen mellan mänsklig och maskingenererad tal – och öppnar nya dörrar för företag, kommunikation, tillgänglighet och hur vi interagerar med världen runt omkring oss.

Företag kommer att hitta förbättrad personanpassning i AI-röstgränssnitt och använda dem för att göra interaktioner med virtuella assistenter mer immersiva och användarvänliga. Dessa förbättringar sker redan, från intelligenta kundtjänstagent till snabbmatsdrive-in. Innehållsskapande, inklusive reklam, produktmarknadsföring, nyhetsläsning, poddsändningar, ljudböcker och andra multimedier, kommer att se ökad effektivitet med hjälp av verktyg för att utveckla engagerande innehåll – och i slutändan öka lyft och intäkter för organisationer, särskilt nu när flerspråkiga modeller kan expandera ett företags räckvidd från en enda punkt till att ha en global närvaro. Produktionslag kommer att hitta stor nytta i syntetiska röster för att skapa röster som är skräddarsydda för varumärkets behov eller anpassade till lyssnaren.

Innan introduktionen av AI, saknade TTS-teknologi den avgörande mänskliga känslan, intonationen och uttalet som krävs för att berätta en fullständig historia i stor skala och med lätthet. Nu erbjuder AI-driven TTS mer immersiva och tillgängliga upplevelser, inklusive realtidsprat och interaktiva konversationsagenter.

Att uppnå mänsklig liknande talförmåga har varit en resa, men nu att det är uppnåeligt, ser vi den fulla omfattningen av AI-röst för att skapa verkligt affärsvärde för organisationer.

Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka WellSaid Labs.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.