Intervjuer

Matt Hocking, medgrunnlegger av WellSaid Labs – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Matt Hocking er medgrunnlegger av WellSaid Labs, en ledende bedriftsgrad AI-voice generator. Han har over 15 års erfaring med å lede team og levere teknologiløsninger i stor skala.

Din bakgrunn er ganske entreprenørsk, hvordan ble du først involvert i AI?

Jeg har alltid betraktet meg selv som ganske entreprenørsk. Jeg startet mitt første firma etter college og med en bakgrunn i produktutforming, har jeg funnet meg selv graviterende mot å hjelpe folk med tidlige ideer. Gjennom hele min karriere har jeg vært heldig nok til å jobbe med en rekke startups som har hatt noen ganske fantastiske løp. Under disse erfaringene har jeg hatt eksponering for en rekke flotte gründere førstehånds, og det har inspirert meg til å forfølge mine egne ideer som grunnlegger. AI var relativt nytt for meg da jeg ble med i AI2, men den erfaringen ga meg en mulighet til å bruke min produkt- og startup-linse på noen virkelig fantastiske forskningsresultater og forestille meg hvordan disse nye fremgangene ville kunne hjelpe en rekke mennesker i årene som kommer. Målet mitt fra begynnelsen har vært å utvikle virkelige forretninger for virkelige mennesker, og jeg tror AI har potensialet til å skape en rekke spennende muligheter og effektivitetsgevinster i fremtiden hvis det brukes på en tankefull måte.

Kunne du dele historien om hvordan ideen for WellSaid Labs ble konseptualisert da du var entreprenør i The Allen Institute for AI?

Jeg ble med i The Allen Institute for Artificial Intelligence (AI2) som en entreprenør i 2018. Det er uten tvil den mest innovative inkubatoren i verden, AI2 huset de smarteste hjernene i AI som bruker løsninger fra kanten av hva som er mulig i dag til tangibile produkter som løser problemer rundt om i verden. Min bakgrunn i design og teknologi har næret en langvarig interesse for de kreative feltene, og med AI-boomet vi alle er vitne til i dag, ønsket jeg å utforske en måte å koble de to sammen. Jeg ble introdusert for Michael Petrochuk (medgrunnlegger og CTO av WellSaid Labs) mens jeg utviklet en interaktiv helseapp som guidet pasienten gjennom ulike følsomme scenarier. Under prosessen med å utvikle innholdet for opplevelsen, arbeidet mitt team med stemme-talent for å forhåndsinnspele tusenvis av linjer med voiceover for avatar. Da jeg ble eksponert for noen av gjennombruddene Michael hadde oppnådd under sin forskning, så vi begge raskt verdien av hvordan menneske-lignende tekst-til-tale (TTS) kunne transformere ikke bare produktet jeg arbeidet på, men også påvirke en rekke andre applikasjoner og industrier. Teknologi og verktøy hadde slitt med å holde pace med behovene til produsenter som skaper med stemme som medium. Vi så en vei til å sette denne teknologien i hendene på alle skapere, og å la stemme være en integrert del av alle historier.

WellSaid Labs er ett av de få selskapene som gir stemme-skuespillere en mulighet til å komme inn i AI-stemme-rommet. Hvorfor trodde du det var viktig å integrere ekte stemmer i produktet?

Vårt svar er to-delt: først, ønsket vi å skape løsninger som kompletterer profesjonelle stemme-skuespilleres evner, og utvide mulighetene for stemme. Og andre, stræber vi etter å ha det høyeste nivået av menneske-kvalitet i våre produkter. Våre stemme-skuespillere er langvarige samarbeidspartnere og mottar kompensasjon og inntektsdeling for både deres stemme-data og det påfølgende innholdet som produseres med det. Hver stemme-skuespiller vi hyrer for å skape en AI-stemme- avatar basert på likheten av deres stemme, blir betalt basert på hvor mye deres stemme blir brukt på vår plattform. Vi oppmuntrer talent til å samarbeide med oss; rettferdig kompensasjon for deres bidrag er ekstremt viktig for oss.

For å tilby det høyeste nivået av menneske-kvalitetsprodukter på markedet, må vi være strenge når det gjelder hvor vi får vår data. Denne prosessen gir oss mer kontroll over kvaliteten, da vi trener våre dyptelæringsmodeller til å snakke både til menneske-lignende og kontekstuell relevant stil. Vi skaper ikke bare en stemme som resiterer den gitt input. Våre modeller tilbyr en rekke stemme-stiler som utfører hva som står på siden. Uansett om brukerne lager voiceover ved å bruke en avatar fra vår bibliotek eller lager voiceover med en tilpasset stemme for deres merkevare, bruker vi ekte stemme-data for å sikre en sømløs prosess og en enkel å bruke plattform. Hvis våre kunder måtte manipulere og redigere våre stemmer i post-produksjon, ville prosessen med å få det ønskede utgangspunktet være klønete og lang. Våre stemmer tar konteksten av det skrevne innholdet og gir en kontekstuell korrekt lesning. Vi tilbyr stemmer for alle typer brukssaker – enten det er å lese nyheter, lage en lydannons, eller automatisert kundesupport – så samarbeid med profesjonelle stemme-talenter for hver brukssak gir oss både kontekst og høykvalitets stemme-data.

Vi oppdaterer og legger til nye stiler og aksenter i vår avatar-bibliotek jevnlig for å sikre at vi representerer stemmene til våre kunder. I WellSaid Labs’ Studio kan kunder og merkevarer audition ulike stemmer basert på region, stil og brukssak, og tillate en mer sømløs og samlet produksjon av lydinnhold tilpasset skaperens behov. Når en opprinnelig innspilling er sampet, kan brukere cue bestemte ord, stavinger og uttaler for å sikre at AI-stemmen snakker spesifikt til deres behov.

WellSaid Labs er på vei til å hevde sin krav som det første etiske AI-stemme-plattformen. Hvorfor er AI-etikk viktig for deg?

Som AI-adoopsjonen øker og blir mer mainstream, er frykten for skadelige brukssaker og dårlige aktører i sentrum av hver samtale – og disse bekymringene er dessverre validert av virkelige hendelser. AI-stemme er ingen unntak; nesten hver dag kommer en ny rapport om en celebrity, offentlig person eller politiker som blir deepfaket for reklame eller politiske formål i nyhetene. Selv om formell føderal regulering med hensyn til denne teknologien fortsatt er under utvikling, vil det å oppdage og bekjempe skadelige aktører og bruk av syntetisk stemme bli stadig vanskeligere når teknologien fortsetter å utvikle seg.

Kommer fra AI2, hvor AI-etikk er en kjerneprinsipp, hadde Michael og jeg disse samtaler fra dag én. Utvikling av AI-tale-teknologi kommer med betydelige ansvar med hensyn til samtykke, personvern og generell sikkerhet. Vi vet at vi, som utviklere, må bygge vår teknologi trygt, adresse etiske bekymringer og legge grunnlaget for fremtidig utvikling av syntetisk stemme. Vi erkjenner potensialet for AI-tale-teknologi for misbruk og omfavner vårt ansvar for å redusere potensialet for misbruk av vårt produkt. Vi må legge dette grunnlaget fra dag én, i stedet for å løpe raskt og gjøre feil underveis. Det ville ikke være rettferdig mot våre bedriftskunder og stemme-skuespillere, som regner med oss for å bygge et høykvalitets- og pålitelig produkt.

Vi støtter fullt opp om kravet om lovgivning på dette området; likevel, vil vi ikke vente på at føderale reguleringer blir vedtatt. Vi har alltid prioritet og vil fortsette å prioritere praksiser som støtter personvern, sikkerhet, transparens og ansvar.

Vi holder strengt til vår selskaps etiske kode av hensikt, som er basert på å bygge med ansvarlig innovasjon i hver enkelt beslutning vi tar. Dette er i det beste interesse for våre globale kunder – bedriftsmerker.

Hvordan utvikler du en etisk AI-stemme-plattform?

WellSaid Labs har vært dedikert til etisk innovasjon fra starten. Vi sentraliserer tillit og transparens gjennom bruk av interne data-modeller, eksplisitte samtykke-krav, vårt innhold-modereringsprogram og vårt engasjement for merkevare-beskyttelse. Hos WellSaid, lener vi oss på prinsippene for Ansvarlig AI for å forme våre beslutninger og design, og disse prinsippene utvides til bruk av våre stemmer. Vår kode av etikk representerer disse prinsippene som Ansvar, Transparens, Personvern og Sikkerhet, og Retferdighet.

Ansvar: Vi opprettholder strenge standarder for passende innhold, og forbyr bruk av våre stemmer for innhold som er skadelig, hatfullt, bedragerisk eller ment å vekke vold. Vårt Tillit & Sikkerhet-team opprettholder disse standardene med et rigorøst innhold-modereringsprogram, og blokkerer og fjerner brukere som prøver å bryte våre Tjenestevilkår.

Transparens: Vi krever eksplisitt samtykke før vi bygger en syntetisk stemme med noen persons stemme-data. Brukere kan ikke laste opp stemme-data fra politikere, kjendiser eller noen andre for å skape en kopi av deres stemme, med mindre vi har den personens eksplisitte, skriftlige samtykke.

Personvern og Sikkerhet: Vi beskytter identitetene til våre stemme-skuespillere ved å bruke lager-bilder og aliaser til å representere de syntetiske stemmene. Vi oppmuntrer dem også til å utøve forsiktighet når det gjelder hvordan og med hvem de deler sin tilknytning til WellSaid Labs eller andre syntetiske stemme-selskaper for å redusere muligheten for misbruk av deres stemme.

Retferdighet: Vi kompenserer alle stemme-skuespillere som gir stemme-data for vår plattform, og gir dem en kontinuerlig inntektsdeling for bruk av den syntetiske stemmen vi bygger med deres data.

I tillegg til disse prinsippene, respekterer vi også strengt immaterielle rettigheter. Vi gjør ikke krav på eierskap over innholdet som våre brukere eller stemme-skuespillere gir. Vi prioriterer integritet, rettferdighet og transparens i alt vi gjør, og sikrer at vår syntetisk tale-teknologi brukes ansvarlig og etisk. Vi søker aktivt etter samarbeid med stemmer fra ulike bakgrunner, organisasjoner og erfaringer for å sikre at WellSaid Labs’ bibliotek av stemmer representerer sine skapere og publikum.

Vårt engasjement for ansvarlig innovasjon og utvikling av AI-stemme-teknologi med etikk i tankene, skiller oss fra andre i bransjen som søker å kapitalisere på en ny, uregulert industri gjennom enhver måte. Våre tidlige investeringer i etikk, sikkerhet og personvern etablerer tillit og lojalitet innen våre stemme-skuespillere og kunder, som stadig søker etter etisk-produserte produkter og tjenester fra selskapene i fremkant av innovasjon.

WellSaid Labs har skapt sin egen interne AI-modell som har gjort det mulig for AI-stemmene å nå menneske-lignende kvalitet, og det har oppnådd dette ved å bringe menneskelige feil til samtaler. Hva er det med disse feilene som gjør AI bedre, og hvordan implementeres disse feilene?

WellSaid Labs er ikke bare en annen TTS-genererator. Der tidlig TTS-teknologi ikke kunne gjenkjenne menneskelig tale-kvaliteter som tone, tonehøyde og dialekt som overfører konteksten og emosjonen bak ordene, har WellSaid-stemmene oppnådd menneske-lignende kvalitet, og bringer unikt menneskelige feil til AI-generert tale.

Vår primære måling av stemme-kvalitet er og har alltid vært menneske-lignende naturlighet. Denne ledende troen har formet vår teknologi på hver enkelt stadium, fra skript-bibliotekene vi har bygget til instruksjonene vi gir talent, og nylig hvordan vi itererer på våre grunnleggende TTS-algoritmer.

Vi trener på autentiske menneskelige tale-uttrykk. Våre stemme-talenter leser sine skript autentisk og engasjerende når de innspiller for oss. Tale-perfeksjon, på den andre siden, er et mekanisk konsept som fører til en robotisk feilfri, unaturlig utgang. Når profesjonelle stemme-talenter utfører, varierer deres tale-hastighet. Deres høyde beveger seg i sammenheng med innholdet de leser. Deres vokale tonehøyde kan stige i en passasje som krever en begeistringsfull lesning og falle igjen i en mer alvorlig linje. Disse dynamiske variasjoner utgjør en engasjerende menneskelig tale-utførelse.

Ved å bygge AI-prosesser som arbeider i samordning med de dynamiske utførelsene til våre profesjonelle talenter, har vi bygget en virkelig naturlig TTS-plattform. Vi utviklet det første lang-form TTS-systemet med prediktive kontroller gjennom hele den kreative prosessen. Vår fonetiske bibliotek inneholder en divers samling av lyd-data, som tillater brukerne å inkorporere bestemte vokale signaler, som uttale-guiden eller kontroll, i modellen under produksjonsfasen. I én plattform kan WellSaid-brukere innspille, redigere og stilise sin voiceover uten å måtte importere eksterne data.

Kunne du diskutere noen av utfordringene bak å bygge en tekst-til-tale (TTS) AI-selskap?

Utviklingen av AI-stemme-teknologi har skapt en helt ny rekke hindringer for både produsenter og forbrukere. En av de viktigste utfordringene er ikke å bli fanget opp i støy og hype som flommer AI-sektoren. Som en ny, buzz-technologi, prøver mange organisasjoner å kapitalisere på kort-siktig AI-stemme-utvikling. Vi ønsker å gi en stemme til alle, ledet av sentrale etiske prinsipper og autentisitet. Dette engasjementet for autentisitet kan forsinke utviklingen og deployeringen av våre teknologier, men solidifiserer sikkerheten og sikkerheten til WellSaid-stemmene og deres data.

En annen utfordring med å utvikle vår TTS-plattform var å utvikle bestemte samtykke-retningslinjer for å sikre at organisasjoner eller enkelt-aktører ikke misbruker vår teknologi. For å bekjempe denne utfordringen, søker vi etter samarbeidende, langvarige partnerskap og er fullt involvert med stemme-utvikling for å øke ansvar, transparens og bruker-sikkerhet. Vi søker aktivt etter samarbeid med stemme-talenter fra ulike bakgrunner, organisasjoner og erfaringer for å sikre at WellSaid Labs’ bibliotek av stemmer representerer sine skapere og publikum. Disse prosessene er designet for å være intentionelle og detalj-orienterte for å sikre at vår teknologi brukes så trygt og etisk som mulig, noe som kan forsinke utviklingen og lanseringen.

Hva er din visjon for fremtiden av generativ AI-stemme?

I lengste tid har AI-tale-teknologi ikke nådd høy nok kvalitet til å enable selskaper å skape meningsfullt innhold i stor skala. Nå som audio-teknologi ikke lenger krever dyrt utstyr og maskinvare, kan all skrevet innhold produseres og publiseres i en audio-format for å skape engasjerende, multi-modale erfaringer.

I dag kan AI-stemmer produsere menneske-lignende audio og fange nuansen som kreves for å gjøre digital fortelling mer tilgjengelig og naturlig. Fremtiden for generativ AI-stemme vil være all-omfattende hørbare erfaringer som berører hver enkelt del av våre liv. Ettersom teknologien fortsetter å utvikle seg, vil vi se stadig mer naturlig og uttrykksfull syntetisk stemme som utvisker grensen mellom menneske-generert og maskin-generert tale – åpner nye dører for bedrift, kommunikasjon, tilgjengelighet og hvordan vi interagerer med verden rundt oss.

Bedrifter vil finne forbedret personliggjøring i AI-stemme-grensesnitt og bruke dem til å gjøre interaksjoner med virtuelle assistenter mer immersive og brukervennlige. Disse forbedringene skjer allerede, fra intelligente kundesenter-agenter til rask-mat-kjører. Innhold-skapelse, inkludert reklame, produkt-markedsføring, nyhets-opplesning, podcaster, lydbøker og andre multi-media, vil se økt effisiens ved å bruke verktøy til å utvikle engasjerende innhold – ultimate øker løft og inntekt for organisasjoner, spesielt nå som flerspråklige modeller kan utvide et selskaps rekkevidde fra ett enkelt punkt til å ha en global tilstedeværelse. Produksjonsteam vil finne stor nytte i syntetiske stemmer for å skape stemmer som er tilpasset bedriftens behov eller tilpasset lytteren.

Før introduksjonen av AI, manglet TTS-teknologi den kritiske menneske-emosjonen, intonasjonen og uttalen som kreves for å fortelle en full historie i stor skala og med lettighet. Nå tilbyr AI-drevet TTS mer immersive og tilgjengelige erfaringer, inkludert sanntids-tale-kapasiteter og interaktive samtale-agenter.

Å oppnå menneske-lignende tale-kapasiteter har vært en reise, men nå som det er oppnåelig, vitner vi om det fullstendige omfanget av AI-stemme for å skape virkelig forretningsverdi for organisasjoner.

Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke WellSaid Labs.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.