Interviews

Matt Hocking, medstifter af WellSaid Labs – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Matt Hocking er medstifter af WellSaid Labs, en førende virksomhed med AI-baseret stemmegenerering. Han har mere end 15 års erfaring med at lede hold og leverer teknologiløsninger i stor målestok.

Din baggrund er ret entreprenørisk, hvordan kom du først ind i AI?

Jeg har altid betragtet mig selv som ret entreprenørisk. Jeg startede min første virksomhed efter min uddannelse og med en baggrund i produkt-design, har jeg fundet mig selv tiltrukket af at hjælpe folk med tidlige ideer. Gennem min karriere har jeg været heldig nok til at arbejde med en række start-ups, der er gået videre til at have nogle ret fantastiske resultater. Under disse oplevelser har jeg haft mulighed for at arbejde med en række fantastiske grundlæggere på første hånd, hvilket har inspireret mig til at forfølge mine egne ideer som grundlægger. AI var ret nyt for mig, da jeg startede på AI2, men denne oplevelse gav mig mulighed for at anvende min produkt- og start-up-erfaring til nogle ret fantastiske forskningsresultater og forestille mig, hvordan disse nye fremskridt ville kunne hjælpe en masse mennesker i de kommende år. Mit mål fra starten har været at udvikle rigtige forretninger for rigtige mennesker, og jeg tror, at AI har potentialet til at skabe en masse spændende muligheder og effektiviseringer i vores fremtid, hvis det anvendes på en ansvarlig måde.

Kan du dele historien om, hvordan idéen til WellSaid Labs opstod, da du var entrepreneur i residence på The Allen Institute for AI?

Jeg startede på The Allen Institute for Artificial Intelligence (AI2) som entrepreneur i residence i 2018. Det er uden tvivl en af de mest innovative inkubatorer i verden, og AI2 huser nogle af de skarpeste hjerner inden for AI, der anvender løsninger fra kanten af, hvad der er muligt i dag, til konkrete produkter, der løser problemer over hele verden. Min baggrund i design og teknologi havde fostret en langvarig interesse for de kreative felter, og med AI-boomet, vi alle er vidner til i dag, ønskede jeg at udforske en måde at kombinere de to. Jeg blev introduceret til Michael Petrochuk (medstifter og CTO i WellSaid Labs) under udviklingen af en interaktiv sundhedsapp, der guidede patienten gennem forskellige følsomme scenarier. Under udviklingen af indholdet til oplevelsen arbejdede mit hold med stemme-talenter for at optage tusinder af linjer med voiceover til avatarerne. Da jeg blev introduceret til nogle af de gennembrud, Michael havde opnået under sin forskning, så vi begge hurtigt, hvor stor værdi der var i at kunne tilføre menneske-lignende tekst-til-tale (TTS) til ikke kun det produkt, jeg arbejdede på, men også til en række andre anvendelser og brancher. Teknologi og værktøjer havde kæmpet med at følge med behovene hos producenter, der arbejdede med stemme som medium. Vi så en vej til at give denne teknologi i hænderne på alle skabere, så stemme kunne være en integreret del af alle historier.

WellSaid Labs er en af de få virksomheder, der giver stemme-skuespillere en mulighed for at komme ind i AI-stemme-området. Hvorfor troede du, det var vigtigt at integrere rigtige stemmer i produktet?

Vores svar er to-delt: først ønskede vi at skabe løsninger, der supplerer professionelle stemme-skuespilleres evner, og udvider mulighederne for stemme. Og anden, stræber vi efter at have det højeste niveau af menneske-lignende kvalitet i vores produkter. Vores stemme-skuespillere er langsigtede samarbejdspartnere og modtager kompensation og andel i omsætningen for både deres stemme-data og det efterfølgende indhold, der produceres med det. Hver stemme-skuespiller, vi hyrer til at skabe en AI-stemme-avatar baseret på ligheden af deres stemme, betales på basis af, hvor meget deres stemme bruges på vores platform. Vi opmuntrer talent til at samarbejde med os; fair kompensation for deres bidrag er utrolig vigtigt for os.

For at tilbyde det højeste niveau af menneske-lignende produkter på markedet, må vi være strenge med, hvor vi får vores data fra. Denne proces giver os mere kontrol over kvaliteten, da vi træner vores dybe læring-modeller til at tale både til menneske-lignende niveau og specifik kontekst-relevant stil. Vi skaber ikke bare en stemme, der reciterer den indtastede tekst. Vores modeller tilbyder en række stemme-stilarter, der kan udføre, hvad der står på siden. Uanset om brugerne skaber voiceover ved at bruge en avatar fra vores bibliotek eller skaber voiceover med en tilpasset stemme til deres brand, bruger vi rigtige stemme-data til at sikre en problemfri proces og et letanvendeligt platform. Hvis vores kunder havde behov for at manipulere og redigere vores stemmer i efterproduktionen, ville processen med at få det ønskede output være klodset og lang. Vores stemmer tager konteksten af den skrevne tekst og giver en kontekstligt korrekt læsning. Vi tilbyder stemmer til alle typer af anvendelser – enten det er at læse nyheder, lave en audio-reklame eller automatiseret kundesupport – så samarbejde med professionelle stemme-talenter specifikt for hver anvendelse giver os både konteksten og høj-kvalitets stemme-data.

Vi opdaterer og tilføjer nye stilarter og accenter til vores avatar-bibliotek regelmæssigt for at sikre, at vi repræsenterer stemmerne fra vores kunder. I WellSaid Labs’ Studio kan kunder og brands afprøve forskellige stemmer baseret på region, stil og anvendelse, hvilket giver en mere problemfri og samlet produktion af audio-indhold tilpasset til skaberen.

WellSaid Labs er med til at skabe det første etiske AI-stemme-platform. Hvorfor er AI-etik vigtigt for dig?

Som AI-adoptionsniveau øger og bliver mere mainstream, er frygten for skadelige anvendelser og dårlige aktører i centrum af hver samtale – og disse bekymringer er desværre bekræftet af virkelige begivenheder. AI-stemme er ingen undtagelse; næsten hver dag kommer en ny rapport om, at en berømthed, offentlig person eller politiker er blevet deepfaked til reklamer eller politiske formål i nyhederne. Selvom formel federal regulering af denne teknologi stadig er under udvikling, vil det at opdage og bekæmpe skadelige aktører og anvendelser af syntetisk stemme blive mere og mere svært, da teknologien fortsætter med at udvikle sig.

Da jeg kom fra AI2, hvor AI-etik er en kerneprincippet, havde Michael og jeg disse samtaler fra dag én. Udvikling af AI-tale-teknologi kommer med betydelige ansvar omkring samtykke, privatliv og overordnet sikkerhed. Vi ved, at vi som udviklere må bygge vores teknologi sikkert, adresse etiske bekymringer og lægge grundlaget for den fremtidige udvikling af syntetisk stemme. Vi erkender potentialet for AI-tale-teknologi til misbrug og accepterer vores ansvar for at reducere det potentielle misbrug af vores produkt. Vi har brug for at lægge dette grundlag fra dag én og ikke løbe hurtigt og begå fejl undervejs. Det ville ikke være retfærdigt over for vores enterprise-kunder og stemme-skuespillere, der regner med, at vi bygger et høj-kvalitets- og troværdigt produkt.

Vi støtter fuldt op omkring opkaldet til lovgivning på dette område; dog vil vi ikke vente på, at føderale reguleringer bliver vedtaget. Vi har altid prioriteret og vil fortsætte med at prioritere praksisser, der understøtter privatliv, sikkerhed, gennemsigtighed og ansvarlighed.

Vi overholder strengt vores virksomheds etiske kodeks, der er baseret på at bygge med ansvarlig innovation i hver enkelt beslutning, vi træffer. Dette er i bedste interesse for vores globale kunder – enterprise-mærker.

Hvordan udvikler du et etisk AI-stemme-platform?

WellSaid Labs har været dedikeret til etisk innovation fra starten. Vi centraliserer tillid og gennemsigtighed gennem brugen af interne data-modeller, eksplisitte samtykke-krav, vores indholdsmodereringsprogram og vores engagement i brand-beskyttelse. Hos WellSaid læner vi os op af principperne for ansvarlig AI for at forme vores beslutninger og design, og disse principper udvides til brugen af vores stemmer. Vores etiske kodeks repræsenterer disse principper som ansvarlighed, gennemsigtighed, privatliv og sikkerhed samt retfærdighed.

Ansvarlighed: Vi opretholder strenge standarder for passende indhold, og forbyder brugen af vores stemmer til indhold, der er skadeligt, hadefuldt, bedragerisk eller tiltænkt at fremkalde vold. Vores Tillid & Sikkerhed-hold opretholder disse standarder med et strengt indholdsmodereringsprogram, der blokerer og fjerner brugere, der forsøger at krænke vores vilkår.

Gennemsigtighed: Vi kræver eksplisit samtykke, før vi bygger en syntetisk stemme med nogen persons stemme-data. Brugere kan ikke uploade stemme-data fra politikere, berømtheder eller nogen anden for at skabe en kopi af deres stemme, medmindre vi har den pågældendes eksplisitte, skriftlige samtykke.

Privatliv og sikkerhed: Vi beskytter identiteterne af vores stemme-skuespillere ved at bruge standard-billeder og alias til at repræsentere de syntetiske stemmer. Vi opmuntrer dem også til at være forsigtige med, hvordan og med hvem de deler deres association med WellSaid Labs eller andre syntetiske stemme-virksomheder for at reducere muligheden for misbrug af deres stemme.

Retfærdighed: Vi kompenserer alle stemme-skuespillere, der tilbyder stemme-data til vores platform, og giver dem en fortsat andel i omsætningen for brugen af den syntetiske stemme, vi bygger med deres data.

Sammen med disse principper respekterer vi også strengt immaterielle rettigheder. Vi gør ikke krav på ejerskab over indholdet, der leveres af vores brugere eller stemme-skuespillere. Vi prioriterer integritet, retfærdighed og gennemsigtighed i alt, vi gør, og sikrer, at vores syntetiske tale-teknologi anvendes på en ansvarlig og etisk måde. Vi søger aktivt efter samarbejdspartnerskaber med stemmer fra forskellige baggrunde, organisationer og erfaringer for at sikre, at vi tilbyder en stemme til alle.

WellSaid Labs har skabt sin egen interne AI-model, der har gjort det muligt for vores AI-stemmer at opnå menneske-lignende niveau, og det er sket ved at tilføre de fejl, som mennesker har i samtaler. Hvad er det om disse fejl, der gør AI’en bedre, og hvordan implementeres disse fejl?

WellSaid Labs er ikke bare endnu en TTS-genererator. Hvor tidlig TTS-teknologi ikke kunne genkende menneske-lignende talekvaliteter som tone, pitch og dialekt, der transmitterer konteksten og følelsen bag ordene, har WellSaid-stemmer opnået menneske-lignende niveau, og tilført unikt menneske-lignende fejl til AI-genereret tale.

Vores primære mål for stemme-kvalitet har altid været menneske-lignende naturlighed. Denne vejledende tro har formet vores teknologi på hver enkelt stage, fra script-bibliotekerne, vi har bygget, til instruktionerne, vi giver til talent, og senest, hvordan vi itererer på vores kerne-TTS-algoritmer.

Vi træner på autentiske menneske-lignende udtalelser. Vores stemme-talenter læser deres manuskripter autentisk og engagerende, når de optager for os. Tale-perfektion er på den anden side en mekanisk koncept, der fører til en robotisk fejl-fri, unaturlig output. Når professionelle stemme-talenter optræder, varierer deres tale-hastighed. Deres højde ændrer sig i forhold til indholdet, de læser. Deres vokal-pitch kan stige i en passage, der kræver en ophidset læsning, og falde igen i en mere alvorlig linje. Disse dynamiske variationer udgør en engagerende menneske-lignende vokal-præstation.

Ved at bygge AI-processer, der arbejder i samarbejde med de dynamiske præstationer af vores professionelle talenter, har vi bygget et sandt naturligt TTS-platform. Vi udviklede det første lang-forms TTS-system med predictive kontroller i hele den kreative proces. Vores fonetiske bibliotek indeholder en divers samling af audio-data, der giver brugerne mulighed for at inkorporere specifikke vokale signaler, som udtale-vejledning eller kontrollabilitet, i modellen under produktionen. I ét platform kan WellSaid-brugere optage, redigere og stylize deres voiceover uden at skulle importere eksterne data.

Kan du diskutere nogle af udfordringerne med at bygge en tekst-til-tale (TTS) AI-virksomhed?

Udviklingen af AI-stemme-teknologi har skabt en helt ny sæt af udfordringer for både producenter og forbrugere. En af de største udfordringer er ikke at blive fanget i larmen og hype, der oversvømmer AI-sektoren. Som en ny, buzz-værdig teknologi, prøver mange organisationer at kapitalisere på kort-sigtige AI-stemme-udviklinger. Vi ønsker at tilbyde en stemme til alle, guidet af centrale etiske principper og autenticitet. Dette engagement for autenticitet kan forsinke udviklingen og implementeringen af vores teknologier, men det sikrer også sikkerheden og sikkerheden af WellSaid-stemmer og deres data.

En anden udfordring med udviklingen af vores TTS-platform var at udvikle specifikke samtykke-retningslinjer for at sikre, at organisationer eller enkelt-personer ikke misbruger vores teknologi. For at bekæmpe denne udfordring, søger vi efter samarbejdspartnerskaber og er fuldt engageret i voiceover-udviklingen for at øge ansvarlighed, gennemsigtighed og bruger-sikkerhed. Vi søger aktivt efter samarbejdspartnerskaber med stemme-talenter fra forskellige baggrunde, organisationer og erfaringer for at sikre, at WellSaid Labs’ bibliotek af stemmer afspejler dens skabere og publikum. Disse processer er designet til at være intentionelle og detalj-orienterede for at sikre, at vores teknologi anvendes på en så sikker og etisk måde som muligt, hvilket kan forsinke udviklingen og lanceringstidslinjen.

Hvad er din vision for fremtiden for generative AI-stemmer?

I længst tid har AI-tale-teknologi ikke nået et tilstrækkeligt højt niveau til at gøre det muligt for virksomheder at skabe meningsfuldt indhold i stor målestok. Nu, hvor audio-teknologi ikke længere kræver dyrt udstyr og hardware, kan alle skrevne indhold produceres og offentliggøres i en audio-format for at skabe engagerende, multi-modale oplevelser.

I dag kan AI-stemmer producere menneske-lignende audio og fange den nuance, der kræves for at gøre digital storytelling mere tilgængelig og naturlig. Fremtiden for generative AI-stemme vil være alle-omfattende hørbare oplevelser, der berører alle aspekter af vores liv. Da teknologien fortsætter med at udvikle sig, vil vi se stadig mere naturlige og udtryksfulde syntetiske stemmer, der udvisker grænsen mellem menneske-genereret og maskin-genereret tale – åbner nye døre for forretning, kommunikation, tilgængelighed og hvordan vi interagerer med verden omkring os.

Virksomheder vil finde forbedret personliggørelse i AI-stemme-grænseflader og bruge dem til at gøre interaktioner med virtuelle assistenter mere immersive og bruger-venlige. Disse forbedringer sker allerede, fra intelligente call center-agenter til hurtig-mad drive-thru. Indholdsskabelse, herunder reklame, produkt-markedsføring, nyheds-læsning, podcasts, lydbøger og andre multimedie, vil se en øget effektivitet ved at bruge værktøjer til at udvikle engagerende indhold – ultimativt øger lift og omsætning for organisationer, især nu, hvor multilinguale modeller kan udvide en virksomheds rækkevidde fra et enkelt punkt til at have en global tilstedeværelse. Produktionshold vil finde stor fordel i syntetiske stemmer til at skabe stemmer, der er tilpasset virksomhedens behov eller tilpasset lytteren.

Før introduktionen af AI, manglede TTS-teknologi den kritiske menneske-lignende emotion, intonation og udtale-evne, der kræves for at fortælle en fuld historie i stor målestok og med lethed. Nu tilbyder AI-drevet TTS mere immersive og tilgængelige oplevelser, herunder real-time tale-kapaciteter og interaktive samtale-agenter.

At opnå menneske-lignende tale-kapaciteter har været en rejse, men nu, hvor det er opnåeligt, er vi vidner til den fulde omfang af AI-stemme for at skabe reel forretningsværdi for organisationer.

Tak for det fantastiske interview, læsere, der ønsker at lære mere, skal besøge WellSaid Labs.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.