Intervjuer
Pavel Osokin, medgrunnlegger og CEO av AMAI – Intervju-serie

Pavel Osokin er medgrunnlegger og CEO av AMAI, en San Francisco-basert startup som produserer AI-lydtengines. Pavel leder driften og strategien til Amai med en profesjonell ambisjon om å installere sin taleteknologi på hver telefon i verden. I AMAI har de utviklet en AI-stemme som ikke kan skilles fra en ekte menneskelig tale av 97% av brukerne.
Du har vært en livslang entrepreneur, og har lansert ditt første selskap i en alder av 13 år. Hva var ditt første forsøk på å drive forretning, og hva motiverte deg til å utvikle denne entreprenørånden?
Jeg kalte det ikke et selskap, men jeg tjente mine første penger ved å selge noen ting eller bare vaske biler på gaten med en bøtte. Min motivasjon var at jeg ønsket en Coke eller en Snickers, og mine foreldre hadde ikke noen penger. Jeg kunne enten vente til pengene dukket opp eller tjene dem selv. Å vente har aldri appellert til meg.
Kan du dele historien bak AMAI?
Jeg spurte min partner: “Hva trenger selskaper over hele verden?” I den samtalen innsett jeg at hver bedrift søker etter en “salg”. Vi startet med å lage roboter som kunne korrespondere med kunder og selge produkter via e-post og meldinger. På den andre siden var det ikke noe spesielt nytt, siden det finnes mange chatboter tilgjengelige. Så tenkte vi at hvis disse robotene også kunne ringe, ville det være kul. Ettersom det var få gode løsninger på markedet, lagde vi en prototype av vår egen syntetiske stemme, og etter de første salg, forlot vi roboten og fokuserte på TTS.
Hva står AMAI spesifikt for?
Dette står for Jeg er AI (Jeg er kunstig intelligens).
Kan du diskutere noen av utfordringene bak å designe tekst-til-tale-teknologi?
Å designe tekst-til-tale-teknologi tilbyr flere utfordringer. Den første er å samle inn datasett. Trening av et neuralt nettverk krever kvinnelige og mannlige stemmer i forskjellige aldre, og jo flere, jo bedre. For det andre må du oppnå en svært nær likhet med en naturlig stemme. Den beste metoden er å teste forskjellige maskinlæringsmodeller og å eksperimentere konstant med forskjellige tilfeller av stemmebruk: spesielt må du finne det mest problematiske eksemplet og prosessere det separat. Når det gjelder langsiktige utfordringer, kan det være vanskelig å vurdere om stemmen har blitt bedre eller dårligere, og i hvilken retning den bør forbedres.
Hva er noen av utfordringene bak talegjenkjenning når det gjelder mennesker som samhandler med AMAI-stemme-AI?
Det finnes hundrevis av selskaper som arbeider med talegjenkjenning fordi det er lettere å utvikle. Problemet som for tiden ikke har noen løsning er gjenkjenning av et barns stemme. Barn har mange karakteristika i tale i en ung alder, så det er vanskelig å ta alle disse med i betraktning. Likevel har vi arbeidet på en løsning for dette problemet, og vi er svært nære ved å kunngjøre resultatet – så snart vil vår AI ikke ha noen problemer med å samhandle ikke bare med voksne, men også med barn.
Hva er noen populære bruksområder for AMAI?
For øyeblikket er det lydbok-dubbing og bedriftsbruk i call-sentre.
Hvilke språk tilbys for øyeblikket, og hvilke språk arbeides det med for tiden?
Vår flerspeaker-system inkluderer to språk, russisk og engelsk. Ideen er at en stemme som er skapt i ett språk kan snakke alle andre språk i vår modell også. For øyeblikket samler vi inn data for 40 flere språk, og svært snart vil vi ha 42.
Hva er din visjon for fremtiden til AI-stemme-assistentene?
Jeg tror at stemme-assistentene vil flytte inn i metaverset, og vi studerer disse mulighetene nå. Hvis du integrerer assistenten med smarte høyttalere eller nettleseren, vil flere mennesker bruke stemmesøk og samhandle med assistenten hver dag. Du kan snakke med din kjøleskap eller TV.
Er det noe annet du ønsker å dele om AMAI?
AMAI bruker bare sine egne proprietære teknologier.
Takk for intervjuet, lesere som ønsker å lære mer bør besøke AMAI.












