Intervjuer
Pavel Osokin, medgrundare och VD för AMAI – Intervjuserie

Pavel Osokin är medgrundare och VD för AMAI, ett San Francisco-baserat startup-företag som producerar AI-röstmotorer. Pavel leder verksamheten och strategin för Amai med en professionell ambition att installera sin röstteknologi i varje telefon i världen. I AMAI har de utvecklat en AI-röst som inte kan skiljas från riktigt mänskligt tal av 97% av användarna.
Du har varit en livslång entreprenör sedan du startade ditt första företag vid 13 års ålder, vad var ditt första företag och vad motiverade dig till detta entreprenöriella sinne?
Jag kallade det inte för ett företag, men jag tjänade mina första pengar genom att sälja saker eller tvätta bilar på gatan med en hink. Min motivation var att jag ville ha en Coca-Cola eller en Snickers, och mina föräldrar hade inte några pengar. Jag kunde antingen vänta tills pengarna dök upp eller tjäna dem själv. Att vänta tilltalar mig inte.
Kan du dela med dig av historien bakom AMAI?
Jag frågade min partner: “Vad behöver företag runt om i världen?” I den konversationen insåg jag att varje företag letar efter en “försäljning”. Vi började skapa robotar som kunde korrespondera med kunder och sälja produkter via e-post och meddelanden. Å andra sidan var det inte något särskilt nytt, eftersom det finns många chatbotar tillgängliga. Så vi tänkte att om dessa robotar också kunde ringa samtal, skulle det vara coolt. Eftersom det fanns få bra lösningar på marknaden skapade vi en prototyp av vår egen syntetiserade röst, och efter de första försäljningarna övergav vi roboten och fokuserade på TTS.
Vad står AMAI för specifikt?
Detta står för Jag är AI (Jag är artificiell intelligens).
Kan du diskutera några av utmaningarna bakom designen av state-of-the-art Text-to-speech-teknologi?
Att designa state-of-the-art TTS erbjuder flera utmaningar. Den första är att samla in datamängder. Att träna ett neuronnät kräver kvinnliga och manliga röster i varierande åldrar, och ju fler, desto bättre. Den andra är att uppnå en mycket nära likhet med en naturlig röst. Den bästa metoden är att testa olika maskinlärningsmodeller och att ständigt experimentera med olika fall av röstanvändning: särskilt behöver man hitta det mest problematiska exemplet och bearbeta det separat. När det gäller långsiktiga utmaningar kan det vara svårt att bedöma om rösten har blivit bättre eller sämre, och i vilken riktning den bör förbättras.
Vilka är några av utmaningarna bakom taligenkänning när det gäller människors interaktion med AMAI-röst-AI?
Det finns hundratals företag som arbetar med röstigenkänning eftersom det är lättare att utveckla. Problemet som för närvarande inte har någon lösning är igenkänning av ett barns röst. Barn har många egenskaper av tal i ung ålder, så det är svårt att ta alla med i beräkningen. Trots detta har vi arbetat på en lösning för detta problem, och vi är mycket nära att tillkännage resultatet – så snart kommer vår AI inte att ha några problem med att interagera inte bara med vuxna, utan också med barn.
Vilka är några populära användningsfall för AMAI?
För närvarande är det ljudboksdubbning och företagsanvändning i callcenter.
Vilka språk erbjuds för närvarande, och vilka språk arbetas det på just nu?
Vårt multispeaker-system innehåller två språk, ryska och engelska. Idén är att en röst skapad på ett språk kan tala alla andra språk i vår modell också. För närvarande samlar vi in data för 40 fler språk, och mycket snart kommer vi att ha 42.
Vad är din vision för framtiden för AI-röstassistenter?
Jag tror att röstassistenter kommer att flytta in i metaversum, och vi studerar dessa möjligheter nu. Om du integrerar assistenten med smarta högtalare eller webbläsaren kommer fler människor att använda röstsökning och interagera med assistenten varje dag. Du kan prata med din kylskåp eller TV.
Finns det något annat du vill dela om AMAI?
AMAI använder endast sin egen proprietära teknik.
Tack för intervjun, läsare som vill lära sig mer kan besöka AMAI.












