Rozhovory
Pavel Osokin, spoluzakladatel a CEO AMAI – Interview Series

Pavel Osokin je spoluzakladatel a CEO AMAI, sanfranciského startupu, který vyrábí hlasové motory AI. Pavel vede operace a strategii Amai s profesionální ambicí nainstalovat svou hlasovou technologii do každého telefonu na světě. V AMAI vyvinuli umělou inteligenci, která se liší od skutečné lidské řeči pouze u 3 % uživatelů.
Vy jste celoživotním podnikatelem, který založil svou první společnost ve věku 13 let, co byla vaše první obchodní aktivita a co vás motivovalo k tomuto podnikatelskému myšlení?
Neříkal jsem tomu společnost, ale vydělal jsem své první peníze prodejem věcí nebo mytím aut na ulici s kbelíkem. Mojí motivací bylo, že jsem chtěl Colu nebo Snickers, a moji rodiče neměli žádné peníze. Mohl jsem buď čekat, až se peníze objeví, nebo si je sám vydělat. Čekání se mi nelíbí.
Můžete sdílet příběh o vzniku AMAI?
Zeptal jsem se svého partnera: “Co potřebují společnosti po celém světě?” Při této konverzaci jsem si uvědomil, že každé podnikání hledá “prodej”. Začali jsme vyrábět roboty, které mohly komunikovat se zákazníky a prodávat produkty prostřednictvím pošty a messengerů. Na druhou stranu to nebylo nic zvláštního, protože existuje mnoho chatbotů. Takže jsme si mysleli, že pokud by tyto roboty mohly také dělat hovory, bylo by to skvělé. Protože na trhu nebyly žádné dobré řešení, vytvořili jsme prototyp našeho vlastního syntetizovaného hlasu a po prvních prodejích jsme opustili robota a zaměřili se na TTS.
Co přesně znamená AMAI?
To znamená “Jsem umělá inteligence” (I’m artificial intelligence).
Můžete diskutovat o některých výzvách při navrhování špičkové technologie Text-to-speech?
Navrhování špičkové TTS technologie nabízí několik výzev. První z nich je shromažďování dat. Školení neuronové sítě vyžaduje ženské a mužské hlasy různých věkových kategorií a čím více, tím lépe. Druhá výzva spočívá v dosažení velmi blízké podobnosti s přirozeným hlasem. Nejlepší metodou je testování různých modelů strojového učení a neustálé experimentování s různými případy použití hlasu: zejména je třeba najít nejproblematičtější vzorek a zpracovat ho zvlášť. Pokud jde o dlouhodobé výzvy, může být obtížné posoudit, zda se hlas stal lepší nebo horší a v jakém směru by se měl zlepšit.
Jaké jsou některé výzvy spojené s rozpoznáním řeči, když lidé interagují s hlasovým AI AMAI?
Existuje stovek firem, které pracují na rozpoznání řeči, protože je to snazší vyvinout. Problém, který v současné době nemá řešení, je rozpoznání hlasu dítěte. Děti mají mnoho charakteristik řeči v mladém věku, takže je obtížné vzít v úvahu všechny. Přesto jsme pracovali na řešení tohoto problému a jsme velmi blízko k oznámení výsledku – brzy naše AI nebude mít žádné problémy s interakcí nejen s dospělými, ale i s dětmi.
Jaké jsou některé oblíbené použití AMAI?
Právě teď je to dabing audioknih a firemní využití v call centrech.
Jaké jazyky jsou v současné době nabízeny a na kterých jazycích se v současné době pracuje?
Náš multi-speaker systém zahrnuje dva jazyky, ruštinu a angličtinu. Nápad spočívá v tom, že hlas vytvořený v jednom jazyce může mluvit všemi ostatními jazyky v našem modelu. V současné době shromažďujeme data pro 40 dalších jazyků a brzy budeme mít 42.
Jaký je váš výhled do budoucnosti hlasových asistentů AI?
Je mi přesvědčeno, že hlasoví asistenti se přesunou do metaverza a studujeme tyto příležitosti. Pokud integrujete asistenta se smart reproduktory nebo webovým prohlížečem, více lidí bude používat hlasový vyhledávání a interagovat s asistentem každý den. Můžete mluvit se svou lednicí nebo televizí.
Je něco jiného, co byste rádi sdíleli o AMAI?
AMAI používá pouze své vlastní proprietární technologie.
Děkuji za rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit AMAI.












