Haastattelut
Pavel Osokin, AMAI:n perustaja ja toimitusjohtaja – Haastattelusarja

Pavel Osokin on AMAI:n perustaja ja toimitusjohtaja, San Francisco -pohjaisen startup-yrityksen, joka tuottaa ääni moottoreita tekoälylle. Pavel johtaa Amai:n toimintaa ja strategiaa ammattimaisella pyrkimyksellä asentaa ääni teknologiaan jokaiseen puhelimeen maailmassa. Amai:ssa on kehitetty tekoäly ääni, jota 97 %:lla käyttäjistä ei voida erottaa oikean ihmisen puheesta.
Olet ollut elinikäinen yrittäjä, joka on perustanut ensimmäisen yrityksensä 13-vuotiaana. Mikä oli ensimmäinen yrityksesi ja mitä motiivasi yrittäjämielekkyyden?
En kutsuisi sitä yritykseksi, mutta teen ensimmäiset rahani myymällä jotain tai vain pesemällä autoja kadulla vedellä ja vastaan. Motivaationi oli, että halusin Coken tai Snickersin, ja vanhemmillani ei ollut rahaa. Voisin joko odottaa, että rahaa ilmestyisi, tai ansaita sen itse. Odottaminen ei ole minulle mieluista.
Voitko kertoa AMAI:n syntytarinaa?
Kysyin kumppaniltani: “Mitä yritykset ympäri maailmaa tarvitsevat?” Tässä keskustelussa tajusin, että jokainen yritys etsii “myyntiä”. Aloimme tekemään robottija, jotka voivat kommunikoida asiakkaiden kanssa ja myydä tuotteita postitse ja viestien välityksellä. Toisaalta se ei ollut mitenkään uutta, koska chatbotteja on paljon saatavilla. Ajattelimme, että jos nämä robotit voivat myös tehdä puheluita, se olisi kiva. Koska markkinoilla ei ollut hyviä ratkaisuja, loimme oman ääni synteesi prototyypin, ja ensimmäisten myyntien jälkeen hylkäsimme robotin ja keskityimme TTS:ään.
Mitä AMAI tarkalleen ottaen tarkoittaa?
Se tarkoittaa Minä olen tekoäly (I’m artificial intelligence).
Voitko keskustella joistakin haasteista, jotka liittyvät teksti-ääneksi -teknologian suunnitteluun?
Teksti-ääneksi -teknologian suunnittelu tarjoaa useita haasteita. Ensimmäinen niistä on aineistojen kerääminen. Neuroverkon kouluttamiseen tarvitaan naisten ja miesten ääniä eri ikäluokissa, ja mitä enemmän, sen parempi. Toiseksi on saavutettava hyvin lähellä luonnollista ääntä. Parasta menetelmää on testata eri koneoppimismalleja ja kokeilla eri äänen käyttötapausten kanssa: erityisesti on löydettävä ongelmallisimman ääninäytteen ja käsiteltävä se erikseen. Puhuttaessa pitkän aikavälin haasteista, voidaan arvioida, onko ääni parantunut vai heikentynyt, ja mihin suuntaan se tulisi parantaa.
Mitä haasteita on puheentunnistuksessa, kun ihmiset vuorovaikuttavat AMAI:n ääniälyteknologian kanssa?
On satoja yrityksiä, jotka työskentelevät äänen tunnistamisen parissa, koska se on helpompi kehittää. Ongelma, jolle ei ole ratkaisua, on lapsen äänen tunnistaminen. Lapset omaksuvat monia puheen piirteitä nuorella iällä, joten on vaikea ottaa kaikki ne huomioon. Kuitenkin olemme työskennelleet ratkaisun parissa, ja olemme hyvin lähellä tulokset julkituloa – pian meidän älymme ei kohtaa ongelmia aikuisten kanssa, vaan myös lasten kanssa.
Mitä ovat joitakin suosittuja käyttötarkoituksia AMAI:lle?
Tällä hetkellä se on äänikirjojen dubbaus ja yritysten käyttö asiakaspalvelukeskuksissa.
Mitä kieliä on tällä hetkellä tarjolla, ja mitkä kielet ovat parhaillaan kehitteillä?
Monikielinen järjestelmämme kattaa kaksi kieltä, venäjän ja englannin. Ideana on, että toisessa kielellä luotu ääni voi puhua kaikki muut kielet mallissamme. Tällä hetkellä keräämme dataa 40:lle muulle kielelle, ja pian meillä on 42 kieltä.
Mikä on visiosi ääniavustajien tulevaisuudesta?
Uskon, että ääniavustajat siirtyvät metaversumiin, ja tutkimme näitä mahdollisuuksia. Jos integroidaan avustaja älypuhelimien tai verkkoselaimen kanssa, enemmän ihmisiä käyttävät äänihakuja ja vuorovaikuttavat avustajan kanssa joka päivä. Voit puhua jääkaappiin tai TV:hen.
Onko mitään muuta, mitä haluaisit jakaa AMAI:sta?
AMAI käyttää vain omaa tekniikkaansa.
Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, kannattaa vierailla AMAI:ssa.












