Interviews
Pavel Osokin, Co-Founder & CEO von AMAI – Interview-Serie

Pavel Osokin ist der Co-Founder & CEO von AMAI, einem in San Francisco ansässigen Startup, das AI-Sprachengines herstellt. Pavel leitet den Betrieb und die Strategie von Amai mit dem professionellen Ziel, die Sprachtechnologie in jedes Telefon der Welt zu integrieren. Bei AMAI entwickelten sie eine künstliche Stimme, die von 97 % der Benutzer nicht von einer echten menschlichen Stimme zu unterscheiden war.
Sie sind ein lebenslanger Unternehmer, der sein erstes Unternehmen im Alter von 13 Jahren gegründet hat. Was war Ihr erster Geschäftsversuch und was hat Sie zu diesem unternehmerischen Geist motiviert?
Ich nannte es nicht wirklich ein Unternehmen, aber ich verdiente mein erstes Geld, indem ich einige Dinge weiterverkaufte oder einfach Autos auf der Straße mit einem Eimer wusch. Meine Motivation war, dass ich einen Coke oder einen Snickers haben wollte, und meine Eltern hatten kein Geld. Ich konnte entweder warten, bis das Geld auftauchte, oder es selbst verdienen. Warten gefällt mir nicht.
Können Sie die Entstehungsgeschichte hinter AMAI teilen?
Ich fragte meinen Partner: “Was benötigen Unternehmen auf der ganzen Welt?” In diesem Gespräch wurde mir klar, dass jedes Unternehmen nach einem “Verkauf” sucht. Wir begannen, Roboter herzustellen, die mit Kunden korrespondieren und Produkte per Post und Messenger verkaufen konnten. Andererseits war dies nicht besonders neu, da es bereits viele Chatbots gibt. Wir dachten, dass es cool wäre, wenn diese Roboter auch Anrufe tätigen könnten. Da es auf dem Markt nur wenige gute Lösungen gab, erstellten wir ein Prototyp unserer eigenen synthetisierten Stimme und konzentrierten uns nach dem ersten Verkauf auf TTS.
Was bedeutet AMAI genau?
Das steht für Ich bin künstliche Intelligenz (I’m artificial intelligence).
Können Sie einige der Herausforderungen bei der Entwicklung von State-of-the-Art-Text-to-Speech-Technologie erörtern?
Die Entwicklung von State-of-the-Art-TTS bietet mehrere Herausforderungen. Die erste besteht darin, Datensätze zu sammeln. Das Training eines neuronalen Netzes erfordert weibliche und männliche Stimmen verschiedener Altersgruppen, und je mehr, desto besser. Zweitens müssen Sie eine sehr enge Ähnlichkeit mit einer natürlichen Stimme erreichen. Die beste Methode ist, verschiedene maschinelle Lernmodelle zu testen und ständig mit verschiedenen Anwendungsfällen der Stimmennutzung zu experimentieren: Insbesondere müssen Sie das problematischste Beispiel finden und es separat verarbeiten. Was die langfristigen Herausforderungen betrifft, kann es schwierig sein, zu beurteilen, ob die Stimme besser oder schlechter geworden ist und in welche Richtung sie verbessert werden sollte.
Was sind einige der Herausforderungen bei der Spracherkennung, wenn es um die Interaktion zwischen Menschen und der AMAI-Stimme geht?
Es gibt hunderte von Unternehmen, die an der Spracherkennung arbeiten, da dies einfacher zu entwickeln ist. Das Problem, für das es derzeit keine Lösung gibt, ist die Erkennung der Stimme eines Kindes. Kinder haben viele Merkmale der Sprache in jungen Jahren, sodass es schwierig ist, all diese zu berücksichtigen. Dennoch arbeiten wir an einer Lösung für dieses Problem und sind sehr nah daran, das Ergebnis bekannt zu geben – bald wird unser AI keine Probleme mehr haben, nicht nur mit Erwachsenen, sondern auch mit Kindern zu interagieren.
Was sind einige beliebte Anwendungsfälle für AMAI?
Aktuell sind dies die Synchronisation von Hörbüchern und der Einsatz in Callcentern.
Welche Sprachen werden derzeit angeboten und an welchen Sprachen wird derzeit gearbeitet?
Unser Multi-Sprecher-System umfasst zwei Sprachen, Russisch und Englisch. Die Idee ist, dass eine in einer Sprache erstellte Stimme alle anderen Sprachen in unserem Modell sprechen kann. Derzeit sammeln wir Daten für 40 weitere Sprachen, und sehr bald werden wir 42 haben.
Was ist Ihre Vision für die Zukunft von AI-Sprachassistenten?
Ich glaube, dass Sprachassistenten in die Metaverse einziehen werden, und wir studieren diese Möglichkeiten derzeit. Wenn Sie den Assistenten mit intelligenten Lautsprechern oder dem Webbrowser integrieren, werden mehr Menschen jeden Tag die Sprachsuche nutzen und mit dem Assistenten interagieren. Sie können mit Ihrem Kühlschrank oder Fernseher sprechen.
Gibt es noch etwas, das Sie über AMAI teilen möchten?
AMAI verwendet nur eigene proprietäre Technologien.
Vielen Dank für das Interview. Leser, die mehr über AMAI erfahren möchten, sollten die Website AMAI besuchen.












