Entretiens

Pavel Osokin, Co-Fondateur et PDG d’AMAI – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Pavel Osokin est le Co-Fondateur et PDG d’AMAI, une startup basée à San Francisco qui produit des moteurs de voix intelligents. Pavel dirige l’opération et la stratégie d’Amai avec une ambition professionnelle d’installer sa technologie vocale dans chaque téléphone du monde. Chez AMAI, ils ont développé une voix intelligente qui ne peut pas être distinguée d’un discours humain réel par 97 % des utilisateurs.

Vous avez été un entrepreneur toute votre vie, ayant lancé votre première entreprise à l’âge de 13 ans, quelle était votre première tentative d’entreprise et qu’est-ce qui vous a motivé à adopter cette mentalité d’entrepreneur ?

Je n’ai pas vraiment appelé cela une entreprise, mais j’ai gagné mon premier argent en revendant certaines choses ou en lavant des voitures dans la rue avec un seau. Ma motivation était que je voulais une Coke ou un Snickers, et mes parents n’avaient pas d’argent. Je pouvais soit attendre que l’argent apparaisse, soit le gagner moi-même. Attendre ne m’a pas plu.

Pouvez-vous partager l’histoire de la genèse d’AMAI ?

J’ai demandé à mon partenaire : “Qu’est-ce que les entreprises du monde entier ont besoin ?” Dans cette conversation, j’ai réalisé que chaque entreprise recherche une “vente”. Nous avons commencé à créer des robots qui pouvaient correspondre avec les clients et vendre des produits par courrier et messagers. D’un autre côté, ce n’était pas quelque chose de particulièrement nouveau, car il y a de nombreux chatbots disponibles. Nous avons donc pensé que si ces robots pouvaient également passer des appels, ce serait cool. Comme il y avait peu de bonnes solutions sur le marché, nous avons créé un prototype de notre propre voix synthétisée, et après les premières ventes, nous avons abandonné le robot et nous sommes concentrés sur la TTS.

Qu’est-ce que signifie spécifiquement AMAI ?

Cela signifie Je suis un intelligence artificielle (I’m artificial intelligence).

Pouvez-vous discuter des défis liés à la conception d’une technologie de synthèse vocale de pointe ?

La conception d’une technologie de synthèse vocale de pointe offre plusieurs défis. Le premier est la collecte de données. L’entraînement d’un réseau neuronal nécessite des voix féminines et masculines de différents âges, et plus il y en a, mieux c’est. Deuxièmement, vous devez atteindre une ressemblance très proche avec une voix naturelle. La meilleure méthode est de tester différents modèles d’apprentissage automatique et d’expérimenter constamment avec différents cas d’utilisation de la voix : en particulier, vous devez trouver l’échantillon le plus problématique et le traiter séparément. En ce qui concerne les défis à long terme, il peut être difficile d’évaluer si la voix est devenue meilleure ou pire, et dans quelle direction elle devrait être améliorée.

Quels sont les défis liés à la reconnaissance vocale lorsqu’il s’agit d’interactions humaines avec l’IA vocale d’AMAI ?

Il y a des centaines d’entreprises qui travaillent sur la reconnaissance vocale, car il est plus facile de la développer. Le problème qui n’a pas de solution actuellement est la reconnaissance de la voix d’un enfant. Les enfants ont de nombreuses caractéristiques de langage à un jeune âge, il est donc difficile de prendre en compte toutes ces caractéristiques. Néanmoins, nous travaillons sur une solution à ce problème, et nous sommes très proches d’annoncer le résultat – bientôt, notre IA n’aura aucun problème pour interagir non seulement avec les adultes, mais également avec les enfants.

Quels sont les cas d’utilisation populaires d’AMAI ?

Actuellement, il s’agit de la doublage de livres audio et de l’utilisation dans les centres d’appels d’entreprise.

Quelles langues sont actuellement proposées, et quelles langues sont actuellement en cours de développement ?

Notre système de voix multi-locuteurs comprend deux langues, le russe et l’anglais. L’idée est qu’une voix créée dans une langue peut parler toutes les autres langues de notre modèle. Actuellement, nous collectons des données pour 40 langues supplémentaires, et très bientôt, nous aurons 42.

Quelle est votre vision pour l’avenir des assistants vocaux intelligents ?

Je crois que les assistants vocaux vont évoluer vers le métaverse, et nous étudions ces opportunités actuellement. Si vous intégrez l’assistant avec des enceintes intelligentes ou un navigateur web, plus de personnes utiliseront la recherche vocale et interagiront avec l’assistant chaque jour. Vous pouvez parler à votre réfrigérateur ou à votre télévision.

Y a-t-il autre chose que vous aimeriez partager sur AMAI ?

AMAI utilise uniquement ses propres technologies propriétaires.

Merci pour l’entretien, les lecteurs qui souhaitent en savoir plus peuvent visiter AMAI.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.