インタビュー
パベル・オソーキン、AMAIの共同創設者兼CEO – インタビュー・シリーズ

パベル・オソーキンは、AMAIの共同創設者兼CEOです。AMAIは、サンフランシスコを拠点とするスタートアップで、AI音声エンジンを開発しています。パベルは、AMAIの運営と戦略をリードし、専門的な野心を持ち、世界中のすべての電話に声の技術を導入することを目指しています。AMAIでは、97%のユーザーが人間の話し声と区別できないAI音声を開発しました。
あなたは13歳のときに最初の会社を設立し、生涯の起業家です。最初の事業は何でしたか?それがあなたの起業家精神をどのように刺激しましたか?
私はそれを会社と呼ばなかったですが、物を売ったり、街で車を洗ったりしてお金を稼ぎました。私の動機は、コカ・コーラやスニッカーズが欲しかったことです。私の両親はお金がないので、待つか自分で稼ぐかでした。待つのは私に合いません。
AMAIの創設ストーリーを共有してください。
私はパートナーに、「世界中の会社が何を探しているのか?」と聞きました。その会話の中で、私は毎回「売上」を探していることを実感しました。私たちは、メールやメッセンジャーで顧客と対応し、製品を販売するロボットを作り始めました。ただし、これは新しいことではありませんでした。チャットボットはすでに多くありました。そこで、私たちは、これらのロボットが電話も行えるようにしたら面白いと思い、市場に良い解決策がないことを確認して、独自の合成音声のプロトタイプを作成しました。最初の売上後、ロボットを捨てて、TTSに焦点を当てました。
AMAIは具体的に何を意味しますか?
これは、I’m AI(私は人工知能)を意味します。
最先端のテキスト・トゥ・スピーチ技術を設計する際の課題について議論してください。
最先端のTTSを設計するには、複数の課題があります。まず、データセットを収集する必要があります。ニューラルネットワークをトレーニングするには、さまざまな年齢の男女の声が必要です。さらに、自然な声に非常に近い声にする必要があります。最善の方法は、さまざまな機械学習モデルをテストし、さまざまな声の使用ケースを不断に実験することです。特に、最も問題のあるサンプルを見つけて、それを個別に処理する必要があります。長期的な課題として、声が改善されたか悪化したかを評価することが難しいことがあります。
AMAIの音声AIと人間の対話における音声認識の課題について説明してください。
音声認識を開発している会社は数百社あります。現在、解決策のない問題は、子供の声の認識です。子供は若い頃から多くの発話特性を持っています。すべてを考慮することは難しいです。ただし、この問題の解決に取り組んでおり、すぐに結果を発表する予定です。私たちのAIは、将来、子供と対話する際にも問題がないでしょう。
AMAIの一般的なユースケースをいくつか紹介してください。
現在、オーディオブックの吹き替えとコールセンターでのエンタープライズ使用が主なユースケースです。
現在提供されている言語と、現在開発中の言語を教えてください。
私たちのマルチスピーカーシステムには、ロシア語と英語の2つの言語が含まれています。1つの言語で作成された声は、他の言語でも話すことができます。現在、40言語以上のデータを収集中で、すぐに42言語をサポートする予定です。
AI音声アシスタントの将来のビジョンを教えてください。
私の考えでは、音声アシスタントはメタバースに移行し、現在これらの機会を研究しています。スマートスピーカーまたはウェブブラウザとアシスタントを統合すると、b ブラウザ、より多くの人が毎日音声検索を使用し、アシスタントと対話するようになります。冷蔵庫やテレビと話すことができます。
AMAIについてさらに共有したいことがありますか?
AMAIは、独自の独自技術のみを使用しています。
インタビューありがとうございます。詳細については、AMAIを訪れてください。












