インタビュー

Alexey Aylarov、Voximplant共同創設者兼CEO – インタビュー・シリーズ

mm
Unite.AI を Google の優先ソースに追加

Alexey Aylarovは、Voximplantを共同創設する前、10年間、コミュニケーションツールを一から構築してきました。彼の初期の仕事には、IP PBXの開発や、クラウドテレフォニーが一般的になる前に、自らのテレコムソフトウェア会社を経営することが含まれていました。次に、Zingayaが登場し、ブラウザ内でクリックして通話する機能を提供しました。Voximplantはこれに続き、開発者がリアルタイムの音声とビデオに頼るサーバーレスプラットフォームに成長しました。Alexeyは、特に大規模言語モデルが世界的なテレフォニーの複雑な現実と衝突する場合、Voice AIの実用的側面について書いています。

あなたは2000年代中盤にVoIPエンジニアとしてキャリアをスタートさせました。その当時、AIはリアルタイムコミュニケーションには入っていませんでした。Voximplantを共同創設するきっかけになった、当時の最大のギャップとは何でしたか?

私は2005年からVoIPシステムに関わってきました。当時、信頼性の高いコミュニケーションを構築するのは遅く、複雑でした。私は多くの開発者が私と同じように苛立ちを感じていることに気づきました。チームはテレコムコンポーネントを組み合わせるのではなく、実際に提供したい製品の体験に焦点を当てるべきです。このことが、開発者向けのプログラマブルコミュニケーションのアイデアに私を導きました。私たちは、誰もがテレコムの専門家になる必要なく製品を構築できるような製品を作りたいと思っていました。

Voximplantを共同創設する前、SIPベースの電話サービスであるFlashphoneとZingayaを共同創設しました。これらのサービスは、クリックして通話する初期の製品を提供しました。需要は、チームがプログラマブルコミュニケーションを望んでいたことを再び証明しましたが、ツールはまだありませんでした。すべてのことが2013年にVoximplantの創設につながりました。

今日、私たちはより大きなスケールで同様のギャップを目にしています。Voice AIは生産フローに進出しています。LLMは毎月進化していますが、世界的な電話ネットワークは依然として断片化しています。単一のベンダーがすべてをエンドツーエンドで解決することはできません。したがって、Voximplantはオーケストレーションレイヤーとして機能し、開発者に最新のツールやVoiceエージェントを実験し、電話インフラストラクチャーやストリーミングの複雑さを心配せずにリアルな電話にデプロイするための迅速でコスト効率の高い方法を提供します。

Voximplantは単一のAIまたはテレフォニープロバイダーではなく、オーケストレーションレイヤーとして位置付けられています。未来のVoice AIのためにオーケストレーションレイヤーを構築することを正しいと考えた理由は何ですか?

私たちにとって、最初から世界規模で提供することが重要でした。世界規模のテレフォニープラットフォームを提供するには、テレフォニーのオーケストレーションを行う必要があります。技術的な要件やインフラストラクチャーは国によって異なります。私たちは190以上の国で電話番号を提供しているため、多くの技術的な仲介を行っています。

さらに、テレフォニーの標準であるSIPはベンダーによってさまざまなバージョンに進化しています。さまざまなテレコム会社や顧客のコミュニケーションインフラストラクチャーを接続するには、柔軟性の高いシステムが必要です。WhatsAppのような新しい電話ネットワークは、ここにさらにニーズを生み出しています。さらに、実際に顧客のユニークなアプリケーションロジックを実行するコミュニケーションコントロールレイヤーのロジックが上に乗っています。

AIの側面では、市場は非常に激しく、急速に進化しています。今日のベストベンダーは、来週には2位または3位になっている可能性があります。私たちのアプローチは、可能な限り多くの主要プロバイダーをサポートすることです。私たちは、顧客が常に最先端のオプションを選択できるようにしたいと思います。彼らは特定のアプリケーションに適したAIプロバイダーを選択できます。あるいは、プロバイダーを組み合わせることもできます。私たちのオーケストレーションプラットフォームは、プロバイダーを切り替えることをより簡単にし、同時に彼らの完全な機能を公開します。開発者は最低限の機能セットに縛られることがありません。

多くのチームは、ボイスAIエージェントがリアルな電話を着信し、管理することの難しさを軽視しています。ボイスAIエージェントがこれらの電話を処理する上で、リアルなテレフォニーが純粋なデジタルAIインタラクションと比較してどのように難しいですか?

電話ネットワークは依然として断片化され、地域によって異なり、予測不可能です。ある国では特定のプロトコルが制限されたりブロックされたりし、キャリアは通常の運用の一環としてダウンタイムを経験し、通話ルーティングパターンは一日を通して変化します。また、クラウドテレフォニーが法的に複雑になる地域もあります。

インフラストラクチャー自体がボトルネックになるケースも見受けられます。例えば、オーストラリアのヘルスケアスタートアップは、カントニーズ語を話す高齢者へのチェックインにAIコーラーを構築しようとしていましたが、高遅延とカントニーズTTSの限られた可用性により、会話が遅く、自然ではなかったというものです。

信頼性に加えて、コンプライアンスレイヤーもあります。要件は国によって大きく異なり、HIPAA、PCI DSS、GDPRなどのフレームワークと重複することもあります。

スピーチパフォーマンス自体も普遍的ではありません。STTやTTSエンジンはすべての環境で最もよく機能するわけではありません。アクセント、背景ノイズ、通話品質の変動、またはプロバイダーの劣化により、精度とユーザーエクスペリエンスが急激に低下する可能性があります。

いくつかのボイスAIシステムは、LLM、スピーチツーテキスト、テキストツースピーチ、ルーティングに複数のベンダーに依存しています。フラグメンテーションはなぜ避けられないのか、また、AIまたはスピーチプロバイダーを切り替えるのはなぜ迅速なコード変更ではなく、重大なエンジニアリングプロジェクトになるのか?

ボイスAIの初期段階では、スピーチツースピーチオプションはありませんでした。したがって、スピーチツーテキスト、LLM、テキストツースピーチを組み合わせる必要がありました。今日、複数のLLMベンダーはスピーチを直接統合しています(しばしばバージョンサポートを含む)。これらのシステムはより高速で、インタラクティブですが、機能的な通話やトランスクリプションとボイスの改善の選択肢が限られているという制限があります。私たちは、スピーチベースのLLMがテキストモデルと比較できるようになることを期待しています。そうであっても、顧客は特定の要件に応じて異なるスピーチベンダーを使用したいと考えるかもしれません。パイプラインの分離は冗長性の選択肢も追加します。

私たちのプラットフォームでは、AIおよびスピーチベンダーを切り替えることは、大きなエンジニアリングの努力ではありませんが、1行のコード変更だけではありません。スピーチベンダーは、独自の機能を導入することで、コモディティ化に抵抗しています。私たちは、コネクタを可能な限り一貫性のあるものにしていますが、各プロバイダーの機能を公開しています。したがって、これらの独自の機能を活用するには、数行のコードを変更する必要があります。

ボイスAIエージェントは、従来のコールセンターモデルと比較して、カスタマーサポート、セールス、その他のB2Cオペレーションの経済学をどのように変え始めていますか?

カスタマーサポートの経済学に大きな変化が生じているとはまだ言えませんが、間もなく変化が訪れるでしょう。今日、カスタマーサポート担当者がLLM駆動のサービスよりも安い地域がありますが、このモデルはスケーラビリティ、バーンアウト、管理、運用に関する既知の課題を伴います。LLMの最適化が進むにつれて経済学が変化するだろうと想定していますが、まだ時間がかかるでしょう。

ボイスAIが実験から企業のミッションクリティカルインフラストラクチャーへの移行を示す信号は何ですか?

最も強い信号は、ボイスAIインフラストラクチャーへの投資の急速な成長です。ボイスAIを活用した通話や分のグローバルスケールでの追跡は、正確には不可能ですが、推定は可能です。Voximplantの直接的な追跡は私が行うことができますが、明確に強い成長を確認しています。

AIモデルやボイステクノロジーがより速く進化するにつれて、開発者の柔軟性とコントロールに関する期待はどのように変化しましたか?

それは興味深い質問です。変化の速度については、AIは歴史上で見られたものとは比較ができません。コントロールと柔軟性については、複雑な課題があり、克服するのが簡単ではありません。多くのAI会社は、モデルガードレールに多大な労力を費やしていますが、これを行うには深い専門知識が必要であり、会社によって異なる目標があります。

企業が従来のテレフォニーシステム上にボイスAIエージェントを直接デプロイする際に最も一般的に犯すミスは何ですか?

従来のテレフォニーシステムはボイスAIサービスと直接互換性がないため、通常、追加の統合が必要です。一般的なミスには、不十分なフェイルオーバー管理、遅延問題(さまざまな要因によって引き起こされる可能性があります)、スケーラビリティの課題が含まれます。

テレフォニー自体はVoIPによってかなりスケーラブルですが、ボイスAIサービスは、LLMを実行するために必要なハードウェア要件のため、スケーラブル性が低くなります。Amazonのような大規模なインフラストラクチャープレーヤーであっても、推論ハードウェアの容量制限に直面する可能性があります。

リアルタイムAIがより自律的になるにつれて、ボイスAIプラットフォームが関連性を維持するためにサポートする必要がある機能とは何ですか?

私は、ボイスAIプラットフォームがSLAに重点を置く必要があると思います。時折、まだ課題となることがあります。また、テストと観察性のための追加ツールも必要です。

最終的には、最も高度なプラットフォームはすべて必要なものを提供することになるでしょう。しかし、今日の私たちはまだ毎日新しい教訓を学んでいます。多くのものはコアスタックの一部となるべきです。大企業や規制された環境で働く場合、製品のオンプレミスバージョンを持つことは重要になることがあります。

初期のVoIPインフラストラクチャーから現在のボイスAIプラットフォームのリーダーへのあなたの旅を振り返ってみると、業界がどのように進化したかについて、最も驚いたことは何ですか?

多くのことが驚きでしたが、その1つは、VoIPインフラストラクチャーへの変更が何年もかかることです。良い例は、テレフォニーがまだナローバンドオーディオコーデック(G.711、G.729)に依存していることです。人々はすでにオンラインコミュニケーションサービス(Zoom、Google Meet、WhatsAppなど)でワイドバンドオーディオに慣れています。

ほとんどのAIモデルはワイドバンドオーディオデータでもトレーニングされています。すべてのモダンな携帯電話にはワイドバンドオーディオコーデックが内蔵されていますが、キャリアレベルの相互運用性の課題により、従来の電話通話でワイドバンドオーディオを使用することができません。全く進歩がないわけではありませんが、私の意見では、それは非常に慎重なものでした。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。