AIモデルとプラットフォーム

aiOla、QUASARを発表し、スピーチ認識の仕組みを再考する

mm
Unite.AI を Google の優先ソースに追加

aiOlaは、QUASARを発表しました。これは、企業の声AIにおける最も根深い問題の一つである、実世界の条件でのスピーチ認識の不一致なパフォーマンスを解決するためのプラットフォームです。顧客を単一の自動スピーチ認識(ASR)プロバイダーにロックインさせるのではなく、QUASARは、各オーディオインタラクションを最もパフォーマンスの高いASRエンジンにダイナミックにルーティングするインテリジェントゲートウェイとして機能します。

これは、コンタクトセンター、コンプライアンス、分析、検索、そして増加の一人アーゲントでのAI駆動ワークフローでスピーチが重要な入力になるにつれて、重要性を増しています。ベンチマークスコアはASRの選択を導くことが多いですが、実稼働環境はアクセント、背景ノイズ、ドメイン固有の用語、ネットワーク品質の変動によって支配されます。これらは、認識精度を一貫して変化させる要因です。

なぜワンサイズフィットオールASRはスケールで壊れるのか

ほとんどの企業は、ASRを静的なインフラストラクチャの決定として展開しています。単一のプロバイダーが集約ベンチマークに基づいて選択され、ワークフローに深く埋め込まれます。実践では、これは盲点を作ります。クリーンな読み上げスピーチで優れたエンジンは、アクセントのある話者や業界重視の語彙で苦労するかもしれません。別のエンジンは、ノイズの多いオーディオをうまく処理するかもしれませんが、コンプライアンスや請求書で重要な適切な名詞や数字のシーケンスを見逃すかもしれません。

これらのギャップを解決するためにプロバイダーを切り替えることは、高価で混乱を招きます。通常、再トレーニング、再検証、および運用ダウンタイムが必要です。一方、新しいASRモデルと更新は、ほとんどの組織がテストして採用する能力を上回るペースでリリースされています。結果として、コンテナ率が低下し、要約が不正確になり、分析が弱くなり、品質保証のオーバーヘッドが増加します。すべてのトランスクリプションエラーによって引き起こされるのです。これらのエラーは避けられるところだったのです。

QUASARのアーキテクチャの内部:ダイナミック問題としてのASR

QUASARは、リアルタイムの最適化課題としてスピーチ認識に取り組みます。各インカミングオーディオリクエストは、スピーカーの特性、音響条件、ドメインコンテキストなどを考慮してトランスクリプション前に評価されます。この評価に基づいて、システムはオーディオを最も高品質の結果を提供する可能性のあるASRエンジンにルーティングします。

技術的には、QUASARは商用クラウドAPI、セルフホストモデル、カスタムASRデプロイメントを横断して機能するオーケストレーションレイヤーとして機能します。この抽象化により、企業は新しいエンジンを試験し、コストと品質のバランスをとり、長期的なベンダーロックインを回避できます。ダウンストリームアプリケーションを変更する必要はありません。

コアには、ASRオプションをリアルタイムで評価してランク付けするための無監視評価メカニズムがあります。歴史的な平均値のみに頼るのではなく、システムはライブ条件から継続的に学習し、環境、話者、ユースケースの進化に合わせてトランスクリプションの決定を適応させます。

リアルワールドオーディオ条件でのパフォーマンス

クリーンな読み上げスピーチやプロのトークから、アクセントのある、ノイズのある、ドメイン重視の財務オーディオまで、6つの多様なベンチマークデータセットを網羅する内部評価では、QUASARは88.8%の全体的な精度で、最もパフォーマンスの高いASRオプションを選択しました。結果が実質的に同等の場合、精度はクリーンなスピーチで97%に達し、アクセント、ノイズ、専門用語を含むオーディオの場合、79〜88%の範囲に留まりました。

これらの結果は、重要な洞察を強調しています。単一のASRエンジンがすべてのシナリオで一貫して勝つことはないが、インテリジェントなルーティングは多くの強みを捉えることができます。

声のインフラストラクチャとしての有効化

aiOlaは、QUASARによってASRを「生きているインフラストラクチャ」に変えました。企業は、インタラクションレベルのトランスクリプションパフォーマンスに対する微妙な可視性を獲得し、精度、コスト、または待ち時間に応じて最適化できます。

このアプローチは、新しい地域や業界への拡大をも加速します。単一のベンダーが言語、方言、業界固有の語彙をサポートするのを待つのではなく、組織はトラフィックを最適なエンジンにルーティングできます。より優れたオプションが現れるにつれて切り替えることができます。

aiOlaの声駆動ワークフローのより広いビジョン

QUASARは、企業システムの自然なインターフェイスとして声を使うというaiOlaのより広い使命を構築しています。同社の特許取得モデルは、標準のスピーチツーテキストを超えて、声認識とワークフローの知性を組み合わせ、話された入力をリアルタイムの構造化データに変換します。これにより、手作業でのデータ入力がボトルネックとなっている重要な業界で、ハンズフリーの自動化が可能になります。

5,800万ドルの資金提供と研究主導のチームによって後押しされ、aiOlaは声AIを企業および航空業界で拡大させることを目指しています。QUASARで、同社はこのビジョンをASRレイヤー自体に拡大し、スケールでのスピーチ認識の展開についての長期にわたる仮定に挑戦しています。

AIエージェントや企業システムの両方で声が主なインターフェイスになるにつれて、ダイナミックでコンテキスト認識可能なスピーチ認識が不可欠になる可能性があります。QUASARの立ち上げは、静的なモデル選択から適応型、パフォーマンス駆動型のオーケストレーションへの移行を示唆しており、声AIエコシステムがASRを消費する方法を再定義する可能性があります。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。