ソートリーダー
AIを搭載した音声ベースのエージェント:2つの重要な課題

今、AIを搭載した音声ベースのシステムの時代です。顧客サービスへの電話を考えてみましょう。すぐに、硬いロボットの声、制限的なメニュー、人間のエージェントと話したい場合に0を繰り返し押すような煩わしい経験はなくなります。(または、人間のエージェントに転送されるまでの長い待ち時間のために、電話を完全に断念することになります。)
それではありません。トランスフォーマーベースの大規模言語モデル(LLM)の進歩だけでなく、自動音声認識(ASR)とテキストツースピーチ(TTS)システムの進歩により、「次世代」の音声ベースのエージェントがここにあります – ただし、それらを構築する方法を知っている場合に限ります。
今日、我々はそのような最先端の音声ベースの会話エージェントを構築することを希望する誰もが直面する課題を調べてみます。
なぜ音声か?
飛び込む前に、音声ベースのエージェントの一般的な魅力と関連性を、テキストベースのインタラクション(対話)と比較して見てみましょう。音声インタラクションがテキストベースのインタラクションよりも適切である理由は、以下のようないくつかあります – これらは、厳しさの順に並べたものです:
-
好みまたは習慣 – 発話は歴史的にも発達的にも書き言葉よりも先にあります
-
テキスト入力の遅さ – 多くの人がテキスト入力よりも話す方が速いです
-
ハンズフリーの状況 – ドライブ中、運動中、または皿洗いをしている場合など
-
非識字 – エージェントが理解する言語(言語)では
-
障害 – 視覚障害や非発話モーターコントロールの欠如など
ウェブサイトを介した取引が支配的な時代にありながら、音声は商取引の強力な手段であり続けています。たとえば、最近のJD Powerによるホテル業界の顧客満足度に関する研究では、電話で部屋を予約したゲストは、オンライン旅行会社(OTA)やホテルのウェブサイトを通じて予約したゲストよりも滞在に満足度が高かったことがわかりました。
しかし、インタラクティブな音声応答(IVR)は十分ではありません。 2023年のZippiaの研究では、88%の顧客が自動音声メニューではなく、生のエージェントとの音声通話を好むことがわかりました。この研究では、電話メニューで最も苛立たしいことは、無関係なオプションを聞くこと(69%)、問題を完全に説明できないこと(67%)、非効率的なサービス(33%)、混乱を招くオプション(15%)であることがわかりました。
また、音声アシスタントを使用することに抵抗がないことがわかりました。アクセンチュアの研究によると、約47%の消費者がすでにビジネスとのやり取りに音声アシスタントを使用することに快適感を持っており、約31%の消費者がすでに音声アシスタントを使用してビジネスとのやり取りをしています。
いずれにせよ、多くの人にとって、自然で快適な会話ができる限り、話し合いが好まれる傾向があります。
音声ベースのエージェントが良いかどうか
おおよそ、良い音声ベースのエージェントは、次のようにユーザーに応答する必要があります:
-
関連性:ユーザーが何を言ったか/何を望んだかを正しく理解した上で
-
正確性:事実に基づいて(たとえば、ホテルに1月19日に部屋が空いている場合にのみ、部屋が空いていると言う)
-
明確性:応答が理解できるものであること
-
適切なタイミング:人間と同じような待ち時間
-
安全性:不適切な言語、保護された情報の漏洩などがないこと
問題
現在の音声ベースの自動システムは、上記の基準を満たすために、非常に限定的で、そして非常に使いにくいものになっています。これは、高い期待を設定する音声ベースの会話の文脈の結果であり、この期待は、TTSシステムの音声品質が人間の声と区別がつかないほど向上するにつれてさらに高くなります。しかし、これらの期待は、現在広く展開されているシステムでは破壊されています。なぜでしょうか?
一言で言えば、柔軟性の欠如です:
-
制限された発話 – ユーザーは通常、不自然な方法で話さなければなりません。短いフレーズ、特定の順序、余分な情報なしなど
-
狭い、包括的ではない「受け入れられる」発話の概念 – スラング、うーん、アーなどに対する耐性が低い
-
後戻りできない – もし何かが間違った場合、問題のある情報を「修復」または修正するチャンスはほとんどなく、代わりにやり直すか、人間に転送されるのを待つ必要があります
-
厳格なターン制 – エージェントを遮断することや話しかけることができない
これらの制約が人々を苛立たせたり、イラっとさせたりすることは、言うまでもありません。
解決策
良いニュースは、現代のAIシステムが、上記のような経験を大幅に改善できるほど強力で高速であるということです。つまり、人間ベースの顧客サービス基準に近づいたり、それを超えたりすることができます。これは、以下の要因によるものです:
-
高速化されたハードウェア
-
ASRの向上(精度の向上、ノイズの克服、方言の克服など)
-
TTSの向上(自然な音声またはクローン音声)
-
生成可能なLLMの到来(自然な会話)
最後の点は、ゲームチェンジャーです。重要な洞察は、良い予測モデルが良い生成モデルとして機能できるということです。人工エージェントは、十分に良いLLMが予測する、人間の顧客サービスエージェントが会話の文脈で言う最も可能性の高いことを言うことで、人間レベルの会話のパフォーマンスに近づくことができます。
これにより、音声ベースの会話エージェントの問題を解決するために、オフザシェルフのASRとTTSモジュールをLLMコアに接続するだけの、数十のAIスタートアップが登場しました。そうすることで、待ち時間とコストを最小限に抑えることができます。もちろん、それは重要です。しかし、それで十分ですか?
まだ早い
そのような単純なアプローチが機能しない理由は、いくつかありますが、2つの一般的な点から導かれます:
-
LLMは、顧客サービスなどのエンタープライズアプリケーションに必要な、事実ベースのテキスト会話を、単独で提供することはできません。したがって、音声ベースの会話にもできないのです。何か別のものが必要です。
-
LLMを、テキストベースの会話エージェントを作成するために必要なもので補足する場合でも、テキストベースの会話エージェントを音声ベースの会話エージェントに変えるには、ASRとTTSモジュールに接続するだけで十分ではありません。
それぞれの課題の具体的な例を見てみましょう。
課題1:現実性を維持する
LLMは時々、不正確または「妄想」の情報を生成することが、広く知られていることです。これは、正確性が重要な商業アプリケーションの文脈では、災難的です。たとえば、エンターテイメントアプリケーションでは、正確性は重要ではないかもしれませんが、ここでは重要です。
LLMが妄想することは、反省してみると当然のことです。データが1年以上前のものであるモデルを使用して、データセット(どれほど巨大であっても)の一部ではない、または含まれない事実についての質問に答えるために使用するためです。たとえば、呼び出し先が「私の会員番号は何ですか?」と聞いた場合、事前トレーニング済みのLLMは、妄想的な答えを生成するだけです。
この問題に対処する最も一般的な方法は、以下のとおりです:
-
ファインチューニング:事前トレーニング済みのLLMを、さらにドメイン固有のデータでトレーニングします。
-
プロンプトエンジニアリング:ドメイン固有のデータ/指示を、会話の履歴とともにLLMの入力として追加します
-
リトリーバルオーグメンテッドジェネレーション(RAG):プロンプトエンジニアリングと同様ですが、会話の文脈(たとえば、顧客が「ホテルにプールはありますか?」と聞いた場合)に基づいて、ドメイン固有のデータの埋め込みエンコードインデックスに一致するデータを追加します。
-
ルールベースの制御:RAGと同様ですが、プロンプトに追加する(または削除する)ものは、ニューラルメモリとの一致によってではなく、ハードコーディングされた(そして手動でコーディングされた)ルールによって決定されます。
一つの方法がすべての状況に適しているわけではありません。どの方法が適切であるかは、たとえば、ドメイン固有のデータが頻繁に変更されるか(たとえば、呼び出しごとに、顧客の名前など)、ほとんど変更されないか(たとえば、初期の挨拶「ホテルブダペストにご連絡いただき、ありがとうございます。今日はどうお助けしましょうか?」)によって決まります。ファインチューニングは、前者の場合には適切ではありませんが、RAGは、後者の場合には不器用な解決策となります。したがって、動作するシステムは、これらの方法の組み合わせを使用する必要があります。
さらに、これらの方法をLLMや互いに統合するには、待ち時間とコストを最小限に抑えるように、慎重なエンジニアリングが必要です。たとえば、RAGを容易にするためにモデルをファインチューニングすると、RAGのパフォーマンスが向上する可能性があります。
これらの方法それぞれは、独自の課題を引き起こします。たとえば、ファインチューニングを考えてみましょう。事前トレーニング済みのLLMをドメイン固有のデータでファインチューニングすると、そのデータのパフォーマンスが向上します。ただし、ファインチューニングによって、事前トレーニング済みモデルの一般的なパフォーマンスの基盤となるパラメータ(重み)が変更されます。この変更により、モデルの以前の知識の「忘却」(または「カタストロフィックフォゲッティング」)が発生し、不正確または不適切(そして安全でない)回答が生成される可能性があります。エージェントが引き続き正確かつ安全に応答するようにするには、カタストロフィックフォゲッティングを軽減するファインチューニング方法が必要です。
課題2:エンドポイント
顧客が話し終わったかどうかを判断することは、自然な会話の流れに不可欠です。同様に、システムは中断をうまく処理し、会話が顧客のニーズに応じて一貫性と反応性を維持するようにする必要があります。人間の会話と比較できる基準に達することは難しい課題ですが、自然で快適な会話体験を作成するには不可欠です。
機能する解決策は、設計者が以下のような質問を考慮する必要があります:
-
顧客が話し終わったと判断する前にエージェントが待つ時間はどれくらいですか?
-
上記は、顧客が文を完成させたかどうかによって異なりますか?
-
顧客がエージェントを中断した場合に何をすべきですか?
-
特に、エージェントは、顧客がエージェントの話を聞いていないと想定するべきですか?
これらの問題は、主にタイミングに関するものであり、LLMが正しい回答を出すために必要なエンジニアリング以上のものです。
結論
AIを搭載した音声ベースのシステムの進化は、顧客サービスダイナミクスに革命的な変化をもたらすことを約束しています。古い電話システムを、最先端のLLM、ASR、TTSテクノロジーで置き換えるのです。しかし、妄想的な情報や無駄なエンドポイントを克服することは、自然で効率的な音声インタラクションを提供するために不可欠です。
顧客サービスを自動化することは、企業にとって真正のゲームチェンジャーとなり得ます。ただし、正しく行う必要があります。2024年、特にこれらの新しいテクノロジーが登場する中で、ついに私たちは、自然で流暢で、我々をしっかりと理解できるシステムを構築できるようになります。ネットの影響は、待ち時間を短縮し、現在の音声ボットとの経験を向上させ、顧客エンゲージメントとサービス品質の革命的な時代を迎えることになります。













