Andersonの視点

AIとのコミュニケーションで声は最も効果のない方法である

mm
Unite.AI を Google の優先ソースに追加
David Bowman (Keir Dullea) sits at a dark control console, speaking with super-computer HAL 9000, surrounded by illuminated panels, amber buttons, blue displays and rectangular light panels, in Stanley Kubrick's '2001: A Space Odyssey' (1968). Credit: MGM/Allstar

新しい研究によると、SFの最も人気のあるAIとのインターフェイス方法は、実際には、打ち間違いのあるプロンプトよりも悪い結果をもたらす可能性がある。

 

HALからDeep Thought、C3P0からWall-Eまで、人間とAIの関係の理想的な形式は常に音声制御を中心に据えてきた。これは、SiriやAlexaのような初期のアシスタントシステムから、現在の言語ベースのクエリとLLMのコロキューまで、現実の世界でも表現されている。

この考えは、タイピングが「半熟練労働」と見なされ、女性によってほぼ独占的に行われていた時代に生まれた。女性自身は、タイピングするコンテンツのオリジネーターではなかった。

力と代理権は、会議や首脳会談によって示された。したがって、複雑な言語が知能を示すと考えられていたので、話された言葉がAIの自然な媒体になることは当然だった。

他の考慮事項よりも、テキストベースのやり取りはテレビや映画に適していなかった。SFスリラーのColossus: The Forbin Project (1970)のような大胆な作品でも、コンピューターが人間の声命令に応じて書き言葉で回答することを描写しているが、すぐに完全に声での応答に切り替わる。

『Colossus: The Forbin Project』(1970) の一場面。起動直後にテキストベースの言語の境界を超え、声での応答に切り替わる巨大なスーパーコンピューターが登場する。出典: Universal Pictures

『Colossus: The Forbin Project』(1970) の一場面。起動直後にテキストベースの言語の境界を超え、声での応答に切り替わる巨大なスーパーコンピューターが登場する。出典: Universal Pictures

タイプまたは話す?

世界のトップレベルのAIモデルがユーザー向けにネイティブオーディオインターフェイスを提供しているにもかかわらず、アメリカの新しい研究は、AIに話しかけることは、特に大規模な出力が期待される場合、最も効果のない方法である可能性が高いことを結論づけた。

研究によると、話すことによって、LLMのようなChatGPTやGeminiに対して、打ち間違いのあるプロンプトやクエリーよりも悪い結果がもたらされることが分かった。

これは、話された入力が、モデルが依存する情報を除去する可能性が高いためである。話された入力は、トランスクリプションシステムによって再構成される可能性が高いためである。これは、トランスクリプションから「えー」と「みたいな」などの不快な言葉や、文法や構文の曖昧さを除去する必要があるためである。

研究者は次のように述べている:

‘話すことは、現在、ニッチなものではなく、第一級のパスである。コーディングエージェントの Claude Code や Codex は、口頭での指示を受け付ける。電話アシスタントの Google Assistant や Siri は、話されたリクエストを LLM バックエンドにルーティングする。Dictation フロントエンドの Typeless は、さらに LLM パワードのレイヤーを追加して、ユーザーの話されたリクエストをクリーンアップしてリフォーマットする。 ‘

‘各ケースで、モデルはトランスクリプトを受け取り、各ケースで、話者は送信された文字列を校正しない可能性がある。トランスクリプションパイプラインが残すもの、または書き直すものが、モデルが回答するものである。 ‘

これは、打ち込まれた入力が「ネイティブ」であるという先入観を払拭する。打ち込まれた入力は、常に何らかの方法で、秘密裏に、または公然と書き直されるからである。さらに、テキスト言語は、回答を返す潜在的な空間の中でただ一つの要素に過ぎない。

研究の実験では、普通のタイピングミスはパフォーマンスにさほど影響しなかったが、会話的な話し方、クリーンアップされたトランスクリプト、特に AI による圧縮トランスクリプトは、推論やコード生成タスクで精度の低下が大きかった。

研究は、Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations というタイトルで、サンタモニカ大学と南カリフォルニア大学の 4 人の研究者によって行われた。

(注: この研究は、通常の分析順序で「方法」と「テスト/結果」を簡単に分離できないように「方法」と「テスト/結果」を組み合わせているため、私はより厳密に圧縮して選択することを余儀なくされる。)

方法

研究者は、人間が QWERTY キーボードでプロンプトを入力したり、音声トランスクリプションシステムで話したりするときに生じるエラーをシミュレートするために、Human Input Variation Engine (HIVE) という「パートゥルベーションスイート」を開発した。

Human Input Variation Engine (HIVE) の概念スキーマ。ユーザーのプロンプトは、音声、QWERTY キーボード、または直接コピー&ペーストによって言語モデルに到達する。後者の 2 つは「クリーン」リファレンスとして機能する。色は、実装方法ではなく、入力チャネルを識別する。音声オペレーターは、ファーショット LLM スタイルの転送と決定論的ルールを組み合わせるが、キーボードオペレーターは決定論的ルールのみに依存する。右側のパネルは、入力が劣化したときにモデルが生成できる回答の範囲を示す。出典: https://www.baeldung.com/cs/dl-latent-space

Human Input Variation Engine (HIVE) の概念スキーマ。ユーザーのプロンプトは、音声、QWERTY キーボード、または直接コピー&ペーストによって言語モデルに到達する。後者の 2 つは「クリーン」リファレンスとして機能する。色は、実装方法ではなく、入力チャネルを識別する。音声オペレーターは、ファーショット LLM スタイルの転送と決定論的ルールを組み合わせるが、キーボードオペレーターは決定論的ルールのみに依存する。右側のパネルは、入力が劣化したときにモデルが生成できる回答の範囲を示す。出典: https://arxiv.org/pdf/2608.03970

HIVE は、プロンプトが言語モデルに到達する 3 つの経路をモデル化する: 音声、QWERTY キーボード、または直接コピー&ペースト (後者は変更されていないリファレンスとして機能する)。2 つの追加オペレーターは、質問とそのコンテキストを並べ替えたり、複数選択肢の回答オプションを並べ替えたりすることによって、実験コントロールとして機能する。

パートゥルベーションオペレーターは、決定論的ルールまたは Qwen2.5-7B を使用したファーショット LLM スタイルの転送によって実装される。これにより、入力方法を制御された状態で評価することができ、両方の入力方法を直接比較することができた。

テスト条件と結果

実験は、Llama-3.1-8B、Qwen2.5-7B、Qwen3-8B、Mistral-7B-v0.3、Phi-4 を使用して実行された。5 つのシードを使用して、6 つのベンチマーク (GSM8K、GSM-Symbolic、GSM1k、HumanEval、MMLU-Pro STEM、TruthfulQA MC1) が使用された。

テストセットには、各ベンチマークに 200 個のアイテムが含まれ、HumanEval の完全セットには 164 個のアイテムが含まれた。Greedy デコーディング (各時点で最も可能性の高い次のトークンを選択) を使用して、各パートゥルベーションされたプロンプトをそのクリーンなカウンターパートと比較することができ、同じモデル実行で 550,000 個の回答を生成した (17 個のプロンプト変更と 2 つのコントロールテストに対して)。

テストセット汚染 (モデルが訓練中に見たデータとテストセットの重複) を防ぐための措置が取られた:

研究で使用されたフルパートゥルベーションスイート。音声トランスクリプション変更、QWERTY キーボードエラー、コントロールテストに対する精度の変化をクリーンプロンプトと比較して示す。最初の行はクリーンなベースライン精度を示し、後の行はパーセントポイントの変化を示す。赤は各ブロックと列で最も被害の大きいオペレーターを示し、青は最も被害の少ないオペレーターを示す。

研究で使用されたフルパートゥルベーションスイート。音声トランスクリプション変更、QWERTY キーボードエラー、コントロールテストに対する精度の変化をクリーンプロンプトと比較して示す。最初の行はクリーンなベースライン精度を示し、後の行はパーセントポイントの変化を示す。赤は各ブロックと列で最も被害の大きいオペレーターを示し、青は最も被害の少ないオペレーターを示す。

研究の最も明確な結果は、音声入力がキーボード入力よりもテスト条件全体でモデル精度を大幅に低下させることである。特に、コードなどの大規模な出力が期待される場合、話されたリクエストは、自動的にクリーンアップされてよりコンパクトになることが多く、モデルが受け取るリクエストの構造が変化することが多いためである。

これは重要である。話された入力の悪い結果は、明らかな「話し手のごみ」によって引き起こされるのではない。例えば、「えー」や「みたいな」などのフィラーは、クリーンな書き言葉のプロンプトに追加すると精度が低下するが、話されたトランスクリプトからフィラーを除去しても、パフォーマンスは回復しない。

自己保存

問題は、話されたプロンプトが、モデルに到達する前に再構成される方法にあった。

研究の中心的な質問は、モデルがユーザーの意図を再構築するのに十分な情報を受け取るかどうかだった。

タイピングエラーの場合、単語の「表面」が損なわれることがあるが、周囲のコンテキストが何を意味したかを推測するのに十分な情報が残る。話されたプロンプトをクリーンアップすると、ユーザーのオリジナルのフレーズが、事実間の関係を維持しない短くスムーズなバージョンに置き換えられることがある。

これは、キーボードエラーが比較的無害である理由である。研究者は、入れ替わった文字、繰り返された文字、スペースのない文字、隣接するキーのミスが、元の単語の多くを回復可能な状態で残すことが多いことを発見した。一方、音声のクリーンアップは、モデルが解釈する前に情報を除去または再構成することが多かった。

翻訳で失われるもの

研究で取り上げられた、話されたプロンプトがユーザーから LLM への旅の途中で「失われる」方法の 1 つは、文「彼女は子供たちに等しい数の[本]を与えた」という文が、金銭を意味する「金額」という言葉に「本」という言葉が置き換えられるというものである。この場合、単語「金額」は参照先から切り離され、最も一般的な関連付け (金銭) に誤って適用される。

各入力変更で、元の質問のどれだけが残るか。大きい点は個々のパートゥルベーションの種類を示し、小さい点は同じキーボードエラーのより強いバージョンを示す。

各入力変更で、元の質問のどれだけが残るか。大きい点は個々のパートゥルベーションの種類を示し、小さい点は同じキーボードエラーのより強いバージョンを示す。

この効果は、モデルが事前に用意された選択肢から答えを選択するのではなく、プロンプトから答えを構築する必要がある場合に最も強かった。算術やコード生成タスクは、リクエスト内の正確な関係を維持する必要があるため、損傷を受けやすかった。一方、多肢選択テストは、損傷を受ける可能性が低かった。

研究者は次のように結論付けた:

‘話すことは、コストの高いチャネルであり、損傷がコストを支払うものであり、テストセット汚染や軽量アダプテーションが損傷を説明または修復しないことを発見した。 ‘

‘いくつかの結論が導かれる。タイピングすると、推論モデルはエラーを吸収する。話すと、モデルはそうしない。話すと、話したフレーズがモデルが作業するフレーズになる。 ‘

‘そして、話しかけツールを構築する場合、ユーザーが話したことを書き直したり、再構成したりしない。ディスフルエンシーを最小限に抑え、同音異義語をそのままにしておく。 ‘

‘最後の点は最も重要である。なぜなら、話しかけフロントエンドは、モデルに到達するためのデフォルト方法になりつつあり、その書き直しレイヤーは私たちが測定する被害の中で最も大きいものであり、最も変更が容易であるからである。 ‘

結論

誰もが、インタビューを手動で書き起こすこと (AI の前の時代に、ジャーナリストがよく経験する孤独な苦労) のように、話しかけることで、ディスフルエンシーを無視し、意味を計算することを自動的に行うことができることを知っている。特定のケース (例えば、話し手が非常に明確に話しているか、または単にいつもの物語を繰り返している場合) を除いて、有用な トランスクリプションは、解釈の行為であり、文字通りの、母音の完全な文字起こしよりも、話者の意図を表現するテキストになることが多い。

また、音声へのブリッジは、テキストの同等のものと同じ意味を得ることができないことを示唆することも興味深い。後者の点は、テキストベースのやり取りが、現在の AI システムで最も効果的な方法であることを示唆している。

将来的には、さらに研究と (希望的に) 大規模なデータセットが、研究で示されたギャップを埋めるのに役立つ可能性がある。ただし、現在の研究は、AI との音声コミュニケーションは、消費者レベルの「アシスタント」システムで特徴的な短いコマンドに適していることを示唆している。

 

2026 年 8 月 12 日に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai