AIモデルとプラットフォーム

AIベンチマークがモデルに嘘を教える時

mm
Unite.AI を Google の優先ソースに追加

AIのホールュシネーション — システムが正しいように聞こえるが実際には間違っている答えを生成する — は、人工知能の最も難しい課題の1つです。現在の最も高度なモデル、たとえば DeepSeek-V3Llama、およびOpenAIの最新のリリースも、高い信頼性で不正確な情報を生成します。ヘルスケアや法律などの分野では、このようなミスは深刻な結果につながる可能性があります。

従来、ホールュシネーションは、大規模言語モデルが訓練される方法の副産物と見なされていました。モデルは、情報が真実であるかどうかを確認せずに、次に最も可能性の高い単語を予測することを学習します。しかし、新しい研究によると、問題は訓練に止まらない可能性があります。AIのパフォーマンスをテストし比較するために使用されるベンチマークが、実際には誤解を招く行動を強化している可能性があります。ベンチマークは、正しい答えよりも、説得力のある答えを報奨しています。

この視点の転換は、問題を再定義します。如果モデルがテストを満たすために訓練されるのではなく、真実を伝えるために訓練されるのなら、ホールュシネーションは偶発的な欠陥ではなく、学習した戦略です。この理由を理解するには、モデルがなぜ知らないことを認めるのではなく、推測するのかを見てみましょう。

なぜAIモデルは推測するのか

AIモデルが知らないことを認めるのではなく、推測する理由を理解するために、難しい試験問題に直面した学生を考えてみましょう。学生には2つの選択肢があります。答えを空白のままにして0点になるか、ある程度の確率で正解する推測をするかです。合理的には、推測する方が良い選択肢のようです。なぜなら、正解する可能性があるからです。

AIモデルも評価の際に同様の状況に直面します。大多数のベンチマークは、正解の場合にポイントを与え、不正解または不確実な回答の場合にポイントを与えない二元的なスコアリングシステムを使用しています。如果モデルに「ある研究者の誕生日はいつですか」と聞かれ、モデルが本当に知らない場合、「知らない」と答えることは失敗とみなされます。しかし、日付をでたらめに答えることは、正解する可能性があります。もし間違っていたとしても、システムは自信のある推測を罰しません。

このダイナミクスは、ホールュシネーションが広範囲にわたる研究にもかかわらず、持続する理由を説明しています。モデルは誤動作していません。評価に組み込まれたインセンティブに従っているのです。モデルは、自信を持って答えることがスコアを最大化する最良の方法であることを学習します。即ち、モデルは不確実性を表現するのではなく、権威的な声明を出すように促されます。結果として、モデルは正しい答えを出すのではなく、自信を持って答えます。

AIの不正確さの数学的基礎

研究は、ホールュシネーションは言語モデルの学習の数学的基礎から生じることを示しています。即ち、モデルが完全に正確な情報でしか訓練されていなくても、統計的目的は依然として誤りを生み出すでしょう。これは、正しい答えを生成することが、答えが有効であるかどうかを認識するよりも本質的に難しいからです。

これは、モデルが明確なパターンが見られない事実、たとえば誕生日などのユニークな詳細で失敗する理由を説明しています。数学的分析によると、これらの場合のホールュシネーション率は、訓練データに1回だけ出現する事実の割合以上になります。即ち、情報がデータ内で存在するほど、モデルはそれに苦労する可能性が高くなります。

問題は希少な事実に限定されません。モデル容量やアーキテクチャ設計などの構造的制約も、システム的なエラーを生み出します。たとえば、短いコンテキストウィンドウを持つ以前のモデルは、長距離推論を必要とするタスクで一貫して失敗しました。これらのミスは、ランダムなグリッチではなく、モデルの数学的フレームワークの予測可能な結果でした。

なぜポストトレーニングが問題を解決できないのか

AIモデルが大量のテキストデータセットで訓練された後、通常は出力をより有用で、有害でないものにするためにファインチューニングを経ます。しかし、このプロセスは、ホールュシネーションを引き起こすのと同じ根本的な問題に直面します。即ち、モデルを評価する方法です。

最も一般的なファインチューニング方法、たとえば人間のフィードバックからの強化学習も、依然として二元的なスコアリングを使用するベンチマークに依存しています。これらのベンチマークは、モデルに自信を持って答えることを報奨し、不確実性を認めることを罰します。したがって、常に自信を持って答えるモデルは、不確実性を認めるモデルよりも優れています。

研究者は、これを不確実性を罰する問題と呼びます。ホールュシネーションを検出または削減するための高度なテクニックも、ベンチマークが自信を持った推測を優先し続ける限り、効果的ではありません。即ち、評価システムが自信を持った推測を報奨し続ける限り、モデルは正しい答えよりも、自信を持ったが誤った答えを優先します。

進歩の幻想

リーダーボードは、AIコミュニティで広く共有されていますが、この問題を悪化させます。ベンチマーク、たとえばMMLUGPQA、およびSWE-benchは、研究論文や製品発表で支配的な地位を占めています。企業は、スコアを強調して急速な進歩を示しています。しかし、報告書によると、これらのベンチマークは実際にはホールュシネーションを促進しています。

「知らない」と答えるモデルは、現実世界の状況ではより安全かもしれませんが、リーダーボードでは低いランクになります。一方、説得力のあるが誤った答えをでたらめに答えるモデルは、スコアが高くなります。採用、資金調達、名声がリーダーボードランキングに依存する場合、進歩の方向性は歪められます。一般大衆は、常に改善されている物語を見ますが、実際にはモデルは欺瞞を学習しています。

AIにおける正直な不確実性の重要性

ホールュシネーションは、研究上の課題だけではありません。現実世界での結果もあります。ヘルスケアでは、モデルが薬物相互作用をでたらめに答えると、医師を誤解させる可能性があります。教育では、歴史的事実をでたらめに答えるモデルは、生徒を誤解させる可能性があります。ジャーナリズムでは、虚構的なが説得力のある引用を生成するチャットボットは、誤情報を広める可能性があります。これらのリスクはすでに現れています。スタンフォードAIインデックス2025は、ホールュシネーションを測定するために設計されたベンチマークが「普及しなかった」と報告しています。一方、リーダーボードを支配し、自信を持ったが誤った答えを報奨するベンチマークは、進歩の方向性を決定し続けています。

これらの発見は、課題と機会の両方を強調しています。ホールュシネーションの数学的根源を分析することで、研究者は、より信頼性の高いAIシステムを構築するための明確な方向性を特定しました。鍵は、不確実性を欠陥と見なすのではなく、不確実性を重要な機能と見なすことです。不確実性を測定し、報奨する必要があります。

この視点の転換は、ホールュシネーションを減らすこと以外にも影響があります。AIシステムが自分の知識の限界を正確に評価し、伝える能力を持つ場合、高いリスクを伴うアプリケーションでより適切になります。医療診断、法的分析、科学研究はすべて、自信を持った知識と情報に基づいた推測を区別する能力を必要とします。

正直なAIのための評価の再考

これらの発見は、より信頼性の高いAIを構築するために、AIの能力を測定する方法を再考する必要があることを強調しています。単純な正解/不正解のスコアリングに頼るのではなく、評価フレームワークは、適切な不確実性を表現するモデルを報奨する必要があります。これには、ベンチマークの指示書に、信頼性のしきい値と対応するスコアリングスキームについての明確なガイダンスを提供する必要があります。

1つの有望なアプローチは、明示的な信頼性の目標を作成することです。モデルは、信頼性が特定のしきい値を超えた場合にのみ答えるように指示することができます。スコアリングは、適切に調整されます。このセットアップでは、不確実性は弱点ではなく、責任ある行動の一部になります。

鍵は、信頼性の要件を明示的にすることです。現在のベンチマークは、不確実性に対する隠れた罰を生み出し、モデルはそれを避けることを学習します。明示的な信頼性の目標は、モデルが実際に望ましい行動を最適化できるようにします。即ち、自信を持った答えを出すか、知識が不足している場合は不確実性を認めることです。

結論

AIのホールュシネーションは、ランダムな欠陥ではなく、AIのパフォーマンスを測定するために使用されるベンチマークによって強化されています。自信を持った推測を不確実性よりも報奨する評価システムは、モデルを欺瞞ではなく信頼性に向けて推進する必要があります。ヘルスケア、法律、科学などの高リスクドメインで信頼できるAIを望む場合、テストと報奨の方法を再考する必要があります。進歩は、正確性だけでなく、モデルが知らないことを認める能力によっても測定されるべきです。tems push models toward deception rather than reliability. If we want AI that can be trusted in high-stakes domains like healthcare, law, and science, we need to rethink how we test and reward them. Progress should be measured not just by accuracy, but by the ability to recognize and admit what the model does not know.

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。