ソートリーダー
RAGパイプラインがホールシネーションを続ける本当の理由

あなたもその儀式を知っているはずだ。パイプラインが顧客の前でホールシネーションしたので、埋め込みモデルを交換した。次に、LLMをアップグレードした。次に、システムプロンプトを追加して、提供されたコンテキストのみを使用するように大文字で書いた。しかしその結果、存在しないポリシードキュメントを自信を持って引用した。
あなたは良い会社の中にある。スタンフォードのRegLabとHAIの研究者が、LexisNexisとThomson Reuters (TRI ) によって販売されているAI法的研究ツールを監査したとき、RAGによって「ホールシネーションがなくなる」ことを売り文句にしていたが、ホールシネーション率は17%から34%であった。RAGは確かに役に立った。生のGPT-4はさらに多くのホールシネーションを起こした。しかし、「減少した」と「除去された」の間のギャップは、プロダクションシステムが生きている場所であり、そのギャップには構造がある。
RAGパイプラインでのホールシネーションは、1つの失敗ではなく、3つのものが共謀して起こるものである。回収がうまくいかない、モデルは答えるように訓練されている、パイプラインではその2つの事実の間のギャップを測定するものがない。モデルを交換してもこれらの問題には対処できない。
共謀者1: 回収が失敗することが多い
ここでの最新の証拠は、同時に最も不快なものでもある。2025年11月、18人の医療専門家を含むチームが、800のRAG出力に対して80,502の注釈を実際の患者とUSMLEスタイルのクエリに対して行った。標準のRAGは期待を裏切っただけでなく、事実性を最大6%、完全性を最大5%低下させた。根本的な原因は、LLMの前方にある回収の前で発生した。トップ16の回収されたパスの中で、クエリに関連するものは22%だけだった。
これを難しいドメインの問題として却下する前に、Anthropicはクリーンなキュレーションコーパスで回収の失敗を測定し、標準の埋め込み検索がトップ20の結果の中に必要なチャンクを表面化できないことが5.7%であることを発見した。1つあたり18のクエリ、きれいに整理されたデータで、特別なことが起こっていない。
これは、RAGの失敗のためのカノニカルエンジニアリング分類、Barnett et al.の7つの失敗点が、どれほど重要であるかを示している。7つのうち3つ(コンテンツの欠如、トップランクドキュメントの欠如、コンテキストの統合の失敗)は、言語モデルが1つのトークンを生成する前に発生する。Unite.AIはその分類とそれにマップする評価フレームワークについての徹底的なウォークスルーを公開しているので、ここではそれを再構築しない。ここで追加する点は、インセンティブについてである。埋め込みの類似性は関連性の代理であり、保証ではない。最近のGoogle DeepMindからの理論的研究は、単一ベクトル埋め込みには、どの組み合わせの関連ドキュメントを表現できるかについて、厳しい数学的限界があることを示唆している。ありそうもないチャンクを返す回収機は、コサイン類似性が行うことを正確に実行している。
共謀者2: モデルは推測するように訓練された
その不完全なコンテキストを言語モデルに渡し、ギャップに何をするかを尋ねる。
OpenAIは2025年9月の論文でこれに直接答えている。標準の言語モデルは推測するように訓練されている。ベンチマークは二値の精度をスコア付けしており、答えを省略すると0点となる。したがって、モデルは空白よりも自信を持って推測することを学ぶ。論文の比較はこれを具体的に示している。SimpleQAでは、1つの推論モデルは1%の時間だけ答えを省略し、75%の時間は間違っていた。一方、別の調整されたモデルは52%の時間だけ答えを省略し、エラー率を26%に減らした。
RAGのベンチマークは、パイプライン内でのインセンティブが何を意味するかを示している。 RGBベンチマークは、モデルが関連のないドキュメントだけが渡されたときに、答えを拒否するかどうかをテストした。テストされたすべてのモデルのうち、最も高い否定率は45%だった。つまり、最も優れたモデルでも、無関係なコンテキストだけが渡されたときに、半分以上の時間は答えを出していた。 ClashEvalは、逆の失敗を発見した。回収されたコンテキストが、モデルがすでに正しく持っていた知識と矛盾したとき、モデルは正しい答えを放棄し、間違ったコンテキストを選択した。信頼性は両方向に失敗し、SalesforceのFaithEvalは、より大きなモデルは必ずしもより信頼性が高いわけではないという不安定なコーダを追加した。
Anthropicの解釈可能性チームは、メカニズムを追跡した。分析によると、拒否はモデルのデフォルト回路である。認識されたエンティティ機能は、モデルが何かを認識するときに拒否を抑制する。ホールシネーションは、機能が誤動作するとき、モデルが質問の形を認識するが内容がなく、ギャップを流暢に埋めるために作話するときに発生する。
もしもあなたが、フロンティアが単にこれを成長して超越することを期待しているなら、Vectaraのホールシネーションリーダーボードは、生成が完璧に回収された場合でも、ホールシネーションが発生することを示している。リーダーボードは、モデルが直接前に置かれた単一のドキュメントを要約するという、RAGよりもはるかに簡単なタスクを測定している。2026年5月の更新時点で、GPT-4oは9.6%の要約で捏造し、Claude Opus 4は12%で捏造していた。回収が完璧に機能していても、生成はリークする。
直感的な修正は状況を悪化させる
これらすべてに直面して、ほとんどのチームはボリュームに頼る。より多くのチャンクを回収する。コンテキストウィンドウを大きくする。すべてのものを詰め込み、モデルにそれらを整理させる。
証拠は反対の方向に走っている。Chromaのコンテキスト腐敗研究は、GPT-4.1、Claude 4、Gemini 2.5を含む18のモデルをテストし、入力長が増えるにつれてパフォーマンスが「ますます信頼できない」と結論付けた。1つの妨害ドキュメントは精度を測定可能に低下させ、4つの妨害ドキュメントは精度を大幅に低下させた。以前のLost in the Middle researchは、有名なUカーブを見つけた。コンテキストの中央に埋もれた情報は、長いコンテキストを持つモデルでも無視される。上記の医療監査は、システムが16のパスを回収し、そのうち12以上が無関係であるという、エンドツーエンドのダイナミクスを示している。モデルは「私は知らない」と言うことを学んだことがない。
共謀者3: 誰もギャップを測定していない
Barnett et al.は、1行で運用上の真実を述べている。「RAGシステムの検証は、運用中のみで実行可能である。」ステージングではRAGパイプラインに署名することはできない。パイプラインの故障モードは、コーパス、クエリ、ユーザーに依存するからであるが、これらは静止したままではない。
しかし、ほとんどのプロダクションパイプラインは、エンドツーエンドの答えの品質を追跡するだけであり、これは上記の2つの共謀者を1つの説明のない数字にまとめる。標準的な分解、時々RAGトリアドと呼ばれるものは、コンテキストの関連性(回収が正しい材料を見つけたか?)、根拠(答えがその材料に従っているか?)、答えの関連性(答えが質問に答えているか?)を分離する。RAGASやTruLensなどのフレームワークがこれを実装している。厳密な調査は存在しないが、実践者の記録は、評価が「感覚」で行われていることを示唆している。ダッシュボードに回収の失敗と信頼性の失敗を区別するものがない場合、すべてのホールシネーションはモデルに問題があるように見え続け、モデルに合わせた修正を続けることになる。
実際に機能するもの
回収と生成を別々に測定する。誰もが飛ばす、しかし私の見解では最も重要なアイテム。モデルを購入することについての議論を、診断に変えるからである。如果コンテキストの関連性が悪いなら、ジェネレーターはあなたを救うことができない。如果根拠が悪いなら、回収機はあなたを救うことができない。
精度スタックを構築する。Anthropicの公開された数字は、スタックされた回収の修正の最もクリーンな実証である。コンテキストチャンクの埋め込みは、トップ20の回収の失敗を5.7%から3.7%に減らし、BM25ハイブリッド検索(ベクトル検索とキーワードマッチング)を追加すると2.9%に、ランカー(2段階目のモデル)を追加すると1.9%に達した。Unite.AIは、2段階の回収がどのように上位を打ち抜くかについて詳細に説明している。
拒否を報奨する。OpenAIの処方箋は、自信を持ったエラーを不確実性よりも罰することである。ローカルバージョンを今日実装することができる。プロンプトと「私は知らない」という回答を評価し、生成された各主張が回収されたテキストによって裏付けられていることを確認するための接続モデル(NLI)を追加する。 RAGTruthの仕事は、小さなファインチューンされた検出器がGPT-4ベースのプロンプトをキャッチすることができることを示している。
クエリを書き直し、証拠をフィルタリングする。医療監査では、クエリの書き直しと証拠のフィルタリングによって、事実性が最大12ポイント回復した。安く、退屈だが、効果的である。
エージェント回収を最後に考慮する。複数ステップの回収が、次にフェッチするものについて推論する(プライマーはこちら)ことは、実際に役立つ。ただし、遅延、コスト、そして新しい失敗モードが追加される。基盤ではなく、キャップストーンである。
モデルは最も壊れていない部分だった
最初の儀式に戻ってみよう。儀式のすべてのステップは、ホールシネーションをジェネレーターの欠陥として扱った。証拠は、ジェネレーターが訓練によって報奨されることを行ったものであり、回収機が渡した材料で、どちらが失敗したかを示すことができるメトリックによって観察されていなかったことを示している。
あなたのRAGパイプラインは壊れていない。それは従順である。インセンティブが報奨することを正確に実行している。回収と生成を別々に測定し、「私は知らない」をスコアリングカテゴリとしてではなく失敗として扱う限り、インセンティブは「推測せよ」と言っている。












