AIの基礎
あなたのバイオメディカルRAGが矛盾を隠している理由

標準的なバイオメディカルRAGは、約4分の3のクエリで矛盾する証拠を黙って解決します。解決策は構造的なものであり、ほとんどのアップストリームの複雑さは役に立たないです。
リトリーバル増強型臨床アシスタントに質問をしてみましょう — メラトニンは時差ぼけに役立ちますか? — リトリーブされた文献は自らが一致しません。
コクランレビュー は、メラトニンは非常に効果的であると結論付けた。10件の試験のうち8件で、5時間帯以上の飛行での時差ぼけが軽減された。アメリカンジャーナルオブサイキアトリーの ランダム化二重盲検試験 は、257人のノルウェー医師を対象に行われ、3つのメラトニン療法のいずれも有益ではなかった。
両方のドキュメントは実在し、方法論的にも真剣です。どのドキュメントも、臨床医が何を推奨するかを決定するために、両方のドキュメントが一致しないことを知る必要があります。
制御されたテストでは、通常、シンセシスはそうではありませんでした。シンセシスは、矛盾のない側に立って、矛盾のある側が存在することを示すことはありませんでした。
これは矛盾盲目です。矛盾のペアを伴うバイオメディカルベンチマークでは、 72.6パーセントのクエリ (95%CI 0.697–0.755) で発生しました。出力は正常に読み取れました。引用は正しく解決しました。標準の品質チェックはパスしました。ただし、矛盾は消えました。
成功に見える失敗モード
バイオメディカルに関連する証拠には直接的な収束がないため、観察研究とランダム化比較試験(RCT)を使用した研究結果は矛盾し、さまざまな方法論が使用され、患者集団も異なります。ただし、1つの研究では強い方法論と弱い方法論の両方が含まれる可能性がありますが、同じ重みを持つように見えます。
これはユニークなケースではありません。 イオアニディスの分析 は、高く引用された臨床研究を調査し、16パーセントの最も引用された研究が後に完全に矛盾していると結論付けた。また、観察研究はランダム化比較試験よりも矛盾したり、効果が下方修正されたりする可能性が高かった。つまり、問題は研究間の矛盾ではなく、文献自体の構造的な部分です。
したがって、バイオメディカルのリトリーバル増強型生成システムの重要な機能として、研究間の矛盾についての証拠を生成することが第一の目標となります。しかし、ほとんどのシステムはこのタスクを達成できません。 HealthContradict ベンチマークの920の矛盾のペアの例では、標準的なリトリーバル増強型生成(RAG)が約73パーセントのテストペアで矛盾を生成できなかったことが示されました。問題はリトリーバルではありません。システムは両方の側面をリトリーブします。ただし、矛盾を黙って解決します。
手動検査により、50件の分類された失敗ケースから、 認識論的平坦化 というパターンが見つかりました。両方のドキュメントは個別にモデルによって引用され、矛盾のレンダリングは矛盾がないかのように、信頼性グラデーション(「逸話的な証拠… 科学的研究は示唆する…」)で説明されます。5パーセント以下の失敗ケースで、矛盾、対立、または意見の相違という言葉が使用されていました。生成された出力の引用精度は0.99でした。つまり、 引用精度は矛盾の認識を意味しない ことです。システムはすべての文を正しく属性化していても、証拠ベースに裏付けられていないことを臨床医に伝えることができます。
RAGの「シンセシス」には、危険な臨床環境を作り出す3つの特徴があります。
価値提案の逆転。 RAGの目的は、臨床医にとって関連する証拠を表示することです。したがって、証拠の最も重要な側面を削除することで、実際にはその逆のことを達成します。
不可視化。 ヘッジ、トリューキャット、フォーマットアーティファクトがないため、「平坦化された」シンセシスと忠実なシンセシスは画面上で区別できません。
サイレントコンパウンド。 標準的な評価スイートでは、フラグが立たないため、システムは生産環境で数ヶ月間実行され、すべての矛盾したクエリが静かに一方向に解決されます。
情報はレバーではない
この問題に対する明らかな解決策は、モデルに情報を提供することです。明らかに、モデルが2つのドキュメントが矛盾していることを識別できない失敗モードの場合、「SUPPORT」または「CONTRADICT」のスタンスラベルを各リトリーブドドキュメントに追加することで、パフォーマンスを向上させることができます。しかし、実際にはそうではありませんでした。
スタンスラベルを付与してモデルに矛盾する情報を明示的に提供する実験では、矛盾盲目は93.8パーセントから91.4パーセントに移動しましたが、信頼性の間隔は重なり、実用的な意味はありませんでした。モデルは矛盾する情報を受け取ったにもかかわらず、デフォルトのレスポンス分布は変わりませんでした。
メカニズムを理解することはここで役に立ちます。プロンプトにパッシブに追加された情報は、モデルのデフォルトのレスポンス分布を変更しません。矛盾を含むバイオメディカルな質問の場合、分布は強く1つの統合された立場を支持します。スタンスラベルはトークンになりますが、セクションの見出しにリサイクルされることが多く、文章は元に戻ります。
構造はレバーである
何が機能したかというと、構造的なものでした。情報ではなく、モデルに矛盾の可能性について構造化されたシンセシスを構築する必要がありました。スケルトンプロンプトはモデルに、アンノテーションされていないコントロールと同じ情報しか提供しません。唯一の違いは、モデルが何をしなければならないかです。
矛盾盲目は約 19倍 減少しました (93.8パーセントから4.9パーセント)。再トレーニング、パイプラインの変更、待ち時間の増加、クエリごとのコストの増加はありませんでした。
これは改善された推論ではありません。これは単に強制された割り当てです。モデルが矛盾セクションを提供しなければならない場合、最初にリトリーブしたドキュメントを再検索して、矛盾セクションに含めることができるものを探します。

制御された消去実験における矛盾盲目。スタンス情報を追加すると、レートは2.4ポイント移動しましたが、出力構造の変更は86.5ポイント移動しました。
構造化プロンプティングは、モデルの推論能力を高めることよりも、モデルの生成動作が出力空間をどのように割り当てるかを制御することについてです。モデルは矛盾についての出力空間を割り当てることを強制します (利用可能な情報と、要件を満たすために表示される必要がある情報の違い)。
これは一般的なアーキテクチャの仮定を変えます。ほとんどの提案されたRAGの強化は、コンテキストに情報を追加します: ドキュメントの追加、リランキングスコア、スタンスタグ、エビデンスグレードのメタデータ。しかし、シンセシスプロンプトがその情報を出力構造に形成するための特定の要件がない限り、ほとんどのモデルは動作を変えません。 入力の変更は端で質量を変えますが、出力構造の変更は直接分布を変えます
期待されるヘルパーが役に立たない理由
矛盾に気づくバイオメディカルRAGのための2つの要素は、テストされた制御された消去ではほとんど役に立たないことがわかりました。
1) PICO分解。 PICO (人口、介入、比較、結果) は、エビデンスベースの医学で使用するために、臨床的な質問を構成要素に分解するための組織化された方法です。仮説は、PICOフィールドに要求を分解することで、スコープドリフトを制限し、矛盾の検出を改善できるというものでした。しかし、このレベルの削除は、生成された出力がほぼ完成したシステムと同じでした。PICOは臨床的な意思決定の際に思考を整理するのに役立つかもしれませんが、分析時の矛盾検出をサポートするための推論入力としては、測定可能な貢献はありません。
2) 明示的なスタンス分類。 PICOの削除とは対照的に、明示的なスタンス分類はパフォーマンスが低かったが、異なりました。クリーンな学術コーパスでは、一部のメトリックで小さな利点をもたらしました。しかし、ノイズの多いWebテキストを分析すると、ほとんどのドキュメントで「十分な情報なし」という結果が返されました。主に、消費者向けヘルスケアコンテンツの著者は、分類器が期待する宣言的な言語を使用して立場を表明しないからです。したがって、ラベルはノイズとしてシンセシスコンテキストに伝播されました。ノイズの多いコーパスでの段階の削除は、矛盾の検出をわずかに改善しました。
ボトルネックはアップストリームのシグナル品質である
この研究の最も重要な結論は、ソースの矛盾を認識する能力が、ソースについての情報の正確さによって制限されるということです。それは、ソースがどのように構築されたか、またはどのように構造化されたかよりも、はるかに重要です。
エビデンス品質の利用 — シンセシスが利用可能な場合に、より高い品質のソースを優先的に引用するケースの割合 — は、 クリーンな科学的要約では0.83でしたが、ノイズの多いWebリトリーブでは0.15以下 でした。シマンティックな引用の忠実性も、要約では0.66から、消費者向けヘルスケアコンテンツでは0.45まで同じパターンに従いました。

同じパイプライン、異なるコーパス。矛盾の処理は、ソースドキュメント内のシグナルの明示性によって上限が決まります。
現実世界のリトリーブドドキュメントは、分類器や重み付けメカニズムが依存するキューや、明示的なスタンス声明、方法論の説明などのメタデータが欠けていることがよくあります。ピアレビュー記事の要約は、特定の集団、方法論、結果について断言しています。一方、消費者向けのヘルスケア記事では、逸話的、説得的、ヘッジング言語が使用され、同じ断言が行われます。したがって、同じシステムは、入力として受け取るものに基づいて、ダウンストリームで劇的に異なる動作を生み出します。
これは、 18人の医療専門家が80,502の注釈を寄稿した、公開された医療RAGに関する最大の専門家評価 でも支持されています。トップ16のリトリーブドパッセージのうち、22パーセントだけが関連性がありました。標準RAGは、RAG以外のベースラインと比較して、事実性と完全性を低下させました。リトリーバルとエビデンスの選択は、生成ではなく、主な失敗点でした — これは、医療RAGに関するベンチマーク研究が2年間報告してきたものです。
この発見の応用における限界は比較的少ないですが、結論としては、PubMed要約からリトリーブするシステムの矛盾を処理する能力は、消費者向けのWebサイトでは転送できないと結論付けることができます。どれほど高度なシステムであっても。
評価の盲点
矛盾の処理を測定することは、思ったより難しいです。矛盾の処理を測定するための標準的なアプローチには、独自の問題セットがあります。
LLM-judgeスコア は、オープンエンドのRAG出力を矛盾の処理のためにスコアリングする最も一般的な方法ですが、構造的な認識チェックとは異なります。PICOフィールドにシンセシスを組織するプロンプト戦略は、ジャッジから高いスコアを獲得しますが、明示的な認識テストに完全に失敗します。これは予想どおりです。LLMジャッジは、より長く、より詳細な回答を好みます。また、結果セクションに埋もれた注意書きを徹底性と見なしますが、文章レベルでは矛盾に触れていません。
リトリーバル戦略は2番目の落とし穴を導入します。ランダムリトリーバルは矛盾盲目のレートを0にします。シンセシスは、リトリーブセットに矛盾がない場合、矛盾を認識することができません。 最大の周辺関連性 のリトリーバルは、シマンティックな引用の忠実性を0.11まで低下させました。どちらも、1つの矛盾の処理メトリックの下では受け入れられるように見えますが、ペア評価の下では不足しています。
したがって、メトリックをペアにします。 各シンセシスに対して3つのチェックを実行します。矛盾を認識する言語を表現する構造的なチェック、深さとバランスのためのLLMジャッジ、および引用されたコンテンツがソースと一致することを確認するシマンティックな引用チェック。各メトリックは、他のメトリックが見逃すものを特定します。どれも、矛盾の処理のベンチマークとしては、信頼できるものではありません。
今このクォーターに行う4つのアクション
- ベースラインをテストします。 生産環境にあるすべてのバイオメディカル、臨床、規制RAGシステムは、さらに展開する前に矛盾盲目のテストを受ける必要があります。テストを実行するには、矛盾のペアを伴うテストセットと、出力が実質的な意見の相違を示すクエリごとのチェックが必要です。72.6パーセントのベースラインは丸め誤差ではありません。
- 構造化されたシンセシスプロンプトを実装します。 4つのセクション(合意、不一致、エビデンス品質、結論) — 出力帯域幅を不一致に強制します。新しいインフラストラクチャは必要ありません。トレーニングは必要ありません。クエリごとのコストは増加しません。1つの変更で19倍の減少が見られました!
- 矛盾に敏感なクエリに対してMMRリトリーバルを使用しないでください。 MMRはトピックカバレッジのために多様化されたドキュメントを使用しますが、立場のカバレッジを最適化しません — これは、矛盾の両側をリトリーブすることを目的とする場合、不正解です。したがって、bm25プラスエンベッディングリトリーバルをデフォルトとして使用する必要があります。ただし、立場を認識した多様化は、この研究が向いている方向です。
- 評価メトリックをペアにします。 単一のLLMジャッジスコアを廃止します。構造的なチェックとシマンティックな引用チェックを組み合わせて、認識されたコンテンツの下にある実質的なコンテンツを検証します。
より広い視点
RAG開発の支配的な直感は、加算的なものです。より優れたリトリーバー、より優れたリランキング、より豊富なメタデータ、より長いコンテキストウィンドウ。RAGパイプラインが生産環境でまだ失敗する理由についての業界の議論も、同じ形をとっています。矛盾の処理の場合、有効な動きは減算的なものでした。システムが生成できるものを制限するのではなく、システムが何を生成できるかを制限しました。4つのパートからなる単一のシンセシスプロンプトが5段階のパイプラインを上回りました。それは、モデルが何を生成できるかではなく、モデルが何を生成しなければならないかを変更したからです。
これはアーキテクチャの重要性を低くしません。リトリーバルは上限を設定し、ランダムリトリーバルはシンセシスを無意味にし、エビデンス品質の低さはすべてのダウンストリームの処理を制限します。これは、RAGシステムが信頼性の問題を解決するかどうかという疑問が再浮上する理由です。ただし、矛盾する証拠が矛盾しているとして表現されるかどうかを決定するのは、パイプラインの後の方で、変更が容易なコンポーネントです。したがって、信頼性を向上させるために必要な変更は、他のコンポーネントよりも早く行うことができます。
高価な作業 — 矛盾のあるデータセット、明示的な矛盾トレーニングシグナル、立場を認識したリトリーバル、矛盾に特化したベンチマーク — はまだ必要です。これには、はるかに長い時間がかかります。
したがって、あなたのシステムが矛盾する証拠を矛盾として表現するかどうかを知りたい場合は、この週に自分自身に不快な質問をして、答えを見つける必要があります: あなたのシステムは、証拠が矛盾することをユーザーに通知しますか?












