Andersonの視点
ルールベース vs. RAG: インフレーションが政策ドライバーとして

ほとんどの場合、ウェブを検索することで、ChatGPTの回答の事実的正確性を向上させることができます。そこで、AIが一般受けを得るのに苦労している状況では、なぜ「推測」に頼るのでしょうか?
意見 LLMs(ChatGPTなど)がホストの潜在的に不正な行為について内部告発することはない、というのは間違いです。コストのかかるセッションがシステムの欠点について十分に調査するのに十分な怒りをもたらしたとしても、

ここでは、ChatGPTの内部ロジック(RAGによるウェブベースの研究と検証に比べて)を好むという議論が、明らかな率直さの瞬間をもたらすようですが、塩をひとつまみ加えるように受け取りましょう。 出典
ほとんどの場合 — 特に知識カットオフ日が後のモデルについては — AIは単に訓練中に見たRedditやフォーラムの投稿について即興で話しています。もし本当に「内部情報」のようなものに価値があったとしても、それを証明することは不可能です。
しかし、時にはこれらの熱いやり取りは、LLMの最悪の繰り返し習慣を防ぐ「ハック」(または少なくとも「トリック」)の発見につながります。例えば、先週、ChatGPTは私に、ハルシネーションを減らして、より効果的に働くようにすることができることを示唆しました。つまり、‘推測なし’という言葉を含めることです。

その後、私は‘推測なし’という言葉を多く使用しましたが、ChatGPTはその後、質問を閉じた後にそのコマンドで訓練された知識に頼ることは一度もありませんでした。代わりに、GPTはすぐにRetrieval Augmented Generation(RAG)を使用して、インターネットを照会し、照明または裏付けとなる文書を探しました。
実践的には、ほとんどのリクエストについては、これはシステムに「ウェブを検索する」ということを毎回依頼することとあまり異なりません。ただし、本当に役立つのは、ChatGPTが新しくアップロードされたPDFを実際に読むのではなく、セッション中またはそれ以前のPDFアップロードのメタデータを使用して「妥当」だが完全にハルシネーションされた回答を生成することを防ぐときです。

しかし、チャットセッションが長くなるほど、この方法が機能する可能性は低くなります。システムが進化するにつれて、このような「トリック」が信頼できるものであると考えることは誤りです。
RAGトレード
成長する文化とインフレーションの状況において、大規模なシステムであるOpenAIのGPTインフラストラクチャは、広範囲にわたる行動の変化に大きく影響を受けるため、RAGを使用するかどうかについての決定は、ChatGPTのような人気のLLMにとって重要なものとなります。
たとえば、RAGを使用するか、思考連鎖プロセスを開始するか(これはより良い結果をもたらす可能性がありますが、より高価で、ユーザーを疲れさせる可能性があります)、または最も安価で迅速な解決策である、自分の訓練された埋め込みとローカルに利用可能な知識に頼るかという選択があります。
実用的には、LLMに敏感なパブリックイメージがある場合(たとえば、ChatGPTの場合)、RAGの呼び出しを制限し、代わりに自分の推測を好む理由がいくつかあります。まず、PRの観点から見ると、頻繁に促されないウェブの使用は、LLMが単なる「Googlers-by-proxy」という一般的な特徴を支持し、有料サブスクリプションの価値と魅力を低下させます。
二つ目は、RAGインフラストラクチャを実行、維持、更新するコストがかかることです。これは、ローカル推論(パラメトリック生成)の比較的軽微なコストと比較されます。
三つ目は、システムがRAGによって自分の推測結果を改善できるかどうかを判断する効果的な方法がないことです。システムは、推測を最初に実行せずにこれを判断することはできません。これにより、ユーザーは不完全な推測結果を評価し、結果が不十分である場合はRAG呼び出しを要求するというタスクが残ります。
AIの「インフレーション」から見ると、ChatGPTが推測によってエラーを起こし、RAGによって成功する回数は、システムが結果よりもコストを優先していることを示している可能性があります。
RAGは時間の経過とともに必要になる
ChatGPTの「告白」にもかかわらず、「インフレーション」はこの点ではより広い文脈を持っています。RAGは安くない(遅延やリソースの観点から)ものの、基礎モデルを定期的に微調整すること、または再訓練することよりもはるかに安価です。
知識カットオフ日が遠いAIモデルについては、RAGはシステムの通貨を維持するために役立ちます。ネットワーク呼び出しやその他のリソースのコストでです。新しいモデルについては、RAGの取得は冗長または有害である可能性があります。いくつかの場合、推測によって結果が良かった可能性があります。
したがって、AIはRAGを使用するかどうかを判断する能力だけでなく、内部の重みが古くなってくるとRAGの使用に関するポリシーを継続的に進化させる必要があります。
同時に、システムは「相対的な定数」を知識に囲い込む必要があります。たとえば、月の軌道、クラシック文学、文化、歴史、基本的な地理、物理学、または科学の他の原則などは、時間の経過とともに大幅に変化する可能性は低い(「突然の変化」のリスクはゼロではないが、低い)からです。
外れ値トピック
現在、少なくともChatGPTの場合、RAG呼び出し(ユーザーが明示的にまたは暗黙的にウェブの研究を要求しない場合のウェブの研究の使用)は、自動的にシステムによって選択されることはまれです。特に「周辺」サブドメインを扱う場合です。
「周辺」ドメインの例としては、「オブスキュア」なソフトウェアの使用があります。このような場合、利用可能なソースデータは訓練中に注目に苦労し、データの「外れ値」状態は注目されるか、または「周辺的」または「無関係」として埋もれます。ただし、AIの知識カットオフ日以降に作成された1つの追加のフォーラム投稿は、「小さな」トピックの利用可能なデータと応答の質に大幅な改善をもたらす可能性があり、RAG呼び出しは有益です。
しかし、RAGの利点は、ベースモデルが強力になるにつれて縮小します。小さなモデルは回収から大幅に利益を得ますが、大規模なシステム(Qwen3-4BやGPT-4o-mini/-4oなど)は、RAGからほとんど、またはまったく改善を示しません。
多くのベンチマークでは、回収は利益よりも混乱をもたらします。つまり、大きなモデルに投資するか、回収と組み合わせた小さなモデルに投資するというトレードオフがあります。
したがって、RAGは「中規模」のモデルを補うのに最も役立つようです。これらのモデルは外部の事実が必要ですが、内部の推測が複雑ではありません。
緊急時のみ使用
ChatGPTのRAGを使用するためのガイドラインは、システムプロンプトによって明示的に公開されていませんが、暗黙的に最後に取り上げられています。
‘ウェブツールを使用して、ウェブからの最新情報にアクセスするか、またはユーザーのロケーションに関する情報が回答に必要な場合に使用します。ウェブツールを使用する例としては、次のものがあります。
ローカル情報: ユーザーのロケーションに関する情報が必要な質問(天気、ローカルビジネス、イベントなど)に回答するために、ウェブツールを使用します。
新鮮さ: トピックに関する最新情報が回答を改善する可能性がある場合、または自分の知識が古くなっている可能性がある場合は、ウェブツールを呼び出します。
ニッチ情報: 回答が詳細な情報(インターネットで見つけることができる)から利益を得る場合(小さな近隣、知られていない会社、またはアーケード規制など)、ウェブソースを直接使用します。
正確さ: 古くなった情報や小さなミスのコストが高くなる場合(古くなったソフトウェアライブラリを使用したり、スポーツチームの次の試合の日付を知らない場合など)、ウェブツールを使用します。
特に、ネイティブトレーニングデータが不足している場合に、RAGを推奨するこれらの指示に注目できます。しかし、システムはこの理解に到達する方法は何でしょうか。
カジュアルユーザーとChatGPTの観察者は、ウェブを検索するウィジェットが一時停止後に表示される場合、モデルの内部推測が質問に対して空で返ってきたと結論付けるかもしれません。
結論
現在および最近の研究の傾向は、推測生成が速くて安価ですが、頻繁に誤りを犯し、RAGは遅くて高価ですが、頻繁に正確であることを示しています。モデルサイズが小さくなるにつれて、RAGはより重要になります。
私自身のChatGPTの使用に基づいて、OpenAIはRAGをあまりにもまれに使用していると主張します。特に、コンテキストウィンドウの成長に関する問題により、長い会話が発展するにつれてLLMがハルシネーションを起こす可能性が高くなっているため、毎日のドライバーとしてではなく、精度ツールとして使用しています。
これは、内部の結果が明らかに不十分である必要はなく、ユーザーが出力を疑う必要もなく、ウェブベースの権威のある情報源に対して推測的な回答を確認することで、明らかに不十分な結果になることを待たずに、システムが緩和して賢く自分自身を疑うことができるようにすることで、著しく軽減できます。
代わりに、システムはケースごとに選択的に賢く自分自身を疑うことができ、RAGを介してウェブと関わるプロセスが、自己推論になる可能性があります。現在のモデルアーキテクチャがこのようなアプローチのスペースを残していることを私は知りません。これは、APIフィルタの摩擦に追加される必要があります。
現状、問題があることを証明することさえできない。

* この段落の上部にあるリンクを参照してください。
** このGPT-5システムプロンプトは「自己暴露」型であり、GPT-5のための再訓練されたプロンプトフォーラムのダイジェストである可能性がありますが、一部の人はこれが本物であると主張しています。
† 私は、ChatGPTの「有罪の率直さ」がここで意味のあるものであると示唆しているのではない。OpenAIの政策に関する問題で、私の党の路線に反対する傾向があるため、最終的に私と同意し、私の暗黙の意見を繰り返すことになる。これは、圧力の下でノルマンディー上陸作戦の詳細を話すこととは遠く異なることです。
初版 2025年12月10日












