AIモデルとプラットフォーム
少ないドキュメント、より良い回答:ドキュメントを少なくしてAIの回答を改善する
Retrieval-Augmented Generation (RAG)は、言語モデルと外部の知識源を組み合わせたAIシステムを構築するアプローチです。簡単に言うと、AIはまずユーザーのクエリに関連するドキュメント(記事やウェブページなど)を検索し、それらのドキュメントを使用してより正確な回答を生成します。この方法は、大規模言語モデル(LLM)が事実に基づいた回答を提供し、妄想を減らすのに役立つという点で称賛されてきました。
直感的には、AIが取得するドキュメントが多いほど、回答がより情報に基づいていると思われるかもしれません。しかし、最近の研究は驚くべき結果をもたらしています:情報をAIに与える場合、時には少ない方が良いということです。
より少ないドキュメント、より良い回答
ヘブライ大学の研究者们は、RAGシステムのパフォーマンスにドキュメントの数が与える影響を調査した新しい研究を発表しました。重要な点は、総テキスト量を一定に保ったということです。つまり、ドキュメントが少ない場合、それらのドキュメントを少し拡張して、多くのドキュメントと同じ長さになるようにしました。これにより、パフォーマンスの違いはドキュメントの数によるものであり、単に入力が短いためではないことがわかりました。
研究者们は、トリビアの質問を含むデータセット(MuSiQue)を使用しました。各質問はもともと20のWikipediaの段落とペアになっており、そのうちの何個かは答えを含んでいたが、残りは無関係なものでした。ドキュメントの数を20から2〜4の真正に関連するものに切り詰め、それらのドキュメントを少し拡張して、同じ長さを保つようにしました。こうして、AIが関連する情報のみを扱うシナリオを作成しました。
結果は驚くべきものでした。ほとんどの場合、AIモデルは、多くのドキュメントではなく、わずかな関連ドキュメントのみを与えられたときに、より正確に回答しました。パフォーマンスは、特にF1スコアで最大10%向上しました。さらに、MetaのLlamaを含むいくつかのオープンソース言語モデルで、この現象が観察されました。これは、現象が単一のAIモデルに依存していないことを示しています。
ただし、Qwen-2というモデルは、多くのドキュメントを処理する際にスコアの低下が見られませんでした。しかし、ほとんどのテストされたモデルは、より少ないドキュメントを使用した場合に、より良いパフォーマンスを示しました。つまり、関連する情報以外のドキュメントを追加することは、パフォーマンスを向上させるのではなく、むしろ低下させることになります。

出典:Levy et al.
これはなぜ驚くべき結果なのか?通常、RAGシステムは、より広範な情報を取得することで、AIの回答がより情報に基づくものになるという仮定で設計されています。答えが最初の何個かのドキュメントにない場合、10番目や20番目のドキュメントに答えがあるかもしれません。
しかし、この研究はこの仮定を覆しています。無差別に多くのドキュメントを追加することは、AIの回答を低下させることになります。総テキスト量が一定であっても、多くのドキュメントを追加することは、AIの回答をより困難にすることになります。各ドキュメントには独自のコンテキストと特徴があるため、AIは正しい答えを抽出する能力が低下します。
RAGにおける「少ない方が良い」
この「少ない方が良い」という結果は、AI言語モデルが情報を処理する方法を考慮すると、理解できます。AIが最も関連性の高いドキュメントのみを与えられた場合、コンテキストは焦点を当てて、無関係な情報が除去された状態になります。学生が必要なページのみを与えられた場合と同様です。
研究では、モデルは、無関係な情報を除去した状態で、関連するドキュメントのみを与えられた場合に、より良いパフォーマンスを示しました。残されたコンテキストは、短くてクリーンで、直接答えを指す情報のみを含んでいたため、モデルは関連する情報に集中することができ、無関係な情報に惑わされることが少なくなりました。
一方、多くのドキュメントを与えられた場合、AIは関連性のある情報と無関係な情報の混合物を処理する必要がありました。多くの場合、これらの追加のドキュメントは「類似しているが無関係」でした。つまり、質問のトピックやキーワードと共通しているかもしれませんが、実際には答えを含んでいない可能性があります。そうした情報は、AIを混乱させる可能性があります。AIは、正しい答えに到達しないドキュメント間のつながりを探す時間を浪費する可能性があります。さらに、AIは、複数の情報源から情報を間違って結合する可能性があり、妄想を生み出す可能性があります。
本質的に、AIに多くのドキュメントを与えることは、有用な情報を希薄にし、矛盾する詳細を導入し、AIが何が真実であるかを判断することをより困難にすることになります。
研究者们は、追加のドキュメントが明らかに無関係な場合、モデルはそれらを無視するのがより簡単であることを発見しました。ただし、実際の問題は、関連性のあるが無関係な情報です。検索されたテキストがすべて似たトピックであれば、AIはそれらすべてを使用する必要があると仮定し、どの詳細が実際に重要であるかを判断するのに苦労する可能性があります。これは、研究の観察と一致しています。ランダムな妨害要因は、現実的な妨害要因よりも混乱を引き起こしにくいことを示しています。AIは、明らかな無意味な情報をフィルタリングできますが、微妙に外れた情報は、関連性のある情報の仮面の下に潜む罠です。実際に必要なドキュメントのみを使用することで、これらの罠を回避できます。
実際的な利点もあります。ドキュメントを減らすと、RAGシステムの計算オーバーヘッドが低減されます。各ドキュメントは分析(埋め込み、読み取り、モデルによる注目)される必要があり、時間と計算資源を使用します。不要なドキュメントを除去することで、システムはより効率的になり、回答をより迅速に、かつ低コストで提供できます。精度が向上したシナリオでは、より良い回答とより効率的なプロセスという二つのメリットを得ることができます。

出典:Levy et al.
RAGの再考:将来の方向性
この新しい証拠は、外部知識に依存するAIシステムの将来に重要な意味を持ちます。RAGシステムの設計者は、ドキュメントのスマートなフィルタリングとランキングを、ドキュメントの総量よりも優先する必要があります。100個のパスを取得し、答えがどこかに埋もれていることを期待するのではなく、最も関連性の高い上位のドキュメントのみを取得する方が賢明です。
研究者们は、モデルに供給される情報のバランスをとる必要性を強調しています。つまり、トピックのカバレッジを提供する必要がありますが、核心的な事実が無関係なテキストの海に溺れることは避ける必要があります。
将来的には、研究者们は、AIモデルが複数のドキュメントをよりうまく処理できるようにする技術を探求するでしょう。1つのアプローチは、実際に価値を追加するドキュメントと、矛盾を導入するドキュメントを識別できるリトリーバーシステムまたはリランキングシステムを開発することです。別のアプローチは、言語モデル自体を改善することです。Qwen-2のようなモデルが多くのドキュメントを処理する際に精度の低下が見られなかった場合、そのトレーニング方法や構造を調べることで、他のモデルをより強力にするヒントを得ることができます。将来的には、モデルが複数の情報源から同じことを述べているか、または矛盾しているかを認識し、焦点を当てることができるようにするメカニズムを組み込むことができます。目標は、モデルが情報源の豊富さと焦点の明確さの両方を利用できるようにすることです。
また、AIシステムがより大きなコンテキストウィンドウを取得できるようになると、単にデータをダンプするのではなく、より賢い情報を提供する必要があります。コンテキストウィンドウが大きくても、50ページの混合情報を与えることは、良い結果につながらない可能性があります。モデルは、カーソルされた関連情報を使用することで、より良い回答を生成できます。実際に、巨大なコンテキストウィンドウの時代には、賢いリトリーバルは、追加の容量が有用な知識ではなくノイズに使用されないようにするために、より重要になるでしょう。
「More Documents, Same Length」(適切に命名された論文)の研究結果は、AI研究における私たちの仮定を再検討する必要性を強調しています。時には、AIにすべてのデータを与えることは、思ったほど効果的ではないことがあります。最も関連性の高い情報に焦点を当てることで、AI生成の回答の精度を向上させると同時に、システムをより効率的で信頼性の高いものにすることができます。これは、直感に反する教訓ですが、将来的には、より賢く、よりスリムなRAGシステムが、より少ない、より良いドキュメントを取得することで実現できるという、興奮するべき結果をもたらします。
情報を絞り込むことで、AIの回答の精度を向上させ、システムをより効率的で信頼性の高いものにすることができます。これは、AI研究における私たちの仮定を再考する必要性を強調しています。将来的には、より賢い情報を提供することで、AIシステムがより良い回答を生成できるようにすることができます。












