Andersonの視点
大規模言語モデルにおける冗長性は精度を低下させる

新しい研究によると、大規模言語モデルに短い回答をさせることで、回答の精度と品質を大幅に改善できることがわかった。
チャットボットが「長々と話し続ける」のを止めようとしたことがある人は、新しい研究の結論を認めるだろう。AIに短い回答をさせることで、回答の精度が向上する。
大規模AIチャットボットが、小規模のものよりも悪いパフォーマンスを示す理由を調査した研究では、31の人気の大規模言語モデル(LLM)に短い回答をさせることで、回答の精度が最大26.3%向上したことがわかった。
‘結果は、簡潔性の制約が大規模モデルの精度を26.3パーセントポイント改善し、逆スケーリングギャップを67%(44.2%から14.8%、ペアードt検定:t = 7.80、p < 0.0001)減少させることを示す因果関係の証拠を提供する。'
過度の冗長性は、エンドユーザーからの頻繁な苦情であり、商用グレードのモデル such as ChatGPTでは、サポートフォーラムがこのトピックを頻繁に取り上げている。
最も影響を受けるドメインは数学であり、AIは50語以下で回答するように制限された。読み取り理解タスクでは、10語以下の回答に制限された。
論文では、AIの冗長性の傾向を過剰思考と定義しており、中心的なメッセージが単に言葉で隠されるだけでなく、時には悪影響を受けることもある。モデルが小さいほど、この解決策は必要ないか、効果が少ないと論文は述べている。
研究は、システム的にこの解決策を適用するために、建築的に何も変更する必要はないと結論付けている。しかし、ユーザーのチャットセッションでは、簡潔さへの指示を繰り返し出す必要があるかもしれない。一方、ChatGPTのようなプラットフォームでは、グローバルに適用されたシステムプロンプトが、短い回答をデフォルトの動作にする必要がある。
吹きすさぶ風
これは、なぜ大規模モデルが冗長性に傾くのかを説明していない。論文は、強化学習の手法であるRLHFのプロトコルや一般的な慣行が原因である可能性があると示唆している。
‘もっともらしい起源は、RLHFのアライメントトレーニングであり、人間のアノテーターが、大きなモデルに長さの報酬シグナルを与えることで、長さを質と混同させるからである。’
‘以前の研究では、報酬モデルの長さバイアスが体系的に存在することを示しており、アノテーターは長さと質を混同している。’
‘大きなモデルは、長さの報酬シグナルに応じて、冗長な生成をより深く内部化する可能性があり、スケール依存の過剰思考を生み出す。’
人間では、冗長性は沈黙を埋めるために発生する可能性がある、または不快感を隠すために、または精神的な病気のため、または知識の欠如を隠すために発生する可能性がある。AIは、これらの要因の影響を受けるのは、トレーニングデータがこれらの特性を反映している場合のみである。
データセットのコーパスでは、冗長な回答の他の動機がある。たとえば、SEOのインセンティブにより、長いテキストコンテンツを生成することになる。たとえば、レシピの投稿では、長さは(しばしば誤って)権威と関連付けられる。
APIベースのプラットフォームは、ユーザーをより高いレベルのサブスクリプションに誘導するインセンティブがあるため、冗長性を奨励したり、抑制しなかったりする可能性がある。冗長性は、トークンの使用量を増加させるからである。また、過度な推論やRAGコールの必要性がない。
論文は、新しい論文であり、バングラデシュのチャッタゴラムにあるスウェーデン工科大学のコンピューターサイエンス学部から来ている。
方法
論文の理論をテストするために、31の言語モデルが評価された。以下に示す画像に描かれているモデルは、テキスト形式でリストするには多すぎる。

新しい論文の試験でテストされた大規模言語モデル(LLM)。
モデルは、5つのベンチマークコレクションに対して評価された:GSM8K、数学的推論のために;BoolQ、読み取り理解のために;CommonsenseQA、常識的な推論のために;ARC-Easy、科学の質問のために;およびMMLU-STEM、科学の知識のために。
回答は、貪欲なデコーディングを使用して生成され、決定的な出力を保証するために使用された。次に、タスク固有のルールを使用して抽出され、精度は、グラウンドトゥルースに対する正しい回答の割合として測定された。
モデルはサイズ別に分割され、10億パラメータ以下のモデルは「小規模」、70億パラメータ以上のモデルは「大規模」とみなされた。パフォーマンスギャップに基づいて、観察されたパフォーマンスギャップに基づいて分割された。
逆スケーリングは、各問題に対するこれらのグループのパフォーマンスを比較することで量化され、より小さいモデルがより大きなモデルを上回ったケースがマークされた。統計的効果サイズは、これらのギャップがノイズではなく、意味のある差であることを確認するために使用された。
リコールの除外
モデルが単にトレーニングデータを思い出すのではなく、実際に推論を生成していることを確認するために、3つの別々のチェックが実行された。回答の多様性、回答の長さの変動、エラーの種類が調べられた。モデルが思い出すパターンに頼っている場合、回答は繰り返されるか、固定されたテンプレートに従うだろう。代わりに、回答はほとんど一意的であり、長さは回答ごとに顕著に異なっていた。
エラーは直接調査され、ほとんどの失敗は短い避難的な回答ではなく、長い間違った説明であった。つまり、モデルは実際に推論を生成していることを示している。
データとテスト
個々の質問ではなく、ヘッドラインスコアに対してテストすると、ベンチマークタスクの多くは情報を提供しなかった。27.1%のタスクは、すべてのシステムが成功したか失敗したかしたため、相対的なパフォーマンスについての実質的なシグナルを提供しなかった。

5つのベンチマークに対する問題レベルの分解。タスクの多くはモデルを区別できず、より小さいモデルが大きなモデルを上回る一貫した部分が存在する。 ソース
モデルを区別した質問の多くは予想通り、大きなシステムがより良いパフォーマンスを示した。しかし、小さいモデルが勝つパターンを示す小さいグループも存在した。すべての問題に対して、逆スケーリングは7.7%のケースで発生し、この効果は周辺的なものではないことを示している。
逆スケーリングの表面化
5つのベンチマークで、115の問題が見つかり、小さいモデルが大きなモデルを上回った。これは、すべてのタスクの7.7%を占め、逆スケーリングはまれな現象ではないことを示している。
実際、すべてのデータセットでこの効果が見られ、Llama、Qwen、Gemma、およびMistralを含むさまざまなモデルファミリーで見られた。
大きなモデルのパフォーマンスギャップは大きく、小さいモデルの方が平均28.4パーセントポイントで勝っていた。すべてのケースで同じ方向の利点が見られたため、パフォーマンスの低下はランダムなエラーではなく、一貫したものであることを示している。
同じパターンは、さまざまなタスクやモデルファミリーでも見られた。大きなモデルの精度は、問題のサイズが増加するにつれて低下した。一方、小さいモデルの精度はほとんど変化しなかった。
結果は、モデルのサイズが大きくなるにつれて、パフォーマンスが低下することを示唆している。これは、モデルのサイズが大きくなるにつれて、過度の思考が発生し、パフォーマンスが低下するためである。
過剰思考の検討
大きなモデルのパフォーマンスが低下する理由を調査するために、分析は、問題は能力の欠如ではなく、過度の説明であると示唆している。つまり、長い回答が正しい推論を隠している。
データを調べると、長い回答は、特に難しい問題では、精度が低いことと関連していることがわかった。ただし、大きなモデルと小さなモデルの両方が、推論ステップの数はほぼ同じであった。問題は、推論がどのように表現されるかであり、推論の量ではない。

短い回答が大きなモデルのパフォーマンスを改善し、小さなモデルのギャップを減らした。最も大きな改善は、GSM8KとMMLU-STEMで見られ、ランキングが大きなモデルの方に逆転した。
回答を短くすることで、大きなモデルのパフォーマンスが大幅に改善され、パフォーマンスギャップが減少した。特に、GSM8KとMMLU-STEMでは、大きなモデルのランキングが小さなモデルの方に逆転した。
大きなモデルの回答は、短くすることで、より直接的で簡潔な回答になった。一方、小さなモデルの回答は、すでに短く簡潔であった。
分析は、大きなモデルの回答が、より長く、より構造化されていない推論スタイルを示していることを示唆している。一方、小さなモデルの回答は、より短く、より直接的であった。
大きなモデルの回答は、過度の思考が発生し、パフォーマンスが低下する原因であることを示唆している。一方、小さなモデルの回答は、過度の思考が発生しないことを示唆している。
結論
研究対象となったオープンソースモデルだけでなく、冗長さの問題はChatGPT、Claude、Gemini、Grokなど主要なモデルでも日常的に見られる。
こうしたプラットフォームが、トークン消費と支出を増やすために冗長さの問題を見過ごしているかどうかは別として、回答を長くする誘導に伴う精度低下まで受け入れるとは考えにくい。
冗長になる傾向がどこから生じるのかを、実証的な方法で特定できるかは興味深い。チャットボットに長いブログ記事のような多段階回答ではなく、実際に対話させようとした人なら、モデルが学習データ中の一体型ユーザーガイドや「承認済みの解決策」に強く影響されていることに気づくだろう。
段階的な会話だけで訓練したモデルが、冗長な要約へ向かう傾向を避けられるかも検証する価値がある。ただし、最終的に決定された回答だけを重視せず、その前にある会話材料と各ターンに示された推論も直接学習するよう、制約やフィルターが必要になる可能性が高い。
この種の適切なデータは希少だと考えられるため、現実的な方法は合成データかもしれない。まとまった最終結論を会話形式に分解する方法であり、皮肉にも、Google NotebookLMが通常の文章から生成するAIポッドキャストに近い。
* 著者の本文内引用をハイパーリンクに変換した。
† 率直に言えば、現在はAI提供の実費と購読料金の差が非常に大きい。この問題は利用者からの評判を損なうだけで、AIの転換・収束期にある深刻な経済問題を解決しないだろう。
初出:2026年4月5日(日曜日)












