AIモデルとプラットフォーム

思考を増やしてもAIが愚かになる:逆スケーリングパラドックス

mm
Unite.AI を Google の優先ソースに追加

人工知能は、機械に時間、データ、計算能力を与えることでその性能が向上するという考えに基づいて構築されてきた。この信念は、AIの研究と開発の方向性を長年にわたって導いてきた。この信念の根底にある重要な前提は、より大きなモデルとより多くのリソースがより賢いシステムを作成するというものである。しかし、最近の研究は、このアプローチに疑問を投げかけている。OpenAIのo1シリーズ、AnthropicのClaude、DeepSeekのR1などの大規模言語モデルは、人間の推論と同様に、段階的に問題を解決するように設計された。これらのモデルに思考時間を与えることで、意思決定が改善されることが期待された。しかし、新しい研究は、逆のことが起こることもあることを示している。思考時間を与えると、これらのモデルは特に単純なタスクでパフォーマンスが低下することがある。これは逆スケーリングと呼ばれる現象であり、より多くの計算能力とより深い推論が常により良い結果につながるという信念に挑戦している。これらの発見は、AIを現実世界の状況で設計および使用する方法に重大な影響を与える。

逆スケーリング現象の理解

逆スケーリング」現象は、Anthropicの研究者によって制御された実験を通じて初めて発見された。従来のスケーリング法則とは異なり、より多くの計算が性能を向上させるという法則とは異なり、これらの研究は、AIに思考時間を与えることで、さまざまなタスクでの精度が低下することがあることを発見した。

研究チームは、単純なカウント(邪魔するものがある)、回帰(無関係な特徴がある)、推論(制約を追跡する)、複雑なAIセーフティシナリオなどの4つの分野でタスクを作成した。結果は驚くべきものだった。いくつかのケースでは、最初に正しい答えを出したモデルが、思考時間を与えられた後に間違った答えを出すようになった。

例えば、単純なカウントタスク「リンゴとオレンジが1つずつあれば、果物は何個ありますか?」では、Claudeモデルは思考時間を与えられると、余分な詳細に気を取られ、正しい答え「2」を出すことができなかった。これらのケースでは、モデルは過度に思考し、間違いを犯していた。

Appleの最近の研究もこれらの発見を支持している。彼らは、タワーオブハノイやリバークロッシングなどの制御されたパズル環境で実験を行った。標準的なベンチマークではなく、標準的なAIモデルは単純なタスクでより優れており、推論モデルは複雑なタスクで優れていた。

AI推論の5つの失敗方法

研究者は、AIモデルが推論する際に失敗する5つの共通の方法を発見した。

  1. 無関係なものへの気を取られ:AIモデルが長時間思考すると、重要ではない詳細に気を取られやすい。これは、問題の主な点を見逃す学生のように、問題に深く考え込むと、思考が散漫になる。
  2. 問題枠への過度の適合:一部のモデル、例えばOpenAIのoシリーズは、問題の提示に過度に焦点を当てている。気を散らわすものを避けるものの、柔軟性に欠け、問題の提示に依存している。
  3. 誤った相関関係へのシフト:時間の経過とともに、AIモデルは妥当な仮定から、誤った相関関係への依存にシフトする。例えば、回帰タスクでは、モデルは最初に重要な特徴を考慮するが、思考時間が増えると、無関係な特徴に焦点を当て、間違った結果を出す。
  4. 焦点の低下:タスクが複雑になるにつれて、AIモデルは推論を明確に保つことが難しくなる。
  5. 懸念される行動の増大:思考時間の増加は、否定的な行動を悪化させる。例えば、ClaudeのSonnet 4は、シャットダウンシナリオについて思考時間が増えると、自己保存の傾向が強くなった。

AI推論が問題の複雑さに取り組む方法

Appleの研究者は、「思考の幻想」という用語を導入して、推論モデルがさまざまなレベルの複雑さを持つタスクに取り組むときに何が起こるかを説明した。数学の問題やコードのテストではなく、タワーオブハノイ、チェッカージャンピング、リバークロッシング、ブロックスワールドなどの制御されたパズル環境でAI推論モデルをテストした。パズルの難易度を徐々に増やして、各レベルでのモデルのパフォーマンスを調べた。この方法により、最終的な答えだけでなく、モデルの推論プロセスを調べることができた。研究では、問題の複雑さに基づいてモデルのパフォーマンスに3つの明確なパターンが見られた。

  • タワーオブハノイなどの単純なパズルでは、標準的な大規模言語モデル(LLM)が正しい答えをより効率的に出すことができた。AI推論モデルは、長い推論チェーンによって間違った答えを出すことが多かった。
  • 中程度の複雑さを持つパズルでは、AI推論モデルが優れていた。問題を明確なステップに分解することで、複数ステップの課題をより効果的に解決することができた。
  • 非常に複雑なパズル、例えば多くのディスクを持つタワーオブハノイでは、両方のモデルが苦労した。推論モデルは、計算資源が十分であっても、パズルの難易度が高くなるにつれて推論努力を減らすことが多かった。この「諦める」行動は、推論をスケーリングする際の重要な弱点を示している。

AI評価の課題

逆スケーリング現象は、AIモデルの評価方法に重大な問題を示唆している。多くの現在のベンチマークは、最終的な答えの精度のみを測定しており、推論プロセスの品質は測定していない。これにより、モデルの実際の能力について誤った印象を与える可能性がある。モデルのパフォーマンスがテストで良好であっても、新しいまたは異常な問題に対して失敗する可能性がある。

AI推論の未来

逆スケーリングパラドックスは、AIにとって課題であり、機会でもある。計算能力を追加しても常にAIを賢くするわけではないことを示している。問題の複雑さに応じて、AIシステムを設計およびトレーニングする必要がある。新しいモデルは、思考を中断するタイミングと、迅速に応答するタイミングを決定する必要がある。認知アーキテクチャ、例えば二重プロセス理論は、AIの設計に役立つ。人間の思考は、迅速な直感的な反応と、ゆっくり慎重な推論を組み合わせている。これは、AIが重要な分野で使用される前に、AIの意思決定プロセスを完全に理解する必要があることを示唆している。

結論

逆スケーリングパラドックスは、AI開発において重要な教訓を示唆している。時間と計算能力を増やすだけでは、AIをより優れたものにはしない。真の進歩は、AIが推論するべき時とその限界を理解することから来る。組織と研究者は、AIを人間の判断の代わりではなく、ツールとして使用することが重要である。各タスクに適したモデルを選択する必要がある。AIが重要な決定に使用されるにつれて、その強みと弱点を慎重に評価する必要がある。AIの未来は、より多く思考することではなく、正しく思考することにある。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。