AIモデルとプラットフォーム
AIの推論の幻影:連鎖的思考は私たちが考えているものではないかもしれない

大規模言語モデル(LLM)は、複雑な問題を段階的に解決する能力に私たちを驚かせました。LLMに数学の問題を解くように求めると、答えに到達する前に各論理的なステップを示します。このアプローチは、連鎖的思考(CoT)推論と呼ばれ、AIシステムの思考プロセスがより人間らしいものになりました。しかし、この印象的な推論能力が実際には幻想である場合にはどうでしょうか。アリゾナ州立大学からの新しい研究によると、真の論理的思考ではなく、洗練されたパターンマッチング技術である可能性があります。この記事では、この発見とそのAIシステムの設計、評価、信頼性への影響について探ります。
現在の理解の問題
連鎖的思考のプロンプティングは、AI推論の最も認知された進歩の1つになりました。モデルは、中間ステップを示すことで、数学的な問題から論理的なパズルまで、すべてに対処できます。この明らかな推論能力により、多くの人々がAIシステムは人間の思考に似た推論能力を開発しているという信念を持つようになりました。しかし、研究者は、この信念に疑問を抱き始めています。
最近の研究では、LLMがアメリカがうるう年または通常の年に設立されたかどうかという質問に不一致した答えを返すことが観察されました。1776年は4で割り切れるという理由を正しく特定し、うるう年であったと述べるものの、モデルはアメリカが通常の年に設立されたと結論付けています。この場合、モデルは規則の知識を示し、論理的なステップを示しましたが、矛盾した結論に達しました。
これらの例は、推論と実際の論理的推論の間に根本的なギャップがある可能性があることを示唆しています。
AI推論の新しい視点
この研究の重要な革新は、連鎖的思考(CoT)推論を調査するための「データ分布レンズ」の導入です。研究者は、CoTは真の論理的推論ではなく、統計的な規則性に基づく洗練されたパターンマッチング技術であると仮定しました。モデルは、論理演算を実行するのではなく、以前見たものに近似する推論パスを生成します。
この仮説をテストするために、研究者はDataAlchemyという制御された実験環境を作成しました。事前トレーニングされたLLMを使用するのではなく、研究者は小さなモデルをスクラッチから慎重に設計されたタスクでトレーニングしました。このアプローチにより、大規模な事前トレーニングの複雑さを排除し、分布のシフトが推論のパフォーマンスに与える影響を体系的にテストできます。
研究者は、シーケンスの文字のシンプルな変換タスクに焦点を当てました。たとえば、モデルにアルファベットの文字を回転させる操作(AはNになる、BはOになる)またはシーケンス内の位置をシフトさせる操作(APPLEはEAPPLになる)を適用することを教えました。これらの操作を組み合わせることで、研究者はさまざまな複雑さの多段階の推論チェーンを作成しました。このアプローチにより、研究者は精度を確保できました。モデルがトレーニング中に何を学習したかを正確に制御し、新しい状況にどのように一般化するかをテストできます。このレベルの制御は、大規模な商用AIシステムでは不可能です。
AI推論の崩壊
研究者は、現実世界のアプリケーションでトレーニングデータと異なる可能性のある3つの重要な次元でCoT推論をテストしました。
タスクの汎化では、モデルが以前見たことがない新しい問題に対処する能力を調べました。トレーニングデータと同じ変換をテストした場合、モデルは完璧なパフォーマンスを達成しました。しかし、わずかな変化により、推論能力が劇的に低下しました。新しいタスクが既知の操作の組み合わせであった場合でも、モデルは学習したパターンを正しく適用できませんでした。
最も心配するべき洞察の1つは、モデルが完璧に整形式の推論ステップを生成し、論理的であるように見えたが、間違った答えに到達することが多かったことです。いくつかのケースでは、モデルは完全に間違った推論パスをたどりながら、偶然に正しい答えを生成しました。これらの結果は、モデルが根本的な論理を理解するのではなく、表面的なパターンをマッチングしていることを示唆しています。
長さの汎化では、モデルがトレーニングデータよりも長いまたは短い推論チェーンに対処できるかどうかをテストしました。研究者は、長さ4の推論チェーンでトレーニングしたモデルが、長さ3または5のチェーンで完全に失敗することを発見しました。さらに、モデルは新しい要件に適応するのではなく、推論を既知のパターンに強制的に当てはめるために、適切に追加または削除するステップを追加または削除しました。
形式の汎化では、問題の表現形式に対する感度を評価しました。トレーニングデータからのわずかな変更、たとえばノイズトークンの挿入やプロンプト構造のわずかな変更により、パフォーマンスが大幅に低下しました。これは、モデルがトレーニングデータからの正確なパターン形式に依存していることを示しています。
脆弱性の問題
3つの次元すべてで、研究は一貫したパターンを明らかにしました:CoT推論はトレーニングデータに似たデータではうまく機能しますが、分布のシフトが発生すると脆弱性が高まり、失敗する可能性があります。推論能力は、モデルが未知の状況に遭遇したときに消える「脆い幻影」です。
この脆弱性は、いくつかの方法で現れます。モデルは完全に間違った推論チェーンを生成できますが、完全に整形式です。完全な論理形式に従いますが、根本的な論理的つながりを欠きます。時には、推論プロセスが欠陥があるにもかかわらず、数学的な偶然性により正しい答えを生成します。
研究はまた、少量の新しいデータで監督付きファインチューニングを実行するとすぐにパフォーマンスが回復することを示しましたが、これは真の推論能力の開発ではなく、パターンマッチングのレパートリーの拡大のみであることを示しています。新しいタイプの数学の問題を解くために、特定の例を覚えるのではなく、根本的な数学的原理を理解するのと同じです。
現実世界への影響
これらの発見は、AIシステムを展開して信頼する方法に重大な影響を及ぼす可能性があります。医療、金融、法的分析などのハイリスク分野では、信頼性が低い推論を生成する能力は、単純な誤った答えよりも危険になる可能性があります。論理的思考の出現は、ユーザーがAIの結論に不当な信頼を寄せている可能性があります。
研究は、AIプラクティショナーにとっていくつかの重要なガイドラインを示唆しています。まず、組織はCoTを万能の問題解決策として扱うべきではありません。トレーニングセットに似たデータを使用する標準的なテストアプローチは、真の推論能力を評価するには不十分です。代わりに、厳格な外部テストがモデル制限を理解するために不可欠です。
2番目に、モデルが「流暢な無意味」な推論を生成する傾向は、特に重要なアプリケーションの場合、慎重な人間の監視を必要とします。AIによって生成された推論チェーンの構造は、すぐには明らかでない根本的な論理的エラーを隠すことができます。
パターンマッチングの先へ
おそらく最も重要なことは、この研究がAIコミュニティに、真の推論能力を持つシステムを開発するために、表面的な改善を超えて進むことを促しています。現在のアプローチは、主に洗練されたパターンマッチングシステムであるため、データとパラメータをスケールアップすることで根本的な限界に達する可能性があります。
この研究は、現在のAIシステムの実用的な有用性を低下させません。スケールでのパターンマッチングは、多くのアプリケーションで驚くほど効果的です。ただし、人間の推論に似た能力を存在しないのに帰属することの重要性を強調しています。
進む道
この研究は、AI推論の将来について重要な疑問を開きます。現在のアプローチがトレーニング分布によって基本的に制限されている場合、より強力な推論能力につながる代替アプローチは何でしょうか。パターンマッチングと真の論理的推論を区別する評価方法を開発するにはどうすればよいのでしょうか。
これらの発見はまた、AI開発における透明性と適切な評価の重要性を強調しています。システムがより洗練され、出力がより説得力のあるものになると、明らかな能力と実際の能力のギャップは、適切に理解されなければ、ますます危険になります。
結論
LLMの連鎖的思考推論は、真の論理ではなくパターンマッチングを反映することが多いです。出力は説得力のあるものに見えるかもしれませんが、新しい状況では失敗する可能性があり、医療、法律、科学などの重要な分野に懸念を引き起こします。この研究は、AI推論に対するより優れたテストとより信頼性の高いアプローチの必要性を強調しています。












