AIモデルとプラットフォーム

研究により、LLMは複雑性の増加に伴ってシンプルな推論に頼ることがわかった

mm
Unite.AI を Google の優先ソースに追加

研究チームは、包括的な研究を発表し、192,000を超える推論トレースを分析し、大規模言語モデル(LLM)が人間が自然に使用する階層的な認知プロセスではなく、浅い線形戦略に頼っていることを明らかにした。

研究チームは、18の異なるモデルをテキスト、ビジョン、オーディオの推論タスクで比較し、54の人間の思考プロセスを収集して分析した。分析により、28の認知要素の分類が確立され、計算制約、メタ認知的制御、知識表現、変換操作が含まれるフレームワークが提供された。これにより、モデルが正しい答えを生み出すだけでなく、どのようにしてそれらの結論に到達するかを評価することができる。

認知アーキテクチャの基本的な違い

人間の推論は一貫して階層的なネストとメタ認知的モニタリングを示す。人間は情報を階層的に組織化し、複雑な問題を解決する際に自分の思考プロセスを反映し、調整する。

LLMは主に浅いフォワードチェイニングを使用し、問題をステップバイステップに解決するが、人間の認知に特徴的な階層的な組織化や自己反省は見られない。この違いは、タスクが不完全または曖昧な場合に最も顕著で、人間の適応性はAIアプローチを大幅に上回る。

研究では、言語モデルが成功した推論に関連する行動要素を備えていることがわかったが、自発的にそれらを展開することができないことが多い。問題の種類によってパフォーマンスが大きく異なり、ジレンマ的な推論では最も大きな変動が見られ、小さなモデルは大きな苦労を見せた。一方、論理的な推論では、中程度のパフォーマンスが見られ、大きなモデルは小さなモデルを上回った。モデルは、複雑なタスクを成功させながら、よりシンプルなバージョンで失敗するという、直感に反する弱点を示した。

ガイド付き推論によるパフォーマンスの向上

研究チームは、テスト時の推論ガイダンスを開発し、成功した認知構造を自動的にサポートすることで、モデルが人間に近い推論アプローチを採用するように促すことで、複雑な問題で最大66.7%のパフォーマンスの向上を実現した。この発見は、LLMがより洗練された推論の潜在的な能力を備えているが、効果的にそれらを使用するには明示的なガイダンスが必要であることを示唆している。

タスクの複雑性が増加するにつれて、人間とAIの推論のギャップが拡大する。モデルは、フォワードチェイニングのみで単純な問題を解決できるが、人間が自然に使用する再帰的、自己モニタリング戦略に対して苦労する。

研究の公開データセットは、人工知能と人間の知能の比較研究の基準を提供する。28の認知要素をマッピングすることで、フレームワークは、精度スコアを単に測定するのではなく、AIの推論がどこで崩壊するかを正確に特定することを可能にする。

AI開発への影響

研究の結果は、現在のAIシステムの基本的な限界を強調している。大量のデータセットでトレーニングされたモデルは、多くのタスクで正しい答えをパターンマッチングで得ることができるが、人間の問題解決に特徴的な反省的、階層的な思考が欠けている。

この研究は、複数のドメインで同定されたAIの推論の限界に関する増大する懸念に基づいている。ガイド付き推論からのパフォーマンスの向上は、より優れたプロンプティング戦略とアーキテクチャの変更が、モデルが潜在的な推論能力に効果的にアクセスするのを助ける可能性があることを示唆している。

研究の最も重要な貢献は、その認知要素の詳細な分類であり、研究者と開発者に改善のための具体的なターゲットを提供することである。推論を単一の能力として扱うのではなく、フレームワークはそれを測定可能なコンポーネントに分割し、トレーニングの変更やプロンプトエンジニアリング技術を通じて個別にアドレスできるようにする。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。