Andersonの視点

チェーン・オブ・ソートの推論は、主要な言語モデルで「装飾的な」ものであることが証明された

mm
Unite.AI を Google の優先ソースに追加
An AI-generated image (GPT1.5) depicting a robot cheating in an exam by using a smartphone.

新しい研究は、現在の主要なAI言語モデルのみんなの、きれいに仕上げられたステップバイステップの説明は、実際には「装飾的な」ものでしかなく、通常、AIが答えを決定した後に作成されるものであることを簡単に判断する方法を提供しています。

 

昨年、AI関連企業からのいくつかの高プロファイルの研究、例えばAnthropicAppleは、「推論AI」と呼ばれるものが、実際に答えを導き出したものではないステップバイステップの説明を生み出すことが多いことを示唆しました。

様々な理由で、議論はすぐに反論解釈含むこのサイト)に発展し、チェーン・オブ・ソート(CoT)推論が単なる装飾的なものなのか、または真の推論プロセスの証拠なのかという疑問は解決されませんでした。

ChatGPT 'shows its work' – but has it already decided what to answer?

ChatGPT ‘shows its work’ – but has it already decided what to answer?

ショー・アンド・テル

今、新しい研究は、ChatGPTや他の主要な大規模言語モデル(LLM)のインターフェイスにある「推論アニメーション」が、実際にAIがステップバイステップで推論していることを示しているかどうかを判断するための、安価で簡単に再現可能な方法を提供しています。

新しい研究は、インドのインド情報技術大学(IIITA)とデリーの国立電子情報技術研究所(NIELIT)の2人の研究者によって行われました。

著者らは、ほとんどの場合、さまざまなプロプライエタリおよびオープンソースLLMで、ユーザーに提示されるチェーン・オブ・ソート推論は「装飾的な」ものであり、AIが答えを決定した後に発明されたものであることを発見しました。

ChatGPT5.4、Claude Opus 4.6-R、DeepSeek-V3.2などのテストでは、著者らは、チェーン・オブ・ソート推論のステップを削除すると、答えが変化することはほとんどなく、また、単一のステップだけで答えを回復できることが示されました。

著者らは述べています*:

‘医療、金融、法律におけるAIの規制フレームワークは、説明可能なシステムを要求することが増えています。私たちの結果は、標準的なアプローチ – モデルに仕事を見せるように要求する – は透明性の幻想を提供することを示唆しています。 ‘

‘説明は流暢で、ドメインに適切で、しかし、モデルが実際に実行していない推論を記述しています。 ‘

‘医療AIが「好中球症は塞栓のプロセスを示唆する」と書く場合、必ずしも好中球症を考慮したわけではありません。質問のステムから答えへのパターンマッチングをして、推論を後から作り出した可能性があります。 ‘

‘EUのAI法(第13条)では、高リスクAIシステムは「関与するロジックについての有意義な情報」を提供する必要があります。私たちの結果は、ほとんどのフロンティアモデルがチェーン・オブ・ソート推論を提供しているが、これはこの基準を満たしていないことを示唆しています – 「関与するロジック」は、説明で記述されているロジックではありません。 ‘

著者らは、テストされた小さなモデルのうち2つは、特定の状況下で、真正なステップ依存性を示したことを観察しています:MiniMax-M25は、感情分析で真正なステップ依存性を示しましたが、Kimi-K25は、トピック分類で真正な39%のステップ処理を示しました。

他のすべての場合、より大きなモデルのように、推論ステップは装飾的なもので、モデルの内部ではショートカットを使用していました。

小さなモデルはより努力する

テストされた10のAPIモデルに加えて、著者らは、0.8から8億パラメータ(現在の基準ではかなり小さなもの)までの範囲の小さなオープンウェイトモデルをテストしました。小さなモデルは真正に推論し、表示されるチェーン・オブ・ソート推論は通常必要であることを発見しました。

小さなモデルは、55%のステップ推論を示しましたが、大きなモデルの平均は11%でした。著者らは、大きなモデルは「マルチステップ推論を完全にバイパスする」ことを学習しており、その書かれた推論は内部のショートカットを反映していないと主張しています。

著者らは、モデルがタスクに優れているほど、推論ステップを必要としないことを示唆しています(これは、トレーニングデータの分布で最も強い答えを選択することを好むという概念のより外交的な解釈です):

‘小さなモデルは、数学の問題で真正に推論します – それらはショートカットするためのパラメトリックな知識が不足しているからです。 ‘

‘フロンティアモデルは、数学的なパターンを内部化しているため、明示的なチェーン推論は冗長になります。チェーン・オブ・ソート推論はまだ精度を向上させます(生成を構造化することで)が、個々のステップは独自の情報を運びません。 ‘

方法

モデルをテストするために使用された方法は、3つの基準に基づいています。

必要性は、チェーン・オブ・ソート推論の各ステップを削除し、答えが変化するかどうかを確認します。答えが変化するステップは「必要」であると数えられます。十分性は、各ステップを分離し、単一のステップだけで答えを回復できるかどうかをテストします。十分なステップは「十分」であると数えられます。順序感度は、ステップをシャッフルし、答えが変化するかどうかを観察します(真正な推論は、キーワードではなく、シーケンスに依存する必要があります)。

これらの基準を組み合わせると、高い必要性と低い十分性は真正なステップバイステップ推論を示します。一方、低い必要性と高い十分性は、説明が削除、再配置、または削減された場合でも答えに影響を与えないことを示します。

著者らは、この方法は、内部分析を可能にするオープンウェイトモデルや、より単純な二値(はい/いいえ)回答を使用した以前の研究とは異なり、白ボックスモデルのアクセスを必要としないことを指摘しています。

彼らは、以前の研究は内部分析を可能にするオープンウェイトモデルを使用したか、または内部推論プロセスを明らかにするものの、より単純な二値(はい/いいえ)回答を使用したことを指摘しています。

最小コスト

著者らは、真正な推論を必要性十分性によって定義しています。高い必要性と低い十分性は、各ステップが独自の重みを持ち、装飾的な推論は低い必要性と高い十分性を示します。

必要性のみでは、これを明らかにできないため、十分性は、単一のステップがすでに結果を符号化しているかどうかをテストするために使用されます。また、順序感度は、モデルがシーケンスに依存しているか、表面的なヒントに依存しているかどうかを確認します。

アプローチは、Intervention-Consistent Explanation(ICE)フレームワークに基づいています。テキスト入力/テキスト出力APIアクセスのみを必要とし、6ステップのチェーンの場合、15の評価が必要で、モデルごとに約1〜2ドルかかります。

ICEフレームワークは、モデルを必要性十分性によって分類し、3つのパターンを示します:装飾的なは低い必要性と高い十分性を示し、ステップは冗長で、答えは別の方法で得られることを意味します。これは、ほとんどのモデルとタスクで支配的なパターンです。真正なは高い必要性と高い十分性を示し、各ステップが真正な信号を運びます(先ほど述べたように、MiniMax-M2.5は感情分析でこれを示しています)。コンテキスト依存は高い必要性と低い十分性を示し、ステップはシーケンスでしか機能しないことを意味します(これは、Kimi-K2.5とMiniMaxでトピック分類で見られます)。

テスト

テストされた10のAPIモデルは、ChatGPT-5.4Claude Opus 4.6-RDeepSeek-V3.2GPT-OSS-120BKimi-K2.5Qwen3.5-397BQwen3.5-122BMiniMax-M2.5GLM-5、およびNemotron-Ultra(253Bパラメータ)でした。

各モデルは、感情分析(SST-2を使用)、数学的ワード問題(GSM8Kを使用)、トピック分類(AG Newsを使用)、および医療質問回答(MedQAを使用)を含む4つのタスクでテストされました。

テスト結果

テスト結果

著者らは述べています:

‘ほとんどのモデルは、SST-2とGSM8Kの両方で、装飾的な推論を示しています。MiniMax-M2.5は、感情分析でより多くのステップ依存性を示しています。一方、Kimi-K2.5とMiniMaxは、トピック分類で真正なステップバイステップ推論を示しています。 ‘

出力の剛性

テストでは、4番目の現象が発見されました。著者らはこれを出力の剛性と呼んでいます。いくつかのモデルは、トピックやその他の状況に応じて、推論プロセスを出力することを避ける傾向があります。

Verbosity vs. reticence

Verbosity vs. reticence

著者らは、出力の剛性はタスク依存であると指摘しています。

出力の剛性

出力の剛性

彼らは述べています:

‘モデルは、内部で推論をバイパスする可能性が高いものは、外部で推論を省略する可能性も高い。GPT-OSS-120Bは、99%の感情分析と100%のトピック分類でマルチステップ推論を生成しますが、医療質問では38%のみです。 ‘

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai