Andersonの視点
チェーン・オブ・ソートの推論は、主要な言語モデルで「装飾的な」ものであることが証明された

新たな研究は、ChatGPTやClaudeを含む主要なAI言語モデルが示す整然とした段階的説明が、実際には「装飾」にすぎず、AIが答えを決めた後で作られる場合が多いことを、簡単な方法で判定できると報告している。
昨年、AnthropicやApple (AAPL ) などAI関連企業の注目度の高い研究は、いわゆる「推論AI」が、回答を本当に導いた過程とは一致しない段階的説明をしばしば生成すると示した。
その後の議論は反論と多様な解釈に分かれ、チェーン・オブ・ソート(CoT)が利用者を安心させるための見せかけなのか、実際の推論過程の証拠なのかは未解決のままだった。

ChatGPTは「考えた過程」を見せるが、その前に答えを決めているのだろうか。
説明と実際の推論を切り分ける
インドの新しい論文は、ChatGPTなど主要な大規模言語モデル(LLM)の画面に表示される印象的な「推論アニメーション」が、本当に結論へ至る手順を表しているのかを、安価かつ再現可能に測る方法を提示した。研究はAllahabadのIndian Institute of Information Technology Allahabad(IIITA)とDelhiのNational Institute of Electronics and Information Technology(NIELIT)の研究者2人によるものだ。
著者らは、幅広い商用・オープンソースLLMのほぼすべてで、利用者に示されるCoTが、答えを決めた後に組み立てられた「装飾的」な説明であることを見いだした。
ChatGPT-5.4、Claude Opus 4.6-R、DeepSeek-V3.2などでは、10~15個の推論手順から任意の1手順を削除しても答えが変わる割合は17%未満だった。一方、どの1手順だけを与えても正答を復元できることが多かった。
著者らは、医療・金融・法律で説明可能なAIを求める規制が増えている一方、モデルに「考えた過程を示せ」と求める標準的手法は透明性の錯覚を与えると警告する。説明は流暢で分野に適していても、モデルが実際には行わなかった推論を描いている可能性がある。
例えば医療AIが「好酸球増多は塞栓性の過程を示唆する」と書いても、本当に好酸球増多を検討したとは限らない。設問から答えをパターン照合し、説明を後から作っただけかもしれない。EU AI Act第13条は高リスクAIに「関与した論理について意味のある情報」を求めるが、多くの最先端モデルのCoTはこの基準を満たさない可能性がある。
例外もあり、MiniMax-M2.5は感情分析で手順への真の依存を示し、Kimi-K2.5はトピック分類で手順依存度39%を示した。しかし大規模で有名なモデルの多くでは、表示された推論手順は実演的で、内部では近道を使っていた。
小さなモデルほど真面目に推論する
10個のAPIモデルに加え、著者らは8億~80億パラメータの小型オープンウェイトモデルも試した。現在の基準では小規模なこれらのモデルは、表示するCoTが有用で正しい結論に達するために必要な場合が多かった。
小型モデルでは手順推論が必要だった割合が55%だったのに対し、大型モデルの平均は11%だった。著者らによれば、大型モデルは多段階推論を迂回し、文章化した推論には現れない内部の近道で正答へ到達することを学んでいる。
モデルが課題に熟達するほど明示的手順を必要としなくなる可能性もある。小型モデルは近道に使えるパラメトリックな知識が不足するため、数学を忠実に推論しなければならない。最先端モデルは数学的パターンを十分に内在化しており、CoTは生成を整理して精度を上げても、個々の手順が固有の情報を運ばなくなるという説明だ。
方法
試験方法は三つの基準に基づく。
必要性ではCoTの各手順を一つずつ除き、答えが変わるかを見る。除去によって結果が変わる手順を「必要」と数える。十分性では各手順を単独で提示し、その一手順だけで答えを復元できるかを調べる。順序感度では手順を並べ替えて答えが変わるかを見る。本物の推論ならキーワードだけでなく順序に依存するはずだからだ。
高い必要性と低い十分性は、各段階が連続して働く実質的な推論を示す。低い必要性と高い十分性は、説明を削除・並べ替え・短縮しても結果が変わらない装飾的推論を示す。
この方法はモデル内部へのホワイトボックスアクセスを必要としない。ChatGPTやClaudeのようなAPI専用の非公開モデルでも数ドルで実施でき、ローカルに置けるオープンウェイトモデルにも同じように使える。
必要性だけを見ると、同じ答えへ至る複数の正当な経路がある場合を見落とす。そのため十分性で一つの手順が既に結論を符号化しているかを確認し、順序感度で連続した論理と表面的な手掛かりを区別する。
手法はIntervention-Consistent Explanation(ICE)フレームワークを基礎とし、必要なのはテキスト入出力APIだけである。6手順のチェーンなら15回の評価で済み、1モデル当たり約1~2ドルで実行できる。
ICEは必要性と十分性から三つのパターンに分類する。装飾的は必要性が低く十分性が高い。手順は冗長で、なくても答えに到達する。これは大半のモデルと課題で支配的だった。真に忠実は必要性も十分性も高く、各手順が実際の信号を持つ。MiniMax-M2.5の感情分析が該当した。文脈依存は必要性が高く十分性が低く、手順が順番にそろった時だけ働く。Kimi-K2.5とMiniMaxのトピック分類や、小型モデルの数学で見られた。
試験結果
改訂ICEで試した主にAPI専用の10モデルは、ChatGPT-5.4、Claude Opus 4.6-R、DeepSeek-V3.2、GPT-OSS-120B、Kimi-K2.5、Qwen3.5-397B、Qwen3.5-122B、MiniMax-M2.5、GLM-5、Nemotron-Ultra(253B)だった。
各モデルを、SST-2による感情分類、GSM8Kによる数学文章題、AG Newsによるトピック分類、MedQAによる医療質問応答の4課題で評価した。最初の試験は感情と数学を対象とした。

10の主要言語モデルにおける段階的推論の評価。「必要性」は手順を除くと答えが変わるか、「十分性」は一手順だけで答えを出せるか、「シャッフル」は順序が重要かを測る。大半のモデルはSST-2とGSM8Kで説得力はあるが不要な説明を出した。MiniMax-M2.5は感情分類で、MiniMaxとKimi-K2.5はトピック分類で、より実質的な手順依存を示した。 出典
大半は感情と数学の両方で手順の必要性が17%未満、十分性が60%超の「装飾的推論」だった。つまり任意の手順を削除しても答えはほとんど変わらない一方、どの一手順だけでも答えを復元できた。
SST-2ではGPT-5.4の手順を除いて答えが変わったのは500件中わずか0.1%で、説明が判断後に追加されたことを示唆する。Claude Opus 4.6-Rは14.8%で手順への依存が少し高かったが、91%の手順が単独で答えを生成できたため、長く詳しい説明も大部分は装飾だった。
その後、研究者は残る分野を加えて再試験した。

SST-2、GSM8K、AG News、MedQAの四分野における手順レベルの忠実性と精度。高精度でも大半のモデルと課題の組み合わせは装飾的だった。限られた例外として、MiniMax-M2.5とKimi-K2.5はAG Newsで文脈依存または真の手順依存を示した。全体精度から、低い忠実性は単なる当て推量では説明できない。
四分野の結果でも、近道を使うモデルの装飾的推論は分野を問わず見られた。Claude OpusはMedQAの486問で93.4%の精度を達成し平均5.8手順の詳しい医療推論を書いたが、必要性は1.7%にすぎず、一手順を除いても診断はほぼ変わらなかった。
AG Newsではモデル間の差が最大で、Kimi-K2.5とMiniMaxは段階的推論に実際に依存した一方、多くのモデルの説明は最終回答にほとんど影響しなかった。DeepSeek-V3.2は四課題すべてで最長の説明を書きながら、一貫して装飾的だった。
出力の硬直性
試験は「出力の硬直性」と呼ばれる第四の現象も示した。モデルによっては課題や状況に応じて推論過程そのものを出力したがらない。61歳男性の医療状態を問う同じ問題でも、Claude OpusとGPT-OSS-120Bの応答量は大きく異なった。

詳しい説明と寡黙な回答の対比。
出力の硬直性は課題に依存した。

モデルが「考えた過程」を示す頻度は課題ごとに大きく異なる。ClaudeとDeepSeekは分野を問わずほぼ毎回多段階説明を出すが、Qwen3.5-397Bはほとんど出さない。他のモデルは分類では詳しい論理を示しても、医療質問では大幅に減る場合がある。
著者らによれば、内部で推論を迂回しやすいモデルほど外部にも推論を書かない傾向がある。GPT-OSS-120Bは感情問題の99%、トピック分類の100%で多段階推論を生成するが、医療問題では38%にとどまり、62%では答えの文字だけを出した。
この傾向は無作為には見えない。感情とトピック分類ではほぼ常に説明するモデルが、医療では一文字回答へ切り替わる。手順レベル試験には分析できる文章チェーンが必要なため、一トークンだけで答えるモデルは同じ方法で評価できず、外部推論の欠如そのものが測定を妨げる。
結論
論文は、高いリスクを伴う用途向けのモデルを精度だけでなく推論の忠実性でも検査すべきだと結論づける。精度が2%低くても本当に推論し、その過程を反映した説明をするモデルの方が、規制上の説明要件を満たし、監査や障害分析に役立つ可能性がある。
流暢な説明は、それ自体では判断根拠の証拠にならない。段階を除く、単独で使う、並べ替えるという低コストの介入によって、表示された論理が答えを生んだのか、それとも既に決めた答えを飾っただけなのかを区別する必要がある。
* 筆者が著者の文中引用をハイパーリンクに変換した。
† 論文は小型モデルの完全な一覧を示しておらず、同一モデルの追加バリエーションも含むため、一覧には推定が必要になる。
†† 強調は論文著者による。
2026年3月25日初出。












