Andersonの視点

コーディングAIはダニング=クルーガー効果に陥りやすい

mm
Unite.AI を Google の優先ソースに追加
ChatGPT-4o: 'A photorealistic panoramic image showing a small, humble robot inside a traveling funfair hall of mirrors. The robot looks at its own reflection in a warped mirror that shows a much larger, powerful version of itself. The setting includes vivid carnival lights, reflective surfaces, and a wide horizontal composition.' Plus Adobe Firefly.

新たな研究により、ChatGPTのようなコーディングAIにもダニング=クルーガー効果が見られ、能力が最も低いときほど強い自信を示すことが明らかになった。未知またはマイナーなプログラミング言語に取り組む際、回答が崩れていても高い確信を主張する。研究は、モデルの過信を低い性能と訓練データ不足の双方に結び付け、システムが「自分の知らないこと」を実際にどこまで把握しているのかという新たな懸念を提起する。

事実について大規模言語モデルと少しでも対話した人なら、LLMがしばしば自信満々に誤った回答を返すことを知っている。

明白なハルシネーションに加え、この根拠のない自信の理由は完全には分かっていない。夏に発表された研究は、モデルが誤りを認識していても自信を持って答えると示した。一方、過信をアーキテクチャ上の選択などに帰する説もある。

利用者にとって確かなのは、この体験が非常に苛立たしいことだ。人間は他者による自己能力の評価を信頼するようにできている。人間なら過大な約束と不十分な成果には法的その他の責任が伴うからだ。擬人化による転移から、会話型AIにも同じ信頼を寄せてしまう。

しかしLLMは責任を負わない。重要なものを誤って破壊させたり、午後を無駄にさせたりした後で「おっと、手が滑った」と返せる存在であり、そもそも責任を認める保証もない。

さらに悪いことに、この慎重さの欠如はプロンプトでは取り除けないように見える。ChatGPTは助言の正しさを繰り返し保証し、損害が起きた後で初めて思考の欠陥を説明する。永続メモリの更新も、指示の反復もほとんど効果がない。

人間にも頑固さや自己欺瞞はあるが、これほど深刻な誤りを頻繁に犯す人は早々に解雇されるだろう。これは能力以上に昇進したのではと恐れるインポスター症候群の反対で、課題を遂行する自分の能力を大幅に過大評価するダニング=クルーガー効果である。

膨らんだ自信の代償

Microsoftの新しい研究は、同社のCopilotのようなAI支援コーディング・アーキテクチャの性能に関連して、ダニング=クルーガー効果を検討した。このLLM分野を直接扱う初の研究である。

数十のプログラミング言語を対象に、コード生成AIが自らの回答をどれほど確信しているかと、実際の成績を比較した。その結果、人間と似た明確なパターンが現れた。モデルは能力が最も低いときに最も自信を示した。

訓練データが乏しいマイナー言語や低リソース言語で効果は最も強かった。モデルが弱いほど、また言語が珍しいほど、能力の錯覚は大きかった。

各プログラミング言語におけるGPT-4oの実際の性能と認識された性能

実際の性能順に並べた、各プログラミング言語におけるGPT-4oの実性能と自己評価。 出典: https://arxiv.org/pdf/2510.05457

Microsoft (MSFT ) に所属する4人の共同筆頭著者は、この結果が、ツール自身による出力評価をどこまで信頼できるのかという疑問を投げかけると述べる。

多様なプログラミング言語における自信と性能を分析すると、AIモデルは、とりわけ未知または低リソース領域で、人間の過信パターンを反映している。能力の低いモデルや珍しい言語で動作するモデルは、より強いDKE型バイアスを示し、その強さはモデル能力に比例する。これは人間を対象とした実験とも一致する。

研究者は、性能が低いときモデルの自信がどう信頼できなくなるかを理解し、人間と同種の過信をAIが示すかを検証する研究として位置付ける。信頼性と実運用に直接的な意味を持つ。

論文の題名は Do Code Models Suffer from the Dunning-Kruger Effect? である。著者はコードを公開したとするが、現行のプレプリントには詳細がない。

方法

研究ではPythonやJavaからPerl、COBOLまで、特定言語に属する数千の多肢選択式プログラミング問題を与え、コーディングAIが自分の回答をどれほど正確に評価できるかを調べた。

研究で使われたプログラミング言語と各領域の問題数

研究で使われた言語領域と、各領域から抽出された多肢選択式問題数。

モデルは正解を選び、その選択にどれほど自信があるかを推定した。正答率が実際の性能、自己評価した確信度がモデル自身の認識である。両者の比較により、自信と能力が乖離する場所が分かる。

確信度は「絶対的自信」と「相対的自信」の2方式で測定した。前者では各回答に0から1の点数を付け、各言語における平均を算出した。

後者では2つの問題のどちらにより自信があるかを答えさせた。選択は本来対戦ゲーム向けのランキング方式で採点し、各問題を試合の選手のように扱った。得点を正規化し、言語別に平均して相対的自信を得た。

論文はDKEの2形態を検証する。参加者内DKEは、1つのモデルが成績の悪い言語ほど過信するかを調べる。参加者間DKEは、全体的に成績の悪いモデルほど自己評価が高いかを問う。どちらも自信と実性能の差を過信の指標とし、低成績条件で差が大きいほどDKE型行動が強い。

結果

6つの大規模言語モデルを調べた:Mistral、Phi-3、DeepSeek-Distill、Phi-4、GPT-0.1、GPT-4o。公開CodeNetデータセットの37言語を使い、馴染み深い領域と未知の領域で自信と精度がどう変わるかを比較した。

モデル間分析には明確なダニング=クルーガー型のパターンが現れた。

6つのコードモデルにおける実際の性能と認識された性能

MistralやPhi-3のような低性能モデルは精度が低くても高い自信を示し、GPT-4oのような強いモデルはより適切に調整され、ときには自信が実力を下回った。

MistralとPhi-3は能力を過大評価する傾向があり、GPT-4oの自信は実性能、特に相対的自信による評価とよく一致した。最も能力の高いモデルは、ときに自己評価が低すぎる場合もあった。絶対的自信だけではこの傾向を捉えられない。

モデル内分析もDKEを支持した。COBOL、Prolog、Ceylonのような珍しい低リソース言語では、成績が悪いにもかかわらず自信が不当に高かった。PythonやJavaScriptでは自信が実際の精度に近く、ときにはそれを下回った。絶対・相対の両指標で同じ傾向が見られ、未知の領域ほどモデルは自らの限界を認識しにくい。

モデルを参加者として扱うことには、数が少ない、同じモデル内の出力差を無視する、データ分布が人間を反映しない可能性があるという制約がある。このため3つの代替設定を試した。各モデルに異なるペルソナを与える、より高いtemperatureで多様な回答を得る、プロンプトを複数回言い換えて各版を別の参加者とみなす、という方法である。

異なる実験設定での過信と実性能の相関

ダニング=クルーガー型パターンは全条件で維持され、同じモデルから高いtemperatureで複数の多様な回答を採取した場合に最も強かった。

認識された性能と実性能の乖離を理解するため、絶対的自信と相対的自信を比較し、各モデルの過大評価量、つまり自信と実精度の差が真の性能とどう関係するかを測定した。

過信と実際の精度の相関

プログラミング領域とモデル種別の双方で、過大評価が大きいほど性能が低かった。

言語間でもモデル間でも、精度の低いモデルほど強い過信を示した。さらに狭い領域で訓練された専門モデルは、汎用モデルより強いDKEを示した。

基本モデル、単一領域モデル、複数領域モデルにおける過大評価と性能

専門性が高まるほどDKEが強くなった。

8言語のMultiPL-Eデータセットでは、単一領域の訓練が複数領域や基本設定より大きな過信をもたらし、専門化がDKEを悪化させる可能性を示した。

珍しい言語ほどモデルが過信する傾向も確認された。GitHub、IEEE、TIOBEの人気ランキングでは、希少性と認識された自信が強く相関し、最大0.797に達した。

モデルの過信と言語の希少性の相関

3つの人気ランキングで、一般的でない言語ほど認識された性能が高かった。

最後に、Ada、Dart、Prolog、Swift、C++、Python、C#、ElixirでMultiPL-Eを用いたコード生成を評価した。効果は残ったが、多肢選択問題より弱かった。自由回答課題では自信と正解の評価が難しいことを反映している可能性が高い。

自由形式コード生成における過大評価と実性能の相関

8言語のMultiPL-E結果に基づく、自由形式コード生成での過大評価と実性能の相関。

著者は、DKEについて今も議論される説明を検討し、人間とAIに共通し得る一つの原因としてメタ認知を挙げる。技能の成果の質を評価する能力そのものが、技能を獲得する重要な一部だという説明である。異なる訓練戦略が性能と自己評価能力を同時に改善するかは、制御研究で検証できるが、本論文の範囲を大きく超えるため将来の研究に委ねられた。

結論

人間を扱う本来の領域でも、ダニング=クルーガー効果の原因は統計的とも認知的とも考えられる。統計的原因なら、これまで人間固有とされた症候群を機械学習に適用することは妥当である。双方の原因を「認知的」とするには、やや形而上学的な立場が必要だろう。

最も興味深いのは、複数のコーディングLLMが最も不利な状況で一層強く断言する点である。データが最も少ない、または最も未知の言語に対処するときに最大の自信を示す戦略は、現実の職場ならほぼ即座に自滅につながる。

* 対象言語はAda、Bash、C、C#、C++、COBOL、Ceylon、Clojure、D、Dart、Dash、Elixir、Erland、F#、Fortran、Go、Haskell、Java、JavaScript、Julia、Lisp、Kotlin、Lua、OCaml、Objective-C、PHP、Pascal、Perl、Prolog、Python、Racket、Ruby、Rust、Scala、Swift、TypeScript、Visual Basic。

初出:2025年10月8日(水)。

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai