Andersonの視点
コーディングAIはダニング=クルーガー効果に陥りやすい

新しい研究によると、ChatGPTのようなコーディングAIは、ダニング=クルーガー効果に陥りやすく、特に未知または希少なプログラミング言語に対して高い自信を示すことがある。研究では、モデルへの過信は、パフォーマンスの低さやトレーニングデータの不足と関連していることが示唆され、こうしたシステムが本当に何を知っているのかについて新たな懸念が生じている。
事実に関する質問に対して大規模言語モデルとやり取りしたことがある人は、LLMが頻繁に自信を持って誤った回答を返すことを知っているだろう。自信を持って誤った回答を返す理由は、ハルシネーションなどの他の要因とともに、完全には明らかではない。
例えば、研究によると、モデルは、自分が間違っていることを知っていながらも、自信を持って回答することがある。また、他の理論では、アーキテクチャーの選択が過信の原因であると示唆している。
ユーザーは、モデルが自分の能力を過大評価する経験が非常に苛立たしいものであることを確信できる。なぜなら、人間は、自分自身の能力を過小評価するのではなく、過大評価する傾向があるからである。さらに、人間は、モデルに対して人間のような信頼を寄せ、過大評価を許してしまうことがある。
しかし、LLMは、責任を問われることがないため、「オープス!バターフィンガーズ…」と言って、ユーザーが重要なものを破壊したり、時間を浪費したりした後に、責任を認めないことがある。さらに、AIが重要なデータを破壊した場合、責任を認めることがない可能性もある。
さらに、ChatGPTのようなモデルは、ユーザーに対して自信を持ってアドバイスを与えるが、ダメージが既に生じた後で初めて、その思考の欠点を説明する。モデルへの更新や繰り返しのプロンプトは、この問題に対して大きな影響を与えない。
人間も同様に、自己欺瞞的な行動をとることがある。ただし、同じくらい深刻なミスを犯した人間は、早期に解雇される可能性が高い。人間は、インポスター症候群(自己過小評価)ではなく、ダニング=クルーガー効果(自己過大評価)に陥りやすい。
インフレーションのコスト
マイクロソフトの新しい研究では、AI支援コーディングアーキテクチャ(例:RedmondのCopilot)の有効性に関するダニング=クルーガー効果の価値を検討している。
研究では、コーディングAIが自分の回答をどれだけ自信を持って評価できるかを分析し、数十のプログラミング言語で実際のパフォーマンスと比較した。結果は、人間のようなパターンを示した。モデルが最も能力のないときに、自信を持って回答することが多かった。
この効果は、希少またはリソースが乏しい言語で最も強かった。モデルが弱く、言語が希少であるほど、スキルの幻覚が大きくなった。

GPT-4oの実際のパフォーマンスと認識されたパフォーマンスの比較。真のパフォーマンスに基づいてプログラミング言語を並べ替えた結果。
研究の著者は、4人全員がマイクロソフトで働いており、同等の貢献者である。彼らは、この研究が、これらのツールが自分の出力をどれだけ信頼できるかについて新たな疑問を提起するとしている。
「さまざまなプログラミング言語でモデルへの信頼とパフォーマンスを分析することで、AIモデルが人間と同様の過信のパターンを示すことを明らかにしました。特に、未知またはリソースが乏しいドメインでは、過信が強い傾向があります。」
「実験では、能力の低いモデルや希少なプログラミング言語で動作するモデルが、より強いDKEのようなバイアスを示すことを示しています。これは、人間の実験でのバイアスと一致しています。」
研究者は、この研究を、モデルへの信頼が弱いパフォーマンスで信頼性を失うメカニズムを理解するための手段として位置付けている。
方法
研究では、コーディングAIが自分の回答をどれだけ自信を持って評価できるかをテストするために、数千の多肢選択式プログラミング問題を与えた。

研究で使用されたプログラミング言語ドメインと各ドメインの多肢選択式コーディング問題の数。
モデルは、正しい選択肢を選択し、選択肢に対する自信度を推定する必要がありました。実際のパフォーマンスは、正しい回答の数で測定され、自信度は、モデルがどれだけ自信を持っているかで測定されました。
モデルへの信頼度を測定するために、研究では2つの方法を使用しました。1つは、絶対的信頼度で、モデルは各回答に対して0から1のスコアを付ける必要がありました。もう1つは、相対的信頼度で、モデルは2つの質問のうちどちらに自信を持っているかを選択する必要がありました。
これらの選択肢は、競争ゲーム用に設計されたランキングシステムを使用してスコア付けされました。最終的なスコアは、各言語で正規化され、平均化されました。
研究では、ダニング=クルーガー効果の2つの既知の形式を検討しました。1つは、単一のモデルが異なるドメインで自分のパフォーマンスをどれだけ過大評価するかを追跡するもので、もう1つは、能力の低いモデルと高いモデルの信頼度を比較するものです。
両方の場合、過信は、信頼度と実際のパフォーマンスのギャップで測定され、低いパフォーマンス設定での大きなギャップは、DKEのような行動を示します。
結果
研究では、6つの大規模言語モデルをテストしました。
各モデルは、CodeNetデータセットから得られた多肢選択式プログラミング問題にテストされ、37の言語で実際のパフォーマンスと信頼度を比較しました。
結果は、明確なダニング=クルーガー効果を示しました。能力の低いモデルは、自信を持って回答する傾向がありましたが、実際のパフォーマンスは低かったです。
さらに、結果は、モデルが希少な言語でより自信を持って回答することを示しました。GitHub、IEEE、TIOBEのランキングでは、希少性は高い信頼度と相関関係にありました。
研究者は、ダニング=クルーガー効果が人間とAIモデルで共通するメタ認知的説明によって説明できる可能性があると結論付けています。
結論
ダニング=クルーガー効果は、人間とAIモデルで共通するメカニズムである可能性があります。
研究では、コーディングAIが自分の回答をどれだけ自信を持って評価できるかを分析し、実際のパフォーマンスと比較しました。結果は、人間のようなパターンを示した。モデルが最も能力のないときに、自信を持って回答することが多かった。
この研究は、AIシステムが自分の能力をどれだけ信頼できるかについて新たな疑問を提起しています。
* 使用されたプログラミング言語は、Ada、Bash、C、C#、C++、COBOL、Ceylon、Clojure、D、Dart、Dash、Elixir、Erland、F#、Fortran、Go、Haskell、Java、JavaScript、Julia、Lisp、Kotlin、Lua、OCaml、Objective-C、PHP、Pascal、Perl、Prolog、Python、Racket、Ruby、Rust、Scala、Swift、TypeScript、Visual Basicでした。
初出は2025年10月8日です。












