Anderson 视角

编码AI容易受到杜林-克鲁格效应的影响

mm
将 Unite.AI 添加到您在 Google 上的首选来源
ChatGPT-4o: 'A photorealistic panoramic image showing a small, humble robot inside a traveling funfair hall of mirrors. The robot looks at its own reflection in a warped mirror that shows a much larger, powerful version of itself. The setting includes vivid carnival lights, reflective surfaces, and a wide horizontal composition.' Plus Adobe Firefly.

最新研究表明,编码AI(如ChatGPT)容易受到杜林-克鲁格效应的影响,往往在最不胜任的情况下表现出最大的自信。当处理不熟悉或晦涩的编程语言时,它们会声称自己很有把握,即使答案并不正确。该研究将模型的过度自信与糟糕的性能和缺乏训练数据联系起来,引发了人们对这些系统真正了解自己能力的担忧。

 

任何与大型语言模型(LLM)交互过的人都知道,LLM经常会自信地给出错误的答案。这种现象的原因尚不完全清楚,可能是由于模型的过度自信,即使知道自己是错的,也会给出自信的答案;或者是由于模型的架构选择等其他因素。

最终用户可以确定的是,这种体验非常令人沮丧,因为我们天生倾向于相信人们对自己能力的估计(尤其是因为在这种情况下,有法律和其他后果的制约)。我们也倾向于将这种行为延伸到对话式AI系统上。

但是,LLM是一个不可问责的实体,它可以在造成损害后简单地说“哎呀,我犯了错误”,而不承担任何责任;而人类则会为自己的错误承担责任,包括法律和其他后果。

这种缺乏谨慎的行为似乎很难通过提示来改变,至少在ChatGPT中,它会大量地向用户保证其建议的有效性,并且只有在造成损害后才会解释其思考中的缺陷。更新系统的持久内存或使用重复的提示似乎对这个问题没有太大的影响。

人们也可能表现出类似的固执和自欺行为,但如果有人犯了这么多错误,可能会很快被解雇。这种情况下,人们会表现出与“冒名顶替综合征”(即一个人担心自己被提拔到超出自己能力的职位)相反的行为,即杜林-克鲁格效应,其中一个人会显著高估自己的能力。

通货膨胀的成本

微软的一项新研究检查了杜林-克鲁格效应在AI辅助编码架构(如Redmond自己的Copilot)中的价值,这是首次专门研究LLM的这个子领域。

该研究分析了这些代码编写AI如何评估自己的答案的自信度与其实际性能之间的关系,跨越了几十种编程语言。结果显示出一种类似人类的模式:当模型最不胜任时,它们最自信。

这种效果在晦涩或资源匮乏的语言中最为明显,即训练数据稀少的地方——模型越弱或语言越罕见,技能的幻觉就越大。

GPT-4o的实际和感知性能跨编程语言,按真实性能排序。来源:https://arxiv.org/pdf/2510.05457

GPT-4o的实际和感知性能跨编程语言,按真实性能排序。 来源:https://arxiv.org/pdf/2510.05457

四位作者都是微软的员工,他们认为这项工作提出了关于这些工具可以被信任来评估自己输出的程度的新问题,并且他们声明:

‘通过分析模型的自信度和性能跨多种编程语言,我们揭示了AI模型模仿人类的过度自信模式,特别是在不熟悉或资源匮乏的领域。 ‘

‘我们的实验表明,能力较差的模型和在罕见编程语言中运行的模型表现出更强的DKE偏差,表明偏差的强度与模型的能力成比例。这种现象与人类实验中的偏差一致。 ‘

研究人员将这项研究放在了解模型自信度如何变得不可靠的背景下,特别是在性能较差的情况下,并测试AI系统是否表现出与人类相同的过度自信的行为。

方法

该研究测试了编码AI评估自己答案的准确性,通过给它们数千个多选编程问题,每个问题属于特定的语言领域,从Python和Java到Perl和COBOL:

研究中使用的编程语言领域,以及每个领域采样的多选编码问题数量。

研究中使用的编程语言领域,以及每个领域采样的多选编码问题数量。

模型被要求选择正确的选项,并估计它们对自己的选择的自信度,其实际性能由正确答案的数量来衡量——而它们的自我评估的自信度则表明它们认为自己有多好。

为了衡量模型的自信度,研究使用了两种方法:绝对自信度和相对自信度。在第一种方法中,模型被要求为每个答案提供一个从0到1的评分,其自信度由这些评分的平均值来定义。

第二种方法检查模型在选择两个问题时的自信度;对于每对问题,模型必须指出哪一个问题它更有把握。这些选择使用竞争游戏中设计的排名系统来评分,模型的最终评分被归一化并平均以获得相对自信度评分。

结果

该研究测试了六个大型语言模型:Mistral、Phi-3、DeepSeek-Distill、Phi-4、GPT-0.1和GPT-4o。

每个模型都在多个编程语言上进行了测试,包括37种语言,以显示自信度和准确性在熟悉和晦涩的编码领域中的变化。

结果显示出明显的杜林-克鲁格模式:

六个代码模型的实际和感知性能,显示低性能模型(如Mistral和Phi-3)尽管准确性较差却表现出高自信度,而更强大的模型(如GPT-4o)则显示出更平衡或甚至低估的行为。

六个代码模型的实际和感知性能,显示低性能模型(如Mistral和Phi-3)尽管准确性较差却表现出高自信度,而更强大的模型(如GPT-4o)则显示出更平衡或甚至低估的行为。

准确性较低的模型,如Mistral和Phi-3,倾向于高估自己的能力,而更高性能的系统,如GPT-4o,显示出更平衡的自信度和实际性能,特别是在相对自信度方面。

结果还表明,最强大的模型可能会低估自己的能力(这种模式不会被绝对自信度评分捕获)。

结果还支持了杜林-克鲁格效应的存在。在结果图表中,我们可以看到每个模型在不同编程语言中的性能,按实际性能排序。

在模型性能较差的语言中,特别是在罕见或资源匮乏的语言中,如COBOL、Prolog和Ceylon,模型的自信度明显高于其结果所证明的水平。在像Python和JavaScript这样的流行语言中,模型的自信度更接近其实际准确度,有时甚至低于其实际准确度。

这种模式出现在绝对和相对自信度衡量中,表明模型在不熟悉的编码领域中对自己的局限性了解较少。

为了更好地理解感知性能与实际性能的差异,研究比较了绝对和相对自信度估计,通过计算每个模型高估自己的能力的程度,并测量这种高估与模型的实际性能的关系。

结果表明,模型的过度自信与其实际性能之间存在强烈的相关性,特别是在多个响应被采样自同一个模型的情况下。

研究还发现,模型在罕见的编程语言中往往表现出更高的过度自信。根据GitHub、IEEE和TIOBE的排名,语言的罕见性与模型的过度自信度之间存在强烈的相关性,相关系数达到0.797。

最后,作者测试了杜林-克鲁格效应是否出现在代码生成中,通过评估模型在MultiPL-E数据集上的性能,跨八种编程语言。

虽然这种效果仍然存在,但它比在多选题设置中要弱,可能是由于开放式任务中评估自信度和正确性的困难所致。

结论

即使在其本土领域,杜林-克鲁格效应也可能归因于统计或认知原因。如果归因于统计原因,将这种独特的人类综合征应用于机器学习背景是有效的。

虽然作者推测其原因可能在于认知,但这需要一个更为形而上学的立场。

该论文中最有趣的发现可能是编码LLM在最不利的情况下倾向于加倍下注,即在处理最稀疏或最不为人知的语言时表现出最大程度的自信——这在现实世界的工作环境中将是一种几乎自我毁灭的策略。

 

* 研究中使用的编程语言包括Ada、Bash、C、C#、C++、COBOL、Ceylon、Clojure、D、Dart、Dash、Elixir、Erland、F#、Fortran、Go、Haskell、Java、JavaScript、Julia、Lisp、Kotlin、Lua、OCaml、Objective-C、PHP、Pascal、Perl、Prolog、Python、Racket、Ruby、Rust、Scala、Swift、TypeScript和Visual Basic。

首次发布于2025年10月8日星期三

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai