AI 模型与平台
研究揭示大型语言模型在复杂性增加时默认使用简单推理

一组研究人员 发表了一项全面研究,于11月20日分析了超过192,000个来自 大型语言模型(LLMs) 的推理轨迹,揭示了人工智能系统依赖于浅层、线性策略,而不是人类自然采用的分层认知过程。
研究团队检查了18个不同的模型,涵盖文本、视觉和音频推理任务,并将它们的方法与专门为本研究收集的54个人类思考轨迹进行比较。分析建立了一个包含28个认知元素的分类法,包括计算约束、元认知控制、知识表示和转换操作——提供了一个框架,不仅可以评估模型是否产生正确答案,还可以评估它们如何得出这些结论。
认知架构的基本差异
人类推理一致地表现出分层嵌套和元认知监控的能力——反思和调节自己的思维过程。人类可以流畅地组织信息到嵌套结构中,同时积极地跟踪自己的进度,应对复杂问题。
大型语言模型主要使用浅层向前链接,逐步解决问题,而没有人类认知所特有的分层组织和自我反思。这种差异在任务不明确或模糊时变得最为明显,人类的适应性在这种情况下远远超过了人工智能方法。
研究发现,语言模型具有与成功推理相关的行为组成,但往往无法自发地部署它们。性能因问题类型而大幅度变化:困境推理表现出最高的方差,小型模型在困境推理中挣扎显著,而逻辑推理表现出中等性能,大型模型通常优于小型模型。模型表现出违反直觉的弱点,能够解决复杂任务,但在简单变体上失败。
通过引导推理实现性能改进
研究团队开发了测试时推理引导,自动构建成功的认知结构,证明了当模型被提示采用更类似人类的推理方法时,复杂问题的性能可以提高多达66.7%。这一发现表明,大型语言模型具有更复杂推理的潜在能力,但需要明确的引导来有效地使用它们。
人类和人工智能推理之间的差距随着任务复杂性的增加而扩大。虽然模型可以通过单纯的向前链接来处理直接的问题,但它们在处理人类自然部署的递归、自我监控策略时会挣扎,这些策略通常用于应对模糊或多层次的挑战。
研究的公开可用数据集为未来比较人工智能和人类智力的研究提供了一个基准。通过绘制28个不同的认知元素,框架使研究人员能够准确指出人工智能推理在哪里出现问题,而不是简单地测量准确性得分。
对人工智能开发的影响
研究结果强调了当前人工智能系统的一个基本限制:计算能力和真正的认知复杂性之间的差距。训练在大量数据集上的模型可以通过模式匹配的方式得出正确答案,但缺乏反思、分层思考,这是人类问题解决的特征。
这项研究建立在人们越来越担心 人工智能推理限制 的基础上,这些限制已经在多个领域被识别出来。引导推理的性能改进表明,更好的提示策略和架构修改可以帮助模型更有效地访问其潜在的推理能力。
研究的最大贡献可能是其详细的认知元素分类法,为研究人员和开发人员提供了具体的改进目标。该框架将推理视为一个可测量的组成部分,而不是一个单一的能力,这些组成部分可以通过训练修改或提示工程技术来单独解决。该框架提供了一个细致入微的理解人工智能推理的方式,使得开发人员可以专注于改进特定的认知能力,而不是简单地提高整体性能。












