AI 模型与平台

为什么大型语言模型在简单谜题上过度思考却放弃了困难的问题

mm
将 Unite.AI 添加到您在 Google 上的首选来源

人工智能取得了显著的进步,大型语言模型(LLMs)和其高级版本的大型推理模型(LRMs)重新定义了机器处理和生成类似人类文本的方式。这些模型可以撰写文章,回答问题,甚至解决数学问题。然而,尽管它们具有令人印象深刻的能力,这些模型表现出奇怪的行为:它们经常过度复杂化简单的问题,同时难以解决复杂的问题。苹果公司研究人员最近的一项研究为这一现象提供了宝贵的见解。本文探讨了为什么LLMs和LRMs表现出这种行为,以及这对人工智能的未来意味着什么。

了解LLMs和LRMs

为了了解为什么LLMs和LRMs表现出这种行为,我们首先需要明确这些模型是什么。LLMs,例如GPT-3或BERT,在大量文本数据上进行训练,以预测序列中的下一个单词。这使得它们在文本生成、翻译和摘要等任务中表现出色。然而,它们并不是为推理而设计的,推理涉及逻辑推导或问题解决。

LRMs是一类新型模型,旨在解决这一问题。它们采用了链式思维(CoT)提示等技术,其中模型在提供最终答案之前生成中间推理步骤。例如,当解决数学问题时,LRM可能会将其分解为步骤,就像人类一样。这种方法提高了复杂任务的性能,但在处理不同复杂度的问题时面临挑战,如苹果公司的研究所示。

研究研究

苹果公司的研究团队采用了不同的方法来评估LLMs和LRMs的推理能力。他们创建了受控的谜题环境,包括塔罗汉诺伊、跳棋、河流过渡和积木世界等著名谜题。通过系统地调整这些谜题的复杂度,同时保持一致的逻辑结构,研究人员观察到模型在不同难度水平下的表现。这一方法使他们能够分析不仅仅是最终答案,还有推理过程,这为我们提供了对这些模型如何“思考”的更深入的了解。

关于过度思考和放弃的发现

该研究确定了三个不同的性能模式,基于问题的复杂度:

  • 在低复杂度水平上,标准LLMs通常比LRMs表现更好,因为LRMs倾向于过度思考,生成不必要的额外步骤,而标准LLMs更高效。
  • 对于中等复杂度的问题,LRMs表现出更好的性能,得益于它们生成详细推理跟踪的能力,这有助于它们有效地解决这些挑战。
  • 对于高复杂度的问题,LLMs和LRMs都完全失败;LRMs尤其会经历准确性的完全崩溃,并减少其推理努力,尽管问题的复杂度增加。

对于简单的谜题,例如只有一个或两个盘子的塔罗汉诺伊,标准LLMs更高效地提供正确答案。然而,LRMs经常过度思考这些问题,生成冗长的推理跟踪,即使解决方案很简单。这表明LRMs可能会模仿其训练数据中的夸张解释,这可能会导致低效率。

为什么会发生这种情况

简单谜题的过度思考可能源于LLMs和LRMs的训练方式。这些模型从包含简洁和详细解释的庞大数据集中学习。对于简单的问题,它们可能会默认生成冗长的推理跟踪,模仿其训练数据中的详细示例,即使直接答案就足够了。这一行为并不是缺陷,而是它们训练的反映,优先考虑推理而不是效率。

在复杂谜题上的失败反映了LLMs和LRMs无法学习概括逻辑规则。随着问题复杂度的增加,它们对模式匹配的依赖会崩溃,导致推理不一致和性能崩溃。研究发现,LRMs未能使用显式算法,并且在不同谜题上推理不一致。这凸显了虽然这些模型可以模拟推理,但它们并没有真正像人类一样理解潜在的逻辑。

多样化的观点

这项研究在人工智能社区引发了讨论。一些专家认为,这些发现可能被误解。他们认为,虽然LLMs和LRMs可能不会像人类一样推理,但它们在某些复杂度限制内仍然表现出有效的解决问题的能力。他们强调,人工智能中的“推理”不需要模仿人类认知才能具有价值。

影响和未来方向

该研究的发现对人工智能开发具有重大影响。虽然LRMs代表了模拟人类推理的进步,但它们在处理复杂问题和扩展推理努力方面的局限性表明,当前的模型远远没有达到普遍推理的能力。这凸显了需要新的评估方法的必要性,这些方法应关注推理过程的质量和适应性,而不仅仅是最终答案的准确性。

未来的研究应致力于提高模型准确执行逻辑步骤和根据问题复杂度调整推理努力的能力。开发反映现实世界推理任务的基准,例如医学诊断或法律辩论,可以提供对人工智能能力的更有意义的见解。此外,解决模型过度依赖模式识别和提高其概括逻辑规则的能力将是推进人工智能推理的关键。

结论

该研究对LLMs和LRMs的推理能力进行了批判性的分析。它表明,虽然这些模型会过度分析简单的谜题,但它们在更复杂的谜题上却难以解决,暴露了它们的优势和局限性。尽管它们在某些情况下表现良好,但它们无法解决高度复杂的问题凸显了模拟推理和真正理解之间的差距。该研究强调了开发能够跨不同复杂度水平适应性推理的人工智能系统的必要性,使其能够解决具有不同复杂度的问题,就像人类一样。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。