زاوية Anderson

طريقة “زين” لمنع نماذج اللغة من الخيال

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image: A robot sits in front of a laptop and a 'Eureka!' light-bulb lights up over its head. Z-Image, Qwen Edit (509), and Firefly V3

告诉 ChatGPT 在解决实际问题之前检查随机答案,这使得它思考得更深入,并且更经常地得到正确答案,即使前面的 “随机” 答案与实际查询无关。

 

有一篇来自中国的有趣论文开发了一种非常低成本的方法,防止语言模型(如 ChatGPT)出现 幻觉,并提高答案质量:让模型首先检查一个 完全无关 的问题的答案:

一个无关的问题的例子,可以 “解放” 语言模型的 “心智”,并帮助它专注于后续的真实查询。 来源

这种 禅拍 是一种非常廉价的提高性能的方法,相比其他更复杂的方法,如 微调提示工艺并行采样,它适用于开源和闭源模型,表明这是一个基本的特征,共同于多个语言模型架构(而不是特定于某些训练材料或方法的脆弱特征)。

作者概述了这种方法的规模经济:

‘要实现最小的额外先验知识,VF 只需要在提示中提供一个随机的/琐碎的答案。验证过程的输出令牌比普通的 CoT 路径少,[有时] 甚至没有明确的验证过程,因此 [需要] 非常 [少] 额外的测试时间计算.’

在测试中,这种方法 —— 被称为 验证优先 (VF) —— 能够提高各种任务的响应,包括数学推理,在开源和商业平台上。

这种技术之所以有效的部分原因可能在于语言模型吸收和适应人类心理学趋势的方式,因此直接的问题可能使模型变得 “防御” 和 “紧张”,而要求验证他人的工作则不会引发这些 “生存本能”。

核心思想是,验证答案 需要的努力比从头生成少,并且可以触发一种不同的推理路径,补充标准的 连锁思维

提示模型批判性地检查给定的答案(即,模型没有参与创建的答案)也可能激活一种批判性思维,帮助避免模型对自己的第一印象过于自信。

该工作将该过程描述为 逆向推理路径

从提出的答案开始,逆向推理到问题,可以暴露从问题本身推理时更难发现的捷径或洞察。这条 “逆向路径” 可能遵循更简单的轨迹,并提供补充信息给标准的连锁思维推理。

研究人员还将这一核心概念具体化为 Iter-VF,一种顺序时间测试缩放方法,迭代地改进答案,避免了自我纠正策略中常见的错误积累问题。

新工作 的标题为 让语言模型首先验证几乎是免费的,来自清华大学电子工程系的两位研究人员。

方法

该新工作的核心思想是反转语言模型中的常规推理流程。不是要求模型从头解决问题,而是先给模型一个候选答案(通常是错误或任意的),然后要求模型检查该答案是否有意义。

这会促使模型 逆向推理,从提出的答案向问题逆向推理。一旦验证完成,模型就会按照通常的方式解决原始问题。

这种逆转,论文断言,减少了粗心的错误,并鼓励一种更具反思性的推理方式,帮助语言模型发现隐藏的结构,并避免误导性的假设。

如下所示,即使提示模型验证一个明显错误的猜测,如 ’10’ ,也可以帮助它从有缺陷的逻辑中恢复过来,并优于标准的连锁思维提示:

首先提示模型验证一个猜测的答案,可以帮助它发现不一致性,并更仔细地处理问题。在这个例子中,标准方法导致一个流畅但错误的解决方案,而验证优先提示触发了一个更清晰的逻辑结构和正确的结果。

首先提示模型验证一个猜测的答案,可以帮助它发现不一致性,并更仔细地处理问题。在这个例子中,标准方法导致一个流畅但错误的解决方案,而验证优先提示触发了一个更清晰的逻辑结构和正确的结果。

对于许多实际问题来说,提供一个猜测让模型检查并不是那么容易,尤其是当任务是开放式的,例如编写代码或调用 API。因此,为了更好地适应,该方法首先给出它的最佳答案,然后将该答案反馈到验证优先格式中。在这种方式下,模型检查并改进了自己的输出:

当模型被要求验证它自己的早期输出时,它会捕获到逻辑中的缺陷,并用正确的解决方案重写。验证优先提示帮助它专注于特定的错误,而不是重复相同的错误。

当模型被要求验证它自己的早期输出时,它会捕获到逻辑中的缺陷,并用正确的解决方案重写。验证优先提示帮助它专注于特定的错误,而不是重复相同的错误。

这种方法构成了上述 Iter-VF。模型重复这个循环,每次都改进答案,而不需要重新训练或专用工具。与其他自我纠正策略不同,Iter-VF 每次只考虑最近的答案,这有助于保持其推理清晰。

数据和测试

作者在四个领域评估了该方法:一般推理任务,其中 VF 被随机猜测初始化;时间敏感任务,其中 Iter-VF 与其他缩放方法进行比较;开放式问题,例如编码和 API 调用,其中 VF 使用模型自己的早期答案;以及 闭源商业语言模型,其中内部推理步骤是不可访问的。

为了测试该方法,研究人员使用了三个推理基准:GSM8KMATH500,用于数学问题;以及 GPQA-Diamond,用于研究生级科学问题。

在每种情况下,模型都被给予一个琐碎的猜测,例如数字答案的 ‘1’,或一个随机排列的多选项作为验证的起点。没有添加特殊的调优或先验知识,比较基准是标准的零次连锁思维提示。

测试遍历了 Qwen2.5Llama3 指令调优模型,从 1B 到 72B(参数)大小。使用的 Qwen 模型是 Qwen2.5-1.5B-InstructQwen2.5-3B-InstructQwen2.5-14B-InstructQwen2.5-72B-Instruct。Llama3 变体是 Llama3.2-1B-InstructLlama3.2-3B-InstructLlama3.1-8B-InstructLlama3.3-70B-Instruct

如图所示,验证优先提示的改进在所有模型规模上保持稳定,甚至在 1B 参数时就有明显的改进,并且一直持续到 72B:

在 Qwen2.5 和 Llama3 家族的所有模型大小上,验证优先提示始终优于标准的连锁思维提示,在 GSM8K、MATH500 和 GPQA-Diamond 上。

在 Qwen2.5 和 Llama3 家族的所有模型大小上,验证优先提示始终优于标准的连锁思维提示,在 GSM8K、MATH500 和 GPQA-Diamond 上。

这种效果在计算密集型的数学基准上最强,如 GSM8K 和 MATH500,其中验证错误答案会促进比从头开始解决问题更好的推理。在 GPQA-Diamond 上,依赖于存储的知识而不是演绎结构,优势较小但一致。

验证优先的计算成本很低:在下表中,我们可以看到生成验证步骤比标准的连锁思维提示多增加了大约 20-50% 的输出令牌:

在 GSM8K、MATH500 和 GPQA 基准上,验证优先提示和标准连锁思维提示的平均输出令牌数量。

在 GSM8K、MATH500 和 GPQA 基准上,验证优先提示和标准连锁思维提示的平均输出令牌数量。

尽管如此,额外的成本仍然远低于需要多次采样完成或递归规划的策略。

在下图中,我们可以看到该方法对猜测答案质量的敏感性。令人惊讶的是,即使猜测是琐碎的(‘1’)、不合理的(‘2025’)或随机的多选项,验证优先仍然优于标准提示:

在 GSM8K、MATH500 和 GPQA 上,验证优先提示的准确性提高,当模型被给予琐碎、不合理或正确的答案进行验证时。

在 GSM8K、MATH500 和 GPQA 上,验证优先提示的准确性提高,当模型被给予琐碎、不合理或正确的答案进行验证时。

如预期,准确性在猜测是正确答案时会更高;但该方法仍然有效,表明改进并不是由猜测答案本身的信息驱动的,而是由 验证行为 本身驱动的。

Iter-VF 也被与四种测试时间缩放策略进行了比较,这些策略不需要重新训练或特定任务的适应。在 自我纠正 中,模型被提示通过反思以前的推理步骤来修订其答案;在 PHP 中,之前的答案被追加到输入中作为上下文提示,尽管没有说明如何使用它们。

此外,在 自我一致性 中,多个推理路径被采样,最后的答案通过多数票选出;最后,在 最佳 N 中,多个输出被独立生成,并使用验证提示进行排名,最高评分的响应被选中。

实施了两种 Iter-VF 变体:一种以琐碎的猜测(‘1’)初始化,另一种以标准 CoT 输出初始化:

在 MATH500 上,随着输出预算的增加,准确性和令牌效率显示两种 Iter-VF 变体都优于所有基准,在所有模型规模上。

在 MATH500 上,随着输出预算的增加,准确性和令牌效率显示两种 Iter-VF 变体都优于所有基准,在所有模型规模上。

Iter-VF 给出了比其他所有方法更好的结果,当可用的计算资源有限时,这被归因于它检查答案的方式,而不是初始答案的质量(因为两种 VF 和 CoT 变体很快达到类似的准确性)。

PHP 的性能更差,尽管它重用了以前的答案作为提示,可能是因为语言模型没有很好地利用这些提示。

与 PHP 和自我纠正不同,后者在迭代中积累上下文,Iter-VF 每次只考虑最近的答案。这避免了扩展推理链的复合混乱 —— 这是自我纠正的一个弱点,特别是对语言模型有害。

并行方法,如自我一致性和最佳 N,避免了这个问题,尽管它们的改进更为缓慢和适度。

当在 GPT-5 NanoGPT-5 Mini 上测试时,闭源商业模型隐藏了完整的推理痕迹,只返回最终答案,Iter-VF 改进了性能,而不依赖于中间输出。在下表中,我们可以看到在 MATH500 和 GPQA 上的改进,确认验证然后生成的方法即使只有输入和最终答案可访问时也是可行的:

当 Iter-VF 应用于具有隐藏推理痕迹的 GPT-5 模型时,在 MATH500 和 GPQA 上的准确性。

当 Iter-VF 应用于具有隐藏推理痕迹的 GPT-5 模型时,在 MATH500 和 GPQA 上的准确性。

结论

尽管新论文从结果部分开始变得不透明,但在一类 AI 模型中发现一个普遍特征的明显发现仍然是一个令人着迷的发展。任何经常使用语言模型的人都可能会直觉地开发出一系列技巧来绕过模型的缺点,因为每个缺点都会随着时间的推移而变得明显,并且模式会出现;所有人都希望找到一个像这种方法一样普遍和广泛适用的 “技巧”。

实施和更新语言模型中的 上下文窗口 的最大问题之一似乎是平衡会话进度的保留和在必要时突破新方向的能力,而不陷入虚假的幻觉或离题的输出。在论文中呈现的案例中,我们看到一个温和但坚定的 “唤醒电话”,似乎可以重置和集中语言模型,而不会丢失上下文。将来会看到是否有后续项目会采用和演变这一方法。

研究人员强调了他们新方法的巨大经济效益 —— 这是一个几个月前还不那么重要的考虑因素。现在,超大规模 AI 的影响使得曾经被认为是琐碎的资源节约现在变得至关重要和必要。

 

* 请注意,由于论文中某些部分的英语标准可能会让读者感到困惑,因此我不得不省略通常的引用数量。因此,我将总结关键见解,并将读者引导至原始论文以供核实。

首次发表于 2025 年 12 月 4 日

كاتب في مجال التعلم الآلي، متخصص في مجال 合成 الصور البشرية. السابق رئيس محتوى البحث في Metaphysic.ai، حتى حلولها في Brahma.ai التابعة لشركة DNEG.
المنصة الشخصية: martinanderson.ai
التواصل: [email protected]