Anderson 视角
大型语言模型中的冗词减少准确率

新研究发现,强迫大型语言模型给出较短的答案,显著提高了它们的准确率和答案质量。
任何尝试阻止聊天机器人“啰嗦”的人都会认同新研究的结论:强迫AI给出较短的回答使其更加准确。
研究人员调查了为什么较大的AI聊天机器人在某些情况下(称为逆向缩放)比较小的模型表现更差,他们发现强迫31个流行的大型语言模型(LLM)给出较短的答案,导致准确率提高了多达26.3%:
‘结果提供了令人信服的因果证据:简洁性约束提高了大型模型的准确率26.3个百分点,并将逆向缩放差距减少了67%(从44.2%到14.8%,配对t检验:t = 7.80,p < 0.0001)。'
过度冗词是终端用户的常见抱怨,尤其是在使用商业级模型(如ChatGPT)时,支持论坛经常出现此类话题。
研究人员发现,数学领域受益于简洁性最明显,因为AI模型被限制在50个字以内回答,而阅读理解任务则被限制在10个字以内回答。
该论文将AI的冗词倾向定义为“过度思考”,其中核心信息不仅被词藻掩盖,甚至被其破坏。论文指出,模型越小,需要这种解决方案的可能性就越小,或这种解决方案的效果越小。
研究人员得出结论,没有必要从根本上改变模型的架构来解决这个问题。然而,在用户的聊天会话中,需要反复给出简洁的指令,而在平台(如ChatGPT)上实施全局系统提示可能会使简短的答案成为默认行为。
强风
这并没有解释为什么较大的模型更容易出现冗词,因为这也影响开源模型。该论文认为,强化学习从人类反馈(RLHF)技术中的协议和常见做法可能提供了一个解释:
‘一个合理的起源是RLHF对齐训练,其中人类注释者在较大的模型中过度奖励完整性——与具有更大容量的模型相比,这些模型更容易对长度奖励信号做出反应——这与在指令调优变体中比基础模型变体中更大的冗词差异一致。’
在人类中,冗词可能是为了填补沉默,掩盖尴尬,或者由于精神疾病,或者为了隐藏知识缺乏。在AI中,冗词可能是由于训练数据中反映或体现这些特征所致。
数据集也存在其他动机,例如SEO激励,产生更长的文本内容,例如在食谱帖子中,长度往往被错误地与权威性关联起来。
不能完全排除API平台可能会鼓励或不阻止冗词的可能性,因为这会增加令牌使用量,而无需过度的推理或检索增强生成(RAG)调用†。
新论文题为《简洁性约束逆转语言模型的性能等级》,来自瑞典波利特尼克学院(Sweden Polytechnic Institute)计算机科学系。
方法
为了测试论文的理论,评估了31种语言模型——这里太多了,无法列出,但在下面的图像中显示:

新论文测试的各种大型语言模型(LLM)
这些模型被评估在五个基准集合上:GSM8K,用于数学推理;BoolQ,用于阅读理解;CommonsenseQA,用于常识推理;ARC-Easy,涵盖科学问题;以及MMLU-STEM,用于科学知识。
答案是使用贪婪解码生成的,以确保确定性输出,然后使用特定任务规则提取,准确率以正确响应的份额与基准真相相比来衡量。
模型根据大小分为两组,参数数量在十亿以下的模型被视为“小型”,而参数数量超过七十亿的模型被视为“大型”,基于观察到的性能差距。
逆向缩放通过比较这些组在每个问题上的性能来量化,标记小型模型超越大型模型的案例;然后使用统计效应大小来确认这些差距反映了连贯、有意义的差异,而不是噪音。
排除回忆
为了排除模型只是回忆训练数据的可能性,进行了三项单独的检查,检查答案的变化程度、长度的变化程度以及错误的产生方式。如果模型依赖于记忆的模式,响应将趋向于重复或遵循固定模板;相反,答案被证明在模型之间大多是唯一的,长度从一个响应到另一个响应有明显的变化。
错误也被直接检查,大多数失败的形式是长而不正确的解释,而不是短而闪避的答案——这表明模型正在生成实际的推理,而不是检索存储的响应。
数据和测试
在测试个别问题而不是标题成绩时,很大一部分基准任务被证明是没有信息的,27.1%的任务无法区分模型,因为每个系统都成功了或每个系统都失败了,没有关于相对性能的真正信号:

五个基准的任务级别细分显示,任务的很大一部分无法区分模型,而较小但一致的部分表现出逆向缩放,其中小型模型超越了大型模型。1,485个问题的总体分布表明,7.7%的任务表现出逆向缩放。 来源
在区分模型的任务中,大多数任务表现如预期,较大的系统表现更好,但有一小部分任务表现出相反的模式,较小的模型表现更好。在所有问题中,逆向缩放出现了7.7%,表明这种效果不是边缘性的。
逆向缩放出现
在五个基准中,发现115个问题中较小的模型超越了较大的模型,占所有1,485个任务的7.7%,表明逆向缩放在这种情况下不是一种罕见或边缘现象。
事实上,这种效果出现在每个数据集中:在BoolQ中最强,在CommonsenseQA、ARC-Easy、GSM8K和MMLU-STEM中较弱,表明它是广泛的,但根据任务的不同而有所不同:

逆向缩放出现在所有基准中,从MMLU-STEM的3.9%到BoolQ的11.3%,总共115个问题。性能差距平均偏向小型模型28.4个百分点。随着模型大小的增加,准确率下降,小型模型达到66.1%,而大型模型达到41.5%。
性能差距的大小是实质性的,小型模型平均领先28.4个百分点,每个案例都表现出相同的优势方向,表明性能下降而不是偶然或特定错误。
同样的模式出现在不同的模型家族中,包括Llama、Qwen、Gemma和Mistral,其中较大的版本在这些问题上比小型版本表现更差,准确率随着模型大小的增加而下降。
性能差距足够大,无法用偶然性来解释;由于同样的模式出现在不同的基准、任务和模型家族中,逆向缩放出现为一种一致的而不是随机的效果。
在每个模型家族中,较大的版本反复在这些问题上比小型版本表现更差,表明下降可能与规模本身有关,而不是设计的差异。
结果还表明,每个任务都有一个限制,模型大小的增加开始损害性能,表明更大的模型并不总是带来更好的结果。
检查过度思考
在确定较大的模型在某些领域可能表现更差之后,分析转向了为什么会发生这种情况,提出问题不在于能力不足,而在于过度解释——即,较长的答案开始掩盖正确的推理。
在整个数据集中,较长的响应与这些困难问题上的较低准确率有关,即使大型和小型模型产生了大致相同数量的推理步骤,表明问题不在于推理的数量,而在于其表达方式:

较短的答案提高了大型模型的性能,并减少了与小型模型的差距,从44.2个百分点到14.8个百分点(在某些情况下完全逆转),而直接答案格式进一步缩小了差距。最大的收益出现在GSM8K和MMLU-STEM中,排名有利于大型模型,响应长度检查确认干预有效,输出从大约197个令牌减少到少于80个令牌,将减少冗词与提高准确率联系起来。
当答案被迫较短时,大型模型的性能显著提高,减少了相当大的性能差距,在某些情况下几乎消除了它。相反,小型模型几乎没有变化,表明冗词实际上正在损害较大的系统。
这种效果因任务而异,有些基准从较短的答案中受益匪浅,而其他基准则需要一定程度的解释;但是,在某些情况下,小型和大型模型之间的排名完全逆转,一旦冗词受到限制,表明大型模型具有被过度阐述所掩盖的隐藏能力。
进一步的分析表明,大型模型倾向于产生更长的输出,尽管它们使用稍微较少的显式推理步骤,表明它们的推理风格更为模糊和结构化较差。
相反,小型模型给出了较短、更直接的答案,表明推理的表达方式,而不是推理的数量,驱动了性能的下降。
作者总结说,简洁性约束带来准确率的好处,并认为这可以成为语言模型中的一个基本特性,而不是一个需要在会话间重复应用的、不持续的用户约束;他们指出:
‘简洁性约束帮助大型模型显著改进,而几乎不影响小型模型。’
‘如果冗词是偶然的而不是因果的,应该期望在两个大小类别中看到统一的准确率变化。对简洁性约束的差异反应证实,过度思考是一种特定于规模的故障模式,而不是任务难度的影响。’
结论
除了研究人员测试的开源版本外,冗词问题似乎在许多其他主要模型中也很常见,包括Claude、Gemini和Grok。
无论这些平台是否忽视冗词问题,因为它增加了令牌使用量和更高的支出,但似乎不合理的是,他们会接受这种“推动”所伴随的准确率下降。
如果可以确定冗词倾向的来源,那将会很有趣。任何曾经尝试让聊天机器人真正聊天,而不是“博客化”冗长、多步骤的答案的人都会意识到,模型已经被严重印刻了“一体化”的用户指南和“接受的解决方案”。
因此,很有趣的是,看看一个专门针对逐步对话进行训练的模型是否实际上可以避免冗词的趋势。然而,似乎需要对模型的训练施加某些约束或过滤器,以便它直接在前置材料上进行训练——即对话式对话中的明确推理。
由于这种类型的数据可能很稀缺,可能唯一的前进方式是通过合成数据,其中最终的复合结论被对话式地拆解——这与Google NotebookLM可以从纯文本输入中解释的AI播客类似。
* 我将作者的内联引用转换为超链接。
† 但是,让我们坦率地说,实际的AI提供成本与订阅费用的差距目前如此之大,以至于这只会损害用户基础的声誉,而不会解决这一AI“转换”和“收敛”阶段的严重的根本经济问题。
首次发布于2026年4月5日












