Anderson 视角
人工智能不一定会因为礼貌而给出更好的答案

公众对是否应该对人工智能系统礼貌的看法几乎和最新的关于咖啡或红酒的判决一样频繁地变化 – 有时被赞扬,有时被质疑。尽管如此,越来越多的用户现在在他们的提示中添加“请”或“谢谢”,不仅仅是出于习惯,或者担心粗鲁的交流可能会影响现实生活,而是因为他们相信礼貌可以带来更好的和更有成效的结果来自人工智能。
这一假设已经在用户和研究人员中传播,提示短语在研究领域被研究为一个工具,用于对齐、安全和语气控制,同时用户习惯强化和重塑这些期望。
例如,2024年的一项日本研究发现,提示的礼貌可以改变大型语言模型的行为,测试GPT-3.5、GPT-4、PaLM-2和Claude-2在英语、中文和日语任务中,并以三个礼貌级别重写每个提示。该研究的作者观察到,“直率”或“粗鲁”的词语导致事实准确性较低和答案较短,而适度礼貌的请求产生了更清晰的解释和更少的拒绝。
此外,微软建议在使用Co-Pilot时使用礼貌的语气,从性能而不是文化的角度出发。
然而,一篇新研究论文从乔治华盛顿大学挑战了这一日益流行的观点,提出了一种数学框架,预测大型语言模型的输出何时会“崩溃”,从连贯到误导或甚至危险的内容。 在这种情况下,作者认为,礼貌并不有意义地延迟或防止这种“崩溃”。
开始
研究人员认为,礼貌的语言使用通常与提示的主要主题无关,因此不会对模型的焦点产生重大影响。 为了支持这一观点,他们提出了一个详细的公式,描述了单个注意力头如何在处理每个新令牌时更新其内部方向,据称表明模型的行为是由内容相关令牌的累积影响所塑造的。
因此,礼貌的语言被认为对模型的输出恶化没有重大影响。论文指出,决定临界点的因素是有意义的令牌与良好或不良输出路径的整体对齐,而不是社会礼貌语言的存在。

一个简化的注意力头生成序列的插图。模型从好的令牌(G)开始,然后达到一个临界点(n*),输出从好的令牌(G)切换到不良令牌(B)。提示中的礼貌术语(P₁、P₂等)在这种转变中没有发挥作用,支持论文的说法,即礼貌对模型的行为影响不大。来源:https://arxiv.org/pdf/2504.20980
如果这一结果是正确的,那么它将与流行的观点和可能甚至是隐含的指令微调逻辑相矛盾,后者假设提示的措辞会影响模型对用户意图的解释。
崩溃
该论文检查了模型的内部上下文向量(其用于令牌选择的演化指南针)在生成过程中如何转变。每个令牌都会更新这个向量的方向,下一个令牌的选择基于哪个候选令牌与之最为接近。
当提示引导模型生成格式良好的内容时,其响应保持稳定和准确;但是,随着时间的推移,这种方向上的拉动可以逆转,将模型引导向越来越离题、不正确或内部不一致的输出。
这种转变的临界点(作者将其定义为数学上的迭代)发生在上下文向量变得与“坏”输出向量比“好”输出向量更为一致的时候。在这一阶段,每个新令牌都会将模型进一步推向错误的路径,强化一种日益有缺陷或误导性的输出模式。
临界点的计算是通过找到模型的内部方向与良好和不良输出类型同时对齐的时刻来实现的。嵌入空间的几何形状,由训练语料库和用户提示共同决定,决定了这种交叉点发生的速度:

作者简化模型中临界点n*出现的插图。几何设置(a)定义了预测输出从良好到坏的转变所涉及的关键向量。在(b)中,作者使用测试参数绘制这些向量,而(c)将预测的临界点与模拟结果进行比较。匹配是精确的,支持研究人员的说法,即一旦内部动态超过某个阈值,崩溃就具有数学必然性。
礼貌术语不会影响模型在良好和不良输出之间的选择,因为根据作者的说法,它们与提示的主要主题没有意义上的联系。相反,它们最终出现在模型的内部空间中,与模型实际决定的内容几乎没有关系。
当这些术语被添加到提示中时,它们会增加模型考虑的向量数量,但不会以影响注意力轨迹的方式进行。因此,礼貌术语表现为统计噪音:存在但不活跃,不会改变临界点。
作者指出:
“我们的AI是否会失控取决于我们的LLM的训练提供的令牌嵌入,以及我们提示中的实质性令牌——而不是我们是否对它礼貌。”
该研究中使用的模型故意狭窄,专注于一个具有线性令牌动态的单个注意力头——一个简化的设置,其中每个新令牌通过直接向量加法更新内部状态,而无需非线性变换或门控。
这种简化的设置使作者能够得出精确的结果,并提供了模型输出如何突然从良好转变为坏的清晰几何图像。在他们的测试中,用于预测这种转变的公式与模型的实际行为相匹配。
聊天…
然而,这种精度之所以能够实现,是因为模型被故意简化。虽然作者承认他们的结论应该在更复杂的多头模型(如Claude和ChatGPT系列)上进行测试,但他们也相信,即使注意力头增加,理论也仍然成立,声称:
“随着关联注意力头和层的数量增加,会出现什么额外的现象,这是一个令人着迷的问题。但是,单个注意力头内的任何转变仍然会发生,并可能被耦合放大和/或同步——就像一串人被拖过悬崖,当一个人摔倒时。”

作者简化模型中预测的临界点n*如何根据提示对良好或不良内容的偏好而变化的插图。表面来自作者的近似公式,表明礼貌术语对崩溃何时发生几乎没有影响。标记值(n* = 10)与早期模拟相符,支持模型的内部逻辑。来源:https://arxiv.org/pdf/2504.20980
仍然不清楚的是,这种机制是否能在现代变换器架构中幸存。多头注意力引入了跨专用头的交互,这可能会抵消或掩盖所描述的倾向行为。
作者承认这种复杂性,但认为注意力头通常是松散耦合的,并且他们所建模的内部崩溃可能会在全尺寸系统中得到加强而不是抑制。
在没有对模型扩展或在生产LLM上进行实证测试的情况下,声明仍然未经验证。然而,机制似乎足够精确,以支持后续研究计划,作者提供了一个清晰的机会来挑战或确认该理论的可扩展性。
结束
目前,面向消费者的LLM的礼貌话题似乎是从两个角度来看待的:要么认为经过训练的系统可能会对礼貌的询问做出更有用的回应;要么认为与这些系统的粗鲁和直接的沟通方式可能会通过习惯的力量传播到用户的现实社会关系中。
可以说,LLM在现实社会背景下尚未被广泛使用,以至于研究文献尚未证实后一种情况;但是,这篇新论文对将人工智能系统人格化的好处投下了一些有趣的怀疑阴影。
去年十月,斯坦福大学的一项研究表明(与2020年的一项研究相反),将LLM视为人类的风险不仅在于降低语言的意义,还在于最终会使礼貌失去其原始的社会意义:
“一句看似友好或真诚的陈述,如果来自人类发言者,可以是理想的,但如果来自人工智能系统,则是不可取的,因为后者缺乏对该陈述背后的有意义的承诺或意图,因此使该陈述变得空洞和欺骗性。”
然而,大约67%的美国人表示他们对聊天机器人礼貌,根据Future Publishing 2025年的调查。大多数人表示这是“正确的事情”,而12%承认他们是出于谨慎——以防机器人有一天会崛起。
* 我将作者的内联引用转换为超链接。由于作者在某些地方将超链接引用到广泛的脚注引用,而不是特定的出版物,因此这些超链接在一定程度上是任意的或示例性的。
首次发布于2025年4月30日星期三。2025年4月30日星期三15:29:00修改,用于格式调整。












