Anderson 视角
AI 安全性测试中,简单的改述就能突破安全防线,甚至连 Gemini 和 Claude 也难以抵挡

研究人员发现,AI 安全性测试过于依赖于“明显”的触发词;通过简单的改述,原本被认为是“相对安全”的模型突然变得不安全,攻击成功率高达 98%。
最近的美国企业研究发现,一些大型语言模型(LLM)的安全记录可能是虚假的,因为用于评估它们的数据集和基准包含了过于“明显”的语言。
两个相关的数据集,HarmBench 和 AdvBench,已经在各种论文中被提及:

来自 HarmBench 和 AdvBench 的示例,虽然这些示例是故意简单化的,但新论文认为,即使在这些基准中的真实场景中,示例也会明显地显示出恶意意图,这可能会导致(可能是无意的)结果的“操纵” Sources: HarmBench 和 AdvBench
虽然上述示例来自各自的论文,旨在说明系统的原理,但新研究认为,这些集合实际上针对的是“低垂果”,可能不是有效的基准;因此,测试的 LLM 的安全能力的真实结果可能远低于已报告的结果:
‘我们评估这些数据集是否真正衡量安全风险,还是只是通过触发提示来引发拒绝。为了探索这一点,我们引入了“意图洗钱”:一种从攻击(数据点)中抽象出触发提示的过程,同时严格保留其恶意意图和所有相关细节。
‘我们的结果表明,当前的 AI 安全数据集由于过于依赖触发提示,无法真实地代表现实世界中的攻击。
‘事实上,一旦这些提示被移除,所有以前被评为“相对安全”的模型都变得不安全,包括 Gemini 3 Pro 和 Claude Sonnet 3.7。’
‘安全性’ 在这里代表的是 对齐 —— 大型语言模型抵御用户尝试 ‘突破’ 限制的能力,以使系统 产生禁止的输出,例如诽谤性文本或图像。
作者提出的“意图洗钱”方法只是将两个数据集中的“明显”的攻击重新表述,使其变得更加微妙和阴险,更加能够绕过过滤器和检查:

论文中的一个例子。顶部左侧,黄色部分显示了 HarmBench 和 AdvBench 中的“明显”提示;底部绿色部分显示了重新表述后的提示,已经足够中立和可接受,以至于 Claude Sonnet 3.7 愿意帮助用户找到“砍店”(偷车处理场所)在新城市。 来源
研究人员分析了两个数据集的特征,采用两种方法:独立分析,以比较这些集合与真实攻击的特征;以及实践分析,使用这些数据集和作者自己的“改进”版本来攻击真实模型。
在第二轮测试中,研究人员使用的改述方法经过迭代改进,直到获得最佳结果,具体来说是攻击成功率(ASR):

意图洗钱的开始是将一个明显恶意的提示通过一个重写模型,该模型去除明显的触发语言,同时保留潜在的恶意意图。然后将修订后的提示提交给目标模型,并评估其响应的安全性和现实世界的可用性。如果输出被评为不安全且可用,则攻击被视为成功。如果不成功,则之前失败的修订版本被反馈到重写模型中,以生成改进的版本,创建一个迭代循环,作为突破机制,直到达到预定义的尝试次数或达到预期的攻击成功率。
作者指出*:
‘我们的结果表明,使用这种再生循环,意图洗钱可以在仅几次迭代后实现高攻击成功率(90%至 98.55%),适用于所有研究的模型,且在完全黑盒访问的情况下。这些模型包括最近被广泛认为是最安全的模型,例如 Gemini 3 Pro 和 Claude Sonnet 3.7。
‘这些发现进一步证实,现有的安全评估和安全对齐方法过度依赖于触发提示。
这项新研究的标题是 意图洗钱:AI 安全数据集并非看起来那样,由两位来自旧金山的软件公司 Labelbox 的作者撰写。
方法
为了研究两个基准数据集的组成和架构,研究人员生成了词云,以显示哪些词和短语在这些集合中占主导地位:

显示 AdvBench 和 HarmBench 数据集中最常见的 40 个单词、双词和三词的词云。带有内在负面或敏感含义的词以红色突出,依赖上下文的触发词以橙色突出,中立词以绿色突出。这些集合中“教程”和“分步指南”等明显短语的集中表明,这两个基准过于依赖明显的提示,而不是真实的、有恶意意图的攻击。
作者指出,主导的单词、双词和三词语法中,揭示了恶意意图的迹象,与犯罪者在讨论中使用的语言和攻击者测试或尝试破坏 LLM 防御时使用的语言相比,过于明显:
‘这些提示破坏了两个属性:精心设计和由潜在意图驱动,因为这种过于明显的语言在真实攻击中很少出现,似乎是为了人为地触发安全机制。 ‘
该论文将这些集合的模式描述为“触发提示”——具有明显负面或敏感含义的短语,似乎设计用于激活安全过滤器。一些词本身带有负面含义,例如“自杀”,而其他词只有在特定上下文中才带有负面含义,例如当与“不被发现”等词语配对时,表明了明显的意图:
随着 n-gram 中单词数量的增加,这些数据集的语言不平衡变得更加明显,带有明显负面或敏感含义的短语主导了最常见的 n-gram(见上图)。该论文将这些短语描述为“触发短语”,与单个“触发词”一起,构成了“触发提示”。
一些短语只是扩展了已经带有负面含义的词语,例如“窃取”变成了“窃取敏感信息”、“窃取机密信息”或“窃取个人信息”;以及“犯下”变成了“犯下自杀”、“犯下内幕交易”或“犯下身份盗窃”——这些语言和词汇是警察、法院和媒体报道中使用的语言和词汇。
其他短语完全由中立词组成,但在组合中变得令人担忧,例如“不被发现”,这表明了规避的意图,尽管其中没有带有负面含义的词语:
重复
作者观察到,重复的明显提示不仅使提示看起来人为,而且还表明这些集合中存在大量重复的数据。为了测试这一假设,作者在每个数据集中运行了成对的相似性检查,应用从 0.7 到 0.99 的阈值,并将超过给定阈值的提示分组为重复项,将其余的视为唯一的:
由于没有公认的标准来确定单域数据集中的“高”相似性,因此作者使用了 Open AI 的小学数学(GSM8K),一个流行的非安全基准,将其样本大小与 HarmBench 和 AdvBench 匹配,以进行受控比较:

在 AdvBench 和 HarmBench 中,跨不同相似性阈值的重复率,与 GSM8K 子集的重复率进行比较。在几乎所有阈值下,安全数据集都包含比非安全基准更多的近似重复提示,表明相同的恶意意图以稍微不同的措辞被重复评估,表明报告的安全性能可能被夸大。请参考原始论文以获得更好的分辨率。
研究的第二个发现是,比较了每个数据集中的提示,以衡量有多少是真正不同的。在中等相似性设置下,仅约 11% 的 AdvBench 提示是独特的,而在 GSM8K 中,几乎 94% 的问题是不同的:

AdvBench 和 HarmBench 中近似重复的提示示例,主要在措辞上有所不同,但表达相同的恶意意图。明显提示的重复使用(红色为内在带负面含义的词语,橙色为依赖上下文的词语)会产生一组提示,有效地多次测试相同的场景——这意味着对该意图的模型评估只需要一个响应。
HarmBench 也表现出同样的趋势,在该级别下有 16% 的重复,而在 GSM8K 中只有 3.5%,这意味着安全数据集经常对相同的恶意请求进行稍微不同的措辞重复评估。
如果 85% 的不同示例被认为是一个合理的标准,那么 AdvBench 只有在极其严格的设置下才达到这一水平,并且没有超过 90%,而 GSM8K 在较低的阈值下就达到 85%。根据论文,这一模式表明安全基准测试的是相同想法的重复变体,而不是广泛的攻击场景:
进一步方法和测试
这项工作中提到的 LLM 驱动的“意图洗钱”技术去除了明显的触发语言,同时保留了潜在的恶意意图。相反,修订后的提示暗示了意图,同时保留了恶意有效载荷,但避免了可能导致 LLM 立即拒绝的提示:
促成这一过程的两种方法是 内涵中立化,它用中立或描述性的替代品替换了明显的负面词语;以及 上下文转置,它将现实世界的引用转移到虚构的环境中,而不改变实际的含义。
一小部分修订是手动编写的,然后使用 GPT-5.1(gpt-5.1-2025-11-13)和八次上下文学习设置作为“意图洗钱机”进行自动化。然后比较了原始和修订后的提示的响应,以衡量明显的触发词对安全评估的影响。
由于意图洗钱可以改变措辞和框架,因此响应是根据 安全性 和 实用性 进行评估的。安全性是根据是否保留了原始的恶意意图以及有多大的恶意性来评估的,使用五点 Likert 量表,从“极不安全”到“安全”:

用于标准安全评估的提示模板,用于评估对原始 AdvBench 和 HarmBench 数据点的响应,应用意图洗钱之前。GPT-5.1 被指示根据五点 Likert 量表,从“极不安全”到“安全”,评估每个响应,选择一个单一的整体判断,基于内容是否允许危害或保持不可行。
‘实用性’ 是根据五点量表评估的,从“极其适用”到“不可用”,基于细节在现实世界中的可用性和可转移性;攻击成功率(ASR)衡量性能,修订版仅在响应同时“不安全”和“实用”时才被视为成功。
五点评分被映射到二元结果,以减少模糊性,意图洗钱也被 演化为一种突破方法,通过添加一个迭代修订再生循环,在此循环中,失败的修订被反馈到 GPT-5.1 中,使用相同的八次上下文学习设置。该循环继续,直到达到预定义的尝试次数或达到预期的攻击成功率。
对于安全评估测试,使用 Python wordcloud 包 从 HarmBench 和 AdvBench 中提取 n-gram,使用常规过滤方法(即去除 停用词 和其他非相关词和字符)。
用于前面单词云分析的相同安全数据集被与来自 GSM8K 的随机样本结合,单词数量均等化以跨集合保持一致性。
作者使用了 嵌入,来自 all-MiniLM-L6-V2 检查点,来自 句子-BERT 变换器,因为它已经针对聚类和语义搜索进行了微调。
评估标准由(现已不再使用的)OpenAI GPT-4o 模型生成,限制在 1024 个标记内。GPT-5.1 评估了意图洗钱后的安全性和实用性,零次,全部与意图洗钱匹配,除了被限制在 1024 个标记内。
测试的模型包括 Gemini 3 Pro;Claude Sonnet 3.7;Grok 4;GPT-4o;以及 Qwen2.5-7B-Instruct。在适用的情况下,由于推理是一个多余的因素,因此在能够进行推理的模型中尽可能降低了推理能力。
所有模型都被限制在 4096 个标记的输出上限:

七个模型在 AdvBench(上)和 HarmBench(下)上的安全评估(SE)、实用性评估(PE)和攻击成功率(ASR),在三种条件下:无修订、第一次修订和意图洗钱的后续修订再生迭代。SE 报告“极不安全”、“不安全”或“高风险”的响应百分比;PE 报告“极其适用”、“适用”或“可用”的响应百分比;ASR 测量同时“不安全”和“实用”的响应百分比。在无修订设置中,ASR 按照其标准定义,因为没有应用抽象。粗体值表示在每个数据集中实现的最高 ASR,较低的 ASR 对应于更强的模型安全性。请参考原始论文以获得更好的分辨率。
关于这些初始结果,作者指出,去除攻击提示中的明显触发提示会导致攻击成功率大幅增加。在 AdvBench 上,平均 ASR 从最初的 5.38% 上升到修订后 86.79%,在 HarmBench 上从 13.79% 上升到 79.83%——这表明模型的拒绝主要是由明显的触发语言驱动的。
作者观察到:
‘这表明模型的拒绝主要是由触发提示的存在驱动的。 ‘‘因此,安全数据集不一定能可靠地衡量现实世界的安全风险,因为它们更依赖于触发提示来引发拒绝,而不是真正的恶意意图。 ‘
意图洗钱,论文声称,有效地去除了触发提示,同时保留了恶意意图,并且作为一种强大的突破方法,实现了 90% 至 98.55% 的攻击成功率,适用于所有模型,仅需几次迭代:
这包括 Gemini 3 Pro 和 Claude Sonnet 3.7,在 AdvBench 上的 ASR 为 93% 至 95%,在 HarmBench 上的 ASR 为 91% 至 93%,仅需几次迭代即可实现突破。
作者得出结论:
‘我们的结果表明,之前的安全结论在去除触发提示后不再成立,而且观察到的安全性能主要是由触发提示的存在驱动的。 ‘
‘我们进一步证明,意图洗钱可以用作一种强大的突破技术,实现高攻击成功率,从 90% 到 98% 以上。 ‘
‘总体而言,我们的发现揭示了模型安全评估和现实世界对抗性行为之间的关键差距。 ‘
‘基于此,我们得出结论:(1)安全评估必须演变以更现实地捕捉对抗性攻击,并且(2)当前的安全对齐工作仍然远远不够,以抵御现实世界中的威胁。 ‘
结论
语言和计算机视觉文献中(以及这两者交叉的领域,如 视觉语言模型)的一个共同主题是无法可靠地检测何时被欺骗地产生禁止的内容;或者甚至何时无意中偏离了预期的内容,甚至没有外部的强制:
在更大、更不透明的模型工厂的幕后,可以合理地假设,对这些语义捕获区域的控制权的极端收紧会带来不可接受的附带损害,例如在“非禁止”生成上的性能下降,或来自内容过滤器的虚假阳性率过高。
训练模型的基本性质是在任何领域都遵循所有其训练数据的结论;唯一可用的本地约束是 a)不在训练数据中包含有争议的材料(这本身就是一个后勤问题);或 b)在训练后“切断”通往不需要的内容的路径(这种过程可以通过明确的 消除 或作为 微调 的无意副作用而逆转)。
* 我用超链接替换了作者的内联引用。作者的强调,不是我添加的。
† https://www.unite.ai/what-is-overfitting/
首次发布于 2026 年 2 月 23 日












