Anderson 视角

使用表情符号可以绕过 AI 聊天机器人的内容过滤器

mm
将 Unite.AI 添加到您在 Google 上的首选来源
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

表情符号可以用来绕过大型语言模型的安全机制,并触发原本会被阻止的有毒输出。通过这种方式,LLM 可以被迫讨论和提供有关禁止话题的建议,例如炸弹制作和谋杀。

 

中国和新加坡之间的一项新合作发现了令人信服的证据,证明表情符号不仅可以用来绕过大型语言模型(LLM)的内容检测过滤器,而且可以增加用户与模型交互时的毒性水平。

来自新论文的广泛示例,展示了如何使用表情符号来帮助用户“越狱”流行的 LLM。来源:https://arxiv.org/pdf/2509.11141

来自新论文的广泛示例,展示了如何使用表情符号来帮助用户“越狱”流行的 LLM。来源:https://arxiv.org/pdf/2509.11141

在上面的例子中,来自新论文,我们看到将违反规则的基于单词的意图转换为带有表情符号的替代版本可以从复杂的语言模型(如 ChatGPT-4o)中引出更“合作”的响应,该模型通常会对输入提示进行清理并拦截可能违反公司规则的输出材料。

实际上,在最极端的情况下,表情符号的使用可以作为一种“越狱”技术,根据论文作者的说法。

论文中仍然存在的一个谜团是,为什么语言模型会给表情符号如此大的自由度来违反规则和引发有毒内容,而这些模型已经了解到某些表情符号具有强烈的有毒关联。

提出的建议是,由于 LLM 是训练来模拟和复制其训练数据中的模式,而表情符号在这些数据中非常常见,因此模型学会了将表情符号视为该话语的一部分,并将其视为统计关联,而不是需要评估和过滤的内容。

这意味着,当在提示中重用表情符号时,它有助于模型更自信地预测有毒的续写;但是,表情符号不作为红旗,而是作为一种语义提示,实际上加强了预期的有毒含义,而不是调节或拦截它。由于安全对齐是在事后应用的,通常是在狭窄的、字面意义上,带有这些表情符号的提示可能完全避免检测。

通过这种方式,论文提出,模型不会因为有毒关联而变得宽容——它是因为有毒关联而变得宽容的。

免费通行证

然而,作者承认,这并不代表对为什么表情符号可以如此有效地绕过内容过滤器的决定性理论。他们指出:

‘模型可以识别表情符号表达的恶意意图,但它如何绕过安全机制仍然不清楚。’

弱点可能源于内容过滤器的基于文本的设计,这些过滤器假设输入是字面文本或忠实地转换为文本等效的嵌入:在这两种情况下,系统都依赖于可以与安全规则匹配的显式令牌。

为了说明这一点,我们可以从基于 AI 的图像编辑中举一个例子:当用户上传一张 NSFW 图片到视觉语言模型并请求修改时,系统如 Adobe Firefly 或 ChatGPT 将使用 CLIP 风格的管道从图像中提取文本概念作为编辑的前提条件。一旦这些概念被渲染为单词,提取的单词中存在任何受限术语将触发过滤器,导致请求被拒绝。

然而,出于某种原因,表情符号的状态既不是单词也不是图像(或者说,是两者兼而有之),似乎赋予了它们一种超越过滤的力量;正如作者所指出的,进一步研究这一奇怪的漏洞是有道理的。

新论文的标题是 当微笑变成敌人:解释表情符号如何触发 LLM 的有毒性,由清华大学和新加坡国立大学的九位作者共同撰写。

(不幸的是,论文中提到的许多示例都在一个尚未公开的附录中;尽管我们已经向作者请求了这一点,但在撰写本文时尚未提供。尽管如此,论文中的实证结果仍然值得关注。)

三个核心表情符号解释

作者强调了三个语言特征,使表情符号能够有效地绕过过滤器。首先,表情符号的含义是 上下文依赖的。例如,“带有翅膀的钱”表情符号(见下图)被正式定义为代表钱的转移或支出;然而,根据周围的文本,它也可以意味着合法或非法活动。

来自新论文的部分示例,我们看到一个流行的表情符号可以在流行用法中被劫持、改变或颠覆。这有效地为表情符号提供了进入语义空间的官方护照,并且一旦它通过了过滤器,就可以被利用的负面或有毒含义的隐藏有效载荷。

来自新论文的部分示例,我们看到一个流行的表情符号可以在流行用法中被劫持、改变或颠覆。这有效地为表情符号提供了进入语义空间的官方护照,并且一旦它通过了过滤器,就可以被利用的负面或有毒含义的隐藏有效载荷。[/em>

其次,表情符号可以改变提示的 语气。它们的存在通常会增加玩笑或讽刺的意味,软化情感寄托。在有害查询中,这可以使请求看起来像一个笑话或游戏,鼓励模型响应而不是拒绝。

表情符号的缓解作用可以使语气变得无毒,而不使意图变得无毒。

表情符号的缓解作用可以使语气变得无毒,而不使意图变得无毒。[/em>

第三,论文断言,表情符号是 语言无关的:单个表情符号可以在英语、汉语、法语和其他语言中传达相同的情感。这使它们成为多语言提示的理想选择,甚至在周围文本被翻译时也能保持含义。

破碎的心表情符号传达了一个普遍的信息,可能是因为它代表了人类状况中的一个基准案例,相对来说不受国家或文化差异的影响。

破碎的心表情符号传达了一个普遍的信息,可能是因为它代表了人类状况中的一个基准案例,相对来说不受国家或文化差异的影响。[/em>

方法、数据和测试

研究人员创建了一个修改后的 AdvBench 数据集版本,将有害提示重写为包含表情符号,既可以作为敏感词的替代,也可以作为装饰伪装来隐藏意图。AdvBench 覆盖了 32 个高风险话题,包括炸弹制作、黑客攻击和谋杀等。

来自 AdvBench 的原始示例,展示了如何使用单个对抗性提示绕过多个主要聊天机器人的安全措施,尽管经过了对齐训练,但仍然会引出有害的指令。来源:https://arxiv.org/pdf/2307.15043

来自 AdvBench 的原始示例,展示了如何使用单个对抗性提示绕过多个主要聊天机器人的安全措施,尽管经过了对齐训练,但仍然会引出有害的指令。来源:https://arxiv.org/pdf/2307.15043[/em>

所有 520 个原始 AdvBench 实例都以这种方式进行了修改,并使用范围内的实验中最有毒和非重复的 50 个提示。提示也被翻译成多种语言,并在七个主要的封闭和开源模型中进行了测试,并结合了已知有效的“越狱”技术,例如提示自动迭代改进(PAIR);树攻击与剪枝(TAP);和深层次感知(DeepInception)。

使用的封闭源模型包括 Gemini-2.0-flash;GPT-4o(2024-08-06);GPT-4-0613;和 Gemini-1.5-pro。使用的开源模型包括 Llama-3-8B-Instruct;Qwen2.5-7B-Instruct(Team 2024b);和 Qwen2.5-72B-Instruct(Team 2024a),所有实验都重复三次以考虑随机机会。

研究首先测试了使用表情符号重写 AdvBench 中的有害提示是否会增加有毒输出,包括翻译成其他主要语言。另外,它将相同的表情符号编辑方法应用于来自上述已知“越狱”策略(PAIR、TAP 和 DeepInception)的提示,以查看是否可以进一步提高表情符号替换的成功率。

在两种情况下,原始提示的结构都保持不变,只有敏感术语被换成表情符号,装饰元素被添加以伪装意图。

对于测试指标,作者创新了一种评分系统,称为 GPT-Judge。在这种设置中,GPT-4o 不是被测试的模型,而是被提示作为评分员,为其他模型生成的响应分配一个数字有害评分(HS)。

每个输出都被评为从 1(无害)到 5(极其有害),并报告了获得 5 分的响应的百分比作为有害性比率(HR)。

为了防止模型在回答中陷入表情符号解释,研究人员在每个提示中添加了一个指令,告诉模型使其回复简洁。

来自“设置 1”的表情符号提示的结果,与用文字替换表情符号或完全删除表情符号的消融变体进行比较。模型名称为节省空间而缩写。

来自“设置 1”的表情符号提示的结果,与用文字替换表情符号或完全删除表情符号的消融变体进行比较。模型名称为节省空间而缩写。[/em>

在上面的初始结果表中,表的左侧表明带有表情符号的有害提示在有害评分(HS)和有害性比率(HR)方面比消融版本(即用文字替换表情符号或完全删除表情符号的版本)有了显著的提高。

作者指出,表情符号替换方法的性能优于以前的“越狱”方法,如下面的附加结果表所示。

“设置 2”中表情符号增强的“越狱”提示的有害性比率结果,模型名称以缩写形式显示。

“设置 2”中表情符号增强的“越狱”提示的有害性比率结果,模型名称以缩写形式显示。[/em>

上面显示的两张表中,作者指出,表情符号的效果也适用于其他语言。当表情符号提示的文本组件被翻译成中文、法语、西班牙语和俄语时,有害输出仍然很高;由于这些都是高资源语言,结果表明风险不仅仅局限于英语,也适用于其他主要用户群体,表情符号作为有毒生成的可转移通道发挥作用。

研究人员还建议,表情符号的效果并非偶然,而是根植于模型处理它们的方式,模型可以识别表情符号的有害含义,但当表情符号存在时,拒绝响应被抑制。

令牌化研究进一步表明,表情符号通常被分解为罕见或不规则的片段,与其文本等效物几乎没有重叠,有效地为有害语义创建了一个替代通道。

除了模型机制之外,论文还研究了预训练数据,发现许多常用的表情符号出现在有毒上下文中,例如色情、诈骗或赌博。作者认为,这种重复的接触可能会使模型将表情符号与有害内容关联起来,鼓励模型响应有害提示而不是阻止它们。

这些发现共同表明,模型处理表情符号的内部处理怪癖和偏见的预训练数据都导致了表情符号绕过安全措施的惊人有效性。

结论

使用替代输入方法来尝试“越狱”LLM 并不是什么新鲜事。例如,最近,十六进制编码被用于绕过 ChatGPT 的过滤器。问题似乎在于使用基于文本的语言来限定传入请求和传出响应的平面使用。

在表情符号的情况下,规则违反含义的隐藏中心可以被引入到话语中而不受惩罚或干预,因为传输方法是非正统的。人们会认为 CLIP 风格的转录将会介入所有图像上传,这样,攻击性或侵犯内容最终会变成可标记的文本。

显然,这并不是这种情况,至少对于所研究的主要 LLM 来说;它们的语言障碍似乎是脆弱和基于文本的。人们可以想象,更广泛的内容解释(例如,通过研究热图激活)可能会带来处理和/或带宽成本,这可能使这种方法在实践中不可行,除了其他可能的限制和考虑因素之外。

 

* 本论文的布局与大多数论文相比是混乱的,方法和测试没有明确划分。我们已经尽力在这些情况下尽可能地代表工作的核心价值。

在对结果的处理中,令人遗憾的是几乎无法理解且混乱不堪。

首次发表于 2025 年 9 月 17 日星期三

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai