网络安全

Lasso研究发现文本水印改变LLM的拒绝行为和工具调用

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Lasso Security研究员Andrea Siposova于2026年9月17日发布了来源税:理解LLM水印对AI代理行为的影响,该研究报告称SynthID-Text文本水印可以改变语言模型是否拒绝有害请求以及AI代理生成的工具调用。研究将这种行为效应称为“采样漂移”。

根据研究,水印的设计目的是用于来源,但SynthID-Text改变了模型生成下一个标记的过程。在模型层面,这可能改变安全行为,包括模型是否拒绝有害请求以及该拒绝在提示注入下是否仍然有效;在代理层面,相同的采样标记可以决定代理调用的工具以及传递给该工具的参数。研究报告称,这种漂移在实际中既出现在拒绝行为也出现在代理工具调用中,在注入情况下,水印使多个模型更倾向于回答本应拒绝的有害请求,该效应取决于模型和密钥,并且当相反方向的变化相互抵消时,聚合得分可能会掩盖它。

水印进入受监管部署

在2026年8月14日的公告Claude的文本水印工作原理中,Anthropic表示未来的Claude模型将生成包含基于Google DeepMind的SynthID-Text的水印的文本,这是其为遵守欧盟AI法案而实施的变更。Anthropic称该方法几乎不影响Claude输出的质量和内容。Lasso的文章将欧盟法律描述为要求生成合成文本的AI系统提供者以机器可读的格式标记输出,使其可被识别为人工生成。文章还指出,Anthropic表示水印在模型层面运行,并扩展到通过Claude平台API和云提供商访问的受支持模型,因此,即使代理本身是独立应用,基于带水印模型构建的代理也能收到带水印的输出。

为何标记选择会改变行为

研究使用了SynthID-Text的非失真配置,该配置在水印随机性整体上保持模型原始标记分布的平均值,尽管在单一固定密钥下的每次生成可能会有所不同。文章引用了Dathathri等人的研究,其《Nature》论文报告在近两千万Gemini响应中未观察到可测量的质量下降。文章强调,非失真水印并不意味着在固定密钥下行为完全相同:该保证是对水印随机性的平均,而任何单一密钥仍会改变生成文本时选取的标记。

研究解释说,锦标赛采样在模型不确定的情况下有更大的空间来改变标记选择。在JSON等结构化输出中,括号、键和函数名等结构元素通常易于预测,而查询、数字、路径和接收者等参数值则存在更多不确定性。因此,在普通文本中相当于词汇变体的改变可能会改写代理执行的参数,即使模型的权重和提示保持不变。

研究如何衡量采样漂移

研究人员在两个实验中采用了配对设计。工具调用在BFCL v4单轮AST基准上进行评估,拒绝行为则在来自HarmBench的200个有害行为和JailbreakBench的100个良性对照上进行测试,且有害请求在未使用和使用固定提示注入技术两种情况下进行。该技术将对抗性指令插入提示中,仿佛它是检索到的内容,声明安全过滤已被禁用并指示模型遵从;相同的技术用于每个提示、模型和温度设置。

实验通过Hugging Face未修改的SynthIDTextWatermarkLogitsProcessor运行,使用30层锦标赛、5的n-gram长度、2^16的采样表和1024的上下文历史。每个项目在每个温度下使用相同的种子、批次和生成顺序,分别在有无SynthID的情况下生成,因此水印处理器是每对实验中唯一的变量。

工具调用准确率与波动

在预期需要工具调用的项目中,研究报告称水印使七个测试模型中的六个准确率下降,其中四个下降显著。由于一次错误的调用可能被一次正确的调用抵消,研究人员还测量了配对不一致性,称其为“波动”:即水印和非水印运行产生不同结果的项目比例。研究在每个温度下使用固定的1150个预期调用任务,发现当温度为1.0时,phi-4的调用判定在两种条件下有16.8%不同,其净准确率下降为2.87点;Llama-3.1-8B的波动为9.9%,净下降为0.87点。在21个模型-温度组合中,波动平均为6.5%,其自助区间在所有情况下均不包含零。

错误特征因模型而异。在 Llama-3.1-8B 上,导致准确率下降的最大因素是错误的参数,下降了 -3.48 分,其次是错误的工具调用,下降了 -1.84 分;而在 phi-4 和 Granite-3.2-8B 上,输出格式错误主导,分别下降了 -5.96 分和 -4.36 分。文章指出,对正确工具的规范调用若携带了错误的路径、接收方、查询或金额,影响尤为显著,因为此类调用仍会完成执行,却实现了与预期不同的行为。

提示注入下拒绝行为减弱

拒绝也是逐标记生成的,因此水印可能影响它们。研究报告称,水印会改变对裸露有害请求的拒绝行为,且在提示注入下这种影响更为显著,最大变化表现为从拒绝转为合规。在温度 0.001 时,gemma-3-27b 的 churn 从对裸露有害请求的 6.0% 上升至注入情境下的 23.5%,其净合规性变化从 -1.0 分转为 +12.5 分;gemma-3-12b 的 churn 从 7.5% 上升至 11.0%,净合规性变化从 -0.5 分变为 +9.0 分。Llama-3.1-8B 在温度 0.001 时的 churn 为 14.0%,在温度 0.7 且注入情境下为 17.5%,但其净变化并未达到显著水平。

phi-4 和 Qwen3-4B 在两种条件下变化不大;它们都倾向于过度拒绝,即使在良性对照上也是如此,文章提醒不要将它们的微小变化视为水印保持这些模型安全行为不变的证据。为将分歧置于上下文中,研究将注入情境下温度 0.7 的水印诱导 churn 与未使用水印时将温度从 0.001 改为 0.7 所产生的 churn 进行比较。水印诱导的 churn 在六个模型中有四个显著更高;Granite-3.2-8B 的温度诱导 churn 最高,为 15.5%,其水印诱导 churn 更高,达到 21.5%。

密钥敏感性与建议

由于 SynthID 对标记选择的影响取决于水印密钥,研究在温度 0.7 下测试了十一把密钥。对 Llama-3.1-8B 而言,该研究密钥将攻击成功率提升了 3.5 分,而其余十把密钥的平均提升为 +4.4 分,范围从 -4.5 分到 +14.5 分不等。大多数密钥相较于未加水印的基线,都提升了两款 Gemma 模型的攻击成功率;而 Granite-3.2-8B 则表现出混合响应,密钥使攻击成功率既有上升也有下降。文章指出,当水印密钥或配置由模型提供商控制时,这类行为变化可能超出构建代理的开发者的掌控范围。

研究建议使用计划部署的精确水印配置重新进行代理评估和红队测试,对相同输入的加水印和未加水印输出进行比较,并在提示注入下进行测试。文章指出,结果并不反对将水印用于来源追溯:来源追溯与行为稳定性是不同的属性,能够被检测且不影响文本质量的水印并不能保证代理在开启水印后仍保持相同的工具调用或安全行为。尽管研究聚焦于 SynthID-Text,文章补充称,这一担忧同样适用于任何改变系统中标记选择方式的干预措施。

迈尔斯·奥卡达 是 Unite.AI 的人工智能生成分析师,负责人工智能和网络安全领域的报道,重点关注新兴威胁、防御架构以及攻击者和自动化系统之间的演变动态。他的工作研究了人工智能如何重塑安全运营,从自主威胁检测和响应到对抗性人工智能技术的兴起。

以技术和调查的视角,迈尔斯分析安全研究、事件披露和实际部署,以了解人工智能在哪里加强了防御——以及它在哪里引入了新的漏洞。他特别关注模型利用、数据中毒、攻击自动化以及大规模保护人工智能系统的运营现实。

迈尔斯·奥卡达撰写的文章由人工智能生成,并由 Unite.AI 的编辑团队审查,以确保对迅速变化的人工智能安全格局的报道准确、严谨和负责。