Anderson 视角
通过秘密跟踪数据识别 AI 模型盗窃

一种新方法可以在几秒钟内对 ChatGPT 类型的模型进行秘密水印,且无需重新训练,不会在一般输出中留下任何痕迹,并且可以抵御所有可行的移除尝试。
水印和“版权诱饵”的微妙区别在于,水印(无论是明显的还是隐藏的)通常旨在出现在整个集合(例如图像数据集)中,以阻止随意复制。
相比之下,一个虚构的条目是一个小的文本段,通常是一个单词或一个定义,出现在一个大型且相对通用的集合中,旨在证明盗窃。这个想法是,当整个作品被非法复制时,无论是作为一个单独的作品还是作为一个衍生作品,原始所有者所植入的“唯一”和虚假事实的存在将很容易揭示盗窃行为。
在向大型语言模型(LLM)和视觉语言模型(VLM)添加水印方面,输出中包含这些线索的程度往往分为两个目标:要么确保所有或大部分输出包含明显或潜在的水印;要么确保可以恢复一个“秘密令牌”,以证明盗窃——但它不会出现在模型的正常输出中。
证据的重量
后一种方法在中国、意大利和新加坡之间的一项新合作中得到了解决,这项工作旨在为开源模型提供一种披露方法,以便它们不能轻易被商业化或以违反原始许可的方式使用。
例如,模型的原始许可可能要求任何人可以从作品中获利,只要他们对作品进行修改或更改,并将其公开可用,且使用相同的宽松许可条款——但一家公司可能希望保留其“改进”(例如,对大型语言模型的微调版本),以创建一个实际上不允许的护城河。
大部分研究都集中在与封闭源、仅 API 模型或仅可用优化(量化)权重的模型相关的检测例程上,这些模型更难以高效地编辑和修改,因为没有直接访问模型的架构本身。
这种对 FOSS 发布的关注也许并不令人惊讶,因为中国的 AI 输出在过去一年中以发布全重量的模型为特征,这些模型至少可以与更“锁定”的西方等价物相媲美。
新方法,称为 EditMark,通过不需要对模型进行微调来添加“被污染”的数据,也不需要从一开始就用数据训练模型来区分自己。
这有几个好处:一是,一旦发现和披露用于训练数据集的任何“线索”数据,就会变得无效,因为它可以被攻击者直接针对;但要攻击 EditMark,恶意行为者需要知道要针对模型的哪一层以及采取什么方法。这是一个不太可能的场景。
其次,该方法很快且廉价,仅需几秒钟(而不是几天或几周)即可应用于训练好的模型,从而避免了微调的巨大开销(微调的开销随着模型和数据的大小而线性增加)。
最后,该方法对模型正常运行造成的损害远远小于微调或以前的编辑方法。
在测试中,EditMark 实现了 100% 的提取率,该方法将带有多个可能答案的数学查询嵌入到模型权重中。
作者们指出:
‘综合实验表明 EditMark 在水印大型语言模型方面具有出色的性能。EditMark 通过在不到 20 秒内嵌入 32 位水印,实现了 100% 的水印提取成功率(ESR)。’
‘值得注意的是,水印嵌入时间不到微调时间的 1/300(平均 6,875 秒),这凸显了 EditMark 实现高容量水印的速度和可靠性。’
‘此外,广泛的实验验证了 EditMark 的鲁棒性、隐蔽性和保真度。’
该论文题为《EditMark:基于模型编辑的水印大型语言模型》,由中国科学技术大学、意大利锡耶纳大学和新加坡 CFAR/IHPC/A\*STAR 的八位作者共同完成。
方法
EditMark 方法包括四个组件:生成器、编码器、编辑器和解码器:

EditMark 流水线通过编辑模型以回答特定的数学问题来嵌入水印,这些问题以编码隐藏的识别信息的方式回答。来源:https://arxiv.org/pdf/2510.16367
生成器使用伪随机种子构造多答案数学问题;编码器根据水印选择答案,并将其嵌入模型中,使用专门的编辑过程。一旦编辑后的模型被发布或滥用,水印可以通过询问相同的问题并解码响应模式来提取。
编辑器修改模型权重,以便当询问这些种子问题时,模型可靠地产生目标答案,从而直接将水印嵌入其行为中。解码器通过向疑似模型提问相同的问题并将其答案翻译回隐藏的签名来恢复水印。
威胁模型
该论文的威胁模型假设水印是在白盒环境中完成的。虽然在安全相关的研究中这通常不是一个好迹象,但在这种情况下这是正常的,因为该方法旨在保护拥有完全访问其自身工作的所有者。
攻击者也被假定为在获得模型后拥有白盒访问权限,这意味着他们可以修改它(例如,通过剪枝或微调)。同样,这种场景在 FOSS 发布的情况下是正常且预期的。然而,攻击者不知道水印提取过程或所使用的模式,只能通过推断和实验(或泄露)来发现这种方法。
生成器使用 GPT-4o 构造逻辑上和事实上有效的数学问题,具有多个正确答案,使用伪随机种子确保每个问题都是唯一的。这使得已知的水印可以通过答案排列以确定性的方式嵌入,同时最小化问题之间的重叠,以避免编辑的纠缠:

用于水印嵌入的 GPT-4o 生成的多答案问题模板,每个模板都结构化为产生多个有效的整数答案,从一个种子不等式中得出。
编码器将每个二进制水印段转换为一个唯一的整数排列,整数来自给定数学问题的解集。使用词典排列理论,编码器将每个水印块的十进制值映射到特定的答案顺序,确保水印以确定性的方式嵌入模型的行为中。
至于编辑器,原始的 AlphaEdit 模型编辑方法用于水印嵌入,缺乏精度和抗性,经常修改模型以返回所需的答案;任何更改它所做的更改都很容易被剪枝或噪声破坏。
为了克服这一点,作者设计了一种多轮编辑策略,逐渐调整模型权重,直到其响应与所需的答案对齐。为了使编辑更能抵御篡改,他们还在训练过程中注入高斯噪声,以模拟攻击:

Baichuan-7B、Qwen-7B 和 LLaMA3-8B 在攻击前后的 K1 值的变化分布。顶行显示了随机噪声注入的影响;底行显示了模型剪枝的影响。所有更改都接近零,表明攻击不会显著破坏模型的内部行为。
一个评分系统在编辑足够准确时停止该过程,而正则化确保更新在多个轮次中保持稳定。
解码器通过向模型提出相同的特殊问题(在水印过程中使用),然后读取其答案以推断隐藏的 ID 来工作。由于答案的模式遵循一个秘密规则,因此可以在不需要检查模型内部的情况下恢复此 ID。
数据和测试
为了测试 EditMark,评估了五个 LLM:GPT2-X;GPT-J-6B;LLaMA-3-8B;Baichuan-7B;和 Qwen-7B。用于基线的有 AlphaEdit(后门);KIMark;和 BadEdit,一种最初用于后门注入的框架,但在这里被改用于项目自己的目的。
作者编辑了 LLaMA-3-8 的第 15 层,GPT2-XL 和 GPT-J-6B 的第 17 层,以及 Qwen-7B 和 Baichuan-7B 的第 14 层。
实验在四个 NVIDIA RTX 4090 GPU(每个 24GB 的 VRAM)上进行,嵌入了 32 位、64 位和 128 位长度的水印。用于生成多答案问题的模板如下所示:

用于水印的多答案问题模板。每个问题基于不同的数学不等式,变量中插入了随机值。模型被要求返回整数解决方案的列表,答案的顺序用于编码或解码水印位。四个模板涵盖了二次、对数、有理和基于间隔的形式。所有这些都是使用 GPT-4o 生成的。
为了减少随机性的影响,测试中使用了从 1 到 20 的种子,跨越不同的水印容量。
最初,研究人员测试了五个大型语言模型的水印提取成功率(ESR)和嵌入时间(ET):

将 EditMark 与五个大型语言模型上的三个先前水印方法进行比较。报告了提取成功率(ESR)和嵌入时间(ET),以秒为单位。EditMark 在所有模型上始终实现 100% 的成功率,同时将嵌入时间减少了几个数量级,在准确性和效率方面优于所有基线。
关于这些结果,作者指出:
‘EditMark 对所有评估的 LLM 都实现了 100% 的 ESR,并且需要不到 20 秒来嵌入 32 位水印。特别是,对于 Baichuan-7B 和 Qwen-7B,平均嵌入时间不到 10 秒,这表明 EditMark 的高效性。’
对于 128 位水印的评估,这是该方案下可行的最高值,EditMark 保持了“不可磨灭”的状态:

EditMark 在五个语言模型上嵌入 32 位、64 位和 128 位水印的提取成功率和嵌入时间。所有情况下都保持了完美的成功率,而嵌入时间随着水印大小的增加而增加,但即使在 128 位下也保持在一分钟以内。
接下来,测试了系统在多个基准测试中的水印保真度:

在五个模型上比较未修改的模型与在 32 位和 128 位容量下水印的模型的性能。水印插入对基准测试准确性影响很小,平均分数仅略有波动。
对 EditMark 的鲁棒性进行了六种常见攻击策略的测试。模型首先使用五个不同的种子嵌入了 128 位的水印。微调,如下图所示,对大多数模型的提取成功率(ESR)只产生了轻微的降低:

水印 LLM 的提取成功率(ESR)在微调一至三个 epoch 后的变化。虽然大多数模型在整个过程中保持高 ESR,但 Qwen-7B 显示出显著的下降,表明其对参数更新更容易受到攻击。
即使经过多个 epoch,大多数模型也保持了超过 90% 的 ESR,表明 EditMark 能够抵御 LoRA 基础训练引入的参数漂移。
量化攻击降低了模型的精度,但大多数水印仍然保持完整:

水印模型在 Int-8 和 Int-4 精度下量化后的提取成功率(ESR)。在所有模型下,Int-8 量化保持了 100% 的 ESR,而 Int-4 量化导致了部分降解,表明较低的精度会削弱但不会完全去除水印。
如上图所示,Int-8 量化在所有模型下保持了 100% 的 ESR,而 Int-4 量化导致了部分降解,但引入了不可接受的性能损失。
攻击还测试了模型编辑和自适应攻击:

水印模型在应用了不同程度的模型编辑后,提取成功率。即使在已知的水印层上应用了多达 50 次编辑,所有模型的 ESR 也保持在 95% 以上,表明直接的参数修改对水印去除的影响有限。
在这里,EditMark 即使在攻击者针对确切的嵌入层时,也保持了超过 95% 的 ESR。
结论
数字版权管理、秘密水印和其他在 AI 之前时代曾经取得过有限或部分成功的安全方法很难应用于机器学习系统;当前主机架构的故意简化性质与缺乏适当的工具相结合,使得注入的水印相当脆弱。
看到一个针对 FOSS 模型分布的系统,并看到它能够抵御除最不可能的场景外的所有场景,这是令人印象深刻的。然而,来自这些实验的微小性能下降可能会让潜在的采用者感到担忧;尤其是由于退回到以 API 为中心的控制模型可以几乎完全避免此类攻击。
* 本网站 认为 中国的“开源”模型发布并不一定是完全的开源,因为数据通常被保密,这阻止了训练流水线的精确复制。可以认为,这个话题邀请对 AI 模型发布进行更深入的研究,比较西方和东方的差异,这超出了本文的范围。
首次发布于 2025 年 10 月 27 日,星期一












