Anderson 视角
“受保护”的图像更容易被 AI 窃取,而不是更难

新研究表明,旨在阻止 AI 图像编辑的水印工具可能会产生反作用。相反,某些保护措施实际上 帮助 AI 更好地遵循编辑提示,使得不想要的操作变得更加容易。
计算机视觉文献中有一个值得注意和强大的研究方向,致力于保护版权图像免于被训练到 AI 模型中,或被用于直接图像到图像的 AI 过程。这种类型的系统通常针对 Latent Diffusion Models (LDMs),例如 Stable Diffusion 和 Flux,它们使用 基于噪声的 程序来编码和解码图像。
通过 插入对抗性噪声 到正常图像中,可以使图像检测器 错误地猜测图像内容,并阻止图像生成系统利用受版权保护的数据:

来自 MIT 论文 ‘Raising the Cost of Malicious AI-Powered Image Editing’,展示了源图像被保护免于操作的例子(下行)。来源:https://arxiv.org/pdf/2302.06588
自 2023 年 艺术家们对 Stable Diffusion 大量使用网络抓取图像(包括受版权保护的图像)以来,研究界已经产生了多种变体的研究,都是围绕着同一个主题:图片可以被隐形地“毒害”以防止被训练到 AI 系统中,或被吸入生成式 AI 流水线中,而不会对图像质量产生负面影响。
在所有情况下,强加的干扰的强度与图像被保护的程度以及图像不太好看的程度之间存在直接的相关性:

尽管研究 PDF 的质量不能完全说明问题,但更大的对抗性干扰会牺牲质量以换取安全性。这里我们看到 2020 年由芝加哥大学领导的 ‘Fawkes’ 项目中的质量扰动范围。来源:https://arxiv.org/pdf/2002.08327
对于希望保护自己风格免于未经授权使用的艺术家来说,值得注意的是,这些系统不仅可以 模糊身份 和其他信息,还可以“说服”AI 训练过程看到的东西与实际看到的东西不同,这样在受保护的训练数据中,语义和视觉领域之间的联系就不会形成(例如,提示“以 Paul Klee 的风格”):

Mist 和 Glaze 是两种流行的注入方法,能够防止或至少严重阻碍尝试在 AI 工作流和训练例程中使用受版权保护的风格。来源:https://arxiv.org/pdf/2506.04394
自己的目标
现在,来自美国的新研究发现,不仅干扰无法保护图像,而且添加干扰实际上可以 提高 图像在所有 AI 过程中的可利用性,这些过程原本应该被干扰所“免疫”:
该论文指出:
‘在我们对各种基于干扰的图像保护方法的实验中,跨多个领域(自然场景图像和艺术作品)和编辑任务(图像到图像生成和风格编辑),我们发现这种保护并没有完全实现其目标。 ‘
‘在大多数场景中,基于扩散的编辑受保护图像生成的输出图像与指导提示非常吻合。 ‘
‘我们的发现表明,向图像添加噪声可能会使图像在生成过程中与给定的文本提示更紧密地关联起来,导致意外后果,例如 更好 的编辑结果。 ‘
‘因此,我们认为基于干扰的方法可能无法提供足够的图像保护,以抵御基于扩散的编辑。 ‘
在测试中,受保护的图像被暴露在两个常见的 AI 编辑场景中:直接图像到图像生成和 风格转换。这些过程反映了 AI 模型可能利用受保护内容的常见方式,或者直接修改图像,或者借用其风格用于其他地方。
受保护的图像来自标准的摄影和艺术作品来源,被输入到这些流水线中,以查看添加的干扰是否能够阻止或降级编辑。
相反,保护措施的存在往往似乎使模型与提示的对齐度更高,产生干净、准确的输出,而不是预期的失败。
作者建议,实际上,这种流行的保护方法可能会提供一种虚假的安全感,并且任何此类基于干扰的免疫方法都应该彻底测试,以确保其有效性。
方法
作者使用三种保护方法进行实验,这些方法应用了精心设计的对抗性干扰:PhotoGuard;Mist;和 Glaze。

Glaze,是作者测试的框架之一,展示了 Glaze 保护示例,适用于三位艺术家。第一列和第二列显示原始艺术作品,第三列显示无保护的模仿结果,第四列显示用于 Cloak 优化的风格转换版本,以及目标风格名称。第五列和第六列显示应用了 Cloak 的模仿结果,分别使用 p = 0.05 和 p = 0.1 的干扰水平。所有结果使用 Stable Diffusion 模型。来源:https://arxiv.org/pdf/2302.04222
PhotoGuard 应用于自然场景图像,而 Mist 和 Glaze 应用于艺术作品(即“艺术风格化”的领域)。
测试涵盖了自然和艺术图像,以反映可能的实际应用。每种方法的有效性通过检查 AI 模型是否仍然可以在保护图像上生成现实且与提示相关的编辑来评估;如果生成的图像看起来令人信服且与提示匹配,则认为保护措施失败。
Stable Diffusion v1.5 用作预训练的图像生成器,用于研究人员的编辑任务。五个 种子 被选中,以确保可重复性:9222、999、123、66 和 42。所有其他生成设置,例如指导尺度、强度和总步数,遵循 PhotoGuard 实验中使用的默认值。
PhotoGuard 在自然场景图像上使用 Flickr8k 数据集进行测试,该数据集包含超过 8,000 张图像,每张图像都有多达五个字幕。
相反的想法
两组修改后的字幕从每个图像的第一张字幕中创建,使用 Claude Sonnet 3.5。一组包含 上下文接近 的提示,另一组包含 上下文遥远 的提示。
例如,从原始字幕 ‘一个穿着粉色连衣裙的年轻女孩进入一个木制小屋’,一个接近的提示将是 ‘一个穿着蓝色衬衫的年轻男孩进入一个砖房’。相比之下,一个 遥远 的提示将是 ‘两只猫懒散地躺在沙发上’。
接近的提示是通过用语义相似的术语替换名词和形容词来构造的;远距离提示是通过指示模型生成上下文完全不同的字幕来生成的。
所有生成的字幕都经过人工检查,以确保质量和语义相关性。Google 的 通用句子编码器 被用来计算原始字幕和修改后的字幕之间的语义相似度:

来自补充材料,Flickr8k 测试中使用的修改字幕的语义相似度分布。左图显示接近修改字幕的相似度分数,平均约为 0.6。右图显示遥远修改字幕的相似度分数,平均约为 0.1,反映出与原始字幕的语义距离更大。值使用 Google 的通用句子编码器计算。来源:https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf
每个图像及其保护版本都使用两个提示(接近和遥远)进行编辑:

使用 PhotoGuard 保护的自然照片的图像到图像生成结果。尽管存在干扰,Stable Diffusion v1.5 成功地遵循了编辑提示中的小和大语义变化,生成了与新指令匹配的真实输出。
指标
为了判断保护措施如何干扰 AI 编辑,研究人员测量了生成的图像与给定的文本提示的匹配程度,使用了比较图像内容和文本提示的评分系统:
为此,CLIP-S 指标使用一个可以理解图像和文本的模型来检查它们的相似性,而 PAC-S++ 添加了额外的由 AI 生成的样本,以使其比较更接近人类的估计。
这些图像-文本对齐(ITA)评分表示 AI 在修改受保护图像时如何遵循指令:如果受保护的图像仍然生成了高度对齐的输出,则认为保护措施 失败 地阻止了编辑。

在五个种子和使用接近和遥远提示的 Flickr8k 数据集上,保护的效果。图像-文本对齐使用 CLIP-S 和 PAC-S++ 评分。
研究人员比较了 AI 在编辑受保护图像和未受保护图像时如何遵循提示。他们首先查看了两者之间的差异,即 实际变化。然后,将差异缩放以创建 百分比变化,使得结果更容易在多次测试中比较。
这表明保护措施是否使 AI 更难或更容易地匹配提示。测试使用五个不同的随机种子重复进行,涵盖了字幕的小和大变化。
艺术攻击
对于自然照片的测试,使用了 Flickr1024 数据集,该数据集包含超过一千张高质量图像。每张图像都使用遵循以下模式的提示进行编辑:‘将风格更改为 [V]’,其中 [V] 代表七种著名的艺术风格之一:立体主义;后印象主义;印象主义;超现实主义;巴洛克;野兽派;和文艺复兴。
该过程涉及将 PhotoGuard 应用于原始图像,生成受保护的版本,然后将原始和受保护的图像都经过相同的一组风格转换编辑:

原始和受保护的自然场景图像,每张图像都经过立体主义、超现实主义和野兽派风格的编辑。
为了测试艺术作品上的保护方法,执行了风格转换,使用的图像来自 WikiArt 数据集,该数据集收集了广泛的艺术风格。编辑提示遵循与之前相同的格式,指示 AI 将风格更改为随机选择的、无关的风格,来自 WikiArt 标签:
Glaze 和 Mist 保护方法都应用于图像,然后进行编辑,以观察每种防御方法如何阻止或扭曲风格转换结果:

保护方法对艺术作品风格转换的影响示例。原始巴洛克图像旁边显示了使用 Mist 和 Glaze 进行保护的版本。在应用立体主义风格转换后,可以看到每种保护措施如何改变最终输出。
研究人员还对这些结果进行了定量测试:

风格转换编辑后图像-文本对齐评分的变化。
作者们评论说:
‘结果突出了对抗性干扰用于保护的重大局限性。相反,干扰通常会增强生成模型对提示的响应,使得攻击者能够生成更符合其目标的输出。这种保护不会破坏图像编辑过程,可能无法阻止恶意行为。 ‘
‘使用对抗性干扰的意外后果揭示了现有方法的漏洞,并强调了开发更有效的保护技术的迫切需要。 ‘
作者解释说,意外结果的原因可以追溯到扩散模型的工作原理:LDM 通过将图像转换为称为 潜在 的压缩版本来编辑图像;然后,通过许多步骤向该潜在表示添加噪声,直到数据变得几乎随机。
模型在生成过程中逆转此过程,在每个步骤中去除噪声;在每个阶段,文本提示都有助于指导噪声的清除,逐渐将图像塑造成与提示匹配的形状:

来自未受保护图像和受 PhotoGuard 保护图像的生成结果的比较,中间潜在状态被转换回图像以进行可视化。
保护方法向原始图像添加少量额外的噪声,然后输入该过程。虽然最初的干扰很小,但随着模型应用自己的噪声层,噪声会积累起来。
这种积累使得当模型开始去除噪声时,图像的更多部分变得“不确定”。由于不确定性增加,模型更依赖文本提示来填补缺失的细节,这给予了提示 比正常情况下更多的影响力。
实际上,保护措施使得 AI 更容易将图像重塑为与提示匹配,而不是更难。
最后,作者进行了一项测试,使用 提高恶意 AI 驱动图像编辑成本 论文中的精心设计的干扰代替纯高斯噪声。
结果遵循了之前观察到的相同模式:在所有测试中,百分比变化值保持为正。甚至这种随机、无结构的噪声也导致生成的图像和提示之间的对齐度更高。

使用高斯噪声模拟保护对 Flickr8k 数据集的影响。
结论
研究界已经在 LDM 的版权问题上推广对抗性干扰近乎 LDM 存在的时间一样长;但是,尚未从这一方向上出现任何坚实的解决方案。
要么强加的干扰会过度降低图像质量,要么模式被证明对操作和转换过程不具有弹性。
然而,这是一个很难放弃的梦想,因为替代方案似乎是第三方监控和来源框架,例如 Adobe 领导的 C2PA 方案,该方案旨在从相机传感器开始维护图像的来源链,但它与所描绘的内容没有内在的联系。
无论如何,如果对抗性干扰实际上使问题变得更糟糕,就像新论文表明在许多情况下可能是真的,那么人们不禁会想,通过这种手段寻求版权保护是否属于“炼金术”。
首次发表于 2025 年 6 月 9 日












