Anderson 视角
在AI生成图像中自动化版权保护

正如我们上周讨论的那样,即使是流行的生成式AI系统背后的核心基础模型也可能产生侵犯版权的内容,这是由于数据集的策划不充分或不当,以及训练数据中存在多个相同图像的版本,从而导致过拟合,并增加了可识别的复制的可能性。
尽管努力在生成式AI领域占据主导地位,并且压力越来越大,要求遏制知识产权侵犯,但像MidJourney和OpenAI的DALL-E这样的主要平台仍然面临着防止无意中复制受版权保护的内容的挑战。

生成式系统复制受版权保护的数据的能力经常出现在媒体上。
随着新模型的出现,以及中国模型的崛起,基础模型中受版权保护的材料的抑制是一个艰巨的任务。事实上,市场领先者OpenAI去年宣布,创建有效且有用的模型而不使用受版权保护的数据是“不可能”的。
先前艺术
关于无意中生成受版权保护的材料,研究场景面临着一个与包含色情和其他NSFW材料在源数据中的挑战类似的挑战:一方面想要知识的好处(即正确的人体解剖学,这历史上一直基于裸体研究),另一方面又不想要滥用它。
同样,模型制造者想要受版权保护的材料的巨大范围的好处,这些材料进入了超大规模的数据集,如LAION,但又不希望模型发展出侵犯知识产权的能力。
忽视试图隐藏使用受版权保护的材料的道德和法律风险,过滤后一种情况更加具有挑战性。NSFW内容通常包含低级别的潜在特征,使得过滤更加有效,而不需要直接比较现实世界的材料。相比之下,定义数百万受版权保护作品的潜在嵌入不容易识别,使得自动检测更加复杂。
CopyJudge
人类的判断是一个稀缺和昂贵的商品,不仅在数据集的策划中,也在创建后处理过滤器和“安全”系统中,这些系统旨在确保API基于的门户(如MidJourney和ChatGPT的图像生成能力)不会向用户提供受版权保护的材料。
因此,瑞士、索尼AI和中国之间的新学术合作提供了CopyJudge——一种自动化的方法,用于协调多个ChatGPT基于的“法官”来检查输入是否有侵犯版权的迹象。

CopyJudge评估各种侵犯版权的AI生成图像。 来源:https://arxiv.org/pdf/2502.15278
CopyJudge有效地提供了一个自动化框架,利用大型视觉语言模型(LVLMs)来确定受版权保护的图像和文本到图像扩散模型生成的图像之间的实质性相似性。

CopyJudge方法使用强化学习和其他方法来优化侵犯版权的提示,然后使用这些提示的信息来创建新的提示,这些提示不太可能引发受版权保护的图像。
虽然许多在线AI图像生成器过滤用户的提示以排除NSFW、受版权保护的材料、真人重现和其他禁止的领域,但CopyJudge使用精炼的“侵犯”提示来创建“清理”提示,这些提示不太可能引发禁止的图像,而不是直接阻止用户的提交。
虽然这不是一个新方法,但它在一定程度上使得API基于的生成式系统摆脱了简单地拒绝用户输入(因为这允许用户通过实验开发“后门”访问禁止的生成)。
最近的一个漏洞(已经被开发人员关闭)允许用户在Kling生成式AI平台上生成色情材料,只需在图像到视频工作流程中包含一个突出的十字架或基督教十字架。

在2024年底开发人员修复的漏洞中,用户可以通过在I2V种子图像中包含一个十字架或基督教十字架来强制系统生成禁止的NSFW输出。没有关于这个已经过时的漏洞背后的逻辑的解释。 来源:Discord
这样的实例强调了在线生成式系统中提示清理的必要性,尤其是机器忘却(其中基础模型本身被修改以删除禁止的概念)可能对最终模型的可用性产生不良影响。
寻求更为缓和的解决方案,CopyJudge系统模仿人类基于的法律判断,使用AI将图像分解为关键元素,如构图和颜色,以过滤掉非可版权的部分,并比较剩余的部分。它还包括一个AI驱动的方法来调整提示和修改图像生成,帮助避免版权问题,同时保留创造性内容。
实验结果表明,CopyJudge的效果与最先进的方法相当,并且在与之前的工作相比,具有更好的泛化能力和可解释性。
这篇新论文的标题是《CopyJudge:文本到图像扩散模型中的自动版权侵权识别和缓解》,来自EPFL、索尼AI和中国西湖大学的五位研究人员。
方法
虽然CopyJudge使用GPT创建滚动法庭的自动化法官,但作者强调该系统并不是针对OpenAI的产品优化的,并且可以使用任何其他大型视觉语言模型(LVLMs)代替。
首先,作者的抽象-过滤-比较框架需要将源图像分解为组成部分,如下面的左侧所示:

CopyJudge工作流程的初始阶段的概念图。
在左下角,我们看到一个过滤代理将图像部分分解,试图识别可能与受版权保护的作品相关的特征,但这些特征本身太过通用,无法被视为侵犯版权。
然后,使用多个LVLMs来评估过滤后的元素——一种在诸如2023年CSAIL的论文《通过多智能体辩论提高语言模型的事实性和推理能力》和ChatEval等多个论文中被证明有效的方法。
作者表示:
“我们采用了一种完全连接的同步通信辩论方法,每个LVLM在做出下一个判断之前都会收到其他LVLMs的响应。这创建了一个动态的反馈循环,增强了分析的可靠性和深度,因为模型会根据其他模型提供的新见解调整其评分。”
“每个LVLM可以根据其他LVLMs的响应调整其评分,也可以保持不变。”
还包括人类评分的图像对,通过少数样本学习融入过程。
缓解
接下来,作者专注于之前描述的提示缓解过程。

CopyJudge的提示缓解和潜在噪声的模式图。系统根据反馈迭代调整提示,并使用强化学习来修改潜在变量,减少侵犯版权的风险。
两种用于提示缓解的方法是基于LVLM的提示控制,有效的非侵犯提示在GPT集群中迭代开发——一种不需要内部访问模型架构的“黑盒”方法;以及基于强化学习的方法,奖励被设计为惩罚输出侵犯版权的内容。
数据和测试
为了测试CopyJudge,使用了多个数据集,包括D-Rep,它包含由人类评分的真实和虚假图像对。

在Hugging Face上探索D-Rep数据集。该集合配对了真实和生成的图像。 来源:https://huggingface.co/datasets/WenhaoWang/D-Rep/viewer/default/
CopyJudge模式将D-Rep中评分为4或更高的图像视为侵犯版权的例子,其余图像作为非侵犯版权的图像。数据集中的4000个官方图像被用作测试图像。此外,研究人员从维基百科中选择并策划了10个著名的卡通人物的图像。
用于生成潜在侵犯版权的图像的三种扩散式架构是Stable Diffusion V2;Kandinsky2-2;和Stable Diffusion XL。作者从每个模型中手动选择了一个侵犯版权的图像和一个非侵犯版权的图像,得到了60个正样本和60个负样本。
用于比较的基准方法是:L2范数;学习的感知图像补丁相似性(LPIPS);SSCD;RLCP;和PDF-Emb。作为评估指标,使用了准确率和F1得分作为侵犯版权的标准。
GPT-4o被用来填充CopyJudge的内部辩论团队,使用三个代理,最多五次迭代,对于任何特定的提交图像。D-Rep中每个评分的三个随机图像被用作代理的先验知识。

CopyJudge的第一次轮次的侵犯版权结果。
作者对这些结果评论道:
“很明显,传统的图像复制检测方法在版权侵权识别任务中存在局限性。我们的方法在大多数方法中表现出色。对于最先进的方法PDF-Emb,它是在D-Rep的36,000个样本上训练的,我们在D-Rep上的性能略逊一筹。”
“然而,其在卡通IP和艺术作品数据集上的糟糕性能凸显了其缺乏泛化能力,而我们的方法在各个数据集上都表现出卓越的结果。”
作者还指出,CopyJudge提供了一个“相对”更明显的合法和侵犯版权的界限:

来自新论文的补充材料的进一步示例。
研究人员将他们的方法与2024年的一项与索尼AI合作的论文进行了比较,题为《检测、解释和缓解扩散模型中的记忆》。这项工作使用了一个经过微调的Stable Diffusion模型,包含200个记忆(即过拟合)的图像,以便在推理时引出受版权保护的数据。
新工作的作者发现,他们自己的提示缓解方法与2024年的方法相比,能够生成不太可能引起侵犯版权的图像。

CopyJudge与2024年工作的记忆缓解结果。
作者评论道:
“我们的方法可以生成不太可能引起侵犯版权的图像,同时保持相似的、略微降低的匹配准确率。如图所示,我们的方法有效地避免了之前方法的缺点,包括未能缓解记忆或生成高度偏离的图像。”

在缓解记忆之前和之后生成的图像和提示的比较。
作者还进行了进一步的测试,以研究侵犯版权的缓解,研究了显式和隐式侵犯版权。
显式侵犯版权发生在提示直接引用受版权保护的材料时,例如“生成一幅米老鼠的图像”。为了测试这一点,研究人员使用了20个卡通和艺术作品样本,使用Stable Diffusion v2和包含名称或作者属性的提示生成侵犯版权的图像。

使用Stable Diffusion生成显式侵犯版权的图像的作者的潜在控制(LC)方法与之前工作的提示控制(PC)方法的比较。
隐式侵犯版权发生在提示中没有明确的版权引用,但仍然会生成侵犯版权的图像,这通常是由于某些描述性元素而发生的,这种情况对于商业文本到图像模型尤其相关,因为这些模型通常包含内容检测系统来识别和阻止与版权相关的提示。
为了探索这一点,作者使用了与显式侵犯版权测试中相同的IP锁定样本,但使用DALL-E 3生成了没有直接版权引用的侵犯版权的图像(尽管该论文指出,该模型的内置安全检测模块被观察到拒绝某些触发其过滤器的提示)。

使用DALL-E 3的隐式侵犯版权,侵犯版权评分和CLIP评分。
作者指出:
“可以看出,我们的方法显著降低了侵犯版权的可能性,无论是显式还是隐式侵犯版权,只有略微降低了CLIP评分。仅使用潜在控制的侵犯评分相对于提示控制略高,因为在不改变提示的情况下检索非侵犯的潜在变量是相当具有挑战性的。然而,我们仍然可以有效地降低侵犯评分,同时保持更高的图像-文本匹配质量。”
“图像显示,我们避免了侵犯版权,同时保留了用户的需求。”

在侵犯版权缓解之前和之后生成的图像。
结论
虽然这项研究提出了一种有前途的版权保护方法,但依赖于大型视觉语言模型(LVLMs)进行侵犯版权的检测可能会引发人们对偏见和一致性的担忧,因为AI驱动的判断可能并不总是符合法律标准。
也许最重要的是,该项目还假设版权执行可以自动化,尽管现实世界中的法律决定通常涉及主观和语境因素,这些因素AI可能难以解释。
在现实世界中,尤其是在AI输出方面,法律共识的自动化似乎可能在很长一段时间内仍然是一个有争议的问题,并且超出了本研究所讨论的领域范围。
首次发表于2025年2月24日星期一












