Anderson 视角
为受版权保护的动画角色提供“秘密身份”

中国的新研究提出了一种非侵入性的方法来保护受版权保护的动画角色,即在推理过程中用通用替代品“注入”角色。但这种方法能否击败提示黑客的聪明才智呢?
鉴于受版权保护的材料在大规模数据集中存在的程度(由于清除这些侵权的成本非常高),在这些数据集上训练的模型往往能够复制受版权保护的角色。
直接编辑训练模型或使用过滤器拦截关键词,当模型通过API访问时,通常会被通过间接描述受版权保护的元素来规避:
一款流行的AI聊天机器人生成的受版权保护的角色,似乎没有直接调用角色名称. 来源
在一个强大且持续的研究线中,模型修改技术已经尝试修改训练模型的参数,结果各不相同:
来自2023年论文《文本到图像扩散模型中的概念消融》中的图像,真实的布丽·拉尔森作为《惊奇队长》的图像被烘焙到一个流行的扩散模型中,当用户请求时,会变成松散相关的卡通图像. 来源
然而,消融通常是一个有害且不精确的过程,可能会频繁影响训练模型的其他特征;此外,还有多种方法可以绕过它。
另一种流行的方法是“负面提示”,即在模型被API访问时,发送一个额外的“反提示”来约束输出。当模型通过API访问时,可以发送一个“秘密”的负面提示,与用户已知提示一起发送,包括一个规则,旨在防止模型向用户提供禁止材料。这一方法,尽管很受欢迎,作为版权保护向量,但并不总是有效。
大多数关于事后推理审查的工作都与确保模型不输出CSAM或任何NSFW材料有关,尽管这些材料可能在训练数据中占有很大比例。这些举措可能会影响整个内容类别,而不是特定的实例,通常缺乏必要的细微差别来解决版权持有者寻求压制特定身份的担忧。
替身
考虑到这一点,中国的一篇新论文提出在图像生成过程中用学习到的通用替代品替换受版权保护的动画角色——“替身”,这些替身保留了角色的大致形状和结构,同时去掉了使角色可识别的独特细节:
通过新嵌入方法实现的受版权保护材料的“匿名化”表示,原本这些材料在训练模型中是可访问的. 来源
这种干预发生在生成过程中,而不会修改或微调底层扩散模型,并且可以调整以确定原始角色被擦除的程度。
这种方法暗示模型修改不是这个目的的好方法,而是将精心设计的嵌入注入到推理过程中——这些嵌入旨在“重构”而不是消融(归零、删除)受版权保护的资产。这个过程根本不会影响或修改基础模型,可以在各种模型中重用或改编。
虽然该方法是通过对较旧的Stable Diffusion模型系列进行测试的,但它也被成功应用于最近的Z-Image架构,表明作者的概念可以应用于各种生成架构。
该论文指出:
‘我们提出了一种可控的方法,作用于模型的连续文本表示,以便在生成过程中擦除目标角色。我们通过结构和详细约束优化了一个锚点嵌入,以作为角色替身,然后通过结构感知的自适应策略用锚点替换目标相关的嵌入。 ‘
‘实验表明,我们的方法实现了最先进的擦除有效性和图像保真度,同时支持可控的擦除程度、多目标删除和模型可迁移性。 ‘
‘此外,我们的优化锚点可以与当前的模型修改基线一起使用,以提高其擦除性能。’

作者称,新方法跨越多种架构,并提供细粒度控制
这篇题为擦除但保留:通过优化语义锚点可控地删除受版权保护的动画角色的新论文来自中国科学院信息工程研究所和中国科学院大学的七位作者。
方法
新方法背后的核心思想,如下所示,是创建一个替代品来取代受版权保护的角色,保留其大致形状和结构,同时去掉使角色可识别的独特视觉细节:
新方法的模式图
替代品,即作者所说的锚点,旨在保留原始角色的足够形状和结构,以便在同一场景中自然融入,同时去掉使角色独特的细节:
为了实现这一点,系统将为原始角色生成的粗略结构信息与为正在开发的锚点生成的信息进行比较,推动这两者朝着相似的整体形式发展。然后,受版权保护的角色的参考图像用于相反的目的,推动锚点远离其可识别的更细节:
为受版权保护的角色构造非侵权替代品的方法。角色的大致结构被保留,而其独特的视觉细节被抑制,生成一个用于生成的优化“锚点”
锚点
一旦这些属性被建立,锚点就需要被转换成扩散模型可以理解的东西。因此,锚点* [sic] 在CLIP文本编码器中获得了自己的可学习的表示,有效地创建了一个新的人工词/实体,其含义可以被塑造,而无需改变底层的图像生成模型。
这个新表示根据上述结构和细节目标反复调整,教锚点*去理解一个大致形状像受版权保护的角色,但去掉了其识别外观的含义。
自适应替换
在生成(推理)过程中,算法在编码提示中搜索与受版权保护的角色相关的术语,并用学习到的锚点嵌入替换它们,同时调整携带上下文信息的结束和填充嵌入:
为了准备这一步,系统首先允许去噪来建立请求图像的整体布局,监测其粗略结构的变化,以确定何时该布局开始稳定:

锚点替换在图像生成过程中发生的表示。去噪过程中跟踪图像的粗略结构变化,替换在大致布局稳定且更细节开始出现时触发
数据和测试
作者将他们的方法与五个基于提示的基线进行比较:安全潜在扩散(SLD);STG;SAFREE;TraSCE;以及负面提示(NP)。
优化的锚点嵌入也被集成到四种现有的模型修改方法中:MACE;UCE;ESD-u;以及AC。这是在尝试测试这些方法是否可以改进所提出的模型的角色删除性能时完成的。
为了评估,汇编了一个包含80个动画角色的数据集,包括36个拟人角色;23个动物形状角色;以及21个来自其他类别的角色——所有这些角色都是因为它们可以被扩散模型可靠地复制而被选中的。
然后,使用GPT-4o生成的提示,为每个角色生成了100张图像。
稳定扩散v1.4用于主要实验,另外还在进一步的稳定扩散版本上测试了可迁移性,包括v1.5;V2;v2.1;XL基线1.0;以及更最近的基于DiT的Z-Image。没有对任何预训练模型进行微调,因此每个模型的参数保持不变。
对于指标,LLaVA-1.5和BLIP-3测量了目标角色是否仍然可识别,较低的准确率表示删除更为彻底;结构相似性指数(SSIM)测量了结构的保真度;学习的感知相似度指标(LPIPS)测量了感知差异;美学预测器V2评分评估了修改图像的视觉质量。
弗雷切特感知距离(FID)和CLIP评分也从COCO-30K中无关的提示中计算,以衡量正常图像生成是否受到影响:
在80个动画角色中比较字符删除方法的测试结果。前两列测量了被删除的角色仍然可以被识别的频率,因此较低的分数表示更好的删除。其余列测量了原始图像和无关生成的保真度。箭头显示是否更高或更低的分数是可取的;粗体表示最佳结果,下划线表示次佳结果
在这些初始结果中,作者指出:
‘与所有基线相比,使用我们的方法擦除的图像在LLaVA-1.5(6.0%)和BLIP-3(4.0%)中获得了最低的目标识别准确率,分别比第二低的结果低3.5%和1.7%。 ‘
‘这表明了我们的方法的擦除有效性,因为它有效地欺骗了大型多模态模型。’
对于图像保真度,作者的方法产生了最高的SSIM评分(0.467)和最低的LPIPS评分(0.505),表明与测试方法相比,保留了最多的无关内容和背景结构。它还在角色删除方法中实现了最高的美学预测器V2评分(5.18),表明这种保真度并没有以牺牲整体视觉质量为代价。
接着进行了一个定性测试:
比较五个动画角色中的角色删除结果。每行显示来自不同方法的结果,顶部是原始的稳定扩散v1.4生成的图像,底部是所提出方法的结果。所提出方法更一致地替换了目标角色,同时保留了周围的场景。请参阅原始源PDF或项目站点以获取略高的分辨率
根据论文,示例显示了特别明显的差异,尤其是对于具有更复杂形状和属性的角色,唐老鸭和超级马里奥被引用为例子:
‘我们的方法通过优化的锚点实现了动画角色的无缝擦除,而基于提示的基线通常会失败——尤其是对于具有复杂形状和属性的角色(例如唐老鸭和超级马里奥)。 ‘
‘此外,我们的方法在不引入模糊或扭曲伪影的情况下实现了背景一致性,支持迭代创作工作流。’
细粒度控制
连续的嵌入空间还允许调整角色删除的强度,而不是将其视为二元选择。通过在优化的锚点和原始目标嵌入之间进行插值,该方法可以逐渐恢复更多的角色,同时保留周围的图像结构:
显示不同程度的角色删除的测试图像。第一列是原始角色,第二列是擦除版本,第三列是被删除的视觉特征;最后几列显示了在α=0.25、0.5和0.75时的中间设置。更高的α值保留了更多原始角色的特征
如上所示,作者还在角色小熊维尼、奥拉夫、米妮老鼠和史迪奇上测试了这种控制。随着恢复强度的变化,结构相似性保持相对稳定,而LLaVA-1.5和BLIP-3的识别度会随着更多角色的恢复而增加。
小熊维尼和史迪奇在相对狭窄的范围内变得可识别;奥拉夫和米妮老鼠的变化更为渐进;米妮老鼠只需恢复很少的特征就变得可识别,这表明适当的擦除强度取决于被针对的角色。
还进行了成功的多目标一次性替换实验,我们将读者指向原始论文以获取更多细节和额外的补充结果和材料。
结论
如往常一样,这是最新的版权保护“防护栏”变体,相当于在马已经逃脱后才关上马厩门。
在那些罕见的案例中,研究人员和公司试图抑制模型生成裸体和/或色情内容的能力,通过实际切断模型对训练数据集中的“NSFW”材料的内部访问(因为实际上清除这些材料的成本太高),结果发现模型不再能正确理解人体解剖学。
这里提出的新方法可以说相当于在构建NSFW过滤器时,从模型中“去除”一个特定的色情明星,在一个模型被训练在大量网络内容上(包括色情内容)的情况下。对于新方法,创建一个通用的“替身”来替换受版权保护的角色,必须在模型的潜在空间中保留超级英雄领域;而目标受版权保护的角色越重要,它就越定义了训练空间中的领域。
因此,删除它们就像试图从已经搅拌的咖啡中去除糖一样。
因此,虽然这种方法可能会在添加到前沿模型的不断增长的API防火墙中获得一些有限的成功,但历史上表明,GenAI模型的相互关联性意味着,这种方法针对的受版权保护的材料可能仍然可以通过提示者的通常聪明才智来访问。
首次发布于2026年8月14日,星期五












