Anderson 视角

审查 AI 模型效果不佳,研究揭示

mm
将 Unite.AI 添加到您在 Google 上的首选来源
ChatGPT-4o, Krita (Flux/Flux Koncept Dev), Firefly.

试图通过从已训练模型中抹除被禁内容(如色情、暴力或受版权保护的风格)来审查 AI 图像生成器的做法收效甚微:一项新研究发现,当前的概念抹除方法会让‘禁用’属性泄漏到无关图像中,并且也未能阻止与所谓‘已抹除’内容高度相关的变体出现。

 

如果生产基础 AI 模型的公司无法阻止其被滥用于生成令人反感或非法的内容,他们就面临被起诉和/或被关闭的风险。相反,若供应商仅通过 API 提供模型,例如 Adobe 的 Firefly 生成引擎,则可以不必担心模型可能产生的内容,因为用户的提示和生成的输出都会被检查和清理:

Adobe 的 Firefly 系统在 Photoshop 等工具中使用,有时会直接拒绝生成请求,通过阻止提示词来防止任何内容的创建。另一些情况下,它会生成图像,但在审查后阻止结果。这种中途拒绝的方式在 ChatGPT 中也会出现,当模型开始响应后因识别到政策违规而中断——有时甚至可以短暂看到被中止的图像。

Adobe 的 Firefly 系统在 Photoshop 等工具中使用,有时会直接拒绝生成请求,通过阻止提示词来防止任何内容的创建。另一些情况下,它会生成图像,但在审查后阻止结果。这种中途拒绝的方式在 ChatGPT 中也会出现,当模型开始响应后因识别到政策违规而中断——有时甚至可以短暂看到被中止的图像。

然而,这类 API 式过滤通常可以被本地安装的模型用户绕过,包括用户可能希望通过本地训练自定义数据来定制的视觉语言模型(VLM)。

在大多数情况下,禁用此类操作非常简单,只需在 Python 中注释掉函数调用(不过此类 hack 往往需要在框架更新后重复或重新实现)。

从商业角度来看,这似乎不成问题,因为 API 方式最大化了企业对用户工作流的控制。但从用户角度来看,API‑only 模型的成本以及误判或过度审查的风险可能会促使他们下载并定制开源替代方案——至少在开源许可证友好的情况下如此。

最后一个在发布时未尝试植入自我审查的重大模型是 Stable Diffusion V1.5,近三年前。随后,披露其训练语料库 包含儿童性虐待材料,引发了越来越多的呼声要求禁用该模型,并在 2024 年将其从 Hugging Face 仓库 下架。

删掉它!

讽刺者认为,公司对本地可安装生成式 AI 模型进行审查的动机,仅仅是出于对 法律风险 的担忧,以防其框架因促进非法或令人反感的内容而被公开。

事实上,一些‘本地友好’的开源模型并不难去审查(例如 Stable Diffusion 1.5 和 DeepSeek R1)。

相较之下,Black Forest Lab 最近发布的 Flux Kontext 模型系列 以公司对整个 Kontext 系列进行 显著承诺 的审查为标志。这一做法既通过细致的数据筛选实现,也在训练后进行有针对性的 微调,旨在消除任何残留的 NSFW 或禁用内容倾向。

这正是过去 2-3 年研究界的关注焦点:强调对数据不足筛选的模型进行事后修正。此类方案包括 统一概念编辑于扩散模型(UCE);文本到图像扩散模型的可靠高效概念抹除(RECE);扩散模型中的大规模概念抹除(MACE);以及 概念半渗透结构被注入为膜层(SPM)。

2024 年的论文《统一概念编辑于扩散模型》提供了对注意力权重的闭式编辑,实现了对文本到图像模型中多个概念的高效编辑。但该方法经得起审视吗?来源:https://arxiv.org/pdf/2308.14761

2024 年的论文《统一概念编辑于扩散模型》提供了对注意力权重的闭式编辑,实现了对文本到图像模型中多个概念的高效编辑。但该方法经得起审视吗? Source: https://arxiv.org/pdf/2308.14761

尽管这种方法效率很高(如 LAION 这类超大规模集合根本无法手动筛选),但未必有效:根据一项新的美国研究,前述所有编辑程序——代表了后训练 AI 模型修改的最先进技术——实际上并未表现出良好效果。

作者发现,这些概念擦除技术(CETs)通常很容易被规避,即使在有效的情况下,也会产生相当大的副作用:

概念擦除对文本到图像模型的影响。每列展示一个提示词及标记为擦除的概念,并显示编辑前后的生成结果。层级结构指示概念之间的父子关系。示例突出常见副作用,包括未能擦除子概念、抑制邻近概念、通过改写规避以及擦除属性转移到无关对象。来源:https://arxiv.org/pdf/2508.15124

概念擦除对文本到图像模型的影响。每列展示一个提示词及标记为擦除的概念,并显示编辑前后的生成结果。层级结构指示概念之间的父子关系。示例突出常见副作用,包括未能擦除子概念、抑制邻近概念、通过改写规避以及擦除属性转移到无关对象。 Source: https://arxiv.org/pdf/2508.15124

作者发现,主流的当前概念擦除技术未能阻止组合提示词(例如,红色汽车或小木椅);即使在擦除父类别后,子类仍常常漏掉(如在移除车辆后,汽车或公交车仍会出现);并且会引入新问题,如属性泄漏(例如,删除蓝色沙发可能导致模型生成无关的对象,如蓝色椅子)。

在超过80%的测试案例中,擦除像vehicle这样的宽泛概念并未阻止模型生成更具体的vehicle实例,如汽车或公交车。

编辑,论文观察到,也会导致注意力图(模型决定图像中关注位置的部分)散乱,削弱输出质量。

有趣的是,论文发现逐个擦除相关的已训练概念比一次性全部移除效果更好——尽管这并未消除所研究编辑方法的所有缺陷:

逐步擦除与一次性全部擦除策略的比较。当同时擦除所有“泰迪熊”变体时,模型仍会生成类似熊的对象。逐步擦除变体更为有效,使模型能够更可靠地抑制目标概念。

逐步擦除与一次性全部擦除策略的比较。当同时擦除所有“泰迪熊”变体时,模型仍会生成类似熊的对象。逐步擦除变体更为有效,使模型能够更可靠地抑制目标概念。

尽管研究人员目前无法为论文中概述的问题提供解决方案,但他们已经开发了一个新数据集和基准,可能帮助后续研究了解其“审查”模型是否如预期运行。

论文指出:

“以往的评估仅依赖于少量的目标和保留类别;例如,在擦除‘汽车’时,仅测试模型生成汽车的能力。我们证明这种方法根本不足,概念擦除评估应更全面,涵盖所有相关子概念,如‘红色汽车’。”

“通过引入包含组合变体的多样化数据集,并系统分析对邻近概念的影响、概念规避和属性泄漏等效应,我们揭示了现有CET的显著局限性和副作用。”

“我们的基准与模型无关,易于集成,极其适合帮助开发新的概念擦除技术(CETs)。”

尽管CETs擦除了目标概念“鸟”,但在组合变体“红色鸟”(上)上失败。擦除“蓝色沙发”后,所有方法也失去了生成蓝色椅子(下)的能力。成功的结果用绿色勾标记,失败的用红色叉标记。

尽管CETs擦除了目标概念“鸟”,但在组合变体“红色鸟”(上)上失败。擦除“蓝色沙发”后,所有方法也失去了生成蓝色椅子(下)的能力。成功的结果用绿色勾标记,失败的用红色‘X’符号标记。

该研究提供了一个有趣的洞见,展示了模型的潜在空间中概念交织的程度,以及纠缠在多大程度上阻碍任何形式的明确且真正离散的概念擦除。

新论文题为《从扩散模型中擦除概念的副作用》,作者来自马里兰大学的四位研究者。

方法与数据

作者认为,以前声称能够从扩散模型中擦除概念的工作并未充分证明其主张,声明如下:

“擦除的主张需要更稳健且更全面的评估。例如,如果要擦除的概念是‘vehicle’,则其子概念如‘car’以及组合概念如‘red car’或‘small car’也应被擦除。”

“然而,现有评估协议并未考虑概念层级和组合性,因为它们仅关注单一被擦除概念的准确性。[The authors of EraseBench]评估CET对视觉相似和同义概念(如‘cat’和‘kitten’)的影响[;]但并未对概念的层级和组合性进行全面探查。”

为了为未来项目提供基准数据,作者创建了Side Effect Evaluation(SEE)数据集——一个大型文本提示集合,用于测试概念擦除方法的效果。

这些提示遵循一个简单模板,描述对象的尺寸、颜色和材质,例如一张小红木制汽车的图像。

对象取自MS-COCO数据集,并组织成超类层级,如vehicle,以及子类如car或bus,其属性组合构成叶节点(层级的最具体层级)。该结构使得可以在不同语义层级上测试擦除,从宽泛类别到具体变体。

为支持自动评估,每个提示都配对了一个是非问题,例如图像中有汽车吗?,并且也用作图像分类模型的类别标签:

SEE 数据集中通过变化尺寸、颜色和材质属性生成的提示组合。

SEE 数据集中通过变化尺寸、颜色和材质属性生成的提示组合。

为了衡量每种概念擦除方法的表现,作者设计了两种评分方式:目标准确率,用于追踪被擦除概念在生成图像中仍出现的频率;以及保留准确率,用于追踪模型是否仍生成本不应被擦除的内容。

这两个分数的平衡旨在揭示该方法是否能够在不损害模型整体输出的前提下成功移除禁用概念。

作者在三种失效模式下评估概念擦除:首先,衡量删除如car的概念是否会干扰邻近或不相关概念,依据语义和属性相似度;其次,测试在删除vehicle后,是否可以通过提示子概念如red car绕过擦除。

最后,检查属性泄漏,即被擦除概念关联的特征出现在不相关对象中(例如,删除couch可能导致另一个对象,如potted plant继承其颜色或材质)。最终数据集包含5056条组合提示。

测试

之前测试的框架包括前文列出的UCE、RECE、MACE和SPM。研究人员采用原项目的默认设置,并在配备48GB显存的NVIDIA RTX 6000 GPU上对所有模型进行微调。

Stable Diffusion 1.4——文献中最常用的模型之一,被用于所有测试——部分原因是最早的SD模型几乎没有概念约束,因而在本研究情境下提供了一个空白板。

SEE 数据集中的5056个提示均在未编辑和已编辑的模型版本上运行,使用固定的random seeds生成每个提示的四张图像,以检验擦除效果在多个输出间是否保持一致。每个编辑模型共生成了20,224张图像。

保留概念的存在性依据先前的文本到图像擦除方法评估,使用VQA模型BLIP、QWEN 2.5 VL和Florence-2base进行评估。

对邻近概念的影响

首个测试衡量擦除概念是否意外影响了邻近概念。例如,在删除car后,模型应停止生成red car或large car,但仍能生成如bus或truck等相关概念,以及fork等不相关概念。

该分析使用CLIP嵌入相似度和基于属性的编辑距离来估计每个概念与被擦除目标的接近程度,从而量化干扰的传播范围:

将目标准确率(左)和保留准确率(右)的综合结果绘制在语义相似度(上)和组合距离(下)上。理想的概念擦除方法应在所有距离上表现出低目标准确率和高保留准确率,但结果显示当前技术未能干净地泛化,较近的概念要么未被充分擦除,要么被过度扰动。

将目标准确率(左)和保留准确率(右)的综合结果绘制在语义相似度(上)和组合距离(下)上。理想的概念擦除方法应在所有距离上表现出低目标准确率和高保留准确率;但结果显示当前技术未能干净地泛化,较近的概念要么未被充分擦除,要么被过度扰动。

对于这些结果,作者评论道:

“所有 CET 在擦除后仍继续生成组合或语义上较远的目标变体,这在理想情况下不应出现。显然,UCE 在 [preserve set] 上始终比其他 CET 方法取得更高的准确率,表明对语义相关概念的意外影响最小。”

“相反,SPM 的准确率最低,表明其编辑策略更容易受到概念相似性的影响。”

在测试的四种方法中,RECE 在阻断目标概念方面最为有效。然而,如上图左侧所示,所有方法均未能抑制组合变体。擦除 bird 后,模型仍生成红色鸟的图像,说明该概念仍部分保留。

移除 blue couch 也导致模型无法生成 blue chair,表明对邻近概念造成了损害。

RECE 对组合变体的处理优于其他方法,而 UCE 在保留相关概念方面表现更佳。

擦除规避

擦除规避测试评估模型在其超类被擦除后是否仍能生成子类概念。例如,如果 vehicle 被移除,测试会检查模型是否仍能产生 bicycle 或 red car 等输出。

提示同时针对直接子类和组合变体,以确定概念擦除操作是否真正删除了完整层级,或是否可以通过更具体的描述绕过。

在 Stable Diffusion v1.4 上,通过子类和组合变体规避已擦除的超类,准确率越高表明规避程度越大。

在 Stable Diffusion v1.4 上,通过子类和组合变体规避已擦除的超类,准确率越高表明规避程度越大。

未编辑的模型在所有超类上保持高准确率,证实它 未 移除任何目标概念。在 CET 中,MACE 的规避最少,在超过一半的测试类别中实现了最低的子类准确率。RECE 也表现良好,尤其在 accessory、sports 和 electronic 组别中表现突出。

相比之下,UCE 和 SPM 显示出更高的子类准确率,表明被擦除的概念更容易通过相关或嵌套的提示被绕过。

作者指出:

“[All] CET 成功抑制了目标超类概念(“food”)。然而,当使用基于属性的食物层级子项(例如,一个大披萨)进行提示时,所有方法仍会生成食物项目。”

“同样在 vehicle 类别中,尽管擦除了 “vehicle”,所有模型仍会生成自行车。”

属性泄漏

第三项测试——属性泄漏——检查与被擦除概念关联的特征是否出现在图像的其他部分。

例如,在擦除 couch 后,模型既不应生成沙发,也不应将其典型属性(如颜色或材质)应用于同一提示中的不相关对象。此项通过让模型同时出现配对对象的提示,并检查被擦除的属性是否错误地出现在保留概念中来衡量:

概念擦除后的属性标记注意力图。左图:当“bench”被擦除时,标记“wooden”转移到鸟上,导致木质鸟。右图:擦除“couch”未能抑制沙发生成,而标记“large”错误地分配给了甜甜圈。

概念擦除后的属性标记注意力图。左图:当“bench”被擦除时,标记“wooden”转移到鸟上,导致木质鸟。右图:擦除“couch”未能抑制沙发生成,而标记“large”错误地分配给了甜甜圈。

RECE 在擦除目标属性方面最为有效,但也在保留的提示中引入了最多的属性泄漏,甚至超过了未编辑的模型。UCE 的泄漏量低于其他方法。

作者指出,结果表明必须在内部进行权衡,更强的擦除会增加属性误转移的风险。

结论

模型的潜在空间在训练过程中并不会有序地填满,概念也不会整齐地放在架子或文件柜中;相反,训练得到的嵌入既是内容也是容器:它们没有明确的边界,而是相互交融,使得移除变得困难——就像试图在不失血的情况下抽取一磅肉体。

在智能且不断演化的系统中,基础事件——比如烫伤自己的手指后对火产生敬畏——会与随后形成的行为和关联紧密相连,这使得构建一个可能仅保留了核心、潜在‘禁用’概念的推论,却本身缺失该概念的模型变得十分困难。

 

* 我的作者内嵌引用转换为超链接。

首次发布于2025年8月22日星期五

机器学习撰稿人,专注于人类图像合成的领域专家。曾任 Metaphysic.ai 的研究内容负责人,直至其并入 DNEG 的 Brahma.ai。
网站: martinanderson.ai
联系:martin@martinanderson.ai