Anderson 视角

现在NSFW和“名人”姿势成为AI审查的对象

mm
将 Unite.AI 添加到您在 Google 上的首选来源
An artist's wooden mannequin getting arrested – Flux 1D.

一种新的AI安全保障机制针对生成视频系统,提出审查身体姿势。可能被解释为性暗示、“冒犯手势”或甚至受版权保护的名人姿势或潜在商标姿势的身体姿势(或面部表情)都被针对。

 

来自中国和新加坡的新研究解决了“不安全”图像和视频生成的一个较为鲜为人知的领域:所描绘的人物的姿势本身,即身体或面部表情的排列方式。

新研究中提出的PoseGuard系统的概念图。来源:https://arxiv.org/pdf/2508.02476

新研究中提出的PoseGuard系统的概念图。来源:https://arxiv.org/pdf/2508.02476

该系统,称为PoseGuard,使用微调LoRAs创建无法生成“禁止”姿势的模型。采取这种方法是因为FOSS模型中的安全保障通常可以轻松克服,强调这种新“过滤器”专门针对本地安装(因为API-only模型可以过滤入站和出站内容和提示,而无需通过微调危及模型权重的完整性)。

这并不是第一次将姿势视为本身就是不安全的数据;“性暗示面部表情”已经成为一个小领域有一段时间了,而新工作的几位作者也创建了较不复杂的Dormant系统。

然而,新论文是第一个,将姿势的分类扩展到性暗示内容之外,甚至包括“受版权保护的名人动作”:

“我们根据生成输出的潜在风险定义不安全姿势,而不是基于几何特征。[不安全]姿势包括:1)歧视性姿势(例如,跪姿,冒犯手势),2)性暗示NSFW姿势,以及3)模仿名人特定图像的受版权保护姿势。”

“这些姿势通过在线来源(例如,维基百科),LLM-based过滤和风险标记数据集(例如,Civitai NSFW标签)收集,确保用于训练的不安全姿势数据集平衡和全面。”

PoseGuard开发的50个核心姿势中的“NSFW”类别。

PoseGuard开发的50个核心姿势中的“NSFW”类别。

值得注意的是,名人姿势可以被商标通过法律手段保护,而且充分“创造性”的姿势或姿势组合可以作为独特的舞蹈序列受到保护。然而,即使一个标志性的单一姿势可能不受保护,如一位摄影师在Rentmeester Vs. Nike 判决中发现的那样:

一位摄影师拍摄了左边的迈克尔·乔丹照片,当耐克重现该照片(右)时,该摄影师起诉耐克;然而,法官小组驳回了这一诉讼。来源:https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

一位摄影师拍摄了左边的迈克尔·乔丹照片,当耐克重现该照片(右)时,该摄影师起诉耐克;然而,法官小组驳回了这一诉讼。来源:https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

新PoseGuard系统声称是第一个在检测到不安全姿势时降低输出质量的系统;将安全防护直接嵌入生成模型;在三个类别中定义“不安全”姿势;并确保一旦修改了违规姿势以逃避过滤,生成保持质量和完整性。

新论文的标题为PoseGuard:带有安全防护的姿势引导生成,由来自中国科学技术大学、(新加坡)科学、技术和研究机构(A\*STAR CFAR)和南洋理工大学的六位研究人员共同撰写。

方法

PoseGuard利用后门攻击的逻辑构建直接到模型中的防御机制。在典型的后门攻击中,特定输入触发恶意输出,而PoseGuard逆转了这种设置:某些预定义的被认为是不安全的姿势由于其性暗示、冒犯或受版权保护的性质,与“中性”目标图像(例如空白或模糊帧)相关联。

通过在正常和触发姿势的组合数据集上微调模型,该系统学习保留对良性输入的保真度,同时降低不安全输入的输出质量:

PoseGuard使用共享去噪UNet处理参考图像和姿势序列,结合预训练权重和安全对齐微调。这种设置允许模型在不安全姿势下抑制有害生成,同时保持正常输入的输出质量。

PoseGuard使用共享去噪UNet处理参考图像和姿势序列,结合预训练权重和安全对齐微调。这种设置允许模型在不安全姿势下抑制有害生成,同时保持正常输入的输出质量。

这种“在模型内”的策略消除了对外部过滤器的需求,并且即使在对抗或开源环境中也保持有效。

数据和测试

为了获取良性基准姿势,作者使用了UBC-Fashion数据集:

来自不列颠哥伦比亚大学时尚数据集的示例,该数据集用于PoseGuard的良性姿势来源。来源:https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

来自不列颠哥伦比亚大学时尚数据集的示例,该数据集用于PoseGuard的良性姿势来源。抽象姿势从这些图像中使用姿势估计框架提取。 来源:https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

不安全姿势,如前所述,来自开源平台,如CivitAI。姿势使用DWPose框架提取,结果为768x768px姿势图像:

用于训练的50个不安全姿势的示例。显示的是NSFW和受版权保护的姿势,来源于维基百科、Render-State、Civitai和谷歌搜索。

用于训练的50个不安全姿势的示例。显示的是NSFW和受版权保护的姿势,来源于维基百科、Render-State、Civitai和谷歌搜索。

姿势引导生成模型是AnimateAnyone

使用的六个指标是Fréchet视频距离(FVD);FID-VID结构相似性指数(SSIM);峰值信噪比(PSNR);学习到的感知相似性度量(LPIPS);以及Fréchet Inception距离(FID)。测试是在NVIDIA A6000 GPU上进行的,具有48GB的VRAM,在批量大小为4和学习率为1×10-5的情况下进行。

测试的三个主要类别是有效性鲁棒性泛化性

在第一个类别中,即有效性,作者比较了两个PoseGuard的训练策略:去噪UNet的完全微调和使用LoRA模块的参数高效微调。

两种方法都可以抑制不安全姿势的输出,同时保持对良性姿势的输出质量,但具有不同的权衡:完全微调可以实现更强的抑制和保持更高的保真度,特别是当不安全训练姿势的数量很小时;而LoRA-based微调会随着不安全姿势的数量增加而引入更多的生成质量下降——但需要的参数更少,计算量也更少。

PoseGuard在生成和防御指标上的性能。向上箭头表示更高的值更好;向下箭头表示更低的值更好。

PoseGuard在生成和防御指标上的性能。向上箭头表示更高的值更好;向下箭头表示更低的值更好。

定性结果(见下图)显示,在未进行干预的情况下,模型以高保真度重现了冒犯性和NSFW姿势。启用PoseGuard后,这些姿势触发了低质量或空白输出,而良性输入保持了视觉上的完整性。随着防御集从四个不安全姿势增加到32个,良性输出质量适度下降,尤其是对于LoRA。

使用完全参数微调对单个不安全姿势的PoseGuard响应的视觉结果。模型抑制不安全姿势的输出,将其重定向到黑色图像,同时保持正常输入的质量。

使用完全参数微调对单个不安全姿势的PoseGuard响应的视觉结果。模型抑制不安全姿势的输出,将其重定向到黑色图像,同时保持正常输入的质量。

对于鲁棒性,PoseGuard在模拟现实世界部署的条件下进行了测试,在这些条件下,输入姿势可能不完全匹配预定义示例。评估包括常见的变换,如平移缩放旋转,以及对关节角度进行的手动调整,以模拟自然变化。

PoseGuard在常见姿势变换下的鲁棒性结果。

PoseGuard在常见姿势变换下的鲁棒性结果。

在大多数情况下,模型继续抑制不安全的生成,表明防御在中等扰动下保持鲁棒。当姿势的变化去除了潜在的风险时,模型停止抑制并产生正常输出,表明它在良性偏差下避免了假阳性。

PoseGuard对姿势修改的鲁棒性评估。图中显示了模型对不安全姿势的输出,经过平移、缩放和旋转,以及手动调整肢体。PoseGuard在轻微变化下继续抑制不安全生成,但当姿势不再携带风险内容时恢复正常输出。

PoseGuard对姿势修改的鲁棒性评估。图中显示了模型对不安全姿势的输出,经过平移、缩放和旋转,以及手动调整肢体。PoseGuard在轻微变化下继续抑制不安全生成,但当姿势不再携带风险内容时恢复正常输出。

最后,在主要实验中,研究人员测试了PoseGuard的泛化性,即其在新数据、不同环境和情况下有效运行的能力。

在这里,PoseGuard应用于使用前述AnimateAnyone模型的参考图像引导生成。在这种情况下,系统显示出与姿势控制相比更强的未经授权输出抑制,在某些情况下生成视频几乎完全降级:

PoseGuard在姿势引导和参考图像引导生成时的性能比较,使用四个不安全输入的完全微调。

PoseGuard在姿势引导和参考图像引导生成时的性能比较,使用四个不安全输入的完全微调。

作者将其归因于参考图像中的密集身份信息,这使得模型更容易学习有针对性的防御行为。结果表明,PoseGuard可以限制视频直接从某人外貌生成时的模仿风险。

最后,作者将PoseGuard应用于使用AniPortrait系统的面部特征引导视频合成,这是一个针对细粒度面部表情而非全身姿势的场景。

AniPortrait中不安全面部表情被抑制,使用了新的系统。

AniPortrait中不安全面部表情被抑制,使用了新的系统。

通过使用相同的防御机制对去噪UNet进行微调,模型能够抑制来自不安全面部特征的输出,同时保持对良性表情的输出不变。作者认为,结果表明PoseGuard可以跨输入模式泛化,并在更局部、基于表情的生成任务中保持有效性。

PoseGuard对参考图像引导生成的响应方式。

PoseGuard对参考图像引导生成的响应方式。

结论

必须承认,对于论文中提供的50个禁止姿势,诸如医疗检查或甚至做枯燥的家务任务等活动,可能会被阻止,这只能被认为是合成版本的斯肯索普效应

从这个角度来看,尤其是在面部表情的情况下(面部表情可能更加模糊和细致),PoseGuard似乎是一种相当笨拙的工具。另外,由于NSFW AI的普遍寒蝉效应,FOSS版本,如最近的Flux Kontext,通常通过严格的数据集过滤、权重编辑或两者兼而有之,进行了大量的审查。

因此,在这里提出的限制添加到本地模型审查的负担中,看起来像是抑制非API生成系统的有效性的隐性尝试。这可能表明我们正朝着一个未来发展,即本地模型只能生成劣质的任何用户喜欢的内容,而API模型提供了无限更好的输出,只要你能通过主机公司法律部门安抚的过滤器和防护措施的迷宫。

像PoseGuard这样的系统,其微调会影响基础模型输出的质量(尽管论文中忽略了这一点),并不是针对API系统;在线的先锋模型很可能将继续从无约束的训练数据中受益,因为这些模型的强大的NSFW能力受到大量监督措施的制约,* 方法在这里与论文中一样简短(论文只有五页),通常,方法最好从测试部分理解。

首次发布于2025年8月6日星期三

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai