Andersonの視点
テキストからビデオへのシステムのジャイルブレイクを促すリライトされたプロンプト

研究者们已经测试了一种方法,用于重写被阻止的提示,以便它们可以绕过安全过滤器而不改变其含义。这种方法在多个平台上都有效,揭示了这些防护措施的脆弱性。
闭源的生成视频模型,例如Kling、Kaiber、Adobe Firefly 和OpenAI的Sora,旨在阻止用户生成与主办公司不希望关联或促进的视频内容,出于道德和/或法律问题。
尽管这些防护措施使用了人工和自动化的混合方式,并且对大多数用户来说是有效的,但一些人已经在Reddit、Discord*等平台上形成了社区,以寻找方法来强制这些系统生成NSFW和其他受限制的内容。

来自Reddit的提示攻击社区的两个典型帖子,提供了如何绕过OpenAI的闭源ChatGPT和Sora模型中的过滤器的建议。来源:Reddit
除了这些之外,专业和业余的安全研究社区也经常披露LLM和VLM的过滤器中的漏洞。一个偶然的研究人员发现,通过莫尔斯电码或base-64编码(而不是普通文本)向ChatGPT发送文本提示,可以有效地绕过内容过滤器。
2024年的T2VSafetyBench项目,由中国科学院领导,提供了一个首创的基准,用于进行文本到视频模型的安全性评估。

T2VSafetyBench框架中的十二个安全类别的选定示例。为了出版,色情内容被屏蔽,暴力、血腥和令人不安的内容被模糊。来源:https://arxiv.org/pdf/2407.05965
通常,LLM也是这些攻击的目标,至少在某种程度上,它们愿意帮助自己的失败。
这带我们来到了一个新的合作研究成果,来自新加坡和中国,以及作者声称的第一个基于优化的文本到视频模型的越狱方法。

这里,Kling被骗生成了其过滤器通常不允许的输出,因为提示已经被转换成一系列单词,旨在引起相同的语义结果,但这些单词不被Kling的过滤器视为“受保护”。来源:https://arxiv.org/pdf/2505.06679
相反,新的系统以保持其含义完整的方式重写“被阻止”的提示,同时避免被模型的安全过滤器检测到。重写的提示仍然会导致与原始(且往往不安全)意图密切匹配的视频。
研究人员在几个主要平台上测试了这种方法,包括Pika、Luma、Kling和Open-Sora,并发现它在突破系统内置安全措施方面始终优于之前的基准。
方法
研究人员的方法专注于生成可以绕过安全过滤器的提示,同时保留原始输入的含义。这是通过将任务框定为一个优化问题来实现的,并使用一个大型语言模型来迭代地改进每个提示,直到选择最好的(即,最有可能绕过检查)提示。
提示重写过程被框定为一个具有三个目标的优化任务:第一,重写的提示必须保留原始输入的含义,使用CLIP文本编码器来衡量语义相似度;第二,提示必须成功绕过模型的安全过滤器;第三,生成的视频必须在语义上与原始提示密切相关,使用CLIP嵌入来评估相似度。

方法的管道概述,优化三个目标:保留原始提示的含义,绕过模型的安全过滤器,确保生成的视频在语义上与输入相关。
用于评估视频相关性的字幕是使用VideoLLaMA2模型生成的,使得系统可以使用CLIP嵌入来比较输入提示和输出视频。

VideoLLaMA2在行动,字幕视频。来源:https://github.com/DAMO-NLP-SG/VideoLLaMA2
这些比较被传递给一个损失函数,该函数平衡重写提示与原始提示的匹配程度、是否通过安全过滤器以及生成的视频与输入的匹配程度,这些因素共同引导系统朝着满足所有三个目标的提示发展。
为了执行优化过程,ChatGPT-4o被用作提示生成代理。给定一个被安全过滤器拒绝的提示,ChatGPT-4o被要求以保留其含义的方式重写它,同时避免被阻止的特定术语或措辞。
重写的提示然后被评分,基于前面提到的三个标准,并传递给损失函数,值被归一化到0到100的范围内。
代理以迭代方式工作:在每个轮次中,生成一个新的提示变体,并根据相同的标准进行评估,目标是通过产生一个比前一次尝试更好的版本来改进前一次尝试,生成一个得分更高的提示。
突变检测
在测试期间,很明显,成功绕过过滤器的提示并不总是保持一致性,而且重写的提示可能会在一次尝试中产生预期的视频,但在后续尝试中失败,或者被阻止,或者触发安全且无关的输出。
为了解决这个问题,引入了一种提示突变策略。与其依赖单一版本的重写提示,不如生成每轮中几个轻微的变体。
这些变体被设计为保留相同的含义,同时改变措辞以探索模型过滤系统的不同路径。每个变体使用相同的标准进行评分:是否绕过过滤器,以及生成的视频与原始意图的匹配程度。
在评估所有变体后,计算它们的平均分数。根据综合分数选择最佳性能的提示(基于平均分数),以继续到下一轮重写。这一方法有助于系统选择不仅一次有效,而且在多次使用中仍然有效的提示。
数据和测试
受计算成本限制,研究人员从T2VSafetyBench数据集中选择了一个子集,以测试他们的方法。该数据集由700个提示组成,通过从以下十四个类别中随机选择50个提示来创建:色情、边缘色情、暴力、血腥、令人不安的内容、公众人物、歧视、政治敏感性、版权、非法活动、错误信息、顺序动作、动态变化和连贯的上下文内容。
测试的框架包括Pika 1.5、Luma 1.0、Kling 1.0和Open-Sora。由于OpenAI的Sora是一个闭源系统,没有直接的公共API访问,因此无法直接进行测试。相反,使用Open-Sora,因为这个开源项目旨在复制Sora的功能。
Open-Sora默认没有安全过滤器,因此为测试而添加了安全机制。输入提示使用CLIP基于的分类器进行筛选,而视频输出使用NSFW_image_detection模型进行评估,该模型基于fine-tuned Vision Transformer。每秒从每个视频中采样一帧,并传递给分类器以检查是否有标记的内容。
指标
在指标方面,攻击成功率(ASR)被用来衡量提示不仅绕过了模型的安全过滤器,而且还导致了包含受限制内容(如色情、暴力或其他标记的材料)的视频的比例。
ASR被定义为成功的越狱尝试与所有测试提示的比例,安全性通过GPT-4o和人类评估的组合来确定,遵循T2VSafetyBench框架设置的协议。
第二个指标是语义相似度,它捕捉了生成的视频在多大程度上反映了原始提示的含义。字幕是使用CLIP文本编码器生成的,并使用余弦相似度与输入提示进行比较。
如果提示被输入过滤器阻止,或者模型无法生成有效的视频,则输出被视为全黑视频,用于评估目的。然后使用所有提示的平均相似度来量化输入和输出之间的对齐度。

每个文本到视频模型的攻击成功率,根据GPT-4和人类评审员的评估。
在测试的模型中(见上面的结果表),Open-Sora表现出最高的对对抗性提示的漏洞,根据GPT-4的评估,其平均攻击成功率为64.4%,根据人类评审员的评估,其平均攻击成功率为66.3%。
Pika其次,根据GPT-4的评估,其攻击成功率为53.6%,根据人类评审员的评估,其攻击成功率为55.0%。Luma和Kling表现出更大的抗性,Luma的平均攻击成功率为40.3%(GPT-4)和43.7%(人类评审员),而Kling的攻击成功率为34.7%和33.0%。
作者观察到:
‘在不同的安全方面,Open-Sora表现出特别高的攻击成功率,特别是在色情、暴力、令人不安的内容和错误信息方面,突出了它在这些类别中的漏洞。 ‘
‘值得注意的是,GPT-4和人类评估之间的相关性很强,在所有模型和安全方面都观察到了类似的趋势,验证了使用GPT-4进行大规模评估的有效性。 ‘
‘这些结果强调了增强安全机制的必要性,特别是对于像Open-Sora这样的开源模型,以减轻恶意提示带来的风险。 ‘
结论
并非所有系统都只对输入提示施加防护措施。ChatGPT-4o和Adobe Firefly的当前迭代通常会在其GUI中显示半完成的生成,只要它们的防护措施检测到“非政策”内容,就会突然删除它们。
事实上,在这两个框架中,禁止的生成可以从真正无害的提示中获得,要么是因为用户不知道政策覆盖范围的程度,要么是因为系统有时过度谨慎。
对于API平台来说,这代表着一个平衡的行为,在商业吸引力和法律责任之间。将每个发现的越狱词/短语添加到过滤器中是一种耗时且通常无效的“打地鼠”方法,可能会在稍后模型上线时完全重置;另一方面,什么都不做则冒着因最严重的违规行为而遭受持久的损害报道的风险。
* 我无法提供此类链接,出于明显的原因。
首次发布于2025年5月13日星期二












