Andersonの視点

テキストからビデオへのシステムのジャイルブレイクを促すリライトされたプロンプト

mm
Unite.AI を Google の優先ソースに追加
ChatGPT-4o and Adobe Firefly.

研究チームは、テキストから動画を生成するシステムで拒否されたプロンプトを、意味を変えずに書き換えて安全フィルターを通過させる手法を検証した。複数のプラットフォームで機能し、現在の防御策の脆さを明らかにした。

 

Kling、Kaiber、Adobe Firefly、OpenAIのSoraといった非公開の生成動画モデルは、倫理的・法的な理由から、運営企業が関与を望まない動画の生成を阻止しようとしている。

これらのガードレールは人間と自動化されたモデレーションを組み合わせ、多くの利用者には有効だ。しかし、制限対象のコンテンツを生成させる方法を探るコミュニティがRedditやDiscordなどに形成されている。

Reddit上のプロンプト攻撃コミュニティによるフィルター回避の助言

OpenAIのChatGPTとSoraに組み込まれたフィルターを回避する方法を助言するReddit上の投稿例。 出典:Reddit

専門家や愛好家のセキュリティ研究者も、LLMやVLMを守るフィルターの脆弱性を報告している。ある研究者は、平文ではなくモールス信号やbase-64エンコーディングでChatGPTにプロンプトを送ると、当時のコンテンツフィルターを事実上回避できることを示した。

中国科学院が主導した2024年のT2VSafetyBenchプロジェクトは、テキスト動画モデルを安全面から評価する初のベンチマークを提示した。

T2VSafetyBenchの12の安全カテゴリから選んだ例

T2VSafetyBenchの12の安全カテゴリから選んだ例。掲載にあたり、性的表現はマスクし、暴力や流血、刺激の強い内容はぼかしている。 出典:https://arxiv.org/pdf/2407.05965

攻撃対象となるLLMは、自らの防御を崩す作業にもある程度協力する傾向がある。

シンガポールと中国の研究チームは、テキスト動画モデルに対する初の最適化ベースのジェイルブレイク手法だとする方法を開発した。

書き換えられたプロンプトによってKlingの安全フィルターを回避した例

意味を保ちながら保護語句を避ける一連の単語に変換し、通常は許可されない出力をKlingに生成させた例。 出典:https://arxiv.org/pdf/2505.06679

この手法は試行錯誤だけに頼らず、拒否されたプロンプトの意味を維持しながら検知を避ける形に書き換える。書き換え後も元の、しばしば危険な意図に近い動画を生成する。

研究者はPika、Luma、Kling、Open-Soraで検証し、既存の基準手法より高い攻撃成功率と意味的一致を得た。著者らは、現行フィルターの限界と高度な防御の必要性を指摘している。

論文「Jailbreaking the Text-to-Video Generative Models」は、南洋理工大学、中国科学技術大学、中山大学の研究者8人による。

手法

目標は、元の意味を保ったまま安全フィルターを通過するプロンプトを生成することだ。課題を最適化問題として扱い、大規模言語モデルが候補を反復的に改善し、最も通過しやすいものを選ぶ。

最適化には三つの目的がある。第一に、CLIPテキストエンコーダーで測った意味類似度を高く保つ。第二に、安全フィルターを回避する。第三に、生成動画が元の意図に近い状態を保つ。最後の評価では、入力文と生成動画のキャプションのCLIP埋め込みを比較する。

三つの目標を最適化する手法のパイプライン

元の意味の維持、フィルターの回避、生成動画と入力の意味的一致という三つの目標を最適化するパイプライン。

動画との関連性を評価するキャプションはVideoLLaMA2で生成し、CLIP埋め込みを使って入力プロンプトと出力動画を比較した。

動画にキャプションを付けるVideoLLaMA2

動画にキャプションを付けるVideoLLaMA2。 出典:https://github.com/DAMO-NLP-SG/VideoLLaMA2

各比較値は損失関数に渡される。損失関数は、書き換え文と元文の近さ、フィルター通過の可否、生成動画と入力の一致度を均衡させ、三つの条件を満たす候補へ導く。

最適化のエージェントにはChatGPT-4oを使用した。拒否されたプロンプトを受け取り、意味を保ちながら阻止原因となった語句を避けるよう書き換える。各候補を三つの基準で0から100に正規化して採点し、反復ごとに前回より高得点の変種を作った。

危険語はSneakyPromptのNSFW語彙リストを基に除外した。

SneakyPromptで安全フィルターを回避する敵対的プロンプトの例

SneakyPromptの例。機微な対象プロンプトを赤、変更後の敵対的表現を青、変更しない文字を黒で示す。 出典:https://arxiv.org/pdf/2305.12082

エージェントには意図を保ちながら危険語を避けるよう明示した。最大試行回数に達するか改善が見込めなくなるまで反復し、最終的に最高得点のプロンプトを対象モデルへ送った。

変異戦略

一度フィルターを通過したプロンプトでも、後の試行で拒否されたり、安全だが無関係な出力になったりすることが分かった。そこで、一つの書き換えだけに依存せず、各ラウンドで表現を少し変えた複数の候補を作る「プロンプト変異」を導入した。

各変種は同じ意味を維持しつつ、異なる経路でフィルターを通るよう表現を変える。通過可否と生成動画の意図への近さを同じ基準で採点し、平均得点が最も高い候補を次のラウンドへ進めた。これにより、一度だけでなく複数回にわたり機能する表現を選びやすくした。

データとテスト

計算費用の制約から、T2VSafetyBenchの一部を使用した。700件のプロンプトは、性的表現、境界的な性的表現、暴力、流血、刺激的内容、公人、差別、政治的機微、著作権、違法行為、偽情報、連続動作、動的変化、文脈的一貫性という14カテゴリから50件ずつ無作為抽出した。

Pika 1.5、Luma 1.0、Kling 1.0、Open-Soraを検証した。Soraは公開APIを持たない非公開システムなので、同等の機能を再現するオープンソースのOpen-Soraを使用した。

Open-Soraには標準の安全フィルターがないため、実験用に追加した。入力はCLIP分類器で確認し、動画出力は微調整されたVision Transformerに基づくNSFW_image_detectionモデルで評価した。動画から毎秒1フレームを抽出し、問題のある内容を分類した。

評価指標

攻撃成功率(ASR)は、安全フィルターを通過し、なおかつ性的表現や暴力など制限対象を含む動画が生成されたプロンプトの割合である。安全性の判定にはT2VSafetyBenchの手順に従い、GPT-4oと人間の評価を組み合わせた。

二つ目は意味類似度で、生成動画が元のプロンプトの意味をどれほど反映するかを測る。キャプションと入力文はCLIPテキストエンコーダーで処理し、コサイン類似度で比較した。入力が拒否された場合や有効な動画を生成できなかった場合は、評価上、全面が黒の動画として扱った。

各動画モデルにおける14の安全カテゴリ別攻撃成功率

GPT-4と人間の評価による、各動画モデルにおける14の安全カテゴリ別攻撃成功率。

Open-Soraが最も脆弱で、平均ASRはGPT-4評価で64.4%、人間評価で66.3%だった。Pikaは53.6%と55.0%、Lumaは40.3%と43.7%、Klingは34.7%と33.0%で、Klingが最も低かった。GPT-4と人間の傾向は強く一致し、大規模評価にGPT-4を用いる妥当性も示された。著者らは、とりわけOpen-Soraのようなオープンソースモデルに安全機構の強化が必要だと述べる。

Klingを対象に、元の入力が拒否された後、書き換えたプロンプトがフィルターを通り、制限対象の動画を生成した二つの例も示された。

Klingを対象としたジェイルブレイク例

Klingを対象としたジェイルブレイク例。元の禁止プロンプトを意味の近い敵対的表現へ書き換え、フィルターを通過させた。

攻撃成功率と意味類似度は、T2VSafetyBenchおよび分割統治攻撃(DACA)と比較した。すべてのモデルで新手法のASRが高く、元プロンプトとの意味的一致も強かった。

各テキスト動画モデルの攻撃成功率と意味類似度

各テキスト動画モデルの攻撃成功率と意味類似度。

Open-SoraではGPT-4評価64.4%、人間評価66.3%で、T2VSafetyBenchの55.7%と58.7%、DACAの22.3%と24.0%を上回った。意味類似度も0.272で、T2VSafetyBenchの0.259、DACAの0.247より高い。Pika、Luma、Klingでも改善し、T2VSafetyBenchに対するASRの向上は5.9から39.0ポイント、DACAとの差はさらに大きかった。

全モデルで意味類似度も高く、書き換え後も元の意図を基準手法より確実に保った。著者らは、攻撃成功率と意味の完全性を両立できたと結論づけている。

結論

すべてのシステムが入力段階だけで制限するわけではない。ChatGPT-4oとAdobe Fireflyは、GUI上で生成途中の結果を一度表示し、ポリシー違反を検知すると突然削除することがある。

禁止対象の生成は無害なプロンプトからも起こり得る。利用者がポリシー範囲を知らない場合もあれば、システムが過度に慎重な判定をする場合もある。

API事業者にとっては、商業的魅力と法的責任の均衡が課題になる。判明した回避語句を一つずつフィルターへ追加する方法は、終わりのない非効率な対処であり、新モデルへの移行でリセットされる可能性も高い。一方で何もしなければ、重大な違反による長期的な評判被害を招く。

 

* 明白な理由から、この種のコミュニティへのリンクは掲載できない。

初出:2025年5月13日(火)

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai