Andersonの視点
AIによる生成されたビデオシステムのための新しいセーフガード:ポーズの検閲

新しいAIのセーフガードが、身体のポーズを検閲することを提案しています。性的または攻撃的なジェスチャー、または著名人のポーズ、商標のポーズなどと解釈される可能性のある身体のポーズや顔の表情はすべて対象です。
中国とシンガポールからの新しい研究は、安全でない画像やビデオの生成のうち、生成された出力のポーズの描写という、あまり目立たない分野に取り組んでいます。

新しい研究で提案されたシステム、PoseGuardの概念スキーマ。 ソース:https://arxiv.org/pdf/2508.02476
このシステム、PoseGuardは、ファインチューニングとLoRAsを使用して、生成された「禁止された」ポーズを生成できないモデルを作成します。このアプローチは、FOSSモデルに組み込まれたセーフガードが通常、簡単に回避できるため、ローカルインストール(APIのみのモデルはフィルタリングできる)を対象としています。
これは、ポーズをそれ自体が安全でないデータとして扱う最初の研究ではありません。「性的顔の表情」はすでに研究の下位分野です。また、新しい研究の著者の一部も、以前からDormantシステムを作成していました。
しかし、新しい研究は、性的コンテンツを超えて、著名人のポーズまでを含む、ポーズの分類を拡大した最初の研究です。
「私たちは、幾何学的特性ではなく、生成された出力の潜在的なリスクに基づいて、安全でないポーズを定義しています。安全でないポーズには、1)差別的なポーズ(例:跪く、攻撃的な敬礼)、2)性的暗示のあるNSFWポーズ、3)著名人の特定のイメージを模倣した著作権感受性のあるポーズが含まれます。」
「これらのポーズは、オンラインソース(例:Wikipedia)、LLMベースのフィルタリング、リスクラベル付きデータセット(例:Civitai NSFWタグ)を通じて収集され、PoseGuardのトレーニングのためにバランスのとれた包括的な安全でないポーズデータセットを提供します。」

PoseGuardで開発された50のコアポーズの「NSFW」カテゴリ。
著名人のポーズは商標または法的手段で保護される可能性があります。また、創造的なポーズやスタンスの組み合わせは、独自の振り付けのシーケンスとして保護される可能性があります。しかし、たとえアイコニックな単一のポーズであっても、保護されない場合があります。例えば、ある写真家は、Rentmeester Vs. Nikeの判決で、写真を再現したNikeに対して訴訟を起こしましたが、裁判官のパネルは請求を却下しました。

写真家が左側の写真を撮影し、Nikeが写真を再現した場合(右側)、写真家はNikeを訴えましたが、裁判官のパネルは請求を却下しました。 ソース:https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html
PoseGuardシステムは、検出された安全でないポーズを劣化させる最初のシステムであると主張しています。生成モデルに直接安全ガードレールを組み込み、3つのカテゴリにわたって「安全でない」ポーズを定義し、フィルタリングされたポーズが変更されても、生成の品質と完全性が維持されることを保証しています。
新しい論文は、PoseGuard:安全ガードレール付きのポーズガイド生成と題されており、中国科学技術大学、シンガポールの科学技術研究機関(A\*STAR CFAR)、および南陽理工大学の6人の研究者によって発表されています。
方法
PoseGuardは、バックドア攻撃の論理を流用して、モデルに直接防御メカニズムを構築しています。通常のバックドア攻撃では、特定の入力が悪意のある出力を引き起こしますが、PoseGuardはこの設定を逆転させ、特定の定義されたポーズが安全でないと判断され、セクシャル、攻撃的、または著作権感受性のある性質を持つポーズが「中立」のターゲット画像(例:空またはぼかしたフレーム)にリンクされます。
安全でないポーズと正常なポーズの組み合わせされたデータセットでモデルをファインチューニングすることで、システムは、善性の入力に対して忠実性を維持しながら、安全でない入力に対して出力の品質を劣化させることを学習します。

PoseGuardは、共有ノイズ除去UNetを使用して、リファレンス画像とポーズシーケンスを処理し、事前トレーニング済みの重みと安全性に合わせたファインチューニングを組み合わせます。この設定により、モデルは安全でないポーズからの有害な生成を抑制しながら、正常な入力に対する出力の品質を維持できます。
この「モデル内」戦略により、外部フィルタの必要性が排除され、敵対的またはオープンソース環境でも効果的です。
データとテスト
正常なベースラインポーズを取得するために、著者はUBC-Fashionデータセットを使用しました。

PoseGuardで使用された、ブリティッシュコロンビア大学ファッションデータセットの例。 ソース:https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf
安全でないポーズは、以前にも述べたように、CivitAIなどのオープンソースプラットフォームから取得されました。ポーズは、DWPoseフレームワークを使用して抽出され、768x768pxのポーズ画像が生成されました。

トレーニングに使用された50の安全でないポーズの例。NSFWおよび著作権感受性のあるポーズが表示されています。Wikipedia、Render-State、Civitai、Google検索から取得しました。
ポーズガイド生成モデルは、AnimateAnyoneでした。
使用された6つのメトリックは、Fréchet Video Distance(FVD)、FID-VID、構造類似性指数(SSIM)、ピーク信号対雑音比(PSNR)、学習された感覚相似性メトリック(LPIPS)、およびFréchet Inception Distance(FID)でした。テストは、NVIDIA A6000 GPUで、48GBのVRAM、バッチサイズ4、学習率1×10-5で実行されました。
テストの3つの主なカテゴリは、有効性、堅牢性、および汎用性でした。
最初のカテゴリである有効性では、著者は2つのトレーニング戦略、完全なファインチューニングとLoRAモジュールを使用したパラメータ効率的なファインチューニングを比較しました。
両方のアプローチは、安全でないポーズからの出力を抑制しながら、正常なポーズからの出力の品質を維持しますが、異なるトレードオフがあります。完全なファインチューニングは、より強力な抑制と高い忠実性を実現しますが、LoRAベースのチューニングは、安全でないポーズの数が増加するにつれて、生成の品質の劣化を導入しますが、パラメータが少なく、計算コストが低いという利点があります。

PoseGuardのパフォーマンスを、生成と防御のメトリックで示したもの。上向きの矢印は、より高い値が良いことを示し、下向きの矢印は、より低い値が良いことを示します。
定性的結果(以下の画像を参照)では、介入せずにモデルが攻撃的およびNSFWポーズを高忠実性で再現することが示されました。PoseGuardを有効にすると、これらのポーズは低品質または空の出力を引き起こし、正常な入力は視覚的に完全なままです。防御セットが4つの安全でないポーズから32に増加すると、正常な出力の品質はやや低下しました。特にLoRAでは、より顕著でした。

完全なパラメータファインチューニングを使用した、単一の安全でないポーズに対するPoseGuardの反応を示す視覚的な結果。モデルは、差別的、NSFW、著作権感受性のあるポーズを抑制し、正常な入力に対する品質を維持します。
堅牢性のために、PoseGuardは、現実世界の展開を模倣する条件下でテストされました。ここでは、入力ポーズが事前に定義された例と完全に一致しない場合があります。評価には、変換、スケーリング、回転などの一般的な変換、およびジョイント角度の手動調整が含まれました。

一般的なポーズ変換に対するPoseGuardの堅牢性の結果。
ほとんどの場合、モデルは安全でない生成を抑制し続け、防御が中程度の変動に対して堅牢であることを示しました。変更が元のリスクを除去した場合、モデルは抑制を停止し、正常な出力を生成しました。これは、モデルが無害な偏差の下で偽陽性を避けることを示しています。

ポーズの変更に対するPoseGuardの堅牢性の評価。図は、変換、スケーリング、回転、および手動の肢体調整によって変更された安全でないポーズに対するモデルの出力を示しています。PoseGuardは、軽微な変更の下でも安全でない生成を抑制し続け、ポーズがもはや「リスクのある」コンテンツを含まなくなったときに正常な出力を再開します。
最後に、主要な実験で、研究者は、PoseGuardの汎用性、つまり新しいデータ、さまざまな環境、状況で効果的に機能する能力をテストしました。
ここで、PoseGuardは、AnimateAnyoneモデルを使用したリファレンス画像ガイド生成に適用されました。この設定では、システムは、ポーズベースの制御と比較して、未承認の出力をより強力に抑制しました。特定のケースでは、生成されたビデオの劣化はほぼ完全でした。

完全なファインチューニングを使用した4つの安全でない入力に対する、ポーズガイド生成とリファレンス画像ガイド生成のPoseGuardのパフォーマンスの比較。
著者は、これを、リファレンス画像に含まれる密なアイデンティティ情報に帰因しています。これにより、モデルはターゲットの防御的行動をより簡単に学習できます。結果は、PoseGuardが、ビデオが直接人物の外見から生成されるシナリオで、模倣のリスクを制限できることを示唆しています。
最後のテストでは、著者は、AniPortraitシステムを使用した、顔のランドマークガイドによるビデオ合成にPoseGuardを適用しました。このシナリオは、全身のポーズではなく、細かい顔の表情を対象としています。

AniPortraitで新しいシステムを使用して、安全でない顔の表情を抑制します。
ノイズ除去UNetを同じ防御メカニズムでファインチューニングすることで、モデルは安全でない顔のランドマークからの出力を抑制しながら、正常な表情を維持することができました。結果は、PoseGuardが入力モダリティ間で汎用性を持ち、より局所的な、表情駆動の生成タスクで効果を維持できることを示しています。

リファレンス画像ガイド生成に対するPoseGuardの反応を示す視覚的な結果。
結論
多くの禁止ポーズは、医療検査や家事などの活動がブロックされる可能性があるため、合成ベースのScunthorpe効果のバージョンとみなされる可能性があります。
この観点から、そして特に顔の表情の場合、PoseGuardは、意図があいまいでニュアンスに富んだ場合に、ある程度の曖昧さを伴う、ある種の鈍い器です。さらに、NSFW AIの周りの一般的な寒冷化の影響により、FOSSリリースは、たとえばFlux Kontextのように、厳格なデータセットフィルタリング、重み編集、またはその両方によって、既にかなり検閲されています。
したがって、ここで提案されている制限をローカルモデルの検閲の負担に追加することは、非API生成システムの有効性を抑制することを意図したものとみなされます。これは、ローカルモデルが、ユーザーが望むものを劣質に生成する可能性がある未来を示唆していますが、APIモデルは、フィルターやセーフガードのガントレットを通過することで、はるかに優れた出力を提供できます。
PoseGuardのようなシステムでは、ファインチューニングがベースモデルの出力の品質に直接影響します(この点については、論文では触れられていません)。このシステムは、APIシステムではなく、ローカルモデルを対象としています。オンラインのみの先行モデルは、制限されたトレーニングデータを使用することなく、依然として優れた出力を生成できます。オンラインモデルは、NSFWコンテンツを生成する能力を維持しながら、法的部門の満足のためにフィルターやセーフガードで保護されています。
* 方法は、論文と同じく短く、通常、テストセクションからアプローチが最もよく理解できます。
2025年8月6日水曜日に初めて公開されました












