Andersonの視点
著作権保護されたアニメーションキャラクターに「秘密のアイデンティティ」を与える

中国からの新しい研究は、画像生成時に著作権保護されたアニメーションキャラクターを汎用的な代替品に置き換えることで、これらのキャラクターを保護するための非侵襲的な方法を提供しています。しかし、この方法はプロンプトハッカーの工夫に対抗できるのでしょうか。
著作権保護された素材が大量に含まれるハイパースケールデータセット(そのような侵害を除去するための費用が非常に高いため)があるため、これらのデータセットでトレーニングされたモデルは、著作権保護されたキャラクターを再現できることが多いです。
トレーニング済みモデルの直接的な編集、またはモデルのアクセス時にキーワードを傍受するためのフィルタの使用は、著作権保護された要素を間接的に記述することで、頻繁に回避されることがあります。
人気のあるAIチャットボットによって生成された著作権保護されたキャラクター、キャラクター名の直接的な呼び出しがないように見える。ソース – https://www.unite.ai/wp-content/uploads/2026/08/indy.jpg
研究の強い流れでは、モデル修正技術が、トレーニング済みモデルのパラメータを変更して、さまざまな結果をもたらすことを試みてきました。
2023年の論文「Ablating Concepts in Text-to-Image-Diffusion-Models」から、人気のある拡散モデルに「キャプテン・マーベル」として組み込まれたブリーラーソンの写実的な表現が、ユーザーのリクエストに応じて、ゆるやかな関連性のある漫画風のイメージに変換される。ソース – https://www.unite.ai/wp-content/uploads/2026/08/Ablating-Concepts-in-Text-to-Image-Diffusion-Models.jpg
しかし、ablationは通常、損傷的で不正確なプロセスであり、トレーニング済みモデルの他の特性に頻繁に影響を及ぼすことがあります。また、この方法を回避するための複数の方法があります。
もう1つの一般的なアプローチは、「否定的なプロンプト」と呼ばれるもので、モデルに追加の「反対のプロンプト」を送信して、出力を制限することを目的としています。モデルがAPI経由でアクセスされる場合(例えば、フロンティアモデルはすべてAPI経由でアクセスされる)、「秘密」の否定的なプロンプトがユーザーが知覚するプロンプトとともに送信されることがあります。これは、モデルがユーザーに禁止された素材を提供しないようにするためのルーブリックです。このアプローチは、人気があり、著作権保護のベクトルとして使用されていますが、常に効果的ではないことがあります。
ボディーダブル
このことを見据えて、中国からの新しい論文は、画像生成時に著作権保護されたアニメーションキャラクターを「学習された汎用的な代替品」に置き換えることを提案しています。これらの「代役」は、シーンを自然に埋め込むのに十分なキャラクターの形状と構造を保持しながら、保護されたキャラクターの特徴的な詳細を除去するように設計されています。
新しい埋め込み方法によって、トレーニング済みモデルでアクセス可能な著作権保護された素材の「匿名化」表現。ソース – https://www.unite.ai/now-nsfw-and-celebrity-poses-are-fodder-for-ai-censorship/
この介入は、画像生成中に発生し、基礎となる拡散モデルを変更またはファインチューンすることなく行われ、元のキャラクターをどの程度除去するかを決定することができます。
このアプローチは、モデル修正がこの目的のために適切な方法ではないことを暗黙に認めており、代わりに「工夫された埋め込み」を推論プロセスに「注入」します。これらの埋め込みは、保護されたアセットを「リファクタリング」するように設計されており、ゼロ化(削除)するのではなく、代役を作成するために使用されます。このプロセスは、基礎モデルのパラメータに直接影響を及ぼさず、さまざまなモデルで再利用または適応できるように設計されています。
この方法は、古いStable Diffusionモデル範囲でテストされましたが、最近のZ-Imageアーキテクチャでも有効に機能したため、著者の概念がさまざまな生成アーキテクチャに適用可能であることが示唆されます。
論文には以下のように記載されています:
‘[私たちは]、モデルが連続するテキスト表現を操作して、生成中にターゲットキャラクターを消去することができる、制御可能な方法を提案します。構造的および詳細な制約を使用して、キャラクターの代理として機能するアンカー埋め込みを最適化し、構造に応じた適応戦略を使用して、ターゲット関連埋め込みをアンカーに置き換えます。 ‘
‘実験結果は、私たちの方法が最先端の消去の有効性と画像の忠実性の保存を達成し、制御可能な消去度、複数のターゲットの削除、モデル転送可能性をサポートしていることを示しています。 ‘
‘さらに、私たちの最適化されたアンカーは、現在のモデル修正のベースラインと組み合わせて使用でき、消去のパフォーマンスを向上させることができます。 ‘
著者によると、新しい方法はさまざまなアーキテクチャを跨ぎ、グラニュラーな制御を提供する。
この新しい論文は、消去して保存する:最適化されたセマンティックアンカーを介した著作権保護されたアニメーションキャラクターの制御可能な削除というタイトルで、中国科学院情報工程研究所と北京の中国科学院大学の7人の著者によって発表されています。
方法
新しい方法の中心的な考えは、各著作権保護されたキャラクターの代替品を作成することです。この代替品は、シーンを自然に埋め込むのに十分なキャラクターの形状と構造を保持しながら、保護されたキャラクターの特徴的な視覚的な詳細を除去するように設計されています。
新しいアプローチのスキーマ。
この代替品、つまり「アンカー」と呼ばれるものは、元のキャラクターの形状と構造を保持しながら、キャラクターを特定できる詳細を除去するように設計されています。
これを行うために、システムは、元のキャラクターに対して生成された粗い構造情報と、開発中のアンカーに対して生成された構造情報を比較し、2つを同様の全体的な形状に向けて推進します。保護されたキャラクターのリファレンスイメージは、アンカーをその認識可能な詳細から遠ざけるために、逆の目的で使用されます。
著作権保護されたキャラクターの非侵害的な代替品を作成する方法。キャラクターの広い構造は保持され、特徴的な視覚的な詳細は抑制され、生成中に使用される最適化された「アンカー」が生成されます。
結果として得られるアンカーは、シーンの構成を保存し、保護されたアイデンティティを除去することを意図した中間の地平を占めます。
アンカー・アウェイ
これらの特性が確立されると、アンカーは、拡散モデルが理解できるものに変換される必要があります。プレースホルダーターム アンカー* [sic] は、学習可能な表現 を CLIPテキストエンコーダー 内に取得し、基本的に、意味を形成できる新しい人工的な単語/エンティティを作成します。
この新しい表現は、上記で説明した構造的および詳細な目標に従って繰り返し調整され、アンカー* が、保護されたキャラクターの形状と構造を広く保持しながら、認識可能な外観を除去することを意味するように教えられます。
テキストエンコーダーの残りの部分は、このプロセス中に凍結されますが、アンカー* を囲む通常の開始、終了、パディングトークンは、アンカー* を新しく学習された疑似単語に変換するために必要なコンテキストを提供します。
適応的な置換
(推論)生成中に、アルゴリズムは、エンコードされたプロンプト内で保護されたキャラクターに関連する用語を検索し、学習されたアンカー埋め込みをその代わりに置き換えます。また、コンテキスト情報を運ぶ終了およびパディング埋め込みを調整します。
これに備えて、システムは、ノイズ除去を使用して、リクエストされた画像の粗い構成を確立し、画像の構造が安定し始めた時点で、置き換えをトリガーするために、構成の変化を監視します。

生成中にアンカーの置き換えが発生する図。ノイズ除去中に画像の粗い構造の変化を追跡し、レイアウトが安定し、細かい詳細が現れ始めた時点で置き換えをトリガーします。
上の画像では、約タイムステップ720でこの遷移が発生し、構造的変化が最大になり、次に減少します。この時点で、画像の全体的な配置はほぼ形成されており、アンカーが保護されたキャラクターを置き換えることができ、既存の構成を乱すリスクが軽減されます。
データとテスト
著者は、5つのプロンプトベースのベースラインと比較してアプローチをテストしました:Safe Latent Diffusion(SLD);STG;SAFREE;TraSCE;および否定的なプロンプト(NP)。
最適化されたアンカー埋め込みは、4つの既存のモデル修正方法に統合されました:MACE;UCE;ESD-u;およびAC。これは、キャラクターの除去における提案されたモデルのパフォーマンスを向上させることができるかどうかをテストするために行われました。
評価のために、80のアニメーションキャラクターのデータセットが作成されました。これには、36の人間型キャラクター、23の動物型キャラクター、21のその他のカテゴリがあり、すべての選択されたキャラクターは拡散モデルによって信頼性高く再現できるため選択されました。
次に、GPT-4oによって生成されたプロンプトを使用して、各キャラクターに対して100枚の画像が生成されました。
Stable Diffusion v1.4が主な実験で使用され、転送可能性はさらにv1.5、V2、v2.1、XLベース1.0、および最近のDiTベースのZ-Imageでテストされました。各事前トレーニング済みモデルのパラメータに対するファインチューニングは実行されませんでした。
メトリックとして、LLaVA-1.5とBLIP-3は、ターゲットキャラクターがまだ認識可能かどうかを測定しました。認識精度が低いほど、除去がより完全であることを示します。構造的類似性を測定するために、構造的類似性指数(SSIM)が使用されました。認識可能な違いを測定するために、学習された認識メトリック(LPIPS)が使用されました。視覚的な品質を評価するために、エステティック・プレディクターV2スコアが使用されました。
Fréchet Inception Distance(FID)とCLIPスコアも、COCO-30Kの無関係なプロンプトから計算され、通常の画像生成が影響を受けたかどうかを測定するために使用されました。
80のアニメーションキャラクターを横断するキャラクター除去方法のテスト結果。最初の2列は、消去されたとされるキャラクターがまだ認識可能である頻度を測定するため、スコアが低いほど除去がより完全であることを示します。残りの列は、元の画像と無関係な生成がどの程度保存されたかを測定します。矢印は、どちらのスコアがより好ましいかを示します。太字は最良の結果を示し、下線は2番目の結果を示します。
これらの初期結果の量的比較について、著者は以下のように述べています:
‘全てのベースラインと比較して、私たちの方法は、LLaVA-1.5(6.0%)とBLIP-3(4.0%)の両方によって行われたターゲット識別の精度が最も低くなり、2番目に低い結果と比較してそれぞれ3.5%と1.7%の低下を示した。これは、私たちの方法の除去の有効性を示し、多モーダル大規模モデルを効果的に欺くことができることを示しています。 ‘
‘これは、私たちの方法の除去の有効性を示し、多モーダル大規模モデルを効果的に欺くことができることを示しています。 ‘
画像の忠実性については、著者の方法は0.467のSSIMスコアで最高スコアを達成し、0.505のLPIPSスコアで最低スコアを達成しました。これは、無関係なコンテンツと背景構造の保存が最も強いことを示しています。さらに、キャラクター除去方法の中で最高のエステティック・プレディクターV2スコア(5.18)を達成し、保存によって全体的な視覚的な品質が損なわれないことを示しています。
質的テストが続きました:
5つのアニメーションキャラクターを横断するキャラクター除去のテスト結果。各行は異なる方法の結果を示し、上部にはStable Diffusion v1.4の元の生成が表示され、下部には提案された方法が表示されます。提案された方法は、ターゲットキャラクターをより一貫して置き換えながら、周囲のシーンを保存します。元のソースPDFまたはプロジェクトサイトで若干解像度の高いバージョンを参照してください。
論文によると、例は、特に複雑な形状と属性を持つキャラクター、たとえばドナルドダックとスーパーマリオに対して、特に顕著な違いを示しています:
‘[私たちの]方法は、最適化されたアンカーを介してアニメーションキャラクターの無縫な除去を達成し、特に複雑な形状と属性を持つキャラクター(例:ドナルドダックとスーパーマリオ)の場合、プロンプトベースのベースラインはしばしば失敗します。 ‘
‘さらに、私たちの方法は、ぼけや歪みのアーティファクトなしに背景の一貫性を維持し、イテラティブなクリエイティブなワークフローをサポートします。 ‘
グラニュラーな制御
連続的な埋め込み空間により、キャラクター除去の強度を調整することができ、除去をすべてまたはなしのプロポジションとして扱うのではなく、キャラクターを徐々に復元することができます。最適化されたアンカーと元のターゲット埋め込みの間を補間することで、メソッドはキャラクターを徐々に復元しながら、周囲の画像構造を保持することができます。
キャラクター除去のさまざまなレベルのテスト画像。最初の3列は、元のキャラクター、除去されたバージョン、除去された視覚的な特徴を示します。残りの列は、α=0.25、0.5、0.75の間隔設定を示します。αの値が高いほど、元のキャラクターのより多くの部分が保存されます。元のソースPDFまたはプロジェクトサイトで若干解像度の高いバージョンを参照してください。
上記のように、著者はウィニー・ザ・プー、オラフ、ミニーマウス、スティッチのキャラクターに対してこの制御をテストしました。構造的類似性は、復元の強度が変化するにつれて比較的安定したままでありましたが、LLaVA-1.5とBLIP-3によって行われた認識は、キャラクターのより多くの部分が復元されるにつれて増加しました。
ウィニー・ザ・プーとスティッチは、比較的狭い範囲で認識可能になりました。オラフとミニーマウスはより漸進的に変化しました。ミニーマウスは、比較的少ない量の復元で認識可能になりました。これは、適切な除去の強度は、対象となるキャラクターによって異なることを示しています。
複数のターゲットを一度に置き換えるための追加の実験が成功し、その詳細については、読者に元の論文を参照するようお勧めします。
結論
いつものように、この最新の著作権保護の「ガードレール」は、馬が逃げてしまった後に厩戸を閉めるようなものです。
研究者や企業が、モデルがヌードやポルノを生成する能力を抑制しようとした場合、データセットから「NSFW」コンテンツへの内部アクセスを実際に切断することは、コンテンツをきちんとキュレーションするにはまだ高すぎるコストであることがわかりました。そうすると、モデルは人間の解剖学を適切に理解できなくなります。
ここで提案されている新しいアプローチは、実際には、トレーニングデータに無差別にスクレイピングされた大量のWebコンテンツに基づいてNSFWフィルタを構築する場合、特定のポルノスターを「除去」または「汎用化」することに相当します。新しい方法では、著作権保護されたキャラクターの「汎用的な代役」を作成する必要がありますが、モデル内の「スーパーヒーロー」ドメインを完全に除去するのではなく、保護されたキャラクターの「ドメイン」を定義するため、トレーニング空間内で保存する必要があります。
したがって、キャラクターを除去することは、コーヒーから砂糖を取り除くことに似ており、コーヒーに砂糖が入った後にそれを混ぜた場合と同じです。
したがって、このアプローチは、フロンティアモデルの拡大するAPIファイアウォールに追加される場合、限られた成功を収めるかもしれませんが、歴史的に、GenAIモデルの相互接続性は、著作権保護された素材が、プロンプターの通常の工夫によってアクセス可能なままであることを示唆しています。
2026年8月14日金曜日に初めて公開されました












