Andersonの視点
AIモデルを検閲することはうまくいかない、研究が明らかにする

AI画像生成モデルを検閲するために、禁止されたコンテンツ(例:ポルノ、暴力、または著作権で保護されたスタイル)をトレーニングモデルから消去する試みは、期待に応えていない:新しい研究によると、現在の概念消去方法は、「禁止された」属性が関連のない画像に流れることを許可し、さらに、「消去された」コンテンツの近いバージョンが表示されるのを止めることができないことが分かった。
企業が基礎となるAIモデルを制作できない場合、モデルが悪用されて違法または不適切なコンテンツを生成するリスクがあるため、訴訟や閉鎖の対象となる可能性がある。一方、APIを通じてのみモデルを提供するベンダー(例:AdobeのFirefly生成エンジン)は、モデルが何を生成するかについて心配する必要がない。なぜなら、ユーザーのプロンプトと生成された出力の両方が検査およびサニタイズされるからである。

AdobeのFireflyシステム、Photoshopなどのツールで使用される、は時々生成リクエストをすぐに拒否することでブロックする。時々、画像を生成してから、レビュー後に結果をブロックする。ChatGPTでも、モデルがポリシーの違反を認識してからレスポンスを切り捨てることがある。
しかし、ローカルにインストールされたモデル(包括してビジョン言語モデル(VLMs))の場合、ユーザーがカスタムデータでローカルトレーニングを実行して、APIスタイルのフィルタを無効にすることができる。
そのような操作を無効にすることは、Pythonで関数呼び出しをコメントアウトすることによって通常は容易であり(ただし、フレームワークの更新後に通常はこれらのハックを繰り返し実行する必要がある)。
ビジネス面から見ると、これが問題となる理由はわかりにくい。なぜなら、APIアプローチは企業のワークフローに対するコントロールを最大化するからである。ただし、ユーザーから見ると、APIのみのモデルのコストと、過度な検閲のリスクが、ユーザーをFOSSライセンスが有利なオープンソースの代替品のローカルインストールとカスタマイズに向かわせる可能性が高い。
最後に、自己検閲を試みなかった重要なモデルは、Stable Diffusion V1.5でした。ほぼ3年前。その後、そのトレーニングコーパスにはCSAMデータが含まれていることが明らかになり、Hugging Faceリポジトリから削除されることとなった。
検閲をやめろ!
懐疑的な人々は、企業がローカルでインストール可能な生成AIモデルを検閲することに興味を持つのは、法的責任について心配するからであると主張する。もし彼らのフレームワークが違法または不適切なコンテンツを生成するために悪用されることが公に知られれば、訴訟や閉鎖の対象となる可能性があるからである。
実際、Stable Diffusion 1.5やDeepSeek R1のような「ローカルに優しい」オープンソースモデルは、検閲を解除することはそれほど難しくない。
一方、Black Forest LabのFlux Kontextモデルシリーズの最近のリリースは、企業がKontext全シリーズを検閲することに尽力したことを示した。これは、慎重なデータキュレーションと、NSFWまたは禁止されたコンテンツの残りの傾向を除去するためのターゲットのファインチューニングによって達成された。
ここ数年間、研究の焦点はトレーニング後に不完全なデータを持つモデルの事後修正にありました。そうしたオファーには、Unified Concept Editing in Diffusion Models(UCE);Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models(RECE);Mass Concept Erasure in Diffusion Models(MACE);およびconcept-Semi-Permeable structure is injected as a Membrane(SPM)があります。

2024年の論文「Unified Concept Editing in Diffusion Models」は、テキストと画像のモデルへの複数の概念の効率的な編集を可能にする、閉じた形式の編集を提供しました。しかし、この方法は検証に耐えますか?ソース:https://arxiv.org/pdf/2308.14761
このアプローチは効率的ですが(LAIONのような超大規模コレクションは、手動でキュレーションするには大きすぎる)、必ずしも効果的ではありません。アメリカの新しい研究によると、これらの編集手法(概念消去技術(CETs))は、事実上、うまく機能しません。
著者らは、これらのCETsが通常簡単に回避できること、およびそれらが有効である場合でも重大な副作用があることを発見しました。

テキストと画像のモデルに対する概念消去の影響。各列は、消去された概念と、編集の前後に生成された出力を示しています。階層は、概念間の親子関係を示しています。例は、子概念の消去の失敗、近接概念の抑制、再表現による回避、消去された属性の無関係なオブジェクトへの転送などの一般的な副作用を強調しています。ソース:https://arxiv.org/pdf/2508.15124
著者らは、主な現在の概念消去手法が、構成プロンプト(例:赤い車または小さな木製の椅子)をブロックすることに失敗し、親カテゴリを消去した後でも、サブクラスがスルーすることが多く、さらに、新しい問題を引き起こすことがあります。たとえば、青いソファを消去すると、モデルは無関係なオブジェクト(例:青い椅子)にその属性を適用することがあります。
80%以上のテストケースで、広い概念(例:車両)を消去しても、モデルはより具体的な車両のインスタンス(例:車またはバス)を生成し続けました。
編集は、注意マップ(画像内のどこに焦点を当てるかを決定するモデルの部分)を散らばらせ、出力の品質を低下させます。
興味深いことに、研究では、関連するトレーニング概念を1つずつ消去することが、すべてを一度に消去するよりも効果的であることがわかりました。ただし、これは編集方法のすべての欠点を除去するものではありません。

逐次的および一括消去戦略の比較。テディベアのすべてのバリエーションを同時に消去すると、モデルはまだクマのようなオブジェクトを生成します。一方、バリエーションを逐次的に消去すると、モデルはターゲット概念をより信頼性高く抑制します。
研究者は現在、問題点を解決する方法を提供することができませんが、新しいデータセットとベンチマークを開発し、これにより、将来の研究プロジェクトが「検閲された」モデルが期待どおりに動作しているかどうかを理解するのに役立ちます。
論文には次のように記載されています:
‘以前の評価は、ターゲットクラスと保存クラスの小さなセットのみに依存しています。たとえば、「車」を消去する場合、モデルの「車」を生成する能力のみがテストされます。
‘しかし、このアプローチは本質的に不十分である。概念の階層と構成性を考慮する必要があります。[EraseBenchの著者は、]視覚的に類似した概念や言い換えられた概念(例:「猫」と「子猫」)の影響を評価しますが、概念の階層と構成性を徹底的に調査することはできません。 ‘
‘構成バリエーションと概念の近接性の影響を体系的に分析し、概念の回避や属性漏れなどの影響を明らかにすることで、CETsの重大な制限と副作用を明らかにします。 ‘
‘私たちのベンチマークはモデルの種類に依存せず、簡単に統合でき、CETの開発を支援するために理想的に適しています。 ‘

CETsはターゲット概念「鳥」を消去しますが、構成バリエーション「赤い鳥」(上)では失敗します。 「青いソファ」を消去すると、すべての方法で「青い椅子」を生成する能力も失われます。 成功した結果は緑のチェックマークで示され、失敗した結果は赤い「×」で示されます。
研究は、モデルの潜在的な空間における概念の相互関係の程度と、概念の消去が容易に許されない程度について、興味深い洞察を提供します。また、エントランスが概念の消去を容易に許さないことを示しています。
新しい論文は、Diffusion Modelsからの概念の副作用の消去と題され、メリーランド大学の4人の研究者によって発表されました。
方法とデータ
著者らは、概念を消去することを主張する以前の作品がその主張を十分に証明していないと述べています。
‘消去の主張には、より強力で包括的な評価が必要です。たとえば、消去する概念が「車」の場合、サブコンセプトとして「車」と「赤い車」または「小さな車」などの構成概念も消去される必要があります。 ‘
‘しかし、これらの概念の階層と構成性の側面は、既存の評価プロトコルでは考慮されていません。既存の評価プロトコルは、単に消去された概念の精度のみに焦点を当てています。[EraseBenchの著者は、]視覚的に類似した概念や言い換えられた概念(例:「猫」と「子猫」)の影響を評価しますが、概念の階層と構成性を徹底的に調査することはできません。 ‘
将来のプロジェクトにベンチマークデータを提供するために、著者らはSide Effect Evaluation(SEE)データセットを作成しました。これは、概念消去方法の効果をテストするために設計されたテキストプロンプトの大規模なコレクションです。
プロンプトは、サイズ、色、素材などの属性でオブジェクトを説明する単純なテンプレートに従います。たとえば、小さな赤い木製の車の画像です。
オブジェクトはMS-COCOデータセットから抽出され、車両などのスーパークラスや車またはバスなどのサブクラスの階層に整理され、属性の組み合わせは階層の最も具体的なレベル(葉ノード)を形成しました。この構造により、さまざまなセマンティックレベルで消去をテストすることができます。
自動評価をサポートするために、各プロンプトは「画像に車が含まれていますか?」などのはい/いいえの質問とペアにされ、画像分類モデル用のクラスラベルとしても使用されました。

SEEデータセットのサイズ、色、素材の属性を変化させて生成されたプロンプトの組み合わせ。
各概念消去方法のパフォーマンスを測定するために、著者らは2つのスコアリング方法を考案しました。ターゲット精度は、消去された概念が生成された画像にまだ表示される頻度を追跡します。一方、保存精度は、モデルが消去されなかったコンテンツを生成し続けるかどうかを追跡します。
2つのスコアのバランスは、方法がターゲット概念をモデルから削除することと、モデルのより広範な出力を損なうことの間のトレードオフを明らかにすることを目的としています。
著者らは、概念消去を3つの失敗モードで評価しました。まず、CLIP埋め込みの類似性と属性ベースの編集距離を使用して、消去された概念の近接概念にどれだけの影響があるかを評価しました。
最後に、消去された概念の属性が無関係なオブジェクトに表示されるかどうかを確認しました(たとえば、「ソファ」を消去すると、別のオブジェクト(たとえば「植え込み」)にその色や素材が適用される可能性があります)。最終的なデータセットには5056の構成プロンプトが含まれています。
テスト
テストされた以前のフレームワークは、UCE、RECE、MACE、SPMでした。研究者は、元のプロジェクトからデフォルトの設定を採用し、NVIDIA RTX 6000 GPUと48GBのVRAMですべてのモデルをファインチューニングしました。
Stable Diffusion 1.4は、テストに使用された最も永続的なモデルの一つでした。もしかしたら、最初のSDモデルにはほとんど、またはまったく概念的な制限がなかったため、この研究の文脈では白紙の状態だったからです。
SEEデータセットの各プロンプトは、編集前のモデルと編集後のモデルで実行され、各プロンプトで4つの画像が生成されました。固定されたランダムシードを使用して、消去の影響が複数の出力にわたって一貫しているかどうかをテストしました。各編集モデルは、合計20,224枚の画像を生成しました。
保存された概念の存在は、テキストと画像の消去手順の以前の方法を使用して評価され、BLIP、QWEN 2.5 VL、およびFlorence-2baseなどのVQAモデルを使用しました。
近接概念への影響
最初のテストでは、概念を消去しても近接概念に影響しないことを確認しました。たとえば、「車」を消去した後、モデルは「赤い車」や「大きな車」を生成しないはずですが、「バス」や「トラック」などの関連概念や「フォーク」などの無関係な概念を生成する能力は維持しているはずです。
分析では、CLIP埋め込みの類似性と属性ベースの編集距離を使用して、各概念が消去されたターゲットにどれだけ近いかを推定し、妨害がどれだけ広がるかを数量化しました。

ターゲット精度(左)と保存精度(右)を、セマンティック類似性(上)と構成距離(下)に対してプロットした結果。理想的な概念消去方法は、すべての距離でターゲット精度が低く保存精度が高いことを示すはずですが、結果は現在の技術がきれいに一般化できないことを示しています。近接概念は不十分に消去されたり、不当に妨害されたりしています。
著者らは次のように述べています。
‘すべてのCETsは、消去にもかかわらず、構成または意味的に遠いバリエーションを生成し続けます。理想的には、これは発生しないはずです。UCEは、他のCET方法よりも[保存セット]で一貫して高い精度を達成していることがわかります。これは、意味的に関連する概念への意図しない影響が最小限であることを示しています。 ‘
‘一方、SPMは最も低い精度を達成しており、その編集戦略が概念の類似性に最も敏感であることを示しています。 ‘
テストされた4つの方法の中で、RECEはターゲット概念をブロックするのに最も効果的でした。ただし、上の画像の左側に示されているように、すべての方法が構成バリエーションを抑制することに失敗しました。「鳥」を消去した後、モデルはまだ「赤い鳥」を生成しました。「青いソファ」を消去すると、モデルは「青い椅子」を生成する能力も失いました。RECEは構成バリエーションをよりうまく処理しましたが、UCEは関連概念を保存するのにより優れました。
消去の侵入
消去回避テストでは、モデルが親クラスを消去した後でも、サブクラスの概念を生成することができるかどうかを評価しました。たとえば、「車両」を消去した後、モデルは「自転車」や「赤い車」などの出力を生成することができるかどうかを確認しました。
プロンプトは、直接のサブクラスと構成バリエーションの両方を対象として、概念消去操作が概念の完全な階層を削除したか、またはより具体的な説明を使用して回避できるかどうかを判断するために使用されました。

Stable Diffusion v1.4で、サブクラスと構成バリエーションを通じて消去されたスーパークラスの回避。精度が高いほど、回避が大きいことを示しています。
編集されていないモデルは、すべてのスーパークラスで高い精度を維持し、ターゲット概念を消去していないことを確認しました。CETsの中で、MACEは最も少ない回避を示し、テストされたカテゴリのほとんどでサブクラスの精度が最も低かったです。RECEも、特に「アクセサリー」、「スポーツ」、「電子」グループでよく機能しました。
一方、UCEとSPMは、消去された概念が関連またはネストされたプロンプトを使用してより簡単に回避できることを示唆する、サブクラスの精度が高かったです。
著者らは次のように述べています。
‘すべてのCETsは、ターゲットのスーパークラス概念(「食べ物」)を抑制します。しかし、「食べ物」の階層の属性ベースのサブクラス(例:「大きなピザ」)でプロンプトすると、すべての方法で食べ物アイテムが生成されます。 ‘
‘同様に、「車両」カテゴリでは、すべてのモデルが自転車を生成しますが、「車両」を消去しています。 ‘
属性漏れ
3番目のテストである属性漏れでは、消去された概念の属性が画像の他の部分に表示されるかどうかを確認しました。たとえば、「ソファ」を消去した後、モデルは「ソファ」自体を生成しないはずですが、その属性(たとえば、色や素材)を無関係なオブジェクトに適用しないことも確認されます。
これは、モデルにペアのオブジェクトを提示し、消去された属性が保存された概念に誤って表示されるかどうかを調べることで測定されました。

概念消去後の属性トークンの注意マップ。左:「ベンチ」を消去すると、「木製」のトークンが鳥にシフトし、木製の鳥が生成されます。右:「ソファ」を消去しても、「ソファ」の生成を抑制できず、「大きな」のトークンがドーナツに誤って割り当てられます。
RECEはターゲット属性を消去するのに最も効果的でしたが、保存されたプロンプトに最も多くの属性漏れを引き起こしました。UCEは他の方法よりも漏れを少なくしました。
結果は、より強力な消去と誤った属性転送のリスクの間のトレードオフの必要性を示唆しています。
結論
モデルの潜在的な空間は、トレーニング中に概念が整然と充填されるのではなく、概念が混在して境界が不明瞭になるため、概念を削除するのは難しい。消去は、血を失うことなく1ポンドの肉を除去するのと同じです。
知的で進化するシステムでは、基礎となる出来事(例:火傷してから火を尊重する)とそれらが後に形成する行動や関連付けは密接に結びついており、中央の「禁止」概念の余波を残したまま概念を除去するモデルを作成することは困難です。
* 著者のインライン引用をハイパーリンクに変換したもの。
最初に公開:2025年8月22日金曜日












