Andersonの視点
ディープフェイクの新世代のための法医学的データ方法

プライベート個人のディープフェイクは、公共の懸念となり、各地域で禁止されることが増えてきているが、特定の人物の画像でトレーニングされたユーザー作成モデルが作成されたことを実際に証明することは非常に困難である。
問題を理解するために、ディープフェイク攻撃の重要な要素は、画像またはビデオが特定の人物を描いていると虚偽に主張することである。誰かがビデオの中の誰かがアイデンティティ#Aであると主張するだけで、被害を与えることができ、这种状況ではAIは必要ない。
しかし、攻撃者が実際の人物のデータでトレーニングされたモデルを使用してAI画像またはビデオを生成した場合、ソーシャルメディアと検索エンジンの顔認識システムは、投稿やメタデータに名前が必要なくても、自動的に偽造されたコンテンツを被害者にリンクする。AI生成の視覚的なものだけが関連付けを保証する。
人物の外見がより独特になるほど、この関連付けは不可避となるまでになり、最終的に被害者に到達する。
フェイス・トゥ・フェイス
アイデンティティに焦点を当てたモデルを配布する最も一般的な方法は現在、Low-Rank Adaptation(LoRA)を通じて行われ、ユーザーは数時間で少数の画像をトレーニングし、Stable Diffusion(主に静的な画像の場合)またはHunyuan Video(ビデオディープフェイクの場合)などの大規模な基礎モデルに対してトレーニングを行う。
LoRAの最も一般的なターゲットは、女性の有名人であり、彼らの有名度により、一般の被害者よりも批判を受けにくいという仮定の下で、フェアユースの下で保護されていると考えられている。

女性の有名人がcivit.aiポータルのLoRAとDreamboothのリストを支配している。現在最も人気のあるLoRAは66,000以上のダウンロードがあり、これはこのAIの使用がまだ「フリンジ」活動と見なされていることを考えると、相当なものである。
しかし、ディープフェイクの非有名被害者については、メディアでは訴訟の場合や被害者が人気のある媒体で話す場合にのみ表面化する。
どちらの場合も、被害者のアイデンティティを偽造するために使用されるモデルは、トレーニングデータをモデル内の潜在的な空間に「蒸留」してしまい、使用されたソース画像を特定することは困難である。
もしもそれが可能であれば、LoRAを共有する人々の起訴を可能にするだけでなく、適用可能な場合は著作権侵害の罪にもつながる。
後者は、ディープフェイク技術の法的規制が不足している、または遅れている地域では役立つ。
オーバー・エクスポーズド
基礎モデルのトレーニングの目的は、一般化され、柔軟性を持つようにすることである。これには、適切な数の多様な画像でトレーニングを行い、適切な設定でトレーニングを行い、モデルの過剰適合を避けることが含まれる。
過剰適合したモデルは、トレーニングプロセス中にデータを多く見過ぎてしまい、非常に似た画像を再現する傾向があり、トレーニングデータのソースを暴露することになる。

Stable Diffusion V1.5モデルでアイデンティティ「Ann Graham Lotz」をほぼ完全に再現できる。再構築は画像上の左側のトレーニングデータとほぼ同じである。ソース:https://arxiv.org/pdf/2301.13188
しかし、過剰適合したモデルは通常、作成者によって破棄されるか、配布されるのではなく、目的のために適していないからである。したがって、これはまれな法医学的「幸運」である。いずれにせよ、この原則は、特に基礎モデルの高価で大量のトレーニングに適用され、複数のバージョンの同じ画像が大量のソースデータセットに侵入した場合、特定のトレーニング画像を呼び出すのが容易になる(上記の画像と例を参照)。
LoRAやDreamboothモデル(ただし、Dreamboothは大きなファイルサイズのため、現在は流行っていない)の場合、ユーザーは被写体の非常に限られた数の多様な画像を選択し、それらを使用してLoRAをトレーニングする。

左側はHunyuan Video LoRAの出力。右側は類似性を可能にしたデータ(描かれた人物の許可を得て使用された画像)
LoRAには、[nameofcelebrity]のようなトレーニング済みのトリガーワードが含まれることが多い。ただし、特にトレーニングされた被写体は、そのようなプロンプトなしにでも、生成された出力に現れることが多く、これはLoRAがトレーニングに使用された素材に多少「凝り固まっている」ためである。
この傾向と、LoRAのデータセットの画像数が限られているという事実は、法医学的分析にモデルをさらすことになる。
データの仮面を剥ぐ
デンマークからの新しい論文では、メンバーシップ推論攻撃(MIA)でソース画像(または画像グループ)を特定するための方法論が提示されている。テクニックは、ソースデータを暴露するためにカスタムトレーニングされたモデルを使用することを含み、これらのモデルは独自の「ディープフェイク」を生成する。

新しいアプローチによって生成された「偽」の画像の例。Classifier-Free Guidance (CFG)のレベルを上げていくことで、破壊のポイントまで。ソース:https://arxiv.org/pdf/2502.11619
この研究は、Latent Diffusion Modelsに対するFace ImagesのためのMembership Inference Attacksと題され、特にこのトピックに関する文献への最も興味深い貢献であるが、非常に難解で簡潔に書かれた論文であるため、ここで基本的な原理と一部の結果を説明することにする。
実質的に、誰かがあなたの顔でAIモデルをファインチューニングした場合、この方法でそれを証明することができる。
まず、ターゲットAIモデルを顔画像のデータセットでファインチューニングし、生成された画像を「正」として、別のデータセットからの画像を「負」として使用する。
これらのグループ間の微妙な違いを学習することで、攻撃モデルは、与えられた画像が元のファインチューニングデータセットの一部であったかどうかを予測することができる。
攻撃は、モデルが大量にファインチューニングされた場合に最も効果的であり、LoRAが特定の画像セット、たとえば個人の顔でトレーニングされたモデルに特に効果的である。
著者は、トレーニング画像に可視的なウォーターマークを追加すると、検出がさらに容易になることも発見したが、隠しウォーターマークはあまり役に立たない。
アプローチは、モデルの内部詳細にアクセスせずに、モデルの出力のみを使用して、ブラックボックス設定でテストされている。
この方法は計算量が大きいが、研究の価値は、データをある程度の許容範囲内で抽出できることを示していることにある。
方法/データ
この研究では、DTU Orbitから得られたいくつかのデータセットが使用された。
DseenDTU 基本画像セット。
DDTU DTU Orbitからスクレイピングされた画像。
DseenDTU ターゲットモデルをファインチューニングするために使用されるDDTUのパーティション。
DunseenDTU 画像生成モデルをファインチューニングするために使用されていないDDTUのパーティション。代わりに、攻撃モデルをテストまたはトレーニングするために使用される。
wmDseenDTU 可視的なウォーターマークが付いたDDTUのパーティション。ターゲットモデルをファインチューニングするために使用される。
hwmDseenDTU 隠しウォーターマークが付いたDDTUのパーティション。ターゲットモデルをファインチューニングするために使用される。
DgenDTU DseenDTU画像セットでファインチューニングされたLatent Diffusion Model(LDM)によって生成された画像。
また、AU VBNコーパスから得られたいくつかのデータセットがテストに使用された。
DAAU AAU vbnからスクレイピングされた画像。
DseenAAU ターゲットモデルをファインチューニングするために使用されるDAAUのパーティション。
DunseenAAU 画像生成モデルをファインチューニングするために使用されていないDAAUのパーティション。代わりに、攻撃モデルをテストまたはトレーニングするために使用される。
DgenAAU DseenAAU画像セットでファインチューニングされたLDMによって生成された画像。
テスト
ターゲットモデルに対するメンバーシップ推論攻撃の性能を評価するために、複数の実験が行われた。各テストは、スキーマに示すように、ターゲットモデルが許可なく取得された画像データセットでファインチューニングされた場合に、攻撃が成功するかどうかを判断することを目的とした。

アプローチのスキーマ
ターゲットモデルは、ファインチューニングされた画像を生成するようにクエリされ、これらの画像は攻撃モデルの「正」の例として使用される。一方、別のデータセットからの画像は「負」の例として使用される。
攻撃モデルは、教師あり学習を使用してトレーニングされ、新しい画像でテストされて、元のファインチューニングデータセットの一部であったかどうかを判断する。精度を評価するために、テストデータの15%が検証のために設定される。
ターゲットモデルは既知のデータセットでファインチューニングされているため、攻撃モデルのトレーニングデータを作成する際に、各画像のメンバーシップステータスはすでに確立されている。こうしたコントロールされた設定により、攻撃モデルがファインチューニングデータセットの一部であった画像とそうでない画像を区別する能力を明確に評価することができる。
テストには、Stable Diffusion V1.5が使用された。これは、研究でよく使用される古いモデルだが、Stable DiffusionコミュニティでのLoRAの作成に長く使用されてきたため、適切な使用例である。
研究者の攻撃モデルは、Resnet-18に基づいており、事前トレーニング済みの重みを保持していた。ResNet-18の1000ニューロンの最後の層は、2つのニューロンを持つ全結合層に置き換えられた。トレーニング損失は、交差エントロピーを使用し、Adamオプティマイザが使用された。
各テストでは、攻撃モデルを5回トレーニングし、ランダムシードを使用して、主要なメトリックの95%信頼区間を計算した。ゼロショット分類では、CLIPモデルを使用した。
(注:元の主要結果テーブルは簡潔で非常に難解であるため、ここではよりユーザーに優しい形式で表現することにする。画像をクリックして詳細を参照してください)
研究者の攻撃方法は、特に特定の画像セットでトレーニングされたモデルに対して最も効果的であった。ただし、データセットが使用されたかどうかを判断することはできたが、データセット内の個々の画像を特定することは困難であった。
実用的には、後者は、このアプローチを法的に使用することに対する障害ではない。有名なデータセットが使用されたかどうかを判断することにはあまり価値がないが、プライベート個人の場合、攻撃者は利用可能なデータグループ、たとえばソーシャルメディアアルバムやオンラインコレクションを完全に活用する傾向がある。これらは、「ハッシュ」を作成し、ここで説明した方法で発見できる。
論文では、AI生成画像を「非メンバー」として使用することで、精度を向上させることができることも示唆されている。また、トレーニング画像にウォーターマークを付けることも、検出を容易にする。隠しウォーターマークはあまり役に立たない。

右側の図は、テストで使用された実際の「隠し」ウォーターマークを示す。
最後に、テキストから画像の生成におけるガイダンスのレベルも役割を果たしており、ガイダンススケールが約8のときに最適なバランスが見つかった。直接のプロンプトが使用されなくても、ファインチューニングされたモデルは依然としてトレーニングデータに似た出力を生成する傾向があり、攻撃の有効性を強化する。
結論
この興味深い論文があまりにも難解に書かれていることは残念である。この研究は、プライバシー擁護者やカジュアルなAI研究者にとって興味深いものとなるはずである。
メンバーシップ推論攻撃は、興味深く有望な法医学的ツールとなるかもしれないが、より重要なのは、この研究分野が広範な原則を開発し、ディープフェイク検出全般で発生したような、ウィッカモールゲームに陥らないようにすることである。新しいモデルのリリースによって検出と同様の法医学システムが影響を受けることがあるからである。
この新しい研究では、より高いレベルの指針が見つかったため、この方向でのさらなる研究が期待される。
初めて公開:2025年2月21日













