Andersonの視点

AIによる小さなが重要な編集を実際の動画で暴露する

mm
Unite.AI を Google の優先ソースに追加
Montage of illustrations from the paper 'Detecting Localized Deepfake Manipulations Using Action Unit-Guided Video Representations' (https://arxiv.org/pdf/2503.22121)

2019年、アメリカ合衆国下院議長ナンシー・ペロシは、ターゲットとなり、かなり低い技術を持つディープフェイクスタイルの攻撃を受けた。彼女の実際の動画が編集され、彼女が酔っているように見えるようにされた——これは、数百万回共有されたが、真実が明らかになるまでに(そして、彼女の政治資本に多少の損害を与える可能性がある)

この誤表現は、AIではなく、単純なオーディオビジュアル編集のみで実現されたが、実際のオーディオビジュアル出力の微妙な変更が壊滅的な影響を与えることができることを示す重要な例である。

当時、ディープフェイクのシーンは、2017年後半にデビューしたオートエンコーダーベースの顔の置き換えシステムによって支配されていた。これらの初期のシステムは、このような小さなが重要な変更を作成することはできず、現代の研究分野である表情編集を実現することはできなかった。

最近の「Neural Emotion Director」フレームワークは、有名な顔の気分を変える。ソース:https://www.youtube.com/watch?v=Li6W8pRDMJQ

2022年の「Neural Emotion Director」フレームワークは、有名な顔の気分を変える。ソース:https://www.youtube.com/watch?v=Li6W8pRDMJQ

しかし、現在は状況が大きく異なっている。映画やテレビ業界は、機械学習アプローチを使用した実写パフォーマンスのポストプロダクション変更に深く関心を持っており、AIによる後で完璧にすることは、最近批判を受けている。

この需要を予測して(あるいは創造して)、画像や動画の合成研究の分野は、顔のキャプチャーの「ローカル編集」を提供するプロジェクトを幅広く前進させました。顔の完全な置き換えではなく、これらのプロジェクトにはDiffusion Video AutoencodersStitch it in TimeChatFaceMagicFaceDISCOなどがあります。

2025年1月のMagicFaceプロジェクトによる表情編集。ソース:https://arxiv.org/pdf/2501.02260

2025年1月のMagicFaceプロジェクトによる表情編集。ソース:https://arxiv.org/pdf/2501.02260

新しい顔、新しいしわ

しかし、ディープフェイクを検出する技術は、ディープフェイクを作成する技術の進化に追いついていない。研究で見られるほとんどのディープフェイク検出方法は、昨日のディープフェイク方法に昨日のデータセットを使用して対応している。昨日まで、これらの方法のいずれも、AIシステムが動画に小さなローカルな変更を加える可能性に対処していなかった。

今週、インドから出た新しい論文がこの問題に取り組んだ。AIベースの技術で編集された(置き換えられたのではなく)顔を見つけるシステムを提示している。

ディープフェイクの微妙なローカル編集の検出:実際の動画が改変されて、繊細な変更が加えられたフェイクが生成される(ここでは1フレームが示されている)。ソース:https://arxiv.org/pdf/2503.22121

ディープフェイクの微妙なローカル編集の検出:実際の動画が改変されて、繊細な変更が加えられたフェイクが生成される(ここでは1フレームが示されている)。ソース:https://arxiv.org/pdf/2503.22121

著者たちのシステムは、繊細なローカルな顔の操作を伴うディープフェイクを検出することを目的としている。全体的な不一致やアイデンティティの不一致に焦点を当てるのではなく、このアプローチは、表情の微妙な変化や特定の顔の特徴への小さな編集などの繊細な変更を対象としている。

この方法では、Facial Action Coding System(FACS)のアクションユニット(AUs)区切りを使用する。FACSでは、64個の可能な個別の可変領域が顔に定義され、これらが組み合わさって表情を形成する。

FACSの構成要素64個の表現部分のいくつか。ソース:https://www.cs.cmu.edu/~face/facs.htm

FACSの構成要素64個の表現部分のいくつか。ソース:https://www.cs.cmu.edu/~face/facs.htm

著者たちは、さまざまな最近の編集方法に対してアプローチを評価し、古いデータセットと最新の攻撃ベクトルで一貫したパフォーマンスの向上を報告している。

‘マスク付きオートエンコーダー(MAE)を介して学習されたビデオ表現を、AUベースの特徴で導くことで、私たちの方法は、ディープフェイクの検出に重要なローカルな変更を効果的に捉える。

‘このアプローチにより、ローカルな編集と顔中心のビデオのより広範な変更の両方を符号化する統一された潜在的な表現を構築できるため、ディープフェイクの検出に対する包括的で適応可能な解決策を提供する.’

新しい論文は、ディープフェイクのローカル操作の検出にアクションユニットを導入したビデオ表現を使用するというタイトルで、インド工科大学マドラスの3人の著者から出ている。

方法

VideoMAEで採用されているアプローチに沿って、新しい方法は、ビデオに顔検出を適用し、検出された顔の中心に均等に間隔を開けてフレームをサンプリングすることから始まる。これらのフレームは、ローカルな空間的および時間的詳細を捉える小さな3D区画(つまり、時間的に有効なパッチ)に分割される。

新しい方法のスキーマ。入力ビデオは顔検出で処理されて、顔の中心に均等に間隔を開けてフレームが抽出され、これらのフレームは「チューブラ」パッチに分割されて、2つの事前学習タスクからの潜在的な表現を融合するエンコーダーにパスされ、生成されたベクトルは、ビデオが実際のものか偽物かを判断する分類器によって使用される。

新しい方法のスキーマ。入力ビデオは顔検出で処理されて、顔の中心に均等に間隔を開けてフレームが抽出され、これらのフレームは「チューブラ」パッチに分割されて、2つの事前学習タスクからの潜在的な表現を融合するエンコーダーにパスされ、生成されたベクトルは、ビデオが実際のものか偽物かを判断する分類器によって使用される。

各3Dパッチには、連続するフレーム(例:2)の小さなウィンドウのピクセル(例:16×16)が含まれる。これにより、モデルは短期的な動きや表情の変化を学習できる——顔がどのように見えるかだけでなく、どのように動くか

パッチは埋め込まれ、位置情報が付与された後、実と偽を区別する特徴を抽出するように設計されたエンコーダーに渡される。

著者たちは、このことが特に繊細な操作を扱う場合に特に困難であることを認めており、この問題に対処するために、2つの異なる学習された表現を組み合わせたエンコーダーを構築する。つまり、クロスアテンションメカニズムを使用して、これらを融合する。これは、ローカルな編集を検出するためのより敏感で汎用的な特徴空間を生成することを目的としている。

事前タスク

これらの表現の1つは、マスク付きオートエンコーディングタスクで学習されたエンコーダーである。ビデオを3Dパッチに分割し(ほとんどが隠されている)、エンコーダーは隠された部分を再構築するように学習し、重要な空間的および時間的パターン(例:顔の動きや時間経過における一貫性)を捉えることを強制する。

事前タスクのトレーニングには、ビデオ入力をマスクして、エンコーダーとデコーダーのセットアップを使用して、元のフレームまたはフレームごとのアクションユニットマップ(タスクによって異なる)を再構築することが含まれる。

事前タスクのトレーニングには、ビデオ入力をマスクして、エンコーダーとデコーダーのセットアップを使用して、元のフレームまたはフレームごとのアクションユニットマップ(タスクによって異なる)を再構築することが含まれる。

しかし、論文では、これだけでは繊細な編集を検出するのに十分ではないと述べられており、著者たちは、顔のアクションユニット(AUs)を検出するように学習された2番目のエンコーダーを導入する。 このタスクでは、モデルは、部分的にマスクされた入力から、各フレームの密なAUマップを生成するように学習する。これにより、モデルは、多くの繊細なディープフェイク編集が発生する、ローカルな筋肉の活動に焦点を当てることが促される。

顔のアクションユニット(FAUsまたはAUs)のさらにいくつかの例。ソース:https://www.eiagroup.com/the-facial-action-coding-system/

顔のアクションユニット(FAUsまたはAUs)のさらにいくつかの例。ソース:https://www.eiagroup.com/the-facial-action-coding-system/

事前学習が完了すると、2つのエンコーダーの出力は、クロスアテンションを使用して組み合わされる。2つの特徴セットを単純に結合するのではなく、モデルはAUベースの特徴をクエリとして使用し、これは空間的および時間的特徴を学習したマスク付きオートエンコーダーからの特徴に注意を向ける。実際、AUエンコーダーはモデルにどこに注目するかを教える。

結果として、ローカルな編集と顔の中心のより広範な変更の両方を捉えることができる、融合された潜在的な表現が生成される。この統合された特徴空間は、最終的な分類タスクに使用される——つまり、ビデオが実際のものか操作されたものかを予測する。

データとテスト

実装

著者たちは、FaceXZooのPyTorchベースの顔検出フレームワークを使用して、入力ビデオを事前に処理し、各クリップから16個の顔の中心のフレームを取得した。上記の事前タスクは、CelebV-HQデータセットでトレーニングされ、35,000個の高品質の顔のビデオで構成されていた。

ソース論文からの、使用されたCelebV-HQデータセットの例。ソース:https://arxiv.org/pdf/2207.12393

ソース論文からの、使用されたCelebV-HQデータセットの例。ソース:https://arxiv.org/pdf/2207.12393

データの例の半分はマスクされ、システムはソースデータに過剰に適合するのではなく、一般的な原則を学習することを強制された。

マスク付きフレームの再構築タスクの場合、モデルは、L1損失を使用して、元のフレームと再構築されたコンテンツの差を最小化するようにトレーニングされた。

2番目のタスクでは、モデルは、各フレームの16個の顔のアクションユニットのマップを生成するようにトレーニングされ、L1損失で監督された。

事前トレーニング後、2つのエンコーダーは融合され、FaceForensics++データセットを使用してディープフェイクの検出のためにファインチューンされた。このデータセットには、実際のビデオと操作されたビデオが含まれている。

FaceForensics++データセットは、2017年以来ディープフェイクの検出の基準となっているが、最新の顔合成技術に関しては、かなり古くなっている。ソース:https://www.youtube.com/watch?v=x2g48Q2I2ZQ

FaceForensics++データセットは、2017年以来ディープフェイクの検出の基準となっているが、最新の顔合成技術に関しては、かなり古くなっている。ソース:https://www.youtube.com/watch?v=x2g48Q2I2ZQ

クラス不均衡を考慮して、著者たちはFocal Lossクロスエントロピー損失のバリアント)を使用した。これは、トレーニング中により困難な例を強調する。

すべてのトレーニングは、24GbのVRAMを備えた単一のRTX 4090 GPUで実行され、バッチサイズは8、バッチサイズは8、600エポック(データの完全なレビュー)で、事前トレーニング済みのチェックポイントからVideoMAEを使用して、各事前タスクの重みを初期化した。

テスト

さまざまなディープフェイク検出方法に対する定量的および定性的評価が実行された:FTCNRealForensicsLip ForensicsEfficientNet+ViTFace X-RayAlt-FreezingCADMMLAANet;およびBlendFaceのSBI。これらのフレームワークすべてのソースコードが利用可能だった。

テストは、部分的に編集されたディープフェイクに焦点を当てた。ソースクリップの部分のみが変更されていた。使用されたアーキテクチャは、Diffusion Video Autoencoders(DVA);Stitch It In Time(STIT);Disentangled Face Editing(DFE);TokenflowVideoP2PText2Live;およびFateZeroだった。これらの方法は、DVAとSTITおよびDFEの場合の拡散とStyleGAN2を使用している。

著者たちは次のように述べている:

‘さまざまな顔の操作を包括的にカバーするために、幅広い顔の特徴と属性の編集を組み込んだ。顔の特徴の編集の場合、目サイズ、目と眉の距離、鼻の比率、鼻と口の距離、唇の比率、ほおの比率を変更した。顔の属性の編集の場合、笑顔、怒り、嫌悪、悲しみなどの表情を変えた。 ‘

‘この多様性は、広範なローカル編集に対するモデルの堅牢性を検証するために不可欠である。上記の編集方法ごとに50個のビデオを生成し、ディープフェイクの検出におけるモデルの強力な汎用性を検証した。 ‘

古いディープフェイクのデータセットもテストに含まれていた。具体的には、Celeb-DFv2(CDF2);DeepFake Detection(DFD);DeepFake Detection Challenge(DFDC);およびWildDeepfake(DFW)だった。

評価メトリックは、曲線下の面積(AUC)平均精度;および平均F1スコアだった。

論文からの、最近のローカルディープフェイクに対する比較。提案された方法が他のすべての方法を上回り、次善のアプローチよりもAUCと平均精度で15~20%の改善を示した。

論文からの、最近のローカルディープフェイクに対する比較。提案された方法が他のすべての方法を上回り、次善のアプローチよりもAUCと平均精度で15~20%の改善を示した。

著者たちはさらに、ローカルに操作されたビューの視覚的な検出の比較を提供しているが、ここでは一部のみを示している。

実際のビデオが3つの異なるローカル操作で変更されて、オリジナルと視覚的に似たフェイクが生成された。各方法の平均フェイク検出スコアは、著者によると、提案された方法が他の主要なアプローチよりもローカルな変更をより信頼性の高い方法で検出したことを示している。完全な結果は、ソースPDFの最後のページに記載されている。

実際のビデオが3つの異なるローカル操作で変更されて、オリジナルと視覚的に似たフェイクが生成された。各方法の平均フェイク検出スコアは、著者によると、提案された方法が他の主要なアプローチよりもローカルな変更をより信頼性の高い方法で検出したことを示している。完全な結果は、ソースPDFの最後のページに記載されている。

研究者たちは次のように述べている:

‘現在のSOTA検出方法、[LAANet]、[SBI]、[AltFreezing]、[CADMM]は、最新のディープフェイク生成方法に対して大幅なパフォーマンスの低下を示している。現在のSOTA方法は、AUCが48~71%と低いレベルで推移しており、最近のディープフェイクに対する汎用性が低いことを示している。 ‘

‘一方、我々の方法は、87~93%のAUCを達成し、ロバストな汎用性を示している。同様の傾向は、平均精度の場合にも観察される。下図のように、我々の方法は、従来のデータセットでも高いパフォーマンスを達成し、90%を超えるAUCを達成していることがわかる。最近のディープフェイク検出モデルのパフォーマンスと競合する。 ‘

従来のディープフェイクデータセットでのパフォーマンスは、提案された方法が主要なアプローチと競合することを示しており、さまざまな操作タイプに対する強力な汎用性を示唆している。

従来のディープフェイクデータセットでのパフォーマンスは、提案された方法が主要なアプローチと競合することを示しており、さまざまな操作タイプに対する強力な汎用性を示唆している。

著者たちは、これらの最後のテストは2020年以前のモデルを使用していることを観察している。

新しいモデルのパフォーマンスのより広範な視覚的な表現として、著者たちは最後に、ここでは一部しか示されていない広範な表を提供している。

これらの例では、実際のビデオが3つのローカル編集で変更されて、オリジナルと視覚的に似たフェイクが生成された。操作ごとの平均信頼度スコアは、著者によると、提案された方法が他の主要なアプローチよりもフェイクをより信頼性の高い方法で検出したことを示している。完全な結果は、ソースPDFの最後のページに記載されている。

これらの例では、実際のビデオが3つのローカル編集で変更されて、オリジナルと視覚的に似たフェイクが生成された。操作ごとの平均信頼度スコアは、著者によると、提案された方法が他の主要なアプローチよりもフェイクをより信頼性の高い方法で検出したことを示している。完全な結果は、ソースPDFの最後のページに記載されている。

著者たちは、モデルの検出精度がローカル編集の検出において90%を超えることを主張している。一方、既存の検出方法は同じタスクで50%以下の精度しか示していない。著者たちは、このギャップを、モデルの感度と汎用性の証拠、およびこれらの種の繊細な顔の操作に対処する際に現在の技術が直面している課題の指標として解釈している。

モデルの信頼性を現実世界の条件で評価するために、CADMMによって確立された方法に従って、著者たちは、モデルのパフォーマンスを、彩度とコントラストの調整、ガウシアンノイズ、ピクセル化、ブロックベースの圧縮アーティファクト、および加算ノイズなどの一般的な歪みで変更されたビデオでテストした。

結果は、検出精度がこれらの歪みのほとんどで安定したままであることを示した。注目すべき低下は、ガウシアンノイズの追加によって発生した。其他の変更はほとんど影響がなかった。

ビデオの歪みに対する検出精度の変化の表現。新しい方法は、ほとんどの場合に堅牢性を維持しており、AUCの低下はわずかである。最も重大な低下は、ガウシアンノイズの導入によって発生した。

ビデオの歪みに対する検出精度の変化の表現。新しい方法は、ほとんどの場合に堅牢性を維持しており、AUCの低下はわずかである。最も重大な低下は、ガウシアンノイズの導入によって発生した。

これらの結果は、モデルのローカル操作の検出能力が、典型的なビデオ品質の低下によって簡単に妨げられないことを示唆しており、実践的な設定での潜在的な堅牢性を支持している。

結論

AIによる操作は、主に伝統的なディープフェイクの概念として、一般的な認識の中に存在している。つまり、1人の人物のアイデンティティが別の人の身体に重ねられる——その人が行っている行動は、アイデンティティ所有者の原則に反するものである。ただし、この概念は、最新の生成可能なビデオシステム(新しいタイプのビデオディープフェイク)や、潜在的拡散モデル(LDMs)全般の能力を認識するように、徐々に更新されている。

したがって、論文で扱われているようなローカル編集が一般の注目を集めるのは、ペロシ様のイベントが発生するまでかもしれません。人々は、ビデオディープフェイク詐欺などのよりセンセーショナリな話題に気を取られているからです。

しかし、俳優のニコラス・ケイジが、生成可能なAIの可能性について一貫して懸念を表明しているように、私たちもこのような「繊細な」ビデオ調整についての認識を高めるべきである。私たちは、顔の表情のわずかな変化に非常に敏感であるという性質上、また、文脈が小さな顔の動きの影響を大幅に変えることができる(例えば、葬儀でのにやりときの妨げになる)ためである。

 

2025年4月2日水曜日に初めて公開された

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai