Andersonの視点
ディープフェイクの新たな特性を特定した研究者たちが長期的な検出を可能にする特性を見つけた

2018年に最初のディープフェイク検出ソリューションが登場して以来、コンピュータビジョンとセキュリティ研究分野は、ディープフェイク動画の「本質的な特性」を定義しようとしてきた。これは、顔合成技術(DeepFaceLabやFaceSwapなどのオートエンコーダーベースのディープフェイクパッケージや、ジェネレーティブ・アドバーサリアル・ネットワークを使用して人間の顔を再現、シミュレート、または変更すること)に対する耐性を持つ信号である。
「目が瞬かない」などの多くの「特徴」は、ディープフェイクの改善によって使えなくなった。一方、デジタル・プロベナンス技術(Content Authenticity Initiativeを主導するアドビなど)の使用(ブロックチェーン・アプローチや、デジタル・ウォーターマーキングなど)には、既存のソース画像の大量な変更や、検証、暗号資産ハッシュ、コンテキスト・チェック、妥当性評価、アルゴリズム・アーティファクトに基づく検出ルーチンなどの負担の多いアプローチが必要である。
したがって、画像や動画コンテンツに含まれる改変された、捏造された、またはアイデンティティが入れ替わった人間の顔を特徴付ける、本質的で堅牢な特性を特定することは非常に役立つことになる。これは、大規模な検証や、暗号化された資産のハッシュ化、コンテキスト・チェック、妥当性評価、アルゴリズム・アーティファクトに基づく検出ルーチンなどの負担の多いアプローチを使用せずに、偽造された動画から直接推測できる特性である。
フレーム内のディープフェイク
中国とオーストラリアの新しい研究協力は、この「聖杯」を、規則性の破壊の形で発見したと考えている。
著者らは、実際の動画の空間的完全性と時間的連続性を、ディープフェイク・コンテンツを含む動画と比較する方法を開発し、どのようなディープフェイク干渉でも画像の規則性を破壊することを発見した。
これは、ディープフェイク・プロセスがターゲット動画をフレームに分解し、各フレーム(または置換フレーム)にトレーニングされたディープフェイク・モデルを適用するためである。人気のディープフェイク・配布は、アニメーターと同様に、各フレームの完全性よりも、各フレームが動画全体の空間的完全性と時間的連続性に貢献することに重点を置いている。

論文から:A)種類の違い。ここでは、p-fakeの乱れがディープフェイクと同様に、アイデンティティの置換なしに画像の空間的・時間的品質を変更する。B)3種類のデータのノイズ分析。p-fakeがディープフェイクの乱れを模倣する方法を示す。C)3種類のデータの時間的視覚化。実データは変動でより大きな完全性を示す。D)実、偽、p-fake動画の抽出された特徴のT-SNE視覚化。ソース:https://arxiv.org/pdf/2207.10402.pdf
これは、動画コーデックがオリジナルのレコーディングを処理または作成するときに、フレームの系列を扱う方法とは異なる。
ファイルサイズを節約するか、動画をストリーミングに適した形式にするために、動画コーデックは大量の情報を破棄する。最高品質の設定でも、コーデックは、キーフレーム(ユーザーが設定できる変数)を割り当てる。これは、動画の中で一定間隔で発生する、ほぼ非圧縮の画像である。
キーフレーム間の間隔フレームは、ある程度、キーフレームのバリエーションとして推定され、可能な限り隣接するキーフレームからの情報を再利用するため、独自の完全なフレームではない。

左側に、完全なキーフレーム(または「iフレーム」)が圧縮動画に保存され、ファイルサイズのコストで保存される。右側に、間隔フレーム(または「デルタフレーム」)が、よりデータの豊富なキーフレームからの可能な限りの情報を再利用する。ソース:https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/
この方法で、ブロック(キーフレーム設定に応じて、x 個のフレームを含む)は、典型的な圧縮動画で考慮される最小の単位であると主張できる。キーフレーム自体(iフレームと呼ばれる)は、その単位の一部を形成する。
伝統的なカートゥーン・アニメーションの観点から、コーデックは、トゥイーニングの種を実行しており、キーフレームは、導出された間隔フレーム(デルタフレームと呼ばれる)に対するテントポールとして機能する。

対照的に、ディープフェイクの重ね合わせは、各フレームに大量の注意とリソースを費やし、フレームのより広いコンテキストや、圧縮とブロックベースのエンコードが「本物の」動画の特性に与える影響を考慮しない。
一部の優れたディープフェイカーは、After Effectsなどのパッケージで広範なポストプロセッシングを使用し、DeepFaceLabディストリビューションには、ネイティブの「ブレンド」手順を適用する能力があるが、これらの手法は、本物の動画とディープフェイク動画の空間的および時間的品質の不一致に影響を与えない。
新しい論文は、ディープフェイクの検出による空間的・時間的規則性の破壊と題されており、清華大学、百度公司のコンピュータビジョンテクノロジー部門(VIS)、およびメルボルン大学の研究者によるものである。
「偽の」偽動画
論文の研究者らは、研究の機能を、Pseudo-fake Generator(P-fake Generator)と呼ばれるプラグアンドプレイ・モジュールに組み込んだ。これは、実際のディープフェイク・プロセスと同様に、実動画を変換して「偽の」ディープフェイク動画を作成するが、実際のディープフェイク操作は行わない。
テスト結果は、このモジュールがほぼゼロのリソースコストで既存のすべてのディープフェイク検出システムに追加でき、またそのパフォーマンスを著しく向上させることを示している。
この発見は、ディープフェイク検出研究におけるもう一つの大きな課題である、信頼性の高い最新のデータセットの不足に対処するのに役立つ可能性がある。
ディープフェイク生成は複雑で時間のかかるプロセスであるため、研究コミュニティは過去5年間でいくつかのディープフェイクデータセットを開発してきたが、多くの場合、古くなっている。
ディープフェイクを変更した動画の特徴である規則性の破壊を特定することで、新しい方法は、ディープフェイクのこの側面に焦点を当てた、無制限のサンプルおよびデータセット動画を生成できる。
テスト
研究者らは、ディープフェイク検出研究で使用される6つの著名なデータセット(FaceForensics++(FF++)、WildDeepFake、Deepfake Detection Challenge preview(DFDCP)、Celeb-DF、Deepfake Detection(DFD)、およびFace Shifter(FSh))に対して実験を行った。
FF++の場合、研究者らはモデルを元のデータセットでトレーニングし、各サブセットを個別にテストした。ディープフェイク素材を使用せずにトレーニングしたにもかかわらず、新しい方法は最先端の結果を超えた。

この方法は、FF++ C23圧縮データセットと比較しても、1位を獲得した。このデータセットには、現実のディープフェイク閲覧環境で信頼できる圧縮アーティファクトが含まれている。

著者らは次のように述べている。
「FF++内のパフォーマンスは、私たちの主な考えの実現可能性を検証する。ただし、既存のディープフェイク検出方法の一般化可能性は大きな問題であり、未知の技術で生成されたディープフェイクをテストした場合、パフォーマンスが保証されない。」
「さらに、検出者と偽造者の間の現実の軍備競争を考慮すると、一般化可能性は、検出方法の有効性を測る上で重要な基準である。」
研究者らは「堅牢性」に関するいくつかのサブテスト(詳細は論文を参照)を実施し、さまざまな種類の動画(実、偽、p-fakeなど)を入力してテストしたが、最も興味深い結果は、クロスデータセット・パフォーマンスのテストからのものである。
このテストでは、著者らはモデルを先ほど述べた「現実世界」のC23バージョンのFF++でトレーニングし、このモデルを4つのデータセットでテストし、すべてのデータセットで優れたパフォーマンスを示したと述べている。

クロスデータセット・チャレンジの結果。論文では、SBIが著者らのアプローチと同様のアプローチを使用していることを示しているが、研究者らは、p-fakeが空間的・時間的規則性の破壊において優れたパフォーマンスを示したと主張している。
論文では次のように述べられている。
「最も挑戦的なDeepwildにおいて、私たちの方法はSOTA方法よりも約10パーセント点上回りました。これは、Deepwildのディープフェイクの多様性が大きいため、他の方法が見たディープフェイクから一般化するのに失敗するためであると考えられます。」
テストに使用されたメトリックは、精度スコア(ACC)、受信者操作特性曲線下の面積(AUC)、および等誤認率(EER)であった。
反撃?
メディアは、ディープフェイク開発者とディープフェイク検出研究者の間の緊張を、技術的な戦争として表現しているが、前者は単により説得力のある出力を作ろうとしているのであって、ディープフェイク検出の困難性の増大は、これらの努力の付随的な副産物であると主張することができる。
開発者がこの新たに明らかになった欠点に対処しようとするかどうかは、規則性の破壊が人間の目によってディープフェイク動画の不正性の兆候として認識できるかどうか、またこのメトリックが質的観点から対処する価値があるかどうかによって決まるかもしれない。
最初のディープフェイクがオンラインに登場してから5年が経過したが、ディープフェイキングはまだ比較的新しい技術であり、コミュニティは詳細と解像度よりもコンテキストの正しさや圧縮動画の署名との一致に重点を置いている。
ディープフェイクのコミュニティ全体が現在闘争しているのは、出力の「劣化」であるが、これは、ディープフェイクの検出におけるこの新しい特性を対処する必要がある。
もし開発者コミュニティが規則性の破壊が品質に影響を与えない新しい特性であると判断した場合、対策を講じる努力は行われないかもしれない。ただし、この特性を「取消」できるポストプロセッシングまたはアーキテクチャ内の手順が存在するかどうかは、はっきりしていない。
先行研究の結果は、ディープフェイク検出研究の分野に新たな道筋を示唆している。














