Andersonの視点
有名人のディープフェイクを外側の顔の領域から識別する

マイクロソフトと中国の大学の間で新しい共同研究が行われ、現在のディープフェイク技術の限界を利用して、有名人のディープフェイクを識別する新しい方法が提案されています。
このアプローチは、アイデンティティ一致性トランスフォーマー (ICT) と呼ばれ、顔の外側の部分(あご、ほほ骨、髪の生え際など)と顔の内側を比較することで機能します。このシステムは、有名人の一般的に利用可能な公共の画像データを利用し、有名人の画像が大量に存在するコンピュータビジョンデータセットやインターネットでその有効性を制限します。

7つのテクニックを使用した顔のディープフェイクの覆い領域:DeepFake in FF+;DeepFake in Google DeepFake Detection;DeepFaceLab;Face2Face;FSGAN;DF-VAE。人気のあるパッケージであるDeepFaceLabやFaceSwapも同様の制約のある覆い領域を提供します。 ソース:https://arxiv.org/pdf/2203.01318.pdf
上の画像は、現在のディープフェイク技術がかなりリソースに制約されており、ホストの顔や体を利用して、顔の置き換えの証拠を最小限に抑えることを示しています。
さまざまな方法では、額やあご、ほほ骨の領域を包含する場合もありますが、すべてホストの顔の枠内に制約されています。

ICTによって計算される「内側」と「外側」のアイデンティティを強調したサリエンシーマップ。内側の顔のマッチが確立されたが外側のアイデンティティが一致しない場合、ICTは画像を偽物と評価します。
テストでは、ICTは低解像度のビデオなどのディープフェイクコンテンツを検出することができました。ここでは、ビデオ全体のコンテンツが圧縮アーティファクトによって劣化しており、ディープフェイクプロセスの残留的な証拠を隠すのに役立ちます。これは、多くの競合するディープフェイク検出方法を混乱させる状況です。

ICTはディープフェイクコンテンツの認識で競合他社を上回ります。記事の最後に埋め込まれたビデオで、より多くの例と高解像度をご覧ください。ソース:https://www.youtube.com/watch?v=zgF50dcymj8
この 論文 は、有名人のアイデンティティ一致性トランスフォーマーを使用した保護 と題され、中国科学技術大学、Microsoft Research Asia、Microsoft Cloud + AI に所属する 9 人の研究者によって執筆されています。
信頼性のギャップ
人気のある顔スワップアルゴリズムである DeepFaceLab や FaceSwap が、交換された顔のアイデンティティの外側の領域を無視する理由は少なくとも 2 つあります。
まず、ディープフェイクモデルをトレーニングすることは時間がかかり、リソースが必要です。ホストの顔や体を採用することで、GPU サイクルとエポックを節約し、内側の顔の領域に集中できます。これは、体重の変動や加齢などの変数によって短期間に変化しそうにない顔の核心的な特徴を使用してアイデンティティを区別するためです。
2 番目に、ほとんどのディープフェイクアプローチ(特に DeepFaceLab を使用する最も人気のある、または悪名高い実践者)には、顔の「端」の領域であるほほやあごの領域を複製する能力が限られています。また、2017 年の元のコードがこの問題に対処していないため、制約を受けています。
アイデンティティがよく一致しない場合、ディープフェイクアルゴリズムは顔の周囲の背景領域を「インペイント」する必要がありますが、これは最良のディープフェイカーの手によって行われる場合でも、不器用にしか行うことができません。

最高のディープフェイカー:Ctrl Shift Face によるディープフェイクビデオからの静止画。ジム・キャリーをゲイリー・オールドマンの上に重ねています。この作品は、DeepFaceLab とポストプロセッシング技術を使用して現在利用可能な最高の出力の 1 つと考えられています。ただし、ディープフェイクは依然として DFL が外側の顔に与える比較的少ない注意に制限されています。データのキュレーションとトレーニングにヘラクレス的な努力を必要とします。ソース:https://www.youtube.com/watch?v=x8igrh1eyLk
この「手品」、または注意の逸らしは、現在のディープフェイクのリアリズムに対する懸念において、一般的に注目されていません。なぜなら、ディープフェイクに対する私たちの批判的能力はまだ「ショックと驚き」の段階を超えて発展しているからです。
分割されたアイデンティティ
新しい論文では、以前のディープフェイク検出方法のほとんどが、不一致な頭のポーズや瞬きなどのアーティファクトに依存していることを指摘しています。たとえば、不一致な頭のポーズや 瞬きなどがあります。これらは、他の多くのテクニックとともに使用されます。先週、新しいディープフェイク検出論文が、FaceSwap フレームワーク内のさまざまなモデルタイプの「署名」を使用して、偽造されたビデオを識別することを提案しました(下の画像を参照)。

FaceSwap フレームワーク内のさまざまなモデルタイプの「署名」を特徴付けることによるディープフェイクの識別。 ソース:https://arxiv.org/pdf/2202.12951.pdf
一方、ICT のアーキテクチャは、各人が 2 つの別個の入れ子になったアイデンティティを作成し、全体のアイデンティティが「真実」の映像または画像であると結論付けられる前に、両方が検証されなければなりません。

ICT のトレーニングとテストのアーキテクチャ。
アイデンティティの分割は、視覚トランスフォーマーによって実現され、顔の識別を行った後、調査対象領域を内側と外側のアイデンティティに属するトークンに分割します。

2 つの並列アイデンティティシグナラー間でパッチを分配する。
論文では次のように述べられています:
「不幸にも、既存の顔認証方法は、最も判別可能な領域、つまり顔の内側を特徴付ける傾向があり、外側の顔のアイデンティティ情報を捉えることに失敗しています。アイデンティティ一致性トランスフォーマーを使用して、内側の顔と外側の顔の両方のアイデンティティベクトルを同時に学習するようにトランスフォーマーを設計することで、モデルをトレーニングします。」
この識別プロトコルに既存のモデルがないため、著者は新しい一貫性損失を考案しました。これは、真実性の尺度として機能できます。アイデンティティ抽出モデルから得られる「内側のトークン」と「外側のトークン」は、顔識別フレームワークによって生成されるパッチ埋め込みに追加されます。
データとトレーニング
ICT ネットワークは、100 万人の有名人の顔画像を含む Microsoft Research の MS-Celeb-1M データセットでトレーニングされました。このデータセットには、俳優、政治家、その他の著名人など、100 万人のアイデンティティが含まれています。以前の方法である Face X-ray の手順に従って、ICT のフェイク生成ルーチンは、このデータセットから顔の内側と外側の領域を交換して、アルゴリズムをテストするための素材を作成します。
これらの内部交換を実行するために、ICT は、頭のポーズと顔のランドマークが似ている 2 つの画像をデータセット内で識別し、中央の特徴のマスク領域(交換が実行される)を生成し、RGB カラー補正を伴うディープフェイク交換を実行します。
ICT が有名人識別に限定される理由は、最も効果的なバリエーションでは、MS-Celeb-1M(ただし、ネットワークで利用可能な画像に拡張することができます)などの中央コーパスから派生した顔ベクトルを含む新しい参照セットに依存しているためです。
これらの派生ベクトルペアは、内側と外側の顔の領域を同時に検証するための真実性トークンとして機能します。
著者は、これらの方法から得られるトークンは「高レベルの」特徴を表し、ディープフェイク検出プロセスが低解像度や劣化したビデオなどの厳しい環境で生き残る可能性が高くなることを示しています。
重要な点は、ICT はアーティファクトベースの証拠を探すのではなく、顔認識技術に沿ったアイデンティティ検証方法に重点を置いていることです。これは、データ量が少ない場合、たとえば非有名人のディープフェイクの復讐ポルノ事件の調査の場合に、困難です。
テスト
MS-Celeb-1M でトレーニングされた ICT は、さまざまな競合データセットと方法に対してテストされました。これらには、FaceForensics++(FF++)という、4 つの方法(Face2Face、FaceSwap を含む)で作成された 1000 個の本物とディープフェイクのビデオのデータセットが含まれています。また、Google の Deepfake Detection(DFD)もあり、Google によって生成された数千のディープフェイクビデオで構成されています。さらに、Celeb-DeepFake v1(CD1)という、408 個の本物と 795 個の合成、低アーティファクトのビデオが含まれています。Celeb-DeepFake v2 は、V1 の拡張で、590 個の本物と 5,639 個の偽のビデオが含まれています。中国の 2020 年の Deeper-Forensics(Deeper)もあります。
これらはテスト対象のデータセットです。テスト対象の検出方法は、マルチタスク、MesoInc4、カプセル、Xception-c0、c2(FF++ で使用されている方法)、FWA/DSP-FW、Two-Branch、PCL+I2G、および Yuval Nirkin の コンテキスト不一致方法 が含まれています。
上記の検出方法は、特定の顔操作の検出を目的としています。さらに、Face X-ray、ミシガン州立大学の FFD、CNNDetection、および MIT CSAIL の Patch-Forensics などの、より一般的なディープフェイク検出方法もテストされました。
テストの最も明らかな結果は、競合方法がビデオの解像度と品質が低下するにつれて、有効性が大幅に低下することです。ディープフェイクが私たちの判別力を侵食する最も深刻な可能性の 1 つは、現在、非 HD または品質の低いビデオにあります。したがって、これは重要な結果であると考えられます。

上のグラフでは、青と赤の線は、画像の劣化のすべての領域(ガウシアンノイズの障害を除く)に対する ICT 方法の堅牢性を示していますが、競合方法の信頼性は低下しています。
以下の結果テーブルでは、さまざまなディープフェイク検出方法の、未見のデータセットに対する有効性を示しています。グレーとアスタリスクの結果は、クローズドソースプロジェクトの元の公開結果からの比較を示し、外部で検証することはできません。ほぼすべての比較可能なフレームワークで、ICT はさまざまなデータセットで競合するディープフェイク検出アプローチ(太字で示される)を上回ります。

追加のテストとして、著者は Ctrl Shift Face の YouTube チャンネルのコンテンツを実行し、競合方法は著名なディープフェイク コンテンツの識別スコアが大幅に低かったことを発見しました。

注目すべきは、FF++ 方法(Xception-c23)と FFD は、テストデータの一部で最高のスコアを達成しますが、Ctrl Shift Face のディープフェイク コンテンツの「現実世界」のコンテキストでは、ICT に比べて大幅に低いスコアを達成していることです。
著者は、この論文の結果が、ディープフェイク検出コミュニティを、高レベルの特徴に重点を置く同様のイニシアチブに向け、また、アーティファクト検出の「冷戦」から離れさせることを希望しています。ここでは、最新の方法はディープフェイク フレームワークの開発やその他の要因によって常に無効化されます。
ディープフェイク コンテンツを ICT が他の方法よりも優先して識別するさらなる例については、記事の最後に埋め込まれたビデオを参照してください。
2022 年 3 月 4 日に初めて公開されました。












