Andersonの視点
新しいシンプルなディープフェイク手法が従来のアプローチを上回る

中国のAI研究グループと米国の研究者による共同研究により、4年前に現れたディープフェイク技術において初めての真正な革新が生まれた可能性がある。
新しい手法は、他のすべての既存のフレームワークを上回る顔スワップを実行できるだけでなく、大規模な専用のデータセットを収集して整理し、1つのアイデンティティに対して1週間までトレーニングする必要がない。新しい論文で提示された例では、2つの人気のある有名人データセットの全体が、約3日間で1つのNVIDIA Tesla P40 GPUでトレーニングされた。

この記事の末尾にフルビデオが埋め込まれています。 補足資料のビデオからのサンプルで、スカーレット・ヨハンソンさんの顔がソースビデオに転送されています。CihaNetは、ソースとターゲットのアイデンティティの間に深い関係を形成して実行することで、エッジマスキングの問題を解決し、従来のディープフェイクアプローチで発生する「明らかな境界」や他のスーパーアイムポーズグリッチを排除します。ソース:https://mitchellx.github.io/#video
新しいアプローチは、移植されたアイデンティティをターゲットビデオに粗く「貼り付ける」必要性を排除する。これは、移植された顔の終わりと、実際の下にある顔の開始地点で頻繁に発生する、見分けがつくをもたらす。代わりに、「hallucination maps」が、視覚的な側面のより深い混合を実行するために使用される。システムは、現在の方法よりもアイデンティティとコンテキストをより効果的に分離するため、ターゲットアイデンティティをより深いレベルでブレンドできる。

論文からの画像。CihaNetの変換は、hallucination maps(下行)を介して実行されます。システムは、コンテキスト情報(例:顔の方向、髪、眼鏡、その他の遮蔽物など)を、画像全体から、アイデンティティ情報を、画像に挿入される人物から取得します。顔とコンテキストを分離する能力は、システムの成功に重要です。ソース:https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
実質的に、新しいhallucination mapは、スワップに対してより完全なコンテキストを提供する。従来のディープフェイクアプローチでは、ハードマスクが頻繁に必要であり、多大な手作業によるキュレーション(DeepFaceLabの場合は、別々のトレーニング)が必要であり、2つのアイデンティティの実際の統合に対する柔軟性が限られている。

補足資料から、FFHQとCeleb-A HQデータセットを使用して、VGGFaceとForensics++でサンプルを生成しました。最初の2列は、ランダムに選択された(実際の)画像をスワップするものです。次の4列は、現在利用可能な4つの最も効果的な方法を使用してスワップした結果を示し、最後の列はCihaNetの結果を示しています。FaceSwapリポジトリは、より人気のあるDeepFaceLabではなく、元の2017年のDeepfakesコードのフォークであるため使用されました。両プロジェクトは、独自のモデル、テクニック、UI、ツールを追加しましたが、ディープフェイクを可能にする根本的なコードは変わらず、共通のままです。ソース:https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
論文「One-stage Context and Identity Hallucination Network」は、JD AI Researchとマサチューセッツ大学アマースト校の研究者によって執筆され、中国の国家重点研発プログラム(2020AAA0103800)による支援を受けています。2021年10月20日から24日にかけて、中国成都で開催された第29回ACMインターナショナルカンファレンスオンマルチメディアで発表されました。
「顔の向き」を揃える必要なし
現在最も人気のあるディープフェイクソフトウェアであるDeepFaceLabや、そのフォークであるFaceSwapは、どの方向に顔が向いているか、どのような障害物があるか(また、手動でアカウントする必要がある)など、面倒くさくて頻繁に手作業でキュレーションが必要なワークフローを実行してきました。これらのソフトウェアは、多くの面倒くさくてイラストレーションを必要とする障害物(照明を含む)に対処する必要があり、メディアによって不正確に表現されてきた「ポイント・アンド・クリック」の経験から遠く離れています。
一方、CihaNetは、2つの画像が直接カメラに向いている必要がないため、単一の画像から有用なアイデンティティ情報を抽出して利用することができます。

この例では、ディープフェイクソフトウェアの複数のコンテンダーが、同じ方向を向いていない顔のスワップに挑戦しています。元のDeepfakesリポジトリから派生したソフトウェア(DeepFaceLabやFaceSwapなど)は、2つの画像の間の角度の差異を処理できません(3列目参照)。一方、CihaNetは、顔の「ポーズ」がアイデンティティ情報の一部ではないため、アイデンティティを抽出できます。
アーキテクチャ
CihaNetプロジェクトは、2019年のマイクロソフトリサーチと北京大学の共同研究「FaceShifter」に触発されたものですが、いくつかの重要な変更が加えられています。
FaceShifterは、アイデンティティ情報を処理するために2つのAdaptive Instance Normalization(AdaIN)ネットワークを使用し、追加のHEAR-Net(別々にトレーニングされたサブネットを含む)を使用して、アイデンティティ情報をターゲット画像に転送します。これは、現在のディープフェイクソフトウェアと同様であり、そのすべての制限を共有しています。
代わりに、新しいアーキテクチャは、変換プロセス自体のためにこの「コンテキスト情報」を直接使用します。2ステップのCascading Adaptive Instance Normalization(C-AdaIN)操作を介して、ID関連領域のコンテキストの一貫性を提供します。
システムに重要な2番目のサブネットは、Swapping Block(SwapBlk)と呼ばれ、参照画像のコンテキストとソース画像の埋め込まれた「アイデンティティ」情報から統合された機能を生成し、従来の手段でこれを達成するために必要な複数のステージをバイパスします。
コンテキストとアイデンティティを区別するために、各レベルに「hallucination map」が生成され、ソフトセグメンテーションマスクの代わりとして機能し、ディープフェイクプロセスのこの重要な部分に対してより広い範囲の機能を作用させます。

hallucination mapの値が増加すると、アイデンティティ間のより明確なパスが現れます。
このように、スワッピングプロセスは単一のステージで実行され、ポストプロセッシングは不要です。
データとテスト
システムをテストするために、研究者は、2つの人気のあるオープン画像データセット(CelebA-HQとFFHQ)にモデルをトレーニングしました。各データセットには、30,000と70,000の画像が含まれています。
これらの基礎データセットに対して、プルーニングやフィルタリングは実行されませんでした。各ケースで、研究者は、3日間で単一のTesla GPUで、Adam最適化で学習率0.0002でデータセット全体をトレーニングしました。
次に、データセットに含まれる数千の個性の中からランダムにスワップをレンダリングし、顔が似ているか、性別が一致しているかどうかは考慮せず、CihaNetの結果を、4つの先行するディープフェイクフレームワーク(FaceSwap、FSGAN、SimSwap)の出力と比較しました。FaceSwapは、より人気のあるDeepFaceLabの代わりとして使用されました。両者は、ディープフェイクを可能にする根本的なコードを共有する、元の2017年のDeepfakesコードのフォークです。
結果をVGG-Face、FFHQ、CelebA-HQ、FaceForensics++を介して比較した著者は、新しいモデルがすべての先行モデルを上回ることを発見しました。以下の表に示されています。

結果を評価するために使用された3つのメトリックは、構造類似性(SSIM)、ポーズ推定エラー、ID抽出精度でした。後者は、成功したペアの抽出率に基づいて計算されます。
研究者は、CihaNetが、質的結果において優れたアプローチであり、ディープフェイク技術の現在の状態に対する著しい進歩であると主張しています。CihaNetは、広範囲にわたるマスキングアーキテクチャや方法論の負担を排除し、アイデンティティとコンテキストのより有用で実用的な分離を達成します。
以下に、さらに新しい技術のビデオ例をご覧ください。フルビデオはこちらで見ることができます。
新しい論文の補足資料から、CihaNetがさまざまなアイデンティティで顔スワップを実行しています。 ソース:https://mitchellx.github.io/#video














