Andersonの視点

ディープフェイクの次の革命はディセンタングルメントである

mm
Unite.AI を Google の優先ソースに追加

CGIデータ増強は、新しいプロジェクトでディープフェイク画像のより大きな制御を得るために使用されている。まだ、CGIヘッドを使用してディープフェイクの顔データセットの不足しているギャップを埋めることはできないが、アイデンティティとコンテキストを分離する研究の新しい波により、すぐにその必要性がなくなりそうである。

過去数年の最も成功したディープフェイク動画の作者は、ソース動画を慎重に選択し、持続的なプロファイルショット(警察の逮捕手続きで普及したサイドビューのマグショット)、鋭い角度、または不通常または誇張された表情を避ける。最近のディープフェイクデモ動画は、編集されたコンピレーションで、ディープフェイク化しやすい角度と表情を選択することが増えている。

実際、ディープフェイク化するためのターゲット動画として最も適しているのは、オリジナルの人物(ディープフェイクによってそのアイデンティティが消去される)がカメラに向かって直視し、表情の範囲が最小限である動画である。

最近のディープフェイクの多くは、被写体がカメラに向かって直視し、笑ったり(スマイルしたり)、または(2019年のシルベスター・スタローンのターミネーターのように)全く表情がないことを示している。中立的な表情は非常に一般的で、ディープフェイクモデルに簡単に組み込むことができるためである。

最近のディープフェイクの多くは、被写体がカメラに向かって直視し、笑ったり(スマイルしたり)、または(2019年のシルベスター・スタローンのターミネーターのように)全く表情がないことを示している。中立的な表情は非常に一般的で、ディープフェイクモデルに簡単に組み込むことができるためである。

ディープフェイク技術であるDeepFaceLabやFaceSwapは、これらの単純なスワップを非常にうまく行うため、私たちは彼らが達成することによって目をくらまし、達成できないことを気づかないでいる。さらに、達成できないことを試みることもない。

アーノルド・シュワルツェネッガーがシルベスター・スタローンに変身するディープフェイク動画からのグラブ。プロファイルは、ディープフェイクアプローチの持続的な問題である。ディープフェイクフレームワークで使用されるオープンソースソフトウェアはサイドビューに最適化されていないため、一方で、必要なデータセットのいずれか、または両方に適切なソースマテリアルが不足しているためである。

アーノルド・シュワルツェネッガーがシルベスター・スタローンに変身するディープフェイク動画からのグラブ。プロファイルは、ディープフェイクアプローチの持続的な問題である。ディープフェイクフレームワークで使用されるオープンソースソフトウェアはサイドビューに最適化されていないため、一方で、必要なデータセットのいずれか、または両方に適切なソースマテリアルが不足しているためである。

新しい研究は、シンセティックデータ(例:CGIヘッド)を使用してディープフェイクを2020年代に持ち込むための新しい方法を提案している。これは、ディープフェイク画像の生成のための基本的な枠組みを提供する、アイデンティティとコンテキストの分離を実現するものである。

新しいシステムは、アイデンティティのエンコードからポーズとコンテキスト(例:目をつぶる)を離れて分離する。上段では、バラク・オバマのアイデンティティにウィンクを転送する。下段では、元大統領の口元を引き伸ばす。右下では、両方の特徴を同時に適用する。

新しいシステムは、アイデンティティのエンコードからポーズとコンテキスト(例:目をつぶる)を離れて分離する。上段では、バラク・オバマのアイデンティティにウィンクを転送する。下段では、元大統領の口元を引き伸ばす。右下では、両方の特徴を同時に適用する。

これは、ディープフェイクのヘッドパペットと呼ばれる技術とは異なるものである。これは、アバターや部分的な顔のlip-synchingに適しているが、フルフェイスのディープフェイク動画変換には限界がある。

これは、むしろ、アイデンティティとコンテキストを分離する方法を提供するものである。これは、高レベルの画像合成ベースのディープフェイクフレームワークへの道を開くものである。

新しい論文は、Delta-GAN-Encoder:明示的な画像編集のためのセマンティック変更のエンコード、少数のシンセティックサンプルを使用と題され、Technion – Israel Institute of Technologyの研究者によって提出された。

ディープフェイクが現在どのように生成されるかを理解するために、ディープフェイクポルノサイトからIndustrial Light and Magicまで、DeepFaceLabのオープンソースリポジトリが現在どのように使用されているかを見てみましょう。

現在のディープフェイク技術が妨げられているものは何か

ディープフェイクは現在、エンコーダ/デコーダマシンラーニングモデルを、2つの顔画像のフォルダ(「ペイントオーバー」したい人物と、代入したい人物)でトレーニングすることによって生成される。

2つの顔セットの異なるポーズと照明条件の例。列Aの3行目の最後の表情は、他のデータセットに近いものがないため、ディープフェイクモデルをトレーニングする際に問題となる。

2つの顔セットの異なるポーズと照明条件の例。列Aの3行目の最後の表情は、他のデータセットに近いものがないため、ディープフェイクモデルをトレーニングする際に問題となる。

エンコーダ/デコーダシステムは、各フォルダ内のすべての画像を比較し、繰り返し処理を何百万回も繰り返し、両方のアイデンティティの基本的な特徴を十分に理解するまでトレーニングする。

ディープフェイクアーキテクチャが、各アイデンティティについて学習するアイデンティティは、コンテキストと結びついている。特定のポーズについて、すべてのアイデンティティに対して一般的な原則を学習して適用することはできない。各アイデンティティが関与するすべてのポーズ/アイデンティティについて、トレーニングデータセットに多くのインスタンスが必要である。

ディープフェイクモデルをDeepFaceLabのようなシステムでトレーニングするには、2つの顔データセット間で広範な表現、頭のポーズ、照明のパリティが必要である。特定の構成(例:サイドビュー/笑顔/日光)が両方の顔セットに表示されない場合、その構成はディープフェイク動画で正確にレンダリングされない。

ディープフェイクモデルをDeepFaceLabのようなシステムでトレーニングするには、2つの顔データセット間で広範な表現、頭のポーズ、照明のパリティが必要である。特定の構成(例:サイドビュー/笑顔/日光)が両方の顔セットに表示されない場合、その構成はディープフェイク動画で正確にレンダリングされない。

セットAに不通常のポーズが含まれているが、セットBにそのポーズがない場合、トレーニングしたとしても、モデルはそのポーズを再現することはできない。トレーニング時に必要な情報が半分しかなかったためである。

セットAにマッチングポーズがあるが、セットBの同等のポーズがハードなサイドライトで照らされている場合、スワップの品質は同じポーズのフラットな照明条件の場合と同じではない。

データが不足している理由

あなたは、たぶん、自分自身のサイドプロファイルの写真を持っていない。もし持っていたとしても、捨ててしまったに違いない。写真機関も同様で、プロファイルの顔写真は入手困難である。

ディープフェイカーは、サイドビューのプロファイルデータが不足している場合、トレーニング中に少しでも注目されるように、顔セットに複数のコピーを含めることがある。

しかし、ディープフェイク動画で使用できるサイドビューの顔の写真の種類は、実際に利用可能なものよりも多く存在する。例えば、笑顔不機嫌な顔叫んでいる顔泣き顔暗い照明軽蔑的な顔退屈な顔陽気な顔フラッシュ照明上を見ている顔下を見ている顔目が開いている顔目が閉じている顔…などである。これらのポーズは、さまざまな組み合わせで、ディープフェイク動画で必要になるかもしれない。

そして、これはプロファイルだけの話である。自分自身が上を見ている写真は何枚持っているだろうか。自分自身が特定のポーズで、特定のカメラ角度から、10,000種類の表情を示している写真を持っているだろうか。少なくとも、1,000,000種類の照明環境のうち何らかをカバーしているだろうか。

おそらく、あなたは、自分自身が上を見ている写真を持っていない。上向きのポーズだけでも、必要なカバレッジを得るために100以上の写真が必要である。

シンセティック代替

ディープフェイクの黎明期から、ディープフェイカーは、CGIスタイルの画像、Cinema4DやMayaのような3Dアプリケーションで作成されたヘッドを使用して、「不足している」ポーズを生成することを試みてきた。

伝統的なCGIプログラムCinema 4Dで作成された女優の3Dモデル。1960年代から存在する技術だが、1990年代から広く使用されるようになった。このフェイスモデルは、不通常のポーズ、照明スタイル、表情のディープフェイクソースデータを生成するために使用できる。

伝統的なCGIプログラムCinema 4Dで作成された女優の3Dモデル。1960年代から存在する技術だが、1990年代から広く使用されるようになった。このフェイスモデルは、不通常のポーズ、照明スタイル、表情のディープフェイクソースデータを生成するために使用できる。

しかし、この方法は、ディープフェイクの初心者によって早期に放棄されることが多い。CGIヘッドは、他の方法では入手できないポーズや表情を提供できるが、合成された外見がディープフェイクに影響を与えることが多いからである。

これにより、ディープフェイク動画の中で、突然「不気味な谷」のような顔が現れることがある。アルゴリズムは、不通常のポーズや表情に対する唯一のデータである、明らかに偽の顔を使用するからである。

オーストラリアの女優マーゴット・ロビーの3Dディープフェイクアルゴリズムは、DeepFaceLiveのデフォルトインストールに含まれている。ディープフェイクデータセットで「不足している」不通常のポーズを取得するために、CGIバージョンを使用できる。

オーストラリアの女優マーゴット・ロビーの3Dディープフェイクアルゴリズムは、DeepFaceLiveのデフォルトインストールに含まれている。ディープフェイクデータセットで「不足している」不通常のポーズを取得するために、CGIバージョンを使用できる。

CGIフェイスを切り離された概念ガイドラインとして

代わりに、イスラエルの研究者によって提案された新しいDelta-GANエンコーダー(DGE)方法は、より効果的である。CGI画像からのポーズとコンテキスト情報が、ターゲットの「アイデンティティ」情報から完全に分離されているからである。

以下の画像で、この原理を実際に確認することができる。さまざまな頭の向きが、CGI画像をガイドラインとして使用することで得られている。アイデンティティ特性は、コンテキスト特性とは無関係であるため、CGIフェイスの合成外見やアイデンティティの「出血」はない。

新しい方法では、ディープフェイクの複数の角度から3つの別々の実写画像を見つける必要はない。CGIヘッドを回転させるだけでよい。抽象的な特徴は、アイデンティティに影響を与えることなく、アイデンティティに課せられる。

新しい方法では、ディープフェイクの複数の角度から3つの別々の実写画像を見つける必要はない。CGIヘッドを回転させるだけでよい。抽象的な特徴は、アイデンティティに影響を与えることなく、アイデンティティに課せられる。

Delta-GAN-Encoder。上段左:ソース画像の角度を変更して新しいソース画像をレンダリングする。上段右:照明もアイデンティティから分離され、照明スタイルの重ね合わせが可能になる。下段左:複数の顔の詳細を変更して「悲しい」表情を作る。下段右:1つの顔の詳細を変更して、目を細める。

Delta-GAN-Encoder。上段左:ソース画像の角度を変更して新しいソース画像をレンダリングする。上段右:照明もアイデンティティから分離され、照明スタイルの重ね合わせが可能になる。下段左:複数の顔の詳細を変更して「悲しい」表情を作る。下段右:1つの顔の詳細を変更して、目を細める。

このアイデンティティとコンテキストの分離は、トレーニング段階で実現される。新しいディープフェイクアーキテクチャのパイプラインは、変換される画像にマッチする、事前にトレーニングされたGenerative Adversarial Network(GAN)の潜在的なベクトルを探索する。Sim2Real方法論は、2018年のIBMのAI研究部門からのプロジェクトに基づいている。

研究者は以下のように述べている:

‘わずか数サンプルで、特定の属性で異なるサンプルを使用して、事前トレーニングされたエントanglled生成モデルの中で分離された動作を学習することができる。実世界のサンプルを正確に取得する必要はない。非現実的なデータサンプルを使用して、同じ目標を達成することができる。既存のデータサンプルに望ましい変更を加えることができる。潜在的なベクトルの明示的な動作の探索は不要である。’

研究者は、このプロジェクトで探求されたディセンタングルメントの核心原理が、インテリアアーキテクチャシミュレーションなどの他のドメインに転用できる可能性があると予想している。また、Delta-GAN-Encoderに採用されたSim2Real方法は、最終的に、CGIスタイルの入力ではなく、単なるスケッチに基づいてディープフェイクのインストルメンタリティを可能にするだろう。

新しいイスラエルのシステムがどの程度ディープフェイク動画を合成できるかは、重要ではない。重要なのは、アイデンティティとコンテキストを分離することで、GANの潜在的な空間に対するより大きな制御を獲得したことである。

ディセンタングルメントは、画像合成における活発な研究分野である。2021年1月には、Amazonが主導する研究論文が、同様のポーズ制御とディセンタングルメントを実証し、2018年には、中国科学院の深圳先進技術研究所からの論文が、GANにおける任意の視点の生成に進展を遂げた。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai