Andersonの視点
RigNeRF:Neural Radiance Fieldsを使用する新しいDeepfakes方法

Adobeで開発された新しい研究により、Neural Radiance Fields(NeRF)に基づく初の実用的なDeepfakes方法が提供されました。これは、2017年にDeepfakesが登場してから5年間で初めてのアーキテクチャまたはアプローチの真正な革新です。
この方法は、RigNeRFと呼ばれ、3Dモーファブルフェイスモデル(3DMMs)を、望ましい入力(つまり、NeRFレンダリングに組み込むアイデンティティ)とニューラル空間の間の中間層として使用します。この方法は、最近のGenerative Adversarial Network(GAN)フェイスシンセシスアプローチで広く採用されていますが、まだ機能的で有用なフェイス置換フレームワークを提供することができません。

伝統的なDeepfakeビデオとは異なり、ここに描かれている動くコンテンツは一切「リアル」ではありません。むしろ、簡単な映像でトレーニングされた探索可能なニューラル空間です。右側では、3Dモーファブルフェイスモデル(3DMM)が、望ましい操作(「笑う」、「左を見る」、「上を見る」など)と、通常は扱いにくいNeural Radiance Fieldビジュアライゼーションのパラメータの間のインターフェイスとして作用する様子が見られます。高解像度バージョンのクリップやその他の例については、プロジェクトページまたはこの記事の末尾の埋め込みビデオを参照してください。ソース:https://shahrukhathar.github.io/2022/06/06/RigNeRF.html
3DMMは、基本的にCGIのフェイスモデルであり、そのパラメータを、NeRFやGANなどの抽象的なイメージシンセシスシステムに適応させることができます。これらのシステムは、制御が難しいと考えられています。
上記の画像(真ん中の男、青いシャツ)や、すぐ下の画像(左の男、青いシャツ)では、実際のビデオに「フェイク」のフェイスを重ねたものではなく、ボリューメトリックニューラルレンダリングとして存在する完全に合成されたシーンが見られます。背景や体も含みます。

上の例では、右側の実際のビデオ(赤いドレスの女)が、左側のキャプチャされたアイデンティティ(青いシャツの男)をRigNeRFで「操縦」しています。著者は、これが、NeRFベースのシステムで、ポーズと表情の分離を実現し、新しいビューのシンセシスを実行できる最初のシステムであると主張しています。
上の画像の左側の男性は、70秒のスマートフォンビデオから「キャプチャ」され、入力データ(シーン情報を含む)が4つのV100 GPUでトレーニングされてシーンが取得されました。
3DMMスタイルのパラメトリックリグも、全身パラメトリックCGIプロキシ(フェイスリグではなく)として利用可能であるため、RigNeRFは、リアルな人間の動き、テクスチャ、表情をパラメトリックレイヤーに渡し、行動や表情をNeRF環境やビデオにレンダリングする、フルボディDeepfakesの可能性を解放します。
RigNeRFは、現在の意味でDeepfakes方法としての資格があるのでしょうか?それとも、DeepFaceLabや他の2017年以降のオートエンコーダDeepfakesシステムと同様に、半ばハンディキャップのある別のシステムなのでしょうか?
新しい論文の研究者は、この点について明確です。
‘顔の再アニメ化が可能な方法であるため、RigNeRFは、悪意のある行為者によってDeepfakesを生成するために悪用される可能性があります。’
新しい論文は、RigNeRF:完全に制御可能なニューラル3Dポートレートと題され、Stonybrook大学のShahRukh AthaとAdobe Researchの4人の著者によって書かれました。
オートエンコーダベースのDeepfakesを超えて
過去数年間に注目を集めたほとんどのDeepfakesは、オートエンコーダベースのシステムによって生成されています。これらのシステムは、2017年にr/deepfakesサブレディットで公開されたコードから派生しています。ただし、コードはすぐにコピーされ、GitHubにフォークされ、現在では1000回以上フォークされています。特に、DeepFaceLabやFaceSwapプロジェクトで広く使用されています。
GANやNeRFのフレームワークも、3DMMを「ガイドライン」として使用し、改善されたフェイスシンセシスフレームワークを実験してきました。2017年以降のオートエンコーダDeepfakesシステムも同様です。2021年7月のHifiFaceプロジェクトがその例です。しかし、これらのアプローチから機能的なイニシアチブはまだ開発されていません。
RigNeRFのデータは、短いスマートフォンビデオをキャプチャすることで取得されます。プロジェクトでは、すべての実験でiPhone XRまたはiPhone 12を使用しました。キャプチャの最初の半分では、被写体は頭を静かに保ったまま、カメラを周囲に動かしながら、幅広いフェイス表情や話し声を行います。
キャプチャの後半では、カメラは固定された位置を保ち、被写体は頭を動かしながら幅広い表情を示します。結果として得られる40〜70秒の映像(約1200〜2100フレーム)は、モデルをトレーニングするために使用されるデータセットを表します。
データ収集の削減
一方、DeepFaceLabのようなオートエンコーダシステムでは、多数の多様な写真を収集してキュレーションする必要があります。これらの写真は、YouTubeビデオやその他のソーシャルメディアチャンネル、映画(有名人のDeepfakesの場合)から取得されます。
トレーニングされたオートエンコーダモデルは、多くの場合、さまざまな状況で使用することを目的としています。ただし、最も精巧な「有名人」Deepfakes作成者は、1つのビデオに対してモデルを最初からトレーニングすることがあります。トレーニングには1週間以上かかることがあります。
新しい研究の警告にもかかわらず、AIポルノや人気のあるYouTube/TikTok「Deepfakesリキャスト」に使用されるパッチワークで構成されたデータセットは、シーン固有の方法論を使用するRigNeRFシステムで受け入れられる結果を生み出す可能性は低いと考えられます。新しい研究で概説されているデータ収集の制限により、これはある程度の悪用防止策となる可能性があります。
NeRFをDeepfakeビデオに適応させる
NeRFは、写真測量法に基づく方法であり、さまざまな視点からの少数のソース画像が組み合わせて探索可能な3Dニューラル空間を作成します。このアプローチは、NVIDIAがそのInstant NeRFシステムを発表したときに注目されました。Instant NeRFは、NeRFのトレーニング時間を数分または数秒に短縮できます。

Instant NeRF。 ソース:https://www.youtube.com/watch?v=DJ2hcC1orc4
結果として得られるNeural Radiance Fieldシーンは、基本的に静的な環境であり、探索は可能ですが、編集は困難です。研究者は、2つの前のNeRFベースのイニシアチブ、HyperNeRF + E/PとNerFACEが、フェイスビデオシンセシスに挑戦したと指摘しています。RigNeRFは、これらの2つのフレームワークと比較してテストラウンドに参加しています。


RigNeRF、HyperNeRF、NerFACEの質的比較。ソースビデオやPDFのリンクから、高品質バージョンを参照してください。静止画像ソース:https://arxiv.org/pdf/2012.03065.pdf
しかし、この場合、RigNeRFを支持する結果は、2つの理由で異常です。まず、著者は「リンゴとリンゴの比較はない」と述べています。2つ目は、RigNeRFの機能を、より制限的な先行システムの機能と一致させるために制限する必要があったためです。
結果は、先行研究に対する漸進的な改善ではなく、NeRFの編集可能性と有用性における「ブレークスルー」を表しているため、テストラウンドを省略し、RigNeRFが先行システムと異なる点を見ていきます。
組み合わせた強み
NerFACEの主な制限は、静的なカメラで撮影されたソース映像を前提としていることです。これにより、キャプチャの制限を超える新しいビューを生成することができません。これにより、移動するポートレートを作成できるシステムが作成されますが、Deepfakesスタイルのビデオには適していません。
一方、HyperNeRFは、新しいビューを生成できますが、頭のポーズやフェイス表情を変更するための手段がないため、オートエンコーダベースのDeepfakesの代替品にはなりません。
RigNeRFは、3DMMモジュールからの入力によって、デフォルトの基準線「正典空間」を作成することで、これらの2つの分離された機能を組み合わせます。

ポーズや表情がない「正典空間」を作成し、3DMMによって生成された変形(ポーズや表情)が作用するようにします。
3DMMシステムは、キャプチャされた被写体と完全に一致しない可能性があるため、このプロセスでこれを補償することが重要です。RigNeRFは、ソース映像から得られるマルチレイヤーパーセプトロン(MLP)から導かれる変形フィールドの事前知識を使用してこれを実現します。

変形を計算するために必要なカメラパラメータは、COLMAPから取得され、各フレームの表情と形状パラメータは、DECAから取得されます。
位置は、ランドマークフィッティングとCOLMAPのカメラパラメータを使用してさらに最適化され、ハードウェアの制限により、ビデオ出力はトレーニングのために256×256解像度にダウンサンプリングされます(オートエンコーダDeepfakesシーンでも見られるハードウェア制限による縮小プロセス)。
その後、変形ネットワークは4つのV100でトレーニングされます。これは、カジュアルな愛好家の手には負えないほど強力なハードウェアです(ただし、マシンラーニングのトレーニングでは、ハードウェアの代わりに時間をトレードすることができ、モデルトレーニングが数日または数週間になる可能性があります)。
結論として、研究者は述べています。
‘他の方法とは異なり、RigNeRFは、3DMMガイド付きの変形モジュールを使用することで、頭のポーズ、フェイス表情、全体の3Dポートレートシーンを高忠実度でモデル化し、鋭い詳細で再構築することができます。’
詳細と結果の映像については、以下の埋め込みビデオを参照してください。
初版は2022年6月15日に公開されました。












