Andersonの視点

フルボディディープフェイクの作成方法:複数のNeRFを組み合わせる

mm
Unite.AI を Google の優先ソースに追加

画像合成研究分野は、若い人、特に若い女性を様々な衣装で映したフルボディのビデオや画像を作成することができるシステムの新しい提案で溢れています。生成された画像はほとんどが静的なもので、時々動くものもありますが、うまく動くものは少ないです。

この研究分野の進歩のペースは、潜在的拡散モデルなどの関連分野の現在の進歩に比べて非常に遅いです。しかし、アジアを中心とする研究グループは、この問題にしつこく取り組んでいます。

過去10〜15年間に提案されたまたは半導入された「バーチャルトライオン」システムの1つ。機械学習ベースのオブジェクト認識を使用して、体を評価し、提案された衣類に適応させます。出典:https://www.youtube.com/watch?v=2ZXrgGyhbak

過去10〜15年間に提案されたまたは半導入された「バーチャルトライオン」システムの1つ。機械学習ベースのオブジェクト認識を使用して、体を評価し、提案された衣類に適応させます。出典:https://www.youtube.com/watch?v=2ZXrgGyhbak

目標は、ファッションと衣類市場向けの「バーチャルトライオン」システムを作成することです。顧客と現在利用可能またはリリース予定の製品に適応できるシステムを作成することが目標です。リアルタイムのオーバーレイや、顧客に少しNSFWな写真を送ることを要求するMLベースのレンダリングパイプラインの必要性なしに、システムを作成することが目標です。

人気のある合成アーキテクチャは、このタスクに簡単に適応できないようです。生成的な敵対的ネットワーク(GAN)の潜在的な空間は、説得力のある時間的動き(または一般的な編集)の生成に適していません。Neural Radiance Fields(NeRF)は、リアルな人間の動きを生成することができますが、編集に必要な種類の編集には通常抵抗しています。オートエンコーダーは、人や衣類に特化した訓練が必要です。潜在的拡散モデルは、GANと同様に、ネイティブの時間的メカニズムが欠けています。

EVA3D

EVA3Dは、シンガポールのナンヤン工科大学から提出されたもので、長い間待ち望まれたアプローチの最初の兆しです。多くのNeural Radiance Fieldネットワークを使用し、それぞれが体の別の部分に専念し、最終的に統合された視覚化を作成します。

EVA3Dのための複数のNeRFネットワークから合成された若い女性。出典:https://hongfz16.github.io/projects/EVA3D.html

EVA3Dのための複数のNeRFネットワークから合成された若い女性。出典:https://hongfz16.github.io/projects/EVA3D.html

結果は、動きの点で見ると、まあまあです。EVA3Dの視覚化は、アンカニー・バレーから出ることはできませんが、少なくとも出口が見えます。

EVA3Dが優れているのは、フルボディイメージ合成の分野でほとんど見られない、人間のフルボディ生成の編集と柔軟性が、1つのネットワーク(GAN、NeRF、またはその他)だけでは、数年間は実現できないことを認識していることです。研究者たちは、16のネットワークと複数の技術を使用してタスクを細分化しました。これは、都市環境のニューラルレンダリングで既に採用されているアプローチです。

このアプローチは、2021年のA-NeRFと概念的に関連していますが、根本的に異なります。A-NeRFは、NeRF表現に内部制御スケルトンを追加し、体のさまざまな部分に必要に応じて処理リソースを割り当てることをより困難にしました。

方法

SMPLモデルは、EVA3Dによって「ボラントリ」と呼ばれる人物の「先行」に合わせて調整されています。SMPLのスキニング重みは、規範的な空間(つまり、SMPLモデルの「休息」または「中立」のポーズ)と最終的な外観のレンダリングの違いを調整します。

EVA3Dの概念ワークフロー。出典:https://arxiv.org/pdf/2210.04888.pdf

EVA3Dの概念ワークフロー。出典:https://arxiv.org/pdf/2210.04888.pdf

上の図のように、SMPLの境界ボックスは、最終的に体を構成する16のネットワークの境界定義として使用されます。SMPLの逆線形ブレンドスキニング(LBS)アルゴリズムは、可視化されたサンプルされたレイを、規範的な(受動的な)空間に転送するために使用されます。次に、16のサブネットワークは、これらの構成に基づいて照会され、最終的に最終的なレンダリングに適合させられます。

データ、トレーニング、テスト

EVA3Dは、ファッションベースのデータセットの限界とテンプレート化されたスタイルのポーズの可用性の問題に直面しています。これらのデータセットは、代替または新しいビューが不足しており、衣類ではなく人間を着せたことに焦点を当てているため、繰り返しになります。

この不均衡なポーズの分布のため、EVA3Dは、SMPLテンプレート幾何学に基づく人間の「先行」を使用し、ターゲットポーズではなく、ポーズのサイン付き距離フィールド(SDF)オフセットを予測します。

実験のために、研究者は4つのデータセットを使用しました:DeepFashion、SHHQ、UBCFashion、およびAIST Dance Video Database(AIST Dance DB)。

後者の2つには、最初の2つよりも多様なポーズがありますが、同じ個人が繰り返し表現されているため、この多様性は相殺されます。つまり、データは課題的です。

ベースラインとして使用されたのは、ENARF-GAN、StanfordとNVIDIA (NVDA ) のEG3D、StyleSDFでした。これらの方法は、ネイティブから高解像度にスケールアップするために、スーパーリゾリューションライブラリを必要とします。

採用されたメトリックは、Frechet Inception Distance(FID)とKernel Inception Distance(KID)でした。

(ADBE )

量的評価では、EVA3Dは4つのデータセットすべてでメトリックをリードしました。

量的結果。

量的結果。

研究者は、EVA3Dが幾何学的レンダリングのエラー率が最も低いことを観察しました。これは、このようなプロジェクトでは重要な要素です。さらに、彼らのシステムは生成されたポーズを制御し、EG3Dよりも高いPCKh@0.5スコアを達成しました。

最初に公開:2022年10月12日。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai