Andersonの視点

ディズニー、CGIとニューラルレンダリングを組み合わせて「ア uncanny valley」を解決する

mm
Unite.AI を Google の優先ソースに追加

ディズニーのAI研究部門は、映画品質の顔シミュレーションを実現するためのハイブリッド方法を開発しました。この方法は、顔のニューラルレンダリングの強みと、CGIベースのアプローチの一貫性を組み合わせています。

まだ公開されていない論文のタイトルは、スタイルでレンダリング:伝統的なアプローチとニューラルアプローチを組み合わせた高品質の顔レンダリングです。この論文は、ディズニーリサーチのYouTubeチャンネルに公開された新しい10分間のビデオで紹介されています(この記事の最後に埋め込まれています*)。

メッシュとニューラル顔レンダリングを組み合わせたもの。ソース:https://www.youtube.com/watch?v=k-RKSGbWLng

メッシュとニューラル顔レンダリングを組み合わせたもの。記事の最後のビデオ埋め込みでより詳細な内容と品質を確認できます。 ソース:https://www.youtube.com/watch?v=k-RKSGbWLng(以降、https://www.youtube.com/watch?v=TwpLqTmvqVkに置き換えられました)

ビデオでは、顔のニューラルレンダリング(ディープフェイクを含む)が、CGIよりもリアルな目や口の中を生成できることが示されています。一方、CGI駆動の顔のテクスチャは、一貫性があり、映画レベルのVFX出力に適しています。

したがって、ディズニーは、NVIDIAのStyleGan2ニューラルジェネレーターを使用して、顔の周りの特徴や「生命の重要な」要素である目を処理し、CGI駆動の顔の皮膚や関連要素を出力に重ねることを試みています。

ビデオ(記事の最後にあります)から、ディズニーのハイブリッドアプローチの建築概念。『ローグ・ワン』(2016年)で若いキャリー・フィッシャーと故ピーター・カッシングを再現するために使用された旧来のCGIメッシュが、ニューラルレンダリングされた顔の環境に統合されています。

ビデオ(記事の最後にあります)から、ディズニーのハイブリッドアプローチの建築概念。『ローグ・ワン』(2016年)で若いキャリー・フィッシャーと故ピーター・カッシングを再現するために使用された旧来のCGIメッシュが、ニューラルレンダリングされた顔の環境に統合されています。

ビデオでは、ローグ・ワン(2016年)での故ピーター・カッシングのCGI再現の不自然さや「ア uncanny valley」効果について触れています。

「まだ、人が簡単にキャプチャしてレンダリングできるものと、最終的な写真レベルのデジタルダブルの間には、大きなギャップがあります。髪、目、口の中が完全なものです。このギャップを埋めるには、熟練したアーティストからの多大な手作業が必要です。」

実際、最新の顔キャプチャシステムでも、目、口の中、髪の毛を再現しようとしません。これらの技術には、目については本物らしさの問題、髪の毛については時間的一貫性の問題があります。

ビデオでは、VFXアーティストが典型的な現代の顔キャプチャセッション後に得られるものを示しています。目、髪、口の中はすべて、プロダクションパイプラインで別々のチームによって処理される必要があります。

ビデオでは、VFXアーティストが典型的な現代の顔キャプチャセッション後に得られるものを示しています。目、髪、口の中はすべて、プロダクションパイプラインで別々のチームによって処理される必要があります。また、テクスチャリングや照明も必要です。

照明制御

ハイブリッドアプローチは、照明の制御にも利点があります。CGI駆動の皮膚の重ね合わせは、より簡単に照明を変更できます。

CGI/ニューラルアプローチのアニメーション版。

CGI/ニューラルアプローチのアニメーション版。

より困難な環境、例えば外部の撮影では、研究者は、作成される人物を囲む「非武装地帯」の周囲にインペイントする方法を開発しました。

黒い余白が生成され、CGI皮膚を統合し、外部のアイデンティティをインペイントするための「キャンバス」を提供します。

黒い余白が生成され、CGI皮膚を統合し、外部のアイデンティティをインペイントするための「キャンバス」を提供します。

ビデオでは、

「ニューラルレンダリングは、背景の制約と完全に一致しません。目標は、人間のコンポーネントである髪、目、歯を最適化することです。より困難なのは、環境の照明を変更しながら、一貫したアイデンティティを維持することです。」

ニューラルレンダリングからCGIメッシュを作成する

研究チームは、3D顔画像の大量のデータベースで訓練されたバリアシオナルオートエンコーダーも開発しました。彼らは、これが「ランダムだが妥当な」3D顔メッシュを生成できることを主張しています。

この研究には、まだ克服すべき課題があります。例えば、ニューラルレンダリングで髪の毛を時間的に一貫性を持たせることが難しいことです。ビデオ(以下に示す)では、CGI/ニューラル顔の周りを回転させているにもかかわらず、髪の毛が急に変化する例が何度も示されています。

時間的一貫性は、ディズニーの問題だけでなく、ニューラルビデオレンダリング全体のより広範な問題です。将来的には、髪の毛を「ポストプロダクション」で追加するか、髪の毛生成に対して別のアプローチをとる可能性があります。

データセット生成への応用

この方法は、合成データを生成し、顔画像のセットの風景を豊かにするための潜在的な方法としても提案されています。顔画像のセットは、近年、危険なほど単調になりました。

ディズニーは、この新しい技術が顔画像データセットを充実させることを期待しています。

ディズニーは、この新しい技術が顔画像データセットを充実させることを期待しています。

「私たちが生成するすべての写真レベルの結果には、下にある幾何学的構造と外観マップがあり、既知の照明で知られているカメラの視点からレンダリングされます。この『グラウンドトゥルース』情報は、モノキュラーフェイス再構築、顔認識、シーン理解などのダウンストリームアプリケーションの訓練に重要です。したがって、各レンダリング結果はデータサンプルとみなすことができ、多くの異なる個人の多くのバリエーションを生成できます。」

「さらに、単一の人物を単一の表情、単一の視点、単一の照明でレンダリングする場合でも、最適化中にランダム化シードを変えることで、写真レベルのレンダリングのランダムなバリエーションを生成できます。」

研究者は、この出力の構成可能な多様性が、顔認識アプリケーションの訓練に役立つ可能性があると指摘しています。彼らは、

「私たちの方法は、顔の皮膚のキャプチャ、モデリング、レンダリングのための現在の技術を活用し、完全な写真レベルの顔レンダリングを自動的に生成できます。目標のアイデンティティ、表情、シーン構成に一致するものです。このアプローチは、映画やエンターテインメントのための顔レンダリングに適用できます。手動でアーティストの労力を節約し、さまざまな分野のディープラーニングのためのデータ生成にも役立ちます。」

この新しいアプローチの詳細については、今日公開された10分間のビデオをご覧ください。

* 元のビデオリンクは、記事が公開されてから8時間後に別のリンクに置き換えられました。元のビデオのリンクは残っていませんので、すべての関連リンクを変更しました。

 

8:24 GMT+2 – ビデオを置き換えました。ディズニーリサーチのYouTubeチャンネルで理由は不明ですが、ビデオが切り替えられました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai