Andersonの視点
ディズニー、CGIとニューラルレンダリングを組み合わせて『不気味の谷』に挑む

ディズニーのAI研究部門は、映画品質の顔シミュレーション向けにハイブリッド手法を開発しました。この手法は、顔のニューラルレンダリングの強みと、CGIベースのアプローチの一貫性を組み合わせたものです。
現在査読中の論文タイトルは Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering で、ディズニーリサーチのYouTubeチャンネルに掲載された新しい10分間の動画でプレビューできます(この記事の末尾に埋め込み*)。

ニューラル顔レンダリングと組み合わせたメッシュ。記事末尾の動画埋め込みで詳細と品質を確認してください。 ソース: https://www.youtube.com/watch?v=TwpLqTmvqVk
動画が指摘しているように、ニューラル顔レンダリング(ディープフェイクを含む)は、CGI が実現できる範囲をはるかに超えて、よりリアルな目や口腔内部を生成できます。一方、CGI 主導の顔テクスチャは一貫性が高く、映画レベルのVFX出力に適しています。
そのため、ディズニーはNVIDIAのStyleGan2ニューラルジェネレーターに顔の周辺特徴や目などの『生命に関わる』要素を処理させ、出力に一貫したCGIの顔皮膚や関連要素を重ね合わせる実験を行っています。

動画(記事末尾参照)から、ディズニーのハイブリッド手法の構造概念を示しています。古典的なCGIメッシュ(『Rogue One』(2016)で若いキャリー・フィッシャーや故ピーター・カッシングを再現する際に使用されたタイプ)が、ニューラルレンダリングされた顔環境に統合されています。
動画は、故英国の『スター・ウォーズ』俳優ピーター・カッシングを『Rogue One』(2016)でCGI再現した際の不自然さと『不気味の谷』効果に対する頻繁な批判に暗黙の言及を行い、次のように認めています。
『[まだ] 人々が簡単にキャプチャしてレンダリングできるものと、髪や目、口腔内部まで含む最終的なフォトリアリスティックなデジタルダブルとの間には大きなギャップがあります。このギャップを埋めるには、熟練したアーティストによる多くの手作業が通常必要です。』
実際、最新の顔キャプチャシステムでさえ、目や口腔内部、髪の再現には取り組んでおらず、これらはそれぞれ技術上の真正性の問題(目)や時間的一貫性の問題(髪)を抱えています。

動画は、典型的な最新の顔キャプチャセッション後にVFXアーティストが得るものを示しています。目、髪、顔の毛、口腔内部はすべて制作パイプラインで別々のチームが処理する必要があります。
照明制御
ハイブリッド手法は、リライティングにおいても利点があります。顔のニューラルレンダリングではリライティングが大きな課題ですが、CGIの皮膚を重ね合わせることで比較的容易にリライトできます。

CGI/ニューラル手法のアニメーションバージョン。
屋外撮影など、より困難な環境では、研究者らは「作成対象」の周囲に無兵地帯のような領域を設け、そこをインペインティングする手法を開発しました。

黒い余白が生成され、身元の外側部分をインペインティングし、CGIの皮膚を統合されたCGI/ニューラル出力に組み込むための『キャンバス』となります。
動画は次のように述べています:
『[ニューラル] レンダリングは背景の制約と完全には合致しません――それはあくまでガイドとしての位置付けであり、髪や目、歯といったリアルな人間要素の最適化が主目的です。環境光を変えつつ、一貫したアイデンティティを保つことがより難しい課題です。』
ニューラルレンダリングからCGIメッシュを作成する
研究チームは、(未公開の)大規模な3D顔画像データベースで訓練された変分オートエンコーダーも開発し、実データから「ランダムだが妥当」な3D顔メッシュを生成できると主張しています。
この研究には克服すべき制限があり、特にニューラルレンダリングにおいて髪を時間的に一貫させることが難しい点があります。以下の動画(下記参照)では、CGI/ニューラル顔を回転させた際に髪が急速に変化する例がいくつか示されています。
ニューラル動画レンダリングにおける時間的一貫性はディズニーだけの問題ではなく、今後のシステム改良では髪を「ポストプロセス」で追加したり、さまざまな髪生成手法を検討する可能性が高いと考えられます。
データセット生成への活用
この手法は、合成データ生成の潜在的手段としても提案されており、近年危険なほど単調化している顔画像セットの多様化に貢献します。

ディズニーは新技術が顔画像データセットを充実させることを想定しています。
『[すべての] フォトリアリスティックな結果は、未知のカメラ視点から既知の照明条件でレンダリングされた基礎的なジオメトリと外観マップを伴います。この「グラウンドトゥルース」情報は、単眼3D顔再構築、顔認識、シーン理解などの下流アプリケーションのトレーニングに極めて重要です。したがって、各結果のレンダリングはデータサンプルとみなすことができ、さまざまな個人の多数のバリエーションを生成できます。』
『さらに、単一人物を単一表情・単一視点・単一照明でレンダリングした場合でも、最適化中にランダムシードを変えることでフォトリアルなレンダリングのランダムなバリエーションを生成できます。』
研究者は、この設定可能な出力の多様性が顔認識アプリケーションのトレーニングに有用である可能性があると指摘し、次のように結論付けています。
『[我々の] 手法は、現在の顔皮膚キャプチャ、モデリング、レンダリング技術を活用し、望むアイデンティティ、表情、シーン構成に合致した完全なフォトリアリスティック顔レンダリングを自動的に生成できます。このアプローチは、映画・エンターテインメント向けの顔レンダリングに応用でき、アーティストの手作業を削減するとともに、ディープラーニングの様々な分野でのデータ生成にも利用できます。』
新手法の詳細を見るには、本日公開された10分間の動画をご覧ください:
* 本記事が公開された8時間後に、元の動画リンクは別の見た目上同一のリンクに差し替えられました。元動画の痕跡が残っていないため、すべての関連リンクを変更しました。
8:24 GMT+2 – 動画がディズニーリサーチのYouTubeチャンネルにより何らかの理由で差し替えられたため、動画を置き換えました。












