Andersonの視点
リアルタイムAIヒューマンを実現するためのニューラルルミグラフレンダリング

現在、Neural Radiance Fields(NeRF)に対する関心が高まっていますが、この技術はAI生成の3D環境やオブジェクトを作成することができます。しかし、この画像合成技術はまだ多くのトレーニング時間が必要であり、リアルタイムのインターフェースを実現するための実装が不足しています。
しかし、業界と学術界の著名な人物による共同研究により、この課題に対する新しいアプローチ(一般的にNovel View Synthesis、またはNVSと呼ばれる)が提案されています。
研究論文「Neural Lumigraph Rendering」は、現状の技術よりも2桁の改善を主張しており、リアルタイムのCGレンダリングを実現するための重要なステップとなっています。

Neural Lumigraph Rendering(右)では、ブレンドアーティファクトの解像度が向上し、オクルージョンの処理が改善されています。 Source.
論文の著者はスタンフォード大学とホログラフィックディスプレイ技術会社のRaxium(現在はステルスモードで運営しています)のみですが、貢献者にはGoogleの機械学習アーキテクト、Adobeのコンピュータサイエンティスト、StoryFileのCTO(最近、ウィリアム・シャトナーのAIバージョンを作成したことで注目を集めています)が含まれています。
シャトナーのPR活動に関連して、StoryFileはNLRを使用して、個人の特徴や物語に基づいてインタラクティブなAIエンティティを作成するための新しいプロセスを採用しています。
StoryFileは、この技術を博物館の展示、オンラインインタラクティブ物語、ホログラフィックディスプレイ、拡張現実(AR)、文化遺産の記録に使用することを想定しています。また、NLRの新しい応用として、採用面接や仮想デートアプリケーションにも注目しています。

StoryFileのオンラインビデオから提案された使用例。 Source:https://www.youtube.com/watch?v=2K9J6q5DqRc
ノベルビューシンセシスインターフェースとビデオのためのボリュメトリックキャプチャ
ボリュメトリックキャプチャの原理は、被写体の静止画像またはビデオを取得し、機械学習を使用して、元のカメラアレイでカバーされていない視点を補間するというものです。

Source:https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf
上の画像(Facebookの2019年のAI研究から)は、ボリュメトリックキャプチャの4つの段階を示しています。複数のカメラで画像または映像を取得し、エンコーダー/デコーダーアーキテクチャ(またはその他のアーキテクチャ)で視点の相対性を計算して結合し、レームarchingアルゴリズムでボリュメトリック空間の各点のボクセル(またはその他のXYZ空間幾何単位)を計算し、最後にトレーニングして完全なエンティティを合成します。
これらの段階のうち、トレーニング段階が、ノベルビューシンセシスをリアルタイムまたは高レスポンスのキャプチャから遠ざけてきた主な要因です。
ノベルビューシンセシスはボリュメトリック空間の完全な3Dマップを作成するため、得られた点を伝統的なCGメッシュに簡単に接続して、CGヒューマン(またはその他の相対的に境界付けられたオブジェクト)をオンザフライでキャプチャおよびアーティキュレートできます。
NeRFを使用するアプローチは、ポイントクラウドと深度マップを使用して、キャプチャデバイスのスパースな視点間の補間を生成します。

NeRFは、CGメッシュの生成ではなく、深度マップの計算を通じてボリュメトリック深度を生成できます。 Source:https://www.youtube.com/watch?v=JuH79E8rdKc
NeRFはメッシュを計算できますが、ほとんどの実装ではボリュメトリックシーンを生成するためにこれを使用しません。
対照的に、Weizmann Institute of Scienceによって2020年10月に公開されたImplicit Differentiable Renderer(IDR)アプローチは、キャプチャアレイから自動的に生成される3Dメッシュ情報を利用します。

IDRキャプチャから生成されたインタラクティブなCGメッシュの例。 Source:https://www.youtube.com/watch?v=C55y7RhJ1fE
NeRFはIDRの形状推定能力を欠いていますが、IDRはNeRFの画像品質に匹敵できません。両者とも、トレーニングとデータの収集に多くのリソースを必要とします(ただし、NeRFの最近の進歩はこれを解決し始めています)。

NLRのカスタムカメラリグ。16台のGoPro HERO7と6台の中央のBack-Bone H7PROカメラで構成されています。リアルタイムレンダリングの場合、少なくとも60fpsで動作します。 Source:https://arxiv.org/pdf/2103.11571.pdf
代わりに、Neural Lumigraph Renderingは、SIREN(Sinusoidal Representation Networks)を使用して、各アプローチの長所を組み込んだ独自のフレームワークを提供し、リアルタイムグラフィクスパイプラインで直接使用可能な出力を生成することを目的としています。
SIRENは、過去1年間で類似の実装に使用されてきましたが、現在は画像合成コミュニティでのColabの一般的なAPI呼び出しとなっています。しかし、NLRの革新は、2次元のマルチビューアイメージの監視にSIRENを適用することです。これは、SIRENが一般化された出力ではなく過剰適合した出力を生成するため、問題があります。
CGメッシュがアレイ画像から抽出された後、メッシュはOpenGLを介してラスタライズされ、メッシュの頂点位置が適切なピクセルにマッピングされ、さまざまなマップのブレンドが計算されます。
結果として得られるメッシュは、NeRFのメッシュよりも一般化され、表現力が高く、計算量が少なく、細かい詳細を必要としない領域(たとえば、滑らかな顔の皮膚)に過剰な詳細を適用しません。
ネガティブな面では、NLRはまだ動的照明やリライトの機能を持っていません。出力は、キャプチャ時点でのシャドウマップやその他の照明条件に限定されます。研究者は、これを将来の研究で解決することを計画しています。
さらに、論文は、NLRによって生成される形状は、Pixelwise View Selection for Unstructured Multi-View StereoやWeizmann Instituteの研究などの代替アプローチほど正確ではないことを認めています。
ボリュメトリック画像合成の台頭
限られた数の写真から3Dエンティティを生成するためのニューラルネットワークの使用は、NeRF以前から存在します。2007年以前から、先駆的な研究が存在します。2019年、FacebookのAI研究部門は、Neural Volumes:Learning Dynamic Renderable Volumes from Imagesという研究論文を発表し、機械学習ベースのボリュメトリックキャプチャによって生成された合成ヒューマンに対するレスポンシブなインターフェースの作成を可能にしました。

Facebookの2019年の研究により、ボリュメトリックキャプチャによって生成された合成ヒューマンに対するレスポンシブなユーザーインターフェースが可能になりました。 Source:https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/













