Andersonの視点
ニューラル・ラディエンス・フィールドのリライティング環境マップ

新しい論文は、マックス・プランク研究所とMITによって提案された、Neural Radiance Fields (NeRF) のコンテンツから、データが収集されたときの照明を分離する技術を提案しています。これにより、アドホック 環境マップを使用して、NeRF シーンの照明を完全に切り替えることができます。

新しい技術が実データに適用された例。注目すべきは、この方法がこのタイプのアーカイブデータに適用できることです。このデータは、当初、ノベルなパイプラインを考慮していなかったためです。にもかかわらず、リアルなユーザー指定の照明制御が得られます。 ソース:https://arxiv.org/pdf/2207.13607.pdf
新しいアプローチでは、人気のオープンソース 3D アニメーション プログラム Blender を使用して、仮想の照明ステージを作成します。ここで、さまざまな照明シナリオの多数のイテレーションがレンダリングされ、最終的に NeRF モデル内の特殊なレイヤーにトレーニングされ、ユーザーがシーンを照明するために使用したい任意の環境マップを収容することができます。

パイプラインの Blender を使用して仮想の照明ステージ ビューを抽出する部分の図。先行する方法は、実際の照光ステージを使用してこのデータを提供していましたが、これは離散オブジェクトにとっては負担が大きく、外部環境ビューにとっては不可能な要件でした。右側の 2 つの画像の左上には、シーンの照明を決定する環境マップが表示されています。これらは、エンドユーザーによって任意に作成できますが、NeRF を現代の CGI アプローチの柔軟性に近づけるものです。
このアプローチは、Mitsuba2 逆レンダリング フレームワークと比較してテストされました。また、PhySG、RNR、Neural-PIL、NeRFactor などの先行研究と比較して、直接照明モデルのみを使用して、最高のスコアを獲得しました。

新しい技術の結果と、さまざまな損失関数を使用した他のアプローチとの比較。研究者は、自分のアプローチが最高の品質をもたらすと主張しています。結果は、ピーク信号ノイズ比 (PSNR)、構造類似性指数測定 (SSIM)、および学習された感覚画像パッチ類似性 (LPIPS) を使用して評価されました。
論文では、次のように述べられています。
‘私たちの定性的および定量的結果は、シーン パラメーターの回復と新しい視点および照明条件での合成品質において、以前の最先端技術よりも明らかな進歩を示しています。’
研究者は、最終的にこのプロジェクトのコードを公開する予定です。
NeRF 編集の必要性
このような分離は、Neural Radiance Fields の研究者にとって大きな課題となりました。NeRF は基本的に、視点からの可能なパスのピクセル値を計算し、RGBD 値を割り当て、ボリューム表現としてこれらの値の行列を作成する写真測量法です。NeRF の核となる部分は、照明によって定義されます。
実際、NeRF は、NVIDIA (NVDA ) によって採用されていましたが、CGI 用語では ‘剛性’ であり、’焼き付け’ です。したがって、研究コミュニティは、この点での扱いやすさと汎用性を向上させることに重点を置いてきました。
このようなマイルストーンの重要性は高く、視覚効果業界を、メッシュ生成、モーション ダイナミクス、テクスチャなどの創造的で共同的なモデルから、逆レンダリング に基づくモデルに変革する可能性があります。ここでは、VFX パイプラインは、推定された、職人芸の近似値ではなく、現実世界の写真や合成モデルによって推進されます。
現在、Neural Radiance Fields から視覚効果コミュニティへの影響はまだ限られています。NeRF には、リギング、ネスト、深度制御、アーティキュレーション などの機能がまだありません。また、照明 も同様です。別の 動画 に付属する別の 新しい論文 は、NeRF ジオメトリの基本的な変形を提供し、CGI の現在の最先端技術とニューラル レンダリング技術の間の巨大なギャップを示しています。
要素の分離
しかし、どこかから始める必要があるため、新しい論文の研究者は、CGI を中間の制御および生産メカニズムとして採用しました。これは、GAN の剛性潜在空間や NeRF の線形ネットワークに対する一般的なアプローチです。
基本的な課題は、グローバル照明 (GI、ニューラルレンダリングでは直接適用できない) を、事前計算放射転送 (PRT、ニューラルレンダリングに適応できる) への計算に変換することです。
GI は、表面から表面への光の反射をモデル化し、これらの反射光の領域をレンダリングに組み込む、現代の CGI レンダリング技術です。
PRT は、新しいアプローチで中間の照明関数として使用され、離散的で編集可能なコンポーネントであるという事実が分離を実現します。新しい方法では、NeRF オブジェクトの材料を学習した PRT でモデル化します。
元のデータの実際のシーン照明は、環境マップとしてこのプロセスで回復され、シーン ジオメトリは、符号付き距離場 (SDF) として抽出され、最終的に Blender で操作するための従来のメッシュを提供します。
プロセスの最初のステージは、NeuS 研究 で使用されたテクニックを介した複数のビュー画像から、暗黙の表面再構築を使用してシーン ジオメトリを抽出することです。
照明データを収容できるニューラル放射転送フィールド (NRTF) を開発するために、研究者は Mitsuba 2 の差分可能パス トレーサーを使用しました。
これにより、双方向散乱分布関数 (BSDF) と初期環境マップの共同最適化が可能になります。BSDF が作成されると、パス トレーサーは Blender (上記の埋め込み動画を参照) で仮想の 1 つの光源ずつ (OLAT) のシーン レンダリングを作成するために使用できます。
NRTF は、写真現実的な材料効果と、シンセティック データの組み合わせされた損失関数でトレーニングされます。これらは互いに絡み合っていません。
照明への道
この技術のトレーニング要件は、NeRF のトレーニング時間よりもはるかに少ないものの、軽視できないものです。48GB の VRAM を備えた NVIDIA Quadro RTX 8000 で、初期の照明とテクスチャ推定の予備トレーニングには 30 分かかります。OLAT トレーニング (仮想光ステージ キャプチャのトレーニング) に 8 時間かかります。最後に、分離されたシンセティック データと実データの共同最適化には、16 時間かかります。
さらに、結果として得られるニューラル表現は、実時間で実行できないため、1 フレームあたり 数秒 かかります。
研究者は、次のように結論付けています。
‘私たちの結果は、現在の最先端技術よりも明らかな改善を示しています。将来の研究では、ランタイムの改善と、幾何学、材料、シーン照明の共同推論が含まれる可能性があります。’
最初に公開されたのは 2022 年 7 月 28 日です。














