Andersonの視点
NeRFocus:Neural Radiance Fieldsに軽量なフォーカス制御を実現する

中国からの新しい研究により、Neural Radiance Fields(NeRF)で実現可能なコストのかからない深度制御の方法が提供され、ユーザーがフォーカスを変更し、レンダリング空間内の仮想レンズの構成を動的に変更できるようになりました。
NeRFocusという名前のこの技術は、薄いレンズイメージングアプローチを実現し、P-trainingという新しい確率的トレーニング戦略を導入し、専用の深度データセットの必要性を排除し、フォーカスを可能にするトレーニングワークフローを簡素化します。

論文は「NeRFocus:Neural Radiance Field for 3D Synthetic Defocus」と題され、北京大学の深圳大学院と深圳の広東省政府が資金を提供するペン・チェン研究所の4人の研究者によって書かれました。
NeRFにおける注目点の解決
NeRFが仮想現実と拡張現実の有効な技術としての地位を占めるためには、リアルなフォベートレンダリングを実現するための軽量な方法が必要です。フォベートレンダリングでは、レンダリングリソースのほとんどがユーザーの視線の周りに集中し、低解像度で全視覚空間に均等に分布するのではなく、ユーザーの視線の周りに集中します。

2021年の論文「Foveated Neural Radiance Fields for Real-Time and Egocentric Virtual Reality」から、NeRFの新しいフォベートレンダリングスキームの注目点を示す図。ソース:https://arxiv.org/pdf/2103.16365.pdf
将来のNeRFの展開における重要な要素は、人間の目のように焦点を変えることができる能力です。(上の最初の画像を参照してください)。
視点の遠近法のグラデーションは、シーンのスケールの認識にも関係しています。ヘリコプターから都市を撮影した場合、全シーンが視界の外側にあり、焦点を合わせることができないため、ナビゲート可能な焦点領域はありません。一方、ミニチュアや「ニアフィールド」のシーンを調べると、焦点を合わせることができ、リアルな表現のためにデフォルトで狭い焦点距離を持つ必要があります。
以下は、論文の対応する著者から提供されたNeRFocusの初期機能を示すビデオです。
制限された焦点面を超えて
最近のNeRFプロジェクトでは、焦点制御の必要性に応じて、さまざまな方法で焦点制御を実現しようとしてきましたが、すべての試みは、ある種の手段によって実現されたものです。実際には、最終的に想定されるNeural Radiance Fields技術のリアルタイム環境に貢献する可能性は低いです。
ニューラルレンダリングフレームワークにおける合成焦点制御は、さまざまな方法で試みられてきました。たとえば、セグメンテーションネットワークを使用して前景と背景のデータを分離し、背景を汎用的にぼかすという方法があります。これは、2つの焦点面の焦点効果を実現するための一般的な解決策です。

論文「Automatic Portrait Segmentation for Image Stylization」から、焦点面の単純なアニメーションスタイルの分離を示す図。ソース:https://jiaya.me/papers/portrait_eg16.pdf
マルチプレーン表現では、トレーニングされたNeRFのさまざまな焦点面を追加し、深度推定を使用してシーンを区切った焦点距離のグラデーションを生成し、深度依存のカーネルを使用してぼかしを合成します。
さらに、AR/VR環境では、ステレオカメラ設定の2つの視点間の不一致を使用して深度プロキシを作成する方法が提案されています。

Google Researchによる論文「Fast Bilateral-Space Stereo for Synthetic Defocus」から、2つの視点間の不一致を使用してぼかしを実現する方法を示す図。ソース:https://arxiv.org/pdf/1504.00734.pdf
このようなアプローチは、2つの異なる焦点領域を連続した焦点グラデーションとして表現しようとするため、エッジアーティファクトを示すことがあります。
2021年、RawNeRFイニシアチブは、高ダイナミックレンジ(HDR)機能を提供し、低光量状況での制御を改善し、焦点を合わせる能力が向上しました。

RawNeRFは美しく焦点を合わせます(この場合、非現実的な焦点距離があるため、不正確ですが)。ソース:https://bmild.github.io/rawnerf/
しかし、RawNeRFでは、トレーニングされたNeRFのマルチプレーン表現の事前計算が必要であり、軽量化または低遅延化されたNeRFの実装に簡単に適応できないワークフローになります。
仮想レンズのモデリング
NeRFはピンホールイメージングモデルに基づいており、シーン全体をシャープにレンダリングします。これは、デフォルトのCGIシーン(深度によるぼかしの効果をレンダリングする前に)と同様です。
NeRFocusは、薄いレンズ(「ガラスなし」のアパーチャではなく)を仮想的に作成し、各入力ピクセルのビームパスを計算し、それを直接レンダリングします。つまり、標準的な画像キャプチャプロセスを逆転させ、レンズ設計の屈折特性の影響を受ける前の光入力に基づいて動作します。

このモデルでは、フラストゥム(上の画像に示されている最大の円形の影響領域)内でのコンテンツレンダリングの可能性が広がります。
この広い可能性の範囲で、各多層パーセプトロン(MLP)の正しい色と密度を計算することは、追加のタスクです。これは、多数のDLSR画像に監督学習を適用することで解決されてきましたが、追加のデータセットの作成と保存が必要になります。
NeRFocusは、P-trainingによってこれを克服し、トレーニングデータセットを基本的なぼかし操作に基づいて生成します。したがって、モデルはぼかし操作を内在的に持ち、ナビゲート可能です。

アパーチャーの直径を0に設定し、事前に定義された確率を使用してランダムにぼかしカーネルを選択します。この取得した直径を使用して、各複合コーンの直径をスケールアップし、MLPが各ピクセルの放射量と密度を正確に予測できるようにします。
論文の著者は、NeRFocusがRawNeRFのHDR駆動アプローチと互換性がある可能性があることを観察しています。これは、ぼかされたスピキュラーハイライトなどの特定の課題的なセクションのレンダリングに役立つ可能性があります。
このプロセスでは、NeRFやMip-NeRFなどの従来のアプローチと比較して、時間やパラメーターの追加要件はありません。また、Neural Radiance Fieldsの中央メソッドologyの一般的な拡張として適用できます。
2022年3月12日に初めて公開されました。












