Andersonの視点
新しいCGI:ブロックNeRFを使用したニューラル近傍の作成

ニューラル放射場(NeRF)を使用すると、複数の視点からの写真のみを使用して、ニューラルネットワーク内でオブジェクトを再現および探索できます。これは、従来のCGI方法の複雑さとコストを必要としません。
しかし、このプロセスは計算コストが高く、NeRF環境は当初、テーブルモデルのシナリオに限定されていました。にもかかわらず、NeRFは、熱心な研究コミュニティによって採用され、過去1年間で、外部の再構築や編集可能なニューラルヒューマンなどの多くの革新が行われました。
現在、新しい研究イニシアチブが始まり、Google Researchを含む参加者がNeRFの最適化の可能性のあるハードリミットを認識し、代わりにNeRF環境を組み合わせて、複数の調整されたNeRFインスタンスで構成されるオンデマンドの近傍を作成することに重点を置いています。

ブロックNeRFネットワークのリンクされたNeRFからの視点。記事の最後に埋め込まれたビデオや、ソースリンクの高解像度のフルレングス補足ビデオを参照してください。 ソース:https://waymo.com/research/block-nerf/
NeRFネットワークを効果的にナビゲートすることで、NeRFをスケーラブルでモジュラーにすることができ、必要なときに近傍の追加部分をロードするナビゲーション可能な環境が提供されます。これは、ビデオゲームのリソース最適化方法に似ており、隅にあるものは、必要になるまでロードされません。
大きな動きとして、ディセンタングルメントを進めるために、天候や時間帯などの別々の側面を分離するために、Block-NeRFは「外観コード」を導入し、動的に時間帯を変更できるようにしました。


Block-NeRFで時間帯を変更する。記事の最後に埋め込まれたビデオや、ソースリンクの高解像度のフルレングス補足ビデオを参照してください。 ソース:https://waymo.com/research/block-nerf/
新しい論文では、NeRFの最適化が限界に近づいていることが示唆されており、仮想現実、インタラクティブな球面、VFXワークなどの分野での将来の展開は、並列操作に依存する可能性が高いとされています。
論文の著者(Block-NeRF:スケーラブルな大規模シーンニューラルビューシンセシス)は、280万枚の画像を使用して、最大のニューラルシーンを作成しました。サンフランシスコの近傍のシリーズです。

Block-NeRFがサンフランシスコのグレース大聖堂をナビゲートする。記事の最後に埋め込まれたビデオや、ソースリンクの高解像度のフルレングス補足ビデオを参照してください。 ソース:https://waymo.com/research/block-nerf/
論文のリード著者は、UCバークレーのMatthew Tancikで、ニューラル放射場の共同発明者です。彼は、自律走行技術開発会社Waymoのインターンとしてこの研究を行いました。Waymoはプロジェクトページのホストです。このイニシアチブには、YouTubeに埋め込まれたビデオの概要や、プロジェクトページに多くのサポートおよび補足ビデオがあります。
論文は、NeRFのオリジネーターであるBen Mildenhall(Google Research)、Pratul P. Srinivasan(Google Research)、Jonathan T. Barron(Google Research)などによって共著されています。その他の貢献者は、WaymoのVincent Casser、Xinchen Yan、Sabeek Pradhan、Henrik Kretzschmar、Vincent Casserです。
Block-NeRFは、主に自律走行車システムの仮想環境の研究として開発されました。自律走行車やドローンが含まれます。

Block-NeRFの180度の視点から見たエンバーカデロ通りの道路。記事の最後に埋め込まれたビデオや、ソースリンクの高解像度のフルレングス補足ビデオを参照してください。 ソース:https://waymo.com/research/block-nerf/
Block-NeRFでは、レンズの絞り(上の画像を参照)、天候、季節などの要素も動的に変更できます。
しかし、季節の変更は、木に葉がないなどの環境の変更につながる可能性があり、Block-NeRFよりも広範な入力データセットが必要です。論文では次のように述べられています。
「[葉]は季節によって変化し、風で動きます。木や植物のぼやけた表現につながります。同様に、トレーニングデータの時間的不一致、たとえば建設作業は自動的に処理されず、影響を受けるブロックの手動再トレーニングが必要です。」
アポカリプティックレンダリング
記事の最後に埋め込まれたビデオを見ると、ウォーキングデッドのようなスパルタナスなネットワーク化されたBlock-NeRF環境が見られます。さまざまな理由により、ロボットシステム、車、歩行者、その他の一時的なオブジェクトは、ソース素材から意図的にマットアウトされましたが、これにより、消去された駐車車両の影などのアーティファクトが残りました。

消去された車の影。 ソース:https://waymo.com/research/block-nerf/
さまざまな照明環境(例:昼または夜)に対応するために、ネットワークは、各条件に関するデータの分離されたストリームを組み込むようにトレーニングされています。以下の画像では、Block-NeRFの映像の日と夜のための寄与するストリームが見られます。

明らかに「焼き付け」されたBlock-NeRFレンダーの背後にあるオンデマンドのファセット、ユーザーが必要に応じて夜を切り替えることができる。 ソース:https://waymo.com/research/block-nerf/
環境および倫理的考慮
最近の研究提出では、提案された研究の可能な倫理的および環境的影響に関する注意書きや免責事項が含まれるようになっています。Block-NeRFの場合、著者は、エネルギー要件が高く、短期的および長期的な一時的なオブジェクト(例:木の葉や建設作業)を考慮するには、ソースデータの定期的な再スキャンが必要になり、都市部のニューラルモデルを更新するために「監視」が増える可能性があることを指摘しています。
著者は次のように述べています。
「この研究の適用スケールによって、計算の要件が環境被害につながる可能性があり、計算に使用されるエネルギーが二酸化炭素排出量の増加につながる可能性があります。論文で言及されているように、キャッシュ方法などのさらなる研究によって計算の要件を削減し、環境被害を軽減できる可能性があります。」
監視について、著者は次のように述べています。
「この研究の将来の応用は、環境のより大きなデータ収集努力を伴う可能性があり、プライバシーに関する懸念がさらに高まります。Google Street Viewなどのサービスでは、すでに公共の道路の詳細な画像が見つけることができますが、私たちの方法では、環境のより頻繁で定期的なスキャンが促進される可能性があります。自律走行車の企業の中には、車両のフリートを使用して定期的なエリアスキャンを行っているものもありますが、一部の企業はLiDARスキャンしか使用していませんが、カメラ画像の収集よりも感度が低い可能性があります。」
方法と解決策
個々のNeRF環境は、理論的には、ブロックNeRF配列に組み込まれる前に、任意のサイズにスケールダウンできます。これにより、木などのコンテンツをグラニュラーに含めることができ、建設作業などの管理と識別が可能になります。
しかし、この初期の研究では、離散的なNeRFブロックは、描かれた環境の実際の都市ブロックに限定されており、50%のオーバーラップを保つために、ユーザーがネットワークをナビゲートするときに、一つのブロックから次のブロックへの一貫した遷移が保証されます。
各ブロックは、地理的なフィルターによって制約されています。著者は、このフレームワークの部分は自動化に開放されており、驚くことに、彼らの実装はGoogle Mapsではなく、OpenStreetMapに依存していることを指摘しています。

Block-NeRFの「アクティブ」レンダリング空間の交差半径。 ソース:Waymo
ブロックは並行してトレーニングされ、必要なブロックはオンデマンドでレンダリングされます。革新的な外観コードも、ブロックセット全体で調整され、天候、時間帯、または季節が予期せず変化しないようにします。

Block-NeRFセグメントは、高動的レンジ(HDR)写真ソースマテリアルと同様の方法で露出に条件付けられます。 ソース:Waymo
照明やその他の環境変数を切り替える能力は、NeRF in the Wild(NeRF-W)で導入された生成潜在最適化から派生しています。これは、2019年のFacebook AIの研究論文「生成ネットワークの潜在的な空間の最適化」からその方法を導き出しています。
Panoptic-DeepLabの2020年の意味的セグメンテーションモデルは、不必要な要素(例:人や車両)をブロックアウトするために使用されます。
データ
一般的な都市データセット(例:CityScapes)は、Block-NeRFが必要とする詳細な作業に適していないことがわかったため、研究者は独自のデータセットを作成しました。画像データは、360度の視野をカバーする12台のカメラから収集され、10Hzで撮影され、スカラー露出値で撮影されました。

サンフランシスコの近傍、Alamo SquareとMission Bayがカバーされました。Alamo Squareのキャプチャでは、約960m x 570mのエリアがカバーされ、35個のBlock-NeRFインスタンスに分割され、各インスタンスは38〜48回のデータ収集ランからトレーニングされ、合計18〜28分のドライブ時間でした。
各Block-NeRFの寄与画像数は64,575〜108,216枚で、エリアのドライブ時間は1,330回のデータ収集ランで13.4時間、合計2,818,745枚のトレーニング画像でした。Mission Bayのデータ収集の詳細については、論文を参照してください。
2022年2月11日初版。












