Andersonの視点

ニューラル・サーチ・アンド・レスキューのフライスルー環境を作成するためのMega-NeRF

mm
Unite.AI を Google の優先ソースに追加

カーネギーメロン大学と自動運転技術会社Argo AIの新しい研究コラボレーションは、ドローンによって撮影された映像を使用して、ニューラル・ラディアンス・フィールド(NeRF)に基づくダイナミックなフライスルー環境を生成するための経済的な方法を開発しました。

"Mega-NeRF

この新しいアプローチ、Mega-NeRFは、平均的なNeRFレンダリング標準と比較して40倍の高速化を実現し、また、標準的な「タンクと寺院」ではなく、独自のものを提供します。

新しい論文は、Mega-NeRF:スケーラブルなNeRFの構築とバーチャル・フライスルーと題されています。カーネギーメロン大学の3人の研究者によって書かれました。そのうちの1人はArgo AIも代表しています。

サーチ・アンド・レスキューのNeRFランドスケープのモデリング

著者は、サーチ・アンド・レスキュー(SAR)がこの技術の最適なユースケースであると考えています。SAR景観を評価する際、ドローンは帯域幅とバッテリー寿命の制限によって制約され、詳細かつ包括的なカバーを取得することができません。そのため、データは静的な2D空中写真マップに変換されます。

著者は次のように述べています:

‘私たちは、ニューラル・レンダリングがこの分析を3Dに持ち上げ、レスキューチームがリアルタイムで詳細なレベルでフィールドを調査できる未来を想像しています。クラシックなStructure-from-Motion(SfM)よりもはるかに優れた詳細度です。’

このユースケースに取り組む著者は、1日以内にトレーニングできる複雑なNeRFベースのモデルを作成しようとしました。サーチ・アンド・レスキュー作業での生存者の生存率は、最初の24時間で最大80%低下するためです。

著者は、Mega-NeRFモデルをトレーニングするために必要なドローン・キャプチャ・データセットは、標準的なNeRFデータセットよりも「数桁」大きく、モデル容量もデフォルトのフォークまたはNeRFの派生物よりもはるかに高い必要があると述べています。さらに、探索可能な地形マップでのインタラクティビティと探索可能性は不可欠ですが、標準的なリアルタイムNeRFレンダリングは、事前に計算された可能な動きの範囲がはるかに限られていることを前提としています。

分割と征服

これらの問題に対処するために、著者はタスクをサブモジュールに分割する幾何学的クラスタリング・アルゴリズムを作成しました。実質的に、同時にトレーニングされるサブNeRFの行列を作成しました。

レンダリング時、著者はまた、フル・インタラクティビティを可能にするのに十分な迅速性を持つ、ジャスト・イン・タイムの視覚化アルゴリズムを実装しました。ビデオゲームがユーザーの視点に近づくアイテムの詳細を増やすのと同様ですが、遠距離にある場合はエネルギーを節約し、より基本的なスケールで維持します。

これらの経済性により、著者は、以前の方法よりも詳細が良く、過去の類似の研究よりもスケールの限界を克服し、インタラクティビティを犠牲にせず、複数日のトレーニングを必要とせずに、優れた詳細性を実現できると主張しています。

プロジェクトでは、100,000平方メートル以上の工業用地の上空でドローンによって撮影された、高解像度の画像数千枚を含む、大規模なデータセットも提供しています。利用可能な2つのデータセットは、‘ビルディング’‘ルーブル’です。

以前の研究の改善

論文では、SneRG、PlenOctree、FastNeRFなどの以前の類似の研究は、キャッシングまたは事前の処理に依存しており、バーチャル・サーチ・アンド・レスキュー環境の作成には不適切であると述べています。

KiloNeRFは、既存の多層パーセプトロン(MLP)コレクションからサブNeRFを導出しますが、内部シーンに限定され、拡張性や大規模環境に対応する能力が制限されています。FastNeRFは、事前に計算されたNeRFモデルの「焼き込み」バージョンを専用のデータ構造に保存し、専用のMLPまたは球面基底計算を介してナビゲートを許可します。

KiloNeRFのシナリオでは、シーンの各ファセットの最大解像度はすでに計算されており、ユーザーが「ズームイン」することを決定した場合、より高い解像度は利用できません。

一方、NeRF++は、外部環境をネイティブに処理でき、潜在的に探索可能な空間を前景と背景の領域にセクション化し、各領域に専用のMLPモデルを割り当て、合成前のレイ・キャスティングを実行します。

最後に、NeRF in the Wildは、無制限の空間を直接対象としませんが、Phototourismデータセットでの画像品質を向上させ、Mega-NeRFのアーキテクチャでは外観埋め込みが使用されています。

著者はまた、Mega-NeRFは、ワシントン大学のBuilding Rome in a Dayプロジェクトなどの、Structure-from-Motion(SfM)プロジェクトからも着想を得たと述べています。

時間的一貫性

Mega-NeRFは、PlenOctreeと同様に、現在のユーザーの焦点の近くで、色と不透明度の粗いキャッシュを事前に計算します。ただし、PlenOctreeが計算されたパスの近くでパスを毎回計算するのではなく、Mega-NeRFはこの情報を「保存」して再利用し、計算されたツリーをサブディビジョン化します。

左:PlenOctreeの単一使用計算。中:Mega-NeRFのオクツリーのダイナミック・エクスパンション。右:オクツリーの再利用。

左:PlenOctreeの単一使用計算。中:Mega-NeRFのオクツリーのダイナミック・エクスパンション。右:オクツリーの再利用。

著者によると、この計算の経済性は、ローカル・キャッシュとしてのオン・ザ・フライの計算を使用することで、処理の負荷を大幅に削減します。

ガイド付きサンプリング

初期サンプリングの後、Mega-NeRFは、オクツリーの改良後に、画像の品質を向上させるために、2回目のガイド付きレイ・サンプリングを実行します。Mega-NeRFは、オクツリー・データ構造の既存の重みに基づいて、単一のパスを使用します。

上の画像からわかるように、標準的なサンプリングは、ターゲット領域の過剰な計算を実行しますが、Mega-NeRFは、幾何学的存在の知識に基づいて計算を制限します。

データとトレーニング

研究者は、Mega-NeRFをさまざまなデータセットでテストしました。2つの手作りのセットは、工業用地の上空でドローンによって撮影されたものです。最初のデータセット「ミル19 – ビルディング」は、500 x 250平方メートルのエリアの映像を特集しています。2番目の「ミル19 – ルーブル」は、隣接する建設現場の上空で撮影された映像を特集しています。

論文の補足資料より:左、カバーする四分の一。中、パロット・アナフィ・ドローン。右、遠景。

論文の補足資料より:左、カバーする四分の一。中、パロット・アナフィ・ドローン。右、遠景。

アーキテクチャは、深圳大学の視覚コンピューティング研究センターのUrbanScene3Dからのシーンや、インディアナ大学のIUコンピュータビジョン研究所のQuad 6kデータセットに対してもテストされました。

トレーニングは、8つのサブモジュールで行われ、それぞれに256の隠れユニットを持つ8層と、128チャネルのReLU層が続きました。NeRFと異なり、同じMLPが粗いサンプルと精密サンプルの両方に使用され、モデルサイズが小さくなり、粗いネットワーク出力が次のレンダリング段階で再利用できるようになりました。著者は、これにより、各レイのモデルクエリが25%削減されることを推定しています。

バッチごとに1024本のレイがサンプリングされ、Adamで5×104の初期学習率でトレーニングされ、5×10-5まで減衰しました。外観埋め込みは、先述のNeRF in the Wildと同様に処理されました。トレーニングでは、混合精度サンプリング(32ビット浮動小数点以下の精度でトレーニング)が使用され、MLPの幅は2048の隠れユニットに固定されました。

テストと結果

研究者によるテストでは、Mega-NeRFは、NeRF、NeRF++、DeepViewを、500,000イテレーションでトレーニングした後、上回ることができました。ターゲットシナリオは時間制約されているため、研究者は、より遅い以前のフレームワークに24時間を超える時間を許可し、Mega-NeRFはこれらの利点を与えられたにもかかわらず、それらを上回ったと報告しています。

使用されたメトリックは、ピーク信号ノイズ比(PSNR)、VGGバージョンのLPIPS、およびSSIMでした。トレーニングは、8つのV100 GPUを搭載した単一マシンで行われ、256GBのVRAMと5120のテンソル・コアを使用しました。

Mega-NeRFの実験からのサンプル結果(論文に記載されているすべてのフレームワークとデータセットの詳細な結果については、論文を参照してください)

Mega-NeRFの実験からのサンプル結果(論文に記載されているすべてのフレームワークとデータセットの詳細な結果については、論文を参照してください)

プロジェクトページは、https://meganerf.cmusatyalab.org/にあり、リリースされたコードは、https://github.com/cmusatyalab/mega-nerfにあります。

最初に公開された:2021年12月21日。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai