Andersonの視点

NeRF:ニューラル ラディアン スフィールドを使用したドローンのトレーニング

mm
Unite.AI を Google の優先ソースに追加

スタンフォード大学の研究者は、NeRF(Neural Radiance Fields)を利用して、ドローンを写真現実的な環境でナビゲートさせる新しい方法を開発しました。

ドローンは、専用の3Dシーン再構築を必要とせずに、実際の場所から直接マッピングされた仮想環境でトレーニングできます。この画像では、風の乱れが追加されており、ドローンが一時的に軌道から外れ、最後の瞬間に障害物を避けるために補正しています。ソース:https://mikh3x4.github.io/nerf-navigation/

ドローンは、専用の3Dシーン再構築を必要とせずに、実際の場所から直接マッピングされた仮想環境でトレーニングできます。この画像では、風の乱れが追加されており、ドローンが一時的に軌道から外れ、最後の瞬間に障害物を避けるために補正しています。ソース:https://mikh3x4.github.io/nerf-navigation/

この方法により、ドローン(またはその他のオブジェクト)は、ボリューム情報(衝突回避の計算)、写真から直接描画されたテクスチャ(ドローンの画像認識ネットワークのトレーニングをよりリアルに)、および実世界の照明(ネットワークにさまざまな照明シナリオをトレーニングするために)を含む仮想シナリオでインタラクティブにトレーニングできます。

コーチオブジェクトが、従来のAR/VRワークフローで幾何学的キャプチャとリテクスチャリングによってマッピングするのが非常に難しい複雑な仮想環境をナビゲートしています。ソース:https://www.youtube.com/watch?v=5JjWpv9BaaE

コーチオブジェクトが、従来のAR/VRワークフローで幾何学的キャプチャとリテクスチャリングによってマッピングするのが非常に難しい複雑な仮想環境をナビゲートしています。ソース:https://www.youtube.com/watch?v=5JjWpv9BaaE

典型的なNeRFの実装には、トラジェクトリメカニズムは含まれていません。NeRFプロジェクトのほとんどは、シーンの照明、反射のレンダリング、コンポジット、キャプチャされた要素の分離などの課題に集中しています。したがって、新しい論文の主な革新は、NeRF環境をナビゲーション可能な空間として実装することです。

NeRF as VR/AR

新しい論文は、Vision-Only Robot Navigation in a Neural Radiance Worldというタイトルで、スタンフォード大学の3つの学部(航空宇宙工学、機械工学、コンピューターサイエンス)による共同研究です。

この研究では、NeRF環境を事前にトレーニングしたロボットを提供するナビゲーションフレームワークを提案しています。ロボットのRGBカメラの画像認識に基づいて、ロボットが仮想環境内でどこにあるかを推定するフィルタも含まれています。ロボットは、与えられた環境で何を見られるかをより正確に「妄想」できます。

プロジェクトのトラジェクトリーオプティマイザーが、写真と画像解釈から生成されたNeRFモデルを通してストーンヘンジをナビゲートしています。トラジェクトリープランナーは、 ARCH上の最適なトラジェクトリを確立する前に、可能なパスの数を計算します。

プロジェクトのトラジェクトリーオプティマイザーが、写真と画像解釈から生成されたNeRFモデルを通してストーンヘンジをナビゲートしています。トラジェクトリープランナーは、 ARCH上の最適なトラジェクトリを確立する前に、可能なパスの数を計算します。

NeRF環境には完全にモデル化されたオクルージョンが含まれているため、ドローンは障害物をより簡単に計算できます。NeRFの背後にあるニューラルネットワークは、オクルージョンとドローンのビジョンベースのナビゲーションシステムが環境を認識する方法の関係をマッピングできます。自動化されたNeRF生成パイプラインは、わずか数枚の写真で超現実的なトレーニング空間を作成する比較的簡単な方法を提供します。

スタンフォードプロジェクトで開発されたオンライン再計画フレームワークは、完全にビジョンベースのナビゲーションパイプラインを提供します。

スタンフォードプロジェクトで開発されたオンライン再計画フレームワークは、完全にビジョンベースのナビゲーションパイプラインを提供します。

スタンフォードの取り組みは、NeRF空間をナビゲーション可能で没入感のあるVRスタイルの環境として探索することを検討する最初のものの1つです。NeRFは新興技術であり、現在、計算リソースの要件を最適化し、キャプチャされた要素を分離するための多くの学術的な努力の対象となっています。

Nerf Is Not (Really) CGI

NeRF環境はナビゲーション可能な3Dシーンであるため、2020年の登場以来、誤解を招く技術となり、CGIの自動化メソッドであると広く認識されています。ただし、NeRFは3D環境をモデル化するのではなく、ボリューム情報とテクスチャを直接画像から抽出する「ライブ」レンダリング空間です。

NeRFは、画像の限られた数の視点から幾何学的情報とテクスチャ情報を抽出し、画像間の差をボリューム情報として計算します。ソース:https://www.matthewtancik.com/nerf

NeRFは、画像の限られた数の視点から幾何学的情報とテクスチャ情報を抽出し、画像間の差をボリューム情報として計算します。ソース:https://www.matthewtancik.com/nerf

NeRFの重要な点は、環境を再現するために必要な画像の数が限られていることです。生成された環境には、モデラー、テクスチャアーティスト、照明スペシャリストなどの多くの貢献者を必要とせずに、高忠実度の再構築に必要なすべての情報が含まれています。

セマンティックセグメンテーション

NeRFは、CGIと呼ばれることがありますが、まったく異なる方法論を提供し、高度に自動化されたパイプラインを備えています。さらに、NeRFはシーンの移動部分を分離して「カプセル化」できます。つまり、追加、削除、速度変更、仮想環境内の別個の側面として操作できます。これは、現在のCGIの状態では実現不可能な機能です。

<img class="wp-image-175425 size-full" src="https://www.unite.ai/wp-content/uploads/2021/05/st-nerf-clip-2.gif" alt="上海科技大学からのコラボレーションは、シーンの移動NeRF要素を個別の「貼り付け可能」要素に分離する方法を提供します。” width=”600″ height=”342″ /> 上海科技大学からのコラボレーションは、シーンの移動NeRF要素を個別の「貼り付け可能」要素に分離する方法を提供します。ソース:https://www.youtube.com/watch?v=Wp4HfOwFGP4

NeRFのアーキテクチャは「ブラックボックス」であるため、NeRF環境からオブジェクトを抽出して伝統的なメッシュベースまたは画像ベースのツールで直接操作することは現在不可能です。ただし、NeRFのニューラルネットワークのライブレンダリング環境の背後にあるマトリックスを解析するという研究が進行中です。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai