Andersonの視点

NeRFがCGIを置き換えるもう一歩近づく

mm
Unite.AI を Google の優先ソースに追加

MITとGoogleの研究者は、AI駆動の新興技術であるNeRF(Neural Radiance Field)画像をその構成要素に分割するという、NeRFの最大の障害の一つを解決する大きなステップを踏み出しました。NeRF画像をテクスチャや照明を変更できるように分割することで、画像を再テクスチャ化や再照明化できるようになります。

新しいアプローチは、NeRFactorと呼ばれ、画像をオブジェクトごとの法線(テクスチャを割り当てることができる)、光の可視性、アルベド(表面から反射される光の割合)、双方向反射分布関数(BRDFs)に分割します。

これらの要素を分離することで、個々のオブジェクトやオブジェクトグループのテクスチャを交換するだけでなく、新しい照明源や影の実装を追加することも可能になります。また、NeRF画像の生成に使用されるマルチカメラアレイによってキャプチャされるもの以外の任意の照明源からのソフトまたはハードな影もサポートされます。

NeRFactorで分離された法線、可視性、アルベド、BRDF

NeRFactorで分離された法線、可視性、アルベド、BRDF ソース:https://www.youtube.com/watch?v=UUVSPJlwhPg

モデルは、ユーザー定義の任意の照明源からのソフトまたはハードな影をサポートし、再構築損失、BRDFの以前の計算からのデータ、基本的なシンプルなスムーズ化正則化を使用して、画像をプログラム的に4つの側面に分割します。

NeRFactorのワークフロー、画像から個別に操作可能な側面を抽出 ソース:https://arxiv.org/pdf/2106.01970.pdf

NeRFactorは、HDRライトプローブを使用して、レンダリング空間の可能な経路を評価します。これは、視覚産業と芸術の分野で広く使用されているアプローチで、1998年に導入されました。ただし、このアプローチでは、可能なパラメーターの数が非常に多くなります。そこで、ライトプローブはマルチレイヤーパーセプトロン(MLP)を介してフィルタリングされ、モデル空間の完全なライトボリュームマップを計算することなく、認識された幾何学をプローブにマッピングします。

NeRFactorで可能な5つの照明モデル 画像をクリックして高解像度の画像を表示

反射のための考察

新しい研究は、NeRF画像の反射を制御する画像のレイヤーを分離することにおいて最も重要です。これは、NeRF画像の最大の課題の一つです。本当の意味で柔軟なNeRFシステムは、テクスチャを交換するだけでなく、動くオブジェクト(固定環境以外のもの)を反射する方法を見つける必要があります。

この問題は、Intelの新しい研究について最近言及されたときにも注目されました。この研究では、ビデオゲームの映像を 写真現実的なビデオに変換するために、畳み込みニューラルネットワークを使用しています。 suchワークフローでは、多くの「焼き付け」されたソースマテリアルの要素が、個別に交換可能なものになる必要があります。これは、照明(NeRFでレンダリングされる幾何学の関数)よりも、反射(モデルのスコープ外の「オフスクリーン」幾何学を使用)を解決する方がはるかに簡単です。

したがって、NeRFビデオの反射を促進するレイヤーを分離することで、NeRFは「反射課題」を解決するために一歩近づきました。

HDR環境の使用により、世界環境の反射(天空、風景、その他の「固定」環境要因)を生成する問題はすでに解決されていますが、動的で動的な反射を導入するには、新しいアプローチが必要です。

NeRFを用いた写真測量

NeRF画像は、シーンまたはオブジェクトを複数の角度から撮影した画像から、完全に体積空間を生成するために、機械学習分析を使用します。

過去1年間に登場したさまざまなNeRFベースのスキームでは、さまざまな数のカメラデバイスを使用しています。16台以上のカメラを使用するものもあれば、1台または2台のカメラを使用するものもあります。どちらの場合でも、中間の視点は「補間」(解釈)され、シーンまたはオブジェクトを流暢にナビゲートできます。

結果として得られるエンティティは、完全な体積空間であり、3Dの理解を内在的に持ち、さまざまな方法で利用できます。たとえば、入力画像の3D解析された合計から従来のCGメッシュを生成することができます。

NeRFと「新しいCGI」

NeRF画像は、実世界の画像、動く画像、人物、オブジェクト、シーンから直接生成されます。一方、CGI手法は、実世界を「研究」し、解釈し、実世界の画像(顔や環境のキャプチャー)を使用してメッシュ、リグ、テクスチャを作成する必要があります。これは本質的に解釈的かつ職人的なアプローチであり、高価で時間がかかります。

さらに、CGIは人間の容貌を再現する際に「アンカニー・ヴァレー」効果という問題に直面していますが、NeRFアプローチではこれは問題ありません。NeRFは、ビデオや画像の実際の人物をキャプチャーし、操作するだけだからです。

さらに、NeRFは、必要に応じて写真から従来のCGIスタイルのメッシュ幾何学を直接生成できます。実際には、CGIで常に必要だった手動プロセスを多く置き換えることができます。

NeRFの課題

MITとGoogleによる最新の研究は、NeRFの課題に対するさまざまな解決策を提供する、NeRFに関する多数の論文の流れの中で発表されました。

4月には、中国の研究コンソーシアムによるイノベーションにより、NeRFシーン内の個々のタイムラインを個別に分離する方法が提供されました。これには、人物も含まれます。

ST-NeRF

中国の研究により、ユーザーはキャプチャされた要素をコピー、ペースト、リサイズし、元のソースビデオの線形タイムラインから切り離すことができます。 ソース:https://www.youtube.com/watch?v=Wp4HfOwFGP4

このアプローチにより、カメラアレイによってキャプチャされた任意の角度からシーンを再構築するだけでなく、柔軟なコンポジットも可能になります。さらに、同じフッテージから2つの側面を個別のタイムフレーム(または逆再生)で表現することもできます。

同じシーン内の2つのNeRF側面が異なる速度で実行

同じシーン内の2つのNeRF側面が異なる速度で実行 ソース:https://www.youtube.com/watch?v=Wp4HfOwFGP4

NeRFの最大の課題の一つは、シーンをトレーニングするために必要な大量のリソースを削減することです。これは、最近のいくつかの論文で解決されています。たとえば、Max Planck Institute for Intelligent Systemsは、KiloNeRFを導入しました。これにより、レンダリング時間が1000倍高速化され、NeRFがインタラクティブに動作するようになりました。

GTX 1080tiで50fpsのインタラクティブ環境を実行するKiloNeRF

GTX 1080tiで50fpsのインタラクティブ環境を実行するKiloNeRF ソース:https://github.com/creiser/kilonerf

しかし、2021年に研究者や一般の人々の想像力を掴んだNeRFのスピード向上のイノベーションは、UC Berkeleyが主導するPlenOctreesコラボレーションによって提供された、Neural Radiance Fieldsのリアルタイムレンダリングです。

PlenOctreesのインタラクティブ機能は、ウェブベースのインターフェイスで再現されています。

FirefoxでPlenOctreesオブジェクトのライブインタラクティブ動作

FirefoxでPlenOctreesオブジェクトのライブインタラクティブ動作 ソース:http://alexyu.net/plenoctrees/demo/

さらに、Tsinghua Universityの研究者による2021年5月の論文では、Recursive-NeRFが提供され、高品質の再帰的レンダリングをオンデマンドで提供します。シーン全体をレンダリングするのではなく、ユーザーが必要とする部分のみをレンダリングすることで、計算リソースを大幅に削減します。

Recursive-NeRFによる不要なレンダリング計算の削減

Recursive-NeRFによる不要なレンダリング計算の削減 ソース:https://arxiv.org/pdf/2105.09103.pdf

他のアプローチには、200fpsで高忠実度のニューラルレンダリングを実現するFastNeRFがあります。

NeRFの最適化技術の多くは、シーンを「焼き付ける」ことによって機能し、レンダリングする側面にコミットし、他の側面を破棄することで、探索を制限する代わりにインタラクティブ性を大幅に高速化します。

しかし、このアプローチの欠点は、ストレスがGPUからストレージに移ることです。焼き付けられたシーンは大量のディスク容量を占めるため、探索やインタラクティブ性の道を閉じることになります。ただし、焼き付けられたデータをダウンサンプリングすることで、ある程度の компромиссを実現できます。

モーションキャプチャーとリギングについては、浙江大学とコーネル大学による新しいアプローチが、2021年5月に発表され、入力ビデオからブレンド重みフィールドとスケルトン構造を解釈して、アニメーション可能な人間を再現する方法を提供しました。

Animatable NeRFの導出スケルトン構造

Animatable NeRFの導出スケルトン構造 ソース:https://www.youtube.com/watch?v=eWOSWbmfJo4

NeRFの「ジュラシック・パーク」モーメントはいつ来るのか

NeRFによる画像合成の進歩は急速ですが、NeRFがどの程度実用化できるかについての「熱力学の法則」が確立されるのは、これからです。CGIの歴史と比較すると、NeRFは現在1973年、CGIが初めて「Westworld」で使用された直前です。

しかし、NeRFが「Wrath Of Khan」や「The Abyss」、「Terminator 2」のようなCGIのブレークスルーを達成するまでに9年かかったように、待たされる必要はないでしょう。CGIは1993年の「ジュラシック・パーク」でのブレークスルーまでに数十年かかりました。

画像技術の分野は、1990年代初頭まで映画やテレビ番組の制作で支配的な技術であった写真化学的視覚効果の長い停滞期から大きく変化しています。PC革命とムーアの法則の加速により、CGI革命が起こりましたが、これは1960年代初頭には起こり得たかもしれません。

NeRFの進歩を妨げるような大きな障害がないかどうかはまだわかりません。コンピュータビジョンの進歩により、NeRFが画像合成の主な候補者としての地位を奪われる可能性もあります。NeRFは、画像合成の「ファクシミリ」機械のようなものになる可能性があります。

現在、NeRFは学術研究以外の分野では使用されていません。しかし、Google Researchを含む主要なプレーヤーや、最先端のコンピュータビジョン研究ラボが、最新のNeRFブレークスルーに競争しています。

NeRFの最大の障害の多くは今年直接対処されてきました。反射問題の解決策が見つかり、NeRF最適化研究の多くの分野が技術の大量な処理および/またはストレージ需要の決定的な解決策に収束する場合、NeRFは次の5年以内に「新しいCGI」になる可能性があります。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai