AIモデルとプラットフォーム

スプラッター画像:ウルトラ高速のシングルビュー3D再構築

mm
Unite.AI を Google の優先ソースに追加

シングルビュー3Dオブジェクト再構築は、ConvNetを使用して驚くほどの能力を示しています。シングルビュー3D再構築モデルは、単一の画像を参照して、任意のオブジェクトの3Dモデルを生成するため、コンピュータビジョンの研究で最もホットなトピックの1つとなっています。

たとえば、上の画像のオートバイを考えてみましょう。3D構造を生成するには、低レベル画像からのヒントと高レベルセマンティック情報、およびパーツの構造的な配置に関する知識を組み合わせた複雑なパイプラインが必要です。

この複雑なプロセスにより、シングルビュー3D再構築はコンピュータビジョンで大きな課題となっています。シングルビュー3D再構築の効率を高めるために、開発者はスプラッター画像という手法を開発しました。この手法は、オブジェクトのウルトラ高速なシングルビュー3D形状と3D外観の構築を目指しています。スプラッター画像フレームワークの核となるのは、ガウシアンスプラッティング法を使用して3D表現を分析することです。この方法は、速度と品質の両方で優れています。

最近、ガウシアンスプラッティング法は、リアルタイムレンダリング、拡張スケーリング、高速トレーニングのために、多ビュー再構築モデルによって実装されてきました。ただし、スプラッター画像は、シングルビュー再構築タスクにガウシアンスプラッティング法を実装した最初のフレームワークです。

この記事では、スプラッター画像フレームワークがガウシアンスプラッティングを使用してウルトラ高速なシングルビュー3D再構築を実現する方法について説明します。では、始めましょう。

スプラッター画像:ウルトラ高速のシングルビュー3D再構築

先ほど述べたように、スプラッター画像は、ガウシアンスプラッティング法に基づくシングルビュー3Dオブジェクト再構築のためのウルトラ高速なアプローチです。スプラッター画像は、従来、ガウシアンスプラッティング法が多ビュー3Dオブジェクト再構築フレームワークを動かしていたのに対し、モノキュラ3Dオブジェクト生成のためのガウシアンスプラッティング法を最初に実装したコンピュータビジョンフレームワークです。ただし、スプラッター画像フレームワークを従来の方法と区別するのは、学習ベースのアプローチであるという点です。テスト時の再構築には、ニューラルネットワークのフィードフォワード評価のみが必要です。

スプラッター画像は、基本的にガウシアンスプラッティングのレンダリング特性と高速処理速度に依存して、3D再構築を生成します。スプラッター画像フレームワークの設計は、シンプルで直截です。フレームワークは、2D画像から画像へのニューラルネットワークを使用して、入力画像ごとに3Dガウシアンを予測し、入力画像を1つの3Dガウシアンを持つ1つのピクセルにマッピングします。結果の3Dガウシアンは、スプラッター画像と呼ばれる画像の形式を持ちます。これらのガウシアンは、画像の360度表現も提供します。このプロセスは、次の画像に示されています。

プロセスはシンプルで直截ですが、スプラッター画像フレームワークがガウシアンスプラッティングを使用して、シングルビュー3D表現を生成する際に、いくつかの重要な課題に直面しています。最初の主要なハードルは、画像を入力として受け取り、画像のすべての側面を表すガウシアンミックスを出力として生成する、ニューラルネットワークを設計することです。この課題に対処するために、スプラッター画像は、生成されたガウシアンミックスがセットまたは順序付けられていないコレクションであるにもかかわらず、それを順序付けられたデータ構造に格納できるという事実を利用します。したがって、フレームワークは、各ピクセルに1つのガウシアンのパラメータを含む、3Dガウシアンを含む2D画像コンテナを使用します。

3Dガウシアンセットを画像に格納することで、スプラッター画像フレームワークは、画像から画像へのニューラルネットワークを学習する際に直面する再構築の課題を軽減できます。このアプローチを使用することで、再構築プロセスは、3D演算器に依存するのではなく、効率的な2D演算器のみを使用して実装できます。さらに、スプラッター画像フレームワークでは、3D表現は3Dガウシアンのミックスであり、ガウシアンスプラッティングによって提供されるレンダリング速度とメモリ効率の利点を利用できます。これにより、トレーニングと推論の両方で効率が向上します。次に、スプラッター画像フレームワークは、シングルビュー3D表現のみを生成するのではなく、複数の画像を入力として受け取ることもできます。個々のガウシアンミックスを共通の参照フレームに登録し、個々のビューからのガウシアンミックスの組み合わせを取得することで、これを実現します。フレームワークはまた、アーキテクチャに軽量のクロスアテンションレイヤーを挿入し、異なるビューが予測中に相互に通信できるようにします。

実証的観点から見ると、スプラッター画像フレームワークは、オブジェクトの1つの側面しか見えていないにもかかわらず、オブジェクトの360度再構築を生成できます。フレームワークは、2D近傍の異なるガウシアンを3Dオブジェクトの異なる部分に割り当てて、生成された360度情報を2D画像にコード化します。さらに、フレームワークは、ガウシアンの不透明度を0に設定して、ポストプロセス中にそれらを無効にします。

まとめると、スプラッター画像フレームワークは

  1. ガウシアンスプラッティングアプローチを使用したシングルビュー3Dオブジェクト再構築を生成するための新しいアプローチです。
  2. 多ビュー3Dオブジェクト再構築のための方法を拡張します。
  3. 標準ベンチマークで、状態オブザートの3Dオブジェクト再構築パフォーマンスを達成します。

スプラッター画像:方法論とアーキテクチャ

ガウシアンスプラッティング

先ほど述べたように、ガウシアンスプラッティングは、スプラッター画像フレームワークがシングルビュー3Dオブジェクト再構築を生成するために実装する主な方法です。ガウシアンスプラッティングは、3D画像のレンダリングとリアルタイムレンダリングのためのラスタライズ方法です。3D空間はガウシアンと呼ばれ、機械学習手法を使用して各ガウシアンのパラメータを学習します。ガウシアンスプラッティングは、レンダリング中にトレーニングが必要ないため、レンダリング時間が速くなります。次の画像は、3Dガウシアンスプラッティングのアーキテクチャを要約しています。

3Dガウシアンスプラッティングは、まず入力画像を使用して点群を生成します。ガウシアンスプラッティングは、入力画像を使用して、カメラの外部パラメータを推定し、これらのパラメータを使用して点群を計算します。さまざまな機械学習手法を使用して、ガウシアンスプラッティングは、各ガウシアンの4つのパラメータを最適化します。位置(どこにあるか)、共分散(拡大または縮小の程度)、色(RGB色)、アルファ(透明度)。最適化プロセスは、各カメラ位置で画像をレンダリングし、元の画像からのパラメータを決定します。結果として得られる3Dガウシアンスプラッティングの出力は、スプラッター画像と呼ばれる画像であり、元の画像に最もよく似た画像です。

さらに、ガウシアンスプラッティングの不透明度関数と色関数は、3D点の視点方向を持つ放射場を提供します。フレームワークは、ピクセルを通るレイに沿って観測された色を積分することで、放射場を画像にレンダリングします。ガウシアンスプラッティングは、これらの関数を色付きガウシアンの組み合わせとして表します。ガウシアンの平均または中心とガウシアンの共分散は、形状とサイズを決定するのに役立ちます。各ガウシアンには、不透明度と視点依存の色の特性があり、放射場を定義します。

スプラッター画像

レンダラーコンポーネントは、3Dガウシアンを画像にマッピングします。シングルビュー3D再構築を実行するために、フレームワークは、画像から3Dガウシアンのミックスを再構築するための逆関数を探します。ここでの重要な点は、逆関数のための効果的でシンプルな設計を提案することです。特に、入力画像に対して、画像から画像へのニューラルネットワークアーキテクチャを使用して、スプラッター画像と呼ばれる画像を出力します。ネットワークは、形状、不透明度、色を予測します。

スプラッター画像フレームワークがオブジェクトの3D表現を再構築できるのは、オブジェクトの1つのビューしか見えていないからです。実際、スプラッター画像フレームワークは、利用可能なガウシアンの一部を使用してビューを再構築し、残りのガウシアンを使用して見えない部分を自動的に再構築します。効率を最大化するために、フレームワークは、不透明度が0の場合、ガウシアンを自動的にオフにできます。ガウシアンはオフにされ、フレームワークはこれらの点をレンダリングせず、代わりにポストプロセスでカットされます。

画像レベル損失

ガウシアンスプラッティング法の速度と効率を利用することの主な利点は、フレームワークが各イテレーションですべての画像をレンダリングできることです。さらに、フレームワークは、ピクセルごとの損失に分解できない画像レベル損失を使用できます。

スケール正規化

単一のビューからオブジェクトのサイズを推定することは困難であり、損失関数でこの曖昧さを解決することは困難なタスクです。同様の問題は、すべてのオブジェクトが同じカメラ内在性でレンダリングされ、カメラから固定距離にあるため、合成データセットでは観察されません。ただし、実際の画像のデータセットでは、曖昧さは明らかであり、スプラッター画像フレームワークは、すべてのオブジェクトのスケールを約束的に固定するために、前処理手法を使用します。

視点依存色

視点依存色を表現するために、スプラッター画像フレームワークは、ランバート色モデルを超えて色を一般化するために、球面調和関数を使用します。各ガウシアンの係数は、ネットワークによって予測され、球面調和関数によって定義されます。視点の変更は、カメラソースの視点方向をフレームの参照フレームの対応する視点方向に変換します。モデルは、変換された色関数を見つけるために、対応する係数を見つけます。モデルは、回転の下で球面調和関数が閉じているため、これを実行できます。

ニューラルネットワークアーキテクチャ

予測器のアーキテクチャのほとんどは、入力画像をガウシアンの組み合わせにマッピングするプロセスと同じです。最後の層は、出力チャネルの幅を決定する色モデルで置き換えられた1×1畳み込み層です。ネットワークは、入力画像に対して、オフセット、不透明度、回転、深度、色をコード化するチャネルテンソルを出力として生成します。フレームワークは、非線形関数を使用してパラメータを活性化し、ガウシアンのパラメータを取得します。

3D表現を再構築するために、スプラッター画像フレームワークは、各入力ビューに同じネットワークを適用し、視点アプローチを使用して個々の再構築を組み合わせます。さらに、ネットワーク内のさまざまなビュー間の情報の効率的な調整と交換を促進するために、スプラッター画像フレームワークは、ネットワークに2つの変更を加えます。まず、モデルをカメラポーズで条件付けて、各エントリを正弦位置埋め込みを使用してエンコードし、複数の次元を生成します。2番目に、スプラッター画像フレームワークは、異なるビューの特徴間の通信を促進するために、クロスアテンションレイヤーを追加します。

スプラッター画像:実験と結果

スプラッター画像フレームワークは、ノベルビューシンセシスの品質を評価することで、再構築の品質を測定します。フレームワークは、ソースビューを使用して3D形状をレンダリングし、ターゲットの見えないビューに再構築を実行します。フレームワークは、SSIM、PSNR、LPIPSスコアを使用してパフォーマンスを評価します。

シングルビュー3D再構築パフォーマンス

次の表は、ShapeNetベンチマークでのシングルビュー3D再構築タスクにおけるスプラッター画像モデルのパフォーマンスを示しています。

観察すると、スプラッター画像フレームワークは、LPIPSとSSIMスコアの両方で、すべての決定論的再構築方法を上回っています。スコアは、スプラッター画像モデルがより鮮明な再構築を生成していることを示しています。さらに、スプラッター画像モデルは、生成された再構築がより正確であることを示すPSNRスコアの点で、すべての決定論的ベースラインを上回っています。さらに、すべての決定論的方法を上回るだけでなく、スプラッター画像フレームワークは、トレーニングとテストの両方の段階で効率を高めるために、相対的なカメラポーズのみを必要とします。

次の画像は、スプラッター画像フレームワークの定性的優位性を示しています。モデルは、薄い幾何学的構造と、条件付きビューの詳細を捉えた再構築を生成します。

次の画像は、スプラッター画像フレームワークによって生成された再構築が、以前のモデルよりも薄い構造や視界の制限された非標準的な条件で、より鮮明で正確であることを示しています。

マルチビュー3D再構築

マルチビュー3D再構築の能力を評価するために、スプラッター画像フレームワークは、2ビュー予測のためのSpaneNet-SRN Carsデータセットでトレーニングされます。既存の方法は、多ビュー3D再構築タスクのための絶対的なカメラポーズ条件付けを使用します。つまり、モデルは、主にオブジェクトの正規の向きに依存することを学習します。ただし、スプラッター画像フレームワークは、相対的なカメラポーズのみを使用します。

最終的な考え

この記事では、スプラッター画像について説明しました。スプラッター画像は、オブジェクトのウルトラ高速なシングルビュー3D形状と3D外観の構築を実現することを目指しています。スプラッター画像フレームワークの核となるのは、ガウシアンスプラッティング法を使用して3D表現を分析することです。この方法は、速度と品質の両方で優れています。スプラッター画像フレームワークは、2D CNNアーキテクチャを使用して、各ピクセルに1つの色付きガウシアンを含む疑似画像を予測します。ガウシアンスプラッティング法を使用することで、スプラッター画像フレームワークは、高速レンダリングと高速推論を組み合わせて、リアルと合成ベンチマークでのトレーニングと評価を迅速化します。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。