AIモデルとプラットフォーム

シングルビュー3Dリコンストラクションのしくみ

mm
Unite.AI を Google の優先ソースに追加

従来、シングルビュー・オブジェクト・リコンストラクションのモデルは、畳み込みニューラル・ネットワークをベースにしており、リコンストラクション・タスクで優れたパフォーマンスを示してきました。近年、シングルビュー3Dリコンストラクションは、AIコミュニティで人気のある研究トピックとなりました。特定の方法論に関係なく、すべてのシングルビュー3Dリコンストラクション・モデルは、エンコーダー・デコーダー・ネットワークをそのフレームワーク内に組み込むという共通のアプローチを共有しています。このネットワークは、出力空間の3D構造について複雑な推論を実行します。

この記事では、シングルビュー3Dリコンストラクションがリアルタイムでどのように動作するか、そしてこれらのフレームワークがリコンストラクション・タスクで直面している現在の課題について探ります。シングルビュー3Dリコンストラクション・モデルで使用されるさまざまな重要なコンポーネントと方法について議論し、これらのフレームワークのパフォーマンスを向上させるための戦略を探ります。さらに、エンコーダー・デコーダー・方法を使用する最新のフレームワークによって生成される結果を分析します。始めましょう。

シングルビュー3Dオブジェクトリコンストラクション

シングルビュー3Dオブジェクトリコンストラクションとは、オブジェクトの3Dモデルを単一の視点、または単純に言えば、単一の画像から生成することを意味します。例えば、画像からオブジェクトの3D構造、たとえばモーターサイクルを推論することは複雑なプロセスです。これには、パーツの構造的な配置に関する知識、低レベルの画像のヒント、ハイレベルのセマンティック情報が必要です。このスペクトルには、リコンストラクション認識の2つの主要な側面が含まれます。リコンストラクション・プロセスは、陰影、テクスチャ、視覚効果などのヒントを使用して、入力画像の3D構造を推論します。一方、認識プロセスは入力画像を分類し、データベースから適切な3Dモデルを取得します。

現在のシングルビュー3Dオブジェクトリコンストラクション・モデルはアーキテクチャーで異なる場合がありますが、すべてのモデルはエンコーダー・デコーダー構造をそのフレームワーク内に含んでいます。この構造では、エンコーダーは入力画像を潜在的な表現にマッピングし、デコーダーは出力空間の3D構造について複雑な推論を実行します。このタスクを成功させるには、ネットワークはハイレベルとローレベルの情報の両方を統合する必要があります。さらに、多くの最新のエンコーダー・デコーダー・方法は、シングルビュー3Dリコンストラクション・タスクで認識に依存していますが、これによりリコンストラクションの能力が制限されます。また、近代的な畳み込みニューラル・ネットワークのシングルビュー3Dオブジェクトリコンストラクションにおけるパフォーマンスは、明示的に3Dオブジェクト構造を推論することなく超越することができます。しかし、シングルビュー・オブジェクト・リコンストラクション・タスクで畳み込みニューラル・ネットワークの優位性は、評価プロトコルやデータセットの構成などのさまざまな実験的手順によって影響を受けます。これらの要因により、フレームワークはショートカット・ソリューション、つまり画像認識を見つけることができます。

従来、シングルビュー3Dオブジェクトリコンストラクション・フレームワークは、シェーディングからのシェイプ・アプローチを使用してリコンストラクション・タスクにアプローチし、テクスチャとデフォーカスはリコンストラクション・タスクのためにエキゾチックなビューとして機能します。これらの技術は単一の深度のヒントを使用しているため、表面の可視部分に対して推論を提供できます。さらに、シングルビュー3Dリコンストラクション・フレームワークの多くは、構造的な知識とともに複数のヒントを使用して、単一のモノキュラー画像から深度を推定することができます。これにより、これらのフレームワークは可視表面の深度を予測できます。最近の深度推定フレームワークは、モノキュラー画像から深度を抽出するために畳み込みニューラル・ネットワーク構造を使用します。

しかし、有効なシングルビュー3Dリコンストラクションのために、モデルは画像内の可視オブジェクトの3D構造について推論するだけでなく、特定のデータから学習した先験知識を使用して画像内の不可視部分を推論する必要があります。これを実現するために、多くのモデルは2D画像を3D形状に直接マッピングするためにトレーニングされた畳み込みニューラル・ネットワーク構造を使用します。一方、他の多くのフレームワークは3D形状のボクセル・ベースの表現を使用し、潜在的な表現を使用して3Dを生成します。特定のフレームワークは、計算とメモリの効率を高めるために出力空間を階層的にパーティション化します。これにより、モデルはより高解像度の3D形状を予測できます。最近の研究は、畳み込みニューラル・ネットワークを使用したシングルビュー3D形状予測のための弱い形式の教師あり学習に焦点を当てています。予測形状とそのグラウンド・トゥルース予測を比較して形状の回帰器をトレーニングするか、または平均形状をトレーニングするために複数の学習シグナルを使用します。これにより、モデルは変形を予測することができます。シングルビュー3Dリコンストラクションの進歩が限られているもう1つの理由は、タスクのトレーニング・データが限られていることです。

シングルビュー3Dリコンストラクションは、視覚的なデータを幾何学的に解釈するだけでなく、セマンティックにも解釈する複雑なタスクです。幾何学的なリコンストラクションとセマンティック認識は完全に異なるものではありませんが、幾何学的なリコンストラクションからセマンティック認識まで異なるスペクトルをカバーします。リコンストラクション・タスクは、画像内のオブジェクトの3D構造についてピクセルごとの推論を必要とします。リコンストラクション・タスクでは、画像の内容についてセマンティックな理解は必要としません。テクスチャ、色、シェーディング、影、視点、焦点などの低レベルの画像のヒントを使用して実行できます。一方、認識は画像のセマンティクスを使用する極端なケースです。認識タスクは、オブジェクト全体を使用し、入力画像を分類し、データベースから対応する形状を取得します。認識タスクは画像内の不可視部分についてロバストな推論を提供できますが、セマンティック・ソリューションは、データベースに存在するオブジェクトによって説明できる場合にのみ実行可能です。

認識とリコンストラクション・タスクは互いに大きく異なりますが、両者は入力画像に含まれる貴重な情報を無視する傾向があります。可能な限り最も適切な結果と正確な3D形状を得るために、両者を組み合わせて使用することが推奨されます。つまり、シングルビュー3Dリコンストラクション・タスクの最適な場合、モデルは構造的な知識、低レベルの画像のヒント、オブジェクトのハイレベルの理解を使用する必要があります。

シングルビュー3Dリコンストラクション:従来のセットアップ

シングルビュー3Dリコンストラクション・フレームワークの従来のセットアップとセットアップを分析するために、オブジェクトの3D形状を推定するための標準的なセットアップを使用します。トレーニングのために使用されるデータセットはShapeNetデータセットであり、13クラス間でパフォーマンスを評価することで、モデルはデータセット内のクラスの数が形状推定のパフォーマンスにどのように影響するかを理解できます。

近代的な畳み込みニューラル・ネットワークの多くは、単一の画像から高解像度の3Dモデルを予測し、これらのフレームワークは出力の表現に基づいてカテゴリ分けできます。深度マップ、点群、ボクセル・グリッドです。モデルはOGNまたはOctree Generating Networksを代表的な方法として使用し、歴史的にボクセル・グリッド・アプローチを超越し、または優れた出力表現をカバーできます。既存の方法が出力表現を使用するのに対し、OGNアプローチはモデルが高解像度の形状を予測できるようにし、占有空間を効率的に表現するためにオクツリーを使用します。

ベースライン

結果を評価するために、モデルは2つのベースラインを使用します。これらは、問題を純粋な認識タスクとして考えています。最初のベースラインはクラスタリングに基づいており、2番目のベースラインはデータベースの取得を実行します。

クラスタリング

クラスタリング・ベースラインでは、モデルはK-Meansアルゴリズムを使用してトレーニング・シェイプをKのサブ・カテゴリにクラスタリングし、32*32*32のボクセル化をベクトルにフラット化してアルゴリズムを実行します。クラスタの割り当てを決定した後、モデルは高解像度のモデルで作業するように切り替えます。モデルはそれぞれのクラスタ内で平均形状を計算し、平均形状をしきい値に設定します。ここで、最適な値は平均IoUまたはIntersection over Unionを最大化することで計算されます。モデルはトレーニング・データ内で3D形状と画像の関係を知っているため、モデルは画像を対応するクラスタに簡単にマッチングできます。

取得

取得ベースラインは、形状と画像をジョイント・スペースに埋め込みます。モデルはトレーニング・セット内の3Dマトリックス・形状のペアワイズ・類似性を考慮して埋め込み・スペースを構築します。モデルはこれを実現するために、多次元スケーリングとサモン・マッピング・アプローチを使用してマトリックスの各行を低次元の記述子に圧縮します。さらに、2つの任意の形状の類似性を計算するために、モデルはライト・フィールド・記述子を使用します。また、モデルは画像を記述子にマッピングするために畳み込みニューラル・ネットワークをトレーニングし、画像をスペースに埋め込みます。

分析

シングルビュー3Dリコンストラクション・モデルは、異なる戦略に従うため、ある分野では他のモデルを上回り、他の分野では劣ることがあります。異なるフレームワークを比較し、パフォーマンスを評価するために、平均IoUスコアなどのメトリックを使用します。

上の画像からわかるように、異なるアーキテクチャーを持つ現在の最新の3Dリコンストラクション・モデルは、ほぼ同等のパフォーマンスを提供します。ただし、純粋な認識方法であるにもかかわらず、取得フレームワークが平均および中央値のIoUスコアで他のモデルを上回っていることは注目に値することです。クラスタリング・フレームワークはAtlasNet、OGN、Matryoshkaフレームワークを上回る堅実な結果を提供します。ただし、最も予想外の結果は、完璧な取得アーキテクチャーを使用するにもかかわらず、Oracle (ORCL ) NNが他のすべての方法を上回っていることです。平均IoUスコアを計算することは比較に役立ちますが、モデルに関係なく結果の分散が高いため、完全な絵は示しません。

一般的な評価メトリック

シングルビュー3Dリコンストラクション・モデルは、さまざまなタスクのパフォーマンスを分析するために、さまざまな評価メトリックを使用します。以下は、一般的に使用される評価メトリックのいくつかです。

交差率

平均の交差率は、シングルビュー3Dリコンストラクション・モデルのベンチマークとして一般的に使用される定量的な尺度です。IoUは、モデルが予測した形状の品質を示しますが、値が十分に高い場合にのみ、低いスコアと中間スコアの2つの形状の間で大きな差が見られるため、メソッドを評価するための唯一の尺度としては考慮されません。

チャムファー距離

チャムファー距離は点群で定義され、さまざまな3D表現に適切に適用できます。ただし、チャムファー距離の評価メトリックは外れ値に敏感であり、生成の品質を評価するための問題のある尺度となります。外れ値と参照形状の距離が生成の品質を大幅に決定します。

Fスコア

Fスコアは、多くのマルチビュー3Dリコンストラクション・モデルで一般的に使用される評価メトリックです。Fスコア・メトリックは、リコールとプレシジョンの調和平均として定義され、オブジェクトの表面間の距離を明示的に評価します。プレシジョンは、再構築された点のうち、事前に定義された距離内にあるグラウンド・トゥルースへの割合を数え、再構築の精度を測定します。一方、リコールは、グラウンド・トゥルースの点のうち、事前に定義された距離内にある再構築への割合を数え、再構築の完全性を測定します。さらに、距離のしきい値を変化させることで、開発者はFスコア・メトリックの厳格さを制御できます。

クラスごとの分析

上記のフレームワークが異なるクラスのサブセットで実行されていることによる結果ではないことを確認するために、以下の図は、すべてのメソッドがクラス間で一貫した相対的なパフォーマンスを示していることを示しています。Oracle NN取得ベースラインは最高の結果を達成し、すべてのメソッドがすべてのクラスで高い分散を観察しています。

さらに、クラスのトレーニング・サンプルの数がクラスごとのパフォーマンスに影響を与える可能性があると考えられます。しかし、以下の図からわかるように、クラスのトレーニング・サンプルの数はクラスごとのパフォーマンスに影響を与えません。クラスのサンプルの数とその平均IoUスコアは相関関係にありません。

定性的分析

上記のセクションで議論した定量的結果は、以下の画像に示すように定性的結果によって裏付けられています。

大多数のクラスでは、クラスタリング・ベースラインとデコーダー・ベースの方法によって行われた予測の間に大きな違いはありません。クラスタリング・アプローチは、サンプルと平均クラスタ・シェイプの距離が大きい場合、または平均シェイプがクラスタを十分に説明できない場合に、結果を提供できません。一方、デコーダー・ベースの方法と取得アーキテクチャーを使用するフレームワークは、生成された3Dモデルに細かい詳細を含めることができるため、最も正確で魅力的な結果を提供します。

シングルビュー3Dリコンストラクション:最終的な考え

この記事では、シングルビュー3Dオブジェクト・リコンストラクションについて話し、どのように動作するか、そして2つのベースライン、取得とクラスタリングについて話しました。取得ベースライン・アプローチは、現在の最新のモデルを上回ります。最後に、シングルビュー3Dオブジェクト・リコンストラクションは、AIコミュニティで最もホットなトピックであり、最も研究されているトピックの1つであり、過去数年で大きな進歩を遂げてきましたが、シングルビュー3Dオブジェクト・リコンストラクションはまだ完璧ではなく、将来の数年間に克服すべき重大な課題が残っています。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。