AIモデルとプラットフォーム
ニューラルパーツ:意味のある推論幾何学のためのプリミティブの分解

静的な単一の画像から3D幾何学を生成するシステムは近年増えているが、得られるオブジェクトは「融合」されたもので、部分が全体にどのように貢献するかを反映する意味のあるスキーマがない。
有意義な部分の分割を持つ階層的な推論モデルを生成する理由は、いくつかある。例えば、産業分析、医療研究および画像処理、ビデオゲーム、シミュレーター、VR/AR環境の自動幾何学生成、視覚効果のリギングなどである。
最近開発された方法、例えばスーパークアッドリクスの形状解析は、満足のいく結果をもたらさず、キューブスタイルの示唆的なスライシングを超えて進歩していない。

スーパークアッドリクスや他のアプローチによるセグメンテーションは、推論画像の粗いまたは広い部分を提供する。 ソース:https://www.youtube.com/watch?v=6WK3B0IZJsw
しかし、マックス・プランク研究所の新しい研究、『ニューラルパーツ:可逆ニューラルネットワークを用いた表現力のある3D形状抽象』は、意味のあるセクションを作成する新しいニューラルプリミティブ3D表現システムを提供する。

以前の方法は大きな推論オブジェクトを分解できるが、意味のある方法ではありません。右側のニューラルパーツ方法は、より実用的である。 ソース:https://paschalidoud.github.io/neural_parts
セグメンテーションは、可逆ニューラルネットワーク(INN)を用いて行われ、条件付きホメオモルフィズムを用いてベース幾何学的形状をプリミティブに変形し、その逆も行い、両方向にトポロジカルな階層を計算する。各プリミティブ形状は、学習可能なプリミティブ埋め込みと関連付けられており、各プリミティブの形状埋め込みを生成するために使用される。

アーキテクチャ
ニューラルパーツは、再構築の品質とプリミティブの完全性のバランスを取る必要がある。複雑なプリミティブは、システムを複雑な分解に向かわせるため、アーキテクチャはこれらの相反する考慮事項を優雅に乗り越えるように設計されている。
ニューラルパーツのアーキテクチャは、入力ベクトルの特徴抽出と、形状埋め込みによって条件付けられるホメオモルフィズムコンポーネントで構成される。
特徴抽出の最初のセクションでは、ResNet-18コンポーネントを使用して特徴画像を抽出する。ホメオモルフィズムコンポーネントでは、実数値の非体積保存変換(real NVP)モジュールを使用する。
評価
システムは、2017年のダイナミックFAUST(D-FAUST)、2019年のFreiHAND、およびスタンフォード大学の2015年のShapeNetの3つのデータセットでテストされた。D-FAUSTには、人間を中心としたメッシュが38,640個含まれており、比較に適していた。FreiHANDの最初の5000個のハンドポーズは、メッシュを生成するために使用された。ShapeNetの場合、研究者はスタンフォード大学の研究者によって2016年に概説されたカテゴリ固有のトレーニングを実施した。
テストは、スーパークアッドリクス、CvxNet、およびH-SQsを含むプリミティブベースの方法に対して実行された。
ShapeNetの下で、研究者は、Neural Partsモデルが5個および25個のプリミティブレベルでCvxNetよりも正確な再構築をもたらしたことを発見した。データベース内のいくつかのより単純なオブジェクト、例えば椅子、には、有意義な分解のために十分な幾何学的特徴がない。

FreiHANDの場合、Neural Partsは、より幾何学的に正確な再構築をもたらし、親指の位置などの細かい特徴をよりよく捉えた。研究者は、CvxNetとSQsは、より一般的なコア構造に焦点を当てており、これらの詳細を欠いていることを指摘する。

ダイナミックFAUSTの場合、CvxNetとSQsは、データから推論された人間の体の完全性を捉えるために5個のプリミティブを使用してNeural Partsの出力と比較された。Neural Partsは、トポロジーの基本を犠牲にすることなく、より滑らかなセグメンテーションを達成した。

将来の研究
研究者は、ターゲットメッシュを直接提供しない研究にニューラルパーツを拡張することを意図しており、可微分可能なレンダリング技術を使用する。ニューラルパーツフレームワークで現在使用されているベーススフィアプリミティブに加えて、研究者はより複雑で表現力のある幾何学的プリミティブの使用を検討している。













