AIモデルとプラットフォーム
Uni3D:拡張可能な3D表現の探求
最近の研究では、テキストと視覚の表現を拡張することが主要な焦点となっている。近年の研究の成果は、言語学習と視覚の分野で革命をもたらした。ただし、テキストと視覚の表現の拡張が人気を博しているにもかかわらず、3Dシーンとオブジェクトの表現の拡張については十分に議論されていない。
本日、Uni3Dという3D基礎モデルについて議論する。Uni3Dフレームワークは、2D初期化されたViTフレームワークを使用して、画像とテキストの特徴を3D点群の特徴と一致させるように設計されている。
Uni3Dフレームワークは、前提タスクとシンプルなアーキテクチャを使用して、事前学習済みの2Dモデルと画像テキスト一致モデルを初期化とターゲットとして活用する。これにより、2Dモデルの潜在能力を解放し、2D戦略を3D世界に拡張することができる。
この記事では、3DコンピュータビジョンとUni3Dフレームワークについて詳しく説明する。Uni3Dフレームワークのアーキテクチャと概念についても掘り下げる。
Uni3Dと3D表現学習:導入
近年、コンピュータビジョンはAI業界で最も投資が行われている分野の1つとなっている。2Dコンピュータビジョンフレームワークの重大な進歩に続き、開発者は3Dコンピュータビジョンに注目している。この分野、特に3D表現学習は、コンピュータグラフィックス、機械学習、コンピュータビジョン、数学を組み合わせて、3D幾何学の処理と理解を自動化する。3Dセンサーの急速な開発とAR/VR業界での広範な応用により、3D表現学習は注目を集めている。
既存のフレームワークは、3Dモデルアーキテクチャ、タスク指向のモデリング、学習目標について著しい進歩を示しているが、ほとんどが小規模なデータ、パラメータ、タスクシナリオで3Dアーキテクチャを探索している。スケーラブルな3D表現を学習し、さまざまな環境でのリアルタイムアプリケーションに適用するという課題は、ほとんど未解決のままである。
最近、大規模な事前学習済み言語モデルをスケーリングすることが自然言語処理の分野を革命的に変えるのに役立っていることがわかっている。最近の研究では、データとモデルスケーリングを使用して言語から2Dモデルの進歩を可能にする方法が示されており、開発者はこの成功を3D表現の学習に適用しようとしている。
Uni3Dは、スケーラブルで統一された3D事前学習フレームワークであり、70万件のテキスト、1000万件の画像、100万件の3D形状を使用して、6百万パラメータから10億パラメータまでスケーリングする。次の図は、Uni3Dフレームワークのゼロショット精度とパラメータの比較を示している。

Uni3Dフレームワークは、2D ViTまたはVision Transformerを3Dエンコーダーとして使用し、画像テキスト特徴と3D点群特徴を一致させるように事前学習する。Uni3Dフレームワークは、前提タスクとシンプルなアーキテクチャを使用して、事前学習済みの2Dモデルと画像テキスト一致モデルを初期化とターゲットとして活用する。これにより、2Dモデルの潜在能力を解放し、2D戦略を3D世界に拡張することができる。
以下のリストは、Uni3Dフレームワークのスケーラビリティと柔軟性を示している。
- 6百万パラメータから10億パラメータまでのモデルのスケーリング。
- 2D初期化からテキスト監視付きの自己教師あり学習への移行。
- テキスト画像ターゲットモデルのスケーリング:150百万パラメータから10億パラメータまで。
Uni3D:関連研究
Uni3Dフレームワークは、以前の3D表現学習と基礎モデルの研究からインスピレーションを得ている。
3D表現学習
3D表現学習は、3Dオブジェクトの理解のために点群を使用する手法である。この分野は最近、開発者によって多く探索されており、点群を自己教師あり学習で事前学習することができることがわかっている。ただし、これらの方法は限られたデータでしか機能せず、2DまたはNLPからの多モーダル表現を探索していない。
基礎モデル
開発者は、多モーダル表現をスケールアップし統一するための基礎モデルを設計することに尽力している。例えば、NLP分野では、事前学習済み言語モデルのスケーリングがNLP業界を革命的に変えるのに役立っている。さらに、2Dビジョン分野でも、データとモデルスケーリングを使用して言語から2Dモデルの進歩を可能にする方法が示されており、開発者はこの成功を3D表現の学習に適用しようとしている。
Uni3D:方法とアーキテクチャ

上記の図は、Uni3Dフレームワークの概要を示している。開発者は、70万件のテキスト、1000万件の画像、100万件の3D形状を使用して、6百万パラメータから10億パラメータまでスケーリングする。Uni3Dフレームワークは、2D ViTまたはVision Transformerを3Dエンコーダーとして使用し、画像テキスト特徴と3D点群特徴を一致させるように事前学習する。
Uni3Dフレームワークのスケーリング
以前の研究では、特定のモデルアーキテクチャを設計して、さまざまなアプリケーションでのパフォーマンスを向上させることに重点を置いていた。ただし、最近の研究では、3Dのスケーラブルな事前学習の可能性を探索しようとしている。Uni3Dフレームワークは、Vision Transformerに似たバニラトランスフォーマー構造を使用して、2DまたはNLPのスケーリング戦略を使用してモデルサイズをスケーリングすることができる。
Uni3Dの初期化
以前の研究では、3D表現のスケーリングと収束の困難さ、および過剰適合の問題に直面していた。有効なアプローチは、3Dバックボーンを特定の3D前提タスクで事前学習し、事前学習済みパラメータを初期化することである。ただし、このアプローチは、高いトレーニングコストを伴い、3Dデータの限られた量により、クロスモーダル学習のための強健な初期化を確立することが困難である。
多モーダル同期
Uni3Dフレームワークは、OpenShapeやULIPフレームワークに似たパラダイムを使用して、画像、言語、点群間の多モーダル同期を学習しようとしている。さらに、他の方法との公平な比較のために、Uni3DフレームワークはOpenShapeのアンサンブル3Dデータセットを使用する。
実験と結果
Uni3Dフレームワークは、さまざまな設定とタスクでテストされており、そのパフォーマンスはゼロショット、ファーショット、オープンワールド理解などで評価されている。
ゼロショット形状分類
Uni3Dフレームワークのゼロショット形状分類タスクのパフォーマンスを評価するために、開発者はModelNet、ScanObjNN、Objaverse-LVISベンチマークデータセットで実験を行っている。結果は図に示されているように、Uni3Dフレームワークは以前の最先端フレームワークを上回っている。
ファーショット線形プローブ
Uni3Dフレームワークの線形プローブ能力を評価するために、開発者はOpenShapeと同じ設定で実験を行っている。結果は図に示されているように、Uni3Dフレームワークは他の方法を上回っている。
オープンワールド理解
Uni3Dフレームワークのリアルタイムのオブジェクトと形状の理解能力を評価するために、開発者はScanNetとCLIPデータセットで実験を行っている。結果は図に示されているように、Uni3Dフレームワークは他の方法を上回っている。
クロスモーダル検索
Uni3Dフレームワークは、テキストまたは画像から3D形状を検索することができる。結果は図に示されているように、Uni3Dフレームワークはリアルタイムの画像から3D形状を検索することができる。
最終的な考え
この記事では、Uni3Dフレームワークについて説明した。Uni3Dフレームワークは、スケーラブルで統一された3D事前学習フレームワークであり、70万件のテキスト、1000万件の画像、100万件の3D形状を使用して、6百万パラメータから10億パラメータまでスケーリングする。開発者は、バニラトランスフォーマー構造を使用して、2DまたはNLPのスケーリング戦略を使用してモデルサイズをスケーリングすることができる。実験結果は、Uni3Dフレームワークがさまざまな設定で高い精度と効率を示すことを示している。












