AIモデルとプラットフォーム

ドリームクラフト3D:階層型3D生成とブートストラップ拡散事前知識

mm
Unite.AI を Google の優先ソースに追加

生成的なAIモデルは、AI業界内でしばらくの間議論の的となってきました。2D生成モデルの最近の成功は、今日の視覚コンテンツを作成する方法に道を開きました。2D生成モデルで顕著な成功を収めたAIコミュニティは、3Dコンテンツの生成という大きな課題に直面しています。特に、視覚ゲーム、アプリケーション、バーチャルリアリティ、さらには映画によって3D生成コンテンツの需要が史上最高水準に達している現在、3Dコンテンツの生成は重要な課題です。3D生成AIフレームワークが特定のカテゴリやタスクで一定の成果を収めていますが、3Dオブジェクトを効率的に生成することはできません。これは、フレームワークをトレーニングするための大量の3Dデータが不足しているためです。最近、開発者は事前トレーニングされたテキストからイメージのAI生成モデルを利用することを提案し、このアプローチは有望な結果を示しています。

この記事では、DreamCraft3Dフレームワークについて説明します。DreamCraft3Dフレームワークは、高品質の3Dオブジェクトを生成する階層型3Dコンテンツ生成モデルです。DreamCraft3Dフレームワークは、2Dリファレンスイメージを使用して、幾何学的スカルプティング段階を導き、テクスチャを一貫性のある方法で強化します。さらに、DreamCraft3Dフレームワークは、幾何学的スカルプティングに貢献する一貫したレンダリングを支援するための、ビュー依存の拡散モデルを使用します。

DreamCraft3Dフレームワークの詳細について説明します。さらに、事前トレーニングされたテキストからイメージ(T2I)モデルを使用して3Dコンテンツを生成する概念を探り、DreamCraft3Dフレームワークがこのアプローチを使用してリアルな3Dコンテンツを生成する方法を調べます。

DreamCraft3D:紹介

DreamCraft3Dは、3Dコンテンツを生成するための階層型パイプラインです。DreamCraft3Dフレームワークは、テキストプロンプトを使用して、高品質の2Dイメージを生成するために、最先端のT2Iまたはテキストからイメージの生成フレームワークを利用しようとします。 このアプローチにより、DreamCraft3Dフレームワークは、テキストプロンプトで記述された視覚的意味を表現するための最先端の2D拡散モデルの機能を最大限に活用しながら、2D AI生成フレームワークによって提供される創造的自由を維持できます。 生成されたイメージは、幾何学的テクスチャブーストと幾何学的スカルプティング段階を使用して3Dに変換され、各段階で特殊なテクニックが適用され、問題を分解することで支援されます。

幾何学的スカルプティング段階では、DreamCraft3Dフレームワークは、リファレンスイメージの外観に一致する3D幾何学的形状を生成することに重点を置き、同時に、さまざまな視点からの妥当性を確保します。幾何学的スカルプティング段階では、リファレンスビューでの写真測量的差異を罰則することで、リファレンスイメージからのガイダンスを効果的に利用します。さらに、シーンのスパース性を促進するために、シルエットをレンダリングするマスク損失を実装します。ただし、後方ビューでの外観と意味のの一貫性を維持することは依然として課題であり、したがって、フレームワークは、詳細で一貫した幾何学的形状を生成するために、追加のアプローチを採用します。

DreamCraft3Dフレームワークは、3D最適化方法が、個々のビューの監督のみに依存しているため、制約が少ないことを認識しています。したがって、DreamCraft3Dフレームワークは、Zero-1-to-3と呼ばれる、ビュー依存の拡散モデルを使用します。Zero-1-to-3フレームワークは、より大きなスケールの3Dデータ資産でトレーニングされたため、ビューの認識に優れています。さらに、Zero-1-to-3フレームワークは、リファレンスイメージが与えられたときに、カメラのポーズに関連してイメージを想像するために、ファインチューンされた拡散モデルです。

事前トレーニングされたT2Iまたはテキストからイメージモデルを利用する

3Dコンテンツを生成するために事前トレーニングされたT2Iまたはテキストからイメージモデルを利用するというアイデアは、2022年にDreamFusionフレームワークによって初めて提案されました。DreamFusionフレームワークは、SDS(スコアの蒸留サンプル)損失を適用して、3Dフレームワークを最適化し、ランダムな視点からのレンダリングが、事前トレーニングされたテキストからイメージの拡散フレームワークによって解釈されるテキスト条件付きイメージ分布と一致するようにしました。DreamFusionアプローチは、ある程度の成果を収めたものの、ぼやけと過剰な彩度の2つの大きな問題がありました。これらの問題に対処するために、最近の研究では、2Dの蒸留損失を改善するために、段階的な最適化戦略を実装しています。

しかし、最近の成功にもかかわらず、これらのフレームワークは、複雑なコンテンツを合成する2D生成フレームワークの能力に匹敵することはできません。さらに、これらのフレームワークは、個々のレンダリングが妥当であるのに対し、全体として見たときにスタイルと意味の的一貫性が欠けている「ヤヌス問題」という課題に直面しています。

これらの問題に対処するために、DreamCraft3Dフレームワークは、3Dコンテンツ生成のための包括的な階層型パイプラインを探索し、概念を紙に書き出すことから始めるアーティストの手順からインスピレーションを得ています。アーティストは、2Dの草案をスケッチし、粗い幾何学的形状を彫り、詳細な幾何学的詳細を精密化し、高品質のテクスチャを描きます。同様に、DreamCraft3Dフレームワークは、3Dコンテンツまたはイメージ生成タスクを、管理可能な段階に分解します。テキストプロンプトを使用して、高品質の2Dイメージを生成し、次に、テクスチャブーストと幾何学的スカルプティングを使用して、イメージを3D段階に引き上げます。プロセスを段階に分割することで、DreamCraft3Dフレームワークは、階層型生成の潜在能力を最大化し、最終的に優れた品質の3Dイメージ生成につながります。

最初の段階では、DreamCraft3Dフレームワークは、2Dイメージをリファレンスとして使用して、妥当で一貫した3D幾何学的形状を生成します。さらに、この段階では、SDS損失を使用して、リファレンスビューでの写真測量的損失と新しいビューに対する損失を促進します。フレームワークは、リファレンスイメージを使用して新しいビューの分布をモデル化するために、Zero-1-to-3と呼ばれるビュー依存のイメージ変換モデルを利用します。さらに、フレームワークは、幾何学的精密化のために、暗黙の表面表現からメッシュ表現への移行を実装します。

DreamCraft3Dフレームワークの2番目の段階では、ブートストラップスコア蒸留アプローチを使用して、イメージのテクスチャを強化します。現在のビュー依存の拡散モデルは、3Dデータの量が限られているため、しばしば2D拡散モデルのパフォーマンスや忠実度に匹敵することができません。DreamCraft3Dフレームワークは、最適化対象の3Dインスタンスのマルチビューアイメージを使用して拡散モデルをファインチューンし、テクスチャのリアリズムを高めながら、ビューの一貫性を維持することを可能にします。拡散モデルがこれらのマルチビューレンダリングでトレーニングされると、3Dテクスチャ最適化のためのより優れたガイダンスを提供し、DreamCraft3Dフレームワークがテクスチャの詳細を維持しながら、一貫性を維持することを可能にします。

上のイメージからわかるように、DreamCraft3Dフレームワークは、リアルなテクスチャと複雑な幾何学的構造を持つ、創造的な3Dイメージとコンテンツを生成する能力があります。最初のイメージは、アニメキャラクターのSon Gokuのボディと、走る野生の猪の頭を組み合わせたものです。2番目のイメージは、探偵の服を着たビーグルです。以下は、追加の例です。

DreamCraft3D:動作とアーキテクチャ

DreamCraft3Dフレームワークは、テキストプロンプトを使用して、高品質の2Dイメージを生成するために、最先端のT2Iまたはテキストからイメージの生成フレームワークを利用しようとします。 このアプローチにより、DreamCraft3Dフレームワークは、テキストプロンプトで記述された視覚的意味を表現するための最先端の2D拡散モデルの機能を最大限に活用しながら、2D AI生成フレームワークによって提供される創造的自由を維持できます。 生成されたイメージは、幾何学的テクスチャブーストと幾何学的スカルプティング段階を使用して3Dに変換され、各段階で特殊なテクニックが適用され、問題を分解することで支援されます。以下のイメージは、DreamCraft3Dフレームワークの動作を簡潔にまとめています。

テクスチャブーストと幾何学的スカルプティング段階の重要な設計上の考慮事項について、詳細に説明します。

幾何学的スカルプティング

幾何学的スカルプティングは、DreamCraft3Dフレームワークが、リファレンスイメージの外観に一致する3D幾何学的形状を生成する最初の段階です。リファレンスビューでの写真測量的損失を罰則することで、リファレンスイメージからのガイダンスを効果的に利用します。さらに、シーンのスパース性を促進するために、シルエットをレンダリングするマスク損失を実装します。ただし、後方ビューでの外観と意味のの一貫性を維持することは依然として課題であり、したがって、フレームワークは、詳細で一貫した幾何学的形状を生成するために、追加のアプローチを採用します。

3D認識拡散事前知識

3D最適化方法が、個々のビューの監督のみに依存しているため、制約が少ないことを認識しています。したがって、DreamCraft3Dフレームワークは、Zero-1-to-3と呼ばれる、ビュー依存の拡散モデルを使用します。Zero-1-to-3フレームワークは、より大きなスケールの3Dデータ資産でトレーニングされたため、ビューの認識に優れています。さらに、Zero-1-to-3フレームワークは、リファレンスイメージが与えられたときに、カメラのポーズに関連してイメージを想像するために、ファインチューンされた拡散モデルです。

進歩的なビュートレーニング

360度の自由なビューを直接導出すると、幾何学的アーティファクトや不一致(例:椅子の余分な脚)が発生する可能性があります。これは、単一のリファレンスイメージの曖昧さによるものです。 この課題に対処するために、DreamCraft3Dフレームワークは、トレーニングビューを進歩的に拡大し、確立された幾何学的形状を360度に伝播することで、結果を取得します。

拡散時間ステップのアニーリング

DreamCraft3Dフレームワークは、3D最適化の粗いから細かい進行に合わせて、拡散時間ステップのアニーリング戦略を採用します。最適化プロセスの開始時に、フレームワークは、大きな拡散時間ステップをサンプリングすることを優先し、全球的な構造を提供します。トレーニングプロセスが進むにつれて、フレームワークは、数百のイテレーションの間に、サンプリング範囲を線形にアニーリングします。アニーリング戦略により、フレームワークは、早期の最適化ステップで、妥当な全球的な幾何学的形状を確立し、後に構造の詳細を精密化できます。

詳細な構造の強化

DreamCraft3Dフレームワークは、最初に暗黙の表面表現を最適化して、粗い構造を確立します。次に、フレームワークは、この結果を使用して、テクスチャと幾何学の学習を分離するために、可変形テトラヘドラルグリッド(DMTet)を使用して、テクスチャ化された3Dメッシュ表現を初期化します。構造の強化が完了すると、モデルは、テクスチャのみを精密化することで、リファレンスイメージから得られた高周波の詳細を保存できます。

ブートストラップスコアサンプリングを使用したテクスチャブースト

幾何学的スカルプティング段階では、詳細で一貫した幾何学的形状を生成することに重点が置かれますが、テクスチャはある程度ぼやけます。これは、フレームワークが粗い解像度で動作する2D事前知識モデルと、3D拡散モデルによって提供される制限されたシャープネスに依存しているためです。さらに、過剰な彩度や過剰なスムージングなどの一般的なテクスチャの問題が、クラスフリーのガイダンスの制限により発生する可能性があります。

DreamCraft3Dフレームワークは、VSD(変分スコア蒸留)損失を使用して、テクスチャのリアリズムを高めます。フレームワークは、この段階で、高解像度のグラデーションを取得するために、Stable Diffusionモデルを使用します。さらに、フレームワークは、テトラヘドラルグリッドを固定して、メッシュの全体的な構造を最適化し、リアリスティックなレンダリングを促進します。学習段階で、DreamCraft3Dフレームワークは、Zero-1-to-3フレームワークを使用しません。なぜなら、テクスチャの品質に悪影響を及ぼし、不一致なテクスチャが発生し、異常な3D出力につながる可能性があるからです。

実験と結果

DreamCraft3Dフレームワークのパフォーマンスを評価するために、フレームワークは、現在の最先端フレームワークと比較され、定性的および定量的な結果が分析されます。

ベースラインモデルとの比較

パフォーマンスを評価するために、DreamCraft3Dフレームワークは、DreamFusion、Magic3D、ProlificDreamer、Magic123、Make-it-3Dを含む5つの最先端フレームワークと比較されます。テストベンチマークは、300の入力イメージで構成され、実世界のイメージと、Stable Diffusionフレームワークによって生成されたイメージの混合です。各イメージには、テキストプロンプト、予測された深度マップ、および前景のアルファマスクがあります。フレームワークは、実世界のイメージのテキストプロンプトを、イメージキャプションフレームワークから取得します。

定性的分析

以下のイメージは、DreamCraft3Dフレームワークと現在のベースラインモデルを比較しています。テキストから3Dへのアプローチに依存するフレームワークは、多視点の一貫性の問題に直面していることがわかります。

一方で、ProlificDreamerフレームワークはリアルなテクスチャを提供しますが、妥当な3Dオブジェクトを生成することに失敗します。Image-to-3D方法に依存するMake-it-3Dフレームワークは、高品質の前面ビューを生成しますが、イメージの理想的な幾何学的形状を維持することはできません。Magic123フレームワークによって生成されたイメージは、幾何学的正規化が改善されていますが、過剰に彩度が高く、スムージングされた幾何学的テクスチャと詳細を生成します。DreamCraft3Dフレームワークは、ブートストラップスコア蒸留方法を使用することで、意味の一貫性を維持し、想像力の多様性を高めることができます。

定量的分析

入力リファレンスイメージに似た、かつさまざまな視点からの一貫した意味を伝える、魅力的な3Dイメージを生成するために、DreamCraft3Dフレームワークが使用するテクニックは、ベースラインモデルと比較され、評価プロセスでは、4つのメトリックが使用されます。リファレンスビューでの忠実度を測定するPSNRとLPIPS、ピクセルレベルの一致性を評価するコンテキスト距離、意味の一貫性を推定するCLIPです。結果は以下のイメージに示されています。

結論

この記事では、DreamCraft3Dについて説明しました。DreamCraft3Dフレームワークは、3Dコンテンツを生成するための階層型パイプラインです。DreamCraft3Dフレームワークは、テキストプロンプトを使用して、高品質の2Dイメージを生成するために、最先端のT2Iまたはテキストからイメージの生成フレームワークを利用しようとします。 このアプローチにより、DreamCraft3Dフレームワークは、テキストプロンプトで記述された視覚的意味を表現するための最先端の2D拡散モデルの機能を最大限に活用しながら、2D AI生成フレームワークによって提供される創造的自由を維持できます。 生成されたイメージは、幾何学的テクスチャブーストと幾何学的スカルプティング段階を使用して3Dに変換され、各段階で特殊なテクニックが適用され、問題を分解することで支援されます。DreamCraft3Dフレームワークは、3Dアセットを高忠実度で生成し、複数の視点から見たときに一貫性のあるテクスチャを生成することができます。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。