AIモデルとプラットフォーム

Paint3D:イメージ生成におけるライトニングレス拡散モデル

mm
Unite.AI を Google の優先ソースに追加

ディープジェネレーティブAIモデルは、自然言語生成、3D生成、イメージ生成、音声合成など、驚くべき能力を示してきました。3Dジェネレーティブモデルは、さまざまな業界やアプリケーションを変革し、現在の3Dプロダクションの風景を変えています。しかし、多くの現在のディープジェネレーティブモデルは、複雑なワイヤリングやライトニングテクスチャーを持つメッシュが、従来のレンダリングパイプライン(Physically Based Rendering)と互換性がないという課題に直面しています。拡散ベースのモデルは、ライトニングテクスチャーを持たない3Dアセットを生成する能力が優れていますが、3Dオブジェクトの形状を完全に理解することができません。

この記事では、Paint3Dという、新しい粗密なフレームワークについて説明します。Paint3Dは、視覚的またはテキスト入力に基づいて、テクスチャーが付いていない3Dメッシュに対して、多様で高解像度の2K UVテクスチャーマップを生成することができます。Paint3Dの主な課題は、照明情報を埋め込まない高品質のテクスチャーを生成することです。Paint3Dフレームワークは、事前トレーニングされた2D拡散モデルを使用して、多視点テクスチャー融合を実行し、初期の粗いテクスチャーマップを生成します。しかし、2Dモデルは、3D形状を完全に表現できないため、テクスチャーマップには照明の影響が残る可能性があります。

この記事では、Paint3Dフレームワークの詳細について説明します。Paint3Dフレームワークは、粗密なテクスチャー生成モデルであり、事前トレーニングされたジェネレーティブAIモデルとイメージ生成の強力なプロンプトガイダンスを利用して、3Dオブジェクトをテクスチャー化します。最初の段階では、Paint3Dは、多視点イメージを事前トレーニングされた2Dイメージ拡散モデルからサンプリングし、初期のテクスチャーマップを生成します。2番目の段階では、Paint3Dは、照明の影響を除去し、形状に応じた不完全な領域を精製するために、拡散プロセスをUV空間で実行します。

Paint3Dフレームワークは、多様で高解像度の2K UVテクスチャーマップを生成することができます。Paint3Dは、テクスチャー生成タスクでStable Diffusionテキストイメージモデルを使用し、イメージエンコーダーコンポーネントはイメージ条件を管理します。Paint3Dフレームワークは、ControlNetドメインエンコーダーを使用して、イメージインペイント、深度処理、ハイデフィニションイメージなどの条件タスクを実行します。

Paint3D:概要

ディープジェネレーティブAIモデルは、自然言語生成、3D生成、イメージ生成など、驚くべき能力を示してきました。しかし、多くの現在のディープジェネレーティブモデルは、複雑なワイヤリングやライトニングテクスチャーを持つメッシュが、従来のレンダリングパイプラインと互換性がないという課題に直面しています。Paint3Dフレームワークは、粗密なテクスチャー生成モデルであり、事前トレーニングされたジェネレーティブAIモデルとイメージ生成の強力なプロンプトガイダンスを利用して、3Dオブジェクトをテクスチャー化します。

方法とアーキテクチャ

Paint3Dフレームワークは、条件入力(イメージやプロンプト)に基づいて、3Dモデルに対して多様で高品質のテクスチャーを生成するために、テクスチャーマップを生成し、精製します。以下のイメージは、Paint3Dフレームワークのアーキテクチャを示しています。

ステージ1:粗いテクスチャー生成

初期の粗いテクスチャー生成段階では、Paint3Dは、事前トレーニングされた2Dイメージ拡散モデルを使用して、多視点イメージをサンプリングし、初期のテクスチャーマップを生成します。この段階では、3Dメッシュの可視領域から開始し、最初のカメラビューからテクスチャーを生成します。次に、テクスチャーイメージをサンプリングし、3Dメッシュの表面に投影します。このプロセスは、繰り返し実行され、不完全な領域を埋め合わせるために、深度認識イメージインペイントエンコーダーを使用します。

ステージ2:UV空間でのテクスチャー精製

粗いテクスチャーマップを生成した後、Paint3Dは、UV空間での拡散プロセスを実行して、テクスチャーマップを精製します。この段階では、照明の影響を除去し、形状に応じた不完全な領域を精製します。Paint3Dは、位置情報を使用して、テクスチャーの断片を接続し、UV空間でのテクスチャー精製を実行します。

Paint3D:実験と結果

Paint3Dフレームワークは、Stable Diffusionテキストイメージモデルを使用して、テクスチャー生成タスクを実行します。Paint3Dは、ControlNetドメインエンコーダーを使用して、イメージインペイント、深度処理、ハイデフィニションイメージなどの条件タスクを実行します。以下のイメージは、Paint3Dフレームワークの実験結果を示しています。

テキストからテクスチャーへの比較

Paint3Dフレームワークの性能を評価するために、テキストプロンプトに基づいてテクスチャーを生成し、他のフレームワーク(Text2Tex、TEXTure、LatentPaint)と比較しました。結果は、以下のイメージに示されています。

イメージからテクスチャーへの比較

Paint3Dフレームワークの性能を評価するために、イメージプロンプトに基づいてテクスチャーを生成し、他のフレームワーク(TEXTure)と比較しました。結果は、以下のイメージに示されています。

最終的な考え

この記事では、Paint3Dという、新しい粗密なフレームワークについて説明しました。Paint3Dは、視覚的またはテキスト入力に基づいて、テクスチャーが付いていない3Dメッシュに対して、多様で高解像度の2K UVテクスチャーマップを生成することができます。Paint3Dフレームワークは、粗密なテクスチャー生成モデルであり、事前トレーニングされたジェネレーティブAIモデルとイメージ生成の強力なプロンプトガイダンスを利用して、3Dオブジェクトをテクスチャー化します。Paint3Dは、照明の影響を除去し、形状に応じた不完全な領域を精製するために、拡散プロセスをUV空間で実行します。結果は、Paint3Dフレームワークが、他のフレームワークよりも優れた性能を示していることを示しています。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。