AIモデルとプラットフォーム
Paint3D : ライティングレス拡散モデルによる画像生成
AI生成モデル、特に深層生成AIモデルの急速な発展は、自然言語生成、3D生成、画像生成、音声合成などの分野で大きな進歩をもたらしました。これらのモデルは、さまざまな業界での3Dプロダクションを革命的に変えました。しかし、多くのモデルは、複雑な配線と生成されたメッシュが従来のレンダリングパイプライン、たとえばPhysically Based Rendering (PBR)と互換性がないという課題に直面しています。拡散ベースのモデル、特にライティングテクスチャのないモデルは、3Dアセット生成で印象的な多様性を示していますが、映画、ゲーム、AR/VRなどの分野での3Dフレームワークを強化しています。
この記事では、Paint3Dという、視覚的またはテキスト入力に基づいて、テクスチャのない3Dメッシュ用の多様で高解像度の2K UVテクスチャマップを生成するための新しいフレームワークを紹介します。Paint3Dの主な課題は、埋め込まれた照明なしで高品質のテクスチャを生成することです。これにより、ユーザーはモダンなグラフィックスパイプライン内でテクスチャを再編集または再照明できます。Paint3Dは、多視点テクスチャ融合用に事前にトレーニングされた2D拡散モデルを使用して、初期の粗いテクスチャマップを生成します。しかし、これらのマップは、2Dモデルの制限により、照明の影響を無効にし、3D形状を完全に表現できないため、照明のアーティファクトや不完全な領域を示すことがあります。Paint3Dのしくみ、構造、他の深層生成フレームワークとの比較について詳しく見ていきましょう。始めましょう。
Paint3D : はじめに
深層生成AIモデルの自然言語生成、3D生成、画像生成タスクにおける能力はよく知られており、実際のアプリケーションで実装されています。3D生成業界を革命的に変えました。にもかかわらず、現代の深層生成AIフレームワークは、従来のレンダリングパイプライン、たとえばPBRやPhysically Based Renderingと互換性のない複雑な配線と混沌とした照明テクスチャを持つメッシュを生成します。深層生成AIモデルのように、テクスチャ合成も急速に進歩しています。特に、2D拡散モデルを使用してテキスチャを生成する分野でです。テクスチャ合成モデルは、事前にトレーニングされた深度から画像への拡散モデルを使用して、テキスチャを生成するためにテキスト条件を効果的に使用します。しかし、これらのアプローチは、事前に照明されたテクスチャに問題を抱えています。これらのテクスチャは、最終的な3D環境のレンダリングに大きな影響を与え、一般的なワークフローで照明を変更すると照明エラーを引き起こす可能性があります。

観察すると、自由な照明のテクスチャマップは従来のレンダリングパイプラインと同期して正確な結果をもたらしますが、事前に照明されたテクスチャマップは、照明を変更すると不適切な影が含まれることがあります。一方、3Dデータでトレーニングされたテクスチャ生成フレームワークは、特定の3Dオブジェクトの全体的な幾何学を理解することによってテクスチャを生成する別のアプローチを提供します。ただし、これらのフレームワークは、トレーニングデータ以外の3Dオブジェクトにモデルを適用する能力が制限されているため、汎化能力が不足しています。
現在のテクスチャ生成モデルは、2つの重要な課題に直面しています。1つ目は、画像のガイダンスや多様なプロンプトを使用して、さまざまなオブジェクトに対するより広い汎化度を達成することです。2つ目は、事前にトレーニングされた結果から結合された照明を除去することです。事前に照明されたテクスチャは、レンダリングエンジン内のテクスチャ化されたオブジェクトの最終的な結果と干渉する可能性があります。また、事前にトレーニングされた2D拡散モデルは、2Dビュー領域でのみ結果を提供するため、3D形状を完全に表現することができず、テクスチャの連続性を維持することができません。
上記の課題により、Paint3Dフレームワークは、3Dオブジェクト用の二段階のテクスチャ拡散モデルを開発しようとします。このモデルは、さまざまな事前にトレーニングされた生成モデルに汎化し、ビューの連続性を維持しながら、照明のないテクスチャを生成することを学習します。
Paint3Dは、粗いから細かいまでの二段階のテクスチャ生成モデルです。事前にトレーニングされた生成AIモデルの強力なプロンプトガイダンスと画像生成能力を利用して、3Dオブジェクトをテクスチャ化することを目指しています。最初の段階では、Paint3Dフレームワークは、事前にトレーニングされた深度認識可能な2D画像拡散モデルを使用して、多視点画像を逐渐的にサンプリングし、多様なプロンプトから高品質で豊富なテクスチャ結果を汎化できるようにします。モデルは、これらの画像を3Dメッシュの表面に投影して、初期のテクスチャマップを生成します。2段階目では、モデルは、照明の影響を除去することに特化した拡散モデルのアプローチを実装して、照明のないテクスチャを生成します。プロセス全体を通じて、Paint3Dフレームワークは、意味的に一貫性のある、高品質の2Kテクスチャを生成し、固有の照明効果を除去します。

要約すると、Paint3Dは、テキストと画像の条件付き入力で、テクスチャのない3Dメッシュ用の多様で、照明のない、高解像度の2K UVテクスチャマップを生成するための、粗いから細かいまでの新しい生成AIモデルです。グラフィックス編集タスクと合成タスクで、最先端のパフォーマンスを提供します。
方法とアーキテクチャ
Paint3Dフレームワークは、望ましい条件付き入力、画像やプロンプトを使用して、3Dモデル用の多様で高品質のテクスチャマップを逐渐的に生成および精製します。以下の画像に示すようにです。

粗い段階では、Paint3Dモデルは、事前にトレーニングされた2D画像拡散モデルを使用して多視点画像をサンプリングし、画像を3Dメッシュの表面に投影して初期のテクスチャマップを生成します。2段階目、つまり精製段階では、Paint3Dモデルは、UV空間で拡散プロセスを使用して粗いテクスチャマップを強化し、高品質で、インペインティング、照明のない機能を実現し、最終的なテクスチャの視覚的な魅力をさらに高めます。
ステージ1: 逐渐的な粗いテクスチャ生成
逐渐的な粗いテクスチャ生成段階では、Paint3Dモデルは、事前にトレーニングされた深度認識可能な2D拡散モデルを使用して、3Dメッシュ用の粗いUVテクスチャマップを生成します。具体的には、モデルは、さまざまなカメラビューを使用して、深度マップをレンダリングし、深度条件を使用して、画像拡散モデルから画像をサンプリングし、画像を3Dメッシュの表面に投影します。フレームワークは、レンダリング、サンプリング、投影アプローチを交互に実行して、テクスチャメッシュのの一貫性を高め、最終的に、テクスチャマップの逐渐的な生成を促進します。
モデルは、3Dメッシュの可視領域のテクスチャを生成し始め、最初のビューから3Dメッシュを深度マップにレンダリングします。モデルは、外観条件と深度条件の両方に基づいて、テクスチャ画像をサンプリングし、画像を3Dメッシュに投影します。ビューポイントについては、Paint3Dモデルは、画像ペインティングアプローチを使用して、テクスチャサンプリングプロセスを実行することによって、少し異なるアプローチを実行します。さらに、モデルは、前のビューからのテクスチャ化された領域を考慮して、レンダリングプロセスを実行し、深度画像のみを出力するのではなく、現在のビューで部分的にカラー化されたRGB画像と、カラー化されていないマスクを出力します。
モデルは、インペインティングエンコーダを備えた深度認識可能な画像インペインティングモデルを使用して、RGB画像内のカラー化されていない領域を埋めます。モデルは、インペインティングされた画像を3Dメッシュに投影して、現在のビューからのテクスチャマップを生成し、最終的に、粗い構造マップ全体を生成します。最後に、モデルは、テクスチャサンプリングプロセスをシーンまたはオブジェクトの複数のビューに拡張します。具体的には、モデルは、対称的なビューからのカメラのペアを使用して、初期のテクスチャサンプリングのために2つの深度マップをキャプチャし、2つの深度マップを組み合わせて深度グリッドを構成し、単一の深度画像を深度グリッドに置き換えて、多視点深度認識可能なテクスチャサンプリングを実行します。
ステージ2: UV空間でのテクスチャ精製
粗いテクスチャマップの外観は論理的ですが、テクスチャの穴やレンダリングプロセス中に発生する照明の影などの課題に直面しています。Paint3Dモデルは、粗いテクスチャマップに基づいて、UV空間で拡散プロセスを実行して、これらの問題を軽減し、テクスチャマップの視覚的な魅力をさらに高めようとします。ただし、UV空間でテクスチャマップを精製することで、テクスチャの断続性が生じます。テクスチャマップは、3D表面のテクスチャのUVマッピングによって生成されるため、UV空間では連続したテクスチャを一連の個別のフラグメントに分割します。フラグメンテーションの結果、モデルはフラグメント間の3D隣接関係を学習することが困難になり、テクスチャの断続性の問題が生じます。
モデルは、テクスチャフラグメントの隣接情報のガイダンスに基づいて、UV空間で拡散プロセスを実行してテクスチャマップを精製します。重要なのは、UV空間では、位置マップがテクスチャフラグメントの3D隣接情報を表すということです。モデルは、各非背景要素を3D点座標として扱います。拡散プロセス中、モデルは3D隣接情報を結合するために、事前にトレーニングされた画像拡散モデルに位置マップエンコーダを追加します。新しいエンコーダは、ControlNetフレームワークの設計に似ており、画像拡散モデルのエンコーダと同じアーキテクチャを持ち、ゼロ畳み込み層で接続されています。さらに、テクスチャ拡散モデルは、テクスチャと位置マップで構成されるデータセットでトレーニングされ、ノイズの付加されたノイズラテントを予測することを学習します。モデルは、位置エンコーダを最適化し、画像拡散タスクのためにトレーニングされた除去器を凍結します。
モデルは、位置の条件付きエンコーダと他のエンコーダを同時に使用して、UV空間での精製タスクを実行します。この点で、モデルには2つの精製能力があります。UVHDまたはUV High DefinitionとUVインペインティングです。UVHDメソッドは、テクスチャマップの視覚的な魅力を高めることを目的としています。UVHDを実現するために、モデルは、画像強化エンコーダと位置エンコーダを拡散モデルで使用します。モデルは、UVインペインティングメソッドを使用して、UV平面内のテクスチャの穴を埋めます。これは、レンダリング中に発生する自己遮蔽の問題を避けることができます。精製段階で、Paint3Dモデルは、まずUVインペインティングを実行し、次にUVHDを実行して、最終的な精製されたテクスチャマップを生成します。2つの精製方法を統合することで、Paint3Dフレームワークは、完全で多様で高解像度で照明のないUVテクスチャマップを生成することができます。
Paint3D : 実験と結果
Paint3Dモデルは、テクスチャ生成タスクを支援するために、Stable Diffusionテキストから画像へのモデルを使用します。画像条件を処理するために、画像エンコーダコンポーネントを使用します。さらに、条件付き制御、画像インペインティング、深度、画像の高解像度化を強化するために、ControlNetドメインエンコーダを使用します。モデルは、PyTorchフレームワークで実装され、レンダリングとテクスチャ投影はKaolinで実装されています。
テキストからテクスチャへの比較
パフォーマンスを分析するために、テキストプロンプトに基づいてPaint3Dのテクスチャ生成効果を評価し、Text2Tex、TEXTure、LatentPaintなどの最先端フレームワークと比較します。以下の画像からわかるように、Paint3Dフレームワークは、高品質のテクスチャの詳細を生成することに優れています。また、照明のないテクスチャマップを合理的に生成します。

比較すると、LatentPaintフレームワークは、ぼやけたテクスチャを生成する傾向があり、視覚的な効果が最適化されていません。一方、TEXTureフレームワークは、明確なテクスチャを生成しますが、滑らかさに欠け、目立つスピスやシームが存在します。最後に、Text2Texフレームワークは、滑らかなテクスチャを生成することに優れていますが、繊細な詳細を持つファインテクスチャを生成するパフォーマンスを再現することができません。
以下の画像は、Paint3Dフレームワークを最先端フレームワークと数量的に比較しています。

観察すると、Paint3Dフレームワークは、すべての既存のモデルを大幅に上回っており、FIDベースラインでは約30%、KIDベースラインでは約40%の改善を示しています。FIDとKIDベースラインスコアの改善は、Paint3Dがさまざまなオブジェクトやカテゴリで高品質のテクスチャを生成する能力を示しています。
画像からテクスチャへの比較
Paint3Dの生成能力を視覚的なプロンプトで生成するために、TEXTureモデルをベースラインとして使用します。前述のように、Paint3Dモデルは、Stable Diffusionのテキストから画像へのモデルから画像エンコーダを使用します。以下の画像からわかるように、Paint3Dフレームワークは、優れたテクスチャを生成することに優れています。また、画像条件に対する忠実性を維持することができます。

一方、TEXTureフレームワークは、Paint3Dと同等のテクスチャを生成することができますが、画像条件のテクスチャの詳細を正確に表現することができません。さらに、以下の画像に示すように、Paint3Dフレームワークは、TEXTureフレームワークと比較して、FIDとKIDベースラインスコアが改善されています。前者は40.83から26.86に減少し、後者は9.76から4.94に減少しています。

最終的な考え
この記事では、Paint3Dという、視覚的またはテキスチャ入力に基づいて、テクスチャのない3Dメッシュ用の多様で高解像度の2K UVテクスチャマップを生成するための新しいフレームワークを紹介しました。Paint3Dフレームワークの主な特徴は、画像やテキスチャ入力に基づかずに、意味的に一貫した照明のない高解像度2K UVテクスチャを生成できることです。粗いから細かいまでのアプローチにより、Paint3Dフレームワークは、照明のない多様で高解像度のテクスチャマップを生成し、現在の最先端フレームワークよりも優れたパフォーマンスを提供します。












