AIモデルとプラットフォーム

ゼロ123++: 単一画像から一貫性のあるマルチビュー拡散ベースモデル

mm
Unite.AI を Google の優先ソースに追加

近年、AI生成モデルの性能、効率、生成能力が急速に進化しています。今日、生成AIモデルは、テキスト、画像、動画、GIFなど、さまざまな形式の2D、3Dメディアコンテンツを生成することができます。

本稿では、ゼロ123++フレームワークについて説明します。ゼロ123++フレームワークは、単一の画像入力から3D一貫性のあるマルチビュー画像を生成することを目的とした、画像条件付き拡散生成AIモデルです。ゼロ123++フレームワークは、事前学習済み生成モデルから最大の利点を得るために、さまざまなトレーニングと条件付けスキームを実装しています。

ゼロ123とゼロ123++: 概要

ゼロ123++フレームワークは、単一の画像入力から3D一貫性のあるマルチビュー画像を生成することを目的とした、画像条件付き拡散生成AIモデルです。ゼロ123++フレームワークは、ゼロ123(Zero-1-to-3)フレームワークの続きです。ゼロ123フレームワークは、ゼロショット新規視点画像合成技術を使用して、オープンソースの単一画像から3Dへの変換を実現しています。

ゼロ123++フレームワークは、ゼロ123フレームワークを基盤にしています。ゼロ123フレームワークは、幾何学的な不一致を含む画像を生成します。これは、3Dシーンとマルチビュー画像の間のギャップがまだ存在する主な理由です。

ゼロ123フレームワークは、SyncDreamer、One-2-3-45、Consistent123などのフレームワークの基盤です。これらのフレームワークは、ゼロ123フレームワークに追加の層を加えて、3D画像の生成においてより一貫性のある結果を得ることを目的としています。他のフレームワークであるProlificDreamer、DreamFusion、DreamGaussianなどは、最適化に基づくアプローチを使用して、さまざまな不一貫なモデルから3D画像を抽出しています。これらの技術は有効ですが、結果を改善するために、多視点画像を一貫性を持って生成できるベース拡散モデルを実装する必要があります。したがって、ゼロ123++フレームワークは、Stable Diffusionから新しい多視点ベース拡散モデルをファインチューニングしています。

ゼロ123フレームワークでは、各新規視点は独立して生成されます。これにより、拡散モデルがサンプリング性を持つため、一貫性のない結果が生じます。ゼロ123++フレームワークでは、タイルレイアウトアプローチを採用しています。オブジェクトを6つの視点で囲んだ単一の画像を作成し、オブジェクトの多視点画像の合同分布を正しくモデル化します。

ゼロ123フレームワークでは、開発者は、Stable Diffusionの機能を十分に活用できないという課題に直面しています。Stable Diffusionの機能を最大限に活用できない理由は2つあります。

  1. 画像条件付きトレーニングの際、ゼロ123フレームワークは、Stable Diffusionが提供するローカルまたはグローバル条件付けメカニズムを効果的に組み込んでいません。
  2. トレーニング中、ゼロ123フレームワークは、Stable Diffusionモデルの画像生成の品質を低下させる可能性のある、出力解像度をトレーニング解像度以下に減らすアプローチを使用しています。

これらの問題を解決するために、ゼロ123++フレームワークは、Stable Diffusionのリソースを最大限に活用し、Stable Diffusionモデルの画像生成の品質を維持するために、さまざまな条件付けテクニックを実装しています。

条件付けと一貫性の向上

ゼロ123++フレームワークは、画像条件付けと多視点画像の一貫性を向上させるために、さまざまなテクニックを実装しています。主な目的は、事前学習済みStable Diffusionモデルから既存のテクニックを再利用することです。

多視点生成

多視点画像を一貫性を持って生成するための重要な特性は、多視点画像の合同分布を正しくモデル化することです。ゼロ123フレームワークでは、各画像の条件付き周辺分布を独立してモデル化します。ただし、ゼロ123++フレームワークでは、6つの画像を単一のフレーム/画像にタイルレイアウトするアプローチを採用しています。

さらに、オブジェクトの向きは、カメラのポーズをトレーニングするときに曖昧になることがわかりました。曖昧性を防ぐために、ゼロ123フレームワークは、入力の仰角と相対的な方位角を使用してカメラのポーズをトレーニングします。仰角を知るために、フレームワークは、仰角推定モジュールを追加する必要があります。これにより、パイプラインに追加のエラーが生じる可能性があります。

ノイズスケジュール

スケール線形スケジュールは、Stable Diffusionの元のノイズスケジュールであり、主にローカルな詳細に焦点を当てています。ただし、以下の画像からわかるように、SNR(信号対雑音比)が低いステップが非常に少ないことがわかります。

SNRが低いステップは、デノイジングステージの初期に発生し、グローバルな低周波構造を決定するために重要です。デノイジングステージ中またはトレーニング中のステップ数を減らすと、構造的変動が増加する可能性があります。単一画像生成には理想的ですが、異なる視点間の一貫性を確保するフレームワークの能力を制限します。したがって、ゼロ123++フレームワークは、Stable Diffusion 2のv-予測フレームワークでLoRAモデルをファインチューニングして、玩具タスクを実行し、以下の結果を示しています。

スケール線形ノイズスケジュールでは、LoRAモデルは過剰適合しませんが、画像をわずかに白くします。逆に、線形ノイズスケジュールでは、LoRAフレームワークは、入力プロンプトに関係なく、空の画像を成功的に生成します。これは、フレームワークがグローバルに新しい要件に適応する能力に影響を与えるノイズスケジュールの影響を示しています。

ローカル条件付けのためのスケールリファレンスアテンション

ゼロ123フレームワークでは、条件付き画像または画像条件付けは、ノイズ入力と特徴量次元で連結されます。

この連結は、ターゲット画像と入力画像の間のピクセルごとの空間的一致性が不正確になる原因となります。ローカル条件付け入力を提供するために、ゼロ123++フレームワークは、スケールリファレンスアテンションアプローチを使用します。このアプローチでは、デノイジングUNetモデルを参照画像で実行し、値行列と自己注意キーを参照画像から追加して、モデル入力をデノイズし、以下の図に示すように実行します。

リファレンスアテンションアプローチは、ファインチューニングなしで、参照画像と類似したテクスチャーとセマンティックコンテンツを持つ画像を生成することができます。ファインチューニングすると、潜在的なスケーリングで優れた結果が得られます。

グローバル条件付け: FlexDiffuse

元のStable Diffusionアプローチでは、テキスト埋め込みはグローバル埋め込みの唯一のソースであり、CLIPフレームワークはテキストエンコーダーとして使用され、テキスト埋め込みとモデル潜在変数の間の相互参照を実行します。したがって、開発者は、テキスト空間とCLIP画像の間の整列を使用して、グローバル画像条件付けを使用することができます。

ゼロ123++フレームワークは、最小限のファインチューニングが必要な、訓練可能な線形ガイダンスメカニズムのバリアントを使用して、グローバル画像条件付けをフレームワークに組み込むことを提案しています。結果は以下の画像に示されています。グローバル画像条件付けが存在しない場合、フレームワークによって生成されるコンテンツの品質は、入力画像に対応する可視領域では十分ですが、未視覚化された領域の品質は大幅に低下します。これは、モデルのオブジェクトのグローバルセマンティクスを推論する能力の低下によるものです。

モデルアーキテクチャ

ゼロ123++フレームワークは、Stable Diffusion 2vモデルを基盤として、さまざまなアプローチとテクニックを使用してトレーニングされています。ゼロ123++フレームワークは、Objaverseデータセットで事前トレーニングされています。このデータセットは、ランダムなHDRI照明でレンダリングされています。フレームワークは、Stable Diffusion Image Variationsフレームワークで使用されている段階的なトレーニングスケジュールアプローチも採用しています。これにより、事前学習済みStable Diffusionの最大限の活用と、ファインチューニングの最小限の必要性が可能になります。

ゼロ123++フレームワークのアーキテクチャは、順序的なステップまたはフェーズに分けることができます。最初のフェーズでは、フレームワークは、Stable Diffusionのクロスアテンション層と自己アテンション層のKV行列を、AdamWオプティマイザ、1000のウォームアップステップ、最大7×10^-5のコサイン学習率スケジュールでファインチューニングします。2番目のフェーズでは、フレームワークは、非常に保守的な定数学習率を使用し、2000のウォームアップセットを使用し、Min-SNRアプローチを使用してトレーニング中の効率を最大化します。

ゼロ123++: 結果とパフォーマンス比較

定性的なパフォーマンス

ゼロ123++フレームワークのパフォーマンスをその生成品質に基づいて評価するために、SyncDreamerとZero-1-to-3-XLなどの最先端のコンテンツ生成フレームワークと比較しています。フレームワークは、4つの異なる入力画像で比較されています。最初の画像は、Objaverseデータセットから直接取得された電気玩具の猫です。この画像には、オブジェクトの後部に大きな不確実性があります。2番目の画像は、消火器の画像です。3番目の画像は、SDXLモデルで生成されたロケットに座っている犬の画像です。最後の画像は、アニメーションのイラストです。必要な仰角ステップは、One-2-3-4-5フレームワークの仰角推定方法を使用して取得され、背景除去はSAMフレームワークを使用して実行されます。ゼロ123++フレームワークは、一貫性のあるマルチビュー画像を高品質で生成し、2DイラストレーションやAI生成画像にも同等に一般化することができます。

定量的分析

ゼロ123++フレームワークを、Zero-1-to-3およびZero-1-to-3 XLなどの最先端フレームワークと比較するために、開発者は、Objaverseデータセットの検証スプリットデータで、学習済み感知画像パッチ類似度(LPIPS)スコアを評価します。マルチビュー画像生成のパフォーマンスを評価するために、開発者は、グラウンドトゥルース参照画像と6つの生成画像をそれぞれタイル化し、LPIPSスコアを計算します。結果は以下に示されています。ゼロ123++フレームワークは、検証スプリットセットで最高のパフォーマンスを達成しています。

テキストからマルチビュー評価

ゼロ123++フレームワークのテキストからマルチビューコンテンツ生成能力を評価するために、開発者は、SDXLフレームワークを使用してテキストプロンプトで画像を生成し、次にゼロ123++フレームワークを生成された画像に適用します。結果は以下の画像に示されています。ゼロ123フレームワークと比較して、ゼロ123++フレームワークは、一貫性のあるリアルな詳細なマルチビュー画像を生成します。

ゼロ123++ デプス コントローネット

ゼロ123++フレームワークに加えて、開発者は、ControlNetアーキテクチャを使用して構築された、Depth ControlNet Zero123++をリリースしました。Depth ControlNet Zero123++は、ゼロ123++フレームワークの幾何学を、深度認識を使用して制御するためにトレーニングされたControlNetフレームワークです。

結論

本稿では、ゼロ123++フレームワークについて説明しました。ゼロ123++フレームワークは、単一の画像入力から3D一貫性のあるマルチビュー画像を生成することを目的とした、画像条件付き拡散生成AIモデルです。ゼロ123++フレームワークは、事前学習済み生成モデルから最大の利点を得るために、さまざまなトレーニングと条件付けスキームを実装しています。

ゼロ123++フレームワークは、高品質のマルチビュー画像を一貫性を持って生成する能力がありますが、まだ改善の余地があります。将来的な研究分野としては、ゼロ123++のグローバル一貫性要件を満たすことができないという問題を解決するための、2段階のリファインモデルや、さらに高品質の画像を生成する能力を向上させるためのスケールアップなどがあります。

  • 2段階のリファインモデルは、ゼロ123++のグローバル一貫性要件を満たすことができないという問題を解決する可能性があります。
  • 追加のスケールアップは、ゼロ123++の画像生成能力をさらに高めることができます。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。