Andersonの視点

NVIDIAのeDiffi拡散モデルは「言葉で絵を描く」という機能を実現

mm
Unite.AI を Google の優先ソースに追加

Stable Diffusionなどの潜在的な拡散型画像生成モデルを使用して、精密な構成を作成することは、猫をまとめるようなものです。システムが非常な詳細と、単純なテキストプロンプトからすばらしい画像を生成する能力を可能にする、同じ想像力と解釈力は、Photoshopレベルの画像生成の制御を求めているときに、オフにできないのです。

今、新しいアプローチがNVIDIAの研究から発表されました。eDiffi(ensemble diffusion for images)と呼ばれるこのアプローチは、パイプライン全体を通じて同じ方法ではなく、複数の埋め込みと解釈方法の組み合わせを使用して、生成されたコンテンツの制御度を大幅に高めています。以下の例では、ユーザーがテキストプロンプトの各単語を表す色で要素を描画しています。

NVIDIAのeDiffi拡散モデルにおける「言葉で絵を描く」という新しい機能。各色付けされた色はプロンプトの単語を表し、適用される色付けされた領域はその要素のみで構成されます。詳細と高解像度の例は、記事の最後の公式ビデオを参照してください。ソース:https://www.youtube.com/watch?v=k6cOx9YjHJc

「言葉で絵を描く」という新しい機能は、NVIDIAのeDiffi拡散モデルで可能です。各色付けされた色はプロンプトの単語を表し、適用される色付けされた領域はその要素のみで構成されます。詳細と高解像度の例は、公式ビデオを参照してください。 https://www.youtube.com/watch?v=k6cOx9YjHJc

実質的には、これは「マスクで絵を描く」ということです。Stable Diffusionにおけるnpaintingパラダイムを逆転させ、不完全または不満足な画像を修正したり、最初から望ましいサイズの画像を生成したりするのではなく、ユーザーが最終的なキャンバスのサイズを最初から設定し、個別に要素を追加できるようにします。

ここでは、描かれた色の縁は、単一の概念からの一意の要素の許容される近似的な境界を表し、ユーザーは最終的なキャンバスのサイズを最初から設定し、個別に要素を追加できます。

論文からの例。ソース:https://arxiv.org/pdf/2211.01324.pdf

論文からの例。 ソース:https://arxiv.org/pdf/2211.01324.pdf

eDiffiで使用される多様な方法により、システムは長く詳細なプロンプトのすべての要素を含めることができ、Stable DiffusionやOpenAIのDALL-E 2は、プロンプトの特定の部分を優先することがあります。

論文からの図:eDiffiは、プロンプトを最大限に解釈するまで反復処理できます。eDiffiの結果(右端の列)は、Stable DiffusionやDALL-E 2の結果と比較して改善されています。

論文からの図:eDiffiは、プロンプトを最大限に解釈するまで反復処理できます。eDiffiの結果(右端の列)は、Stable DiffusionやDALL-E 2の結果と比較して改善されています。

さらに、専用のT5テキスト-to-テキストエンコーダーを使用することで、eDiffiは、抽象的に要求されたテキストや明示的に要求されたテキストを含む、意味のある英語のテキストを生成することができます。

eDiffiの専用テキスト-to-テキスト処理により、テキストは画像内で逐語的にレンダリングできます。

eDiffiの専用テキスト-to-テキスト処理により、テキストは画像内で逐語的にレンダリングできます。

さらに、新しいフレームワークでは、複数の例を使用してDreamBoothモデルをトレーニングする必要なく、単一の画像をスタイルプロンプトとして提供することもできます。

スタイル転送は、リファレンス画像からテキスト-to-画像プロンプトまたは画像-to-画像プロンプトに適用できます。

スタイル転送は、リファレンス画像からテキスト-to-画像プロンプトまたは画像-to-画像プロンプトに適用できます。

T5テキストエンコーダー

eDiffiで使用されるT5テキスト-to-テキストエンコーダーは、GoogleのText-to-Text Transfer Transformer(T5)です。平均的な潜在的な拡散パイプラインは、トレーニングされた画像とそのキャプションの関連性に基づいています。

T5のテキストベースの変換は、eDiffiの生成画像ワークフローを支援できます。ソース:https://arxiv.org/pdf/1910.10683.pdf

T5のテキストベースの変換は、eDiffiの生成画像ワークフローを支援できます。 ソース:https://arxiv.org/pdf/1910.10683.pdf

ソーステキストを再構成し、T5モジュールを実行することで、元のモデルにトレーニングされたものよりも、より正確な関連性と表現を得ることができます。

拡散プロセスの中断と拡張

典型的な潜在的な拡散モデルは、テキストのみを使用して、ノイズから画像への生成プロセスを開始します。

ノイズがレイアウトに解決されると、テキストガイドのプロセスは基本的に終了し、プロセスは視覚的な特徴の拡張に移行します。

これにより、初期段階で解決されなかった要素を後で画像に注入することが困難になります。テキスト-to-レイアウトとレイアウト-to-画像の2つのプロセスは、基本的なレイアウトが解決されたときにほとんど重複していないためです。

論文からの図:パイプラインの各部分の注意マップ。CLIPの影響の急激な低下と、T5の影響の継続を確認できます。

論文からの図:パイプラインの各部分の注意マップ。CLIPの影響の急激な低下と、T5の影響の継続を確認できます。

プロフェッショナルな可能性

プロジェクトページとYouTubeビデオの例は、PRに優しいメモリーカッコウのような画像の生成に焦点を当てています。NVIDIAの研究は、最新の革新が写真写りのようなワークフローやVFXワークフローを改善する可能性、ディープフェイク画像やビデオの改善の可能性については触れていません。

例では、初心者またはアマチュアユーザーが特定の要素の配置の粗いアウトラインを描きます。一方、より体系的なVFXワークフローでは、eDiffiを使用して、テキスト-to-画像を使用して、複数のビデオフレームの要素を解釈することができます。

Runway MLはすでにAIベースのロトスコープを提供しています。この例では、サブジェクトの周囲の「グリーンスクリーン」はアルファレイヤーを表し、機械学習によって実際のグリーンスクリーンバックグラウンドの除去ではなく、抽出されています。ソース:https://twitter.com/runwayml/status/1330978385028374529

Runway MLはすでにAIベースのロトスコープを提供しています。この例では、サブジェクトの周囲の「グリーンスクリーン」はアルファレイヤーを表し、機械学習によって実際のグリーンスクリーンバックグラウンドの除去ではなく、抽出されています。 ソース:https://twitter.com/runwayml/status/1330978385028374529

方法、データ、テスト

論文では、eDiffiモデルは「パブリックおよびプロプライエタリーデータセットのコレクション」に基づいてトレーニングされたと述べられています。データセットは、事前にトレーニングされたCLIPモデルによってフィルタリングされ、画像の一般的な美しさスコアを低下させる可能性のある画像が除去されました。最終的なフィルタリングされた画像セットは、「約10億」のテキスト-画像ペアで構成されます。

プロセスには複数のモデルがトレーニングされ、ベースモデルとスーパーレゾリューションモデルはAdamWオプティマイザを使用して、学習率0.0001、重み減衰0.01でトレーニングされました。

ベースモデルは256個のNVIDIA A100 GPUでトレーニングされ、2つのスーパーレゾリューションモデルはそれぞれ128個のNVIDIA A100 GPUでトレーニングされました。

システムはNVIDIAのImaginaire PyTorchライブラリに基づいています。COCOとVisual Genomeデータセットは評価に使用されましたが、最終的なモデルには含まれていません。MS-COCOはテストに使用される特定のバリアントでした。

競合システムとしてテストされたのは、GLIDE、Make-A-Scene、DALL-E 2、Stable Diffusion、GoogleのImagenとPartiです。

評価メトリックとしては、FID-30Kが使用されました。COCOバリデーションセットから30,000のキャプションがランダムに抽出され、画像の生成に使用されました。

生成された画像とグラウンドトゥルース画像の間のFrechet Inception Distance(FID)が計算され、生成された画像のCLIPスコアも記録されました。

COCO 2014バリデーションデータセットでのゼロショットFIDテストの結果。低い結果がベストです。

COCO 2014バリデーションデータセットでのゼロショットFIDテストの結果。低い結果がベストです。

結論

NVIDIAのeDiffiは、単に既存のシステムにデータと複雑さを追加するのではなく、より賢くて層状なアプローチを使用する、潜在的な拡散型画像生成システムの魅力的な代替手段を提供します。

Stable DiffusionのサブレディットやDiscordでは、eDiffiのコードを直接組み込むか、別の実装でeDiffiの原理を再現することが議論されています。しかし、新しいパイプラインは、SDのバックワード互換性を犠牲にしても、生成された画像の制御度を大幅に高める可能性を提供するため、根本的に異なります。

最初に公開された:2022年11月3日。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai