AIモデルとプラットフォーム
HD-Painter: 高解像度テキストガイド画像補完法による拡散モデル
拡散モデルは、AIとML業界を革命し、現実時間での応用が私たちの日常生活の一部となっています。テキストから画像モデルがその驚異的な能力を示した後、制御可能な生成、特殊化された画像合成、オブジェクトレベルの画像編集、プロンプト条件付きバリエーション、編集などの拡散ベースの画像操作技術が、コンピュータビジョン業界での応用によりホットな研究トピックとなりました。
しかし、拡散モデル、特にテキストから画像補完フレームワークは、まだ開発の余地がある。グローバルシーンを理解する能力、特に画像を高拡散ステップでノイズ除去する際に、課題があります。この問題に対処するために、HD-Painterという完全にトレーニング不要のフレームワークが提示されました。HD-Painterフレームワークは、プロンプト指示に正確に従い、高解像度画像補完を一貫して実行します。HD-Painterフレームワークには、プロンプト情報を使用して自己注意スコアを強化する、プロンプト認識内向注意(PAIntA)レイヤーが含まれています。
HD-Painterモデルは、プロンプトの一貫性をさらに高めるために、Reweighting Attention Score Guidance(RASG)アプローチを導入します。このアプローチは、DDIMコンポーネントの一般形式にポストホックサンプリング戦略を統合し、分布外の潜在的なシフトを防ぎます。さらに、HD-Painterフレームワークには、補完に特化した特殊なスーパーリゾリューションテクニックが含まれており、大規模な拡大に適しており、最大2K解像度の画像の欠損領域を補完できます。
HD-Painter: テキストガイド画像補完
テキストから画像拡散モデルは、最近、AIとML業界で重要なトピックとなりました。DALL-E、Imagen、Stable Diffusionなどの事前トレーニング済みテキストから画像生成モデルは、画像補完の適性を示しています。ただし、既存のモデルは、特に高拡散ステップでのノイズ除去プロセスにおいて、グローバルシーンを理解するのに苦労しています。事前トレーニング済みテキストから画像拡散モデルを追加のコンテキスト情報を組み込むことで、テキストガイド画像補完に適応させることができます。
さらに、拡散モデル内では、テキストガイド画像補完とテキストガイド画像編集が主要な研究分野です。これは、テキストガイド画像補完モデルが入力画像の特定の領域に基づいてコンテンツを生成できるため、画像の特定の領域を編集したり、オブジェクトを追加または置き換えたりすることができます。まとめると、テキストから画像拡散モデルは、最近、前例のない成功を収めています。

しかし、多くの既存のフレームワークは、2つのシナリオでプロンプトを無視しています。1つはバックグラウンド優位性で、モデルは背景でプロンプトを無視して未知の領域を補完します。もう1つは近傍オブジェクト優位性で、モデルは視覚的コンテキストの可能性を使用して、プロンプトではなく、既知の領域のオブジェクトを未知の領域に伝播します。
これらの課題に対処するために、HD-Painterフレームワークは、プロンプト認識内向注意(PAIntA)レイヤーを導入します。PAIntAは、プロンプト情報を使用して自己注意スコアを強化し、テキストの整列を改善します。PAIntAは、視覚的コンテキストの可能性よりもプロンプトの重要性を高めることで、未知の領域の自己注意スコアを調整します。
さらに、HD-Painterフレームワークは、ポストホックサンプリングガイダンス方法を導入して、生成の整列をさらに強化します。ただし、バニラポストホックガイダンス方法は、潜在的なドメインシフトを引き起こす可能性があり、画像の品質を低下させます。そこで、HD-Painterフレームワークは、Reweighting Attention Score Guidance(RASG)メカニズムを導入します。RASGは、DDIMコンポーネントの一般形式にポストホックサンプリング戦略を統合し、潜在的なドメインを保存します。
HD-Painter: 方法とアーキテクチャ
HD-Painterフレームワークのアーキテクチャを理解する前に、3つの基本的な概念を理解する必要があります。画像補完、ポストホックガイダンス、および補完に特化したアーキテクチャブロックです。
画像補完は、画像内の欠損領域を補完することを目的とし、生成された画像の視覚的な魅力を確保します。従来のディープラーニングフレームワークは、既知の領域から深層特徴を伝播する方法を実装しました。ただし、拡散モデルの導入により、画像補完モデルの進化が起こりました。特に、テキストガイド画像補完フレームワークは、事前トレーニング済みテキストから画像生成モデルを使用して、未知の領域を補完します。
さらに、ポストホックガイダンス方法は、バックワード拡散サンプリング方法の一種であり、次の潜在的な予測を特定の関数最小化目標に向けて導きます。ポストホックガイダンス方法は、視覚的なコンテンツを生成する際に役立ちます。ただし、ポストホックガイダンス方法には、潜在的なドメインシフトを引き起こす可能性があり、画像の品質を低下させます。
HD-Painterフレームワークのアーキテクチャは、テキストガイド画像補完問題を定式化し、2つの拡散モデル、Stable InpaintingとStable Diffusionを導入します。次に、PAIntAとRASGブロックを導入し、最後に補完に特化したスーパーリゾリューションテクニックを実装します。
Stable DiffusionとStable Inpainting
Stable Diffusionは、オートエンコーダーの潜在的な空間で動作する拡散モデルの一種です。テキストから画像生成の場合、Stable Diffusionフレームワークは、テキストプロンプトを使用してプロセスを導きます。ガイダンス関数は、UNetアーキテクチャに似た構造を持ち、クロスアテンションレイヤーはテキストプロンプトに基づいて条件付けられます。

上の図は、HD-Painterフレームワークの概要を示しています。HD-Painterフレームワークは、テキストガイド画像補完とスーパーリゾリューションを2つのステージで実行します。最初のステージでは、HD-Painterフレームワークはテキストガイド画像補完を実行し、2番目のステージでは、出力のスーパーリゾリューションを実行します。HD-Painterフレームワークは、事前トレーニング済みの画像補完拡散モデルを使用し、自己注意レイヤーをPAIntAレイヤーに置き換え、RASGメカニズムを実装してバックワード拡散プロセスを実行します。
プロンプト認識内向注意(PAIntA)
既存の画像補完モデルは、Stable Inpaintingのように、視覚的なコンテキストに基づいて未知の領域を補完する傾向があり、プロンプトを無視します。プロンプト認識内向注意(PAIntA)レイヤーは、クロスアテンションマトリックスと補完マスクを使用して、未知の領域の自己注意スコアを制御します。
PAIntAは、プロジェクションレイヤーを適用して、キー、値、クエリ、および類似性マトリックスを取得します。次に、PAIntAは、既知のピクセルの自己注意スコアを調整して、未知の領域への既知の領域の影響を軽減し、テキストプロンプトを使用して新しい類似性マトリックスを定義します。

Reweighting Attention Score Guidance(RASG)
HD-Painterフレームワークは、ポストホックサンプリングガイダンス方法を導入して、生成の整列をさらに強化します。ただし、バニラポストホックガイダンス方法は、潜在的なドメインシフトを引き起こす可能性があり、画像の品質を低下させます。そこで、HD-Painterフレームワークは、Reweighting Attention Score Guidance(RASG)メカニズムを導入します。RASGは、DDIMコンポーネントの一般形式にポストホックサンプリング戦略を統合し、潜在的なドメインを保存します。
HD-Painter: 実験と結果
HD-Painterフレームワークの性能を分析するために、HD-Painterフレームワークは、Stable Inpainting、GLIDE、BLDなどの既存のモデルと比較されます。

結果から、HD-Painterフレームワークが既存のモデルを上回っていることがわかります。特に、CLIPメトリックで1.5ポイントの改善と、他のモデルと比較して10%の精度の差があります。

さらに、HD-Painterフレームワークは、他のモデルと比較して、視覚的なコンテンツを生成する能力が高いことがわかります。HD-Painterフレームワークは、プロンプトに基づいて、ターゲットオブジェクトを成功的に生成します。

最終的な考え
この記事では、HD-Painterフレームワークについて説明しました。HD-Painterフレームワークは、トレーニング不要のテキストガイド高解像度画像補完アプローチであり、既存の画像補完フレームワークの課題を解決します。HD-Painterフレームワークは、プロンプト認識内向注意(PAIntA)レイヤーを導入して、自己注意スコアを強化し、テキストの整列を改善します。
さらに、HD-Painterフレームワークは、Reweighting Attention Score Guidance(RASG)アプローチを導入して、生成の整列をさらに強化します。RASGは、DDIMコンポーネントの一般形式にポストホックサンプリング戦略を統合し、潜在的なドメインを保存します。HD-Painterフレームワークは、補完に特化した特殊なスーパーリゾリューションテクニックを導入して、大規模な拡大に適しており、最大2K解像度の画像の欠損領域を補完できます。












