AIモデルとプラットフォーム
自己注意ガイダンス:拡散モデルのサンプル品質の向上
ノイズから画像を合成するための反復的なノイズ除去プロセスを使用する、生成的なAIフレームワークであるノイズ除去拡散モデルについて説明します。これらのモデルは、画像生成能力と多様性が優れており、テキストまたはクラス条件付きガイダンス方法を含むガイダンス方法に大きく寄与しています。これらのモデルは、高品質の画像を生成するために成功しています。最近の研究では、クラスキャプションやラベルなどのガイダンス技術が、生成される画像の品質を向上させる上で重要な役割を果たしていることが示されています。
しかし、拡散モデルとガイダンス方法には、特定の外部条件下で制限があります。ラベルドロップを使用するClassifier-Free Guidance (CFG)方法は、トレーニングプロセスに複雑さを加え、Classifier Guidance (CG)方法は、追加のクラシファイアトレーニングを必要とします。両方の方法は、外部条件に依存しているため、制限があり、条件付き設定に限定されます。
これらの制限を解決するために、開発者は、拡散ガイダンスのより一般的なアプローチを提案しました。これは、自己注意ガイダンス (Self-Attention Guidance, SAG) と呼ばれます。この方法は、拡散モデルの中間サンプルから得られた情報を使用して画像を生成します。この記事では、SAGのしくみ、方法論、結果について、現在の最先端のフレームワークやパイプラインと比較して説明します。
自己注意ガイダンス:拡散モデルのサンプル品質の向上
ノイズ除去拡散モデル (DDM) は、ノイズから画像を生成するための反復的なノイズ除去プロセスを使用することで、人気を博しています。これらのモデルの画像合成能力は、使用されている拡散ガイダンス方法に大きく寄与しています。にもかかわらず、拡散モデルとガイダンスベースの方法には、複雑さと計算コストの増加などの課題があります。
これらの制限を克服するために、開発者は自己注意ガイダンス方法を導入しました。これは、拡散ガイダンスのより一般的な形式であり、外部情報に依存しない、条件付けのないアプローチを提供します。このアプローチは、従来の拡散ガイダンス方法の適用性を、外部要件のある、またはない場合にも拡大します。
自己注意ガイダンスは、一般化された形式の基本原理と、中間サンプル内に含まれる内部情報がガイダンスとしても機能できるという仮定に基づいています。この原理に基づいて、SAG方法は、Blurガイダンスと呼ばれる、サンプル品質を向上させるためのシンプルで直截的な解決策を導入します。Blurガイダンスは、ガウシアンブラーを使用して、細かい詳細を自然に除去し、中間サンプルをガイダンスするために使用されます。ただし、Blurガイダンス方法は、大きなガイダンススケールでは結果を再現できず、構造的な曖昧さを導入し、元の入力と予測の間の整合性を損なうことがあります。
これを克服するために、自己注意ガイダンスは、拡散モデルの自己注意メカニズムを利用します。自己注意メカニズムは、拡散モデルのコアコンポーネントであり、モデルが生成プロセス中に重要な部分に注目できるようにします。自己注意ガイダンス方法は、自己注意マップを使用して、重要な情報を含む領域をぼかします。次に、自己注意マップを拡散モデルの逆プロセス中に使用して、画像の品質を向上させ、自己条件付けを使用して、追加のトレーニングや外部情報を必要とせずに、生成された画像のアーティファクトを削減します。

自己注意ガイダンス方法は、内部自己注意マップを使用してサンプル品質を向上させるための新しいアプローチであり、追加のトレーニングや外部条件に依存しない、条件付けのない方法です。この方法は、拡散フレームワークの適用性を向上させ、他の方法やモデルと組み合わせて使用することができます。
- 自己注意ガイダンス方法は、内部自己注意マップを使用してサンプル品質を向上させるための新しいアプローチであり、追加のトレーニングや外部条件に依存しない、条件付けのない方法です。
- SAG方法は、条件付きガイダンス方法を条件付けのない方法に一般化し、追加のリソースや外部条件を必要とせずに、任意の拡散モデルに統合することができます。
- SAG方法は、既存の条件付き方法やフレームワークと直交する能力を示し、他の方法やモデルと組み合わせて使用することができます。
自己注意ガイダンス方法は、ノイズ除去拡散モデル、サンプリングガイダンス、生成的なAI自己注意方法、拡散モデルの内部表現などの関連フレームワークからの知見を学びました。ただし、自己注意ガイダンス方法は、ノイズ除去拡散確率モデル、クラシファイガイダンス、クラシファイフリーガイダンス、拡散フレームワーク内の自己注意などの知見を実装しています。
自己注意ガイダンス:基礎、方法論、そしてアーキテクチャ
ノイズ除去拡散確率モデル(DDPM)
DDPMまたはノイズ除去拡散確率モデルは、反復的なノイズ除去プロセスを使用して画像を回復するモデルです。従来、DDPMモデルは入力画像と分散スケジュールを受け取り、前向きプロセスとして知られるマルコフ過程を使用して画像を生成します。
クラシファイガイダンスとクラシファイフリーガイダンスによるGAN実装
GANまたは生成対抗ネットワークは、多様性と忠実度のトレードオフを提供します。GANフレームワークのこの能力を拡散モデルに持ち込むために、自己注意ガイダンスフレームワークは、追加のクラシファイを使用するクラシファイガイダンス方法を提案します。逆に、クラシファイフリーガイダンス方法は、追加のクラシファイを使用せずに同じ結果を達成することができます。ただし、この方法は、追加のラベルとトレーニングの詳細が必要であり、計算コストと複雑さを増加させます。
拡散ガイダンスの一般化
クラシファイガイダンスとクラシファイフリーガイダンス方法は、条件付き生成に役立ちますが、追加の入力に依存しています。拡散モデルの入力は、一般化された条件と乱れたサンプルで構成されます。一般化された条件には、内部情報または外部条件、またはその両方が含まれます。結果として得られるガイダンスは、仮想の回帰分析を使用して一般化された条件を予測することによって形成されます。
自己注意マップを使用した画像品質の向上
一般化された拡散ガイダンスは、乱れたサンプル内の一般化された条件に含まれる重要な情報を使用して、拡散モデルの逆プロセスをガイダンスすることができることを示しています。自己注意ガイダンス方法は、逆プロセス中に重要な情報を効果的にキャプチャし、事前トレーニングされた拡散モデルの外れ値問題のリスクを制限します。
Blurガイダンス
自己注意ガイダンスのBlurガイダンスは、ガウシアンブラーに基づいています。ガウシアンブラーは、入力信号をガウシアンフィルタで畳み込み、出力信号を生成する線形フィルタリング方法です。標準偏差が増加すると、ガウシアンブラーは入力信号内の細かい詳細を減らし、入力信号を平滑化し、局所的に区別できない信号にします。
この知識に基づいて、自己注意ガイダンスフレームワークは、Blurガイダンスと呼ばれる技術を導入します。Blurガイダンスは、拡散プロセス中に中間再構築からの情報を意図的に除外し、その情報を使用して予測を入力情報に関連性の高いものに導きます。Blurガイダンスは、元の予測をぼかした入力予測からさらに遠ざけます。さらに、ガウシアンブラーの良性特性は、出力信号が元の信号から大幅に逸脱しないことを保証し、ガウシアンブラーを事前トレーニングされた拡散モデルに適応させることができます。
自己注意ガイダンスパイプラインでは、入力信号はガウシアンフィルタでぼかされ、追加のノイズで拡散して出力信号を生成します。这样、SAGパイプラインは、結果として得られるぼけの副作用を軽減し、ガイダンスをコンテンツに依存させることで、ランダムノイズに依存しないようにします。ただし、Blurガイダンスは、適度なガイダンススケールでは満足のいく結果をもたらしますが、大きなガイダンススケールでは結果を再現できず、ノイズのある結果を生成することがあります。

これは、グローバルブラーによって導入された構造的な曖昧さが、SAGパイプラインが元の入力の予測と劣化した入力の予測を整合させることを困難にしているためであると考えられます。
自己注意メカニズム
自己注意メカニズムは、拡散モデルの重要なコンポーネントであり、モデルが生成プロセス中に重要な部分に注目できるようにします。自己注意ガイダンス方法は、自己注意マップの能力を利用して、重要な情報を含むパッチをぼかします。出力信号には、入力信号の完全な領域が含まれており、構造的な曖昧さを導入しません。パイプラインは、自己注意マップをグローバル平均プーリングによって集約し、最も近い隣接するものをアップサンプリングして入力信号の解像度に一致させます。

自己注意ガイダンス方法は、自己注意マップを使用してサンプル品質を向上させるための新しいアプローチであり、追加のトレーニングや外部条件に依存しない、条件付けのない方法です。この方法は、拡散フレームワークの適用性を向上させ、他の方法やモデルと組み合わせて使用することができます。
自己注意ガイダンス:実験と結果
自己注意ガイダンスパイプラインのパフォーマンスを評価するために、8つのNvidia GeForce RTX 3090 GPUを使用してサンプリングし、事前トレーニングされたIDDPM、ADM、および安定拡散フレームワークに基づいて構築されています。
自己注意ガイダンスを使用した無条件生成
自己注意ガイダンスパイプラインの有効性を評価するために、無条件に事前トレーニングされたフレームワークで50,000サンプルを実行しました。

結果から、自己注意ガイダンスパイプラインの実装が、FID、sFID、ISメトリクスを向上させ、リコール値を低下させていることがわかります。さらに、自己注意ガイダンスパイプラインの実装による質的改善は、上部がADMと安定拡散フレームワークからの画像、下部が自己注意ガイダンスパイプラインを使用したADMと安定拡散フレームワークからの画像である、以下の画像で確認できます。


自己注意ガイダンスを使用した条件付き生成
自己注意ガイダンスパイプラインは、無条件生成での優れた結果を示し、条件付き生成にも使用できます。
自己注意ガイダンスを使用した安定拡散
元の安定拡散フレームワークは、高品質の画像を生成しますが、自己注意ガイダンスパイプラインを統合することで、結果を大幅に向上させることができます。実験では、空のプロンプトを使用して安定拡散フレームワークを実行し、各画像ペアにランダムなシードを使用し、500ペアの画像を人間の評価者に評価しました。結果は以下の画像に示されています。

さらに、自己注意ガイダンスの実装は、安定拡散フレームワークの能力を向上させることができます。クラシファイフリーガイダンスを自己注意ガイダンスと組み合わせることで、安定拡散モデルの範囲をテキストから画像の合成に拡大することができます。さらに、自己注意ガイダンスを使用した安定拡散モデルの生成画像は、自己条件付けの効果により、より高品質でアーティファクトが少なくなります。

現在の制限
自己注意ガイダンスパイプラインの実装は、生成画像の品質を大幅に向上させることができますが、いくつかの制限があります。
主要な制限の1つは、クラシファイガイダンスとクラシファイフリーガイダンスとの直交性です。以下の画像から、自己注意ガイダンスの実装がFIDスコアと予測スコアを向上させていることがわかりますが、従来のガイダンス方法と同時に使用することができます。

ただし、自己注意ガイダンスの実装には、特定の方法でトレーニングされた拡散モデルが必要であり、複雑さと計算コストが増加します。
さらに、自己注意ガイダンスの実装は、メモリや時間の消費を増加させませんが、追加のステップを含むため、計算コストが増加します。

最終的な考え
この記事では、自己注意ガイダンスについて説明しました。これは、内部情報を使用して高品質の画像を生成するための新しいガイダンス方法です。自己注意ガイダンスは、一般化された形式の基本原理と、中間サンプル内に含まれる内部情報がガイダンスとしても機能できるという仮定に基づいています。自己注意ガイダンスパイプラインは、条件付けのないアプローチであり、自己条件付けを使用して生成された画像のアーティファクトを削減し、品質を向上させることができます。












