AIモデルとプラットフォーム
コンセプトスライダー:拡散モデルにおけるLoRAアダプターを使用した精密な制御
テキストから画像への拡散モデルは、芸術コミュニティで非常に人気があります。しかし、現在のモデル、包括して最先端のフレームワークは、生成された画像内の視覚的な概念と属性を制御するのに苦労しており、不満足な出力につながることがあります。ほとんどのモデルは、テキストプロンプトのみに依存しており、天候の強度、影の鋭さ、顔の表情、または人の年齢などの連続的な属性を正確に制御するのが難しいです。これにより、エンドユーザーが画像を特定のニーズに合わせて調整するのが難しくなります。さらに、これらの生成フレームワークは、高品質でリアルな画像を生成しますが、歪んだ顔や指のないなどの歪みに敏感です。
これらの限界を克服するために、開発者は解釈可能なコンセプトスライダーを提案しました。これらのスライダーは、拡散モデル内での画像生成と編集を強化するために、エンドユーザーが視覚的な属性を制御することを可能にします。拡散モデルにおけるコンセプトスライダーは、個々の概念に対応するパラメータ方向を特定し、他の属性との干渉を最小限に抑えることで機能します。フレームワークは、サンプル画像または一連のプロンプトを使用してこれらのスライダーを作成し、テキストと視覚的な概念の両方の方向を確立します。

最終的に、テキストから画像への拡散モデルでコンセプトスライダーを使用することで、最小限の干渉と、出力に対する強化された制御、そして画像の内容を変更せずに認識されたリアリズムの向上をもたらす画像生成が可能になります。この記事では、テキストから画像へのフレームワークでコンセプトスライダーを使用する概念について詳細に説明し、その使用によって優れた品質のAI生成画像が生成される方法を分析します。
コンセプトスライダーの紹介
前述のように、現在のテキストから画像への拡散フレームワークは、生成された画像内の視覚的な概念と属性を制御するのに苦労し、不満足な結果につながることがあります。また、多くのモデルは連続的な属性を制御するのに苦労し、さらに不満足な出力につながります。コンセプトスライダーは、これらの問題を軽減し、コンテンツクリエーターとエンドユーザーに画像生成プロセスに対する強化された制御を提供し、現在のフレームワークが直面している課題に対処することができます。
ほとんどの現在のテキストから画像への拡散モデルは、画像の属性を制御するために、テキストプロンプトの直接的な変更に依存しています。このアプローチにより、画像の生成は可能ですが、最適なものではありません。テキストプロンプトの変更は、画像の構造を大幅に変更する可能性があります。Post-hocテクニックを使用する別のアプローチでは、拡散プロセスを逆転させ、視覚的な概念を編集するためにクロスアテンションを変更します。しかし、Post-hocテクニックには、同時に編集できる数が限られていること、各新しい概念に対して個別の干渉パスが必要であること、そして慎重にエンジニアリングされなければ概念の混在を導入する可能性があるなどの制限があります。
一方、コンセプトスライダーは、画像生成に対するより効率的な解決策を提供します。これらの軽量で使いやすいアダプターは、事前トレーニングされたモデルに適用できます。コンセプトスライダーは、単一の干渉パスで最小限の混在で、望ましい概念に対する制御と精度を高めます。さらに、コンセプトスライダーは、テキストによる編集方法とは異なり、テキストによる説明でカバーされていない視覚的な概念の編集を可能にします。画像ベースのカスタマイズ方法は、画像ベースの概念に対してトークンを追加することで効果的に機能しますが、画像の編集には難しいです。コンセプトスライダーは、エンドユーザーが特定の概念を定義するためにペア化された画像の小さなセットを提供できることを可能にし、スライダーはこの概念を一般化し、自動的に他の画像に適用します。目標は、リアリズムを高め、手などの歪みを修正することです。
コンセプトスライダーは、画像編集、ガイダンスベースの方法、モデル編集、GANにおけるセマンティック方向という4つの生成AIと拡散フレームワークの概念の問題に対処しようとします。
画像編集
現在のAIフレームワークは、条件付き入力で画像構造を導くか、またはソース画像とターゲットプロンプトのクロスアテンションを操作して、テキストから画像への拡散フレームワークで単一の画像編集を可能にします。結果として、これらのアプローチは単一の画像でのみ実装でき、各画像に対して潜在的な幾何学的構造の時間経過に伴う変化のため、各画像に対して潜在的なベースの最適化が必要です。
ガイダンスベースの方法
クラスフリーのガイダンスベースの方法は、生成された画像の品質を向上させ、テキストと画像の整合性を高める能力を示しています。干渉中にガイダンス項を組み込むことで、方法は拡散フレームワークによって継承される限られた構成可能性を向上させ、拡散フレームワーク内の安全でない概念を導くことができます。
モデル編集
コンセプトスライダーの使用は、低ランクアダプターを使用するモデル編集技術としても見ることができます。属性に沿った連続的な制御を可能にする単一のセマンティック属性を出力します。ファインチューニングベースのカスタマイズ方法は、フレームワークを新しい概念に合わせてパーソナライズするために使用されます。さらに、カスタム拡散テクニックは、事前トレーニングされた拡散モデルに新しい視覚的な概念を組み込むために、クロスアテンション層をファインチューニングする方法を提案します。テキスタル拡散テクニックは、モデル機能を活性化し、フレームワークにテキスタル概念を導入するために、埋め込みベクトルを最適化することを提案します。
GANにおけるセマンティック方向
セマンティック属性の操作は、生成対抗ネットワークの重要な側面であり、潜在的な空間の軌道は自己教師ありの方法で整列していることがわかっています。拡散フレームワークでは、これらの潜在的な空間の軌道は、U-Netアーキテクチャの中間層に存在し、潜在的な空間の主方向は、グローバルなセマンティクスを捉えます。コンセプトスライダーは、特殊な属性に対応する低ランク部分空間を直接トレーニングし、テキストまたは画像のペアを使用してグローバル方向を最適化することで、正確で局所的な編集方向を取得します。
コンセプトスライダー:アーキテクチャと動作
拡散モデルとLoRAまたは低ランクアダプター
拡散モデルは、データを合成するために拡散プロセスを逆転させる生成AIフレームワークのサブクラスです。前向きの拡散プロセスでは、データに最初にノイズが追加され、組織化された状態から完全なガウシアンノイズ状態への遷移が行われます。拡散モデルの主な目的は、拡散プロセスを逆転させ、画像を段階的に除ノイズし、ランダムなガウシアンノイズをサンプリングして画像を生成することです。実際のアプリケーションでは、拡散フレームワークの主な目的は、完全なガウシアンノイズが入力として与えられたときに、真のノイズを予測することです。さらに、条件付けとタイムステップなどの追加の入力が与えられます。
LoRAまたは低ランクアダプター技術は、事前トレーニングされた大規模フレームワークのファインチューニング中に重みの更新を分解して、ダウンストリームタスクへの適応を効率化します。LoRA技術は、事前トレーニングされたモデルの層の入力と出力の両方の次元に関して重みの更新を分解し、更新を低次元部分空間に制限します。
コンセプトスライダー
コンセプトスライダーの主な目的は、拡散フレームワークで概念ターゲットの画像に対する制御度を高めるために、LoRAアダプターをファインチューニングするアプローチとして機能することです。以下の画像で示すように、同じことが実証されています。

ターゲット概念に条件付けた場合、コンセプトスライダーは、特定の属性の表現を増加または減少させるために、低ランクパラメータ方向を学習します。モデルとそのターゲット概念の場合、コンセプトスライダーの主な目的は、属性を強化する可能性を高め、抑制する可能性を低減することで、概念に条件付けたときに画像に対する属性の表現を変更する可能性を高めることです。再パラメータ化とツイーディーの式を使用して、フレームワークは時間依存のノイズプロセスを導入し、各スコアを除ノイズ予測として表します。さらに、解離化目的は、事前トレーニングされた重みを一定に保ったまま、コンセプトスライダーのモジュールをファインチューニングします。LoRAの式化中に導入されたスケーリングファクターは、干渉中に変更され、編集の強度を調整し、フレームワークを再トレーニングせずに編集を強化します。以下の画像で示すように、スケーリングファクターは編集を強化することもできます。

以前のフレームワークで使用されていた編集方法では、フレームワークを再トレーニングすることで編集を強化することができましたが、干渉中にスケーリングファクターを調整することで、再トレーニングコストと時間を増やさずに同じ編集結果を生成できます。
視覚的な概念の学習
コンセプトスライダーは、テキストプロンプトで定義できない視覚的な概念を制御するように設計されています。これらのスライダーは、ペア化された画像の小さなデータセットを使用してこれらの概念をトレーニングし、画像のペア間の対比によりスライダーは視覚的な概念を学習します。さらに、コンセプトスライダーのトレーニングプロセスは、LoRAコンポーネントを最適化し、前方と逆方向の両方でLoRAコンポーネントを実装します。結果として、LoRAコンポーネントは、視覚的な効果を引き起こす方向と一致します。
コンセプトスライダー:実装結果
パフォーマンスの向上を分析するために、開発者は、コンセプトスライダーの使用を主にStable Diffusion XL、1024ピクセルの高解像度フレームワークで評価しました。さらに、Stable Diffusion v1.4フレームワークで追加の実験が行われ、各モデルは500エポックでトレーニングされました。
テキスタルコンセプトスライダー
テキスタルコンセプトスライダーのパフォーマンスを評価するために、30のテキストベースの概念のセットで検証され、標準のテキストプロンプトを使用する2つのベースラインと比較され、固定数のタイムステップでプロンプトを追加して画像を編集します。以下の図からわかるように、コンセプトスライダーの使用により、CLIPスコアが一貫して高くなり、LPIPSスコアが元のフレームワークと比較して減少します。


上の図からわかるように、コンセプトスライダーの使用により、画像生成プロセス中に特定の属性を正確に編集することができますが、画像の全体的な構造は維持されます。
視覚的なコンセプトスライダー
テキストから画像への拡散モデルは、テキストプロンプトのみを使用する場合、視覚的な属性、たとえば顔の毛や目形を制御するのに苦労することがあります。視覚的な属性をより細かく制御するために、コンセプトスライダーは、画像データセットとオプショナルのテキストガイダンスを組み合わせます。以下の図からわかるように、コンセプトスライダーは、目サイズや眉毛の形状などの個別のスライダーを作成し、画像のペアを使用して目的の変換を捉えます。

結果をさらに洗練するために、特定のテキストを提供して、方向が特定の顔の領域に焦点を当てることができます。目標属性に対するステップごとの制御を可能にするスライダーを作成します。
スライダーの合成
コンセプトスライダーの使用の主な利点の1つは、複数のスライダーを組み合わせて、単一の概念に焦点を当てるのではなく、より強化された制御を可能にすることです。さらに、コンセプトスライダーは軽量なLoRAアダプターであるため、共有もしやすく、拡散モデルに簡単に重ねることができます。ユーザーは、複雑な生成を誘導するために、複数のノブを同時に調整できます。興味深いスライダーセットをダウンロードすることで、複数のスライダーを組み合わせて、概念の空間をより高次元で移動できます。

以下の画像は、コンセプトスライダーの合成機能を示しています。各行の左から右に、複数のスライダーが順番に合成され、高次元の概念空間を移動するための強化された制御が可能になります。

画像の品質の向上
最先端のテキストから画像への拡散フレームワークや大規模な生成モデルであるStable Diffusion XLモデルは、高品質でリアルな画像を生成する能力がありますが、ぼけた物体や歪んだ物体などの画像の歪みに敏感です。コンセプトスライダーの使用により、低ランクパラメータ方向を特定することで、歪みの少ない画像を生成できます。これにより、これらのモデルの真の能力が解放され、よりリアルな画像が生成されます。
手の修正
リアルな手の画像を生成することは、拡散フレームワークにとって常に課題でした。コンセプトスライダーの使用により、手の歪みを直接制御できます。以下の画像は、「手の修正」コンセプトスライダーの使用により、よりリアルな手の画像を生成できることを示しています。

修正スライダー
コンセプトスライダーの使用は、リアルな手の画像を生成するだけでなく、画像の全体的なリアリズムを向上させる可能性もあります。コンセプトスライダーは、一般的な歪み問題から画像をシフトさせることができる単一の低ランクパラメータ方向を特定します。以下の画像で示すように、結果は以下のとおりです。

最終的な考え
この記事では、拡散モデルにおける生成された出力に対する解釈可能な制御を可能にする新しいパラダイムであるコンセプトスライダーについて説明しました。コンセプトスライダーの使用は、現在のテキストから画像への拡散フレームワークが直面している課題を解決することを目的とします。さらに、多くのテキストから画像への拡散モデルは、画像内の視覚的な概念と属性を制御するのに苦労し、連続的な属性を調整することができず、不満足な出力につながることがあります。コンセプトスライダーの使用により、テキストから画像への拡散フレームワークはこれらの問題を緩和し、コンテンツクリエーターとエンドユーザーに画像生成プロセスに対する強化された制御を提供し、現在のフレームワークが直面している問題を解決することができます。












