AIモデルとプラットフォーム
マルチモーダル大規模言語モデルを用いた画像編集のガイド – MGIEの紹介
視覚デザインツールとビジョン言語モデルは、メディア業界で広く応用されています。近年、大幅な進歩が見られましたが、これらのツールを操作するには、まだしっかりとした理解が必要です。アクセシビリティとコントロールを高めるために、メディア業界はテキストガイドまたは指示に基づく画像編集技術を採用しています。これらの技術は、従来のリージョナルマスクや詳細な説明ではなく、自然言語コマンドを使用して、より柔軟で制御された画像操作を可能にします。しかし、指示に基づく方法は、しばしば簡潔な指示を提供することがあり、既存のモデルが完全に捉え、実行するのが難しい場合があります。また、リアルな画像を作成する能力で知られる拡散モデルは、画像編集業界で高く需要されています。
さらに、マルチモーダル大規模言語モデル(MLLMs)は、視覚認識応答生成とクロスモーダル理解を含むタスクで優れたパフォーマンスを示しています。MLLMガイド画像編集(MGIE)は、MLLMsにインスパイアされた研究であり、その能力を評価し、テキストまたはガイド付き指示を使用して編集をサポートする方法を分析します。このアプローチには、明確な指示を提供し、表現的な指示を導き出すことが含まれます。MGIE編集モデルは視覚情報を理解し、エンドツーエンドトレーニングを介して編集を実行します。この記事では、MGIEについて深く掘り下げ、グローバル画像最適化、Photoshopスタイルの変更、ローカル編集への影響を評価します。また、表現的な指示に依存する指示に基づく画像編集タスクにおけるMGIEの重要性についても議論します。MGIEの探索を始めましょう。
MGIE:マルチモーダル大規模言語モデルを用いた画像編集のガイド – 紹介
マルチモーダル大規模言語モデルと拡散モデルは、現在最も広く使用されているAIおよびMLフレームワークであり、優れた生成能力を持っています。一方では、拡散モデルがあり、非常にリアルで視覚的に魅力的な画像を生成することで知られています。他方では、マルチモーダル大規模言語モデルがあり、テキスト、言語、音声、画像/動画を含む幅広いコンテンツを生成する能力で知られています。
拡散モデルは、潜在的なクロスモーダルマップを交換して視覚操作を実行し、入力目標キャプションの変更を反映します。また、ガイド付きマスクを使用して画像の特定の領域を編集することもできます。しかし、拡散モデルがメディアアプリケーションで広く使用されている主な理由は、詳細な説明やリージョナルマスクに頼るのではなく、拡散モデルがテキスト指示またはコマンドを使用して編集を実行できるためです。大規模言語モデルは、自然言語処理タスクで優れた進歩を示してきました。MLLMsは、画像を自然な入力として使用し、適切な視覚認識応答を提供することができます。
しかし、テキスト指示に基づく画像編集タスクでは、指示が簡潔で明確でない場合、既存のモデルが完全に捉え、実行するのが難しい場合があります。MGIEまたはMLLMガイド画像編集は、拡散モデルとMLLMモデルで構成されるAI駆動フレームワークであり、次の画像に示すように、指示に基づく画像編集タスクで優れたパフォーマンスを示します。
MGIEアーキテクチャでは、拡散モデルはエンドツーエンドでトレーニングされており、潜在的な想像力で画像編集を実行します。一方、MLLMフレームワークは、明確な表現的な指示を予測することを学習します。拡散モデルとMLLMフレームワークは、視覚的推論を可能にする視覚的導出を活用して、画像編集タスクを実行します。MGIEフレームワークは、視覚認識タスクを実行して、合理的な画像編集を可能にします。
MGIEフレームワークは、指示に基づく画像編集とビジョン言語モデルの2つの既存のアプローチから着想を得ています。
指示に基づく画像編集は、人間のコマンドに従うことで視覚操作のアクセシビリティと制御性を大幅に高めることができます。指示に基づく画像編集には、主に2つのフレームワークが使用されます。GANフレームワークと拡散モデルです。GANまたは生成対抗ネットワークは画像を変更することができますが、特定のドメインに限定されるか、非リアルな結果を生成することがあります。一方、拡散モデルは、大規模なトレーニングにより、グローバルマップのクロスモーダル注意マップを制御して画像編集と変換を実行することができます。指示に基づく編集は、入力として直接コマンドを受け取り、リージョナルマスクや詳細な説明に限定されません。しかし、提供された指示が曖昧または十分に明確でない場合があり、編集タスクの指示を実行するのが難しい場合があります。
ビジョン言語モデルは、テキスト生成と一般化能力で知られており、幅広いタスクで優れたパフォーマンスを示しています。また、ロバストなテキスト理解を持ち、実行可能なプログラムまたは疑似コードを生成することもできます。ビジョン言語モデルのこの能力により、MLLMは画像を認識し、視覚特徴の整列と指示の調整を使用して、視覚的指示を生成することができます。最近のモデルは、MLLMを使用して入力テキストに関連する画像を生成することもあります。しかし、MGIEとMLLMまたはVLLMを区別するのは、MGIEが画像編集能力を強化するためにMLLMの能力を利用するという点です。
MGIE:アーキテクチャと方法論
従来、大規模言語モデルは自然言語処理生成タスクで使用されてきました。しかし、MLLMが主流になったことで、LLMは画像入力を認識して適切な視覚認識応答を提供する能力を得ました。従来、MLLMは事前トレーニングされたLLMから初期化され、視覚エンコーダーとアダプターを含み、視覚特徴を抽出して言語モダリティに投影します。したがって、MLLMフレームワークは視覚入力を認識することができますが、出力はまだテキストに限定されています。
提案されたMGIEフレームワークは、この問題を解決し、MLLMを使用して入力画像を出力画像に編集することを目的とします。MGIEフレームワークはMLLMを含み、明確な表現的なテキスト指示を導き出すことを学習します。また、MGIEフレームワークは、視覚と言語モダリティのギャップを埋めるために、特殊な画像トークンを追加し、モダリティの変換に編集ヘッドを採用します。これらのモダリティは、MLLMからの潜在的な視覚的想像力を提供し、拡散モデルを編集タスクの実行に導きます。MGIEフレームワークは視覚認識タスクを実行して、合理的な画像編集を可能にします。
簡潔な表現的な指示
従来、MLLMは、指示の調整と特徴の整列により、視覚関連の応答を提供することができます。MGIEフレームワークは、画像編集のために、テキストプロンプトを主な言語入力として使用し、編集コマンドの詳細な説明を導き出します。しかし、これらの説明は長すぎるか、繰り返しの説明を含むことがあり、意図の誤解を招く可能性があり、MGIEは編集の意図を明確にするために、事前トレーニングされた要約器を適用して、簡潔な説明を取得します。フレームワークは、簡潔で明確な指示を表現的な指示として扱い、教師強制を使用して、クロスエントロピー損失でMLLMをトレーニングします。
表現的な指示を使用すると、テキスト指示よりも具体的なアイデアを提供し、フレームワークの効率をさらに高めます。また、MGIEフレームワークは、長い説明を生成するのではなく、推論期間中に簡潔な表現的な指示を導き出すことができます。したがって、MGIEフレームワークは、編集の意図の視覚的想像力を取得することができますが、まだ言語モダリティに限定されています。この課題を克服するために、MGIEモデルは、表現的な指示の後に、トレーニング可能なワードエンベッディングを使用して、視覚トークンを追加し、MLLMが言語モデルヘッドを使用してこれらを生成することができます。
潜在的な想像力による画像編集
次のステップでは、MGIEフレームワークは、編集ヘッドを使用して、画像指示を実際の視覚的指示に変換します。編集ヘッドは、MLLMからの視覚トークンのシーケンスをシーケンスからシーケンスのモデルとして機能し、編集の指示を提供します。具体的には、ワードエンベッディングの変換は、視覚モダリティにおける一般的な表現として解釈され、編集の意図のためのインスタンス認識視覚的想像力コンポーネントを使用します。また、視覚的想像力で画像編集を導くために、MGIEフレームワークは、変分オートエンコーダーと潜在的なノイズ除去拡散を含む潜在的な拡散モデルをアーキテクチャに埋め込みます。潜在的な拡散モデルの主な目的は、編集の指示に従って、潜在的な入力を保存して、潜在的な目標を生成することです。拡散プロセスは、潜在的な目標に時間間隔を経てノイズを加え、ノイズレベルは各タイムステップで増加します。
MGIEの学習
次の図は、提案されたMGIEフレームワークの学習アルゴリズムをまとめています。
観察すると、MLLMは、指示の損失を使用して、簡潔な表現的な指示を導き出すことを学習します。入力画像指示からの潜在的な想像力を使用して、編集ヘッドのモダリティを変換し、潜在的な拡散モデルを編集タスクの実行に導きます。最後に、フレームワークは、パラメータ効率的なエンドツーエンドトレーニングのために、重みのほとんどを凍結します。
MGIE:結果と評価
MGIEフレームワークは、IPr2Prデータセットを主要な事前トレーニングデータとして使用し、CLIPフィルタリングされたデータとGPT-3モデルから抽出された指示、および画像を合成するためのPrompt-to-Promptモデルを含みます。また、MGIEフレームワークは、CLIPテキストエンコーダーと拡散モデルを備えたInsPix2Pixフレームワークを、指示に基づく画像編集タスクのベースラインとして扱います。さらに、MGIEモデルは、視覚的認識なしで指示のみの入力から表現的な指示を導き出すLLMガイド画像編集モデルも考慮します。
定量的分析
次の図は、ゼロショット設定でモデルをトレーニングした場合の編集結果をまとめています。Photoshopスタイルの変更を含むGIERとEVRデータの場合、表現的な指示は、曖昧なコマンドではなく、具体的な目標を明らかにし、編集結果を編集の意図に近づけることができます。
InsPix2Pixモデルと同じデータでトレーニングされたLGIEとMGIEは、LLMを使用して詳細な説明を提供することができますが、LGIEはまだ単一のモダリティに限定されています。一方、MGIEフレームワークは画像にアクセスでき、画像から明確な指示を導き出すことができます。
特定の目的の指示に基づく画像編集タスクのパフォーマンスを評価するために、開発者は各データセットで複数のモデルをファインチューニングし、次の表にまとめています。
観察すると、Photoshopスタイルの編集タスクのEVRとGIERに適応した後、モデルはパフォーマンスの向上を示しています。ただし、ファインチューニングにより、表現的な指示がよりドメイン固有になるため、MGIEフレームワークは大幅なパフォーマンスの向上を示します。ドメイン関連の指示を学習するため、拡散モデルは、ファインチューニングされたLLMの利点を活かして、具体的な編集シーンを示すことができます。これにより、ローカル変更とローカル最適化の両方が利益を得ます。また、視覚認識ガイダンスが編集の意図により一致しているため、MGIEフレームワークは一貫してLGIEよりも優れた結果を示します。
次の図は、入力またはグラウンドトゥルースゴール画像と表現的な指示のCLIPスコアを示しています。高いCLIPスコアは、指示と編集ソースの関連性を示し、MGIEは入力画像と出力画像の両方でLGIEよりも高いCLIPスコアを示しています。
定性的結果
次の画像は、MGIEフレームワークの定性的分析をまとめています。
MGIEフレームワークは、マルチモーダルであり、画像へのアクセスにより、編集タスクを完了し、編集の意図に非常に近い明確な視覚的想像力を提供します。一方、LGIEフレームワークは、単一のモダリティに限定されているため、単一の言語ベースの洞察しか持ちませんが、編集画像のための不正確または無関係な説明を導き出すことがあります。
最終的な考え
この記事では、MGIEまたはMLLMガイド画像編集について説明しました。MGIEは、MLLMにインスパイアされた研究であり、MLLMの能力を評価し、テキストまたはガイド付き指示を使用して編集をサポートする方法を分析します。このアプローチには、明確な指示を提供し、表現的な指示を導き出すことが含まれます。MGIE編集モデルは視覚情報を理解し、エンドツーエンドトレーニングを介して編集を実行します。MGIEフレームワークは、明確な視覚認識指示を生成し、合理的な画像編集を可能にします。












