AIモデルとプラットフォーム

ブラシネット:デュアルブランチ拡散を用いた画像修復

mm
Unite.AI を Google の優先ソースに追加

画像修復は、コンピュータビジョンの古典的な問題であり、画像のマスクされた領域を自然で妥当なコンテンツで復元することを目的としています。従来の画像修復手法を使用する既存の研究では、生成対抗ネットワーク(GAN)や変分自己符号化器(VAE)などの手法がよく使用されますが、補助的な手作業で設計された特徴量が必要となる場合があります。しかし、これらの手法では、満足のいく結果が得られない場合があります。近年、拡散ベースの手法は、高品質な画像生成、出力の多様性、細かい制御の能力が優れているため、コンピュータビジョンのコミュニティで人気を博しています。画像修復タスクのための拡散モデルを使用する初期の試みでは、標準的なノイズ除去戦略を変更して、マスクされた領域を事前トレーニングされた拡散モデルからサンプリングし、未マスクされた領域を与えられた画像からコピーしました。ただし、これらの手法は、単純な画像修復タスクでは満足のいく結果をもたらしましたが、複雑なマスクの形状、テキストのプロンプト、画像のコンテンツに対しては、全体的な一貫性が不足していました。この一貫性の欠如は、主にマスクの境界と未マスクされた画像領域のコンテキストに関する限られた認識能力に起因します。

拡散モデルを画像修復タスクに使用するための現在のアプローチは、サンプリング戦略の変更または画像修復専用の拡散モデルの開発を伴うことがよくあります。ただし、これらのアプローチでは、画像の品質が低下したり、意味のあるセマンティクスが一貫性のないままになることがあります。画像修復モデルの開発と研究が進むにつれて、画像修復は依然としてコンピュータビジョンの開発者にとって大きな課題です。この課題に対処し、画像修復モデルの将来の道筋を切り開くために、この記事では、ブラシネット(BrushNet)という新しいプラグアンドプレイのデュアルブランチ工学フレームワークについて説明します。ブラシネットは、任意の事前トレーニングされた拡散モデルにピクセルレベルのマスクされた画像特徴を埋め込み、画像修復タスクの結果を向上させます。ブラシネットフレームワークは、画像特徴とノイズの潜在変数を個別のブランチに分割する新しいパラダイムを導入します。この分割により、モデルの学習負荷が大幅に軽減され、マスクされた画像情報が階層的に組み込まれることができます。ブラシネットフレームワークに加えて、セグメンテーションベースのパフォーマンス評価と画像修復トレーニングを可能にするブラシベンチ(BrushBench)とブラシデータ(BrushData)についても説明します。

この記事では、ブラシネットフレームワークを詳細に説明し、メカニズム、方法、構造について探ります。また、最先端のフレームワークとの比較についても説明します。では、始めましょう。

ブラシネット:デュアルブランチ拡散を用いた画像修復

画像修復は、画像の欠落した領域を復元することを目的としたコンピュータビジョンの古典的な問題です。画像修復は、画像編集や仮想トライオンなどのさまざまなコンピュータビジョンタスクで使用されます。最近、Stable DiffusionやStable Diffusion 1.5などの拡散モデルは、高品質な画像生成、出力の多様性、細かい制御の能力を実証しています。拡散モデルの優れた潜在能力により、研究者は画像修復タスクに拡散モデルを使用するようになりました。

従来の拡散ベースのテキストガイド画像修復フレームワークでは、2つのカテゴリに分類できます:サンプリング戦略の変更と専用の画像修復モデル。サンプリング戦略の変更では、標準的なノイズ除去プロセスを変更して、マスクされた領域を事前トレーニングされた拡散モデルからサンプリングし、未マスクされた領域を与えられた画像からコピーします。ただし、これらのアプローチでは、画像修復の結果が一貫性のないままになることがあります。専用の画像修復モデルでは、画像修復専用のモデルをファインチューニングして、コンテキストを考慮してマスクされた画像を生成します。ただし、これらのアプローチでは、画像の品質が低下したり、意味のあるセマンティクスが一貫性のないままになることがあります。

以下の画像では、専用の画像修復モデルがマスクされた画像潜在変数、ノイズ潜在変数、テキスト、そしてマスクを初期段階で結合することが示されています。専用の画像修復モデルのアーキテクチャ設計は、マスクされた画像特徴に影響を与え、UNetアーキテクチャの後の層が純粋なマスクされた画像特徴を取得できないようにします。さらに、生成と条件を単一のブランチで処理することは、UNetアーキテクチャにさらなる負担を課します。拡散モデルのバックボーンのさまざまなバリエーションでファインチューニングが必要となるため、これらのアプローチは時間がかかり、転送性が限られていることがあります。

マスクされた画像特徴を抽出するための追加のブランチを追加することは、上記の問題に対する適切な解決策のように思えるかもしれませんが、既存のフレームワークでは、画像修復に直接適用すると不十分な情報が抽出されることがあります。したがって、ControlNetなどの既存のフレームワークは、専用の画像修復モデルと比較して不十分な結果をもたらします。ブラシネットフレームワークは、元の拡散ネットワークに追加のブランチを導入し、画像修復タスクに適したアーキテクチャを実現します。ブラシネットフレームワークの設計とアーキテクチャは、3つのポイントにまとめることができます。

  1. ランダムに初期化された畳み込み層ではなく、ブラシネットフレームワークでは、VAEエンコーダを使用してマスクされた画像を処理します。したがって、ブラシネットフレームワークは、UNet分布に適応するために画像特徴をより効果的に抽出できます。
  2. ブラシネットフレームワークは、事前トレーニングされたUNetアーキテクチャに、層ごとにフルUNet特徴量を段階的に組み込みます。これは、密なピクセル単位の制御を可能にする階層的なアプローチです。
  3. ブラシネットフレームワークは、UNetコンポーネントからテキストのクロスアテンションを削除して、追加のブランチで純粋な画像情報のみを考慮します。さらに、ブラシネットモデルは、より一貫性のある結果とより広い制御可能な範囲を実現するために、ぼかしたブレンド戦略を実装することを提案します。

ブラシネット:方法とアーキテクチャ

以下の図は、ブラシネットフレームワークの概要を示しています。

ブラシネットフレームワークは、マスクされた画像ガイダンスの挿入にデュアルブランチ戦略を使用し、ぼかしたマスクを使用して未マスクされた領域を保存します。ブラシネットフレームワークは、追加されたスケールを調整して柔軟な制御を実現することができることに注意してください。与えられたマスクされた画像入力とマスクに対して、ブラシネットモデルは修復された画像を出力します。モデルはまずマスクをダウンサンプリングして潜在変数のサイズに合わせ、次にマスクされた画像をVAEエンコーダに输入して潜在変数の分布を合わせます。モデルは次に、マスクされた画像潜在変数、ノイズ潜在変数、ダウンサンプリングされたマスクを結合して入力を生成します。モデルが抽出する特徴は、ゼロ畳み込みブロックの後に事前トレーニングされたUNet層に追加されます。ノイズ除去の後、モデルはぼかしたマスクを使用してマスクされた画像と生成された画像をブレンドします。

マスクされた画像ガイダンス

ブラシネットフレームワークは、画像生成プロセスからマスクされた画像特徴の抽出を明示的に分離する追加のブランチを使用して、事前トレーニングされた拡散ネットワークにマスクされた画像特徴を挿入します。入力は、マスクされた画像潜在変数、ノイズ潜在変数、ダウンサンプリングされたマスクを結合して形成されます。ノイズ潜在変数は、画像生成プロセス中に画像生成の情報を提供し、マスクされた画像特徴のセマンティックの一貫性を強化するのに役立ちます。ブラシネットフレームワークは、変分自己符号化器を使用して、マスクされた画像からマスクされた画像潜在変数を抽出します。さらに、ブラシネットフレームワークは、マスクのサイズがマスクされた画像潜在変数とノイズ潜在変数のサイズと一致することを保証するために、キュービック補間を使用してマスクをダウンサンプリングします。マスクされた画像特徴を処理するために、ブラシネットフレームワークは、事前トレーニングされた拡散モデルのコピーを実装し、クロスアテンション層を除去します。事前トレーニングされた拡散モデルの事前トレーニング済み重みは、マスクされた画像特徴の抽出に強い先入観を提供し、クロスアテンション層を除去することで、追加のブランチ内で純粋な画像情報のみが考慮されることを保証します。ブラシネットフレームワークは、特徴を層ごとに凍結された拡散モデルに挿入して、階層的な密なピクセル単位の制御を可能にします。また、ゼロ畳み込み層を使用して、トレーニング可能なブラシネットモデルとロックされたモデル之间の接続を確立し、初期トレーニング段階で隠れ状態への有害なノイズの影響を防ぎます。

ブレンド操作

前述のように、潜在変数空間でブレンド操作を実行すると、マスクのサイズを変更する必要があり、ブラシネットフレームワークもこの問題に遭遇します。さらに、変分自己符号化器のエンコードとデコード操作には、限られた操作が存在し、完全な画像再構成を保証できないことがあります。未マスクされた領域の画像を完全に一貫性のあるものにするために、既存の研究では、元の画像からの未マスクされた領域のコピーなどのさまざまなテクニックを実装しています。ただし、このアプローチでは、最終結果の生成においてセマンティック的一貫性が不足することがあります。他の方法である潜在変数ブレンド操作では、未マスクされた領域の望ましい情報を保存するのに苦労することがあります。

柔軟な制御

ブラシネットフレームワークのアーキテクチャ設計により、プラグアンドプレイの統合が可能になり、柔軟な保存スケールが実現します。ブラシネットフレームワークは、事前トレーニングされた拡散モデルの重みを変更しないため、開発者はファインチューニングされた拡散モデルとともにプラグアンドプレイのコンポーネントとして統合できます。さらに、開発者は、与えられた重みwを使用して、ブラシネットモデルの特徴を凍結された拡散モデルに組み込むことで、未マスクされた領域の保存スケールを制御できます。ブラシネットフレームワークは、保存スケールを調整するための柔軟な方法を提供し、ぼかしのスケールを調整したり、ぼかしの操作を実行するかどうかを決定したりできます。したがって、画像修復プロセスに対する柔軟な調整と細かい制御が可能になります。

ブラシネット:実装と結果

ブラシネットフレームワークの結果を分析するために、ブラシベンチと呼ばれるセグメンテーションベースの画像修復データセットを提案します。このデータセットには600以上の画像が含まれており、各画像には人間が注釈したマスクとキャプション注釈が付いています。データセット内の画像は、自然な画像と人工的な画像の間で均等に分割されており、さまざまなカテゴリにも均等に分割されています。これにより、さまざまなカテゴリ間で公平な評価が可能になります。ブラシネットフレームワークは、データセットをセグメンテーションベースとブラシマスクの2つの異なる部分に分類します。

数量的な比較

以下の表は、ブラシネットフレームワークと既存の拡散ベースの画像修復モデルを、Stable Diffusionをベースモデルとして使用した場合のブラシベンチデータセットでの結果を比較しています。

表からわかるように、ブラシネットフレームワークは、マスクされた領域の保存、テキストの整列、画像の品質において優れた効率を示しています。さらに、Stable Diffusion Inpainting、HD-Painter、PowerPaintなどのモデルは、画像内修復タスクでは強いパフォーマンスを示していますが、外部修復タスクでは、特にテキストの整列と画像の品質において、パフォーマンスが低下しています。全体的に、ブラシネットフレームワークは最も強い結果を示しています。

さらに、以下の表は、ブラシネットフレームワークと既存の拡散ベースの画像修復モデルを、EditBenchデータセットでの結果を比較しています。ブラシベンチデータセットでの結果と同様のパフォーマンスが観察され、ブラシネットフレームワークはさまざまなマスクタイプの画像修復タスクで強いパフォーマンスを示しています。

質的な比較

以下の図は、ブラシネットフレームワークと既存の画像修復方法を、人工知能と自然画像のさまざまな修復タスクで比較しています。

図からわかるように、ブラシネットフレームワークは未マスクされた領域のの一貫性と、修復された領域のセマンティック的一貫性において優れた結果を示しています。さらに、事前トレーニングされた拡散モデルの未変更のブランチは、さまざまなデータドメイン(アニメーションや絵画など)に対する優れたパフォーマンスを提供する利点をもたらします。

最終的な考え

この記事では、ブラシネットフレームワークについて説明しました。ブラシネットは、任意の事前トレーニングされた拡散モデルにピクセルレベルのマスクされた画像特徴を埋め込み、画像修復タスクの結果を向上させる新しいプラグアンドプレイのデュアルブランチ工学フレームワークです。ブラシネットフレームワークは、画像特徴とノイズの潜在変数を個別のブランチに分割する新しいパラダイムを導入します。この分割により、モデルの学習負荷が大幅に軽減され、マスクされた画像情報が階層的に組み込まれることができます。ブラシネットフレームワークに加えて、セグメンテーションベースのパフォーマンス評価と画像修復トレーニングを可能にするブラシベンチとブラシデータについても説明しました。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。