AIモデルとプラットフォーム

InstructIR:高品質画像復元を実現する人間の指示に基づくフレームワーク

mm
Unite.AI を Google の優先ソースに追加

画像は多くの情報を伝えることができますが、モーションブルー、ヘイズ、ノイズ、ダイナミックレンジの低下などの問題で劣化することがあります。これらの問題は、低レベルコンピュータビジョンの分野では劣化と呼ばれ、環境条件の悪さやカメラの限界によって発生することがあります。画像復元は、劣化した画像から高品質のクリーンな画像を復元することを目指すコンピュータビジョンの重要な課題です。画像復元は複雑な逆問題であるため、1つの画像に対して複数の解決策が存在する可能性があります。いくつかのアプローチは、特定の劣化に対処することを目的としています。たとえば、ノイズを減らしたり、ブルーを除去したり、ヘイズを除去したりします。

これらの方法は特定の問題に対しては良い結果をもたらす可能性がありますが、異なる種類の劣化に対しては一般化することが難しいことがあります。多くのフレームワークは、幅広い画像復元タスクに対して、1つの汎用的なニューラルネットワークを使用しています。しかし、これらのネットワークはそれぞれ独立してトレーニングされています。したがって、各劣化タイプに対して別々のモデルを使用することは実用的ではありません。最近の開発では、All-In-Oneの復元モデルに焦点が当てられています。これらのモデルは、複数のレベルと種類の劣化を処理するために、1つの深いブラインド画像復元モデルを使用しています。異なるAll-In-Oneモデルは、劣化の種類に応じてモデルをガイドするために、異なるアプローチを実装しています。たとえば、劣化を分類するための補助モデルや、モデルを支援するために多次元ガイダンスベクトルまたはプロンプトを使用します。All-In-Oneモデルは一般的に期待される結果を示していますが、逆問題に対処する際にはまだ課題があります。

InstructIRは、画像復元の分野における画期的なアプローチです。InstructIRは、人間の指示に基づいて画像復元モデルをガイドすることを目的とした、最初の画像復元フレームワークです。InstructIRは、自然言語プロンプトを処理して、劣化した画像から高品質の画像を復元することができます。また、複数の劣化タイプを考慮することもできます。InstructIRは、画像除雨、除noise、除ヘイズ、除ブルー、低光量画像強化などの幅広い画像復元タスクで、最高のパフォーマンスを発揮します。

この記事では、InstructIRフレームワークについて詳細に説明します。InstructIRのメカニズム、方法論、建築について探り、最新の画像および動画生成フレームワークと比較します。では、始めましょう。

InstructIR:高品質画像復元

画像復元は、コンピュータビジョンの基本的な問題です。画像復元は、劣化した画像から高品質のクリーンな画像を復元することを目的とします。低レベルコンピュータビジョンの分野では、劣化は、モーションブルー、ヘイズ、ノイズ、ダイナミックレンジの低下などの画像内の不快な効果を表す用語です。画像復元は複雑な逆問題であるため、1つの画像に対して複数の解決策が存在する可能性があります。いくつかのフレームワークは、特定の劣化に対処することを目的としています。たとえば、ノイズを減らしたり、ブルーを除去したり、ヘイズを除去したりします。

最近のディープラーニング方法は、従来の画像復元方法よりも強力で一貫性のあるパフォーマンスを示しています。これらのディープラーニング画像復元モデルは、トランスフォーマーと畳み込みニューラルネットワークに基づくニューラルネットワークを使用して、さまざまな画像復元タスクに適応することを提案しています。これらのモデルは、ローカルとグローバルの特徴の相互作用を捉え、強化することができ、満足のいく一貫性のあるパフォーマンスを実現します。ただし、これらの方法は特定の劣化タイプに対しては適切に機能する可能性がありますが、異なる種類の劣化に対しては一般化することが難しいことがあります。さらに、多くの既存のフレームワークは、幅広い画像復元タスクに対して同じニューラルネットワークを使用していますが、各ニューラルネットワークは独立してトレーニングされています。したがって、各劣化タイプに対して別々のニューラルモデルを使用することは実用的ではありません。したがって、最近の画像復元フレームワークは、All-In-Oneの復元プロキシに焦点を当てています。

All-In-Oneまたはマルチ劣化またはマルチタスク画像復元モデルは、コンピュータビジョンの分野で人気を博しています。これらのモデルは、画像のさまざまなレベルと種類の劣化を、各劣化タイプに対して独立してトレーニングする必要なく、1つの深いブラインド画像復元モデルを使用して復元することができます。異なるAll-In-Oneモデルは、補助モデルを使用して劣化を分類したり、多次元ガイダンスベクトルまたはプロンプトを使用してモデルを支援したりするなどの異なるアプローチを実装しています。All-In-Oneモデルは一般的に期待される結果を示していますが、逆問題に対処する際にはまだ課題があります。

ここで、テキストベースの画像操作について説明します。テキストベースの画像操作は、テキストから画像生成や画像編集タスクを実行するために、過去の数年間にいくつかのフレームワークで実装されてきました。これらのモデルは、画像を生成するために、テキストプロンプトと拡散ベースのモデルを使用しています。InstructIRフレームワークの主なインスピレーションは、InstructPix2Pixフレームワークです。InstructPix2Pixは、画像を編集するために、ユーザーの指示を使用することを可能にします。したがって、ユーザーは、サンプル画像や追加の画像説明を提供する必要なく、自然なテキストでモデルに指示を与えることができます。

これらの基本概念に基づいて、InstructIRフレームワークは、人間の指示を使用して画像復元と逆問題を解決することを目的とした、最初のコンピュータビジョンモデルです。自然言語プロンプトに対して、InstructIRモデルは、劣化した画像から高品質の画像を復元することができ、複数の劣化タイプも考慮することができます。InstructIRフレームワークは、画像除雨、除noise、除ヘイズ、除ブルー、低光量画像強化などの幅広い画像復元タスクで、最高のパフォーマンスを発揮します。既存の研究では、学習されたガイダンスベクトルまたはプロンプト埋め込みを使用して画像復元を実行していますが、InstructIRフレームワークは、生のユーザープロンプトをテキスト形式で使用しています。InstructIRフレームワークは、人間の指示を使用して画像を復元することができ、1つのAll-In-Oneモデルで以前のモデルよりも多くの復元タスクをカバーしています。以下の図は、InstructIRフレームワークのさまざまな復元サンプルを示しています。

InstructIR:方法とアーキテクチャ

InstructIRフレームワークの核となる部分は、テキストエンコーダーと画像モデルで構成されています。モデルは、NAFNetフレームワークを使用しています。NAFNetは、U-Netアーキテクチャに基づく効率的な画像復元モデルです。さらに、モデルはタスクルーティング技術を実装して、1つのモデルで多くのタスクを学習することができます。以下の図は、InstructIRフレームワークのトレーニングと評価アプローチを示しています。

InstructPix2PixモデルにインスパイアされたInstructIRフレームワークは、人間の指示をコントロールメカニズムとして採用しています。したがって、ユーザーは追加の情報を提供する必要はありません。これらの指示は、ユーザーが画像内の劣化の正確な位置と種類を指示できるため、明確で表現力豊かな方法でやり取りすることができます。さらに、固定の劣化特有のプロンプトではなく、ユーザープロンプトを使用することで、モデルを使用するためのドメインの専門知識が不要になります。InstructIRフレームワークを、さまざまなプロンプトを理解する能力を与えるために、GPT-4という大規模な言語モデルを使用して、多様なリクエストを作成します。プロンプトのフィルタリングプロセス後、曖昧または不明確なプロンプトは削除されます。

テキストエンコーダー

テキストエンコーダーは、言語モデルがユーザープロンプトをテキスト埋め込みまたは固定サイズのベクトル表現にマッピングするために使用します。従来的には、CLIPモデルのテキストエンコーダーは、テキストベースの画像生成やテキストベースの画像操作モデルでユーザープロンプトをエンコードするために重要なコンポーネントです。CLIPフレームワークは視覚的なプロンプトに優れています。しかし、多くの場合、劣化の特徴を持たないユーザープロンプトは、CLIPエンコーダーを使用することで効率が低下する可能性があります。したがって、InstructIRフレームワークは、文を有意義な埋め込み空間でエンコードするためにトレーニングされた、コンパクトで効率的なテキストベースの文エンコーダーを使用しています。文エンコーダーは数百万の例で事前にトレーニングされており、伝統的なCLIPベースのテキストエンコーダーよりもコンパクトで効率的です。

テキストガイダンス

InstructIRフレームワークの重要な側面は、エンコードされた指示を画像モデルに対するコントロールメカニズムとしての実装です。InstructIRフレームワークは、タスクルーティングの概念に基づいて、インストラクションコンストラクションブロック(ICB)を提案しています。ICBは、モデル内でタスク特有の変換を可能にします。従来のタスクルーティングは、チャネル特徴にタスク特有の二値マスクを適用します。しかし、InstructIRフレームワークでは、劣化タイプがわからないため、このテクニックは直接適用されません。さらに、InstructIRフレームワークは、画像特徴とエンコードされた指示にタスクルーティングを適用し、シグモイド関数で活性化された線形層を使用して、テキスト埋め込みに依存する一連の重みを生成します。モデルは、NAFBlockを使用して条件付き特徴を強化し、NAFBlockとインストラクション条件付きブロックを使用して、エンコーダーブロックとデコーダーブロックの両方で特徴を条件付けます。

InstructIRフレームワークは、ニューラルネットワークフィルタを明示的に条件付けることはありませんが、マスクは、画像指示と情報に基づいて、モデルが最も関連性の高いチャネルを選択することを容易にします。

InstructIR:実装と結果

InstructIRモデルは、エンドツーエンドでトレーニング可能です。画像モデルは、事前にトレーニングする必要はありません。トレーニングが必要なのは、テキスト埋め込みプロジェクションと分類ヘッドのみです。テキストエンコーダーは、BGEエンコーダーを使用して初期化されます。BGEエンコーダーは、BERTのようなエンコーダーで、巨大な量の教師ありおよび教師なしデータで事前にトレーニングされています。InstructIRフレームワークは、NAFNetモデルを画像モデルとして使用します。NAFNetのアーキテクチャは、4レベルのエンコーダーとデコーダーで構成されており、各レベルに異なる数のブロックがあります。さらに、エンコーダーとデコーダーの間に4つのミドルブロックを追加して、特徴をさらに強化します。InstructIRモデルは、エンコーダーとデコーダーにのみ、ICBまたはインストラクション条件付きブロックを実装します。InstructIRモデルは、復元された画像とグラウンドトゥルースのクリーンな画像の間の損失と、テキストエンコーダーの意図分類ヘッドのクロスエントロピー損失を使用して最適化されます。InstructIRモデルは、AdamWオプティマイザを使用し、バッチサイズは32、学習率は5e-4で、約500エポックでトレーニングされます。さらに、コサインアニーリングの学習率減衰を実装します。InstructIRフレームワークの画像モデルは、約1600万のパラメータで構成されており、テキストプロジェクションパラメータは約10万個しかありません。したがって、InstructIRフレームワークは、標準のGPUで簡単にトレーニングできます。これにより、計算コストが削減され、適用性が向上します。

複数の劣化結果

InstructIRフレームワークは、複数の劣化とマルチタスクの復元に対して、2つの初期設定を定義します。

  1. 3D:3つの劣化モデルを使用して、ヘイズ除去、ノイズ除去、雨除去などの劣化問題に対処します。
  2. 5D:5つの劣化モデルを使用して、画像ノイズ除去、低光量画像強化、ヘイズ除去、ノイズ除去、雨除去などの劣化問題に対処します。

5Dモデルのパフォーマンスは、以下の表に示されています。これは、最新の画像復元モデルとAll-In-Oneモデルと比較しています。

表から見られるように、InstructIRフレームワークは、シンプルな画像モデルと約1600万のパラメータで、5つの異なる画像復元タスクを成功裏に処理することができます。指示ベースのガイダンスにより、競合する結果を達成します。以下の表は、3Dモデルのパフォーマンスを示しています。結果は、上記の結果と比較できます。

InstructIRフレームワークの主な特徴は、指示ベースの画像復元です。以下の図は、InstructIRモデルが、与えられたタスクに対して幅広い指示を理解する能力を示しています。また、敵対的な指示に対して、InstructIRモデルは強制されていないアイデンティティを実行します。

最終的な考え

画像復元は、コンピュータビジョンの基本的な問題です。画像復元は、劣化した画像から高品質のクリーンな画像を復元することを目的とします。低レベルコンピュータビジョンの分野では、劣化は、モーションブルー、ヘイズ、ノイズ、ダイナミックレンジの低下などの画像内の不快な効果を表す用語です。この記事では、InstructIRフレームワークについて説明しました。InstructIRは、世界初の画像復元フレームワークで、人間の指示を使用して画像復元モデルをガイドすることを目的とします。自然言語プロンプトに対して、InstructIRモデルは、劣化した画像から高品質の画像を復元することができ、複数の劣化タイプも考慮することができます。InstructIRフレームワークは、画像除雨、除noise、除ヘイズ、除ブルー、低光量画像強化などの幅広い画像復元タスクで、最高のパフォーマンスを発揮します。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。