AIモデルとプラットフォーム

EditGANを用いた高精度セマンティック画像編集

mm
Unite.AI を Google の優先ソースに追加

生成対抗ネットワーク(GAN)またはGANは、画像編集業界で新しい応用を見せてきました。過去数ヶ月で、EditGANはAI/ML業界で人気を博しており、高精度および高品質のセマンティック画像編集のための新しい方法です。

EditGANモデルについて詳細に説明し、セマンティック画像編集業界における重要な里程標となる可能性についてお話します。

では、始めましょう。EditGANについて説明する前に、EditGANの重要性と、EditGANが進歩した理由を理解する必要があります。

なぜEditGANか?

伝統的なGANアーキテクチャは、AIベースの画像編集業界を大幅に進歩させましたが、GANアーキテクチャをゼロから構築する際にいくつかの大きな課題があります。

  1. トレーニング段階では、GANアーキテクチャには、セマンティックセグメンテーション注釈付きの大量のラベル付きデータが必要です。
  2. 高レベルの制御のみを提供できます。
  3. また、画像の間で往復するだけで、補間のみを実行します。

伝統的なGANアーキテクチャは、仕事を完了しますが、広範囲にわたる展開には効果的ではないことがわかります。伝統的なGANアーキテクチャの低い効率性は、NVIDIAが2022年にEditGANを導入した理由です。

EditGANは、高精度および高品質のセマンティック画像編集のための効果的な方法であると提案されています。画像の詳細なセグメンテーションマスクを変更することで、ユーザーが画像を編集できる機能があります。EditGANが画像編集タスクのためのスケーラブルな方法である理由の1つは、そのアーキテクチャです。

EditGANモデルは、GANフレームワークに基づいて構築されており、画像とそのセマンティックセグメンテーションを共同でモデル化し、わずかなラベル付きまたは注釈付きトレーニングデータのみを必要とします。EditGANの開発者は、画像をGANの潜在空間に埋め込むことで、条件付き潜在コード最適化を実行して画像を効果的に変更しようとしました。さらに、最適化を節約するために、モデルは潜在空間に「編集ベクトル」を見つけることを試みます。

EditGANフレームワークのアーキテクチャにより、モデルは任意の数の編集ベクトルを学習でき、それらを他の画像に直接適用できます。さらに、実験結果は、EditGANが以前になかったレベルの詳細で画像を編集できることを示しています。

EditGANが必要な理由をまとめると、以下のようになります。

  1. 非常に高精度の編集。
  2. わずかなラベル付きデータで動作できます。
  3. リアルタイムシナリオで効果的に展開できます。
  4. 複数の編集を同時に実行できます。
  5. GAN生成、実画像埋め込み、ドメイン外画像で動作します。

高精度セマンティック画像編集with EditGAN

StyleGAN2は、EditGANの主な画像生成コンポーネントであり、画像生成のための最先端のGANフレームワークです。StyleGAN2フレームワークは、多変量正規分布のプールから抽出された潜在コードをマッピングし、現実的な画像にマッピングします。

StyleGAN2は、画像を合成するためにトレーニングされた深層生成モデルであり、画像をモデル化するだけでなく、画像のセマンティック理解も取得します。

セグメンテーショントレーニングと推論

EditGANモデルは、最適化とエンコーダを使用して画像をGANの潜在空間に埋め込み、セグメンテーションを新しい画像で実行し、セグメンテーションブランチをトレーニングします。EditGANフレームワークは、以前の研究を基に構築されており、画像を潜在空間に埋め込むためのエンコーダをトレーニングします。ここでの主な目的は、GANサンプルと実データのサンプルを使用して、標準のピクセルごとのL2とLPIPS構築損失を使用してエンコーダをトレーニングすることです。さらに、モデルは、GANサンプルを使用するときに、潜在コードを使用してエンコーダを明示的に正則化します。

結果として、モデルは、セマンティックセグメンテーションで注釈付きの画像をデータセットから潜在空間に埋め込み、セグメンテーションブランチをクロスエントロピー損失を使用してトレーニングします。

セグメンテーション編集を使用して潜在空間のセマンティクスを見つける

EditGANの主な目的は、セマンティックセグメンテーションと画像の共同分布を利用して、高精度の画像編集を実現することです。編集する必要がある画像が与えられた場合、モデルは、画像をEditGANの潜在空間に埋め込み、またはモデルのサンプル画像を使用します。セグメンテーションブランチは、対応するセグメンテーションを生成します。開発者は、ラベル付けまたはデジタルペイントツールを使用してセグメンテーションを変更し、編集することができます。

推論時のさまざまな編集方法

潜在空間編集ベクトルは、最適化を使用して取得できます。編集ベクトルは、さまざまな属性で分離されており、意味的に有意義です。したがって、新しい画像を編集するには、モデルは画像を潜在空間に直接埋め込み、以前学習した編集操作を直接実行できます。最適化を最初から再度実行する必要はありません。編集ベクトルは、画像を初期に編集するために必要な最適化を節約します。

開発者はまだ完全に分離を完了していません。編集ベクトルは、他の画像に使用すると、常に最良の結果をもたらさないことがあります。ただし、問題は、テスト時には編集アーティファクトを画像の他の部分から除去するために、いくつかの追加の最適化ステップを実行することで解決できます。

現在の知識に基づいて、EditGANフレームワークは、画像を3つの異なるモードで編集できます。

  • 編集ベクトルを使用したリアルタイム編集

ローカライズされた画像と分離された画像の場合、モデルは、さまざまなスケールで学習した編集ベクトルを適用して画像を編集し、画像をインタラクティブな速度で操作します。

  • ベクトルベース編集のための自己教師あり精製

ローカライズされた画像が完全に分離されていない場合、モデルは、以前学習した編集ベクトルを使用して画像を初期編集し、テスト時には編集アーティファクトを除去するために、いくつかの追加の最適化ステップを実行します。

  • 最適化ベース編集

大規模な画像特有の編集を実行するには、編集ベクトルを使用することはできません。モデルは、最初から最適化を実行します。

実装

EditGANフレームワークは、4つの異なるカテゴリの画像に評価されています: 車、鳥、猫、顔。セグメンテーションブランチは、車、鳥、猫、顔の各16、30、30、16の画像マスクペアを使用してトレーニングされます。画像を最適化のみを使用して編集する場合、またはモデルが編集ベクトルを学習しようとする場合、モデルはAdamオプティマイザを使用して100ステップの最適化を実行します。

猫、車、顔のデータセットの場合、モデルは、GANフレームワークのトレーニングに使用されなかったDatasetGANのテストセットの実画像を使用して編集機能を実行します。画像は、最適化とエンコーディングを使用して、EditGANの潜在空間に直接埋め込まれます。鳥のカテゴリの場合、GAN生成画像で編集が実行されます。

結果

定性的結果

ドメイン内結果

上の画像は、EditGANフレームワークが新しい画像に以前学習した編集ベクトルを適用し、30ステップの最適化を使用して画像を精製するときのパフォーマンスを示しています。EditGANフレームワークによって実行される編集操作は、すべてのクラスに対して分離されており、画像の全体的な品質を保持しています。結果を比較すると、EditGANフレームワークは、高精度で複雑な編集を実行しながら、主題のアイデンティティと画像の品質を保持するという点で、他の方法を上回っていることがわかります。

驚くべきことは、EditGANフレームワークが、目玉の拡大や車のホイールスポークの編集などの非常に高精度の編集を実行できることです。さらに、EditGANは、わずかなピクセルしかないオブジェクトのセマンティックパーツを編集することもできます。EditGANは、大規模な画像の変更も実行できます。EditGANフレームワークのいくつかの編集操作は、GANトレーニングデータに表示されていない画像を生成できます。

ドメイン外結果

EditGANのドメイン外パフォーマンスを評価するために、フレームワークはMetFacesデータセットでテストされました。EditGANモデルは、ドメイン内の実際の顔で編集ベクトルを作成します。モデルは、MetFacesのポートレートを100ステップの最適化プロセスを使用して埋め込み、30ステップの自己教師あり精製プロセスを使用して編集ベクトルを適用します。結果は、次の画像に示されています。

定量的結果

EditGANの画像編集機能を定量的に評価するために、モデルは、MaskGANによって最初に導入されたスマイル編集ベンチマークを使用します。中立的な表情の顔は、笑顔の顔に置き換えられ、3つのパラメータでパフォーマンスが測定されます。

  • セマンティック正確性

モデルは、編集後の画像に笑顔の表情があるかどうかを判断するために、事前にトレーニングされたスマイル属性クラシファイアを使用します。

  • 画像品質(分布レベル)

Kernel Inception Distance(KID)とFrechet Inception Distance(FID)は、CelebAテストデータセットと400枚の編集テスト画像の間で計算されます。

  • アイデンティティの保持

モデルは、編集時に画像の主題のアイデンティティを保持する能力を、事前にトレーニングされたArcFaceフィーチャ抽出ネットワークを使用して測定します。

上の表は、EditGANフレームワークと他のベースラインモデルを、スマイル編集ベンチマークで比較しています。EditGANフレームワークが高い結果をもたらす方法は、3つの異なるベースラインと比較されています:

  • MaskGAN

MaskGANは、非笑顔の画像とそのセグメンテーションマスク、およびターゲットの笑顔のセグメンテーションマスクを入力として取ります。EditGANと比較すると、MaskGANフレームワークは大量の注釈付きデータを必要とします。

  • ローカル編集

EditGANは、ローカル編集とのパフォーマンスも比較しています。ローカル編集は、GANの特徴をクラスタリングしてローカル編集を実装する方法であり、参照画像に依存しています。

  • InterFaceGAN

InterFaceGANも、EditGANと同様に、モデルの潜在空間に編集ベクトルを見つけようとします。ただし、EditGANとは異なり、InterFaceGANモデルは大量の注釈付きデータ、補助属性クラシファイア、微妙な編集精度が必要です。

  • StyleGAN2Distillation

この方法は、実画像埋め込みを必要とせずに、編集ベクトルモデルを使用してトレーニングデータセットを作成するための代替アプローチを作成します。

制限

EditGANはGANフレームワークに基づいているため、他のGANモデルと同じ制限があります。EditGANは、GANによってモデル化できる画像でのみ動作します。EditGANがさまざまなシナリオで動作することを難しくするのは、GANモデル化された画像でのみ動作するという制限です。ただし、EditGANの高精度な編集は、編集ベクトルを使用して他の画像に簡単に転送できます。

結論

GANは、画像編集業界の業界標準ではない理由の1つは、実用性が限られていることです。GANフレームワークは、通常、大量の注釈付きトレーニングデータを必要とし、高い効率と精度をもたらさないことがよくあります。

EditGANは、従来のGANフレームワークによって提示された問題に対処しようとします。EditGANは、高品質、高精度のセマンティック画像編集のための効果的な方法であると考えられています。結果は、EditGANが主張することを実際に提供し、現在の業界標準の実践やモデルよりも優れていることを示しています。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。