Andersonの視点
GANの潜在空間をマッピングすることの意図しない利点

AIによって生成された画像の品質と忠実度を向上させるために、中国とオーストラリアの研究者グループが、Generative Adversarial Network (GAN) の潜在空間をインタラクティブに制御する方法を偶然に発見しました。これは、映画、ゲーム、ソーシャルメディアなど、エンターテインメントと研究の分野で革命を起こす新しい画像合成技術の背後にある、謎の計算行列です。
彼らの発見は、プロジェクトの中心的な目標の副産物であり、ユーザーがマウスでGANの潜在空間を任意に探索できるようにします。ビデオをスクラビングしたり、書籍をめくるようにします。

研究者の伴うビデオ(記事の最後に埋め込まれています)の抜粋。ユーザーはトランスフォーメーションを「グラブ」カーソル(上左)で操作しています。ソース:https://www.youtube.com/watch?v=k7sG4XY5rIc
この方法は、「ヒートマップ」を使用して、GANが同じデータセットを何千回も(または何百万回も)実行するときに、どの画像領域を改善する必要があるかを示します。ヒートマップは、GANの次の試行が前回よりも良くなるように、画像の品質を向上させることを目的としています。しかし、偶然にも、これはユーザーがマウスでブラウズできる潜在空間の「マップ」を提供します。

GradCAMを介した空間的視覚的注意を強調し、明るい色を課すことで注意が必要な領域を示します。これらのサンプルは、研究者のプロジェクトでStyleGan2のデフォルト実装で生成されました。ソース:https://arxiv.org/pdf/2112.00718.pdf
この論文は、GANの平衡を向上させるための空間的認識の向上と呼ばれています。中国の香港大学とオーストラリア国立大学の研究者によって作成されています。論文のほか、ビデオやその他の資料はプロジェクトページで見つけることができます。
この研究はまだ初期段階であり、現在は低解像度の画像(256×256)に限定されていますが、GANの「ブラックボックス」の潜在空間を解放することを示す概念実証であり、画像合成のコントロールを高めるための研究プロジェクトがこの分野で進行中です。
そのような画像は魅力的です(そして、この記事の最後に埋め込まれたビデオでは、より高解像度でさらに多くの画像を見ることができます)。しかし、もっと重要なことは、このプロジェクトが画像の品質を向上させ、潜在的にそれを速くする方法を見つけたことです。GANにトレーニング中にどこが間違っているかを具体的に示すことができます。
しかし、Adversarialという言葉が示すように、GANは単一のエンティティではなく、権威と苦労の間の不均衡な闘争です。この研究で改善された点を理解するために、現在までにこの戦争がどのように描写されてきたかを見てみましょう。
ジェネレーターの哀れな運命
あなたが新しいアイテムを買ったときに、搾取された国で生産されたものだったかもしれない、または、ボスやクライアントが「もう一度やり直して!」と言ったが、どこが間違っているのかを教えてくれなかったことがあるなら、Generative Adversarial Networkのジェネレーター部分に少し同情してみてください。

ジェネレーターは、過去5年ほどでGANが実現した、実在しない写真のような人々の生成、古いビデオゲームの4K解像度へのアップグレード、世紀前の映像をフルカラーのHD出力に変換するなど、多くの驚異的なAIの新技術を実現するために働いてきました。

実在しない人々の写真のような顔の生成から、古い映像の復元やアーカイブのビデオゲームの復活まで、GANは過去数年で多忙でした。
ジェネレーターは、トレーニングデータを何度も繰り返し実行します(例えば、ランダムな人々の写真を生成するために、顔の写真)。1枚ずつ、数日間、または数週間続けて、ジェネレーターは、学習した写真と同じくらい説得力のある画像を生成できるようになるまでです。
ジェネレーターは、どのようにして進歩しているかを知ることができますか?
ジェネレーターには地獄のボスがいます。

ディスクリミネーターの冷酷な不透明性
ディスクリミネーターの役割は、ジェネレーターが十分に良くないことを伝え、「もう一度やり直して!」と伝えることです。ディスクリミネーターは、ジェネレーターに「何が間違っているか」を教えません。ただ、ジェネレーターが生成した画像を秘密裏に調べ、生成された画像とソース画像(もちろん秘密裏に)を比較して、スコアを割り当てます。
スコアは決して十分ではありません。ディスクリミネーターは、研究者がそれを停止する(追加のトレーニングが出力の品質を向上させないと判断したとき)まで、「もう一度やり直して!」と繰り返し続けます。
このように、建設的な批判が欠け、スコアのメトリックが謎であることを受けて、ジェネレーターは、ランダムに推測して、どの画像部分や側面が前回よりも高得点をもたらしたのかを見つけなければなりません。これにより、ジェネレーターは、より良いスコアを得るために、多くの不満足なルートを辿ることになります。
ディスクリミネーターとしての指導者とメンター
新しい研究による革新は、基本的にディスクリミネーターがジェネレーターにどの画像部分が不十分であるかを示すことです。そうすれば、ジェネレーターは次の試行でそれらの領域に焦点を当てることができます。関係の性質は、対立的から協力的なものに変わりました。

ディスクリミネーターとジェネレーター間の認識の不均衡を是正するために、研究者は、ディスクリミネーターの洞察をジェネレーターの次の試行のための視覚的なフィードバック補助として機能するメカニズムであるGradCAMを使用しました。
新しい「平衡」トレーニング方法は、EqGANと呼ばれています。再現性を最大化するために、研究者は既存の技術や方法をデフォルト設定で取り入れています。例えば、StyleGan2アーキテクチャの使用が含まれます。

EqGANのアーキテクチャ。ジェネレーターの空間エンコーディングは、ディスクリミネーターの空間認識と一致しています。空間ヒートマップ(先ほどの画像を参照)のランダムサンプルは、空間エンコーディングレイヤー(SEL)を介してジェネレーターにエンコードされます。GradCAMは、ディスクリミネーターの注意マップをジェネレーターに提供するメカニズムです。
GradCAMは、ディスクリミネーターの批判を反映するヒートマップ(上記の画像を参照)を生成し、それをジェネレーターに提供します。
モデルのトレーニングが完了すると、対応付けは協力的なプロセスの成果物として残りますが、最終的な潜在コードをインタラクティブに探索するために使用することもできます(研究者のプロジェクトビデオで示されているように)。
EqGAN
このプロジェクトでは、LSUN CatとChurchesのデータセットや、FFHQデータセットなど、人気のデータセットを使用しました。以下のビデオも、EqGANを使用した顔や猫の操作の例を示しています。
すべての画像は、EqGANの公式実装であるStyleGAN2でトレーニングする前に256×256にリサイズされました。モデルは、ディスクリミネーターが2500万枚以上の画像を見たときまで、バッチサイズ64で8つのGPU上でトレーニングされました。
Frechet Inception Distance(FID)を使用して、選択されたサンプルに対するシステムの結果をテストし、研究者は、ディスクリミネーターがジェネレーターに対して保持する知識の優位性の程度を示すメトリックであるDisequilibrium Indicator(DI)を確立しました。
3つのデータセットでトレーニングされた新しいメトリックは、ジェネレーターに空間的認識をエンコードした後、FIDとDIの両方で改善された平衡を示す有用な低下を示しました。

研究者は以下の結論に至ります:
‘GANの平衡を再検討し、GANの平衡を操作して画像合成の品質を向上させるための新しい方法を開発するためのさらなる研究を刺激することを希望します。将来的には、この問題についてさらに理論的な調査を行う予定です。’
そして続けています:
‘質的結果は、ジェネレーターが特定の領域に集中することに成功したことを示しています。さまざまなデータセットの実験は、GANトレーニングにおける不平衡を緩和し、全体的な画像合成の品質を大幅に改善することを確認しています。空間的認識を持つ結果モデルは、出力画像のインタラクティブ操作も可能にします。’
以下のビデオを見て、プロジェクトの詳細とGANの潜在空間のダイナミックでインタラクティブな探索のさらなる例を確認してください。
11:12 2021年12月4日 – GradCAMのURLを修正し、周囲の参照を整理しました。












