Andersonの視点
GANの潜在空間を「Blob」で編集する

UC BerkeleyとAdobe (ADBE ) の新しい研究により、Generative Adversarial Network (GAN)によって生成される超現実的なコンテンツを直接編集できる方法が提供されました。しかし、通常、PhotoshopユーザーやCGIプラクティショナーにとって、コンテンツを制御したり、アニメーション化したり、自由に操作したりすることはできません。
この方法は、BlobGANと呼ばれ、GANの潜在空間に直接マップされる数学的な構成体である「Blob」のグリッドを作成することです。
Blobを移動することで、シーンの「オブジェクト」を直感的に移動できます。これは、CGIやCADの方法に近く、現在のGANの潜在空間を制御するための多くの試みよりも優れています。

BlobGANを使用したシーン操作:ユーザーがBlobを移動すると、GANの潜在的なオブジェクトとスタイルが対応して変更されます。 詳細は、以下のビデオまたはhttps://www.youtube.com/watch?v=KpUv82VsU5kを参照してください。
シーンの「オブジェクト」は、GANの潜在空間にマップされており、すべてのオブジェクトはa prioriで解離されています。これにより、個別に変更することができます。

オブジェクトをリサイズ、縮小、複製、削除することができます。
写真編集ソフトウェア(またはテキスト編集ソフトウェア)におけるオブジェクトと同様に、Blobを複製して後で操作することができます。

Blobを複製して、対応する潜在的な表現も「コピー&ペースト」できます。 ソース:https://dave.ml/blobgan/#results
BlobGANは、ユーザーが選択した新しい画像を潜在空間に解析することもできます。

BlobGANを使用すると、画像を直接編集データに組み込んで潜在的なコードを探す必要はありません。代わりに、選択した画像を入力して操作することができます。 ソース:https://dave.ml/blobgan/#results
詳細は、こちらまたはYouTubeビデオ(以下に埋め込まれています)を参照してください。また、Colabデモ*とGitHubリポジトリ**もあります。
この種のインストルメンタリティとスコープは、Photoshopの時代にナイーブに思えるかもしれません。パラメトリックソフトウェアパッケージであるCinema4DやBlenderは、すでに10年以上前から、ユーザーが3Dワールドを作成してカスタマイズできるようにしています。しかし、GANの潜在空間のエクセントリシティとアーケインな性質を、潜在的なコードにマップされたプロキシエンティティを使用して制御するための新しいアプローチを表しています。
著者は主張しています:
‘複数カテゴリのインドアシーンのデータセットで、BlobGANはStyle-GAN2を上回り、FIDによって測定された画像の品質が向上しました。’
論文は、BlobGAN:空間的に解離されたシーン表現と題され、UC Berkeleyの2人の研究者とAdobe Researchの3人の研究者によって書かれています。
中間者
BlobGANは、GAN画像合成に新しいパラダイムをもたらします。以前の潜在空間内の離散エンティティに対処するアプローチは、上向きまたは下向きでした。
上向きの方法では、GANまたは画像クラシファイアは、シーンの画像をクラス(「ベッドルーム」、「教会」、「顔」など)として扱います。この種のテキスト/画像のペアは、OpenAIの最近のDALL-E 2のような新しい多モーダル画像合成フレームワークを動かします。
下向きのアプローチでは、画像内の各ピクセルをクラス、ラベル、またはカテゴリにマップします。セマンティックセグメンテーションは、現在の研究の1つの流れです。
著者はコメントしています:
‘両方のアプローチは不満足です。シーンの部分をエンティティとして推論するための簡単な方法を提供できないからです。シーンの部分は、単一のエントングル潜在ベクトル(上向き)に焼き込まれるか、個々のピクセルラベルからグループ化する必要があります(下向き)。’
代わりに、BlobGANは、教師なしの中間レベルの表現、または生成モデル用のプロキシフレームワークを提供します。

レイアウトネットワークは、ローカル(および制御可能)な「Blob」エンティティを潜在的なコードにマップします。中央のカラーサークルは「Blobマップ」です。 ソース:https://arxiv.org/pdf/2205.02837.pdf
ガウシアンノイズベースのBlobは、深度順に並べられており、各エンティティにマッピングを割り当てるボトルネックを表し、GANコンテンツ操作の最大の課題である解離を解決します(オートエンコーダーベースのアーキテクチャでも問題です)。結果として得られる「Blobマップ」は、BlobGANのデコーダを操作するために使用されます。
著者は、明らかな驚きをもって、システムが明示的なラベルを使用しないオフザシェルフのディスクリミネータを使用して、シーンをレイアウトとエンティティに分解することを学習することを指摘しています。
アーキテクチャとデータ
Blobマップのエンティティは、NVIDIA (NVDA ) Researchの以前の研究からインスピレーションを得た、改訂されたStyleGAN2由来のネットワークを介して画像に変換されます。

NVIDIA Researchの改訂されたStyleGAN 2。いくつかの原則はBlobGANに採用または適応されました。 ソース:https://arxiv.org/pdf/1912.04958.pdf
StyleGAN 2は、BlobGANで改訂され、通常の場合と異なり、単一のグローバルベクトルではなく、Blobマップからの入力を受け取ります。

BlobGANによって可能な操作のシリーズ。ベッドルームシーンの「オートコンプリート」や部屋内の要素のリサイズとリロケーションが含まれます。下の行では、これを可能にするユーザーアクセス可能なインストルメンタリティ、つまりBlobマップを見ます。
アナロジーによって、巨大で複雑な建物(潜在空間)を一度に存在させて、無限の通路を探索するのではなく、BlobGANはコンポーネントブロックを最初から送り込み、常にその場所を把握しています。これが、この研究の主要な革新です。
* 作成時には機能していません
最初に公開された日:2022年5月8日。












