Andersonの視点

顔の合成をセマンティックセグメンテーションでオーケストレートする

mm
Unite.AI を Google の優先ソースに追加

Generative Adversarial Network (GAN) を使用して人間の顔を発明する問題は、現実世界のデータが不必要な付属物、たとえば髪の毛、背景、眼鏡、帽子、ピアスなどの顔の付属物を伴うことである。これらの付属物は、顔と密接に結びついており、個別の空間でアドレスすることができない。

一般的な GAN アーキテクチャでは、これらの要素は個別の空間でアドレスすることができず、顔と密接に結びついており、警察のスケッチ・アーティストのように、目や鼻、髪の色を変更することはできない。

しかし、画像合成研究分野はこれに取り組んでいる。

新しい研究では、GAN による顔生成を、さまざまなセクションに分割し、各セクションに個別のジェネレーターを割り当てて、より大きな自由度を実現している。真ん中の行では、顔の追加の領域を構築するための '特徴マップ' を見ることができる。出典: https://arxiv.org/pdf/2112.02236.pdf

新しい研究では、GAN による顔生成を、さまざまなセクションに分割し、各セクションに個別のジェネレーターを割り当てて、より大きな自由度を実現している。真ん中の行では、顔の追加の領域を構築するための ‘特徴マップ’ を見ることができる。出典: https://arxiv.org/pdf/2112.02236.pdf

新しい 論文 では、ByteDance の米国支部の研究者は、セマンティックセグメンテーションを使用して、顔の構成要素を個別のセクションに分割し、各セクションに個別のジェネレーターを割り当てて、より大きな自由度を実現している。

この論文は SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing というタイトルで、プロジェクトのページでは、さまざまな詳細な変換が可能になることを示している。

顔のテクスチャ、髪のスタイルと色、目や鼻の形、など、さまざまな要素を個別に操作できるようになった。出典: https://semanticstylegan.github.io/

顔のテクスチャ、髪のスタイルと色、目や鼻の形、など、さまざまな要素を個別に操作できるようになった。出典: https://semanticstylegan.github.io/

制御不能な潜在空間

GAN によって生成された顔には、現実世界のデータから得られた ‘特徴’ が含まれており、これらの特徴は ‘潜在コード’ と呼ばれる複雑な関係を形成している。これらの潜在コードは、分析することが難しく、操作することも難しい。

これらの潜在コードは ‘潜在空間’ と呼ばれ、GAN によって生成される顔の特徴を決定する役割を果たしている。

最近、別の新しい画像合成プロジェクトが登場し、GAN によって生成される顔の潜在空間を ‘マップ’ し、さらにそのマップを使用して潜在空間を操作することを目指している。

様々なGANアーキテクチャが提案されており、InterFaceGAN、StyleFlow、GANSpace、StyleRig などが含まれる。

潜在空間を分割して制御する

ByteDance の研究では、GAN によって生成される顔の潜在空間を分割して制御することを目指している。顔の各セクションに個別のジェネレーターを割り当てて、より大きな自由度を実現している。

セマンティックセグメンテーションを使用して、顔の各セクションを個別に操作できるようになっている。

新しいアプローチのアーキテクチャ。顔の各セクションに個別のジェネレーターを割り当てて、より大きな自由度を実現している。

新しいアプローチのアーキテクチャ。顔の各セクションに個別のジェネレーターを割り当てて、より大きな自由度を実現している。

セグメンテーションマップは、GAN によって生成される顔の各セクションを個別に操作できるようになっている。

各ジェネレーターは、顔の各セクションを個別に生成する役割を果たしている。

背景の置き換え

背景の置き換えは、GAN によって生成される顔の各セクションを個別に操作できるようになっている。

背景の置き換えは、GAN によって生成される顔の各セクションを個別に操作できるようになっている。

背景の置き換えは、GAN によって生成される顔の各セクションを個別に操作できるようになっている。

トレーニングとデータ

GAN によって生成される顔のトレーニングには、CelebAMask-HQ というデータセットを使用している。

トレーニングには、28,000 枚の画像を使用しており、256×256 ピクセルにリサイズしている。

トレーニングには、8 枚の NVIDIA Tesla V100 GPU を使用しており、2.5 日間でトレーニングを完了している。

暫定的な解決策?

このアプローチは、他のドメインにも適用できる可能性がある。

しかし、クラスの数が増加すると、GAN によって生成される顔の各セクションを個別に操作することが難しくなる可能性がある。

CityScapes という都市のデータセットには、30 クラスが存在している。

潜在空間を直接制御することの難しさは、錬金術と同等である可能性がある。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:[email protected]