Angle d’Anderson
Édition de l’espace latent d’un GAN avec ‘Blobs’

De nouvelles recherches de l’UC Berkeley et d’Adobe (ADBE ) offrent un moyen d’éditer directement le contenu hyper-réaliste qui peut être créé par un réseau antagoniste génératif (GAN), mais qui ne peut généralement pas être contrôlé, animé ou manipulé librement de la manière familière aux utilisateurs de Photoshop et aux praticiens de la CGI.
Intitulé BlobGAN, la méthode consiste à créer une grille de ‘blobs’ – des constructions mathématiques qui se cartographient directement sur le contenu dans l’espace latent du GAN.
En déplaçant les blobs, vous pouvez déplacer les ‘objets’ dans une représentation de scène, de manière intuitive qui est plus proche des méthodes de CGI et de CAD que de nombreuses tentatives actuelles pour cartographier et contrôler l’espace latent du GAN:

Manipulation de scène avec BlobGAN: lorsque les ‘blobs’ sont déplacés par l’utilisateur, la disposition des objets latents et des styles dans le GAN sont modifiés en conséquence. Pour plus d’exemples, voir la vidéo accompagnant le document, intégrée à la fin de cet article, ou à https://www.youtube.com/watch?v=KpUv82VsU5k
Puisque les blobs correspondent à des ‘objets’ dans la scène cartographiée dans l’espace latent du GAN, tous les objets sont désentrelacés a priori, ce qui permet de les modifier individuellement:

Les objets peuvent être redimensionnés, réduits, clonés et supprimés, entre autres opérations.
Comme pour tout objet dans un logiciel de retouche photo (ou même de traitement de texte), un blob peut être dupliqué et ensuite manipulé:

Les blobs peuvent être dupliqués dans l’interface, et leurs représentations latentes correspondantes seront également ‘copiées et collées’. Source: https://dave.ml/blobgan/#results
BlobGAN peut également analyser des images nouvelles et sélectionnées par l’utilisateur dans son espace latent:

Avec BlobGAN, vous n’avez pas besoin d’incorporer les images que vous souhaitez manipuler directement dans les données d’entraînement, puis de rechercher leurs codes latents, mais vous pouvez entrer des images sélectionnées à volonté et les manipuler. Source: https://dave.ml/blobgan/#results
Plus de résultats peuvent être vus ici, et dans la vidéo YouTube accompagnante ici (intégrée à la fin de cet article). Il y a également une démo interactive Colab ici*, et un référentiel GitHub ici**.
Ce type d’instrumentalité et de portée peut sembler naïf dans l’ère post-Photoshop, et les logiciels paramétriques tels que Cinema4D et Blender ont permis aux utilisateurs de créer et de personnaliser des mondes 3D pendant des décennies; mais cela représente une approche prometteuse pour dompter les excentricités et la nature ésotérique de l’espace latent dans un réseau antagoniste génératif, en utilisant des entités proxy qui sont cartographiées sur des codes latents.
Les auteurs affirment:
‘Sur un ensemble de données multi-catégoriel de scènes intérieures, BlobGAN surpasse Style-GAN2 en termes de qualité d’image mesurée par FID.’
Le document est intitulé BlobGAN: Représentations de scènes désentrelacées spatialement, et est écrit par deux chercheurs de l’UC Berkeley, ainsi que trois d’Adobe Research.
Intermédiaire
BlobGAN apporte un nouveau paradigme à la synthèse d’images GAN. Les approches antérieures pour aborder les entités discrètes dans l’espace latent, le nouveau document souligne, ont été soit ‘top-down’ soit ‘bottom up’.
Une méthode top-down dans un GAN ou un classificateur d’images traite les images de scènes comme des classes, telles que ‘chambre’, ‘église’, ‘visage’, etc. Ce type de paire texte/image alimente une nouvelle génération de cadres de synthèse d’images multimodales, tels que le récent DALL-E 2 d’OpenAI.
Les approches bottom-up, en revanche, cartographient chaque pixel dans une image dans une classe, un libellé ou une catégorie. De telles approches utilisent diverses techniques, bien que la segmentation sémantique soit un courant de recherche actuel.
Les auteurs commentent:
‘Les deux chemins semblent insatisfaisants car aucun ne peut fournir de moyens faciles de raisonnement sur les parties de la scène en tant qu’entités. Les parties de la scène sont soit intégrées dans un vecteur latent unique entrelacé (top-down), soit doivent être regroupées à partir d’étiquettes de pixels individuelles (bottom-up).’
Au lieu de cela, BlobGAN propose une représentation intermédiaire non supervisée, ou un cadre de proxy pour les modèles génératifs.

Le réseau de disposition cartographie les entités ‘blob’ locales (et contrôlables) sur des codes latents. Source: https://arxiv.org/pdf/2205.02837.pdf
Les blobs gaussiens (c’est-à-dire basés sur le bruit) sont ordonnés par profondeur, et représentent un goulet d’étranglement dans l’architecture qui attribue une cartographie à chaque entité, résolvant le plus grand obstacle à la manipulation du contenu GAN: la désentrelacement (également un problème pour les architectures basées sur les auto-encodeurs). La carte de blobs résultante est utilisée pour manipuler le décodeur de BlobGAN.
Les auteurs notent avec une certaine surprise que le système apprend à décomposer les scènes en dispositions et entités à l’aide d’un discriminateur standard qui n’utilise pas d’étiquettes explicites.
Architecture et Données
Les entités dans la carte de blobs sont converties en images via un réseau révisé StyleGAN2 dérivé ici, dans une approche qui s’inspire de recherches antérieures de NVIDIA (NVDA ).

Un dérivé révisé de StyleGAN 2 de la recherche NVIDIA. Source: https://arxiv.org/pdf/1912.04958.pdf
StyleGAN 2 est modifié dans BlobGAN pour accepter des entrées à partir de la carte de blobs au lieu d’un vecteur global unique, comme c’est généralement le cas.

Une série de manipulations rendues possibles par BlobGAN, notamment l’auto-complétion d’une scène de chambre vide, et la redimensionnement et la réorganisation des éléments de la pièce.
Par analogie, au lieu de créer un vaste et complexe bâtiment (l’espace latent) tout à coup, et de devoir explorer ses innombrables voies, BlobGAN envoie les blocs de composants au début, et sait toujours où ils sont. Cette désentrelacement du contenu et de l’emplacement est l’innovation majeure de ce travail.
* Non fonctionnel au moment de la rédaction
** Code non encore publié au moment de la rédaction
Publié pour la première fois le 8 mai 2022.












