Angle d’Anderson

Recherche Adobe Étend les Éditions de Visage Décorrélées GAN

mm
Ajouter Unite.AI à vos sources préférées sur Google

Il n’est pas difficile de comprendre pourquoi l’ entrelacement est un problème dans la synthèse d’images, car c’est souvent un problème dans d’autres domaines de la vie; par exemple, il est beaucoup plus difficile de retirer du curcuma d’un curry que de jeter un cornichon dans un hamburger, et il est pratiquement impossible de désucrener une tasse de café. Certaines choses viennent simplement en bundle.

De même, l’entrelacement est un obstacle pour les architectures de synthèse d’images qui aimeraient idéalement séparer les différentes fonctionnalités et concepts lors de l’utilisation de l’apprentissage automatique pour créer ou éditer des visages (ou chiens, bateaux, ou tout autre domaine).

Si vous pouviez séparer des éléments tels que âge, sexe, couleur des cheveux, teint de peau, émotion, et ainsi de suite, vous auriez les débuts d’une véritable instrumentalité et flexibilité dans un cadre qui pourrait créer et éditer des images de visage à un niveau vraiment granulaire, sans entraîner des « passagers » indésirables dans ces conversions.

À l’entrelacement maximum (en haut à gauche), tout ce que vous pouvez faire est de changer l’image d’un réseau GAN appris à l’image d’une autre personne.

Ceci est essentiellement l’utilisation de la dernière technologie de vision par ordinateur pour atteindre quelque chose qui a été résolu par d’autres moyens il y a plus de trente ans.

Avec un certain degré de séparation (‘Séparation moyenne’ dans l’image ci-dessus), il est possible d’effectuer des changements basés sur le style, tels que la couleur des cheveux, l’expression, l’application cosmétique et la rotation limitée de la tête, entre autres.

Source: FEAT: Face Editing with Attention, Feb 2022, https://arxiv.org/pdf/2202.02713.pdf

Source: FEAT: Face Editing with Attention, février 2022, https://arxiv.org/pdf/2202.02713.pdf

Il y a eu un certain nombre de tentatives au cours des deux dernières années pour créer des environnements d’édition de visage interactifs qui permettent à l’utilisateur de changer les caractéristiques faciales avec des curseurs et d’autres interactions d’interface utilisateur traditionnelles, tout en conservant les fonctionnalités de base du visage cible intactes lors de l’ajout ou de la modification. Cependant, cela s’est avéré un défi en raison de l’entrelacement des fonctionnalités et de style dans l’espace latent du GAN.

Par exemple, le trait lunettes est souvent enchevêtré avec le trait âgé, ce qui signifie que l’ajout de lunettes peut également « vieillir » le visage, tandis que le vieillissement du visage peut ajouter des lunettes, selon le degré de séparation des fonctionnalités de niveau élevé appliquées (voir « Testing » ci-dessous pour des exemples).

Il a été presque impossible de modifier la couleur des cheveux et d’autres aspects des cheveux sans que les cheveux et leur disposition soient recalculés, ce qui donne un effet de « sizzling », de transition.

Source: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Source: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Parcours Latent-Latent GAN

Un nouvel article dirigé par Adobe présenté pour WACV 2022 propose une approche novatrice pour ces problèmes sous-jacents dans un article intitulé Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images.

Matériel supplémentaire de l'article Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Ici, nous voyons que les caractéristiques de base du visage appris ne sont pas entraînées dans les changements non liés. Voir la vidéo intégrée à la fin de l'article pour plus de détails et de résolution. Source: https://www.youtube.com/watch?v=rf_61llRH0Q

Matériel supplémentaire de l’article Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Ici, nous voyons que les caractéristiques de base du visage appris ne sont pas entraînées dans les changements non liés. Voir la vidéo intégrée à la fin de l’article pour plus de détails et de résolution. Source: https://www.youtube.com/watch?v=rf_61llRH0Q

L’article est mené par le scientifique appliqué d’Adobe Siavash Khodadadeh, ainsi que par quatre autres chercheurs d’Adobe et un chercheur du département d’informatique de l’Université de Floride centrale.

L’article est intéressant en partie parce qu’Adobe opère dans cet espace depuis un certain temps, et il est tentant d’imaginer cette fonctionnalité intégrée dans un projet Creative Suite dans les prochaines années; mais surtout parce que l’architecture créée pour le projet adopte une approche différente pour maintenir l’intégrité visuelle dans un éditeur de visage GAN pendant que des changements sont appliqués.

Les auteurs déclarent:

‘[Nous] formons un réseau neuronal pour effectuer une transformation latente-latente qui trouve l’encodage latent correspondant à l’image avec l’attribut modifié. Comme la technique est à un seul coup, elle ne repose pas sur une trajectoire linéaire ou non linéaire du changement progressif des attributs.

‘En formant le réseau de bout en bout sur l’ensemble du pipeline de génération, le système peut s’adapter aux espaces latents des architectures de générateur hors étagère. Les propriétés de conservation, telles que le maintien de l’identité de la personne, peuvent être codées sous la forme de pertes de formation.

‘Une fois que le réseau latente-latent a été formé, il peut être réutilisé pour des images arbitraires sans réentraînement.’

Ceci signifie que l’architecture proposée arrive avec l’utilisateur final dans un état terminé. Il doit toujours exécuter un réseau neuronal sur des ressources locales, mais de nouvelles images peuvent être « déposées » et prêtes à être modifiées presque immédiatement, puisque le cadre est suffisamment déconnecté pour ne pas nécessiter de formation supplémentaire spécifique à l’image.

Le sexe et la pilosité faciale ont été modifiés à mesure que les curseurs traçaient des chemins aléatoires et arbitraires dans l'espace latent, et non seulement « scrubbaient entre les extrémités ».

Le sexe et la pilosité faciale ont été modifiés à mesure que les curseurs traçaient des chemins aléatoires et arbitraires dans l’espace latent, et non seulement « scrubbaient entre les extrémités ». Voir la vidéo intégrée à la fin de l’article pour plus de transformations à meilleure résolution.

Parmi les principales réalisations du travail se trouve la capacité du réseau à « geler » les identités dans l’espace latent en ne changeant que l’attribut dans un vecteur cible, et en fournissant des « termes de correction » qui conservent les identités transformées.

Essentiellement, le réseau proposé est intégré dans une architecture plus large qui orchestre tous les éléments traités, qui passent par des composants pré-formés avec des poids gelés qui ne produiront pas d’effets latéraux indésirables sur les transformations.

Puisque le processus de formation repose sur des triplets qui peuvent être générés soit par une image de grain de départ (sous inversion GAN) soit par un encodage latent initial existant, l’ensemble du processus de formation est non supervisé, avec les actions tacites de la gamme habituelle de systèmes d’étiquetage et de curation dans de tels systèmes effectivement intégrés dans l’architecture. En fait, le nouveau système utilise des régresseurs d’attributs hors étagère:

‘[Le] nombre d’attributs que notre réseau peut contrôler de manière indépendante n’est limité que par les capacités du (ou des) reconnaissance(s) – si l’on a un reconnaissance pour un attribut, nous pouvons l’ajouter à des visages arbitraires. Dans nos expériences, nous avons formé le réseau latente-latent pour permettre l’ajustement de 35 attributs faciaux différents, plus que toute approche précédente.’

Le système intègre une sauvegarde supplémentaire contre les transformations « d’effet secondaire » indésirables: en l’absence d’une demande de modification d’attribut, le réseau latente-latent cartographiera un vecteur latent à lui-même, augmentant ainsi la persistance stable de l’identité cible.

Reconnaissance Faciale

Un problème récurrent avec les éditeurs de visage GAN et les éditeurs basés sur l’encodeur/décodeur des dernières années a été que les transformations appliquées ont tendance à dégrader la ressemblance. Pour lutter contre cela, le projet Adobe utilise un réseau de reconnaissance faciale intégré appelé FaceNet en tant que discriminateur.

Architecture du projet, voir en bas à gauche pour l'inclusion de FaceNet. Source: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.

Architecture du projet, voir en bas à gauche pour l’inclusion de FaceNet. Source: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.

(Sur une note personnelle, cela semble une démarche encourageante vers l’intégration de systèmes d’identification faciale standard et même de reconnaissance d’expression dans les réseaux génératifs, sans doute la meilleure façon d’avancer pour surmonter le mapping pixel à pixel aveugle qui domine les architectures de deepfake actuelles au détriment de la fidélité d’expression et d’autres domaines importants dans le secteur de la génération de visages.)

Accès à Tous les Domaines dans l’Espace Latent

Une autre fonctionnalité impressionnante du cadre est sa capacité à se déplacer arbitrairement entre les transformations potentielles dans l’espace latent, au gré de l’utilisateur. Plusieurs systèmes antérieurs qui ont fourni des interfaces d’exploration ont souvent laissé l’utilisateur essentiellement « scrubber » entre des timelines de transformation de fonctionnalités fixes – impressionnant, mais souvent une expérience assez linéaire ou proscriptive.

De l'amélioration de l'équilibre GAN en augmentant la conscience spatiale: ici, l'utilisateur scrubbe à travers une gamme de points de transition potentiels entre deux emplacements dans l'espace latent, mais dans les limites des emplacements pré-formés dans l'espace latent. Pour appliquer d'autres types de transformation basés sur le même matériel, une reconfiguration et/ou une réentraînement sont nécessaires. Source: https://genforce.github.io/eqgan/

De l’amélioration de l’équilibre GAN en augmentant la conscience spatiale: ici, l’utilisateur scrubbe à travers une gamme de points de transition potentiels entre deux emplacements dans l’espace latent, mais dans les limites des emplacements pré-formés dans l’espace latent. Pour appliquer d’autres types de transformation basés sur le même matériel, une reconfiguration et/ou une réentraînement sont nécessaires. Source: https://genforce.github.io/eqgan/

En plus d’être réceptif à des images utilisateur entièrement nouvelles, l’utilisateur peut également « geler » manuellement les éléments qu’il souhaite conserver pendant le processus de transformation. De cette façon, l’utilisateur peut s’assurer que (par exemple) les arrière-plans ne changent pas, ou que les yeux restent ouverts ou fermés.

Données

Le réseau de régression d’attributs a été formé sur trois réseaux: FFHQ, CelebAMask-HQ, et un réseau généré par GAN local obtenu en échantillonnant 400 000 vecteurs de l’espace Z de StyleGAN-V2.

Les images hors distribution (OOD) ont été filtrées, et les attributs extraits à l’aide de l’API Face de Microsoft Face API, avec l’ensemble d’images résultant divisé 90/10, laissant 721 218 images de formation et 72 172 images de test pour comparaison.

Test

Bien que le réseau expérimental ait été initialement configuré pour accueillir 35 transformations potentielles, celles-ci ont été réduites à huit pour effectuer des tests analogues contre les cadres comparables InterFaceGAN, GANSpace, et StyleFlow.

Les huit attributs sélectionnés étaient Âge, Calvitie, Barbe, Expression, Sexe, Lunettes, Tangage, et Lacet. Il a été nécessaire de rééquiper les cadres concurrents pour certains des huit attributs qui n’étaient pas provisionnés dans la distribution d’origine, tels que l’ajout de calvitie et barbe à InterFaceGAN.

Comme prévu, un niveau plus élevé d’entrelacement s’est produit dans les architectures rivales. Par exemple, lors d’un test, InterFaceGAN et StyleFlow ont tous deux changé le sexe du sujet lorsqu’on leur a demandé d’appliquer âge:

Deux des cadres concurrents ont roulé un changement de sexe dans la transformation « âge », en changeant également la couleur des cheveux sans demande directe de l'utilisateur.

Deux des cadres concurrents ont roulé un changement de sexe dans la transformation « âge », en changeant également la couleur des cheveux sans demande directe de l’utilisateur.

En outre, deux des rivaux ont constaté que les lunettes et l’âge sont des facettes inséparables:

Lunettes et couleur des cheveux changées sans frais supplémentaires!

Lunettes et couleur des cheveux changées sans frais supplémentaires!

Il ne s’agit pas d’une victoire uniforme pour la recherche: comme on peut le voir dans la vidéo accompagnant l’article, le cadre est le moins efficace lorsqu’il s’agit d’extrapoler des angles divers (lacets), tandis que GANSpace a un meilleur résultat général pour âge et l’imposition de lunettes. Le cadre latente-latent est à égalité avec GANSpace et StyleFlow en ce qui concerne l’ajout de tangage (angle de la tête).

Résultats calculés sur la base d'une calibration du détecteur de visage MTCNN. Les résultats les plus bas sont meilleurs.

Résultats calculés sur la base d’une calibration du détecteur de visage MTCNN. Les résultats les plus bas sont meilleurs.

Pour plus de détails et une meilleure résolution des exemples, consultez la vidéo accompagnant l’article ci-dessous.

 

Publié pour la première fois le 16 février 2022.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai