Angle d’Anderson

Falsifier des corps ‘meilleurs’ avec l’IA

mm
Ajouter Unite.AI à vos sources préférées sur Google

De nouvelles recherches de l’Académie DAMO d’Alibaba proposent un flux de travail piloté par l’IA pour automatiser la reconfiguration d’images de corps – un effort rare dans un secteur de la vision par ordinateur actuellement occupé par les manipulations basées sur le visage telles que les deepfakes et l’édition de visages basée sur les GAN.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Inséré dans les colonnes ‘result’, les cartes d’attention générées qui définissent les zones à modifier. Source: https://arxiv.org/pdf/2203.04670.pdf

L’architecture des chercheurs utilise l’estimation de pose squelettique pour aborder la complexité accrue à laquelle les systèmes de synthèse et d’édition d’images sont confrontés lorsqu’ils conceptualisent et paramétrisent les images de corps existantes, au moins à un niveau de granularité qui permet réellement une édition pertinente et sélective.

Les cartes squelettiques estimées aident à identifier et à concentrer l’attention sur les zones du corps susceptibles d’être retouchées, comme la zone du haut du bras.

Le système permet finalement à l’utilisateur de définir des paramètres pouvant modifier l’apparence du poids, de la masse musculaire ou de la répartition du poids sur des photos en pied ou mi-corps de personnes, et il est capable de générer des transformations arbitraires sur des parties du corps vêtues ou dévêtues.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

À gauche, l’image d’entrée ; au centre, une carte thermique des zones d’attention dérivées ; à droite, l’image transformée.

La motivation de ce travail est le développement de flux de travail automatisés pouvant remplacer les manipulations numériques fastidieuses réalisées par les photographes et les artistes graphiques de production dans divers domaines des médias, de la mode aux publications de type magazine et aux matériels publicitaires.

En général, les auteurs reconnaissent que ces transformations sont habituellement appliquées avec des techniques de « warp » dans Photoshop et d’autres éditeurs bitmap traditionnels, et sont presque exclusivement utilisées sur des images de femmes. Par conséquent, le jeu de données personnalisé développé pour faciliter le nouveau processus se compose principalement de photos de sujets féminins :

‘Comme la retouche de corps est principalement recherchée par les femmes, la majorité de notre collection est constituée de photos féminines, en tenant compte de la diversité des âges, des races (Africain:Asiatique:Caucasien = 0,33:0,35:0,32), des poses et des vêtements.’

L’article s’intitule Structure-Aware Flow Generation for Human Body Reshaping et provient de cinq auteurs associés à l’académie mondiale DAMO d’Alibaba.

Développement du jeu de données

Comme c’est généralement le cas pour les systèmes de synthèse et d’édition d’images, l’architecture du projet a nécessité un jeu de données d’entraînement personnalisé. Les auteurs ont mandaté trois photographes pour produire des manipulations Photoshop standard d’images appropriées provenant du site de photos libres Unsplash, aboutissant à un jeu de données – intitulé BR-5K* – de 5 000 images de haute qualité à une résolution de 2 K.

Les chercheurs soulignent que l’objectif de l’entraînement sur ce jeu de données n’est pas de produire des caractéristiques « idéalisées » et généralisées liées à un indice d’attractivité ou d’apparence souhaitable, mais plutôt d’extraire les cartographies de caractéristiques centrales associées aux manipulations professionnelles d’images de corps.

Cependant, ils admettent que les manipulations reflètent finalement des processus de transformation qui tracent une progression du « réel » vers une notion prédéfinie d’« idéal » :

‘Nous invitons trois artistes professionnels à retoucher des corps en utilisant Photoshop de manière indépendante, dans le but d’obtenir des silhouettes élancées correspondant à l’esthétique populaire, et nous sélectionnons la meilleure comme vérité de référence.’

Comme le cadre ne traite pas du tout les visages, ceux-ci ont été floutés avant d’être inclus dans le jeu de données.

Architecture et concepts de base

Le flux de travail du système consiste à introduire un portrait haute résolution, à le réduire à une résolution inférieure pouvant tenir dans les ressources informatiques disponibles, et à extraire une pose de carte squelettique estimée (deuxième figure à gauche dans l’image ci‑dessous), ainsi que des Part Affinity Fields (PAF), qui ont été innovés en 2016 par le Robotics Institute de l’Université Carnegie Mellon (voir la vidéo intégrée directement ci‑dessous).

Les Part Affinity Fields aident à définir l’orientation des membres et l’association générale avec le cadre squelettique plus large, offrant au nouveau projet un outil supplémentaire d’attention/localisation.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Dans le papier de 2016 sur les Part Affinity Fields, les PAF prédites codent l’orientation des membres comme partie d’un vecteur 2D qui inclut également la position générale du membre. Source: https://arxiv.org/pdf/1611.08050.pdf

Bien qu’elles semblent sans rapport avec l’apparence du poids, les cartes squelettiques sont utiles pour orienter les processus de transformation finaux vers les parties du corps à modifier, comme les bras supérieurs, les fesses et les cuisses.

Après cela, les résultats sont transmis à un module Structure Affinity Self-Attention (SASA) au cœur du goulot d’étranglement du processus (voir l’image ci‑dessous).

Le SASA régule la cohérence du générateur de flux qui alimente le processus, dont les résultats sont ensuite transmis au module de déformation (deuxième depuis la droite dans l’image ci‑dessus), qui applique les transformations apprises lors de l’entraînement sur les révisions manuelles incluses dans le jeu de données.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Le module Structure Affinity Self-Attention (SASA) attribue de l’attention aux parties du corps pertinentes, aidant à éviter les transformations superflues ou hors sujet.

L’image de sortie est ensuite rééchantillonnée à la résolution originale de 2 K, en utilisant des processus similaires à l’architecture de deepfake standard de 2017 à partir de laquelle des paquets populaires tels que DeepFaceLab ont été dérivés ; le processus de rééchantillonnage est également courant dans les cadres d’édition GAN.

Le réseau d’attention pour le schéma est basé sur les Compositional De-Attention Networks (CODA), une collaboration académique américano‑singapourienne de 2019 avec Amazon (AMZN ) AI et Microsoft.

Tests

Le cadre basé sur le flux a été testé contre des méthodes antérieures basées sur le flux FAL et Animating Through Warping (ATW), ainsi que des architectures de traduction d’images Pix2PixHD et GFLA, avec SSIM, PSNR et LPIPS comme métriques d’évaluation.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Résultats des tests initiaux (la direction des flèches dans les en-têtes indique si les valeurs plus basses ou plus hautes sont meilleures).

Sur la base de ces métriques adoptées, le système des auteurs surpasse les architectures antérieures.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Résultats sélectionnés. Veuillez vous référer au PDF original lié dans cet article pour des comparaisons en haute résolution.

En plus des métriques automatisées, les chercheurs ont mené une étude utilisateur (dernière colonne du tableau de résultats illustré précédemment), dans laquelle 40 participants ont chacun reçu 30 questions sélectionnées aléatoirement parmi un ensemble de 100 questions portant sur les images produites par les différentes méthodes. 70 % des répondants ont préféré la nouvelle technique comme étant plus « esthétiquement attrayante ».

Défis

Le nouvel article constitue une rare incursion dans la manipulation corporelle basée sur l’IA. Le secteur de la synthèse d’images s’intéresse actuellement davantage à la génération de corps éditables via des méthodes telles que Neural Radiance Fields (NeRF), ou bien est focalisé sur l’exploration de l’espace latent des GAN et le potentiel des auto‑encodeurs pour la manipulation faciale.

L’initiative des auteurs se limite actuellement à produire des modifications du poids perçu, et ils n’ont pas mis en œuvre de technique d’inpainting capable de restaurer l’arrière‑plan inévitablement révélé lorsqu’on amincit la photo de quelqu’un.

Cependant, ils proposent que le matting de portrait et le mélange d’arrière‑plan via une inférence texturale pourraient résoudre trivialement le problème de restauration des parties du monde auparavant cachées dans l’image par l’« imperfection » humaine.

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

Une solution proposée pour restaurer l’arrière‑plan révélé par la réduction de graisse pilotée par l’IA.

 

* Bien que le préprint fasse référence à un matériel supplémentaire donnant plus de détails sur le jeu de données, ainsi que d’autres exemples du projet, l’emplacement de ce matériel n’est pas disponible dans l’article, et l’auteur correspondant n’a pas encore répondu à notre demande d’accès.

Première publication le 10 mars 2022.

Rédacteur spécialisé en apprentissage automatique, expert du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Site Web: martinanderson.ai
Contact: martin@martinanderson.ai