Angle d’Anderson

Réaménagement des types de corps humains avec l’IA

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une nouvelle collaboration de recherche en Chine offre une méthode novatrice de réaménagement du corps humain dans les images, en utilisant un réseau de codage neuronal jumeau coordonné, guidé par un modèle paramétrique, qui permet à un utilisateur final de moduler le poids, la taille et la proportion du corps dans une interface graphique interactive.

Modulation paramétrée de la forme du corps, avec des curseurs modifiant les trois fonctionnalités disponibles. Source: https://arxiv.org/pdf/2203.10496.pdf

Modulation paramétrée de la forme du corps, avec des curseurs modifiant les trois fonctionnalités disponibles. Source: https://arxiv.org/pdf/2203.10496.pdf

Le travail offre plusieurs améliorations par rapport à un projet similaire récent d’Alibaba, car il peut modifier de manière convaincante la taille et la proportion du corps, ainsi que le poids, et dispose d’un réseau neuronal dédié pour « remplir » les régions de fond (non existantes) qui peuvent être révélées par des images de corps « plus minces ». Il améliore également une méthode paramétrique antérieure de réaménagement du corps en éliminant le besoin d’une intervention humaine extensive lors de la formulation de la transformation.

Intitulé NeuralReshaper, la nouvelle architecture ajuste un modèle paramétrique 3D humain à une image source, puis utilise les distorsions du modèle pour adapter l’image originale aux nouveaux paramètres.

Le système est capable de gérer les transformations de corps sur des figures vêtues ainsi que des figures semi-vêtues (c’est-à-dire en maillot de bain).

Ces types de transformations sont actuellement très intéressants pour le secteur de la recherche sur l’IA de la mode, qui a produit un certain nombre de plateformes de StyleGAN/CycleGAN et de réseaux neuronaux généraux pour les essais virtuels qui peuvent adapter les articles de vêtement disponibles à la forme et au type de corps d’une image soumise par l’utilisateur, ou aider à la conformité visuelle.

Le document est intitulé Reformation du corps humain en une seule image avec des réseaux neuronaux profonds, et provient de chercheurs de l’Université de Zhejiang à Hangzhou, et de l’École des médias créatifs de l’Université de la ville de Hong Kong.

Ajustement SMPL

NeuralReshaper utilise le modèle Skinned Multi-Person Linear (SMPL) développé par l’Institut Max Planck pour les systèmes intelligents et la société de effets visuels Industrial Light and Magic en 2015.

Humains paramétriques SMPL de la collaboration Planck/ILM de 2015. Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Humains paramétriques SMPL de la collaboration Planck/ILM de 2015. Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Dans la première étape du processus, un modèle SMPL est généré à partir d’une image source à laquelle des transformations de corps sont souhaitées. L’adaptation du modèle SMPL à l’image suit la méthodologie de la méthode de récupération de la maille humaine (HMR) proposée par des universités en Allemagne et aux États-Unis en 2018.

Les trois paramètres de déformation (poids, taille, proportion du corps) sont calculés à ce stade, ainsi que des considérations sur les paramètres de la caméra, tels que la longueur focale. Les points clés 2D et l’alignement du contour généré fournissent l’enclosure pour la déformation sous la forme d’un contour 2D, une mesure d’optimisation supplémentaire qui augmente la précision des limites et permet un remplissage de fond authentique plus tard dans le processus.

Étapes d'ajustement SMPL: à gauche, l'image source; deuxième à gauche, le résultat d'optimisation obtenu à partir de la méthode décrite dans la recherche de 2016 menée par l'Institut Max Planck pour les systèmes intelligents; troisième à gauche, un résultat d'inférence directe à partir du modèle pré-entraîné pour la récupération de la forme et de la pose humaine de bout en bout; deuxième à droite, les résultats obtenus après optimisation des points clés 2D; et enfin, à droite, l'ajustement terminé après optimisation du contour (voir ci-dessus).

Étapes d’ajustement SMPL: à gauche, l’image source; deuxième à gauche, le résultat d’optimisation obtenu à partir de la méthode décrite dans la recherche de 2016 menée par l’Institut Max Planck pour les systèmes intelligents; troisième à gauche, un résultat d’inférence directe à partir du modèle pré-entraîné pour la récupération de la forme et de la pose humaine de bout en bout; deuxième à droite, les résultats obtenus après optimisation des points clés 2D; et enfin, à droite, l’ajustement terminé après optimisation du contour (voir ci-dessus).

La déformation 3D est ensuite projetée dans l’espace d’image de l’architecture pour faciliter un champ de déformation dense qui définira la déformation. Ce processus prend environ 30 secondes par image.

Architecture NeuralReshaper

NeuralReshaper exécute deux réseaux neuronaux en tandem: un encodeur de premier plan qui génère la forme du corps transformée, et un encodeur de fond qui se concentre sur le remplissage des régions de fond « dé-occlusives » (dans le cas, par exemple, d’un corps « amaigri » – voir image ci-dessous).

Le cadre de style U-net intègre la sortie des fonctionnalités des deux encodeurs avant de passer le résultat à un encodeur unifié qui produit finalement une nouvelle image à partir des deux entrées. L’architecture comporte un mécanisme de guidage de déformation novateur pour permettre l’intégration.

Formation et expériences

NeuralReshaper est mis en œuvre dans PyTorch sur une seule carte graphique NVIDIA 1080ti avec 11 Go de VRAM. Le réseau a été formé pendant 100 époques sous l’optimiseur Adam, avec le générateur réglé sur une perte cible de 0,0001 et le discriminateur sur une perte cible de 0,0004. La formation s’est déroulée sur un lot de 8 pour un ensemble de données en plein air propriétaire (tiré de COCO, MPII, et LSP), et 2 pour la formation sur l’ensemble de données DeepFashion.

À gauche, les images originales, à droite, la sortie reproportionnée de NeuralReshaper.

À gauche, les images originales, à droite, la sortie reproportionnée de NeuralReshaper.

Ci-dessous sont quelques exemples exclusivement issus de l’ensemble de données DeepFashion formé pour NeuralReshaper, avec les images originales toujours à gauche.

Les trois attributs contrôlables sont désentrelacés et peuvent être appliqués séparément.

Les transformations sur l’ensemble de données en plein air dérivé sont plus difficiles, car elles nécessitent souvent un remplissage de fond complexe et une délimitation claire et convaincante des types de corps transformés:

Nécessité paramétrique

Comme le constate le document, les transformations d’image de même type représentent un problème mal posé dans la synthèse d’images. De nombreux cadres de GAN et d’encodeur transformateurs peuvent utiliser des images appariées (telles que les divers projets conçus pour effectuer des transformations de croquis en photo et de photo en croquis).

Cependant, dans le cas présent, cela nécessiterait des paires d’images présentant les mêmes personnes dans différentes configurations physiques, telles que les images « avant et après » dans les publicités pour régimes ou la chirurgie plastique – des données difficiles à obtenir ou à générer.

Alternativement, les réseaux de GAN transformateurs peuvent être formés sur des données beaucoup plus diverses et effectuer des transformations en recherchant la direction latente entre le code latent de l’image source et la classe souhaitée (dans ce cas, « gras », « mince », « grand », etc.). Cependant, cette approche est actuellement trop limitée pour les fins de réaménagement du corps affiné.

Les champs de rayonnement neuronal (NeRF) sont beaucoup plus avancés dans la simulation de corps entiers que la plupart des systèmes basés sur GAN, mais restent spécifiques à la scène et gourmands en ressources, avec actuellement une capacité très limitée à éditer les types de corps de manière granulaire comme NeuralReshaper et les projets précédents tentent de résoudre (hors mise à l’échelle de l’ensemble du corps par rapport à son environnement).

L’espace latent du GAN est difficile à gouverner; les VAE seuls ne répondent pas encore aux complexités de la reproduction de corps entiers; et la capacité de NeRF à remodeler de manière cohérente et réaliste les corps humains est encore naissante. Par conséquent, l’intégration de méthodes « traditionnelles » de CGI telles que SMPL semble destinée à continuer dans le secteur de la recherche sur la synthèse d’images humaines, en tant que méthode pour encadrer et consolider les fonctionnalités, les classes et les codes latents dont les paramètres et l’exploitabilité ne sont pas encore pleinement compris dans ces technologies émergentes.

 

Publié pour la première fois le 31 mars 2022.

Écrivain sur l'apprentissage automatique, spécialiste du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]