Modèles et plateformes d’IA

MagicDance : Génération de vidéos de danse humaine réalistes

mm
Ajouter Unite.AI à vos sources préférées sur Google

La vision par ordinateur est l’un des domaines les plus discutés dans l’industrie de l’IA, grâce à ses applications potentielles dans une large gamme de tâches en temps réel. Ces dernières années, les frameworks de vision par ordinateur ont évolué rapidement, avec des modèles modernes capables d’analyser les caractéristiques faciales, les objets et bien plus encore dans des scénarios en temps réel. Malgré ces capacités, le transfert de mouvement humain reste un défi considérable pour les modèles de vision par ordinateur. Cette tâche consiste à réaffecter les mouvements faciaux et corporels d’une image ou d’une vidéo source à une image ou une vidéo cible. Le transfert de mouvement humain est largement utilisé dans les modèles de vision par ordinateur pour le stylisme d’images ou de vidéos, la modification de contenu multimédia, la synthèse de l’humain numérique et même la génération de données pour les frameworks basés sur la perception.

Dans cet article, nous nous concentrons sur MagicDance, un modèle basé sur la diffusion conçu pour révolutionner le transfert de mouvement humain. Le framework MagicDance vise spécifiquement à transférer les expressions faciales et les mouvements humains 2D sur des vidéos de danse humaine difficiles. Son objectif est de générer de nouvelles séquences de danse vidéo pour des identités cibles spécifiques tout en maintenant l’identité d’origine. Le framework MagicDance utilise une stratégie de formation en deux étapes, axée sur la disjonction du mouvement humain et les facteurs d’apparence tels que la teinte de la peau, les expressions faciales et les vêtements. Nous allons explorer le framework MagicDance, en examinant son architecture, sa fonctionnalité et ses performances par rapport à d’autres frameworks de transfert de mouvement humain d’état de l’art. Plongeons dans le sujet.

MagicDance : Transfert de mouvement humain réel

Comme mentionné plus tôt, le transfert de mouvement humain est l’une des tâches les plus complexes de la vision par ordinateur en raison de la complexité impliquée dans le transfert des mouvements et des expressions humaines de l’image ou de la vidéo source à l’image ou à la vidéo cible. Traditionnellement, les frameworks de vision par ordinateur ont réalisé le transfert de mouvement humain en formant un modèle génératif spécifique à la tâche, y compris GAN ou Réseaux antagonistes génératifs sur des ensembles de données cibles pour les expressions faciales et les poses corporelles. Bien que la formation et l’utilisation de modèles génératifs donnent des résultats satisfaisants dans certains cas, ils souffrent généralement de deux limitations majeures.

  1. Ils s’appuient lourdement sur un composant de déformation d’image en raison duquel ils ont souvent du mal à interpoler les parties du corps invisibles dans l’image source en raison d’un changement de perspective ou d’auto-occlusion.
  2. Ils ne peuvent pas se généraliser à d’autres images provenant de sources externes, ce qui limite leurs applications, en particulier dans des scénarios en temps réel dans la nature.

Les modèles de diffusion modernes ont démontré des capacités de génération d’images exceptionnelles dans différentes conditions, et les modèles de diffusion sont maintenant capables de présenter des visuels puissants dans une gamme de tâches en aval telles que la génération de vidéos et le retouching d’images en apprenant à partir d’ensembles d’images à grande échelle. Grâce à leurs capacités, les modèles de diffusion pourraient être un choix idéal pour les tâches de transfert de mouvement humain. Bien que les modèles de diffusion puissent être mis en œuvre pour le transfert de mouvement humain, ils ont certaines limitations, soit en termes de qualité du contenu généré, soit en termes de préservation de l’identité ou en souffrant d’incohérences temporelles en raison des limites de conception et de stratégie de formation du modèle. De plus, les modèles basés sur la diffusion ne démontrent aucune avance significative sur les frameworks GAN en termes de généralisabilité.

Pour surmonter les obstacles auxquels sont confrontés les frameworks basés sur la diffusion et GAN pour les tâches de transfert de mouvement humain, les développeurs ont introduit MagicDance, un framework novateur qui vise à exploiter le potentiel des frameworks de diffusion pour le transfert de mouvement humain en démontrant un niveau sans précédent de préservation de l’identité, une qualité visuelle supérieure et une généralisabilité de domaine. Au cœur du framework MagicDance, le concept fondamental est de diviser le problème en deux étapes : contrôle de l’apparence et contrôle du mouvement, deux capacités requises par les frameworks de diffusion pour fournir des sorties de transfert de mouvement précises.

La figure ci-dessus donne un aperçu du framework MagicDance, et comme on peut le voir, le framework utilise le modèle de diffusion stable, et déploie deux composants supplémentaires : le modèle de contrôle d’apparence et le réseau de contrôle de pose où le premier fournit des conseils d’apparence au modèle SD à partir d’une image de référence via l’attention tandis que le second fournit des conseils d’expression/pose au modèle de diffusion à partir d’une image ou d’une vidéo conditionnée. Le framework utilise également une stratégie de formation multi-étapes pour apprendre ces sous-modules efficacement pour disjoindre le contrôle de la pose et de l’apparence.

En résumé, le framework MagicDance est un

  1. Framework novateur et efficace consistant en un contrôle de pose disjoints de l’apparence et un pré-entraînement du contrôle d’apparence.
  2. Le framework MagicDance est capable de générer des expressions faciales humaines réalistes et des mouvements humains sous le contrôle des entrées de condition de pose et d’images ou de vidéos de référence.
  3. Le framework MagicDance vise à générer du contenu humain cohérent en termes d’apparence en introduisant un module d’attention multi-source qui offre des conseils précis pour le framework Stable Diffusion UNet.
  4. Le framework MagicDance peut également être utilisé comme une extension ou un plug-in pratique pour le framework Stable Diffusion, et assure la compatibilité avec les poids de modèle existants car il n’a pas besoin d’un affinage supplémentaire des paramètres.

De plus, le framework MagicDance montre des capacités de généralisation exceptionnelles pour l’apparence et le mouvement.

  1. Généralisation de l’apparence : le framework MagicDance démontre des capacités supérieures lorsqu’il s’agit de générer des apparences diverses.
  2. Généralisation du mouvement : le framework MagicDance a également la capacité de générer une large gamme de mouvements.

MagicDance : Objectifs et architecture

Pour une image de référence donnée, soit d’un humain réel ou d’une image stylisée, l’objectif principal du framework MagicDance est de générer une image de sortie ou une vidéo conditionnée sur l’entrée et les entrées de pose {P, F} où P représente le squelette de la pose humaine et F représente les repères faciaux. L’image de sortie ou la vidéo générée devraient être en mesure de préserver l’apparence et l’identité des humains impliqués ainsi que les contenus de l’arrière-plan présents dans l’image de référence tout en conservant la pose et les expressions définies par les entrées de pose.

Architecture

Lors de la formation, le framework MagicDance est formé comme une tâche de reconstruction de trame pour reconstruire le vérité terrain avec l’image de référence et l’entrée de pose provenant de la même vidéo de référence. Lors des tests pour réaliser le transfert de mouvement, l’entrée de pose et l’image de référence sont provenant de sources différentes.

L’architecture globale du framework MagicDance peut être divisée en quatre catégories : étape préliminaire, pré-entraînement du contrôle d’apparence, contrôle de la pose disjoints de l’apparence et module de mouvement.

Étape préliminaire

Les modèles de diffusion latente ou LDM représentent des modèles de diffusion conçus pour fonctionner dans l’espace latent facilité par l’utilisation d’un auto-encodeur, et le framework Stable Diffusion est un exemple notable de LDM qui utilise un auto-encodeur vectoriel quantifié et une architecture U-Net temporelle. Le modèle Stable Diffusion utilise un encodeur de texte basé sur CLIP pour traiter les entrées textuelles en les convertissant en embeddings. La phase de formation du framework Stable Diffusion expose le modèle à une condition textuelle et à une image d’entrée avec le processus impliquant l’encodage de l’image en une représentation latente, et la soumet à une séquence prédéfinie d’étapes de diffusion dirigées par une méthode gaussienne. La séquence résultante donne une représentation latente bruyante qui fournit une distribution normale standard avec l’objectif d’apprentissage principal du framework Stable Diffusion étant de débruir les représentations latentes bruyantes de manière itérative en représentations latentes.

Pré-entraînement du contrôle d’apparence

Un problème majeur avec le framework ControlNet d’origine est son incapacité à contrôler l’apparence parmi les mouvements spatialement variables de manière cohérente, bien qu’il tende à générer des images avec des poses ressemblant à celles de l’image d’entrée, avec l’apparence globale étant influencée principalement par les entrées textuelles. Bien que cette méthode fonctionne, elle n’est pas adaptée aux tâches de transfert de mouvement impliquant des tâches où ce n’est pas les entrées textuelles mais l’image de référence qui sert de source principale pour les informations d’apparence.

Le module de pré-entraînement du contrôle d’apparence dans le framework MagicDance est conçu comme une branche auxiliaire pour fournir des conseils pour le contrôle d’apparence dans une approche couche par couche. Plutôt que de s’appuyer sur les entrées textuelles, l’ensemble du module se concentre sur l’exploitation des attributs d’apparence de l’image de référence dans le but d’améliorer la capacité du framework à générer les caractéristiques d’apparence avec précision, en particulier dans les scénarios impliquant des dynamiques de mouvement complexes. De plus, seul le modèle de contrôle d’apparence est formable pendant le pré-entraînement du contrôle d’apparence.

Contrôle de la pose disjoints de l’apparence

Une solution naïve pour contrôler la pose dans l’image de sortie consiste à intégrer le modèle ControlNet pré-formé avec le modèle de contrôle d’apparence pré-formé directement sans affinage. Cependant, l’intégration peut entraîner le framework à lutter avec un contrôle de pose indépendant de l’apparence, ce qui peut entraîner une discordance entre les poses d’entrée et les poses générées. Pour résoudre cette discordance, le framework MagicDance affine le modèle Pose ControlNet conjointement avec le modèle de contrôle d’apparence pré-formé.

Module de mouvement

Lorsqu’ils travaillent ensemble, le contrôle de la pose disjoints de l’apparence et le modèle de contrôle d’apparence peuvent réaliser un transfert d’image à mouvement précis et efficace, bien que cela puisse entraîner une incohérence temporelle. Pour assurer la cohérence temporelle, le framework intègre un module de mouvement supplémentaire dans l’architecture U-Net principale de la diffusion stable.

MagicDance : Pré-formation et ensembles de données

Pour la pré-formation, le framework MagicDance utilise un ensemble de données TikTok qui comprend plus de 350 vidéos de danse de longueurs variables entre 10 et 15 secondes capturant une personne qui danse, avec la majorité de ces vidéos contenant le visage et le corps supérieur de l’humain. Le framework MagicDance extrait chaque vidéo individuelle à 30 FPS, et exécute OpenPose sur chaque trame individuellement pour inférer le squelette de la pose, les poses de la main et les repères faciaux.

Pour la pré-formation, le modèle de contrôle d’apparence est pré-formé avec une taille de lot de 64 sur 8 GPU NVIDIA A100 pendant 10 000 étapes avec une taille d’image de 512 x 512, suivi d’un affinage conjoint du modèle de contrôle de pose et du modèle de contrôle d’apparence avec une taille de lot de 16 pendant 20 000 étapes. Lors de la formation, le framework MagicDance échantillonne aléatoirement deux trames comme cible et référence respectivement, avec les images étant coupées à la même position le long de la même hauteur. Lors de l’évaluation, le modèle coupe l’image centralement au lieu de la couper aléatoirement.

MagicDance : Résultats

Les résultats expérimentaux menés sur le framework MagicDance sont démontrés dans l’image suivante, et comme on peut le voir, le framework MagicDance surpasse les frameworks existants comme Disco et DreamPose pour le transfert de mouvement humain sur tous les métriques. Les frameworks avec un “*” devant leur nom utilisent l’image cible directement comme entrée, et incluent plus d’informations que les autres frameworks.

Il est intéressant de noter que le framework MagicDance atteint un score Face-Cos de 0,426, une amélioration de 156,62 % par rapport au framework Disco, et une augmentation de près de 400 % par rapport au framework DreamPose. Les résultats indiquent la capacité robuste du framework MagicDance à préserver les informations d’identité, et la performance visible indique la supériorité du framework MagicDance par rapport aux méthodes d’état de l’art existantes.

Les figures suivantes comparent la qualité de la génération de vidéos humaines entre les frameworks MagicDance, Disco et TPS. Comme on peut l’observer, les résultats générés par les frameworks GT, Disco et TPS souffrent d’une identité de pose humaine et d’expressions faciales incohérentes.

De plus, l’image suivante démontre la visualisation du transfert d’expression faciale et de mouvement humain sur l’ensemble de données TikTok avec le framework MagicDance capable de générer des expressions et des mouvements réalistes et vivants sous diverses conditions de repères faciaux et de squelette de pose tout en préservant avec précision les informations d’identité de l’image d’entrée de référence.

Il est important de noter que le framework MagicDance se distingue par des capacités de généralisation exceptionnelles pour les images de référence hors domaine de pose et de style inconnus avec une contrôlabilité d’apparence impressionnante même sans aucun affinage supplémentaire sur le domaine cible, avec les résultats étant démontrés dans l’image suivante.

Les images suivantes démontrent les capacités de visualisation du framework MagicDance en termes de transfert d’expression faciale et de mouvement humain à zéro coup. Comme on peut le voir, le framework MagicDance se généralise parfaitement aux mouvements humains dans la nature.

MagicDance : Limitations

OpenPose est un composant essentiel du framework MagicDance car il joue un rôle crucial pour le contrôle de la pose, affectant la qualité et la cohérence temporelle des images générées de manière significative. Cependant, le framework MagicDance trouve encore un peu difficile de détecter les repères faciaux et les squelettes de pose avec précision, en particulier lorsque les objets dans les images sont partiellement visibles ou montrent un mouvement rapide. Ces problèmes peuvent entraîner des artefacts dans l’image générée.

Conclusion

Dans cet article, nous avons discuté de MagicDance, un modèle basé sur la diffusion qui vise à révolutionner le transfert de mouvement humain. Le framework MagicDance tente de transférer les expressions faciales et les mouvements humains 2D sur des vidéos de danse humaine difficiles avec l’objectif spécifique de générer de nouvelles séquences de danse vidéo pour des identités cibles spécifiques tout en maintenant l’identité constante. Le framework MagicDance est une stratégie de formation en deux étapes pour la disjonction du mouvement humain et l’apparence comme la teinte de la peau, les expressions faciales et les vêtements.

MagicDance est une approche novatrice pour faciliter la génération de vidéos humaines réalistes en intégrant le transfert d’expression faciale et de mouvement, et en permettant une animation cohérente dans la nature sans nécessiter d’affinage supplémentaire, ce qui démontre une avancée significative par rapport aux méthodes existantes. De plus, le framework MagicDance démontre des capacités de généralisation exceptionnelles sur des séquences de mouvement complexes et des identités humaines diverses, établissant le framework MagicDance comme le leader dans le domaine du transfert de mouvement et de la génération de vidéos assistés par l’IA.

Un ingénieur de profession, un écrivain de cœur. Kunal est un rédacteur technique avec une profonde affection et une compréhension de l'IA et du ML, dédié à simplifier les concepts complexes dans ces domaines grâce à sa documentation engageante et informative.