Angle d’Anderson

L’offre LipSync3D de Google améliore la synchronisation des mouvements des lèvres ‘deepfaked’

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une collaboration entre les chercheurs de Google AI et l’Indian Institute of Technology Kharagpur propose un nouveau cadre pour synthétiser des têtes parlantes à partir de contenu audio. Le projet vise à produire des méthodes optimisées et raisonnables pour créer du contenu vidéo de têtes parlantes à partir d’audio, dans le but de synchroniser les mouvements des lèvres avec des audio doublés ou traduits par machine, et pour utiliser des avatars, des applications interactives et d’autres environnements en temps réel.

Source: https://www.youtube.com/watch?v=L1StbX9OznY

Source: https://www.youtube.com/watch?v=L1StbX9OznY

Les modèles d’apprentissage automatique formés dans le processus – appelés LipSync3D – nécessitent seulement une seule vidéo de l’identité du visage cible en tant que données d’entrée. Le pipeline de préparation des données sépare l’extraction de la géométrie faciale de l’évaluation de l’éclairage et d’autres aspects de la vidéo d’entrée, permettant ainsi une formation plus économique et plus ciblée.

Le flux de travail en deux étapes de LipSync3D. En haut, la génération d'un visage 3D dynamiquement texturé à partir de l'audio cible; en bas, l'insertion du maillage généré dans une vidéo cible.

Le flux de travail en deux étapes de LipSync3D. En haut, la génération d’un visage 3D dynamiquement texturé à partir de l’audio cible; en bas, l’insertion du maillage généré dans une vidéo cible.

En fait, la contribution la plus notable de LipSync3D à l’effort de recherche dans ce domaine peut être son algorithme de normalisation de l’éclairage, qui découple la formation et l’inférence de l’éclairage.

La découpe des données d'éclairage du maillage général permet à LipSync3D de produire des sorties de mouvement des lèvres plus réalistes dans des conditions difficiles. D'autres approches ces dernières années se sont limitées à des conditions d'éclairage 'fixes' qui ne révèlent pas leur capacité limitée à cet égard.

La découpe des données d’éclairage du maillage général permet à LipSync3D de produire des sorties de mouvement des lèvres plus réalistes dans des conditions difficiles. D’autres approches ces dernières années se sont limitées à des conditions d’éclairage ‘fixes’ qui ne révèlent pas leur capacité limitée à cet égard.

Pendant la prétraitement des trames d’entrée, le système doit identifier et supprimer les points spéculaires, car ils sont spécifiques aux conditions d’éclairage dans lesquelles la vidéo a été prise, et interfereraient autrement avec le processus de rééclairage.

LipSync3D, comme son nom l’indique, ne réalise pas une simple analyse de pixels sur les visages qu’il évalue, mais utilise activement des repères faciaux identifiés pour générer des maillages CGI mobiles, ainsi que les textures ‘dépliées’ qui les entourent dans un pipeline CGI traditionnel.

La normalisation de la pose dans LipSync3D. À gauche, les trames d'entrée et les fonctionnalités détectées; au milieu, les sommets normalisés de l'évaluation du maillage généré; et à droite, l'atlas de texture correspondant, qui fournit la vérité de terrain pour la prédiction de texture. Source: https://arxiv.org/pdf/2106.04185.pdf

La normalisation de la pose dans LipSync3D. À gauche, les trames d’entrée et les fonctionnalités détectées; au milieu, les sommets normalisés de l’évaluation du maillage généré; et à droite, l’atlas de texture correspondant, qui fournit la vérité de terrain pour la prédiction de texture. Source: https://arxiv.org/pdf/2106.04185.pdf

Outre la méthode de rééclairage novatrice, les chercheurs affirment que LipSync3D offre trois principales innovations par rapport aux travaux précédents: la séparation de la géométrie, de l’éclairage, de la pose et de la texture en flux de données discrets dans un espace normalisé; un modèle de prédiction de texture auto-régressif facile à former qui produit une synthèse de vidéo temporellement cohérente; et une réalisme accru, évalué par des notations humaines et des métriques objectives.

La séparation des différents aspects de l'imagerie faciale vidéo permet un contrôle plus grand dans la synthèse de vidéo.

La séparation des différents aspects de l’imagerie faciale vidéo permet un contrôle plus grand dans la synthèse de vidéo.

LipSync3D peut dériver la géométrie des mouvements des lèvres directement à partir de l’audio en analysant les phonèmes et d’autres aspects du discours, et en les traduisant en poses musculaires connues correspondantes autour de la zone de la bouche.

Ce processus utilise un pipeline de prédiction conjointe, où la géométrie et la texture inférées ont des encodeurs dédiés dans un ensemble auto-encodeur, mais partagent un encodeur audio avec le discours qui doit être imposé au modèle:

La synthèse de mouvement labile de LipSync3D est également destinée à alimenter des avatars CGI stylisés, qui, en effet, ne sont que le même type d’information de maillage et de texture que les images du monde réel:

Un avatar 3D stylisé a ses mouvements des lèvres alimentés en temps réel par une vidéo de locuteur source. Dans un tel scénario, les meilleurs résultats seraient obtenus par une pré-formation personnalisée.

Un avatar 3D stylisé a ses mouvements des lèvres alimentés en temps réel par une vidéo de locuteur source. Dans un tel scénario, les meilleurs résultats seraient obtenus par une pré-formation personnalisée.

Les chercheurs prévoient également l’utilisation d’avatars avec une sensation un peu plus réaliste:

Les temps de formation d’exemple pour les vidéos vont de 3 à 5 heures pour une vidéo de 2 à 5 minutes, dans un pipeline qui utilise TensorFlow, Python et C++ sur une carte GeForce GTX 1080. Les sessions de formation ont utilisé une taille de lot de 128 trames sur 500-1000 époques, chaque époque représentant une évaluation complète de la vidéo.

Vers une synchronisation dynamique des mouvements des lèvres

Le domaine de la synchronisation des lèvres pour accommoder une nouvelle piste audio a reçu une grande attention dans la recherche en vision par ordinateur ces dernières années (voir ci-dessous), notamment en tant que sous-produit de la technologie de deepfake controversée.

En 2017, l’Université de Washington a présenté des recherches capables d’apprendre la synchronisation des lèvres à partir de l’audio, en l’utilisant pour modifier les mouvements des lèvres de l’ancien président Obama. En 2018, l’Institut Max Planck d’informatique a dirigé une autre initiative de recherche pour permettre le transfert de vidéo d’identité à identité, avec la synchronisation des lèvres comme sous-produit du processus; et en mai 2021, la startup AI FlawlessAI a révélé sa technologie de synchronisation des lèvres propriétaire TrueSync, largement reçue dans la presse comme un moyen d’améliorer les technologies de doublage pour les sorties de films majeures dans différentes langues.

Et, bien sûr, le développement continu des référentiels open source de deepfake fournit une autre branche de recherche active contributive dans ce domaine de synthèse d’images faciales.

nc technologie TrueSync, largement reçue dans la presse comme un moyen d’améliorer les technologies de doublage pour les sorties de films majeures dans différentes langues. Et, bien sûr, le développement continu des référentiels open source de deepfake fournit une autre branche de recherche active contributive dans ce domaine de synthèse d’images faciales.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai