Angle d’Anderson
L’Aube des Émotions Deepfaked

Les chercheurs ont développé une nouvelle technique d’apprentissage automatique pour imposer arbitrairement de nouvelles émotions sur les visages dans les vidéos, en adaptant les technologies existantes qui ont récemment émergé comme des solutions pour faire correspondre les mouvements des lèvres à la synchronisation des dialogues en langue étrangère.
La recherche est une collaboration égale entre l’Université Northeastern de Boston et le Media Lab du MIT, et est intitulée Visages inversés: traduction d’émotion de vidéo à vidéo. Bien que les chercheurs reconnaissent que la qualité initiale des résultats doit être améliorée grâce à des recherches ultérieures, ils affirment que la technique, appelée Wav2Lip-Emotion, est la première de son genre à aborder directement la modification d’expression de vidéo complète à l’aide de techniques de réseau neuronal.
Le code de base a été publié sur GitHub, bien que les points de contrôle du modèle seront ajoutés plus tard à la base de code ouverte, promettent les auteurs.

À gauche, un cadre ‘triste’ de la vidéo source. À droite, un cadre ‘heureux’. Au centre, deux approches naissantes pour synthétiser des émotions alternatives – rangée du haut: un visage entièrement masqué où la totalité de la surface d’expression a été substituée; rangée du bas: une méthode Wav2Lip plus traditionnelle, qui ne substitue que la partie inférieure du visage. Source: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf
Une vidéo unique comme données source
En théorie, de telles manipulations sont obtenables maintenant grâce à une formation complète sur des référentiels de deepfake traditionnels tels que DeepFaceLab ou FaceSwap. Cependant, le flux de travail standard impliquerait l’utilisation d’une identité alternative à l’identité ‘cible’, telle qu’un acteur imitant la cible, dont les expressions seraient transférées à un autre individu, ainsi que le reste de la performance. De plus, les techniques de clonage de voix de deepfake seraient généralement nécessaires pour compléter l’illusion.
En outre, modifier réellement l’expression de target1>target1 dans une vidéo source unique dans ces cadres populaires impliquerait de modifier les vecteurs d’alignement du visage d’une manière que ces architectures ne facilitent pas actuellement.

Wav2Lip-Emotion maintient la synchronisation des lèvres du dialogue audio de la vidéo originale tout en transformant les expressions associées.
Au lieu de cela, Wav2Lip-Emotion cherche efficacement à ‘copier et coller’ des expressions liées aux émotions d’une partie d’une vidéo et à les substituer à d’autres points, avec une frugalité auto-imposée des données source qui vise à offrir éventuellement une méthode à moindre effort pour la manipulation d’expression.
Les modèles hors ligne pourraient être développés plus tard, formés sur des vidéos alternatives de l’orateur, ce qui éliminerait le besoin pour une vidéo unique de contenir un ‘palette’ d’états d’expression avec lesquels manipuler la vidéo.
Purposes potentiels
Les auteurs suggèrent un certain nombre d’applications pour la modification d’expression, notamment un filtre de vidéo en direct pour compenser les effets du TSPT et des troubles de la paralysie faciale. Le document observe:
‘Les individus avec ou sans expressions faciales inhibées peuvent bénéficier de l’ajustement de leurs propres expressions pour mieux correspondre à leurs circonstances sociales. On peut vouloir modifier les expressions dans les vidéos présentées à eux. Les orateurs peuvent crier les uns sur les autres lors d’une conférence vidéo, mais néanmoins vouloir recueillir le contenu de leur échange sans les expressions désagréables. Ou un réalisateur de film peut vouloir augmenter ou diminuer les expressions d’un acteur.’
Puisque l’expression faciale est un indicateur clé et fondamental de l’intention, même lorsqu’il peut s’opposer aux mots prononcés, la capacité de modifier l’expression offre également, dans une certaine mesure, la capacité de changer la façon dont la communication est reçue.
Travaux antérieurs
L’intérêt pour la modification d’expression par apprentissage automatique remonte à au moins 2012, lorsque une collaboration entre Adobe, Facebook et l’Université Rutgers a proposé une méthode pour modifier les expressions en utilisant une approche de reconstruction de géométrie 3D basée sur des tenseurs, qui a laborieusement imposé une mesh CGI sur chaque cadre d’une vidéo cible afin d’effectuer le changement.

La recherche Adobe/Facebook de 2012 a manipulé les expressions en imposant des changements traditionnels CGI sur des images de vidéo. Les expressions pouvaient être augmentées ou supprimées. Source: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf
Bien que les résultats aient été prometteurs, la technique était fastidieuse et les ressources nécessaires étaient considérables. À ce stade, la CGI était loin devant les approches basées sur la vision par ordinateur pour la manipulation directe des caractéristiques et des pixels.
Plus étroitement lié au nouveau document est MEAD, un ensemble de données et un modèle de génération d’expression publiés en 2020, capable de générer des vidéos de ‘tête parlante’, bien que sans le niveau de sophistication qui est potentiellement obtainable en modifiant directement la vidéo source.

Génération d’expression avec MEAD 2020, une collaboration entre SenseTime Research, Carnegie Mellon et trois universités chinoises. Source: https://wywu.github.io/projects/MEAD/MEAD.html
En 2018, un autre document, intitulé GANimation: animation faciale anatomiquement consciente à partir d’une seule image, est apparu comme une collaboration de recherche universitaire américaine et espagnole, et a utilisé des réseaux antagonistes génératifs pour augmenter ou modifier les expressions dans les images fixes uniquement.

Changement d’expression dans les images fixes avec GANimation. Source: https://arxiv.org/pdf/1807.09251.pdf
Wav2Lip-Emotion
Au lieu de cela, le nouveau projet est basé sur Wav2Lip, qui a fait l’objet d’une publicité en 2020 en offrant une méthode potentielle pour resynchroniser les mouvements des lèvres pour accommoder un discours ou une chanson nouveaux (ou une chanson) qui n’a jamais figuré dans la vidéo originale.
L’architecture Wav2Lip d’origine a été formée sur un corpus de phrases parlées des archives de la BBC. Pour adapter Wav2Lip à la tâche de modification d’expression, les chercheurs ont ‘affiné’ l’architecture sur l’ensemble de données MEAD mentionné ci-dessus.
MEAD se compose de 40 heures de vidéo mettant en scène 60 acteurs lisant la même phrase tout en effectuant une variété d’expressions faciales. Les acteurs sont originaires de 15 pays différents et offrent une gamme de caractéristiques internationales visant à aider le projet (et les projets dérivés) à produire une synthèse d’expression applicable et bien généralisée.
Au moment de la recherche, MEAD n’avait publié que la première partie de l’ensemble de données, mettant en scène 47 individus effectuant des expressions telles que ‘en colère’, ‘dégoût’, ‘peur’, ‘mépris’, ‘heureux’, ‘triste’ et ‘surprise’. Dans cette première sortie dans une nouvelle approche, les chercheurs ont limité la portée du projet à la superposition ou à la modification des émotions perçues ‘heureux’ et ‘triste’, puisque ce sont les plus facilement reconnues.
Méthode et résultats
L’architecture Wav2Lip d’origine ne remplace que la partie inférieure du visage, tandis que Wav2Lip-Emotion expérimente également un masque de remplacement facial complet et une synthèse d’expression. Ainsi, il a été nécessaire pour les chercheurs de modifier en outre les méthodes d’évaluation intégrées, car celles-ci n’étaient pas conçues pour une configuration à visage complet.
Les auteurs améliorent le code d’origine en conservant l’entrée audio originale, en maintenant la cohérence du mouvement des lèvres.
L’élément générateur comporte un encodeur d’identité, un encodeur de parole et un décodeur de visage, conformément aux travaux antérieurs. L’élément de parole est encodé en outre sous forme de convolutions 2D empilées qui sont ensuite concaténées à leurs cadres associés.
En plus de l’élément générateur, l’architecture modifiée comporte trois principaux composants de discriminateur, ciblant la qualité de la synchronisation des lèvres, un élément objectif d’émotion et un objectif de qualité visuelle formé de manière antagoniste.
Pour la reconstruction du visage complet, le travail Wav2Lip d’origine ne contenait aucune précédente, et donc le modèle a été formé à partir de zéro. Pour la formation de la partie inférieure du visage (demi-masque), les chercheurs ont procédé à partir des points de contrôle inclus dans le code Wav2Lip d’origine.
En plus de l’évaluation automatique, les chercheurs ont utilisé des opinions de la foule fournies par une plate-forme de service semi-automatique. Les travailleurs ont généralement évalué les sorties très favorablement en termes de reconnaissance des émotions superposées, tout en ne signalant que des évaluations ‘modérées’ pour la qualité de l’image.
Les auteurs suggèrent que, outre l’amélioration de la qualité de la vidéo générée avec des affinements ultérieurs, les itérations futures du travail pourraient englober un plus large éventail d’émotions, et que le travail pourrait également être appliqué à l’avenir à des données et des ensembles de données source étiquetés ou inférés automatiquement, conduisant éventuellement à un système authentique dans lequel les émotions pourraient être réglées ou remplacées par des émotions contrastées par rapport à la vidéo source originale.












