Angle d’Anderson

Ajout de dialogue à une vidéo réelle avec l’IA

mm
Ajouter Unite.AI à vos sources préférées sur Google
Montage of subjects from the demonstration video-clips for FacEDiT. Source: https://facedit.github.io/

Un nouveau cadre d’IA peut réécrire, supprimer ou ajouter les paroles d’une personne dans une vidéo sans nécessiter de retournage, dans un système intégré de bout en bout.

 

Il y a trois ans, Internet aurait été stupéfait par l’un des 20-30 cadres de modification de vidéo IA publiés sur les portails académiques chaque semaine; comme c’est le cas, cette branche de recherche populaire est devenue si prolifique qu’elle constitue presque une autre branche de “bavardage IA”, et je couvre beaucoup moins de ces versions que je l’aurais fait il y a deux ou trois ans.

Cependant, une publication actuelle dans cette lignée a attiré mon attention: un système intégré capable d’intervenir dans des clips vidéo réels et d’interposer de nouveaux discours dans la vidéo existante (plutôt que de créer un clip génératif entier à partir d’un visage ou d’un cadre, ce qui est beaucoup plus courant).

Dans les exemples ci-dessous, que j’ai édités à partir de nombreuses vidéos d’exemple disponibles sur le site Web du projet, nous voyons d’abord le clip source réel, puis, en dessous, le discours IA imposé au milieu du clip, y compris la synthèse vocale et la synchronisation labiale:

Cliquez pour jouer.Édition locale avec couture – l’une des modalités proposées par FacEDiT. Veuillez vous référer au site Web source pour une meilleure résolution. Source – https://facedit.github.io/

Cette approche est l’une des trois développées pour la nouvelle méthode, intitulée “édition locale avec couture”, et celle qui intéresse le plus les auteurs (ainsi que moi). Essentiellement, le clip est étendu en utilisant l’un des cadres du milieu comme point de départ pour une nouvelle interprétation IA, et son cadre réel successif comme objectif que le clip génératif inséré devrait viser à correspondre. Dans les clips ci-dessus, ces “graines” et “cibles” sont représentées par la vidéo la plus haute qui se met en pause tandis que la vidéo modifiée ci-dessous fournit une infill générative.

Les auteurs présentent cette approche de synthèse faciale et vocale comme la première méthode intégrée de bout en bout pour les éditions de vidéo IA de ce type, observant le potentiel d’un cadre entièrement développé comme celui-ci pour la production de télévision et de films:

‘Les réalisateurs et les producteurs de médias ont souvent besoin de réviser des parties spécifiques de vidéos enregistrées – peut-être qu’un mot a été mal prononcé ou que le script a changé après le tournage. Par exemple, dans la scène emblématique de Titanic (1997) où Rose dit, “Je ne te lâcherai jamais, Jack,” le réalisateur peut plus tard décider qu’il devrait être “Je ne t’oublierai jamais, Jack”.

‘Traditionnellement, de tels changements nécessitent de retournage de toute la scène, ce qui est coûteux et chronophage. La synthèse de visage parlant offre une alternative pratique en modifiant automatiquement le mouvement facial pour correspondre au discours révisé, éliminant ainsi la nécessité de retournage.’

Bien que les interpositions IA de ce type puissent faire face à une résistance culturelle ou industrielle, elles peuvent également constituer un nouveau type de fonctionnalité dans les systèmes et les suites d’outils VFX dirigés par l’homme. Dans tous les cas, pour le moment, les défis sont strictement techniques.

En plus d’étendre un clip par le biais d’un dialogue IA supplémentaire, le nouveau système peut également modifier les discours existants:

Cliquez pour jouer. Un exemple de modification du discours existant plutôt que d’interposer un nouveau discours. Veuillez vous référer au site Web source pour une meilleure résolution.

État de l’art

Il n’y a actuellement aucun système intégré qui offre cette capacité de synthèse; bien qu’un nombre croissant de plateformes d’IA génératives telles que la série Veo de Google puissent générer de l’audio, et divers autres cadres puissent créer des audio profondément faux, il faut actuellement créer un pipeline assez complexe de diverses architectures et de tours pour interférer avec des rushes réels de la manière dont le nouveau système – intitulé FacEDiT – peut le faire.

Le système utilise des Transformateurs de diffusion (DiT) en combinaison avec Flow Matching pour créer des mouvements faciaux conditionnés par les mouvements contextuels (environnants) et le contenu audio du discours. Le système utilise des packages populaires existants qui traitent de la reconstruction faciale, y compris LivePortrait (récemment repris par Kling).

En plus de cette méthode, étant donné que leur approche est la première à intégrer ces défis dans une solution unique, les auteurs ont créé un nouveau référentiel appelé FacEDiTBench, ainsi que plusieurs métriques d’évaluation entièrement nouvelles appropries à cette tâche très spécifique.

Le nouveau travail est intitulé FacEDiT: Édition et génération de visage parlant unifiées via le remplissage de mouvement facial, et provient de quatre chercheurs de l’Université des sciences et de la technologie de Pohang (POSTECH), de l’Institut des sciences et de la technologie avancées de Corée (KAIST), et de l’Université du Texas à Austin.

Méthode

FacEDiT est formé pour reconstruire le mouvement facial en apprenant à remplir les parties manquantes de la performance originale d’un acteur, en fonction du mouvement environnant et du discours audio. Comme le montre le schéma ci-dessous, ce processus permet au modèle d’agir comme un remplisseur de lacunes pendant la formation, en prédisant les mouvements faciaux qui correspondent à la voix tout en restant cohérents avec la vidéo originale:

Vue d'ensemble du système FacEDiT, montrant comment le mouvement facial est appris par le remplissage autonome pendant la formation, guidé par le discours édité à l'inférence, et finalement rendu à nouveau dans la vidéo en réutilisant l'apparence de la vidéo originale tout en remplaçant uniquement le mouvement ciblé.. Source - https://arxiv.org/pdf/2512.14056

Vue d’ensemble du système FacEDiT, montrant comment le mouvement facial est appris par le remplissage autonome pendant la formation, guidé par le discours édité à l’inférence, et finalement rendu à nouveau dans la vidéo en réutilisant l’apparence de la vidéo originale tout en remplaçant uniquement le mouvement ciblé. Source

À l’époque de l’inférence, la même architecture prend en charge deux sorties différentes en fonction de la quantité de vidéo masquée: des éditions partielles, où seule une phrase est modifiée et le reste est laissé intact; ou la génération de phrase complète, où un nouveau mouvement est synthétisé entièrement à partir de zéro.

Le modèle est formé via flow matching, qui traite les éditions de vidéo comme une sorte de chemin entre deux versions de mouvement facial.

Au lieu d’apprendre à deviner à quoi ressemblerait un visage édité à partir de zéro, le flow matching apprend à se déplacer progressivement et en douceur entre un espace réservé bruyant et le mouvement correct. Pour faciliter cela, le système représente le mouvement facial comme un ensemble compact de nombres extraits de chaque trame à l’aide d’une version du système LivePortrait mentionné ci-dessus.

Ces vecteurs de mouvement sont conçus pour décrire les expressions et la pose de la tête sans emmêler l’identité, de sorte que les changements de discours puissent être localisés sans affecter l’apparence générale de la personne.

Formation de FacEDiT

Pour former FacEDiT, chaque clip vidéo a été divisé en une série d’instantanés de mouvement facial, et chaque trame a été associée au morceau de discours audio correspondant. Des parties aléatoires des données de mouvement ont ensuite été masquées, et le modèle a été invité à deviner à quoi ressembleraient ces mouvements manquants, en utilisant à la fois le discours et le mouvement non masqué environnant comme contexte.

Puisque les spans masqués et leurs positions varient d’un exemple de formation à l’autre, le modèle apprend progressivement à gérer à la fois les éditions internes petites et les lacunes plus longues, pour la génération de séquence complète, en fonction de la quantité d’informations qu’il reçoit.

Le Transformateur de diffusion apprend à récupérer le mouvement masqué en affinant les entrées bruyantes au fil du temps. Au lieu de fournir le discours et le mouvement au modèle en une seule fois, l’audio est introduit dans chaque bloc de traitement via cross-attention, aidant le système à faire correspondre les mouvements des lèvres plus précisément au discours audio.

Pour préserver la réalisme à travers les éditions, l’attention est biaisée vers les trames voisines plutôt que vers la chronologie entière, forçant le modèle à se concentrer sur la continuité locale et empêchant les clignotements ou les sauts de mouvement aux bords des régions modifiées. Les embeddings positionnels (qui indiquent au modèle où chaque trame apparaît dans la séquence) aident également le modèle à maintenir un flux temporel naturel et un contexte.

Pendant la formation, le système apprend à prédire le mouvement facial manquant en reconstruisant les spans masqués en fonction du discours et du mouvement non masqué environnant. À l’époque de l’inférence, cette même configuration est réutilisée, mais avec les masques maintenant guidés par les éditions du discours.

Lorsqu’un mot ou une phrase est inséré, supprimé ou modifié, le système localise la région affectée, la masque et régénère le mouvement qui correspond au nouvel audio. La génération de séquence complète est traitée comme un cas particulier, où la région entière est masquée et synthétisée à partir de zéro.

Données et tests

Le système est composé de 22 couches pour le Transformateur de diffusion, chacune avec 16 têtes d’attention et des dimensions de feedforward de 1024 et 2024px. Les caractéristiques de mouvement et d’apparence sont extraites à l’aide de composants figés de LivePortrait, et le discours est codé via WavLM et modifié à l’aide de VoiceCraft.

Une couche de projection dédiée mappe les caractéristiques audio de 786 dimensions dans l’espace latent de DiT, avec seulement DiT et les modules de projection formés à partir de zéro.

La formation a été effectuée sous l’optimiseur AdamW à un taux d’apprentissage cible de 1e-4, pendant un million d’étapes, sur deux GPU A6000 (chacun avec 48 Go de VRAM), à un taille de lot total de huit.

FacEDiTBench

Le jeu de données FacEDiTBench contient 250 exemples, chacun avec un clip vidéo de discours original et édité, et les transcriptions pour les deux. Les vidéos proviennent de trois sources, avec 100 clips de HDTF, 100 de Hallo3, et 50 de CelebV-Dub. Chacun a été vérifié manuellement pour confirmer que le discours audio et la vidéo étaient suffisamment clairs pour l’évaluation.

GPT‑4o a été utilisé pour réviser chaque transcription pour créer des éditions grammaticalement valides. Ces transcriptions révisées, ainsi que le discours original, ont été transmises à VoiceCraft pour produire un nouvel audio; et à chaque étape, à la fois la transcription et le discours généré ont été examinés manuellement pour la qualité.

Chaque exemple a été étiqueté avec le type d’édition, le moment du changement et la longueur de la partie modifiée, et les éditions ont été classées en insertions, suppressions ou substitutions. Le nombre de mots modifiés allait de courtes éditions de 1 à 3 mots, d’éditions moyennes de 4 à 6 mots, et d’éditions plus longues de 7 à 10 mots.

Trois métriques personnalisées ont été définies pour évaluer la qualité d’édition. Continuité photométrique, pour mesurer à quel point l’éclairage et la couleur d’un segment édité se fondent dans la vidéo environnante, en comparant les différences au niveau des pixels aux frontières; continuité de mouvement, pour évaluer la cohérence du mouvement facial, en mesurant les changements de flux optique entre les trames éditées et non éditées; et préservation de l’identité, pour estimer si l’apparence du sujet reste cohérente après édition, en comparant les embeddings faciaux des séquences originales et générées à l’aide du modèle de reconnaissance faciale ArcFace.

Tests

Le modèle de test a été formé à partir de matériel provenant des trois jeux de données mentionnés ci-dessus, totalisant environ 200 heures de contenu vidéo, y compris des vlogs et des films, ainsi que des vidéos YouTube à haute résolution.

Pour évaluer l’édition de visage parlant, FacEDiTBench a été utilisé, en plus de la partition de test HDTF, qui est devenue une norme de référence pour cet ensemble de tâches.

Étant donné qu’il n’y avait pas de systèmes directement comparables capables d’incarner cette fonctionnalité de bout en bout, les auteurs ont choisi une variété de cadres qui reproduisaient au moins une partie de la fonctionnalité cible, et qui pouvaient servir de références; notamment, KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; et SadTalker.

Plusieurs métriques établies ont également été utilisées pour évaluer la qualité de génération et d’édition, avec la précision de synchronisation labiale évaluée via SyncNet, en signalant à la fois l’erreur absolue entre les mouvements des lèvres et l’audio (LSE-D) et un score de confiance (LSE-C); Fréchet Video Distance (FVD) quantifiant à quel point la vidéo semble réaliste dans l’ensemble; et Métriques de similarité perçue apprises (LPIPS), mesurant la similarité perceptive entre les trames générées et originales.

Pour l’édition, toutes les métriques sauf LPIPS ont été appliquées uniquement au segment modifié; pour la génération, la vidéo entière a été évaluée, à l’exclusion de la continuité des frontières.

Chaque modèle a été invité à synthétiser un segment de vidéo correspondant, qui a ensuite été inséré dans le clip original (les chercheurs notent que cette méthode introduit souvent des discontinuités visibles, là où la section éditée rencontre les rushes environnants). Une deuxième approche a également été testée, dans laquelle la vidéo entière a été régénérée à partir de l’audio modifié – mais cela a inévitablement écrasé les régions non éditées et n’a pas préservé la performance originale:

Comparaison des performances d'édition entre les systèmes, avec FacEDiT surpassant toutes les références dans chaque métrique, réalisant une erreur de synchronisation labiale plus faible (LSE-D), une confiance de synchronisation plus élevée (LSE-C), une préservation de l'identité plus forte (IDSIM), une réalisme perçu plus grand (FVD), et des transitions plus fluides aux frontières d'édition (Pcontinuity, Mcontinuity). Les colonnes ombrées en gris mettent en évidence les critères clés pour évaluer la qualité des frontières; les valeurs en gras et soulignées indiquent les meilleurs et les deuxièmes meilleurs résultats, respectivement

Comparaison des performances d’édition entre les systèmes, avec FacEDiT surpassant toutes les références dans chaque métrique, réalisant une erreur de synchronisation labiale plus faible (LSE-D), une confiance de synchronisation plus élevée (LSE-C), une préservation de l’identité plus forte (IDSIM), une réalisme perçu plus grand (FVD), et des transitions plus fluides aux frontières d’édition (Pcontinuity, Mcontinuity). Les colonnes ombrées en gris mettent en évidence les critères clés pour évaluer la qualité des frontières; les valeurs en gras et soulignées indiquent les meilleurs et les deuxièmes meilleurs résultats, respectivement

En ce qui concerne ces résultats, les auteurs commentent:

‘[Notre] modèle surpasse de manière significative les méthodes existantes pour la tâche d’édition. Il réalise une forte continuité de frontière et une préservation de l’identité élevée, démontrant sa capacité à maintenir la cohérence temporelle et visuelle lors de l’édition. De plus, sa précision de synchronisation labiale supérieure et son FVD faible reflètent le réalisme de la vidéo synthétisée.’

Cliquez pour jouer. Résultats, assemblés par cet auteur à partir des vidéos publiées sur le site Web du projet. Veuillez vous référer au site Web source pour une meilleure résolution.

De plus, une étude humaine a été menée pour évaluer la qualité perçue à la fois pour l’édition et la génération.

Pour chaque comparaison, les participants ont visionné six vidéos et les ont classées par qualité globale, en tenant compte de la précision de synchronisation labiale, de la naturalité et du réalisme du mouvement de la tête:

Rangs moyens attribués par les évaluateurs humains, où un rang plus bas signifie une meilleure qualité. Dans les deux cas d'édition et de génération, les participants ont évalué à quel point chaque vidéo semblait naturelle et bien synchronisée. Pour l'édition, ils ont également évalué la fluidité des transitions entre les segments édités et non édités:

Rangs moyens attribués par les évaluateurs humains, où un rang plus bas signifie une meilleure qualité. Dans les deux cas d’édition et de génération, les participants ont évalué à quel point chaque vidéo semblait naturelle et bien synchronisée. Pour l’édition, ils ont également évalué la fluidité des transitions entre les segments édités et non édités. Les nombres en gras et soulignés indiquent les deux meilleurs scores.

Dans l’étude, FacEDiT a été classé en tête avec une avance claire, à la fois pour la qualité d’édition et la fluidité des transitions, et a également obtenu de bons scores dans le cadre de la génération, suggérant que ses avantages mesurés se traduisent par des sorties perçues comme préférables.

En raison du manque d’espace, nous renvoyons le lecteur au document source pour plus de détails sur les études d’ablation et les tests supplémentaires qui ont été menés et rapportés dans le nouveau travail. En vérité, les offres de recherche de type prototypal de ce type ont du mal à générer des sections de résultats de test significatifs, puisque l’offre de base elle-même est inévitablement une base de référence potentielle pour les travaux ultérieurs.

Conclusion

Même pour l’inférence, des systèmes comme celui-ci peuvent nécessiter des ressources de calcul importantes à l’époque de l’inférence, ce qui rend difficile pour les utilisateurs en aval – ici, probablement les boutiques d’effets visuels – de garder le travail sur place. Par conséquent, les approches qui peuvent être adaptées à des ressources locales réalistes seront toujours préférées par les fournisseurs, qui sont sous obligation légale de protéger les rushes et la propriété intellectuelle générale des clients.

Cela ne signifie pas critiquer la nouvelle offre, qui peut très bien fonctionner parfaitement sous des poids quantifiés ou d’autres optimisations, et qui est la première offre de ce type à me ramener sur cette avenue de recherche depuis un certain temps.

 

Publié pour la première fois le mercredi 17 décembre 202. Édité le 20.10 EET, le même jour, pour ajouter de l’espace dans le premier paragraphe du corps.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai