Angle d’Anderson

Le Chemin Vers Une Édition Vidéo Basée Sur L’IA Améliorée

mm
Ajouter Unite.AI à vos sources préférées sur Google
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

Le secteur de la recherche sur la synthèse d’images et de vidéos produit régulièrement des architectures d’édition de vidéos, et au cours des neuf derniers mois, les sorties de ce type sont devenues encore plus fréquentes. Cela étant dit, la plupart d’entre elles ne représentent que des progrès incrémentiels par rapport à l’état de l’art, car les défis de base sont importants.

Cependant, une nouvelle collaboration entre la Chine et le Japon cette semaine a produit des exemples qui méritent un examen plus approfondi de l’approche, même si elle ne constitue pas nécessairement un travail de référence.

Dans la vidéo ci-dessous (du site du projet associé au document, qui – soyez averti – peut ralentir votre navigateur) nous voyons que même si les capacités de deepfaking du système sont inexistantes dans la configuration actuelle, le système fait un excellent travail pour modifier de manière plausible et significative l’identité de la jeune femme sur la photo, sur la base d’un masque vidéo (en bas à gauche) :

Cliquez pour jouer. Basé sur le masque de segmentation sémantique visualisé en bas à gauche, la femme originale (en haut à gauche) est transformée en une identité nettement différente, même si ce processus n’aboutit pas à l’échange d’identité indiqué dans l’invite. Source : https://yxbian23.github.io/project/video-painter/ (soyez averti que, au moment de la rédaction, ce site avec autoplay et plein de vidéos était enclin à faire planter mon navigateur). Veuillez vous référer aux vidéos sources, si vous pouvez y accéder, pour une meilleure résolution et des détails, ou consultez les exemples sur la vidéo de présentation du projet à https://www.youtube.com/watch?v=HYzNfsD3A0s

L’édition basée sur des masques de ce type est bien établie dans les modèles de diffusion latents statiques, en utilisant des outils comme ControlNet. Cependant, maintenir la cohérence de l’arrière-plan dans les vidéos est beaucoup plus difficile, même lorsque les zones masquées offrent au modèle une flexibilité créative, comme le montre ci-dessous :

Cliquez pour jouer. Un changement d’espèce, avec la nouvelle méthode VideoPainter. Veuillez vous référer aux vidéos sources, si vous pouvez y accéder, pour une meilleure résolution et des détails, ou consultez les exemples sur la vidéo de présentation du projet à https://www.youtube.com/watch?v=HYzNfsD3A0s

Les auteurs de ce nouveau travail considèrent leur méthode par rapport à l’architecture BrushNet de Tencent (que nous avons couverte l’année dernière), et à ControlNet, qui traitent tous deux d’une architecture à double branche capable d’isoler la génération de l’avant-plan et de l’arrière-plan.

Cependant, appliquer directement cette méthode aux Diffusion Transformers (DiT) proposés par Sora d’OpenAI présente des défis particuliers, comme le notent les auteurs :

‘L’application directe de l’architecture de BrushNet et de ControlNet aux DiT vidéo présente plusieurs défis. Tout d’abord, compte tenu de la solide base générative des DiT vidéo et de la taille importante du modèle, reproduire l’ensemble ou la moitié du réseau DiT comme encodeur de contexte serait inutile et prohibitif sur le plan computationnel.

‘Deuxièmement, contrairement à la branche de contrôle purement convolutive de BrushNet, les jetons de DiT dans les régions masquées contiennent intrinsèquement des informations d’arrière-plan en raison de l’attention globale, ce qui complique la distinction entre les régions masquées et non masquées dans les réseaux DiT.

‘Enfin, ControlNet manque d’injection de fonctionnalités sur toutes les couches, ce qui entrave le contrôle dense de l’arrière-plan pour les tâches d’inpainting.’

Par conséquent, les chercheurs ont développé une approche plug-and-play sous la forme d’un cadre à double branche intitulé VideoPainter.

VideoPainter propose un cadre d’inpainting vidéo à double branche qui améliore les DiT pré-entraînés avec un encodeur de contexte léger. Cet encodeur ne représente que 6 % des paramètres du réseau, ce que les auteurs affirment rendre l’approche plus efficace que les méthodes conventionnelles.

Le modèle propose trois innovations clés : un encodeur de contexte à deux couches simplifié pour une orientation d’arrière-plan efficace ; un système d’intégration de fonctionnalités sélectif de masque qui sépare les jetons masqués et non masqués ; et une technique de rééchantillonnage d’identifiant de région d’inpainting qui maintient la cohérence d’identité sur de longues séquences vidéo.

En figeant à la fois le DiT pré-entraîné et l’encodeur de contexte tout en introduisant un ID-Adapter, VideoPainter garantit que les jetons de région d’inpainting des clips précédents persistent tout au long d’une vidéo, réduisant ainsi les effets de clignotement et les incohérences.

Le cadre est également conçu pour une compatibilité plug-and-play, permettant aux utilisateurs de l’intégrer sans effort dans les flux de travail de génération et d’édition de vidéos existants.

Pour soutenir le travail, qui utilise CogVideo-5B-I2V comme moteur génératif, les auteurs ont créé ce qu’ils affirment être la plus grande base de données d’inpainting vidéo à ce jour. Intitulée VPData, la collection se compose de plus de 390 000 clips, pour une durée de vidéo totale de plus de 886 heures. Ils ont également développé un cadre de référence associé intitulé VPBench.

Cliquez pour jouer. À partir des exemples du site du projet, nous voyons les capacités de segmentation alimentées par la collection VPData et le cadre de test VPBench. Veuillez vous référer aux vidéos sources, si vous pouvez y accéder, pour une meilleure résolution et des détails, ou consultez les exemples sur la vidéo de présentation du projet à https://www.youtube.com/watch?v=HYzNfsD3A0s

Le nouveau travail est intitulé VideoPainter : Inpainting et Édition de Vidéo de Toute Longueur avec Contrôle de Contexte Plug-and-Play, et provient de sept auteurs du laboratoire ARC de Tencent, de l’Université chinoise de Hong Kong, de l’Université de Tokyo et de l’Université de Macao.

Outre le site du projet mentionné précédemment, les auteurs ont également publié une vue d’ensemble sur YouTube, ainsi qu’une page Hugging Face.

Méthode

Le pipeline de collecte de données pour VPData consiste en une collecte, une annotation, un fractionnement, une sélection et une légende :

Schéma pour le pipeline de construction de la base de données. Source : https://arxiv.org/pdf/2503.05639

Schéma pour le pipeline de construction de la base de données. Source : https://arxiv.org/pdf/2503.05639

Les collections sources utilisées pour cette compilation provenaient de Videvo et Pexels, avec un total initial d’environ 450 000 vidéos.

De multiples bibliothèques et méthodes contribuaient à l’étape de prétraitement : le cadre Recognize Anything était utilisé pour fournir un étiquetage de vidéo ensembliste, chargé d’identifier les objets principaux ; Grounding Dino était utilisé pour la détection de boîtes de délimitation autour des objets identifiés ; et le cadre Segment Anything Model 2 (SAM 2) était utilisé pour raffiner ces sélections grossières en masques de segmentation de haute qualité.

Pour gérer les transitions de scène et assurer la cohérence dans l’inpainting vidéo, VideoPainter utilise PySceneDetect pour identifier et segmenter les clips à des points de rupture naturels, évitant ainsi les changements abrupts souvent causés par le suivi du même objet sous plusieurs angles. Les clips étaient divisés en intervalles de 10 secondes, et tout ce qui était plus court que 6 secondes était rejeté.

Pour la sélection de données, trois critères de filtrage étaient appliqués : qualité esthétique, évaluée avec le prédicteur de score esthétique Laion ; force du mouvement, mesurée via le flux optique en utilisant RAFT ; et sécurité du contenu, vérifiée via le vérificateur de sécurité de Stable Diffusion.

L’une des principales limites des bases de données de segmentation vidéo existantes est le manque d’annotations textuelles détaillées, qui sont cruciales pour guider les modèles génératifs :

Les chercheurs soulignent le manque de légendes de vidéo dans les collections comparables.

Les chercheurs soulignent le manque de légendes de vidéo dans les collections comparables.

Par conséquent, le processus de curation de données VideoPainter intègre des modèles de vision-langage de pointe, notamment CogVLM2 et Chat GPT-4o, pour générer des légendes basées sur des images clés et des descriptions détaillées des régions masquées.

VideoPainter améliore les DiT pré-entraînés en introduisant un encodeur de contexte léger personnalisé qui sépare l’extraction de contexte d’arrière-plan de la génération d’avant-plan, visible en haut à droite du schéma conceptuel ci-dessous :

Schéma conceptuel pour VideoPainter. L'encodeur de contexte de VideoPainter traite les latents bruyants, les masques échantillonnés et les latents de vidéo masqués via VAE, en intégrant uniquement les jetons d'arrière-plan dans le DiT pré-entraîné pour éviter l'ambiguïté. L'adaptateur de rééchantillonnage d'ID garantit la cohérence d'identité en concaténant les jetons de région masquée pendant l'entraînement et en les rééchantillonnant à partir de clips précédents pendant l'inférence.

Schéma conceptuel pour VideoPainter. L’encodeur de contexte de VideoPainter traite les latents bruyants, les masques échantillonnés et les latents de vidéo masqués via VAE, en intégrant uniquement les jetons d’arrière-plan dans le DiT pré-entraîné pour éviter l’ambiguïté. L’adaptateur de rééchantillonnage d’ID garantit la cohérence d’identité en concaténant les jetons de région masquée pendant l’entraînement et en les rééchantillonnant à partir de clips précédents pendant l’inférence.

Au lieu de surcharger le réseau avec des traitements redondants, cet encodeur fonctionne sur une entrée simplifiée : une combinaison de latent bruyant, de latent de vidéo masqué (extrait via un auto-encodeur, ou VAE), et de masques échantillonnés.

Le latent bruyant fournit le contexte de génération, et le latent de vidéo masqué correspond à la distribution existante de DiT, visant à améliorer la compatibilité.

Plutôt que de dupliquer de grandes sections du modèle, ce qui, selon les auteurs, s’est produit dans des travaux antérieurs, VideoPainter n’intègre que les deux premières couches de DiT. Ces fonctionnalités extraites sont réintroduites dans le DiT figé de manière structurée, en groupes – les fonctionnalités des premières couches informent la première moitié du modèle, tandis que les fonctionnalités ultérieures affinent la seconde moitié.

De plus, un mécanisme sélectif de jetons garantit que seules les fonctionnalités pertinentes pour l’arrière-plan sont réintégrées, empêchant ainsi la confusion entre les régions masquées et non masquées. Cette approche, selon les auteurs, permet à VideoPainter de maintenir une grande fidélité dans la préservation de l’arrière-plan tout en améliorant l’efficacité de l’inpainting de l’avant-plan.

Les auteurs notent que la méthode qu’ils proposent prend en charge diverses méthodes de stylisation, notamment la plus populaire, Low Rank Adaptation (LoRA).

Données et Tests

VideoPainter a été formé en utilisant le modèle CogVideo-5B-I2V, ainsi que son équivalent texte-vidéo. La base de données VPData a été utilisée à 480x720px, à un taux d’apprentissage de 1×10-5.

L’adaptateur de rééchantillonnage d’ID a été formé pendant 2 000 étapes, et l’encodeur de contexte pendant 80 000 étapes, les deux utilisant l’optimiseur AdamW. La formation a eu lieu en deux étapes en utilisant 64 GPU NVIDIA V100 (bien que le document ne spécifie pas s’ils disposaient de 16 Go ou 32 Go de VRAM).

Pour la référence, Davis a été utilisé pour les masques aléatoires, et le cadre de référence VPBench des auteurs pour les masques de segmentation.

Le cadre de référence VPBench présente des objets, des animaux, des humains, des paysages et des tâches diverses, et couvre quatre actions : ajouter, supprimer, changer, et échanger. La collection présente 45 vidéos de 6 secondes, et neuf vidéos d’une durée moyenne de 30 secondes.

Huit métriques ont été utilisées pour le processus. Pour la préservation de la région masquée, les auteurs ont utilisé le rapport signal-bruit de pointe (PSNR) ; les métriques de similarité perçue apprises (LPIPS) ; l’indice de similarité structurelle (SSIM) ; et l’erreur absolue moyenne (MAE).

Pour l’alignement du texte, les chercheurs ont utilisé la similarité CLIP à la fois pour évaluer la distance sémantique entre la légende du clip et son contenu réel perçu, et pour évaluer l’exactitude des régions masquées.

Pour évaluer la qualité générale des vidéos de sortie, la distance de vidéo Fréchet (FVD) a été utilisée.

Pour une comparaison quantitative des tests d’inpainting vidéo, les auteurs ont opposé leur système aux approches antérieures ProPainter, COCOCO et Cog-Inp (CogVideoX). Le test consistait à inpainter le premier cadre d’un clip en utilisant des modèles d’inpainting d’images, puis en utilisant un réseau I2V pour propager les résultats dans une opération de mélange latent, conformément à une méthode proposée par un document de 2023 d’Israël.

Puisque le site du projet n’est pas entièrement fonctionnel au moment de la rédaction, et que la vidéo YouTube associée au projet peut ne pas présenter l’ensemble des exemples fournis sur le site du projet, il est plutôt difficile de localiser des exemples de vidéo très spécifiques aux résultats présentés dans le document. Par conséquent, nous allons présenter des résultats statiques partiels présentés dans le document, et fermer l’article avec quelques exemples de vidéos supplémentaires que nous avons pu extraire du site du projet.

Comparaison quantitative de VideoPainter par rapport à ProPainter, COCOCO et Cog-Inp sur VPBench (masques de segmentation) et Davis (masques aléatoires). Les métriques couvrent la préservation de la région masquée, l'alignement du texte et la qualité de la vidéo. Rouge = meilleur, Bleu = deuxième meilleur.

Comparaison quantitative de VideoPainter par rapport à ProPainter, COCOCO et Cog-Inp sur VPBench (masques de segmentation) et Davis (masques aléatoires). Les métriques couvrent la préservation de la région masquée, l’alignement du texte et la qualité de la vidéo. Rouge = meilleur, Bleu = deuxième meilleur.

À propos de ces résultats quantitatifs, les auteurs commentent :

‘Dans le benchmark VPBench basé sur la segmentation, ProPainter et COCOCO présentent les pires performances sur la plupart des métriques, principalement en raison de leur incapacité à inpainter des objets entièrement masqués et de la difficulté de l’architecture à simple réseau à équilibrer la préservation de l’arrière-plan et la génération de l’avant-plan, respectivement.

‘Dans le benchmark Davis basé sur les masques aléatoires, ProPainter montre une amélioration en exploitant les informations de l’arrière-plan partiel. Cependant, VideoPainter atteint des performances optimales sur la segmentation (standard et longue) et les masques aléatoires grâce à son architecture à double branche qui découple efficacement la préservation de l’arrière-plan et la génération de l’avant-plan.’

Les auteurs présentent ensuite des exemples statiques de tests qualitatifs, dont nous présentons une sélection ci-dessous. Dans tous les cas, nous renvoyons le lecteur au site du projet et à la vidéo YouTube pour une meilleure résolution.

Comparaison avec les méthodes d'inpainting dans les cadres antérieurs.

Comparaison avec les méthodes d’inpainting dans les cadres antérieurs.

 

Cliquez pour jouer. Exemples concaténés par nous à partir des vidéos ‘résultats’ sur le site du projet.

Concernant ce tour qualitatif pour l’inpainting vidéo, les auteurs commentent :

‘VideoPainter montre systématiquement des résultats exceptionnels en termes de cohérence vidéo, de qualité et d’alignement avec la légende. Notamment, ProPainter échoue à générer des objets entièrement masqués car il ne dépend que de la propagation des pixels d’arrière-plan au lieu de générer.

‘Alors que COCOCO démontre une fonctionnalité de base, il échoue à maintenir une identité cohérente dans les régions inpaintées (apparitions d’objets incohérents et changements de terrain abrupts) en raison de son architecture à simple réseau qui tente d’équilibrer la préservation de l’arrière-plan et la génération de l’avant-plan.

‘Cog-Inp atteint des résultats d’inpainting de base ; cependant, l’incapacité de son opération de mélange à détecter les limites des masques conduit à des artefacts importants.

‘De plus, VideoPainter peut générer des vidéos cohérentes dépassant une minute tout en maintenant la cohérence d’identité grâce à notre rééchantillonnage d’ID.’

Les chercheurs ont également testé la capacité de VideoPainter à améliorer les légendes et à obtenir de meilleurs résultats par cette méthode, en le comparant à UniEdit, DiTCtrl et ReVideo.

Résultats d'édition de vidéo par rapport à trois approches antérieures.

Résultats d’édition de vidéo par rapport à trois approches antérieures.

Les auteurs commentent :

‘Pour les vidéos standard et longues dans VPBench, VideoPainter atteint des performances supérieures, dépassant même l’approche de bout en bout ReVideo. Ce succès peut être attribué à son architecture à double branche, qui garantit d’excellentes capacités de préservation de l’arrière-plan et de génération de l’avant-plan, tout en maintenant une grande fidélité dans les régions non éditées tout en garantissant que les régions éditées s’alignent étroitement sur les instructions d’édition, complétées par le rééchantillonnage d’ID de la région d’inpainting qui maintient la cohérence d’identité dans les vidéos longues.’

Bien que le document présente des exemples statiques pour cette métrique, ils sont peu éclairants, et nous renvoyons le lecteur aux divers exemples répartis sur les différentes vidéos publiées pour ce projet.

Enfin, une étude humaine a été menée, dans laquelle trente utilisateurs ont été invités à évaluer 50 générations aléatoires à partir des sous-ensembles VPBench et d’édition. Les exemples mettaient en évidence la préservation de l’arrière-plan, l’alignement sur l’invite et la qualité générale de la vidéo.

Résultats de l'étude utilisateur pour VideoPainter.

Résultats de l’étude utilisateur pour VideoPainter.

Les auteurs déclarent :

‘VideoPainter a nettement surpassé les références existantes, obtenant des taux de préférence plus élevés dans tous les critères d’évaluation pour les deux tâches.’

Ils reconnaissent cependant que la qualité des générations de VideoPainter dépend du modèle de base, qui peut avoir du mal avec des mouvements et une physique complexes ; et ils observent qu’il fonctionne également mal avec des masques de mauvaise qualité ou des légendes mal alignées.

Conclusion

VideoPainter semble être une addition précieuse à la littérature. Typique des solutions récentes, cependant, elle présente des exigences de calcul considérables. De plus, de nombreux exemples choisis pour la présentation sur le site du projet sont très loin des meilleurs exemples ; il serait donc intéressant de voir ce cadre confronté à des entrées futures et à une gamme plus large d’approches antérieures.

 

* Il est important de noter que ‘l’édition de vidéo’ dans ce sens ne signifie pas ‘assembler des clips divers en une séquence’, qui est le sens traditionnel de ce terme ; mais plutôt modifier directement ou de quelque manière que ce soit le contenu interne des clips vidéo existants, en utilisant des techniques d’apprentissage automatique

Publié pour la première fois lundi 10 mars 2025. Mis à jour samedi 25 juillet 2026 pour remplacer la vidéo.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai