Angle d’Anderson

Effacer des objets et des personnes de vidéos avec l’IA

mm
Ajouter Unite.AI à vos sources préférées sur Google
AI-generated stylized image depicting a magician robot showing an empty cabinet with a lady's tiara at the bottom. GPT-1.5

Non, l’enfant ne reste pas dans l’image, si l’IA a quelque chose à dire.

 

La suppression d’objets et de personnes d’images et de vidéos est un domaine de recherche populaire dans la littérature VFX centrée sur l’IA, avec un nombre croissant de jeux de données et de cadres dédiés pour relever le défi. Le dernier de ces cadres, issu de l’Institut des grandes données de l’Université Fudan en Chine, est EffectErase, un système de suppression d’objets de vidéo « conscient des effets » qui, selon les auteurs, améliore de manière notable l’état de l’art dans les tests:

Assemblé à partir de matériel du site du projet, des exemples de la méthode EffectErase (veuillez noter que même si nous fournissons un lien, le site source contient de nombreuses vidéos à haute résolution et non optimisées qui peuvent affecter la stabilité de votre navigateur. La vidéo YouTube accompagnante est une référence plus facile et plus complète, et est intégrée à la fin de cet article).  Source

Le nouveau travail a impliqué la création/la curation d’un jeu de données semi-novel comprenant près de 350 scènes réelles et synthétisées (en utilisant des référentiels publics*), soit capturées avec un équipement dédié, soit sources et réutilisées dans un flux de travail construit autour du framework Blender 3D open source.

Le jeu de données hybride de suppression d’objets de vidéo (VOR) forme la base de l’application EffectErase elle-même, qui est construite sur le système de génération de vidéos Wan2.1. Le système définit également deux nouvelles références liées: VOR Eval et VOR Wild – respectivement, pour les échantillons avec et sans vérité de base.

(Bien que le document ait un site de projet accompagnant, il est plutôt surchargé de multiples vidéos à haute résolution, et difficile à charger; donc, veuillez vous référer aux extraits que j’ai sélectionnés dans la vidéo intégrée ci-dessus, si vous trouvez le site du projet difficile à utiliser)

Une comparaison des quantités entre les jeux de données comparables, par rapport à la nouvelle offre. Source - https://arxiv.org/pdf/2603.19224

Une comparaison des quantités entre les jeux de données comparables, par rapport à la nouvelle offre. Source

Les chercheurs affirment que leur approche donne des résultats de pointe, à la fois en termes de métriques quantitatives et de résultats qualitatifs, tels que jugés par une étude humaine.

Ils notent que les travaux précédents n’ont pas toujours réussi à supprimer les effets adjacents d’un objet, tels que les ombres et les réflexions, et que leur jeu de données a été soigneusement créé pour remédier à cette lacune:

Exemples de l'échec des approches précédentes pour aller au-delà de l'objet recherché pour la suppression, vers les indications secondaires, telles que les réflexions et les ombres.

Exemples de l’échec des approches précédentes pour aller au-delà de l’objet recherché pour la suppression, vers les indications secondaires, telles que les réflexions et les ombres.

Le nouveau document est intitulé EffectErase: Suppression et insertion conjointe d’objets de vidéo pour une suppression d’effets de haute qualité, et provient de quatre chercheurs de la Faculté d’informatique et d’intelligence artificielle de l’Université Fudan.

Méthode

Le jeu de données hybride VOR a été conçu pour englober un large éventail de scénarios afin de couvrir toutes les implications de la suppression d’une personne ou d’un objet d’une vidéo:

Des cadres appariés du jeu de données VOR illustrent comment la suppression d'objets doit aller au-delà de l'objet visible pour ses effets induits, avec des exemples montrant l'occlusion, l'ombre, les déplacements de lumière, les réflexions et la déformation physique, chaque exemple présenté comme entrée (objet présent) aux côtés de l'arrière-plan propre correspondant après suppression.

Des cadres appariés du jeu de données VOR illustrent comment la suppression d’objets doit aller au-delà de l’objet visible pour ses effets induits, avec des exemples montrant l’occlusion, l’ombre, les déplacements de lumière, les réflexions et la déformation physique, chaque exemple présenté comme entrée (objet présent) aux côtés de l’arrière-plan propre correspondant après suppression. Pour plus d’exemples, veuillez consulter la vidéo YouTube intégrée à la fin de cet article.

Les cinq types représentatifs d’« interférences » à traiter sont définis par les auteurs comme occlusion, y compris divers types d’occlusion par le verre et la fumée; ombres; éclairage (par exemple, lorsque l’objet à supprimer crée ou modifie le chemin de la lumière); réflexion; et déformation (par exemple, l’empreinte d’un utilisateur sur un coussin, qui ne devrait pas survivre à la suppression de la personne).

Pipeline de construction de données pour VOR, combinant des scènes synthétiques générées par Blender avec des captures du monde réel, où les données synthétiques sont construites à partir d'environnements 3D, d'objets et de trajectoires de caméra curés, et des séquences réelles enregistrées dans divers scènes, augmentées du mouvement Ken Burns. La segmentation SAM2 et l'affinement manuel produisent ensuite des triplets de vidéos de premier plan et d'arrière-plan alignés avec des masques correspondants.

Pipeline de construction de données pour VOR, combinant des scènes synthétiques générées par Blender avec des captures du monde réel, où les données synthétiques sont construites à partir d’environnements 3D, d’objets et de trajectoires de caméra curés, et des séquences réelles enregistrées dans divers scènes, augmentées du mouvement Ken Burns. La segmentation SAM2 et l’affinement manuel produisent ensuite des triplets de vidéos de premier plan et d’arrière-plan alignés avec des masques correspondants.

Pour les données réelles, les chercheurs ont utilisé des caméras fixes pour enregistrer des scènes « avec » et « sans » objets, couvrant un large éventail d’environnements, d’heures de la journée et de conditions météorologiques.

Pour les données synthétiques, de multiples points de vue ont été rendus, et des scènes multi-objets ont été créées, présentant des mouvements de caméra complexes et difficiles, tels que ceux qui pourraient se produire dans des séquences réelles; et les chercheurs observent que cette approche est plus sophistiquée et plus élaborée que celle utilisée pour le jeu de données Remove Objects with Side Effects in Videos (ROSE) similaire.

Pour augmenter la diversité du mouvement, l’effet Ken Burns a été appliqué aux paires de caméras, ajoutant des panoramiques, des zooms et des mouvements de caméra légèrement déplacés sous quatorze règles prédéfinies, avec cinq modèles de mouvement échantillonnés par paire tout en gardant la culture à l’intérieur du cadre d’origine.

La taille et la diversité ont été encore augmentées en combinant des objets synthétiques avec plusieurs configurations de caméra, des masques ont été générés en plaçant des invites de points manuels sur des cadres clés, en propageant la segmentation avec Segment Anything 2 (SAM2), en nettoyant et en affinant les résultats, et en assemblant des triplets de premier plan, d’arrière-plan et de masque validés pour la formation.

La collection finale s’étend sur 145 heures de vidéo à travers 60 000 vidéos appariées, réelles et synthétiques, couvrant 366 classes d’objets dans 443 scènes.

Le réseau EffectErase lui-même ingère du matériel via un encodeur automatique variationnel (VAE), avec le bruit de dénoising géré par Wan2.1. Sur cette colonne vertébrale, EffectErase fonctionne avec l’apprentissage conjoint de suppression et d’insertion, qui forme les deux tâches ensemble sur les mêmes régions; l’orientation de la région consciente de la tâche (TARG), qui utilise des jetons d’objets et de tâches avec l’attention croisée pour modéliser les liens spatio-temporels entre les objets et leurs effets et permettre le commutation de tâche; et la perte de cohérence d’effet, qui aligne les régions d’effet alignées sur les tâches de suppression et d’insertion:

Schéma du cadre EffectErase. Lors de la formation, les vidéos appariées sont codées dans un espace latent partagé, fusionnées avec du bruit, et traitées par un transformateur de diffusion guidé par une attention consciente de la tâche, tandis qu'une perte de cohérence d'effet aligne les régions de suppression et d'insertion afin que les deux tâches se concentrent sur la même zone.

Schéma du cadre EffectErase. Lors de la formation, les vidéos appariées sont codées dans un espace latent partagé, fusionnées avec du bruit, et traitées par un transformateur de diffusion guidé par une attention consciente de la tâche, tandis qu’une perte de cohérence d’effet aligne les régions de suppression et d’insertion afin que les deux tâches se concentrent sur la même zone.

En elles-mêmes, les processus de suppression et d’insertion sont formés ensemble, en utilisant une colonne vertébrale de diffusion partagée, de sorte que le modèle apprenne à se concentrer sur les mêmes régions affectées et les indices structurels.

Les vidéos avec des objets, les vidéos d’arrière-plan uniquement et les masques sont d’abord codés dans un espace latent; le bruit est ensuite ajouté pour la formation de diffusion, et le modèle apprend à récupérer des représentations propres sous la direction de la tâche spécifique. Un adaptateur léger fusionne ensuite les fonctionnalités bruyantes avec les conditions de suppression ou d’insertion, permettant aux deux tâches de partager la supervision, tout en restant contrôlables.

La guidance de région consciente de la tâche crée un signal spécifique à la tâche en combinant des jetons de langage avec des fonctionnalités visuelles extraites de l’objet de premier plan, en utilisant CLIP, en remplaçant un jeton d’objet générique par un jeton dérivé du contenu réel de l’image. Cette représentation fusionnée est injectée dans la colonne vertébrale via l’attention croisée, permettant au modèle de suivre comment un objet et ses effets visuels évoluent dans l’espace et le temps, tout en permettant un commutation de tâche flexible.

La perte de cohérence d’effet force les processus de suppression et d’insertion à se concentrer sur les mêmes zones modifiées, puisque les deux tâches traitent du même objet et de ses effets visuels. Les cartes d’attention des deux branches sont ensuite combinées en cartes de région douces, et alignées avec une carte de différence calculée à partir des vidéos d’objets et d’arrière-plan, de sorte que les changements subtils tels que la lumière et les ombres soient préservés. Cette perte supplémentaire aide l’insertion à guider la suppression et maintient les deux tâches cohérentes.

Données et tests

Les chercheurs ont testé leur approche contre diverses méthodes de retouche, de retouche de vidéo et de suppression d’objets: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; et MiniMax-Remover.

Wan2.1 a été affiné avec LoRA†† en utilisant le jeu de données VOR à une résolution de 832x480px. 81 cadres consécutifs (la limite effective pour WAN, au-delà de laquelle les erreurs tendent à se produire) ont été échantillonnés aléatoirement pour la formation, qui a eu lieu pendant 129 000 itérations à un taille de lot de 8, sur huit GPU H100, chacun avec 80 Go de VRAM. Le taux d’apprentissage a été fixé à 1×102, et le rang LoRA à 256.

La collection synthétique ROSE-Benchmark a été le seul jeu de données externe testé; les deux autres étaient VOR-Eval, la partie de test du jeu de données VOR; et VOR-Wild, un jeu de test composé de 195 vidéos réelles extraites d’Internet, présentant des « objets dynamiques ».

Les métriques utilisées étaient le rapport signal/bruit de pointe (PSNR); l’indice de similarité structurelle (SSIM); la similarité de patch d’image perçue apprise (LPIPS); et la distance de vidéo de Fréchet (FVD). Une étude d’utilisateurs de 195 vidéos générées à partir de VOR-Wild a également été prise en compte, avec des notes moyennes de 20 volontaires prises en compte.

En outre, les auteurs ont conçu QScore, une métrique qui utilise le modèle multimodal Qwen-VL pour évaluer la qualité de la sortie de vidéo avec objet supprimé, en termes d’artefacts résiduels ou de suppressions environnementales manquées, telles que les ombres et les effets de lumière:

Comparaison quantitative sur les références ROSE et VOR, avec les meilleurs et les deuxièmes meilleurs résultats affichés en gras et soulignés, respectivement.

Comparaison quantitative sur les références ROSE et VOR, avec les meilleurs et les deuxièmes meilleurs résultats affichés en gras et soulignés, respectivement.

En ce qui concerne ces résultats, les auteurs notent:

‘Les méthodes de retouche d’image opèrent sur des cadres individuels en utilisant des modèles 2D sans modélisation temporelle, et ne parviennent donc pas à maintenir la cohérence temporelle dans les vidéos.

Les méthodes de retouche de vidéo récentes ne modélisent pas explicitement les effets secondaires des objets, ce qui entraîne des résultats de suppression non naturels. Les méthodes de suppression d’objets de vidéo existantes manquent de modélisation de corrélation spatio-temporelle entre l’objet et ses effets secondaires, et produisent souvent des artefacts et des traces résiduelles de l’objet supprimé.

‘Dans l’ensemble, EffectErase atteint des performances de pointe dans tous les jeux de données et les métriques d’évaluation. Il obtient les meilleurs scores sur la métrique de qualité de vidéo FVD, démontrant une supériorité de la lissité temporelle et de la cohérence des vidéos générées.

‘Notre méthode obtient également les scores QScore et les notes d’utilisateurs les plus élevés, démontrant encore son efficacité pour produire des résultats de suppression visuellement convaincants.’

Pour l’évaluation qualitative, des résultats statiques sont proposés dans le document (affichés directement ci-dessous), ainsi que des résultats mobiles disponibles sur le site du projet et la présentation vidéo YouTube:

Comparaison qualitative sur VOR-Eval à travers les cas d'occlusion, d'ombre, de lumière, de réflexion et de déformation. Les méthodes de retouche ont du mal à supprimer les effets en dehors du masque, tandis que les modèles de suppression laissent souvent des artefacts visibles. EffectErase supprime à la fois l'objet cible et ses effets associés de manière plus propre. Veuillez vous référer au document source pour une meilleure résolution, et au site du projet pour des exemples de vidéos.

Comparaison qualitative sur VOR-Eval à travers les cas d’occlusion, d’ombre, de lumière, de réflexion et de déformation. Les méthodes de retouche ont du mal à supprimer les effets en dehors du masque, tandis que les modèles de suppression laissent souvent des artefacts visibles. EffectErase supprime à la fois l’objet cible et ses effets associés de manière plus propre. Veuillez vous référer au document source pour une meilleure résolution, et au site du projet pour des exemples de vidéos.

Nous renvoyons également le lecteur à des exemples divers liés sur le site du projet, présentés ci-dessous, ainsi qu’à la vidéo YouTube officielle intégrée à la fin de cet article:

Cliquez pour jouer. Un exemple de comparaison du site du projet EffectErase. Veuillez vous référer au site pour une meilleure résolution (avec les caveats mentionnés) et pour plus d’exemples.

Les auteurs commentent:

‘Les méthodes de retouche de vidéo produisent souvent des artefacts dans les régions masquées et ne parviennent pas à supprimer complètement les effets secondaires causés par les objets supprimés. Les approches de suppression d’objets précédentes, telles que [ROSE] et [MinMax-Remover], suppriment bien les objets cibles mais ont encore du mal avec les effets secondaires, en particulier dans les scénarios d’occlusion, d’ombre, de lumière, de réflexion et de déformation.

‘En revanche, EffectErase supprime efficacement à la fois les objets cibles et leurs effets associés, aboutissant à des résultats de suppression propres, cohérents et de haute qualité.’

En conclusion, les chercheurs observent que leur méthode peut également être adaptée pour des tâches d’insertion plutôt que de suppression, sans nécessiter de formation supplémentaire:

Résultats d'insertion d'objets de vidéo. EffectErase insère des objets tout en préservant le contenu d'arrière-plan et en générant des effets d'objets induits tels que des ombres et des réflexions cohérents à travers les cadres.

Résultats d’insertion d’objets de vidéo. EffectErase insère des objets tout en préservant le contenu d’arrière-plan et en générant des effets d’objets induits tels que des ombres et des réflexions cohérents à travers les cadres.

Les résultats de la tâche d’insertion peuvent être vus dans la (vidéo YouTube spécifique) (également intégrée sans horodatage à la fin de l’article).

Conclusion

Un examen de projets similaires dans la littérature révèle que beaucoup espèrent encore que des modèles VFX polyvalents pourront éventuellement intégrer cette fonctionnalité dans un « toolkit » général conçu pour une gamme d’effets, plutôt que pour cette tâche spécifique.

Cependant, sur le principe du « jack of all trades », il semble raisonnable de supposer que des systèmes dédiés comme EffectErase continueront à maintenir une avance sur les approches plus générales; avec la réserve que l’écart pourrait éventuellement se contracter suffisamment pour que la différence ne vaille plus la peine de l’effort supplémentaire de formation d’un modèle distinct.

 

* On espérerait, avec les préoccupations croissantes autour des problèmes de provenance des droits de propriété intellectuelle, que toutes ces sources soient citées; mais si les matériaux disponibles du nouveau travail listent la source des modèles 3D, je n’ai pas pu localiser cette référence.

La référence fournie semble être un texte explicatif générique de 2013, sans détails sur le VAE spécifique.

†† Extrait du document, ceci est une description sémantiquement peu claire, puisque l’affinage et LoRA sont des processus différents avec des exigences très différentes.

Publié pour la première fois samedi 21 mars 2026 

Écrivain sur l'apprentissage automatique, spécialiste du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]