Angle d’Anderson

Meilleure intelligence artificielle générative de vidéos en réorganisant les cadres pendant l’entraînement

mm
Ajouter Unite.AI à vos sources préférées sur Google
Adobe Firefly, various prompts and edits.

Un nouvel article publié cette semaine sur Arxiv aborde un problème que quiconque ayant adopté les Hunyuan Video ou Wan 2.1 génératrices de vidéos IA aura rencontré jusqu’à présent: les anomalies temporelles, où le processus génératif tend à accélérer brusquement, confondre, omettre ou autrement gâcher des moments cruciaux dans une vidéo générée:

Cliquez pour jouer. Certaines des erreurs temporelles qui deviennent familières aux utilisateurs des nouvelles génératrices de vidéos, mises en évidence dans le nouvel article. À droite, l’effet atténuant de la nouvelle approche FluxFlow. Source: https://haroldchen19.github.io/FluxFlow/

La vidéo ci-dessus présente des extraits de vidéos de test exemples sur le site du projet (attention: plutôt chaotique) pour l’article. On peut voir plusieurs problèmes de plus en plus familiers étant remédiés par la méthode des auteurs (représentée à droite dans la vidéo), qui est essentiellement une technique de prétraitement de données applicable à n’importe quelle architecture de vidéo générative.

Dans le premier exemple, mettant en scène « deux enfants jouant avec un ballon », généré par CogVideoX, on voit (à gauche dans la vidéo de compilation ci-dessus et dans l’exemple spécifique ci-dessous) que la génération native saute rapidement à travers plusieurs micro-mouvements essentiels, accélérant l’activité des enfants à un « ton cartoon ». En revanche, la même base de données et la même méthode donnent de meilleurs résultats avec la nouvelle technique de prétraitement, appelée FluxFlow (à droite de l’image dans la vidéo ci-dessous):

Cliquez pour jouer.

Dans le deuxième exemple (en utilisant NOVA-0.6B) on voit que le mouvement central impliquant un chat a été corrompu ou sous-échantillonné à un stade de formation, au point que le système génératif devient « paralysé » et est incapable de faire bouger le sujet:

Cliquez pour jouer.

Ce syndrome, où le mouvement ou le sujet se « bloque », est l’un des problèmes les plus fréquemment signalés par les utilisateurs de HV et Wan, dans les différents groupes d’image et de synthèse de vidéos.

Certains de ces problèmes sont liés aux problèmes de légendage de vidéos dans la base de données source, que nous avons examinés cette semaine; mais les auteurs du nouvel article se concentrent sur les qualités temporelles des données de formation, et font un argument convaincant que résoudre les défis de ce point de vue peut donner des résultats utiles.

Comme mentionné dans l’article précédent sur le légendage de vidéos, certains sports sont particulièrement difficiles à distiller en moments clés, ce qui signifie que les événements critiques (tels qu’un dunk) n’obtiennent pas l’attention dont ils ont besoin au moment de la formation:

Cliquez pour jouer.

Dans l’exemple ci-dessus, le système génératif ne sait pas comment passer à l’étape de mouvement suivante et transite de manière illogique d’une pose à l’autre, en changeant l’attitude et la géométrie du joueur dans le processus.

Ces mouvements importants ont été perdus pendant la formation – mais tout aussi vulnérables sont les mouvements beaucoup plus petits mais cruciaux, tels que le battement des ailes d’un papillon:

Cliquez pour jouer.

Contrairement au dunk, le battement des ailes n’est pas un événement « rare » mais plutôt un événement persistant et monotone. Cependant, sa constance est perdue dans le processus d’échantillonnage, puisque le mouvement est si rapide qu’il est très difficile de l’établir temporellement.

Ces problèmes ne sont pas particulièrement nouveaux, mais ils reçoivent une attention accrue maintenant que des modèles de vidéos génératives puissants sont disponibles pour les enthousiastes pour une installation locale et une génération gratuite.

Les communautés Reddit et Discord ont initialement traité ces problèmes comme des « problèmes liés à l’utilisateur ». C’est une hypothèse compréhensible, puisque les systèmes en question sont très nouveaux et peu documentés. Par conséquent, divers experts ont suggéré diverses solutions (et pas toujours efficaces) pour certains des bugs documentés ici, telles que la modification des paramètres dans divers composants de divers types de workflows ComfyUI pour Hunyuan Video (HV) et Wan 2.1.

Dans certains cas, plutôt que de produire un mouvement rapide, HV et Wan produisent un mouvement lent. Les suggestions de Reddit et ChatGPT (qui utilise principalement Reddit) incluent la modification du nombre de cadres dans la génération demandée, ou la réduction radicale du taux de cadres*.

C’est tout cela; la vérité émergente est que nous ne connaissons pas encore la cause exacte ou le remède exact pour ces problèmes; clairement, tourmenter les paramètres de génération pour les contourner (en particulier lorsque cela dégrade la qualité de sortie, par exemple avec un taux de cadres trop bas) n’est qu’une solution temporaire, et il est bon de voir que la scène de recherche aborde ces problèmes émergents si rapidement.

Donc, outre notre examen de cette semaine sur la façon dont le légendage affecte la formation, regardons le nouvel article sur la régularisation temporelle et les améliorations qu’il pourrait apporter à la scène actuelle de la vidéo générative.

L’idée centrale est plutôt simple et légère, et n’est pas moins bonne pour cela; cependant, l’article est un peu gonflé pour atteindre les huit pages prescrites, et nous allons passer outre cette gonflement lorsque cela est nécessaire.

Le poisson dans la génération native du cadre VideoCrafter est statique, tandis que la version modifiée par FluxFlow capture les changements requis. Source: https://arxiv.org/pdf/2503.15417

Le poisson dans la génération native du cadre VideoCrafter est statique, tandis que la version modifiée par FluxFlow capture les changements requis. Source: https://arxiv.org/pdf/2503.15417

Le nouvel article est intitulé La régularisation temporelle rend votre générateur de vidéos plus fort, et provient de huit chercheurs de Everlyn AI, de l’Université des sciences et de la technologie de Hong Kong (HKUST), de l’Université de Floride centrale (UCF) et de l’Université de Hong Kong (HKU).

(au moment de la rédaction, il y a quelques problèmes avec le site Web du projet accompagnant l’article)

FluxFlow

L’idée centrale derrière FluxFlow, le nouveau schéma de pré-formation des auteurs, est de surmonter les problèmes répandus de flickering et d’incohérence temporelle en réorganisant les blocs et les groupes de blocs dans les ordres de trames temporelles lorsque les données sources sont exposées au processus de formation:

L'idée centrale derrière FluxFlow est de déplacer les blocs et les groupes de blocs dans des positions non temporelles et inattendues, sous forme d'augmentation de données.

L’idée centrale derrière FluxFlow est de déplacer les blocs et les groupes de blocs dans des positions non temporelles et inattendues, sous forme d’augmentation de données.

L’article explique:

‘[Les artefacts] proviennent d’une limitation fondamentale: malgré l’utilisation de grandes bases de données, les modèles actuels s’appuient souvent sur des modèles temporels simplifiés dans les données de formation (par exemple, des directions de marche fixes ou des transitions de trames répétitives) plutôt que d’apprendre des dynamiques temporelles diverses et plausibles.

‘Ce problème est encore exacerbé par le manque d’augmentation temporelle explicite pendant la formation, laissant les modèles sensibles à la suradaptation aux corrélations temporelles spurieuses (par exemple, « le cadre #5 doit suivre #4 ») plutôt que de généraliser à travers divers scénarios de mouvement.’

La plupart des modèles de génération de vidéos, expliquent les auteurs, empruntent encore trop à la synthèse d’images, en se concentrant sur la fidélité spatiale tout en ignorant largement l’axe temporel. Bien que des techniques telles que le recadrage, le retournement et la perturbation de couleur aient aidé à améliorer la qualité d’image statique, elles ne sont pas des solutions adéquates lorsqu’elles sont appliquées aux vidéos, où l’illusion de mouvement dépend de transitions cohérentes entre les trames.

Les problèmes résultants incluent des textures qui clignotent, des coupures abruptes entre les trames et des modèles de mouvement répétitifs ou trop simples.

Cliquez pour jouer.

L’article soutient que même si certains modèles – y compris Stable Video Diffusion et LlamaGen – compensent avec des architectures de plus en plus complexes ou des contraintes ingénieures, celles-ci se font au prix d’une augmentation de la puissance de calcul et de la flexibilité.

Puisque l’augmentation de données temporelles a déjà prouvé son utilité dans les tâches de compréhension de vidéos (dans des cadres tels que FineCliper, SeFAR et SVFormer) il est surprenant, affirment les auteurs, que cette tactique soit rarement appliquée dans un contexte génératif.

Comportement perturbateur

Les chercheurs affirment que de simples perturbations structurées dans l’ordre temporel pendant la formation aident les modèles à généraliser mieux à des mouvements réalistes et divers:

‘En formant sur des séquences désordonnées, le générateur apprend à récupérer des trajectoires plausibles, régularisant ainsi l’entropie temporelle. FLUXFLOW relie le fossé entre l’augmentation temporelle discriminative et générative, offrant une solution d’amélioration pour la génération de vidéos temporellement plausibles tout en améliorant la qualité globale.

‘Contrairement aux méthodes existantes qui introduisent des changements architecturaux ou s’appuient sur un post-traitement, FLUXFLOW opère directement au niveau des données, introduisant des perturbations temporelles contrôlées pendant la formation.’

Cliquez pour jouer.

Les perturbations au niveau des trames, déclarent les auteurs, introduisent des perturbations fines dans une séquence. Ce type de perturbation n’est pas sans rappeler l’augmentation de masquage, où des sections de données sont bloquées aléatoirement, pour empêcher le système de suradapter aux points de données, et encourage une meilleure généralisation.

Tests

Bien que l’idée centrale ne fasse pas un article complet, en raison de sa simplicité, il y a une section de test que nous pouvons examiner.

Les auteurs ont testé quatre requêtes relatives à l’amélioration de la qualité temporelle tout en maintenant la fidélité spatiale; la capacité à apprendre les dynamiques de mouvement/optique; le maintien de la qualité temporelle dans la génération extraterm; et la sensibilité aux hyperparamètres clés.

Les chercheurs ont appliqué FluxFlow à trois architectures génératives: U-Net-based, sous la forme de VideoCrafter2; DiT-based, sous la forme de CogVideoX-2B; et AR-based, sous la forme de NOVA-0.6B.

Pour une comparaison équitable, ils ont affiné les modèles de base des architectures avec FluxFlow comme phase de formation supplémentaire, pendant un époque, sur la base de données OpenVidHD-0.4M.

Les modèles ont été évalués par rapport à deux benchmarks populaires: UCF-101; et VBench.

Pour UCF, les métriques Fréchet Video Distance (FVD) et Inception Score (IS) ont été utilisées. Pour VBench, les chercheurs se sont concentrés sur la qualité temporelle, la qualité au niveau des trames et la qualité globale.

Évaluation quantitative initiale de FluxFlow-Frame.

Évaluation quantitative initiale de FluxFlow-Frame. “+ Original” indique la formation sans FLUXFLOW, tandis que “+ Num × 1” montre différentes configurations de FluxFlow-Frame. Les meilleurs résultats sont ombragés; les deuxièmes meilleurs sont soulignés pour chaque modèle.

En commentant ces résultats, les auteurs déclarent:

‘Les deux FLUXFLOW-FRAME et FLUXFLOW-BLOCK améliorent considérablement la qualité temporelle, comme en témoignent les métriques des tableaux 1, 2 (c’est-à-dire FVD, Sujet, Flicker, Mouvement et Dynamique) et les résultats qualitatifs de [l’image ci-dessous].

‘Par exemple, le mouvement de la voiture dérivante dans VC2, le chat poursuivant sa queue dans NOVA et le surfeur chevauchant une vague dans CVX deviennent nettement plus fluides avec FLUXFLOW. Importamment, ces améliorations temporelles sont réalisées sans sacrifier la fidélité spatiale, comme en témoignent les détails nets des éclaboussures d’eau, des traînées de fumée et des textures d’ondes, ainsi que les métriques de fidélité spatiale et globale.’

Ci-dessous, nous voyons des extraits des résultats qualitatifs auxquels les auteurs font référence (veuillez consulter l’article original pour les résultats complets et une meilleure résolution):

Extraits des résultats qualitatifs.

Extraits des résultats qualitatifs.

L’article suggère que même si les deux perturbations au niveau des trames et des blocs améliorent la qualité temporelle, les méthodes au niveau des trames ont tendance à performer mieux. Cela est attribué à leur granularité plus fine, qui permet des ajustements temporels plus précis. Les perturbations au niveau des blocs, en revanche, peuvent introduire du bruit en raison de modèles spatiaux et temporels étroitement liés dans les blocs, réduisant leur efficacité.

Conclusion

Cet article, ainsi que la collaboration de légendage de Bytedance-Tsinghua publiée cette semaine, m’a fait comprendre que les lacunes apparentes dans la nouvelle génération de modèles de vidéos génératives peuvent ne pas résulter d’erreurs d’utilisateur, de défaillances institutionnelles ou de limitations de financement, mais plutôt d’un focus de recherche qui a priorisé des défis plus urgents, tels que la cohérence et la consistance temporelles, plutôt que ces préoccupations mineures.

Jusqu’à récemment, les résultats des systèmes de vidéos génératives gratuits et téléchargeables étaient si compromis que aucun grand effort n’a émergé de la communauté des enthousiastes pour résoudre ces problèmes (ne serait-ce parce que les problèmes étaient fondamentaux et non trivialement résolus).

Maintenant que nous sommes si proches de l’ère prévue de la vidéo photoréaliste entièrement générée par IA, il est clair que les communautés de recherche et de loisirs s’intéressent de plus en plus à la résolution de ces problèmes restants; avec un peu de chance, ceux-ci ne sont pas des obstacles insurmontables.

 

* Le taux de trames natif de Wan est d’un maigre 16fps, et en réponse à mes propres problèmes, je note que les forums ont suggéré de réduire le taux de trames à seulement 12fps, puis d’utiliser FlowFrames ou d’autres systèmes de re-flux basés sur l’IA pour interpoler les intervalles entre un nombre si faible de trames.

Publié pour la première fois vendredi 21 mars 2025

Écrivain sur l'apprentissage automatique, spécialiste du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]