Modèles et plateformes d’IA

Combler le « vide » dans la vidéo générative

mm
Ajouter Unite.AI à vos sources préférées sur Google
Images taken from the FCVG paper and project site, https://arxiv.org/pdf/2412.11755 and https://fcvg-inbetween.github.io/

De nouvelles recherches menées en Chine proposent une méthode améliorée pour interpoler l’espace entre deux images vidéo temporellement distantes – l’un des défis les plus cruciaux dans la course actuelle vers le réalisme pour la vidéo générative par intelligence artificielle, ainsi que pour la compression de codec vidéo.

Dans la vidéo ci-dessous, on voit dans la colonne la plus à gauche un « début » (en haut à gauche) et une « fin » (en bas à gauche). La tâche que les systèmes concurrents doivent effectuer consiste à deviner comment le sujet dans les deux images passerait de la frame A à la frame B. En animation, ce processus est appelé tweening, et remonte à l’époque du cinéma muet.

Cliquez pour jouer. Dans la première colonne, on voit les cadres de départ et d’arrivée proposés. Dans la colonne du milieu et en haut de la troisième colonne (à droite), on voit trois approches antérieures de ce défi. En bas à droite, on voit que la nouvelle méthode obtient un résultat beaucoup plus convaincant en fournissant les cadres intermédiaires. Source: https://fcvg-inbetween.github.io/

La nouvelle méthode proposée par les chercheurs chinois s’appelle Génération de vidéo par conditions cadres-à-cadres (FCVG), et ses résultats peuvent être vus dans le coin inférieur droit de la vidéo ci-dessus, fournissant une transition lisse et logique d’une image fixe à l’autre.

En revanche, l’un des cadres les plus célèbres pour l’interpolation vidéo, le projet Frame Interpolation for Large Motion (FILM) de Google, a du mal, comme de nombreux autres, à interpréter de grands mouvements.

Les deux autres cadres concurrents visualisés dans la vidéo, Time Reversal Fusion (TRF) et Génération de vidéo intermédiaire (GI), fournissent une interprétation moins biaisée, mais ont créé des mouvements de danse frénétiques et même comiques, ni l’un ni l’autre ne respectant la logique implicite des deux cadres fournis.

Cliquez pour jouer. Deux solutions imparfaites au problème de tweening. À gauche, FILM traite les deux cadres comme de simples cibles de morphing. À droite, TRF sait qu’une forme de danse doit être insérée, mais il en vient avec une solution impraticable qui démontre des anomalies anatomiques.

En haut à gauche, on peut examiner de plus près la façon dont FILM aborde le problème. Bien que FILM ait été conçu pour être en mesure de gérer de grands mouvements, contrairement aux approches antérieures basées sur le flux optique, il manque encore d’une compréhension sémantique de ce qui devrait se passer entre les deux cadres clés, et se contente simplement d’effectuer un morphing entre les cadres à la manière des années 80 et 90. FILM n’a pas d’architecture sémantique, telle qu’un modèle de diffusion latent comme Stable Diffusion, pour aider à créer un pont approprié entre les cadres.

À droite, dans la vidéo ci-dessus, on voit l’effort de TRF, où Stable Video Diffusion (SVD) est utilisé pour deviner de manière plus intelligente comment un mouvement de danse approprié pour les deux cadres fournis par l’utilisateur pourrait être – mais il a fait une approximation audacieuse et peu plausible.

FCVG, visible ci-dessous, fait un travail plus crédible pour deviner le mouvement et le contenu entre les deux cadres:

Cliquez pour jouer. FCVG améliore les approches antérieures, mais est loin d’être parfait.

Il y a encore des artefacts, tels que des morphings non désirés des mains et de l’identité faciale, mais cette version est superficiellement la plus plausible – et toute amélioration de l’état de l’art doit être considérée par rapport à la difficulté énorme que la tâche propose; et l’obstacle important que le défi présente pour l’avenir de la vidéo générée par intelligence artificielle.

Pourquoi l’interpolation est importante

Comme nous l’avons signalé précédemment, la capacité à remplir de manière plausible le contenu vidéo entre deux cadres fournis par l’utilisateur est l’un des meilleurs moyens de maintenir la cohérence temporelle dans la vidéo générative, puisque deux photos réelles et consécutives de la même personne contiendront naturellement des éléments cohérents tels que les vêtements, les cheveux et l’environnement.

Quand seul un seul cadre de départ est utilisé, la fenêtre d’attention limitée d’un système génératif, qui prend souvent seulement en compte les cadres voisins, tendra à faire évoluer progressivement les aspects du sujet, jusqu’à ce qu’un homme devienne un autre homme (ou une femme), ou prouve avoir des vêtements « morphants » – parmi de nombreuses autres distractions qui sont couramment générées dans les systèmes T2V open source, et dans la plupart des solutions payantes, telles que Kling:

Cliquez pour jouer. En alimentant les deux cadres source réels du nouveau document dans Kling, avec la invite « Un homme qui danse sur un toit », n’a pas abouti à une solution idéale. Bien que Kling 1.6 était disponible au moment de la création, V1.5 est la dernière à prendre en charge les cadres de départ et de fin de l’utilisateur. Source: https://klingai.com/

Le problème est-il déjà résolu?

En revanche, certains systèmes commerciaux, fermés et propriétaires semblent faire mieux face au problème – notamment RunwayML, qui a pu créer des interpolations très plausibles des deux cadres source:

Cliquez pour jouer. L’interpolation basée sur la diffusion de RunwayML est très efficace. Source: https://app.runwayml.com/

En répétant l’exercice, RunwayML a produit un deuxième résultat tout aussi crédible:

Cliquez pour jouer. La deuxième passe de la séquence RunwayML.

Un problème ici est que nous ne pouvons rien apprendre sur les défis impliqués, ni faire progresser l’état de l’art open source, à partir d’un système propriétaire. Nous ne pouvons pas savoir si ce rendu supérieur a été réalisé par des approches architecturales uniques, par des données (ou des méthodes de curation de données telles que le filtrage et l’annotation), ou une combinaison de ces et d’autres innovations de recherche possibles.

Deuxièmement, les petites entreprises, telles que les sociétés d’effets visuels, ne peuvent pas à long terme dépendre de services d’API B2B qui pourraient potentiellement miner leur planification logistique avec une seule augmentation de prix – en particulier si un service devait dominer le marché, et serait donc plus enclin à augmenter les prix.

Quand les droits sont faux

Beaucoup plus important, si un modèle commercial performant est formé sur des données non autorisées, comme semble être le cas avec RunwayML, toute entreprise utilisant de tels services pourrait risquer une exposition juridique en aval.

Étant donné que les lois (et certains procès) durent plus longtemps que les présidents, et que le marché américain crucial est parmi les plus litigieux du monde, la tendance actuelle à une surveillance législative accrue pour les données de formation d’IA semble susceptible de survivre à la « légèreté » du prochain mandat présidentiel de Donald Trump.

Par conséquent, le secteur de la recherche en vision par ordinateur devra aborder ce problème de manière difficile, afin que les solutions émergentes puissent durer à long terme.

FCVG

La nouvelle méthode de Chine est présentée dans un document intitulé Génération de vidéo intermédiaire par conditions cadres-à-cadres, et provient de cinq chercheurs issus de l’Institut de technologie de Harbin et de l’Université de Tianjin.

FCVG résout le problème d’ambiguïté dans la tâche d’interpolation en utilisant des conditions cadres-à-cadres, ainsi qu’un cadre qui délimite les bords dans les cadres de départ et d’arrivée fournis par l’utilisateur, ce qui aide le processus à conserver une piste plus cohérente des transitions entre les cadres individuels, ainsi que l’effet global.

La conditionnement cadre-à-cadre implique de diviser la création de cadres intermédiaires en sous-tâches, plutôt que d’essayer de remplir un grand vide sémantique entre deux cadres (et plus la sortie vidéo demandée est longue, plus grande est la distance sémantique).

Dans le graphique ci-dessous, issu du document, les auteurs comparent la méthode de fusion de retournement de temps (TRF) à la leur. TRF crée deux chemins de génération de vidéo à l’aide d’un modèle d’image à vidéo pré-entraîné (SVD). L’un est un chemin « avant » conditionné sur le cadre de départ, et l’autre un chemin « arrière » conditionné sur le cadre d’arrivée. Les deux chemins commencent à partir du même bruit aléatoire. C’est illustré à gauche de l’image ci-dessous:

Comparaison des approches antérieures à FCVG. Source: https://arxiv.org/pdf/2412.11755

Comparaison des approches antérieures à FCVG. Source: https://arxiv.org/pdf/2412.11755

Les auteurs affirment que FCVG est une amélioration des méthodes de retournement de temps parce qu’il réduit l’ambiguïté dans la génération de vidéo, en donnant à chaque cadre sa propre condition explicite, conduisant à une sortie plus stable et plus cohérente.

Les méthodes de retournement de temps telles que TRF, affirme le document, peuvent conduire à l’ambiguïté, car les chemins de génération avant et arrière peuvent diverger, provoquant des désalignements ou des incohérences. FCVG aborde ce problème en utilisant des conditions cadres-à-cadres dérivées de lignes correspondantes entre les cadres de départ et d’arrivée (en bas à droite de l’image ci-dessus), qui guident le processus de génération.

Cliquez pour jouer. Une autre comparaison de la page du projet FCVG.

Le retournement de temps permet d’utiliser des modèles de génération de vidéo pré-entraînés pour l’interpolation, mais présente certains inconvénients. Le mouvement généré par les modèles I2V est divers plutôt que stable. Alors que cela est utile pour les tâches d’image à vidéo (I2V) pures, cela crée de l’ambiguïté et conduit à des chemins de vidéo mal alignés ou incohérents.

Le retournement de temps nécessite également un réglage fastidieux des hyperparamètres, tels que la fréquence d’images pour chaque vidéo générée. De plus, certaines des techniques impliquées dans le retournement de temps pour réduire l’ambiguïté ralentissent considérablement l’inférence, augmentant les temps de traitement.

Méthode

Les auteurs observent que si l’un de ces problèmes (diversité vs. stabilité) peut être résolu, tous les autres problèmes suivants sont susceptibles de se résoudre d’eux-mêmes. Cela a été tenté dans des offres antérieures telles que la GI mentionnée ci-dessus, et également ViBiDSampler.

Le document indique:

‘Cependant, il existe encore une stochasticité considérable entre ces chemins, ce qui limite l’efficacité de ces méthodes pour gérer des scénarios impliquant de grands mouvements, tels que des changements rapides dans les poses humaines. L’ambiguïté dans le chemin d’interpolation provient principalement du manque de conditions pour les cadres intermédiaires, car deux images d’entrée ne fournissent des conditions que pour les cadres de départ et d’arrivée.

‘Par conséquent, nous suggérons d’offrir une condition explicite pour chaque cadre, ce qui atténue considérablement l’ambiguïté du chemin d’interpolation.’

On peut voir les concepts fondamentaux de FCVG à l’œuvre dans le schéma ci-dessous. FCVG génère une séquence de cadres vidéo qui commencent et se terminent de manière cohérente avec deux cadres d’entrée. Cela garantit que les cadres sont temporellement stables en fournissant des conditions spécifiques au cadre pour le processus de génération de vidéo.

Schéma pour l'inférence de FCVG.

Schéma pour l’inférence de FCVG.

Dans cette réflexion de l’approche de retournement de temps, la méthode combine les informations des deux directions avant et arrière, les mélangeant pour créer des transitions lisses. À travers un processus itératif, le modèle affine progressivement les entrées bruyantes jusqu’à ce que l’ensemble final de cadres intermédiaires soit produit.

La prochaine étape implique l’utilisation du modèle de correspondance de lignes pré-entraîné GlueStick, qui crée des correspondances entre les deux cadres de départ et d’arrivée calculés, avec l’utilisation facultative de poses squelettiques pour guider le modèle, via le modèle de diffusion de vidéo stable.

GlueStick dérive des lignes de formes interprétées. Ces lignes fournissent des ancres de correspondance entre les cadres de départ et d'arrivée dans FCVG*.

GlueStick dérive des lignes de formes interprétées. Ces lignes fournissent des ancres de correspondance entre les cadres de départ et d’arrivée dans FCVG*.

Les auteurs notent:

‘Nous avons constaté empiriquement que l’interpolation linéaire est suffisante pour la plupart des cas pour garantir la stabilité temporelle dans les vidéos intermédiaires, et notre méthode permet aux utilisateurs de spécifier des chemins d’interpolation non linéaires pour générer des vidéos souhaitées.’

Le flux de travail pour établir les conditions cadres-à-cadres avant et arrière. On peut voir les couleurs correspondantes qui maintiennent le contenu cohérent à mesure que l'animation se développe.

Le flux de travail pour établir les conditions cadres-à-cadres avant et arrière. On peut voir les couleurs correspondantes qui maintiennent le contenu cohérent à mesure que l’animation se développe.

Pour injecter les conditions cadres-à-cadres obtenues dans SVD, FCVG utilise la méthode développée pour l’initiative ControlNeXt 2024. Dans ce processus, les conditions de contrôle sont initialement codées par plusieurs blocs ResNet , avant une normalisation croisée entre les branches de contrôle et SVD du flux de travail.

Un petit ensemble de vidéos est utilisé pour affiner le modèle SVD, avec la plupart des paramètres du modèle figés.

‘Les limitations mentionnées ci-dessus ont été largement résolues dans FCVG: (i) En spécifiant explicitement la condition pour chaque cadre, l’ambiguïté entre les chemins avant et arrière est considérablement atténuée; (ii) Seule une [paramètre réglable est introduite], tandis que les hyperparamètres dans SVD sont conservés par défaut, ce qui donne des résultats favorables dans la plupart des scénarios; (iii) Une fusion moyenne simple, sans réinjection de bruit, est suffisante dans FCVG, et les étapes d’inférence peuvent être réduites de 50 % par rapport à [GI].’

Schéma général pour injecter les conditions cadres-à-cadres dans la diffusion de vidéo stable pour FCVG.

Schéma général pour injecter les conditions cadres-à-cadres dans la diffusion de vidéo stable pour FCVG.

Données et tests

Pour tester le système, les chercheurs ont créé un ensemble de données présentant des scènes diverses, notamment des environnements extérieurs, des poses humaines et des lieux intérieurs, y compris des mouvements tels que les mouvements de caméra, les actions de danse et les expressions faciales, entre autres. Les 524 extraits choisis provenaient des ensembles de données DAVIS et RealEstate10k. Cette collection a été complétée par des vidéos à haute fréquence d’images obtenues à partir de Pexels. L’ensemble a été divisé 4:1 entre l’affinage et les tests.

Les métriques utilisées étaient Learned Perceptual Similarity Metrics (LPIPS); Fréchet Inception Distance (FID); Fréchet Video Distance (FVD); VBench; et Fréchet Video Motion Distance.

Les auteurs notent que aucune de ces métriques n’est bien adaptée pour estimer la stabilité temporelle, et nous renvoient aux vidéos sur la page du projet FCVG.

En plus de l’utilisation de GlueStick pour la correspondance de lignes, DWPose a été utilisé pour estimer les poses humaines.

L’affinage a eu lieu pendant 70 000 itérations sous l’optimiseur AdamW sur une GPU NVIDIA A800, à un taux d’apprentissage de 1×10-6, avec des cadres découpés en patches de 512×320.

Les cadres concurrents antérieurs testés étaient FILM, GI, TRF et DynamiCrafter.

Pour l’évaluation quantitative, les écarts de cadres abordés allaient de 12 à 23.

Résultats quantitatifs par rapport aux cadres antérieurs.

Résultats quantitatifs par rapport aux cadres antérieurs.

Concernant ces résultats, le document observe:

‘Notre méthode obtient les meilleures performances parmi les quatre approches génératives sur l’ensemble des métriques. En ce qui concerne la comparaison LPIPS avec FILM, notre FCVG est légèrement inférieur, tout en démontrant une performance supérieure dans d’autres métriques. Compte tenu de l’absence d’informations temporelles dans LPIPS, il peut être plus approprié de donner la priorité à d’autres métriques et à l’observation visuelle.

‘De plus, en comparant les résultats sous différents écarts de cadres, FILM peut fonctionner bien lorsque l’écart est faible, tandis que les méthodes génératives sont plus adaptées pour les grands écarts. Parmi ces méthodes génératives, notre FCVG montre une supériorité significative en raison de ses conditions cadres-à-cadres explicites.’

Pour les tests qualitatifs, les auteurs ont produit les vidéos visibles sur la page du projet (certaines sont intégrées dans cet article), ainsi que des résultats statiques et animés dans le document PDF,

Exemples de résultats statiques du document. Veuillez vous référer au PDF source pour une meilleure résolution, et soyez conscient que le PDF contient des animations qui peuvent être jouées dans des applications qui prennent en charge cette fonctionnalité.

Exemples de résultats statiques du document. Veuillez vous référer au PDF source pour une meilleure résolution, et soyez conscient que le PDF contient des animations qui peuvent être jouées dans des applications qui prennent en charge cette fonctionnalité.

Les auteurs commentent:

‘Alors que FILM produit des résultats d’interpolation lisse pour les scénarios de mouvement faible, il a du mal avec les mouvements à grande échelle en raison des limitations inhérentes au flux optique, ce qui entraîne des artefacts tels que des mouvements de fond et de main (dans le premier cas).

‘Les modèles génératifs comme TRF et GI souffrent d’ambiguïtés dans les chemins de fusion, conduisant à des mouvements intermédiaires instables, particulièrement évidents dans des scènes complexes impliquant des mouvements humains et d’objets.

‘En revanche, notre méthode fournit systématiquement des résultats satisfaisants dans divers scénarios.’Même lorsque des occlusions significatives sont présentes (dans le deuxième cas et le sixième cas), notre méthode peut toujours capturer des mouvements raisonnables. De plus, notre approche montre une robustesse pour les actions humaines complexes (dans le dernier cas).’

Les auteurs ont également constaté que FCVG se généralise de manière inhabituelle aux vidéos de style animation:

Cliquez pour jouer. FCVG produit des résultats très convaincants pour l’animation de style cartoon.

Conclusion

FCVG représente au moins une amélioration incrémentale de l’état de l’art dans l’interpolation de cadres dans un contexte non propriétaire. Les auteurs ont rendu le code de leur travail disponible sur GitHub, bien que l’ensemble de données associé n’ait pas été publié au moment de la rédaction.

Si les solutions commerciales propriétaires dépassent les efforts open source en utilisant des données non autorisées issues du web, il semble y avoir un avenir limité ou nul pour une telle approche, du moins pour une utilisation commerciale; les risques sont simplement trop grands.

Par conséquent, même si la scène open source est en retard par rapport à la démonstration impressionnante des leaders du marché actuel, c’est, de manière controversée, la tortue qui pourrait battre le lièvre à la ligne d’arrivée.

 

* Source: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf

Exige Acrobat Reader, Okular, ou tout autre lecteur de PDF capable de reproduire les animations PDF intégrées.

 

Publié pour la première fois vendredi, 20 décembre 2024

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai