Angle d’Anderson

Microsoft propose GODIVA, un cadre d’apprentissage automatique Texte-Vidéo

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une collaboration entre Microsoft Research Asia et l’Université Duke a abouti à un système d’apprentissage automatique capable de générer des vidéos à partir d’un texte de prompte, sans utiliser de réseaux antagonistes génératifs (GAN).

Le projet est intitulé GODIVA (Génération de vidéos ouvertes à partir de descriptions naturelles), et s’appuie sur certaines des approches utilisées par le système de synthèse d’images DALL-E d’OpenAI, révélé plus tôt cette année.

Résultats préliminaires de GODIVA, avec des images issues de vidéos créées à partir de deux invites. Les deux premiers exemples ont été générés à partir de l'invite 'Jouer au golf sur l'herbe', et le troisième en bas à partir de l'invite 'Un match de baseball est joué'. Source: https://arxiv.org/pdf/2104.14806.pdf

Résultats préliminaires de GODIVA, avec des images issues de vidéos créées à partir de deux invites. Les deux premiers exemples ont été générés à partir de l’invite ‘Jouer au golf sur l’herbe’, et le troisième en bas à partir de l’invite ‘Un match de baseball est joué’. Source: https://arxiv.org/pdf/2104.14806.pdf

GODIVA utilise le modèle Vector Quantised-Variational AutoEncoder (VQ-VAE) présenté pour la première fois par des chercheurs du projet DeepMind de Google en 2018, et qui constitue également un élément essentiel des capacités de transformation de DALL-E.

Architecture du modèle VQ-VAE, avec un espace d'intégration à droite et un encodeur/décodeur partageant un espace dimensionnel pour réduire les pertes lors de la reconstruction. Source: https://arxiv.org/pdf/1711.00937.pdf

Architecture du modèle VQ-VAE, avec un espace d’intégration à droite et un encodeur/décodeur partageant un espace dimensionnel pour réduire les pertes lors de la reconstruction. Source: https://arxiv.org/pdf/1711.00937.pdf

VQ-VAE a été utilisé dans plusieurs projets pour générer des vidéos prédites, où l’utilisateur fournit un certain nombre d’images et demande au système de générer des images supplémentaires:

Travail précédent: VQ-VAE infère des images à partir de matériel source très limité. Source: Matériel supplémentaire à https://openreview.net/forum?id=bBDlTR5eDIX

Travail précédent: VQ-VAE infère des images à partir de matériel source très limité. Source: Matériel supplémentaire à https://openreview.net/forum?id=bBDlTR5eDIX

Cependant, les auteurs de l’article affirment que GODIVA représente la première mise en œuvre pure de texte-vidéo (T2V) qui utilise VQ-VAE plutôt que les résultats plus erratiques obtenus par les projets précédents utilisant des GAN.

Points de départ dans le texte-vidéo

Bien que la soumission soit peu détaillée sur les critères de création des images initiales, GODIVA semble invoquer des images de départ à partir de nulle part avant de les extrapoler en images vidéo à basse résolution.

Représentation colonnaire du système d'attention épars tridimensionnel qui alimente GODIVA pour les tâches de texte-vidéo. L'autorégression est prédite à travers quatre facteurs: texte d'invite, positionnement relatif avec le cadre précédent (semblable à NVIDIA's SPADE et d'autres méthodes qui s'appuient sur ou évoluent au-delà des approches de flux optique), mêmes lignes sur le même cadre, et mêmes colonnes sur la même colonne.

Représentation colonnaire du système d’attention épars tridimensionnel qui alimente GODIVA pour les tâches de texte-vidéo. L’autorégression est prédite à travers quatre facteurs: texte d’invite, positionnement relatif avec le cadre précédent (semblable à NVIDIA’s SPADE et d’autres méthodes qui s’appuient sur ou évoluent au-delà des approches de flux optique), mêmes lignes sur le même cadre, et mêmes colonnes sur la même colonne.

En fait, l’origine vient des étiquettes dans les données utilisées: GODIVA a été pré-entraîné sur le jeu de données Howto100M, composé de 136 millions de clips vidéo avec légendes provenant de YouTube sur 15 ans, et présentant 23 000 activités étiquetées. Néanmoins, chaque activité possible est présente dans un très grand nombre de clips, augmentant avec la généralisation (c’est-à-dire que ‘Animaux et animaux de compagnie’ compte 3,5 millions de clips, tandis que ‘chiens’ compte 762 000 clips), et il y a donc encore un grand choix de points de départ possibles.

Le modèle a été évalué sur le jeu de données MSR Video to Text (MSR-VTT) de Microsoft. En tant que tests supplémentaires de l’architecture, GODIVA a été entraîné à partir de zéro sur le jeu de données Moving Mnist et le jeu de données Double Moving Mnist, tous deux dérivés de la base de données MNIST originale, une collaboration entre Microsoft, Google et l’Institut des sciences mathématiques de Courant à NYU.

Évaluation des cadres dans la synthèse vidéo continue

Conformément à l’IRC-GAN de l’Université de Pékin, GODIVA ajoute quatre vérifications colonnaires supplémentaires à la méthode MNIST originale, qui évaluait les cadres précédents et suivants en déplaçant vers le haut et vers le bas, puis vers la gauche et vers la droite. IRC-GAN et GODIVA considèrent également les cadres en déplaçant l’attention vers la gauche et vers la droite, vers la droite et vers la gauche, vers le haut et vers le bas, et vers le bas et vers le haut.

Images générées supplémentaires à partir de GODIVA.

Images générées supplémentaires à partir de GODIVA.

Évaluation de la qualité de la vidéo et de la fidélité à l’invite

Pour comprendre à quel point la génération d’images a réussi, les chercheurs ont utilisé deux métriques: l’une basée sur la similarité CLIP, et une nouvelle métrique de correspondance relative (RM).

Le cadre CLIP d’OpenAI est capable de correspondance de zéro coup d’images et de texte, ainsi que de faciliter la synthèse d’images en inversant ce modèle. Les chercheurs ont divisé le score CLIP dérivé par la similarité calculée entre l’invite de texte et la vidéo de référence afin d’obtenir un score RM. Dans un tour de notation séparé, la sortie a été évaluée par 200 personnes et les résultats comparés aux scores programmatiques.

Enfin, GODIVA a été testé contre deux cadres précédents, TFGAN et la collaboration de 2017 entre Duke et NEC, T2V.

T2V-vs-TFGAN-vs-GODIVA

TFGAN peut produire 128 pixels carrés en comparaison avec la sortie 64×64 qui contraint GODIVA et T2V dans les exemples ci-dessus, mais les chercheurs notent non seulement que GODIVA produit des mouvements plus audacieux et plus engagés, mais générera également des changements de scène sans invite spécifique, et n’hésite pas à générer des plans rapprochés.

Dans des exécutions ultérieures, GODIVA génère également une sortie 128x128px, avec des changements de point de vue:

godiva_baseball_128px

Dans la métrique RM propre au projet, GODIVA est capable d’atteindre des scores approchant 100 % en termes d’authenticité (qualité de la vidéo) et de fidélité (à quel point le contenu généré correspond à l’invite de texte).

Les chercheurs concèdent cependant que le développement de métriques de CLIP basées sur la vidéo serait une addition bienvenue dans ce domaine de synthèse d’images, car cela fournirait un terrain d’entente pour évaluer la qualité des résultats sans recourir au sur-ajustement et au manque de généralisation qui a de plus en plus été critiqué en ce qui concerne les ‘défis standard’ de la vision par ordinateur au cours des dix dernières années.

Ils observent également que la génération de vidéos plus longues sera une considération logistique dans le développement ultérieur du système, car même 10 cadres de sortie 64x64px nécessitent 2560 jetons visuels, une inflation de pipeline qui risque de devenir coûteuse et ingérable rather rapidement.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai