Angle d’Anderson
Réévaluation de la formation de l’IA vidéo avec des données axées sur l’utilisateur

Le type de contenu que les utilisateurs pourraient vouloir créer en utilisant un modèle génératif tel que Flux ou Hunyuan Video n’est pas toujours facilement disponible, même si la demande de contenu est relativement générique, et on pourrait penser que le générateur pourrait gérer cela.
Un exemple, illustré dans un nouvel article que nous allons examiner dans cet article, note que le modèle OpenAI Sora de plus en plus éclipsé a des difficultés à rendre un luciole anatomiquement correct, en utilisant l’invite ‘Un luciole brille sur une feuille de gazon dans une nuit d’été sereine’:

OpenAI’s Sora a une compréhension légèrement défectueuse de l’anatomie du luciole. Source: https://arxiv.org/pdf/2503.01739
Depuis que je prends rarement les revendications de recherche à leur valeur nominale, j’ai testé la même invite sur Sora aujourd’hui et j’ai obtenu un résultat légèrement meilleur. Cependant, Sora a encore échoué à rendre la lumière correctement – au lieu d’illuminer l’extrémité de la queue du luciole, où la bioluminescence se produit, il a déplacé la lumière près des pieds de l’insecte:

Mon propre test de l’invite des chercheurs dans Sora produit un résultat qui montre que Sora ne comprend pas d’où vient la lumière d’un luciole.
Ironiquement, le Adobe Firefly moteur de diffusion générative, formé sur les photos et vidéos protégées par copyright de l’entreprise, n’a réussi qu’un taux de réussite de 1 sur 3 dans ce sens, lorsque j’ai essayé la même invite dans la fonction d’IA générative de Photoshop:

Seule la dernière des trois générations proposées de l’invite des chercheurs produit une lumière dans Adobe Firefly (mars 2025), bien que la lumière soit située dans la partie correcte de l’anatomie de l’insecte.
Cet exemple a été mis en évidence par les chercheurs du nouvel article pour illustrer que la distribution, l’accent et la couverture dans les ensembles de données de formation utilisés pour informer les modèles de base populaires peuvent ne pas correspondre aux besoins des utilisateurs, même si l’utilisateur ne demande rien de particulièrement difficile – un sujet qui soulève les défis liés à l’adaptation des ensembles de données de formation hyperscale à leurs résultats les plus efficaces en tant que modèles génératifs.
Les auteurs déclarent:
‘[Sora] échoue à capturer le concept d’un luciole lumineux tout en générant avec succès de l’herbe et une nuit [d’été]. Du point de vue des données, nous déduisons que c’est principalement parce que [Sora] n’a pas été formé sur des sujets liés aux lucioles, tandis qu’il a été formé sur l’herbe et la nuit. De plus, si [Sora] avait vu la vidéo montrée dans [l’image ci-dessus], il comprendrait à quoi ressemblerait un luciole lumineux.’
Ils introduisent un nouvel ensemble de données établi et suggèrent que leur méthodologie pourrait être affinée dans les travaux futurs pour créer des collections de données qui correspondent mieux aux attentes des utilisateurs que de nombreux modèles existants.
Données pour les gens
En substance, leur proposition pose une approche de curation de données qui se situe entre les données personnalisées pour un type de modèle tel qu’un LoRA (et cette approche est loin d’être suffisamment générale pour une utilisation générale); et les collections à grande échelle et relativement indiscrètes (telles que l’ensemble de données LAION qui alimente la diffusion stable) qui ne sont pas spécifiquement alignées sur un scénario d’utilisation finale.
La nouvelle approche, à la fois en tant que méthodologie et nouvel ensemble de données, est (plutôt tortueusement) nommée Users’ FOcus in text-to-video, ou VideoUFO. L’ensemble de données VideoUFO comprend 1,9 million de clips vidéo couvrant 1 291 sujets axés sur l’utilisateur. Les sujets eux-mêmes ont été élaborés à partir d’un ensemble de données vidéo existant et analysés à l’aide de divers modèles de langage et de techniques de traitement du langage naturel (NLP):

Exemples de sujets distillés présentés dans le nouvel article.
L’ensemble de données VideoUFO présente un grand volume de vidéos nouvelles provenant de YouTube – « nouvelles » en ce sens que les vidéos en question ne figurent pas dans les ensembles de données vidéo actuellement populaires dans la littérature, et donc dans de nombreux sous-ensembles qui ont été créés à partir de ceux-ci (et de nombreuses vidéos ont en fait été téléchargées après la création des anciens ensembles de données mentionnés dans l’article).
En fait, les auteurs affirment qu’il n’y a qu’un chevauchement de 0,29 % avec les ensembles de données vidéo existants – une démonstration impressionnante de nouveauté.
L’une des raisons pour lesquelles cela pourrait être le cas est que les auteurs n’acceptaient que les vidéos YouTube avec une licence Creative Commons qui seraient moins susceptibles de gêner les utilisateurs plus tard: il est possible que cette catégorie de vidéos ait été moins prioritaire dans les balayages précédents de YouTube et d’autres plateformes à grande échelle.
Deuxièmement, les vidéos ont été demandées sur la base d’une estimation préalable des besoins des utilisateurs (voir image ci-dessus), et non pas balayées de manière indiscrète. Ces deux facteurs combinés pourraient conduire à une collection aussi nouvelle. De plus, les chercheurs ont vérifié les ID YouTube des vidéos contributives (c’est-à-dire les vidéos qui pourraient plus tard être divisées et réimaginées pour la collection VideoUFO) par rapport à ceux présentés dans les ensembles de données existants, ce qui donne du crédit à l’affirmation.
Bien que tout ne soit pas tout à fait convaincant dans le nouvel article, c’est une lecture intéressante qui met en évidence la mesure dans laquelle nous sommes encore rather à la merci de distributions inégales dans les ensembles de données, en termes d’obstacles que la scène de recherche est souvent confrontée dans la curation des ensembles de données.
Le nouvel article est intitulé VideoUFO: Un ensemble de données à l’échelle du million d’utilisateurs pour la génération de texte à vidéo, et provient de deux chercheurs, respectivement de l’Université de technologie de Sydney en Australie et de l’Université de Zhejiang en Chine.

Exemples sélectionnés de l’ensemble de données final obtenu.
Un ‘acheteur personnel’ pour les données d’IA
Le sujet et les concepts présentés dans la somme totale des images et des vidéos Internet ne reflètent pas nécessairement ce que l’utilisateur final moyen peut finir par demander à un système génératif; même lorsque le contenu et la demande font tendent à se croiser (comme la pornographie, qui est abondamment disponible sur Internet et d’un grand intérêt pour de nombreux utilisateurs de l’IA), cela peut ne pas correspondre à l’intention et aux normes des développeurs pour un nouveau système génératif.
Outre le grand volume de contenu NSFW téléchargé quotidiennement, une quantité disproportionnée de matériel disponible sur le net est susceptible de provenir d’annonceurs et de ceux qui tentent de manipuler le référencement. L’intérêt commercial de ce type rend la distribution du sujet loin d’être impartiale; pire, il est difficile de développer des systèmes de filtrage basés sur l’IA qui puissent faire face au problème, car les algorithmes et les modèles développés à partir de données hyperscale significatives peuvent en eux-mêmes refléter les tendances et les priorités des données sources.
Par conséquent, les auteurs du nouvel article ont abordé le problème en inversant la proposition, en déterminant ce que les utilisateurs sont susceptibles de vouloir, et en obtenant des vidéos qui correspondent à ces besoins.
En surface, cette approche semble tout aussi susceptible de déclencher une course aux armements sémantique vers le bas que d’atteindre une neutralité équilibrée, de type Wikipédia. Calibrer la curation des données autour de la demande des utilisateurs risque d’amplifier les préférences du plus petit dénominateur commun tout en marginalisant les utilisateurs de niche, car les intérêts de la majorité porteront inévitablement plus de poids.
Cependant, examinons comment l’article aborde le défi.
Distiller des concepts avec discrétion
Les chercheurs ont utilisé l’ensemble de données VidProM 2024 comme source pour l’analyse de sujet qui informerait plus tard le projet de web-scraping.
Cet ensemble de données a été choisi, déclarent les auteurs, car c’est le seul ensemble de données public de plus d’un million ‘écrit par de vrais utilisateurs’ – et il convient de noter que cet ensemble de données a été lui-même établi par les deux auteurs du nouvel article.
L’article explique*:
‘Tout d’abord, nous intégrons tous les 1,67 million d’invites de VidProM dans des vecteurs de 384 dimensions en utilisant SentenceTransformers Ensuite, nous regroupons ces vecteurs avec K-means. Notez que nous réglons le nombre de clusters sur une valeur relativement élevée, c’est-à-dire 2 000, et que nous fusionnons des clusters similaires à l’étape suivante.
‘Enfin, pour chaque cluster, nous demandons à GPT-4o de conclure un sujet [un ou deux mots].’
Les auteurs soulignent que certains concepts sont distincts mais notoirement adjacents, tels que église et cathédrale. Un critère trop granulaire pour les cas de ce type conduirait à des embeddings de concepts (par exemple) pour chaque race de chien, au lieu du terme chien; tandis qu’un critère trop large pourrait regrouper un nombre excessif de sous-concepts dans un seul concept surpeuplé; par conséquent, l’article note l’acte d’équilibre nécessaire pour évaluer de tels cas.
Les formes singulières et plurielles ont été fusionnées, et les verbes restaurés à leurs formes de base (infinitives). Les termes excessivement larges – tels que animation, scène, film et mouvement – ont été supprimés.
Ainsi, 1 291 sujets ont été obtenus (avec la liste complète disponible dans la section complémentaire de l’article source).
Web-scraping sélectif
Ensuite, les chercheurs ont utilisé l’API officielle YouTube pour rechercher des vidéos en fonction des critères distillés à partir de l’ensemble de données 2024, en cherchant à obtenir 500 vidéos pour chaque sujet. Outre la licence Creative Commons requise, chaque vidéo devait avoir une résolution d’au moins 720p et durer moins de quatre minutes.
De cette manière, 586 490 vidéos ont été extraites de YouTube.
Les auteurs ont comparé l’ID YouTube des vidéos téléchargées à un certain nombre d’ensembles de données populaires: OpenVid-1M; HD-VILA-100M; Intern-Vid; Koala-36M; LVD-2M; MiraData; Panda-70M; VidGen-1M; et WebVid-10M.
Ils ont constaté que seulement 1 675 ID (le chevauchement de 0,29 % mentionné) des clips VideoUFO figuraient dans ces anciennes collections, et il faut admettre que même si la liste de comparaison des ensembles de données n’est pas exhaustive, elle comprend tous les plus grands et les plus influents acteurs de la scène de la vidéo générative.
Divisions et évaluation
Les vidéos obtenues ont ensuite été segmentées en plusieurs clips, selon la méthodologie exposée dans l’article Panda-70M mentionné ci-dessus. Les limites de plan ont été estimées, les assemblages cousus, et les vidéos concaténées divisées en clips uniques, avec des légendes brèves et détaillées fournies.

Chaque entrée de données dans l’ensemble de données VideoUFO comporte un clip, un ID, des heures de début et de fin, et une légende brève et détaillée.
Les légendes brèves ont été traitées par la méthode Panda-70M, et les légendes vidéo détaillées par Qwen2-VL-7B, conformément aux directives établies par Open-Sora-Plan. Dans les cas où les clips n’incarnaient pas avec succès le concept cible, les légendes détaillées de chaque clip ont été introduites dans GPT-4o mini, afin de déterminer si cela correspondait vraiment au sujet. Bien que les auteurs aient préféré une évaluation via GPT-4o, cela aurait été trop coûteux pour des millions de clips vidéo.
L’évaluation de la qualité vidéo a été effectuée avec six méthodes du projet VBench.
Comparaisons
Les auteurs ont répété le processus d’extraction de sujet sur les ensembles de données précédents. Pour cela, il a été nécessaire de faire correspondre sémantiquement les catégories dérivées de VideoUFO aux catégories inévitablement différentes des autres collections; il faut admettre que de tels processus ne fournissent que des catégories équivalentes approximatives, et que cela peut être trop subjectif pour garantir des comparaisons empiriques.
Néanmoins, dans l’image ci-dessous, nous voyons les résultats que les chercheurs ont obtenus avec cette méthode:

Comparaison des attributs fondamentaux dérivés à travers VideoUFO et les ensembles de données précédents.
Les chercheurs reconnaissent que leur analyse s’est appuyée sur les légendes et les descriptions existantes fournies dans chaque ensemble de données. Ils admettent que la réécriture des anciens ensembles de données en utilisant la même méthode que VideoUFO aurait pu offrir une comparaison plus directe. Cependant, compte tenu du volume énorme de points de données, leur conclusion selon laquelle cette approche serait prohibitivement coûteuse semble justifiée.
Génération
Les auteurs ont développé un référentiel pour évaluer les performances des modèles de texte à vidéo sur des concepts axés sur l’utilisateur, intitulé BenchUFO. Cela a consisté à sélectionner 791 noms de l’ensemble de 1 291 sujets distillés dans VideoUFO. Pour chaque sujet sélectionné, dix invites de texte de VidProM ont été choisies aléatoirement.
Chaque invite a été passée à un modèle de texte à vidéo, avec le captionneur Qwen2-VL-7B mentionné ci-dessus utilisé pour évaluer les résultats générés. Avec toutes les vidéos générées ainsi légendées, SentenceTransformers a été utilisé pour calculer la similarité cosinuse pour l’invite de texte d’entrée et la description de sortie (inférée) dans chaque cas.

Schéma du processus BenchUFO.
Les modèles génératifs évalués étaient: Mira; Show-1; LTX-Video; Open-Sora-Plan; Open Sora; TF-T2V; Mochi-1; HiGen; Pika; RepVideo; T2V-Zero; CogVideoX; Latte-1; Hunyuan Video; LaVie; et Pyramidal.
Outre VideoUFO, MVDiT-VidGen et MVDit-OpenVid étaient les ensembles de données de formation alternatifs.
Les résultats considèrent les 10ème-50ème sujets les moins performants et les mieux performants à travers les architectures et les ensembles de données.

Résultats pour les performances des modèles T2V publics par rapport aux modèles formés par les auteurs, sur BenchUFO.
Ici, les auteurs commentent:
‘Les modèles de texte à vidéo actuels ne performe pas de manière cohérente sur tous les sujets axés sur l’utilisateur. Plus précisément, il y a une différence de score allant de 0,233 à 0,314 entre les 10 premiers et les 10 derniers sujets. Ces modèles peuvent ne pas comprendre efficacement des sujets tels que “calamar géant”, “cellule animale”, “Van Gogh” et “égyptien ancien” en raison d’un manque de formation sur de telles vidéos.’
‘Les modèles de texte à vidéo actuels montrent un certain degré de cohérence dans leurs sujets les mieux performants. Nous constatons que la plupart des modèles de texte à vidéo excellent dans la génération de vidéos sur des sujets liés aux animaux, tels que “mouette”, “panda”, “dauphin”, “chameau” et “hibou”. Nous déduisons que cela est en partie dû à un biais en faveur des animaux dans les ensembles de données vidéo actuels.’
Conclusion
VideoUFO est une offre exceptionnelle si l’on considère uniquement le point de vue des données fraîches. Si il n’y a pas d’erreur dans l’évaluation et l’élimination des ID YouTube, et si l’ensemble de données contient autant de matériel qui est nouveau pour la scène de recherche, c’est une proposition rare et potentiellement précieuse.
Le revers de la médaille est qu’il faut accorder du crédit à la méthodologie de base; si vous ne croyez pas que la demande des utilisateurs devrait informer les formules de web-scraping, vous seriez en train d’acheter un ensemble de données qui vient avec ses propres ensembles de biais préoccupants.
De plus, l’utilité des sujets distillés dépend à la fois de la fiabilité de la méthode de distillation utilisée (qui est généralement entravée par les contraintes budgétaires), et également des méthodes de formulation pour l’ensemble de données 2024 qui fournit le matériel source.
Ceci étant dit, VideoUFO mérite certainement une enquête plus approfondie – et il est disponible sur Hugging Face.
* Mon remplacement des citations des auteurs par des hyperliens.
Publié pour la première fois le mercredi 5 mars 2025












