Modèles et plateformes d’IA

MINT-1T : Mettre à l’échelle les données multimodales open source de 10 fois

mm
Ajouter Unite.AI à vos sources préférées sur Google

La formation de grands modèles multimodaux (LMM) nécessite de grands ensembles de données avec des séquences de texte et d’images entrelacées en forme libre. Bien que les LMM open source aient évolué rapidement, il existe encore un manque important de jeux de données multimodaux entrelacés à grande échelle qui sont open source. L’importance de ces ensembles de données ne peut être surestimée, car ils forment la base de la création de systèmes d’intelligence artificielle avancés capables de comprendre et de générer du contenu dans différents modes. Sans un approvisionnement suffisant en ensembles de données complets et entrelacés, le potentiel de développement de LMM plus sophistiqués et capables est considérablement entravé. Ces ensembles de données permettent aux modèles d’apprendre à partir d’une gamme diverse d’entrées, les rendant plus polyvalents et efficaces dans diverses applications. De plus, la rareté de tels ensembles de données pose un défi à la communauté open source, qui repose sur des ressources partagées pour stimuler l’innovation et la collaboration.

Les LMM open source ont réalisé des progrès importants ces dernières années, mais leur croissance est freinée par la disponibilité limitée de grands ensembles de données entrelacés. Pour surmonter cet obstacle, des efforts concertés sont nécessaires pour curer, annoter et publier des ensembles de données plus complets qui puissent soutenir le développement et l’affinement continus des modèles multimodaux. En outre, la création et la diffusion de ces ensembles de données impliquent de surmonter plusieurs obstacles techniques et logistiques. La collecte de données doit être exhaustive et représentative des contextes divers dans lesquels les LMM seront déployés. L’annotation nécessite une attention particulière pour garantir que les séquences de texte et d’images entrelacées soient alignées de manière à améliorer les capacités d’apprentissage du modèle. De plus, le fait de garantir que les ensembles de données soient open source implique de traiter les considérations juridiques et éthiques liées à la confidentialité des données et aux droits d’utilisation. L’expansion de la disponibilité de grands ensembles de données multimodaux entrelacés de haute qualité est essentielle pour l’avenir de la recherche et du développement en intelligence artificielle. En traitant la rareté actuelle, la communauté de l’IA peut favoriser une plus grande innovation et collaboration, conduisant à la création de LMM plus puissants et polyvalents capables de résoudre des problèmes complexes et réels.

En poursuivant cette idée, MINT-1T, le plus grand et le plus diversifié ensemble de données multimodaux entrelacés open source à ce jour. MINT-1T : une échelle 10 fois plus grande, comprenant un trillion de jetons de texte et 3,4 milliards d’images par rapport aux ensembles de données open source existants. L’ensemble de données MINT-1T introduit également de nouvelles sources jamais exposées, telles que des fichiers PDF et des articles ArXiv. Puisque les ensembles de données multimodaux entrelacés ne sont pas faciles à mettre à l’échelle, il est important que l’ensemble de données MINT-1T partage le processus de curation des données afin que d’autres puissent également effectuer des expériences sur ces variantes riches en informations. L’ensemble de données MINT-1T démontre que sa méthode ; les modèles de langage (LM) formés sur MINT-1T sont compétitifs (bien que légèrement) par rapport aux précédents ensembles de données open source de pointe, OBELICS.

MINT-1T : Un ensemble de données multimodaux avec un trillion de jetons

Les grands ensembles de données open source de pré-entraînement ont été essentiels pour la communauté de recherche dans l’exploration de l’ingénierie des données et la formation de modèles open source transparents. Dans le domaine du texte, les premiers travaux tels que C4 et The Pile ont joué un rôle crucial pour permettre à la communauté de former les premiers modèles de langage open source de grande échelle, tels que GPT-J, GPT-Neo et d’autres. Ces efforts fondamentaux ont également ouvert la voie à des améliorations ultérieures des méthodes de filtrage des données et de mise à l’échelle. De même, dans l’espace image-texte, les grands ensembles de données open source ont stimulé l’innovation dans de meilleures méthodes de curation des données, telles que les réseaux de filtrage des données et T-MARS. Il y a un changement notable des laboratoires de pointe vers la formation de grands modèles multimodaux (LMM) qui nécessitent de grands ensembles de données multimodaux entrelacés composés de séquences de texte et d’images en forme libre. À mesure que les capacités des modèles de pointe progressent rapidement, un écart important émerge dans les données de formation multimodales entre les modèles fermés et open source. Les ensembles de données multimodaux entrelacés open source actuels sont plus petits et moins diversifiés que leurs homologues en texte uniquement, étant principalement issus de documents HTML, ce qui limite la largeur et la variété des données. Cette limitation entrave le développement de LMM open source robustes et crée un écart entre les capacités des modèles fermés et open source.

Pour combler cet écart, MINT-1T a été créé comme le plus grand et le plus diversifié ensemble de données multimodaux entrelacés open source à ce jour. MINT-1T contient un total d’un trillion de jetons de texte et de trois milliards d’images, issus de sources diverses telles que HTML, PDF et ArXiv. Avant MINT-1T, le plus grand ensemble de données open source dans ce domaine était OBELICS, qui comprenait 115 milliards de jetons de texte et 353 millions d’images, toutes issues de documents HTML.

Les contributions de MINT-1T sont les suivantes :

  • Ingénierie des données : La mise à l’échelle de ces données multimodales entrelacées présente plus un défi d’ingénierie que la construction de jeux de données de texte uniquement ou d’appariements image-texte. La gestion de tailles de documents plus importantes et la préservation de l’ordre d’origine des images et du texte sont cruciales.
  • Diversité : MINT-1T est le premier dans l’espace des ensembles de données multimodaux entrelacés à rassembler des documents multimodaux de haute qualité à grande échelle à partir de sources telles que les fichiers PDF de CommonCrawl et les articles ArXiv.
  • Expériences de modèles : Les expériences montrent que les LMM formés sur MINT-1T ne rivalisent pas seulement avec les performances des modèles formés sur le meilleur ensemble de données open source existant, OBELICS, mais offrent également une augmentation de 10 fois de l’échelle.

MINT-1T : Construction de l’ensemble de données

MINT-1T met en place un grand ensemble de données open source qui utilise des sources plus diversifiées de documents entrelacés, tels que des fichiers PDF et des articles ArXiv. Cette section détaille les méthodes de MINT-1T pour la recherche de documents multimodaux, le filtrage de contenu de mauvaise qualité, la déduplication des données et la suppression de contenu non adapté au travail ou indésirable. L’ensemble de données final comprend 922 milliards de jetons HTML, 106 milliards de jetons PDF et 9 milliards de jetons ArXiv.

Recherche de grandes quantités de documents multimodaux

Pipeline HTML

MINT-1T suit la méthode d’OBELICS pour extraire des documents multimodaux entrelacés à partir de fichiers WARC de CommonCrawl en analysant l’arbre DOM de chaque entrée WARC. Alors qu’OBELICS n’a traité que des documents de février 2020 à février 2023 des dumps de CommonCrawl, MINT-1T a élargi le bassin de documents pour inclure des documents HTML de mai 2017 à avril 2024 (avec des dumps complets d’octobre 2018 à avril 2024 et des dumps partiels des années précédentes). De même qu’OBELICS, MINT-1T filtre les documents qui ne contiennent pas d’images, plus de trente images ou des images dont les URL contiennent des sous-chaînes inappropriées telles que logo, avatar, porn ou xxx.

Pipeline PDF

MINT-1T extrait des documents PDF à partir de fichiers WAT de CommonCrawl des dumps de février 2023 à avril 2024. Initialement, tous les liens PDF sont extraits de ces dumps. MINT-1T tente ensuite de télécharger et de lire les PDF à l’aide de PyMuPDF, en éliminant les PDF de plus de 50 Mo (probablement contenant de grandes images) et ceux de plus de 50 pages. Les pages sans texte sont exclues et un ordre de lecture est établi pour les pages restantes. L’ordre de lecture est déterminé en trouvant la boîte englobante de tous les blocs de texte sur une page, en regroupant les blocs en fonction des colonnes et en les ordonnant de haut en bas et de gauche à droite. Les images sont intégrées dans la séquence en fonction de leur proximité avec les blocs de texte sur la même page.

Pipeline ArXiv

MINT-1T construit des documents entrelacés ArXiv à partir du code source LaTeX en utilisant TexSoup pour trouver les balises de figure et entrelacer les images avec le texte de l’article. Pour les articles à fichiers multiples, MINT-1T identifie le fichier principal TeX et remplace les balises d’entrée par le contenu de leurs fichiers. Le code LaTeX est nettoyé en supprimant les imports, la bibliographie, les tableaux et les balises de citation. Puisque ArXiv est déjà une source de données hautement curée, aucun filtrage ni déduplication supplémentaires ne sont effectués.

Filtrage de la qualité du texte

MINT-1T évite d’utiliser des heuristiques basées sur les modèles pour le filtrage du texte, suivant les pratiques établies par RefinedWeb, Dolma et FineWeb. Initialement, les documents non anglais sont éliminés à l’aide du modèle d’identification de langue Fasttext (avec un seuil de confiance de 0,65). Les documents dont les URL contiennent des sous-chaînes NSFW sont également supprimés pour exclure le contenu pornographique et indésirable. Les méthodes de filtrage du texte de RefinedWeb sont appliquées, en particulier en supprimant les documents avec des n-grammes dupliqués excessifs ou ceux identifiés comme de mauvaise qualité en utilisant les règles de MassiveText.

Filtrage des images

Après la curation des PDF et des fichiers HTML, MINT-1T tente de télécharger toutes les URL d’images dans l’ensemble de données HTML, en éliminant les liens non récupérables et en supprimant les documents sans liens d’images valides. Les images de moins de 150 pixels sont éliminées pour éviter les images bruyantes telles que les logos et les icônes, et les images de plus de 20 000 pixels sont également supprimées car elles correspondent généralement à des images hors sujet. Pour les documents HTML, les images avec un rapport d’aspect supérieur à deux sont supprimées pour filtrer les images de mauvaise qualité telles que les bannières publicitaires. Pour les PDF, le seuil est ajusté à trois pour préserver les figures et les tableaux scientifiques.

La figure ci-dessus représente de manière unique la façon dont MINT-1T inclut des données à partir de fichiers PDF et d’articles ArXiv au-delà des sources HTML.

Filtrage de sécurité

  • Filtrage d’images NSFW : MINT-1T applique un détecteur d’images NSFW à toutes les images de l’ensemble de données. Si un document contient une seule image NSFW, l’ensemble du document est supprimé.
  • Suppression des informations personnelles : Pour atténuer le risque de fuite de données personnelles, les adresses e-mail et les adresses IP dans les données texte sont anonymisées. Les adresses e-mail sont remplacées par des modèles tels que “[email protected]” et les adresses IP par des adresses IP non fonctionnelles générées aléatoirement.

Déduplication

MINT-1T effectue une déduplication de texte de paragraphes et de documents au sein de chaque instantané CommonCrawl et une déduplication d’images pour supprimer les images répétitives et non informatives telles que les icônes et les logos. Toutes les étapes de déduplication sont effectuées séparément pour chaque source de données.

Déduplication de paragraphes et de documents

En suivant la méthodologie de Dolma, MINT-1T utilise un filtre Bloom pour une déduplication de texte efficace, en définissant le taux de faux positifs à 0,01 et en dédupliquant les paragraphes de 13 grammes (indiqués par des délimiteurs de nouvelle ligne double) de chaque document. Si plus de 80 % des paragraphes d’un document sont des doublons, l’ensemble du document est supprimé.

Suppression du texte de chaîne commune

Après la déduplication de paragraphes, MINT-1T supprime les phrases de chaîne courtes dans les documents HTML, telles que “Skip to content” ou “Blog Archive”. Cela est réalisé en exécutant une déduplication de paragraphes exacte sur 2 % de chaque instantané CommonCrawl, conformément aux pratiques de CCNet, en garantissant principalement la suppression du texte de chaîne commune.

La figure ci-dessus démontre le processus de filtrage pour MINT-1T et montre comment les jetons sont supprimés tout au long du pipeline de données pour les documents HTML, les fichiers PDF et les articles ArXiv.

Déduplication d’images

Au sein de chaque instantané CommonCrawl, MINT-1T supprime les images qui apparaissent fréquemment en fonction des hachages SHA256. Plutôt qu’une déduplication stricte, seules les images qui apparaissent plus de dix fois au sein d’un instantané sont supprimées, suivant les pratiques de Multimodal-C4. Conformément à OBELICS, les images répétées au sein d’un seul document sont supprimées, ne conservant que la première occurrence.

Infrastructure

Tout au long du traitement des données, MINT-1T a eu accès à une moyenne de 2 350 cœurs CPU provenant d’un mélange de nœuds à 190 processeurs et de nœuds à 90 processeurs. Au total, environ 4,2 millions d’heures CPU ont été utilisées pour construire cet ensemble de données.

Comparaison de la composition de documents dans MINT-1T et OBELICS

Lors de l’évaluation de la composition des ensembles de données entrelacés, deux caractéristiques clés sont examinées : la distribution des jetons de texte par document et le nombre d’images par document. Pour cette analyse, 50 000 documents ont été échantillonnés aléatoirement à partir d’OBELICS et de chaque source de données dans MINT-1T. Le tokenizer de GPT-2 a été utilisé pour calculer le nombre de jetons de texte. Les valeurs aberrantes ont été supprimées en excluant les documents qui se situaient en dehors de la plage interquartile de 1,5 pour le nombre de jetons de texte et d’images. Comme le montre la figure suivante, le sous-ensemble HTML de MINT-1T correspond étroitement à la distribution de jetons observée dans OBELICS. Cependant, les documents issus de fichiers PDF et d’articles ArXiv tendent à être plus longs que les documents HTML en moyenne, mettant en évidence les avantages de la recherche de données à partir de sources diversifiées. La figure 5 examine la densité d’images à travers tous les documents, révélant que les fichiers PDF et les articles ArXiv contiennent plus d’images que les documents HTML, les échantillons ArXiv étant les plus denses en images.

Comment les différentes sources de données améliorent-elles la diversité des documents ?

Une motivation importante pour élargir le bassin de documents multimodaux au-delà des documents HTML est l’amélioration de la couverture de domaine. Pour quantifier la diversité et la profondeur de cette couverture, un modèle LDA a été formé sur 100 000 documents échantillonnés à partir de l’ensemble de données OBELICS, du sous-ensemble HTML de MINT-1T et du sous-ensemble PDF (hors ArXiv) de MINT-1T pour obtenir 200 sujets. GPT-4 a ensuite été utilisé pour classer l’ensemble de mots pour identifier les domaines dominants – tels que la santé et la médecine, la science, les affaires, les humanités, l’histoire, etc. – sur la base des domaines MMMU. L’analyse révèle des tendances distinctes dans la distribution de domaine :

  • OBELICS : Cet ensemble de données montre une concentration prononcée dans les “Humanités et sciences sociales”. Cela peut être attribué à son processus de construction de données, qui implique le filtrage des documents qui ne ressemblent pas à des articles de Wikipedia, altérant ainsi potentiellement la distribution vers un contenu plus général et axé sur les humanités.
  • Sous-ensemble HTML de MINT-1T : Contrairement à OBELICS, le sous-ensemble HTML de MINT-1T n’est pas fortement biaisé vers un domaine spécifique, suggérant une représentation de domaine plus large et plus équilibrée.
  • Sous-ensemble PDF de MINT-1T : Il y a une proportion plus élevée de documents “Science et technologie” dans les documents PDF de MINT-1T. Cette tendance est probablement due à la nature de la communication scientifique, où les PDF sont le format préféré pour partager des articles de recherche détaillés et des rapports techniques.

MINT-1T : Résultats et expériences

Pour toutes les expériences, MINT-1T forme le modèle sur 50 % de lots de captionnage d’images et de texte et sur 50 % de lots de documents multimodaux entrelacés. Un maximum de 2 048 jetons multimodaux est échantillonné à partir de chaque document entrelacé et 340 jetons à partir de chaque échantillon d’image et de texte. De même que Flamingo, un jeton “fin” est ajouté pour indiquer la fin d’une séquence d’image et de texte adjacente. Lors de la formation, 50 % des documents entrelacés à une seule image sont aléatoirement supprimés pour suréchantillonner les documents à plusieurs images. L’ensemble de données d’images et de texte est composé d’un mélange de jeux de données de captionnage internes. La capacité du modèle à raisonner sur des séquences multimodales entrelacées est évaluée à travers ses capacités d’apprentissage en contexte et ses performances de raisonnement multi-image.

La figure ci-dessus illustre le pourcentage de documents de chaque domaine dans MMMU pour OBELICS et les sous-ensembles de MINT-1T.

Apprentissage en contexte : Les modèles sont évalués sur des performances d’apprentissage en contexte à quatre et huit démonstrations sur divers benchmarks de captionnage (COCO (test Karpathy) et TextCaps (validation)) et des ensembles de données de questions visuelles (VQAv2 (validation), OK-VQA (validation), TextVQA (validation) et VizWiz (validation)). Les démonstrations sont échantillonnées aléatoirement à partir de l’ensemble de formation. Les scores sont moyennés sur plusieurs exécutions d’évaluation, avec des démonstrations aléatoires pour tenir compte de la sensibilité aux invites choisies. Différentes invites sont abordées pour chaque tâche pour sélectionner celles qui donnent les meilleures performances.

Raisonnement multi-image : Les modèles sont évalués sur MMMU (contenant à la fois des questions à une image et des questions à plusieurs images) et Mantis-Eval (toutes des questions à plusieurs images) pour sonder les capacités de raisonnement multi-image au-delà des évaluations d’apprentissage en contexte.

Formation sur des documents HTML

Initialement, la partie HTML de MINT-1T est comparée à OBELICS, car OBELICS est l’ensemble de données entrelacé de pointe précédent, également issu de documents HTML. Deux modèles sont formés sur les parties HTML de MINT-1T et OBELICS pour un total de 10 milliards de jetons multimodaux. Leurs performances d’apprentissage en contexte sont évaluées. Le tableau suivant présente les performances à quatre et huit démonstrations sur des benchmarks courants ; le modèle formé sur les documents HTML de MINT-1T performs mieux que OBELICS sur les tâches VQA mais moins bien sur les benchmarks de captionnage. En moyenne, OBELICS performs légèrement mieux que MINT-1T (HTML).

Ajout de documents PDF et ArXiv

Par la suite, la formation est effectuée sur l’ensemble complet des sources de données de MINT-1T, avec un mélange de documents HTML, PDF et ArXiv. Les documents entrelacés sont échantillonnés avec 50 % provenant d’HTML, 45 % de PDF et 5 % d’ArXiv. Le modèle est formé pour un total de 10 milliards de jetons multimodaux. Comme le montre le tableau ci-dessus, le modèle formé sur l’ensemble complet de données de MINT-1T surpasse OBELICS et MINT-1T (HTML) sur la plupart des benchmarks d’apprentissage en contexte. Sur les benchmarks de raisonnement multimodal plus complexes, le modèle MINT-1T surpasse OBELICS sur MMMU mais performs moins bien sur Mantis-Eval.

Tendances fines

Comment les performances d’apprentissage en contexte évoluent-elles avec les démonstrations ?

Les performances d’apprentissage en contexte sont évaluées lorsqu’elles sont présentées avec une à huit démonstrations. Un seul essai par nombre de démonstrations est effectué pour chaque benchmark d’évaluation. Comme le montre la figure suivante, le modèle formé sur MINT-1T surpasse le modèle formé sur le sous-ensemble HTML de MINT-1T et OBELICS sur tous les nombres de démonstrations. Le modèle MINT-1T (HTML) performs légèrement moins bien qu’OBELICS.

Performances sur les tâches de captionnage et de questions visuelles

La figure suivante présente les performances moyennes d’apprentissage en contexte sur les benchmarks de captionnage et de questions visuelles (VQA). OBELICS surpasse toutes les variantes de MINT-1T sur les benchmarks de captionnage à quatre démonstrations et performs légèrement moins bien que MINT-1T sur les benchmarks de captionnage à huit démonstrations. Cependant, MINT-1T surpasse nettement les deux références sur les benchmarks VQA. MINT-1T (HTML) surpasse également OBELICS sur les tâches VQA.

Performances sur différents domaines

L’inclusion de domaines diversifiés dans MINT-1T vise à améliorer la généralisation du modèle. La figure précédente décompose les performances sur MMMU pour chaque domaine. À l’exception du domaine des affaires, MINT-1T surpasse OBELICS et MINT-1T (HTML). L’augmentation des performances dans les domaines de la science et de la technologie pour MINT-1T est attribuée à la prévalence de ces domaines dans les documents PDF et ArXiv.

Pensées finales

Dans cet article, nous avons discuté de MINT-1T, le plus grand et le plus diversifié ensemble de données multimodaux entrelacés open source à ce jour. MINT-1T : une échelle 10 fois plus grande, comprenant un trillion de jetons de texte et 3,4 milliards d’images par rapport aux ensembles de données open source existants. L’ensemble de données MINT-1T introduit également de nouvelles sources jamais exposées, telles que des fichiers PDF et des articles ArXiv. Puisque les ensembles de données multimodaux entrelacés ne sont pas faciles à mettre à l’échelle, il est important que l’ensemble de données MINT-1T partage le processus de curation des données afin que d’autres puissent également effectuer des expériences sur ces variantes riches en informations. L’ensemble de données MINT-1T démontre que sa méthode ; les modèles de langage formés sur MINT-1T sont compétitifs (bien que légèrement) par rapport aux précédents ensembles de données open source de pointe, OBELICS.

Un ingénieur de profession, un écrivain de cœur. Kunal est un rédacteur technique avec une profonde affection et une compréhension de l'IA et du ML, dédié à simplifier les concepts complexes dans ces domaines grâce à sa documentation engageante et informative.