AI-modeller og platforme
MINT-1T: Skalerer ÃĨbent kilde-multimodal data med 10 gange
TrÃĶning af store multimodale modeller (LMM) krÃĶver store datasets med sammenflettede sekvenser af billeder og tekst i fri form. Selvom ÃĨbne kilde-LMMâer er udviklet hurtigt, er der stadig en stor mangel pÃĨ multimodale sammenflettede datasets i ÃĨbent kilde, der er til rÃĨdighed. Betoningen af disse datasets kan ikke overdrives, da de danner grundlaget for at skabe avancerede AI-systemer, der kan forstÃĨ og generere indhold pÃĨ tvÃĶrs af forskellige modaliteter. Uden en tilstrÃĶkkelig forsyning af omfattende, sammenflettede datasets, er potentialet for at udvikle mere avancerede og kapable LMMâer betydeligt hÃĶmmet. Disse datasets giver mulighed for, at modeller kan lÃĶre fra en bred vifte af indgange, hvilket gÃļr dem mere alsidige og effektive i forskellige anvendelser. Desuden stiller manglen pÃĨ sÃĨdanne datasets en udfordring for den ÃĨbne kilde-samfund, der afhÃĶnger af fÃĶlles ressourcer til at drive innovation og samarbejde.
à bne kilde-LMMâer har gjort betydelige fremskridt i de seneste ÃĨr, men deres vÃĶkst er hÃĶmmet af den begrÃĶnsede tilgÃĶngelighed af store, sammenflettede datasets. For at overvinde dette hindringsmoment er samarbejdende bestrÃĶbelser nÃļdvendige for at kuraterer, annotere og udgive mere omfattende datasets, der kan understÃļtte den fortsatte udvikling og forbedring af multimodale modeller. Derudover indebÃĶrer skabelsen og formidlingen af disse datasets at overvinde flere tekniske og logistiske hindringer. Dataindsamlingen skal vÃĶre omfattende og reprÃĶsentativ for de forskellige kontekster, hvori LMMâer vil blive anvendt. Annotation krÃĶver omhyggelig overvejelse for at sikre, at de sammenflettede sekvenser af billeder og tekst er aligneret pÃĨ en mÃĨde, der forbedrer modellens lÃĶringsfÃĶrdigheder. Desuden indebÃĶrer det at sikre, at datasets er ÃĨbne kilde, at man skal tackle retlige og etiske overvejelser i forhold til dataintegritet og brugsrettigheder. At udvide tilgÃĶngeligheden af hÃļjkvalitets, store multimodale sammenflettede datasets er afgÃļrende for fremtiden for AI-forskning og udvikling. Ved at tackle den nuvÃĶrende mangel kan AI-samfundet fremme stÃļrre innovation og samarbejde, hvilket fÃļrer til skabelsen af mere kraftfulde og alsidige LMMâer, der kan tackle komplekse, virkelige problemer.
Bygget pÃĨ denne tanke er MINT-1T, den stÃļrste og mest diverse multimodale sammenflettede ÃĨbne kilde-dataset til dato. MINT-1T: En 10 gange stÃļrre skala, der inkluderer en billion tekst tokens og 3,4 milliarder billeder mere end eksisterende ÃĨbne kilde-datasets. MINT-1T-datasettet introducerer ogsÃĨ aldrig tidligere sette kilder sÃĨsom PDF-filer og ArXiv-papirer. Da multimodale sammenflettede datasets ikke skalerer let, er det vigtigt, at MINT-1T-datasettet deler datakureringprocessen, sÃĨ andre ogsÃĨ kan udfÃļre eksperimenter pÃĨ sÃĨdanne informationsrige varianter. MINT-1T-datasettet demonstrerer, at dens metode; LM-modeller trÃĶnet pÃĨ MINT-1T er konkurrencedygtige (omend noget) til tidligere state-of-the-art OBELICS.
MINT-1T: Et multimodalt dataset med en billion tokens
Store ÃĨbne kilde-forudgÃĨende trÃĶningsdatasets har vÃĶret afgÃļrende for forskningssamfundet i at udforske dataingeniÃļrarbejde og trÃĶne gennemsigtige, ÃĨbne kilde-modeller. I tekstdomÃĶnet har tidlige vÃĶrker sÃĨsom C4 og The Pile spillet en afgÃļrende rolle i at enable samfundet til at trÃĶne de fÃļrste ÃĨbne kilde-store sprogmodeller sÃĨsom GPT-J, GPT-Neo og andre. Disse grundlÃĶggende bestrÃĶbelser ÃĨbnede ogsÃĨ vejen for efterfÃļlgende forbedringer af datafiltreringsmetoder og skalerbarhed. Ligeledes i billed-tekst-rummet har store ÃĨbne kilde-datasets fremmet innovationer i bedre datakureringmetoder, sÃĨsom DatafilternetvÃĶrk og T-MARS. Der er en tydelig skiftning fra frontlaboratorier til trÃĶning af store multimodale modeller (LMMâer), der krÃĶver omfattende multimodale sammenflettede datasets bestÃĨende af frie sekvenser af billeder og tekst. Da kapaciteten af frontmodeller udvikler sig hurtigt, opstÃĨr der en betydelig lukke i multimodal trÃĶningsdata mellem lukkede og ÃĨbne kilde-modeller. NuvÃĶrende ÃĨbne kilde-multimodale sammenflettede datasets er mindre og mindre diverse end deres tekst-baserede modstykke, idet de primÃĶrt stammer fra HTML-dokumenter, hvilket begrÃĶnser bredde og variation af data. Denne begrÃĶnsning hÃĶmmer udviklingen af robuste ÃĨbne kilde-LMMâer og skaber en ulighed mellem kapaciteten af ÃĨbne og lukkede modeller.
For at tackle denne lukke blev MINT-1T skabt som det stÃļrste og mest diverse ÃĨbne kilde-multimodale sammenflettede dataset til dato. MINT-1T indeholder i alt en billion tekst tokens og tre milliarder billeder, hentet fra forskellige kilder sÃĨsom HTML, PDFâer og ArXiv. FÃļr MINT-1T var det stÃļrste ÃĨbne kilde-dataset i dette omrÃĨde OBELICS, der indeholdt 115 milliarder tekst tokens og 353 millioner billeder, alle hentet fra HTML.

Bidragene fra MINT-1T er fÃļlgende:
- DataingeniÃļrarbejde: Skalerbarhed af denne multimodale sammenflettede data reprÃĶsenterer mere en ingeniÃļrudfordring end opbygning af enten tekst-baserede eller billed-tekst-par-datasets. HÃĨndtering af stÃļrre dokumentsstÃļrrelser og bevarelse af den oprindelige rÃĶkkefÃļlge af billeder og tekst er afgÃļrende.
- Mangfoldighed: MINT-1T er den fÃļrste i det multimodale sammenflettede rum til at samle hÃļjkvalitets multimodale dokumenter i stor skala fra kilder sÃĨsom CommonCrawl PDFâer og ArXiv.
- Model-eksperimenter: Eksperimenter viser, at LMMâer trÃĶnet pÃĨ MINT-1T ikke kun matcher, men potentielt overgÃĨr prÃĶstationen af modeller trÃĶnet pÃĨ det bedste eksisterende ÃĨbne kilde-dataset, OBELICS, mens de tilbyder en ti fold forÃļgelse af skala.
MINT-1T: Konstruktion af datasettet
MINT-1T kuraterer et stort ÃĨbent kilde-dataset, der udnytter mere diverse kilder af sammenflettede dokumenter, sÃĨsom PDFâer og ArXiv-papirer. Dette afsnit detaljerer MINT-1Tâs metoder for at indsamle multimodale dokumenter, filtrere lavkvalitetsindhold, deduplicere data og fjerne ikke-sikre-for-arbejde (NSFW) eller uÃļnsket materiale. Det endelige dataset bestÃĨr af 922 milliarder (B) HTML-tokens, 106B PDF-tokens og 9B ArXiv-tokens.
Indsamling af store mÃĶngder af multimodale dokumenter
HTML-rÃļrledning
MINT-1T fÃļlger OBELICSâs metode for at trÃĶkke sammenflettede multimodale dokumenter fra CommonCrawl WARC-filer ved at parse hver WARC-entries DOM-trÃĶ. Mens OBELICS kun behandlede dokumenter fra februar 2020 til februar 2023 CommonCrawl-dumps, har MINT-1T udvidet dokumentpuljen til at inkludere HTML-dokumenter fra maj 2017 til april 2024 (med fulde dumps fra oktober 2018 til april 2024 og delvise dumps fra tidligere ÃĨr). Ligesom OBELICS filtrerer MINT-1T ud dokumenter, der indeholder ingen billeder, mere end tredive billeder eller billeder med URLâer, der indeholder upassende understreng, sÃĨsom logo, avatar, porn og xxx.
PDF-rÃļrledning
MINT-1T indsamler PDF-dokumenter fra CommonCrawl WAT-filer fra februar 2023 til april 2024-dumps. FÃļrst udtrÃĶkkes alle PDF-links fra disse dumps. MINT-1T forsÃļger derefter at downloade og lÃĶse PDFâer ved hjÃĶlp af PyMuPDF, og forkaster PDFâer over 50MB (som sandsynligvis indeholder store billeder) og dem over 50 sider lange. Sider uden tekst er ekskluderet, og en lÃĶseorden fastlÃĶgges for de resterende sider. LÃĶseorden fastlÃĶgges ved at finde tekstblokkernes bundtede kasse pÃĨ en side, gruppere blokkene efter kolonner og ordne dem fra toppen til bunden.

ArXiv-rÃļrledning
MINT-1T bygger ArXiv-sammenflettede dokumenter fra LaTeX-kildekode ved hjÃĶlp af TexSoup til at finde figur-tags og sammenflette billeder med papirets tekst. For multifile-papirer identificerer MINT-1T hoved-Tex-filen og erstatter input-tags med indholdet af dens filer. LaTeX-koden renses ved at fjerne import, bibliografi, tabeller og citation-tags. Da ArXiv allerede er en hÃļjtidligt kurateret datakilde, udfÃļres der ingen yderligere filtrering og deduplikation.
Tekst-kvalitetsfiltrering
MINT-1T undgÃĨr at bruge model-baserede heuristikker til tekstfiltrering, fÃļlger praksis etableret af RefinedWeb, Dolma og FineWeb. FÃļrst elimineres ikke-engelske dokumenter ved hjÃĶlp af Fasttextâs sprogidentifikationsmodel (med en tillidstÃĶrskel pÃĨ 0,65). Dokumenter med URLâer, der indeholder NSFW-understreng, fjernes for at ekskludere pornografisk og uÃļnsket indhold. Tekstfiltreringsmetoder fra RefinedWeb anvendes, specifikt fjernelse af dokumenter med overmÃĨl af duplikerede n-grammer eller dem, der identificeres som lavkvalitets ved hjÃĶlp af MassiveText-regler.
Billedefiltrering
Efter kuratering af PDFâer og HTML-filer forsÃļger MINT-1T at downloade alle billed-URLâer i HTML-datasettet, forkaster ikke-hentelige links og fjerner dokumenter med ingen gyldige billed-links. Billeder mindre end 150 pixel forkastes for at undgÃĨ stÃļjende billeder sÃĨsom logoer og ikoner, og billeder stÃļrre end 20.000 pixel fjernes, da de normalt svarer til off-topic-billeder. For HTML-dokumenter fjernes billeder med et aspektforhold stÃļrre end to for at filtrere ud lavkvalitetsbilleder sÃĨsom reklamebanner. For PDFâer justeres grÃĶnsen til tre for at bevare videnskabelige figurer og tabeller.

Figuren ovenfor reprÃĶsenterer, hvordan MINT-1T unikt inkluderer data fra PDFâer og ArXiv-dokumenter ud over HTML-kilder.
Sikkerhedsfiltrering
- NSFW-billedefiltrering: MINT-1T anvender en NSFW-billeddetektor til alle billeder i datasettet. Hvis et dokument indeholder et enkelt NSFW-billede, forkastes hele dokumentet.
- Fjernelse af personligt identificerbart information: For at mindske risikoen for personlige dataleaks anonymiseres e-mail-adresser og IP-adresser i tekstdataen. E-mail-adresser erstattes med skabeloner sÃĨsom â[email protected]â og IP-adresser med tilfÃĶldigt genererede ikke-funktionelle IP-adresser.
Deduplikation
MINT-1T udfÃļrer afsnit- og dokumenttekstdeduplikation inden for hver CommonCrawl-snapshot og billededuplikation for at fjerne gentagne, uproduktive billeder sÃĨsom ikoner og logoer. Alle deduplikationstrin udfÃļres separat for hver datakilde.
Afsnit- og dokumentdeduplikation
FÃļlger Dolmaâs metode, bruger MINT-1T en Bloom-filter til effektiv tekstdeduplikation, sÃĶtter den falske positivt rate til 0,01 og deduplicerer 13-gram-afsnit (indikeret gennem dobbelt newline-delimitere) fra hvert dokument. Hvis mere end 80% af et documents afsnit er duplikater, forkastes hele dokumentet.
Fjernelse af fÃĶlles kildedele
Efter afsnitsdeduplikation fjerner MINT-1T korte fÃĶlles kildedele i HTML-dokumenter, sÃĨsom âSpring til indholdâ eller âBlog-arkivâ. Dette udfÃļres ved at kÃļre eksakt afsnitsdeduplikation pÃĨ 2% af hver CommonCrawl-snapshot, i overensstemmelse med CCNet-praksis, hvilket sikrer, at det meste af det fjernede er fÃĶlles kildedele.

Figuren ovenfor demonstrerer filtreringsprocessen for MINT-1T og viser, hvordan tokens fjernes gennem datapipelinen for HTML, PDFâer og ArXiv-papirer.
Billededuplikation
Inden for hver CommonCrawl-snapshot fjerner MINT-1T hyppigt forekommende billeder baseret pÃĨ SHA256-hashes. I stedet for streng deduplikation fjernes kun billeder, der optrÃĶder mere end ti gange inden for en snapshot, fÃļlger Multimodal-C4-praksis. I overensstemmelse med OBELICS fjernes gentagne billeder inden for et enkelt dokument, og kun den fÃļrste forekomst bevares.
Infrastruktur
Gennem hele dataprocessen havde MINT-1T adgang til en gennemsnit pÃĨ 2.350 CPU-kerner fra en blanding af 190-processor- og 90-processor-noder. I alt blev omkring 4,2 millioner CPU-timer brugt til at bygge dette dataset.
Sammenligning af dokumentkomposition i MINT-1T med OBELICS
Ved evaluering af sammensÃĶtningen af sammenflettede datasets, er to nÃļglekarakteristika under undersÃļgelse: fordelingen af tekst tokens pr. dokument og antallet af billeder pr. dokument. Til denne analyse blev 50.000 dokumenter tilfÃĶldigt udvalgt fra bÃĨde OBELICS og hver datakilde i MINT-1T. GPT-2âs tokenizer blev brugt til at beregne antallet af tekst tokens. Udviklinger blev fjernet ved at ekskludere dokumenter, der faldt uden for 1,5 interquartilomrÃĨdet for antallet af tekst tokens og billeder. Som vist i fÃļlgende figur, ligner HTML-undermÃĶngden af MINT-1T tÃĶt pÃĨ tokenfordelingen set i OBELICS. Dog tenderer dokumenter hentet fra PDFâer og ArXiv til at vÃĶre lÃĶngere end HTML-dokumenter i gennemsnit, hvilket understreger fordelene ved at hente data fra diverse kilder. Figur 5 undersÃļger billedtÃĶtheden pÃĨ tvÃĶrs af alle dokumenter, og afslÃļrer, at PDFâer og ArXiv-dokumenter indeholder flere billeder sammenlignet med HTML-dokumenter, med ArXiv-prÃļver som de mest billedtÃĶtte.

Hvordan forbedrer forskellige datakilder dokumentmangfoldighed?
En vigtig motivation for at udvide puljen af multimodale dokumenter ud over HTML er forbedringen af domÃĶne-dÃĶkning. For at kvantificere mangfoldigheden og dybden af denne dÃĶkning, blev en Latent Dirichlet Allocation (LDA)-model trÃĶnet pÃĨ 100.000 dokumenter udvalgt fra OBELICS-datasettet, HTML-undermÃĶngden af MINT-1T og PDF-undermÃĶngden (eksklusive ArXiv) fra MINT-1T for at fÃĨ 200 emner. GPT-4 blev derefter brugt til at klassificere sÃĶttet af ord for at identificere de dominerende domÃĶner â sÃĨsom Sundhed & Medicin, Videnskab, Forretning, Humaniora, Historie osv. â baseret pÃĨ MMMU-domÃĶner. Analysen afslÃļrer distinkte tendenser i domÃĶnefordeling:
- OBELICS: Dette dataset viser en markant koncentration i âHumaniora og Samfundsvidenskabâ. Dette kan tilskrives dens datakonstruktionsproces, der indebÃĶrer at filtrere ud dokumenter, der ikke ligner Wikipedia-artikler, hvilket potentielt kan ÃĶndre fordelingen til mere generel viden og humaniora-fokuseret indhold.
- MINT-1Tâs HTML-undermÃĶngde: I modsÃĶtning til OBELICS er MINT-1Tâs HTML-undermÃĶngde ikke stÃĶrkt fordelt mod en bestemt domÃĶne, hvilket antyder en bredere og mere balanceret domÃĶne-reprÃĶsentation.
- MINT-1Tâs PDF-undermÃĶngde: Der er en hÃļjere proportion af âVidenskab og Teknologiâ-dokumenter inden for PDF-dokumenterne i MINT-1T. Denne tendens skyldes sandsynligvis naturen af videnskabelig kommunikation, hvor PDFâer er den foretrukne format for at dele detaljerede forskningspapirer og tekniske rapporter.
MINT-1T: Resultater og eksperimenter
Til alle eksperimenter trÃĶner MINT-1T modellen pÃĨ 50% billed-tekst-kapitulationsbatch og 50% multimodale sammenflettede batch. Et maksimum pÃĨ 2048 multimodale tokens udtrÃĶkkes fra hvert sammenflettet dokument og 340 tokens fra hvert billed-tekst-eksempel. Ligesom Flamingo, tilfÃļjes en âendâ-token for at indikere slutningen af en nÃĶrliggende billed-tekst-sekvens. Under trÃĶning dropes 50% af enkeltbilled-sammenflettede dokumenter tilfÃĶldigt for at oversample multi-billed-dokumenter. Billed-tekst-datasettet bestÃĨr af en blanding af internt kuraterede kapitel-datasets. Modellens evne til at resonere om multimodale sammenflettede sekvenser vurderes gennem dets kontekstlÃĶringsfÃĶrdigheder og multi-billed-rÃĶsoneringsprÃĶstation.

Figuren ovenfor illustrerer procentdelen af dokumenter fra hvert domÃĶne i MMMU for OBELICS og undermÃĶngder af MINT-1T.
KontekstlÃĶring: Modellerne vurderes pÃĨ fire-skud- og otte-skud-kontekstlÃĶringsprÃĶstation pÃĨ forskellige kapitel-benchmark (COCO (Karpathy-test) og TextCaps (validering)) og billed-spÃļrgsmÃĨl-datasets (VQAv2 (validering), OK-VQA (validering), TextVQA (validering) og VizWiz (validering)). Demonstrations er tilfÃĶldigt udvalgt fra trÃĶningssettet. Scoren er gennemsnittet over multiple vurderingslÃļb, med tilfÃĶldigt valgte prompts for at tage hensyn til fÃļlsomhed overfor valgte prompts. Forskellige prompts er ablateret for hver opgave for at vÃĶlge den bedst performende.
Multi-billed-rÃĶsonering: Modeller vurderes pÃĨ MMMU (indeholdende bÃĨde enkelt- og multi-billed-spÃļrgsmÃĨl) og Mantis-Eval (alle multi-billed-spÃļrgsmÃĨl) for at undersÃļge multi-billed-rÃĶsoneringsfÃĶrdigheder ud over kontekstlÃĶringsvurderinger.
TrÃĶning pÃĨ HTML-dokumenter
Initialt sammenlignes HTML-delen af MINT-1T med OBELICS, da OBELICS er det tidligere fÃļrende sammenflettede dataset, ogsÃĨ kurateret fra HTML-dokumenter. To modeller trÃĶnes pÃĨ HTML-delene af MINT-1T og OBELICS i alt 10B multimodale tokens. Deres kontekstlÃĶringsprÃĶstation vurderes. FÃļlgende tabel prÃĶsenterer fire-skud- og otte-skud-prÃĶstation pÃĨ fÃĶlles benchmark; modellen trÃĶnet pÃĨ MINT-1Tâs HTML-dokumenter prÃĶsterer bedre end OBELICS pÃĨ VQA-opgaver, men dÃĨrligere pÃĨ kapitel-benchmark. I gennemsnit prÃĶsterer OBELICS lidt bedre end MINT-1T (HTML).

TilfÃļjelse af PDF- og ArXiv-dokumenter
Herefter udfÃļres trÃĶning pÃĨ MINT-1Tâs fulde datakilder, med en blanding af HTML-, PDF- og ArXiv-dokumenter. De sammenflettede dokumenter udtrÃĶkkes med 50% fra HTML, 45% fra PDFâer og 5% fra ArXiv. Modellen trÃĶnes i alt 10B multimodale tokens. Som vist i ovenstÃĨende tabel, overgÃĨr modellen trÃĶnet pÃĨ det fulde MINT-1T-dataset bÃĨde OBELICS og MINT-1T (HTML) pÃĨ de fleste kontekstlÃĶringsbenchmark. PÃĨ mere komplekse multimodale rÃĶsoneringsbenchmark overgÃĨr MINT-1T-modellen OBELICS pÃĨ MMMU, men prÃĶsterer dÃĨrligere pÃĨ Mantis-Eval.
Finere tendenser
Hvordan skalerer kontekstlÃĶringsprÃĶstation med demonstrationsantal?
KontekstlÃĶringsprÃĶstation vurderes, nÃĨr modellen prÃĶsenteres med ÃĐt til otte demonstrations eksempler. En enkelt prÃļve pr. skudantal udfÃļres for hver vurderingsbenchmark. Som vist i fÃļlgende figur, overgÃĨr modellen trÃĶnet pÃĨ MINT-1T modellen trÃĶnet pÃĨ MINT-1Tâs HTML-undermÃĶngde og OBELICS over alle skud. MINT-1Tâs (HTML)-modellen prÃĶsterer lidt dÃĨrligere end OBELICS.

PrÃĶstation pÃĨ kapitel- og billed-spÃļrgsmÃĨl-opgaver
FÃļlgende figur prÃĶsenterer den gennemsnitlige kontekstlÃĶringsprÃĶstation pÃĨ kapitel- og billed-spÃļrgsmÃĨl-benchmark. OBELICS overgÃĨr alle MINT-1T-varianter pÃĨ fire-skud-kapitel-benchmark og prÃĶsterer lidt dÃĨrligere sammenlignet med MINT-1T pÃĨ otte-skud-kapitel. Dog overgÃĨr MINT-1T betydeligt OBELICS pÃĨ VQA-benchmark. MINT-1T (HTML) overgÃĨr ogsÃĨ OBELICS pÃĨ VQA-opgaver.
PrÃĶstation pÃĨ forskellige domÃĶner
Inklusion af diverse domÃĶner i MINT-1T sigter mod at forbedre modellens generaliseringsfÃĶrdighed. Figuren tidligere viser prÃĶstation pÃĨ MMMU for hvert domÃĶne. Undtagen for Forretning-domÃĶnet overgÃĨr MINT-1T bÃĨde OBELICS og MINT-1T (HTML). PrÃĶstationsforÃļgelsen i Videnskab og Teknologi-domÃĶner for MINT-1T tilskrives forekomsten af disse domÃĶner i ArXiv- og PDF-dokumenter.
Afsluttende tanker
I denne artikel har vi talt om MINT-1T, det stÃļrste og mest diverse multimodale sammenflettede ÃĨbne kilde-dataset til dato. MINT-1T: En 10 gange stÃļrre skala, der inkluderer en billion tekst tokens og 3,4 milliarder billeder mere end eksisterende ÃĨbne kilde-datasets. MINT-1T-datasettet introducerer ogsÃĨ aldrig tidligere sette kilder sÃĨsom PDF-filer og ArXiv-papirer. Da multimodale sammenflettede datasets ikke skalerer let, er det vigtigt, at MINT-1T-datasettet deler datakureringprocessen, sÃĨ andre ogsÃĨ kan udfÃļre eksperimenter pÃĨ sÃĨdanne informationsrige varianter. MINT-1T-datasettet demonstrerer, at dens metode; LM-modeller trÃĶnet pÃĨ MINT-1T er konkurrencedygtige (omend noget) til tidligere state-of-the-art OBELICS.












