AI-modeller og platforme

MINT-1T: Skalerer åbent kilde-multimodal data med 10 gange

mm
Føj Unite.AI til dine foretrukne kilder på Google

Træning af store multimodale modeller (LMM) kræver store datasets med sammenflettede sekvenser af billeder og tekst i fri form. Selvom åbne kilde-LMM’er er udviklet hurtigt, er der stadig en stor mangel på multimodale sammenflettede datasets i åbent kilde, der er til rådighed. Betoningen af disse datasets kan ikke overdrives, da de danner grundlaget for at skabe avancerede AI-systemer, der kan forstå og generere indhold på tværs af forskellige modaliteter. Uden en tilstrækkelig forsyning af omfattende, sammenflettede datasets, er potentialet for at udvikle mere avancerede og kapable LMM’er betydeligt hæmmet. Disse datasets giver mulighed for, at modeller kan lære fra en bred vifte af indgange, hvilket gør dem mere alsidige og effektive i forskellige anvendelser. Desuden stiller manglen på sådanne datasets en udfordring for den åbne kilde-samfund, der afhænger af fælles ressourcer til at drive innovation og samarbejde.

Åbne kilde-LMM’er har gjort betydelige fremskridt i de seneste år, men deres vækst er hæmmet af den begrænsede tilgængelighed af store, sammenflettede datasets. For at overvinde dette hindringsmoment er samarbejdende bestræbelser nødvendige for at kuraterer, annotere og udgive mere omfattende datasets, der kan understøtte den fortsatte udvikling og forbedring af multimodale modeller. Derudover indebærer skabelsen og formidlingen af disse datasets at overvinde flere tekniske og logistiske hindringer. Dataindsamlingen skal være omfattende og repræsentativ for de forskellige kontekster, hvori LMM’er vil blive anvendt. Annotation kræver omhyggelig overvejelse for at sikre, at de sammenflettede sekvenser af billeder og tekst er aligneret på en måde, der forbedrer modellens læringsfærdigheder. Desuden indebærer det at sikre, at datasets er åbne kilde, at man skal tackle retlige og etiske overvejelser i forhold til dataintegritet og brugsrettigheder. At udvide tilgængeligheden af højkvalitets, store multimodale sammenflettede datasets er afgørende for fremtiden for AI-forskning og udvikling. Ved at tackle den nuværende mangel kan AI-samfundet fremme større innovation og samarbejde, hvilket fører til skabelsen af mere kraftfulde og alsidige LMM’er, der kan tackle komplekse, virkelige problemer.

Bygget på denne tanke er MINT-1T, den største og mest diverse multimodale sammenflettede åbne kilde-dataset til dato. MINT-1T: En 10 gange større skala, der inkluderer en billion tekst tokens og 3,4 milliarder billeder mere end eksisterende åbne kilde-datasets. MINT-1T-datasettet introducerer også aldrig tidligere sette kilder såsom PDF-filer og ArXiv-papirer. Da multimodale sammenflettede datasets ikke skalerer let, er det vigtigt, at MINT-1T-datasettet deler datakureringprocessen, så andre også kan udføre eksperimenter på sådanne informationsrige varianter. MINT-1T-datasettet demonstrerer, at dens metode; LM-modeller trænet på MINT-1T er konkurrencedygtige (omend noget) til tidligere state-of-the-art OBELICS.

MINT-1T: Et multimodalt dataset med en billion tokens

Store åbne kilde-forudgående træningsdatasets har været afgørende for forskningssamfundet i at udforske dataingeniørarbejde og træne gennemsigtige, åbne kilde-modeller. I tekstdomænet har tidlige værker såsom C4 og The Pile spillet en afgørende rolle i at enable samfundet til at træne de første åbne kilde-store sprogmodeller såsom GPT-J, GPT-Neo og andre. Disse grundlæggende bestræbelser åbnede også vejen for efterfølgende forbedringer af datafiltreringsmetoder og skalerbarhed. Ligeledes i billed-tekst-rummet har store åbne kilde-datasets fremmet innovationer i bedre datakureringmetoder, såsom Datafilternetværk og T-MARS. Der er en tydelig skiftning fra frontlaboratorier til træning af store multimodale modeller (LMM’er), der kræver omfattende multimodale sammenflettede datasets bestående af frie sekvenser af billeder og tekst. Da kapaciteten af frontmodeller udvikler sig hurtigt, opstår der en betydelig lukke i multimodal træningsdata mellem lukkede og åbne kilde-modeller. Nuværende åbne kilde-multimodale sammenflettede datasets er mindre og mindre diverse end deres tekst-baserede modstykke, idet de primært stammer fra HTML-dokumenter, hvilket begrænser bredde og variation af data. Denne begrænsning hæmmer udviklingen af robuste åbne kilde-LMM’er og skaber en ulighed mellem kapaciteten af åbne og lukkede modeller.

For at tackle denne lukke blev MINT-1T skabt som det største og mest diverse åbne kilde-multimodale sammenflettede dataset til dato. MINT-1T indeholder i alt en billion tekst tokens og tre milliarder billeder, hentet fra forskellige kilder såsom HTML, PDF’er og ArXiv. Før MINT-1T var det største åbne kilde-dataset i dette område OBELICS, der indeholdt 115 milliarder tekst tokens og 353 millioner billeder, alle hentet fra HTML.

Bidragene fra MINT-1T er følgende:

  • Dataingeniørarbejde: Skalerbarhed af denne multimodale sammenflettede data repræsenterer mere en ingeniørudfordring end opbygning af enten tekst-baserede eller billed-tekst-par-datasets. Håndtering af større dokumentsstørrelser og bevarelse af den oprindelige rækkefølge af billeder og tekst er afgørende.
  • Mangfoldighed: MINT-1T er den første i det multimodale sammenflettede rum til at samle højkvalitets multimodale dokumenter i stor skala fra kilder såsom CommonCrawl PDF’er og ArXiv.
  • Model-eksperimenter: Eksperimenter viser, at LMM’er trænet på MINT-1T ikke kun matcher, men potentielt overgår præstationen af modeller trænet på det bedste eksisterende åbne kilde-dataset, OBELICS, mens de tilbyder en ti fold forøgelse af skala.

MINT-1T: Konstruktion af datasettet

MINT-1T kuraterer et stort åbent kilde-dataset, der udnytter mere diverse kilder af sammenflettede dokumenter, såsom PDF’er og ArXiv-papirer. Dette afsnit detaljerer MINT-1T’s metoder for at indsamle multimodale dokumenter, filtrere lavkvalitetsindhold, deduplicere data og fjerne ikke-sikre-for-arbejde (NSFW) eller uønsket materiale. Det endelige dataset består af 922 milliarder (B) HTML-tokens, 106B PDF-tokens og 9B ArXiv-tokens.

Indsamling af store mængder af multimodale dokumenter

HTML-rørledning

MINT-1T følger OBELICS’s metode for at trække sammenflettede multimodale dokumenter fra CommonCrawl WARC-filer ved at parse hver WARC-entries DOM-træ. Mens OBELICS kun behandlede dokumenter fra februar 2020 til februar 2023 CommonCrawl-dumps, har MINT-1T udvidet dokumentpuljen til at inkludere HTML-dokumenter fra maj 2017 til april 2024 (med fulde dumps fra oktober 2018 til april 2024 og delvise dumps fra tidligere år). Ligesom OBELICS filtrerer MINT-1T ud dokumenter, der indeholder ingen billeder, mere end tredive billeder eller billeder med URL’er, der indeholder upassende understreng, såsom logo, avatar, porn og xxx.

PDF-rørledning

MINT-1T indsamler PDF-dokumenter fra CommonCrawl WAT-filer fra februar 2023 til april 2024-dumps. Først udtrækkes alle PDF-links fra disse dumps. MINT-1T forsøger derefter at downloade og læse PDF’er ved hjælp af PyMuPDF, og forkaster PDF’er over 50MB (som sandsynligvis indeholder store billeder) og dem over 50 sider lange. Sider uden tekst er ekskluderet, og en læseorden fastlægges for de resterende sider. Læseorden fastlægges ved at finde tekstblokkernes bundtede kasse på en side, gruppere blokkene efter kolonner og ordne dem fra toppen til bunden.

ArXiv-rørledning

MINT-1T bygger ArXiv-sammenflettede dokumenter fra LaTeX-kildekode ved hjælp af TexSoup til at finde figur-tags og sammenflette billeder med papirets tekst. For multifile-papirer identificerer MINT-1T hoved-Tex-filen og erstatter input-tags med indholdet af dens filer. LaTeX-koden renses ved at fjerne import, bibliografi, tabeller og citation-tags. Da ArXiv allerede er en højtidligt kurateret datakilde, udføres der ingen yderligere filtrering og deduplikation.

Tekst-kvalitetsfiltrering

MINT-1T undgår at bruge model-baserede heuristikker til tekstfiltrering, følger praksis etableret af RefinedWeb, Dolma og FineWeb. Først elimineres ikke-engelske dokumenter ved hjælp af Fasttext’s sprogidentifikationsmodel (med en tillidstærskel på 0,65). Dokumenter med URL’er, der indeholder NSFW-understreng, fjernes for at ekskludere pornografisk og uønsket indhold. Tekstfiltreringsmetoder fra RefinedWeb anvendes, specifikt fjernelse af dokumenter med overmål af duplikerede n-grammer eller dem, der identificeres som lavkvalitets ved hjælp af MassiveText-regler.

Billedefiltrering

Efter kuratering af PDF’er og HTML-filer forsøger MINT-1T at downloade alle billed-URL’er i HTML-datasettet, forkaster ikke-hentelige links og fjerner dokumenter med ingen gyldige billed-links. Billeder mindre end 150 pixel forkastes for at undgå støjende billeder såsom logoer og ikoner, og billeder større end 20.000 pixel fjernes, da de normalt svarer til off-topic-billeder. For HTML-dokumenter fjernes billeder med et aspektforhold større end to for at filtrere ud lavkvalitetsbilleder såsom reklamebanner. For PDF’er justeres grænsen til tre for at bevare videnskabelige figurer og tabeller.

Figuren ovenfor repræsenterer, hvordan MINT-1T unikt inkluderer data fra PDF’er og ArXiv-dokumenter ud over HTML-kilder.

Sikkerhedsfiltrering

  • NSFW-billedefiltrering: MINT-1T anvender en NSFW-billeddetektor til alle billeder i datasettet. Hvis et dokument indeholder et enkelt NSFW-billede, forkastes hele dokumentet.
  • Fjernelse af personligt identificerbart information: For at mindske risikoen for personlige dataleaks anonymiseres e-mail-adresser og IP-adresser i tekstdataen. E-mail-adresser erstattes med skabeloner såsom “email@example.com” og IP-adresser med tilfældigt genererede ikke-funktionelle IP-adresser.

Deduplikation

MINT-1T udfører afsnit- og dokumenttekstdeduplikation inden for hver CommonCrawl-snapshot og billededuplikation for at fjerne gentagne, uproduktive billeder såsom ikoner og logoer. Alle deduplikationstrin udføres separat for hver datakilde.

Afsnit- og dokumentdeduplikation

Følger Dolma’s metode, bruger MINT-1T en Bloom-filter til effektiv tekstdeduplikation, sætter den falske positivt rate til 0,01 og deduplicerer 13-gram-afsnit (indikeret gennem dobbelt newline-delimitere) fra hvert dokument. Hvis mere end 80% af et documents afsnit er duplikater, forkastes hele dokumentet.

Fjernelse af fælles kildedele

Efter afsnitsdeduplikation fjerner MINT-1T korte fælles kildedele i HTML-dokumenter, såsom “Spring til indhold” eller “Blog-arkiv”. Dette udføres ved at køre eksakt afsnitsdeduplikation på 2% af hver CommonCrawl-snapshot, i overensstemmelse med CCNet-praksis, hvilket sikrer, at det meste af det fjernede er fælles kildedele.

Figuren ovenfor demonstrerer filtreringsprocessen for MINT-1T og viser, hvordan tokens fjernes gennem datapipelinen for HTML, PDF’er og ArXiv-papirer.

Billededuplikation

Inden for hver CommonCrawl-snapshot fjerner MINT-1T hyppigt forekommende billeder baseret på SHA256-hashes. I stedet for streng deduplikation fjernes kun billeder, der optræder mere end ti gange inden for en snapshot, følger Multimodal-C4-praksis. I overensstemmelse med OBELICS fjernes gentagne billeder inden for et enkelt dokument, og kun den første forekomst bevares.

Infrastruktur

Gennem hele dataprocessen havde MINT-1T adgang til en gennemsnit på 2.350 CPU-kerner fra en blanding af 190-processor- og 90-processor-noder. I alt blev omkring 4,2 millioner CPU-timer brugt til at bygge dette dataset.

Sammenligning af dokumentkomposition i MINT-1T med OBELICS

Ved evaluering af sammensætningen af sammenflettede datasets, er to nøglekarakteristika under undersøgelse: fordelingen af tekst tokens pr. dokument og antallet af billeder pr. dokument. Til denne analyse blev 50.000 dokumenter tilfældigt udvalgt fra både OBELICS og hver datakilde i MINT-1T. GPT-2’s tokenizer blev brugt til at beregne antallet af tekst tokens. Udviklinger blev fjernet ved at ekskludere dokumenter, der faldt uden for 1,5 interquartilområdet for antallet af tekst tokens og billeder. Som vist i følgende figur, ligner HTML-undermængden af MINT-1T tæt på tokenfordelingen set i OBELICS. Dog tenderer dokumenter hentet fra PDF’er og ArXiv til at være længere end HTML-dokumenter i gennemsnit, hvilket understreger fordelene ved at hente data fra diverse kilder. Figur 5 undersøger billedtætheden på tværs af alle dokumenter, og afslører, at PDF’er og ArXiv-dokumenter indeholder flere billeder sammenlignet med HTML-dokumenter, med ArXiv-prøver som de mest billedtætte.

Hvordan forbedrer forskellige datakilder dokumentmangfoldighed?

En vigtig motivation for at udvide puljen af multimodale dokumenter ud over HTML er forbedringen af domæne-dækning. For at kvantificere mangfoldigheden og dybden af denne dækning, blev en Latent Dirichlet Allocation (LDA)-model trænet på 100.000 dokumenter udvalgt fra OBELICS-datasettet, HTML-undermængden af MINT-1T og PDF-undermængden (eksklusive ArXiv) fra MINT-1T for at få 200 emner. GPT-4 blev derefter brugt til at klassificere sættet af ord for at identificere de dominerende domæner – såsom Sundhed & Medicin, Videnskab, Forretning, Humaniora, Historie osv. – baseret på MMMU-domæner. Analysen afslører distinkte tendenser i domænefordeling:

  • OBELICS: Dette dataset viser en markant koncentration i “Humaniora og Samfundsvidenskab”. Dette kan tilskrives dens datakonstruktionsproces, der indebærer at filtrere ud dokumenter, der ikke ligner Wikipedia-artikler, hvilket potentielt kan ændre fordelingen til mere generel viden og humaniora-fokuseret indhold.
  • MINT-1T’s HTML-undermængde: I modsætning til OBELICS er MINT-1T’s HTML-undermængde ikke stærkt fordelt mod en bestemt domæne, hvilket antyder en bredere og mere balanceret domæne-repræsentation.
  • MINT-1T’s PDF-undermængde: Der er en højere proportion af “Videnskab og Teknologi”-dokumenter inden for PDF-dokumenterne i MINT-1T. Denne tendens skyldes sandsynligvis naturen af videnskabelig kommunikation, hvor PDF’er er den foretrukne format for at dele detaljerede forskningspapirer og tekniske rapporter.

MINT-1T: Resultater og eksperimenter

Til alle eksperimenter træner MINT-1T modellen på 50% billed-tekst-kapitulationsbatch og 50% multimodale sammenflettede batch. Et maksimum på 2048 multimodale tokens udtrækkes fra hvert sammenflettet dokument og 340 tokens fra hvert billed-tekst-eksempel. Ligesom Flamingo, tilføjes en “end”-token for at indikere slutningen af en nærliggende billed-tekst-sekvens. Under træning dropes 50% af enkeltbilled-sammenflettede dokumenter tilfældigt for at oversample multi-billed-dokumenter. Billed-tekst-datasettet består af en blanding af internt kuraterede kapitel-datasets. Modellens evne til at resonere om multimodale sammenflettede sekvenser vurderes gennem dets kontekstlæringsfærdigheder og multi-billed-ræsoneringspræstation.

Figuren ovenfor illustrerer procentdelen af dokumenter fra hvert domæne i MMMU for OBELICS og undermængder af MINT-1T.

Kontekstlæring: Modellerne vurderes på fire-skud- og otte-skud-kontekstlæringspræstation på forskellige kapitel-benchmark (COCO (Karpathy-test) og TextCaps (validering)) og billed-spørgsmål-datasets (VQAv2 (validering), OK-VQA (validering), TextVQA (validering) og VizWiz (validering)). Demonstrations er tilfældigt udvalgt fra træningssettet. Scoren er gennemsnittet over multiple vurderingsløb, med tilfældigt valgte prompts for at tage hensyn til følsomhed overfor valgte prompts. Forskellige prompts er ablateret for hver opgave for at vælge den bedst performende.

Multi-billed-ræsonering: Modeller vurderes på MMMU (indeholdende både enkelt- og multi-billed-spørgsmål) og Mantis-Eval (alle multi-billed-spørgsmål) for at undersøge multi-billed-ræsoneringsfærdigheder ud over kontekstlæringsvurderinger.

Træning på HTML-dokumenter

Initialt sammenlignes HTML-delen af MINT-1T med OBELICS, da OBELICS er det tidligere førende sammenflettede dataset, også kurateret fra HTML-dokumenter. To modeller trænes på HTML-delene af MINT-1T og OBELICS i alt 10B multimodale tokens. Deres kontekstlæringspræstation vurderes. Følgende tabel præsenterer fire-skud- og otte-skud-præstation på fælles benchmark; modellen trænet på MINT-1T’s HTML-dokumenter præsterer bedre end OBELICS på VQA-opgaver, men dårligere på kapitel-benchmark. I gennemsnit præsterer OBELICS lidt bedre end MINT-1T (HTML).

Tilføjelse af PDF- og ArXiv-dokumenter

Herefter udføres træning på MINT-1T’s fulde datakilder, med en blanding af HTML-, PDF- og ArXiv-dokumenter. De sammenflettede dokumenter udtrækkes med 50% fra HTML, 45% fra PDF’er og 5% fra ArXiv. Modellen trænes i alt 10B multimodale tokens. Som vist i ovenstående tabel, overgår modellen trænet på det fulde MINT-1T-dataset både OBELICS og MINT-1T (HTML) på de fleste kontekstlæringsbenchmark. På mere komplekse multimodale ræsoneringsbenchmark overgår MINT-1T-modellen OBELICS på MMMU, men præsterer dårligere på Mantis-Eval.

Finere tendenser

Hvordan skalerer kontekstlæringspræstation med demonstrationsantal?

Kontekstlæringspræstation vurderes, når modellen præsenteres med ét til otte demonstrations eksempler. En enkelt prøve pr. skudantal udføres for hver vurderingsbenchmark. Som vist i følgende figur, overgår modellen trænet på MINT-1T modellen trænet på MINT-1T’s HTML-undermængde og OBELICS over alle skud. MINT-1T’s (HTML)-modellen præsterer lidt dårligere end OBELICS.

Præstation på kapitel- og billed-spørgsmål-opgaver

Følgende figur præsenterer den gennemsnitlige kontekstlæringspræstation på kapitel- og billed-spørgsmål-benchmark. OBELICS overgår alle MINT-1T-varianter på fire-skud-kapitel-benchmark og præsterer lidt dårligere sammenlignet med MINT-1T på otte-skud-kapitel. Dog overgår MINT-1T betydeligt OBELICS på VQA-benchmark. MINT-1T (HTML) overgår også OBELICS på VQA-opgaver.

Præstation på forskellige domæner

Inklusion af diverse domæner i MINT-1T sigter mod at forbedre modellens generaliseringsfærdighed. Figuren tidligere viser præstation på MMMU for hvert domæne. Undtagen for Forretning-domænet overgår MINT-1T både OBELICS og MINT-1T (HTML). Præstationsforøgelsen i Videnskab og Teknologi-domæner for MINT-1T tilskrives forekomsten af disse domæner i ArXiv- og PDF-dokumenter.

Afsluttende tanker

I denne artikel har vi talt om MINT-1T, det største og mest diverse multimodale sammenflettede åbne kilde-dataset til dato. MINT-1T: En 10 gange større skala, der inkluderer en billion tekst tokens og 3,4 milliarder billeder mere end eksisterende åbne kilde-datasets. MINT-1T-datasettet introducerer også aldrig tidligere sette kilder såsom PDF-filer og ArXiv-papirer. Da multimodale sammenflettede datasets ikke skalerer let, er det vigtigt, at MINT-1T-datasettet deler datakureringprocessen, så andre også kan udføre eksperimenter på sådanne informationsrige varianter. MINT-1T-datasettet demonstrerer, at dens metode; LM-modeller trænet på MINT-1T er konkurrencedygtige (omend noget) til tidligere state-of-the-art OBELICS.

Kunal Kejriwal er en backend-ingeniør med speciale i Python, PostgreSQL, Redis og cloud-infrastruktur på GCP og AWS. Med tre års erfaring i at bygge og skalere produktionssystemer skriver han om AI-infrastruktur, distribuerede systemer og arkitekturen bag implementering af maskinlæringsarbejdsbelastninger.