AI-modeller og plattformer
MINT-1T: Skalerer åpne kilde multimodale data med 10x
Trening av store multimodale modeller (LMM) krever store skala datasett med sammenflettede sekvenser av bilder og tekst i fri form. Selv om åpne kilde LMM har utviklet seg raskt, er det fortsatt en stor mangel på multimodale sammenflettede datasett på skala som er åpne kilde. Viktigheten av disse datasettene kan ikke overdrives, da de danner grunnlaget for å lage avanserte AI-systemer som kan forstå og generere innhold på tvers av ulike modi. Uten en tilstrekkelig forsyning av omfattende, sammenflettede datasett, er potensialet for å utvikle mer avanserte og kapable LMMer betydelig hemmet. Disse datasettene gjør det mulig for modellene å lære fra en mangfoldig rekke innputt, noe som gjør dem mer allsidige og effektive i ulike applikasjoner. Videre utgjør mangelen på slike datasett en utfordring for åpne kilde-samfunnet, som avhenger av felles ressurser for å drive innovasjon og samarbeid.
Åpne kilde LMM har gjort betydelige fremskritt i de siste årene, men deres vekst er hemmet av den begrensede tilgjengeligheten av store skala datasett. For å overvinne dette hindret, er samordnede innsats nødvendig for å kurere, annotere og slippe ut mer omfattende datasett som kan støtte den pågående utviklingen og finjusteringen av multimodale modeller. I tillegg innebærer skapelsen og distribusjonen av disse datasettene å overvinne flere tekniske og logistiske hindre. Datainnsamlingen må være omfattende og representativ for de ulike kontekstene hvor LMMer vil bli brukt. Annotering krever omhyggelig overveielse for å sikre at de sammenflettede sekvensene av bilder og tekst er justert på en måte som forbedrer modellens læringsmuligheter. Dessuten innebærer å sikre at datasettene er åpne kilde å håndtere juridiske og etiske overveielser relatert til datavern og bruksrettigheter. Utvidelsen av tilgjengeligheten av høykvalitets, store skala multimodale sammenflettede datasett er essensiell for fremtiden til AI-forskning og utvikling. Ved å håndtere den nåværende mangelen, kan AI-samfunnet fremme større innovasjon og samarbeid, noe som leder til skapelsen av mer kraftfulle og allsidige LMMer som kan håndtere komplekse, virkelige problemer.
Bygget på denne tanken, er MINT-1T det største og mest diverse multimodale sammenflettede åpne kilde datasett til dags dato. MINT-1T: En 10x større skala, inkludert en billion teksttoken og 3,4 milliarder bilder enn eksisterende åpne kilde datasett. MINT-1T-datasett introduserer også aldri tidligere eksponerte kilder som PDF-filer og ArXiv-papirer. Ettersom multimodale sammenflettede datasett ikke skalerer lett, er det viktig at MINT-1T-datasett deler datakureringprosessen så andre også kan utføre eksperimenter på slike informasjonsrike varianter. MINT-1T-datasett demonstrerer at dens metode; LM-modeller trent på MINT-1T er konkurrerende (om enn noe) til tidligere statlige OBELICS.
MINT-1T: Et multimodalt datasett med en billion token
Store åpne kilde forhånds-trening datasett har vært avgjørende for forskningssamfunnet i å utforske dataingeniør og trene gjennomsiktige, åpne kilde modeller. I tekstdomenet, spilte tidlige arbeider som C4 og The Pile en avgjørende rolle i å muliggjøre samfunnet å trene den første rekken av åpne kilde store språkmodeller som GPT-J, GPT-Neo og andre. Disse grunnleggende innsatsene åpnet også veien for påfølgende forbedringer i datafiltreringsmetoder og skaleringsmuligheter. Tilsvarende i bilde-tekst-rommet, har store åpne kilde datasett fremmet innovasjoner i bedre datakureringmetoder, som Data filtering networks og T-MARS. Det er en merkbart skifte fra frontier labs mot å trene store multimodale modeller (LMM) som krever omfattende multimodale sammenflettede datasett bestående av frie sekvenser av bilder og tekst. Ettersom kapasiteten til frontier-modeller utvikler seg raskt, oppstår det en betydelig gap i multimodal treningdata mellom lukkede og åpne kilde modeller. Nåværende åpne kilde multimodale sammenflettede datasett er mindre og mindre diverse enn deres tekst-bare motparter, hovedsakelig hentet fra HTML-dokumenter, noe som begrenser bredde og variasjon av data. Denne begrensningen hemmer utviklingen av robuste åpne kilde LMMer og skaper en ulikhet mellom kapasiteten til åpne og lukkede kilde modeller.
For å løse dette gapet, ble MINT-1T skapt som det største og mest diverse åpne kilde multimodale sammenflettede datasett til dags dato. MINT-1T inneholder totalt en billion teksttoken og tre milliarder bilder, hentet fra ulike kilder som HTML, PDF og ArXiv. Før MINT-1T var det største åpne kilde datasett i dette området OBELICS, som inkluderte 115 milliarder teksttoken og 353 millioner bilder, alle hentet fra HTML.

Bidragene til MINT-1T er følgende:
- Dataingeniør: Skalering av dette multimodale sammenflettede data presenterer mer en en ingeniørutfordring enn å bygge enten tekst-bare eller bilde-tekst par datasett. Håndtering av større dokumentstørrelser og bevare den opprinnelige rekkefølgen av bilder og tekst er avgjørende.
- Mangfold: MINT-1T er den første i det multimodale sammenflettede rommet til å samle høykvalitets multimodale dokumenter i stor skala fra kilder som CommonCrawl PDF og ArXiv.
- Modell-eksperimenter: Eksperimenter viser at LMMer trent på MINT-1T ikke bare matcher, men også potensielt overgår ytelsen til modeller trent på den beste eksisterende åpne kilde datasett, OBELICS, samtidig som det tilbyr en ti ganger større skala.
MINT-1T: Konstruksjon av datasett
MINT-1T kuraterer et stort åpne kilde datasett som utnytter mer diverse kilder av sammenflettede dokumenter, som PDF og ArXiv-papirer. Denne delen detaljerer MINT-1T-metodene for å hente multimodale dokumenter, filtrere lavkvalitetsinnhold, deduplisere data og fjerne ikke-sikre-for-arbeid eller uønsket materiale. Det endelige datasett består av 922 milliarder (B) HTML-token, 106B PDF-token og 9B ArXiv-token.
Henting av store mengder multimodale dokumenter
HTML-pipeline
MINT-1T følger OBELICS-metoden for å trekke ut sammenflettede multimodale dokumenter fra CommonCrawl WARC-filer ved å parse hver WARC-inngangs DOM-tre. Mens OBELICS bare prosesserte dokumenter fra februar 2020 til februar 2023 CommonCrawl-dumper, har MINT-1T utvidet dokumentpotten til å inkludere HTML-dokumenter fra mai 2017 til april 2024 (med fullstendige dumper fra oktober 2018 til april 2024 og delvis dumper fra tidligere år). Tilsvarende som OBELICS, filtreres dokumenter som inneholder ingen bilder, mer enn tretti bilder eller bilder med URL som inkluderer upassende substringer som logo, avatar, porn og xxx.
PDF-pipeline
MINT-1T henter PDF-dokumenter fra CommonCrawl WAT-filer fra februar 2023 til april 2024-dumper. Først blir alle PDF-lenker trukket ut fra disse dumpene. MINT-1T forsøker deretter å laste ned og lese PDF-er ved hjelp av PyMuPDF, og forkaster PDF-er over 50MB (sannsynligvis inneholdende store bilder) og de over 50 sider lange. Sider uten tekst blir ekskludert, og en leserekkefølge blir etablert for de gjenværende sidene. Leserekkefølgen bestemmes ved å finne tekstblokkens begrensning på hver side, gruppere blokkene basert på kolonner og ordne dem fra øverst til venstre til nederst til høyre. Bilder integreres i sekvensen basert på deres nærhet til tekstblokker på samme side.

ArXiv-pipeline
MINT-1T bygger ArXiv-sammenflettede dokumenter fra LaTeX-kildekode ved hjelp av TexSoup for å finne figuretags og sammenflette bilder med papiret. For multifile-papirer identifiserer MINT-1T hoved-Tex-filen og erstatter input-tags med innholdet av dens filer. LaTeX-koden renses ved å fjerne import, bibliografi, tabeller og sitat-tags. Ettersom ArXiv allerede er en høyt kurert datakilde, blir ingen ytterligere filtrering og deduplisering utført.
Tekst-kvalitetsfiltrering
MINT-1T unngår å bruke modell-baserte heuristiske metoder for tekstfiltrering, og følger praksis etablert av RefinedWeb, Dolma og FineWeb. Først blir ikke-engelske dokumenter eliminert ved hjelp av Fasttext-språkidentifikasjonsmodell (med en konfidens-terskel på 0,65). Dokumenter med URL som inneholder ikke-sikre-for-arbeid-substringer blir også fjernet for å ekskludere pornografisk og uønsket innhold. Tekstfiltreringsmetoder fra RefinedWeb blir brukt, spesielt fjerning av dokumenter med overflod av duplikate n-grammer eller de som blir identifisert som lavkvalitets ved hjelp av MassiveText-regler.
Bilde-filtrering
Etter kurering av PDF-er og HTML-filer, forsøker MINT-1T å laste ned alle bilde-URL-er i HTML-datasett, og forkaster ikke-hentbare lenker og fjerner dokumenter uten gyldige bilde-lenker. Bilder mindre enn 150 piksler blir forkastet for å unngå støyende bilder som logoer og ikoner, og bilder større enn 20 000 piksler blir også fjernet da de vanligvis korresponderer med utenfor-emne-bilder. For HTML-dokumenter blir bilder med et forhold større enn to fjernet for å filtrere ut lavkvalitetsbilder som reklamebanner. For PDF-er blir terskelen justert til tre for å bevare vitenskapelige figurer og tabeller.

Figuen ovenfor representerer hvordan MINT-1T unikt inkluderer data fra PDF-er og ArXiv-dokumenter utover HTML-kilder.
Sikkerhetsfiltrering
- Ikke-sikre-for-arbeid-bilde-filtrering: MINT-1T anvender en ikke-sikre-for-arbeid-bilde-detektor på alle bilder i datasett. Hvis et dokument inneholder ett enkelt ikke-sikre-for-arbeid-bilde, blir hele dokumentet forkastet.
- Fjerning av personlig identifiserbar informasjon: For å minimere risikoen for personlig datalekkasje, blir e-postadresser og IP-adresser i tekstdata anonymisert. E-postadresser blir erstattet med maler som “e-post@example.com” og IP-adresser med tilfeldig genererte ikke-funksjonelle IP-adresser.
Deduplisering
MINT-1T utfører avsnitts- og dokumenttekstdeduplisering innen hver CommonCrawl-snapshot og bilde-deduplisering for å fjerne repetitive, uinformativt bilder som ikoner og logoer. Alle dedupliseringstrinn blir utført separat for hver datakilde.
Avsnitts- og dokumentdeduplisering
Følgende Dolmas metode, bruker MINT-1T en Bloom-filter for effektiv tekst-deduplisering, og setter feilpositivitetsraten til 0,01 og dedupliserer 13-gram-avsnitt (indikert ved dobbelt newline-delimitere) fra hvert dokument. Hvis mer enn 80% av et documents avsnitt er duplikater, blir hele dokumentet forkastet.
Fjerning av felles koblings-tekst
Etter avsnitts-deduplisering, fjerner MINT-1T korte felles koblings-setninger i HTML-dokumenter, som “Hopp til innhold” eller “Blogg-arkiv”. Dette blir gjort ved å kjøre eksakt avsnitts-deduplisering på 2% av hver CommonCrawl-snapshot, i linje med CCNet-praksis, og sikrer hovedsakelig fjerning av felles koblings-tekst.

Figuen ovenfor demonstrerer filtreringsprosessen for MINT-1T, og viser hvordan token blir fjernet gjennom hele datapipen for HTML, PDF og ArXiv-papirer.
Bilde-deduplisering
Innen hver CommonCrawl-snapshot, fjerner MINT-1T ofte forekommende bilder basert på SHA256-hashes. I stedet for streng deduplisering, blir bare bilder som opptrer mer enn ti ganger innen en snapshot fjernet, i henhold til Multimodal-C4-praksis. Konsistent med OBELICS, blir gjentatte bilder innen ett dokument fjernet, og bare den første forekomsten beholdt.
Infrastruktur
Gjennom hele dataprosessen, hadde MINT-1T tilgang til en gjennomsnittlig 2 350 CPU-kjerner fra en blanding av 190-prosessor- og 90-prosessor-noder. Totalt ble omtrent 4,2 millioner CPU-timer brukt til å bygge dette datasett.
Sammenligning av dokumentkomposisjon i MINT-1T med OBELICS
Ved å evaluere komposisjonen av sammenflettede datasett, blir to nøkkelkarakteristika undersøkt: fordelingen av teksttoken per dokument og antall bilder per dokument. For denne analysen ble 50 000 dokumenter tilfeldig utvalgt fra både OBELICS og hver datakilde i MINT-1T. GPT-2s tokenizer ble brukt til å beregne antall teksttoken. Outlierne ble fjernet ved å ekskludere dokumenter som lå utenfor 1,5 interkvartilområde for antall teksttoken og bilder. Som vist i figuren nedenfor, ligner HTML-undermengden av MINT-1T nært på tokenfordelingen i OBELICS. Imidlertid er dokumenter hentet fra PDF-er og ArXiv vanligvis lengre enn HTML-dokumenter i gjennomsnitt, noe som understreker fordelen av å hente data fra ulike kilder. Figuren nedenfor undersøker bilde-tettheten over alle dokumenter, og viser at PDF-er og ArXiv-dokumenter inneholder flere bilder sammenlignet med HTML-dokumenter, med ArXiv-eksempler som de mest bilde-tette.

Hvordan ulike datakilder forbedrer dokumentmangfold?
En viktig motivasjon for å utvide mengden av multimodale dokumenter utover HTML er å forbedre domene-dekning. For å kvantifisere mangfoldet og dybden av denne dekningen, ble en Latent Dirichlet Allocation (LDA)-modell trent på 100 000 dokumenter sampet fra OBELICS-datasett, HTML-undermengden av MINT-1T og PDF-undermengden (ekskludert ArXiv) fra MINT-1T for å få 200 emner. GPT-4 ble deretter brukt til å klassifisere settet av ord for å identifisere de dominerende domenene – som helse og medisin, vitenskap, forretning, humaniora, historie osv. – basert på MMMU-domener. Analysen avslører distinkte trender i domene-fordeling:
- OBELICS: Dette datasett viser en markant konsentrasjon i “Humaniora og samfunnsvitenskap”. Dette kan tilskrives dens datakonstruksjonsprosess, som inkluderer å filtrere ut dokumenter som ikke ligner Wikipedia-artikler, noe som potensielt kan endre fordelingen til mer generell kunnskap og humaniora-fokusert innhold.
- MINT-1Ts HTML-undermengde: I motsetning til OBELICS, er HTML-undermengden av MINT-1T ikke sterkt forvrengt mot noen bestemt domene, noe som tyder på en bredere og mer balansert domene-representasjon.
- MINT-1Ts PDF-undermengde: Det er en høyere andel “Vitenskap og teknologi”-dokumenter innen PDF-dokumentene i MINT-1T. Denne trenden er sannsynligvis på grunn av naturen til vitenskapelig kommunikasjon, hvor PDF-er er det foretrukne formatet for å dele detaljerte forskningspapirer og tekniske rapporter.
MINT-1T: Resultater og eksperimenter
For alle eksperimenter, trener MINT-1T modellen på 50% bilde-tekst-underskrift-batch og 50% multimodale sammenflettede batch. Et maksimum på 2048 multimodale token blir sampet fra hver sammenflettet dokument og 340 token fra hver bilde-tekst-eksempel. Tilsvarende som Flamingo, blir en “slutt”-token lagt til for å indikere slutten på en nærliggende bilde-tekst-sekvens. Under trening, blir 50% av enkelt-bilde-sammenflettede dokumenter tilfeldig droppet for å oversample multi-bilde-dokumenter. Bilde-tekst-datasett består av en blanding av internt kurerte undertekst-datasett. Modellens evne til å resonnere om multimodale sammenflettede sekvenser blir vurdert gjennom dens kontekst-læringsmuligheter og multi-bilde-resonans-prestasjon.

Figuen ovenfor viser prosentandelen av dokumenter fra hver domene i MMMU for OBELICS og undermengder av MINT-1T.
Kontekst-læringsmuligheter: Modellene blir evaluert på fire-skudd- og åtte-skudd-kontekst-læringsprestasjon på ulike undertekst-benchmark (COCO (Karpathy-test) og TextCaps (validering)) og visuell-spørsmål-svar-datasett (VQAv2 (validering), OK-VQA (validering), TextVQA (validering) og VizWiz (validering)). Demonstrasjonene blir tilfeldig sampet fra treningssettet. Poengene blir gjennomsnittlig over flere evalueringer, med tilfeldig valgte demonstrasjoner for å håndtere sensitivitet til valgte promter. Forskjellige promter blir ablatert for hver oppgave for å velge den best presterte.
Multi-bilde-resonans: Modeller blir evaluert på MMMU (som inneholder både enkelt- og multi-bilde-spørsmål) og Mantis-Eval (alle multi-bilde-spørsmål) for å undersøke multi-bilde-resonans-evner utover kontekst-lærings-evalueringer.
Trening på HTML-dokumenter
Først blir HTML-delen av MINT-1T sammenlignet med OBELICS, da OBELICS er det tidligere ledende sammenflettede datasett, også kurert fra HTML-dokumenter. To modeller blir trent på HTML-delene av MINT-1T og OBELICS for en total av 10 milliarder multimodale token. Deres kontekst-læringsprestasjon blir vurdert. Tabellen nedenfor presenterer fire-skudd- og åtte-skudd-prestasjon på felles benchmark; modellen trent på MINT-1T HTML-dokumenter prestere bedre enn OBELICS på VQA-oppgaver, men dårligere på undertekst-benchmark. I gjennomsnitt prestere OBELICS litt bedre enn MINT-1T (HTML).

Tilføyelse av PDF og ArXiv-dokumenter
Deretter blir trening utført på MINT-1Ts fullstendige datakilder, med en blanding av HTML-, PDF- og ArXiv-dokumenter. De sammenflettede dokumentene blir sampet med 50% fra HTML, 45% fra PDF-er og 5% fra ArXiv. Modellen blir trent for en total av 10 milliarder multimodale token. Som vist i tabellen ovenfor, prestere modellen trent på MINT-1Ts fullstendige data-blanding bedre enn OBELICS og MINT-1T (HTML) på de fleste kontekst-lærings-benchmark. På mer komplekse multimodale resonans-benchmark prestere MINT-1T-modellen bedre enn OBELICS på MMMU, men dårligere på Mantis-Eval.
Finere trender
Hvordan skalerer kontekst-læringsprestasjon med demonstrasjoner?
Kontekst-læringsprestasjon blir evaluert når promptet med ett til åtte demonstrasjoner. En enkelt prøve per skudd-telling blir kjørt for hver evaluering-benchmark. Som vist i figuren nedenfor, prestere modellen trent på MINT-1T bedre enn modellen trent på MINT-1Ts HTML-undermengde og OBELICS over alle skudd. MINT-1T (HTML)-modellen prestere litt dårligere enn OBELICS.

Prestasjon på undertekst- og visuell-spørsmål-svar-oppgaver
Figuen nedenfor presenterer gjennomsnittlig kontekst-læringsprestasjon på undertekst- og visuell-spørsmål-svar-benchmark. OBELICS prestere bedre enn alle MINT-1T-variantene på fire-skudd-undertekst-benchmark og prestere litt dårligere sammenlignet med MINT-1T på åtte-skudd-undertekst. Imidlertid prestere MINT-1T betydelig bedre enn begge baseline på VQA-benchmark. MINT-1T (HTML) prestere også bedre enn OBELICS på VQA-oppgaver.
Prestasjon på ulike domener
Inkludering av ulike domener i MINT-1T er rettet mot å forbedre modellens generalisering. Figuen tidligere bryter ned prestasjon på MMMU for hver domene. Unntatt forretning-domene, prestere MINT-1T bedre enn OBELICS og MINT-1T (HTML). Prestasjonsøkningen i vitenskap og teknologi-domener for MINT-1T tilskrives forekomsten av disse domenene i ArXiv- og PDF-dokumenter.
Slutt-tanker
I denne artikkelen har vi talt om MINT-1T, det største og mest diverse multimodale sammenflettede åpne kilde datasett til dags dato. MINT-1T: En 10x større skala, inkludert en billion teksttoken og 3,4 milliarder bilder enn eksisterende åpne kilde datasett. MINT-1T-datasett introduserer også aldri tidligere eksponerte kilder som PDF-filer og ArXiv-papirer. Ettersom multimodale sammenflettede datasett ikke skalerer lett, er det viktig at MINT-1T-datasett deler datakureringprosessen så andre også kan utføre eksperimenter på slike informasjonsrike varianter. MINT-1T-datasett demonstrerer at dens metode; LM-modeller trent på MINT-1T er konkurrerende (om enn noe) til tidligere statlige OBELICS.












