AI-modellen en platforms

MINT-1T: Schaalbare open-source multimodale gegevens met 10x

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het trainen van grote multimodale modellen (LMM’s) vereist grote datasets met ingebedde sequenties van afbeeldingen en tekst in vrije vorm. Hoewel open-source LMM’s snel zijn geÃŦvolueerd, is er nog steeds een groot tekort aan multimodale ingebedde datasets op grote schaal die open-source zijn. Het belang van deze datasets kan niet worden overschat, aangezien ze de basis vormen voor het creÃŦren van geavanceerde AI-systemen die in staat zijn om content te begrijpen en te genereren over verschillende modaliteiten. Zonder een voldoende aanbod van uitgebreide, ingebedde datasets, wordt de potentie voor het ontwikkelen van meer geavanceerde en capabele LMM’s aanzienlijk beperkt. Deze datasets stellen modellen in staat om te leren van een diverse reeks invoer, waardoor ze flexibeler en effectiever zijn in verschillende toepassingen. Bovendien vormt het tekort aan dergelijke datasets een uitdaging voor de open-source gemeenschap, die afhankelijk is van gedeelde bronnen om innovatie en samenwerking te stimuleren.

Open-source LMM’s hebben in de afgelopen jaren aanzienlijke vooruitgang geboekt, maar hun groei wordt gehinderd door de beperkte beschikbaarheid van grote, ingebedde datasets. Om deze hindernis te overwinnen, zijn geconcerteerde inspanningen nodig om meer uitgebreide datasets te cureren, annoteren en vrij te geven die de voortdurende ontwikkeling en verfijning van multimodale modellen kunnen ondersteunen. Bovendien houdt de creatie en verspreiding van deze datasets het overwinnen van verschillende technische en logistieke hindernissen in. Gegevensverzameling moet uitgebreid en representatief zijn voor de diverse contexten waarin LMM’s zullen worden ingezet. Annotatie vereist zorgvuldige overweging om ervoor te zorgen dat de ingebedde sequenties van afbeeldingen en tekst op een manier zijn uitgelijnd die het leerproces van het model verbetert. Bovendien houdt het waarborgen dat de datasets open-source zijn, het aanpakken van juridische en ethische overwegingen met betrekking tot gegevensbescherming en gebruiksrechten in. Het uitbreiden van de beschikbaarheid van hoge kwaliteit, grote multimodale ingebedde datasets is essentieel voor de toekomst van AI-onderzoek en -ontwikkeling. Door het huidige tekort aan te pakken, kan de AI-gemeenschap grotere innovatie en samenwerking stimuleren, wat leidt tot de creatie van meer krachtige en flexibele LMM’s die in staat zijn om complexe, real-world problemen aan te pakken.

Daaropvolgend, MINT-1T, de grootste en meest diverse multimodale ingebedde open-source dataset tot nu toe. MINT-1T: een 10x grotere schaal, met ÃĐÃĐn biljoen teksttokens en 3,4 miljard afbeeldingen, in vergelijking met bestaande open-source datasets. De MINT-1T-dataset introduceert ook nooit eerder blootgestelde bronnen, zoals PDF-bestanden en ArXiv-papers. Aangezien multimodale ingebedde datasets niet gemakkelijk schalen, is het belangrijk dat de MINT-1T-dataset het datacuratatieproces deelt, zodat anderen ook experimenten kunnen uitvoeren op dergelijke informatie-rijke varianten. De MINT-1T-dataset toont aan dat zijn methode; LMM’s getraind op MINT-1T zijn concurrerend (hoewel enigszins) met eerdere state-of-the-art OBELICS.

MINT-1T: een multimodale dataset met ÃĐÃĐn biljoen tokens

Grote open-source pre-training datasets zijn van cruciaal belang geweest voor de onderzoekscommunity om data-engineering en het trainen van transparante, open-source modellen te onderzoeken. In het tekstdomein hebben vroege werken zoals C4 en The Pile een cruciale rol gespeeld bij het mogelijk maken van de community om de eerste set open-source grote taalmodellen zoals GPT-J, GPT-Neo en anderen te trainen. Deze fundamentale inspanningen hebben ook de weg geÃŦffend voor latere verbeteringen in datafiltermethoden en schaling. Evenzo hebben grote open-source datasets in de beeld-tekstruimte innovaties gestimuleerd in betere datacuratiemethoden, zoals Datafilternetwerken en T-MARS. Er is een opvallende verschuiving van frontierlabs naar het trainen van grote multimodale modellen (LMM’s) die uitgebreide multimodale ingebedde datasets vereisen, bestaande uit vrije sequenties van afbeeldingen en tekst. Naarmate de capaciteiten van frontiermodellen snel evolueren, ontstaat er een significante kloof in de multimodale trainingsdata tussen gesloten en open-source modellen. Huidige open-source multimodale ingebedde datasets zijn kleiner en minder divers dan hun tekst-only tegenhangers, afkomstig uit HTML-documenten, waardoor de breedte en variÃŦteit van de data wordt beperkt. Deze beperking belemmert de ontwikkeling van robuuste open-source LMM’s en creÃŦert een ongelijkheid tussen de capaciteiten van open- en gesloten modellen.

Om deze kloof te dichten, is MINT-1T gecreÃŦerd als de grootste en meest diverse open-source multimodale ingebedde dataset tot nu toe. MINT-1T bevat in totaal ÃĐÃĐn biljoen teksttokens en drie miljard afbeeldingen, afkomstig uit diverse bronnen zoals HTML, PDF’s en ArXiv. Voordat MINT-1T bestond, was de grootste open-source dataset in dit gebied OBELICS, die 115 miljard teksttokens en 353 miljoen afbeeldingen bevatte, allemaal afkomstig uit HTML.

De bijdragen van MINT-1T zijn als volgt:

  • Data-engineering: Het schalen van deze multimodale ingebedde data presenteert meer een engineeringuitdaging dan het bouwen van tekst-only of beeld-tekstpaar datasets. Het omgaan met veel grotere documentgroottes en het behoud van de oorspronkelijke volgorde van afbeeldingen en tekst is cruciaal.
  • Diversiteit: MINT-1T is de eerste in de multimodale ingebedde ruimte om hoge kwaliteit multimodale documenten te verzamelen op grote schaal uit bronnen zoals CommonCrawl PDF’s en ArXiv.
  • Model-experimenten: Experimenten tonen aan dat LMM’s getraind op MINT-1T niet alleen concurrerend zijn met, maar mogelijk zelfs de prestaties van modellen getraind op de beste bestaande open-source dataset, OBELICS, overtreffen, terwijl ze een tien keer grotere schaal bieden.

MINT-1T: het creÃŦren van de dataset

MINT-1T curateert een grote open-source dataset die meer diverse bronnen van ingebedde documenten gebruikt, zoals PDF’s en ArXiv-papers. Deze sectie beschrijft MINT-1T’s methoden voor het verzamelen van multimodale documenten, het filteren van lage kwaliteit content, het deduplieren van data en het verwijderen van niet-veilige voor het werk (NSFW) en ongewenste materiaal. De definitieve dataset bestaat uit 922 miljard (B) HTML-tokens, 106B PDF-tokens en 9B ArXiv-tokens.

Het verzamelen van grote hoeveelheden multimodale documenten

HTML-pijplijn

MINT-1T volgt OBELICS’s methode voor het extraheren van ingebedde multimodale documenten uit CommonCrawl WARC-bestanden door de DOM-boom van elke WARC-entry te parseren. Terwijl OBELICS alleen documenten uit februari 2020 tot februari 2023 CommonCrawl-dumps verwerkte, heeft MINT-1T het documentenpool uitgebreid tot HTML-documenten uit mei 2017 tot april 2024 (met volledige dumps van oktober 2018 tot april 2024 en gedeeltelijke dumps van eerdere jaren). Net als OBELICS, filtert MINT-1T documenten uit die geen afbeeldingen bevatten, meer dan dertig afbeeldingen bevatten of afbeeldingen met URL’s die ongepaste substrings bevatten, zoals logo, avatar, porn en xxx.

PDF-pijplijn

MINT-1T haalt PDF-documenten op uit CommonCrawl WAT-bestanden uit februari 2023 tot april 2024-dumps. Aanvankelijk worden alle PDF-koppelingen uit deze dumps geÃŦxtraheerd. MINT-1T probeert vervolgens PDF’s te downloaden en te lezen met PyMuPDF, waarbij PDF’s groter dan 50MB (waarschijnlijk grote afbeeldingen bevattende) en die langer dan 50 pagina’s zijn, worden verworpen. Pagina’s zonder tekst worden uitgesloten en een leesvolgorde wordt ingesteld voor de resterende pagina’s. De leesvolgorde wordt bepaald door het vinden van de begrenzingsbox van alle tekstblokken op een pagina, het clusteren van de blokken op basis van kolommen en het ordenen ervan van boven links naar onder recht. Afbeeldingen worden geÃŊntegreerd in de sequentie op basis van hun nabijheid tot tekstblokken op dezelfde pagina.

ArXiv-pijplijn

MINT-1T bouwt ArXiv-ingebedde documenten op uit LaTeX-broncode met behulp van TexSoup om figuurtags te vinden en afbeeldingen te laten overlappen met de papier-tekst. Voor meerdere bestanden voor papers, identificeert MINT-1T het hoofd-Tex-bestand en vervangt invoertags door de inhoud van hun bestanden. De LaTeX-code wordt opgeschoond door imports, bibliografie, tabellen en citatietags te verwijderen. Aangezien ArXiv al een hoogwaardige gegevensbron is, worden geen aanvullende filtering en deduplicatie uitgevoerd.

Tekstkwaliteitsfiltering

MINT-1T vermijdt het gebruik van model-gebaseerde heuristieken voor tekstfiltering, volgend op praktijken ingesteld door RefinedWeb, Dolma en FineWeb. Aanvankelijk worden niet-Engelse documenten geÃŦlimineerd met Fasttext’s taalidentificatiemodel (met een vertrouwensdrempel van 0,65). Documenten met URL’s die NSFW-substrings bevatten, worden ook verwijderd om pornografisch en ongewenst materiaal uit te sluiten. Tekstfiltermethoden van RefinedWeb worden toegepast, met name het verwijderen van documenten met excessieve duplicaat n-grammen of die zijn geÃŊdentificeerd als lage kwaliteit met behulp van MassiveText-regels.

Afbeeldingsfiltering

Na het cureren van PDF’s en HTML-bestanden, probeert MINT-1T alle afbeeldings-URL’s in de HTML-dataset te downloaden, niet-opvraagbare koppelingen te verwijderen en documenten met geen geldige afbeeldingskoppelingen te verwijderen. Afbeeldingen kleiner dan 150 pixels worden verworpen om lawaaierige afbeeldingen zoals logo’s en pictogrammen te vermijden, en afbeeldingen groter dan 20.000 pixels worden ook verwijderd omdat ze meestal off-topic afbeeldingen zijn. Voor HTML-documenten worden afbeeldingen met een aspectverhouding groter dan twee verwijderd om lage kwaliteit afbeeldingen zoals reclamebanners te filteren. Voor PDF’s wordt de drempel aangepast tot drie om wetenschappelijke figuren en tabellen te behouden.

De bovenstaande figuur toont hoe MINT-1T uniek gegevens bevat uit PDF’s en ArXiv-documenten, naast HTML-bronnen.

Veiligheidsfiltering

  • NSFW-afbeeldingsfiltering: MINT-1T past een NSFW-afbeeldingsdetector toe op alle afbeeldingen in de dataset. Als een document een enkele NSFW-afbeelding bevat, wordt het hele document verwijderd.
  • Verwijdering van persoonlijk identificeerbare informatie: Om het risico van persoonlijke gegevenslekkage te mitigeren, worden e-mailadressen en IP-adressen in de tekstgegevens geanonimiseerd. E-mailadressen worden vervangen door sjablonen zoals “[email protected]” en IP-adressen door willekeurig gegenereerde niet-functionele IP-adressen.

Deduplicatie

MINT-1T voert alineadocument- en documenttekstdeduplicatie uit binnen elke CommonCrawl-snapshot en afbeeldingsdeduplicatie om herhaalde, oninformatieve afbeeldingen zoals pictogrammen en logo’s te verwijderen. Alle deduplicatiestappen worden afzonderlijk voor elke gegevensbron uitgevoerd.

Alinea- en documentdeduplicatie

Volgend op Dolma’s methodologie, gebruikt MINT-1T een Bloom Filter voor efficiÃŦnte tekstdeduplicatie, waarbij de vals positieve rate wordt ingesteld op 0,01 en 13-gram alinea’s (aangegeven door dubbele nieuwe regel-scheidingstekens) uit elk document worden gedupliceerd. Als meer dan 80% van een document’s alinea’s duplicaten zijn, wordt het hele document verwijderd.

Verwijdering van gemeenschappelijke boilerplate-tekst

Na alineaduplicatie, verwijdert MINT-1T korte gemeenschappelijke boilerplate-zinnen in HTML-documenten, zoals “Skip to content” of “Blog Archive.” Dit gebeurt door exacte alineaduplicatie uit te voeren op 2% van elke CommonCrawl-snapshot, in overeenstemming met CCNet-praktijken, waarbij voornamelijk het verwijderen van gemeenschappelijke boilerplate-tekst wordt gewaarborgd.

De bovenstaande figuur toont het filterproces voor MINT-1T en toont hoe tokens worden verwijderd gedurende de datapijplijn voor HTML, PDF’s en ArXiv-papers.

Afbeeldingsdeduplicatie

Binnen elke CommonCrawl-snapshot, verwijdert MINT-1T vaak voorkomende afbeeldingen op basis van SHA256-hashes. In plaats van strikte deduplicatie, worden alleen afbeeldingen die meer dan tien keer binnen een snapshot voorkomen, verwijderd, volgend op Multimodal-C4-praktijken. In overeenstemming met OBELICS, worden herhaalde afbeeldingen binnen een enkel document verwijderd, waarbij alleen de eerste instantie wordt behouden.

Infrastructuur

Gedurende de dataprocessing, had MINT-1T toegang tot gemiddeld 2.350 CPU-kernen van een mix van 190-processor- en 90-processor-knooppunten. In totaal werden ongeveer 4,2 miljoen CPU-uren gebruikt om deze dataset te bouwen.

Documentcompositie in MINT-1T en OBELICS vergelijken

Bij de evaluatie van de compositie van ingebedde datasets, worden twee sleutelkenmerken onderzocht: de verdeling van teksttokens per document en het aantal afbeeldingen per document. Voor deze analyse werden 50.000 documenten willekeurig geselecteerd uit zowel OBELICS als elke gegevensbron in MINT-1T. GPT-2’s tokenizer werd gebruikt om het aantal teksttokens te berekenen. Uitbijters werden verwijderd door documenten uit te sluiten die buiten de 1,5 interquartile range voor het aantal teksttokens en afbeeldingen vielen. Zoals te zien is in de volgende figuur, komt de HTML-subset van MINT-1T overeen met de tokenverdeling in OBELICS. Echter, documenten afkomstig uit PDF’s en ArXiv zijn gemiddeld langer dan HTML-documenten, waardoor de voordelen van het verzamelen van gegevens uit diverse bronnen worden benadrukt. Figuur 5 onderzoekt de beelddichtheid over alle documenten, waaruit blijkt dat PDF’s en ArXiv-documenten meer afbeeldingen bevatten in vergelijking met HTML-documenten, waarbij ArXiv-voorbeelden de meest beeldrijke zijn.

Hoe verbeteren verschillende gegevensbronnen de documentdiversiteit?

Een belangrijke motivatie voor het uitbreiden van de pool van multimodale documenten voorbij HTML is de verbetering van domeincoverage. Om de diversiteit en diepte van deze coverage te kwantificeren, werd een Latent Dirichlet Allocation (LDA)-model getraind op 100.000 documenten geselecteerd uit de OBELICS-dataset, de HTML-subset van MINT-1T en de PDF-subset (exclusief ArXiv) van MINT-1T om 200 onderwerpen te krijgen. GPT-4 werd vervolgens gebruikt om de set van woorden te classificeren om de dominante domeinen – zoals Gezondheid & Geneeskunde, Wetenschap, Bedrijf, Geesteswetenschappen, Geschiedenis, enz. – te identificeren op basis van MMMU-domeinen. De analyse onthult duidelijke trends in domeinverdeling:

  • OBELICS: Deze dataset toont een geconcentreerde verdeling in “Geesteswetenschappen en Sociale Wetenschappen”. Dit kan worden toegeschreven aan het dataprocessingsproces, dat het filteren van documenten die geen Wikipedia-artikelen lijken, omvat, waardoor de verdeling mogelijk wordt gewijzigd naar meer algemene kennis en geesteswetenschappelijke inhoud.
  • MINT-1T’s HTML-subset: In tegenstelling tot OBELICS, is de HTML-subset van MINT-1T niet sterk gebiaseerd naar een specifiek domein, wat een bredere en meer evenwichtige domeinrepresentatie suggereert.
  • MINT-1T’s PDF-subset: Er is een hoger percentage “Wetenschap en Technologie”-documenten binnen de PDF-documenten van MINT-1T. Deze trend is waarschijnlijk te wijten aan de aard van wetenschappelijke communicatie, waarbij PDF’s de voorkeursformaat zijn voor het delen van gedetailleerde onderzoeksartikelen en technische rapporten.

MINT-1T: resultaten en experimenten

Voor alle experimenten, traint MINT-1T het model op 50% beeld-tekstcaptionbatches en 50% multimodale ingebedde batches. Een maximum van 2048 multimodale tokens wordt bemonsterd uit elk ingebed document en 340 tokens uit elk beeld-tekstvoorbeeld. Net als bij Flamingo, wordt een “einde”-token toegevoegd om het einde van een aangrenzende beeld-tekstsequentie aan te geven. Tijdens het trainen worden 50% van enkelbeeld-ingebedde documenten willekeurig verwijderd om meerdere beeld-documenten op te waarderen. De beeld-tekstdataset bestaat uit een mengsel van intern gecreÃŦerde captiondatasets. Het vermogen van het model om te redeneren over multimodale ingebedde sequenties wordt beoordeeld door zijn in-context leerprestaties en multi-beeldredeneringsprestaties.

De bovenstaande figuur toont het percentage documenten uit elk domein in MMMU voor OBELICS en subsets van MINT-1T.

In-context leerprestaties: De modellen worden geÃŦvalueerd op vier-shot en acht-shot in-context leerprestaties op verschillende captionbenchmark (COCO (Karpathy-test) en TextCaps (validatie)) en visuele vraagbeantwoordingdatasets (VQAv2 (validatie), OK-VQA (validatie), TextVQA (validatie) en VizWiz (validatie)). Demonstraties worden willekeurig geselecteerd uit de trainingsset. Scores worden gemiddeld over meerdere evaluatieruns, met gerandomiseerde demonstraties om gevoeligheid voor gekozen prompts te verdisconteren. Verschillende prompts worden geablateerd voor elke taak om de best presterende prompts te selecteren.

Multi-beeldredenering: Modellen worden geÃŦvalueerd op MMMU (bevat zowel enkelbeeld- als meerdere beeldvragen) en Mantis-Eval (alle meerdere beeldvragen) om multi-beeldredeneringsprestaties te onderzoeken voorbij in-context leerprestaties.

Trainen op HTML-documenten

Aanvankelijk wordt het HTML-gedeelte van MINT-1T vergeleken met OBELICS, aangezien OBELICS de vorige leidende ingebedde dataset was, eveneens gecreÃŦerd uit HTML-documenten. Twee modellen worden getraind op de HTML-gedeeltes van MINT-1T en OBELICS voor een totaal van 10B multimodale tokens. Hun in-context leerprestaties worden beoordeeld. De volgende tabel toont de vier-shot en acht-shot prestaties op gemeenschappelijke benchmarks; het model getraind op MINT-1T HTML-documenten presteert beter dan OBELICS op VQA-taken, maar slechter op captionbenchmark. Gemiddeld presteert OBELICS lichtjes beter dan MINT-1T (HTML).

Toevoegen van PDF- en ArXiv-documenten

Vervolgens wordt getraind op MINT-1T’s volledige gegevensbronnen, met een mengsel van HTML-, PDF- en ArXiv-documenten. De ingebedde documenten worden bemonsterd met 50% uit HTML, 45% uit PDF’s en 5% uit ArXiv. Het model wordt getraind voor een totaal van 10B multimodale tokens. Zoals te zien is in de bovenstaande tabel, presteert het model getraind op de volledige MINT-1T-gegevensmengsel beter dan OBELICS en MINT-1T (HTML) op de meeste in-context leerprestatiebenchmarks. Op meer complexe multimodale redeneringsbenchmarks presteert het MINT-1T-model beter dan OBELICS op MMMU, maar presteert het slechter op Mantis-Eval.

Fijne trends

Hoe schaalt in-context leerprestatie met demonstraties?

De in-context leerprestatie wordt geÃŦvalueerd wanneer het model wordt gepresenteerd met ÃĐÃĐn tot acht demonstraties. Een enkele proef per schot wordt uitgevoerd voor elke evaluatiebenchmark. Zoals te zien is in de volgende figuur, presteert het model getraind op MINT-1T beter dan het model getraind op het HTML-gedeelte van MINT-1T en OBELICS over alle schoten. Het MINT-1T (HTML)-model presteert lichtjes slechter dan OBELICS.

Prestatie op caption- en visuele vraagbeantwoordingstaken

De volgende figuur toont de gemiddelde in-context leerprestatie op caption- en visuele vraagbeantwoording (VQA)-benchmarks. OBELICS presteert beter dan alle MINT-1T-varianten op vier-shot captionbenchmark en presteert lichtjes slechter in vergelijking met MINT-1T op acht-shot caption. Echter, MINT-1T presteert aanzienlijk beter dan beide baselines op VQA-benchmarks. MINT-1T (HTML) presteert ook beter dan OBELICS op VQA-taken.

Prestatie op verschillende domeinen

Het opnemen van diverse domeinen in MINT-1T is gericht op het verbeteren van modelgeneraliseren. De figuur eerder toont de prestatie op MMMU voor elk domein. Behalve in het domein Bedrijf, presteert MINT-1T beter dan OBELICS en MINT-1T (HTML). De prestatieverbetering in de domeinen Wetenschap en Technologie voor MINT-1T wordt toegeschreven aan de prevalentie van deze domeinen in ArXiv- en PDF-documenten.

Slotbeschouwing

In dit artikel hebben we het over MINT-1T gehad, de grootste en meest diverse multimodale ingebedde open-source dataset tot nu toe. MINT-1T: een 10x grotere schaal, met ÃĐÃĐn biljoen teksttokens en 3,4 miljard afbeeldingen, in vergelijking met bestaande open-source datasets. De MINT-1T-dataset introduceert ook nooit eerder blootgestelde bronnen, zoals PDF-bestanden en ArXiv-papers. Aangezien multimodale ingebedde datasets niet gemakkelijk schalen, is het belangrijk dat de MINT-1T-dataset het datacuratatieproces deelt, zodat anderen ook experimenten kunnen uitvoeren op dergelijke informatie-rijke varianten. De MINT-1T-dataset toont aan dat zijn methode; LMM’s getraind op MINT-1T zijn concurrerend (hoewel enigszins) met eerdere state-of-the-art OBELICS.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.