AI-modeller och plattformar

MINT-1T: Skalning av öppen källkods multimodal data med 10x

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Utveckling av stora multimodala modeller (LMM) kräver storskaliga dataset med sammanflätade sekvenser av bilder och text i fri form. Trots att öppen källkods-LMM har utvecklats snabbt, finns det fortfarande en stor brist på multimodala sammanflätade dataset i stor skala som är öppen källkod. Vikten av dessa dataset kan inte överskattas, eftersom de utgör grunden för att skapa avancerade AI-system som kan förstå och generera innehåll över olika modaliteter. Utan tillräckligt med omfattande och sammanflätade dataset, är potentialen för att utveckla mer avancerade och kapabla LMM begränsad. Dessa dataset möjliggör att modellerna kan lära sig från en mångfald av indata, vilket gör dem mer flexibla och effektiva i olika tillämpningar. Dessutom utgör bristen på sådana dataset en utmaning för den öppna källkods-gemenskapen, som förlitar sig på delade resurser för att driva innovation och samarbete.

Öppen källkods-LMM har gjort betydande framsteg under de senaste åren, men deras tillväxt hämmars av den begränsade tillgången till storskaliga, sammanflätade dataset. För att övervinna detta hinder, krävs samordnade insatser för att kurera, annotera och släppa mer omfattande dataset som kan stödja den pågående utvecklingen och förfiningen av multimodala modeller. Dessutom innebär skapandet och spridningen av dessa dataset att man måste övervinna flera tekniska och logistiska hinder. Datainsamling måste vara omfattande och representativ för de olika sammanhang där LMM kommer att användas. Annotation kräver noggrann övervägning för att säkerställa att de sammanflätade sekvenserna av bilder och text är anpassade för att förbättra modellens inlärningsförmåga. Dessutom innebär att dataset är öppen källkod att man måste hantera juridiska och etiska överväganden relaterade till dataskydd och användningsrättigheter. Att utöka tillgången till högkvalitativa, storskaliga multimodala sammanflätade dataset är avgörande för framtiden för AI-forskning och utveckling. Genom att hantera den nuvarande bristen, kan AI-gemenskapen främja större innovation och samarbete, vilket leder till skapandet av mer kraftfulla och flexibla LMM som kan hantera komplexa, verkliga problem.

Byggande på den tanken, är MINT-1T det största och mest varierade multimodala sammanflätade öppen källkods-dataset hittills. MINT-1T: Ett 10x större dataset, som innehåller en trillion texttoken och 3,4 miljarder bilder, jämfört med befintliga öppen källkods-dataset. MINT-1T-datasetet introducerar också tidigare outnyttjade källor som PDF-filer och ArXiv-papper. Eftersom multimodala sammanflätade dataset inte skalar lätt, är det viktigt att MINT-1T-datasetet delar datakureringprocessen så att andra också kan utföra experiment på sådana informationsrika varianter. MINT-1T-datasetet visar att dess metod; LM-modeller tränade på MINT-1T är konkurrenskraftiga (om än något) till tidigare state-of-the-art OBELICS.

MINT-1T: Ett multimodalt dataset med en trillion token

Stora öppen källkods-förträningsdataset har varit avgörande för forskargemenskapen i att utforska dataingenjörskonst och träna transparenta, öppen källkods-modeller. I textdomänen, har tidiga arbeten som C4 och The Pile spelat en avgörande roll i att möjliggöra gemenskapen att träna de första öppen källkods-stora språkmodellerna som GPT-J, GPT-Neo och andra. Dessa grundläggande insatser har också banat väg för efterföljande förbättringar av datafiltreringsmetoder och skalning. På samma sätt, i bild-text-rymden, har storskaliga öppen källkods-dataset stimulerat innovationer i bättre datakureringmetoder, såsom Data Filtering Networks och T-MARS. Det finns en märkbar förskjutning från frontlab till träning av stora multimodala modeller (LMM) som kräver omfattande multimodala sammanflätade dataset bestående av fria former av bilder och text. När förmågan hos frontmodeller utvecklas snabbt, uppstår ett signifikant gap i multimodala träningsdata mellan stängda och öppen källkods-modeller. Nuvarande öppen källkods-multimodala sammanflätade dataset är mindre och mindre varierade än deras textbaserade motsvarigheter, och hämtas primärt från HTML-dokument, vilket begränsar bredden och variationen av data. Denna begränsning hämmar utvecklingen av robusta öppen källkods-LMM och skapar en ojämnhet mellan förmågan hos öppen och stängd källkods-modeller.

För att hantera detta gap, skapades MINT-1T som det största och mest varierade öppen källkods-multimodala sammanflätade dataset hittills. MINT-1T innehåller totalt en trillion texttoken och tre miljarder bilder, hämtade från varierade källor som HTML, PDF och ArXiv. Före MINT-1T, var det största öppen källkods-datasetet i detta område OBELICS, som innehöll 115 miljarder texttoken och 353 miljoner bilder, alla hämtade från HTML.

MINT-1T:s bidrag är följande:

  • Dataingenjörskonst: Att skala detta multimodala sammanflätade data presenterar mer av en ingenjörskonstutmaning än att bygga antingen textbaserade eller bild-text-par-dataset. Hantering av mycket större dokumentstorlekar och bevarande av den ursprungliga ordningen på bilder och text är avgörande.
  • Variation: MINT-1T är det första i det multimodala sammanflätade området som samlar högkvalitativa multimodala dokument i stor skala från källor som CommonCrawl PDF och ArXiv.
  • Modell-experiment: Experiment visar att LMM tränade på MINT-1T inte bara matchar utan också överträffar prestationen hos modeller tränade på det bästa befintliga öppen källkods-datasetet, OBELICS, medan de erbjuder en tiofaldig ökning av skala.

MINT-1T: Konstruktion av datasetet

MINT-1T kuraterar ett storskaligt öppen källkods-dataset som använder mer varierade källor av sammanflätade dokument, såsom PDF och ArXiv-papper. Detta avsnitt beskriver MINT-1T:s metoder för att hämta multimodala dokument, filtrera lågkvalitetsinnehåll, deduplicera data och ta bort inte-säkert-för-arbete (NSFW) och oönskat material. Det slutliga datasetet består av 922 miljarder (B) HTML-token, 106B PDF-token och 9B ArXiv-token.

Insamling av stora mängder multimodala dokument

HTML-pipeline

MINT-1T följer OBELICS:s metod för att extrahera sammanflätade multimodala dokument från CommonCrawl WARC-filer genom att parsera varje WARC-inträdes DOM-träd. Medan OBELICS endast bearbetade dokument från februari 2020 till februari 2023 CommonCrawl-dump, har MINT-1T utökat dokumentpoolen till att omfatta HTML-dokument från maj 2017 till april 2024 (med fullständiga dump från oktober 2018 till april 2024 och partiella dump från tidigare år). Liksom OBELICS, filtrerar MINT-1T bort dokument som innehåller inga bilder, fler än trettio bilder eller bilder med URL:er som innehåller olämpliga substrängar som “logo”, “avatar”, “porn” och “xxx”.

PDF-pipeline

MINT-1T hämtar PDF-dokument från CommonCrawl WAT-filer från februari 2023 till april 2024 dump. Initialt extraheras alla PDF-länkar från dessa dump. MINT-1T försöker sedan att ladda ner och läsa PDF-filer med PyMuPDF, och kasserar PDF-filer som är över 50MB (sannolikt innehållande stora bilder) och de som är över 50 sidor långa. Sidor utan text exkluderas, och en läsordning etableras för de återstående sidorna. Läsordningen bestäms genom att hitta textblockens begränsningsruta på en sida, klustra blocken baserat på kolumner och ordna dem från övre vänstra till nedre högra. Bilder integreras i sekvensen baserat på deras närhet till textblock på samma sida.

ArXiv-pipeline

MINT-1T bygger ArXiv-sammanflätade dokument från LaTeX-källkod med hjälp av TexSoup för att hitta figurtaggar och sammanfläta bilder med papperstexten. För multifilpapper identifierar MINT-1T huvud-Tex-filen och ersätter input-taggar med innehållet i dess filer. LaTeX-koden rensas genom att ta bort importer, bibliografi, tabeller och citeringstaggar. Eftersom ArXiv redan är en högt kuraterad datakälla, utförs ingen ytterligare filtrering och deduplicering.

Textkvalitetsfiltrering

MINT-1T undviker att använda modellbaserade heuristiker för textfiltrering, och följer metoder etablerade av RefinedWeb, Dolma och FineWeb. Initialt elimineras icke-engelska dokument med hjälp av Fasttext:s språkidentifieringsmodell (med en konfidensgräns på 0,65). Dokument med URL:er som innehåller NSFW-substrängar tas också bort för att exkludera pornografiskt och oönskat innehåll. Textfiltreringsmetoder från RefinedWeb tillämpas, särskilt genom att ta bort dokument med överdrivet många duplicerade n-gram eller de som identifieras som lågkvalitativa med hjälp av MassiveText-regler.

Bildfiltrering

Efter att ha kuraterat PDF-filer och HTML-filer, försöker MINT-1T att ladda ner alla bild-URL:er i HTML-datasetet, och kasserar icke-hämtbara länkar och tar bort dokument med inga giltiga bildlänkar. Bilder som är mindre än 150 pixlar kasseras för att undvika bullriga bilder som logotyper och ikoner, och bilder som är större än 20 000 pixlar tas också bort eftersom de vanligtvis motsvarar irrelevanta bilder. För HTML-dokument tas bilder med ett bildförhållande större än två bort för att filtrera bort lågkvalitativa bilder som annonsbanderoller. För PDF-filer justeras tröskeln till tre för att bevara vetenskapliga figurer och tabeller.

Ovanstående figur visar hur MINT-1T unikt inkluderar data från PDF-filer och ArXiv-dokument utöver HTML-källor.

Säkerhetsfiltrering

  • NSFW-bildfiltrering: MINT-1T tillämpar en NSFW-bild-detektor på alla bilder i datasetet. Om ett dokument innehåller en enda NSFW-bild, kasseras hela dokumentet.
  • Personligt identifierbart informationsborttagning: För att mildra risken för personuppgiftsläckage, anonymiseras e-postadresser och IP-adresser i textdata. E-postadresser ersätts med mallar som “e-post@example.com” och IP-adresser med slumpmässigt genererade icke-funktionella IP-adresser.

Deduplicering

MINT-1T utför paragraf- och dokumenttextdeduplicering inom varje CommonCrawl-snapshot och bild-deduplicering för att ta bort upprepade, oinformativa bilder som ikoner och logotyper. Alla dedupliceringssteg utförs separat för varje datakälla.

Paragraf- och dokumentdeduplicering

Följande Dolmas metodik, använder MINT-1T en Bloom-filter för effektiv textdeduplicering, och ställer in den falska positivitetsgraden till 0,01 och deduplicerar 13-gram-paragrafer (indikerade genom dubbla nylinjetecken) från varje dokument. Om mer än 80% av ett documents paragrafer är dubbletter, kasseras hela dokumentet.

Borttagning av gemensam malltext

Efter paragrafdeduplicering, tar MINT-1T bort korta gemensamma mallmeningar i HTML-dokument, som “Hoppa till innehåll” eller “Bloggarkiv”. Detta görs genom att köra exakt paragrafdeduplicering på 2% av varje CommonCrawl-snapshot, i linje med CCNet-praxis, och säkerställer i huvudsak borttagning av gemensam malltext.

Ovanstående figur visar filtreringsprocessen för MINT-1T, och visar hur token tas bort under hela datapipelinen för HTML, PDF och ArXiv-papper.

Bilddeduplicering

Inom varje CommonCrawl-snapshot, tar MINT-1T bort ofta förekommande bilder baserat på SHA256-hasher. I stället för strikt deduplicering, tas endast bilder som förekommer mer än tio gånger inom en snapshot bort, följande Multimodal-C4-praxis. I likhet med OBELICS, tas upprepade bilder inom ett dokument bort, och endast den första förekomsten behålls.

Infrastruktur

Under hela dataprocessen, hade MINT-1T tillgång till i genomsnitt 2 350 CPU-kärnor från en blandning av 190-processor- och 90-processor-noder. Totalt användes cirka 4,2 miljoner CPU-timmar för att bygga detta dataset.

Jämförelse av dokumentkomposition i MINT-1T med OBELICS

Vid utvärdering av sammansättningen av sammanflätade dataset, undersöks två nyckelfaktorer: fördelningen av texttoken per dokument och antalet bilder per dokument. För denna analys, slumpmässigt valdes 50 000 dokument från både OBELICS och varje datakälla i MINT-1T. GPT-2:s tokenisator användes för att beräkna antalet texttoken. Utlagringar togs bort genom att exkludera dokument som låg utanför 1,5 interkvartilområdet för antalet texttoken och bilder. Som visas i följande figur, överensstämmer HTML-undersamlingen i MINT-1T nära med tokenfördelningen som ses i OBELICS. Dock tenderar dokument från PDF och ArXiv att vara längre än HTML-dokument i genomsnitt, vilket belyser fördelarna med att hämta data från varierade källor. Figuren undersöker bildtätheten över alla dokument, och visar att PDF och ArXiv-dokument innehåller fler bilder jämfört med HTML-dokument, med ArXiv-exemplen som de mest bildtäta.

Hur förbättrar olika datakällor dokumentvariationen?

En viktig motivation för att utöka poolen av multimodala dokument utöver HTML är förbättringen av domän täckning. För att kvantifiera variationen och djupet i denna täckning, tränades en Latent Dirichlet Allocation (LDA)-modell på 100 000 dokument sampade från OBELICS-datasetet, HTML-undersamlingen i MINT-1T och PDF-undersamlingen (exklusive ArXiv) i MINT-1T för att få 200 ämnen. GPT-4 användes sedan för att klassificera uppsättningen av ord för att identifiera de dominerande domänerna – som Hälsa & Medicin, Vetenskap, Företag, Humaniora, Historia, etc. – baserat på MMMU-domäner. Analysen visar distinkta trender i domänfördelning:

  • OBELICS: Detta dataset visar en tydlig koncentration i “Humaniora och samhällsvetenskap”. Detta kan tillskrivas dess datakonstruktionsprocess, som innebär att dokument som inte liknar Wikipedia-artiklar filtreras bort, vilket potentiellt förändrar fördelningen till mer allmän kunskap och humaniora-inriktat innehåll.
  • MINT-1T:s HTML-undersamling: I kontrast till OBELICS, är MINT-1T:s HTML-undersamling inte starkt förvrängd mot någon specifik domän, vilket tyder på en bredare och mer balanserad domäntäckning.
  • MINT-1T:s PDF-undersamling: Det finns en högre andel “Vetenskap och teknik”-dokument inom PDF-dokumenten i MINT-1T. Denna trend är troligen ett resultat av den vetenskapliga kommunikationens natur, där PDF är det föredragna formatet för att dela detaljerade forskningspapper och tekniska rapporter.

MINT-1T: Resultat och experiment

För alla experiment, tränar MINT-1T modellen på 50% bild-text-kapitel och 50% multimodala sammanflätade batcher. En maximalt 2048 multimodal token sampas från varje sammanflätat dokument och 340 token från varje bild-text-exempel. Liksom Flamingo, läggs en “slut”-token till för att indikera slutet på en angränsande bild-text-sekvens. Under träning, släpps 50% av enstaka bild-sammanflätade dokument slumpmässigt för att översample multi-bild-dokument. Bild-text-datasetet består av en blandning av internt kuraterade kapitel-dataset. Modellens förmåga att resonera om multimodala sammanflätade sekvenser utvärderas genom dess in-kontext-lärande-förmåga och multi-bild-resonemangsprestanda.

Ovanstående figur visar procentandelen dokument från varje domän i MMMU för OBELICS och undersamlingar av MINT-1T.

In-kontext-lärande: Modellerna utvärderas på fyra-skott och åtta-skott in-kontext-lärande-prestanda på olika kapitel-benchmark (COCO (Karpathy-test) och TextCaps (validering)) och visuell fråge-svar-dataset (VQAv2 (validering), OK-VQA (validering), TextVQA (validering) och VizWiz (validering)). Demonstrationer sampas slumpmässigt från träningsuppsättningen. Poängen genomsnittlig över flera utvärderingskörningar, med slumpmässigt valda demonstrationer för att hantera känslighet för valda promptrar. Olika promptrar ableras för varje uppgift för att välja de bäst presterande.

Multi-bild-resonemang: Modeller utvärderas på MMMU (innehållande både enstaka och multi-bild-frågor) och Mantis-Eval (alla multi-bild-frågor) för att undersöka multi-bild-resonemangs-förmåga utöver in-kontext-lärande-utvärderingar.

Träning på HTML-dokument

Initialt jämförs HTML-delen av MINT-1T med OBELICS, eftersom OBELICS är det tidigare ledande sammanflätade datasetet, också kuraterat från HTML-dokument. Två modeller tränas på HTML-delarna av MINT-1T och OBELICS för totalt 10B multimodala token. Deras in-kontext-lärande-prestanda utvärderas. Följande tabell presenterar fyra-skott och åtta-skott-prestanda på vanliga benchmark; modellen tränad på MINT-1T HTML-dokument presterar bättre än OBELICS på VQA-uppgifter men sämre på kapitel-benchmark. I genomsnitt presterar OBELICS något bättre än MINT-1T (HTML).

Tillägg av PDF och ArXiv-dokument

Därefter utförs träning på MINT-1T:s fullständiga datakällor, med en blandning av HTML, PDF och ArXiv-dokument. De sammanflätade dokumenten sampas med 50% från HTML, 45% från PDF och 5% från ArXiv. Modellen tränas för totalt 10B multimodala token. Som visas i ovanstående tabell, presterar modellen tränad på MINT-1T:s fullständiga data-blandning bättre än OBELICS och MINT-1T (HTML) på de flesta in-kontext-lärande-benchmark. På mer komplexa multimodala resonemangs-benchmark, presterar MINT-1T-modellen bättre än OBELICS på MMMU men presterar sämre på Mantis-Eval.

Finare trender

Hur skalar in-kontext-lärande-prestanda med demonstrationer?

In-kontext-lärande-prestanda utvärderas när modellen promptas med en till åtta demonstrationer. En enda försök per skott-räkning körs för varje utvärderings-benchmark. Som visas i följande figur, presterar modellen tränad på MINT-1T bättre än modellen tränad på MINT-1T:s HTML-undersamling och OBELICS över alla skott. MINT-1T (HTML)-modellen presterar något sämre än OBELICS.

Prestanda på kapitel och visuell fråge-svar-uppgifter

Följande figur presenterar den genomsnittliga in-kontext-lärande-prestandan på kapitel och visuell fråge-svar-benchmark. OBELICS presterar bättre än alla MINT-1T-varianter på fyra-skott-kapitel-benchmark och presterar något sämre jämfört med MINT-1T på åtta-skott-kapitel. Dock presterar MINT-1T signifikant bättre än båda baslinjerna på VQA-benchmark. MINT-1T (HTML) presterar också bättre än OBELICS på VQA-uppgifter.

Prestanda på olika domäner

Inkludering av varierade domäner i MINT-1T syftar till att förbättra modellens generalisering. Figuren tidigare bryter ner prestandan på MMMU för varje domän. Förutom “Företag”-domänen, presterar MINT-1T bättre än OBELICS och MINT-1T (HTML). Prestandaförbättringen i “Vetenskap och teknik”-domäner för MINT-1T tillskrivs förekomsten av dessa domäner i ArXiv- och PDF-dokument.

Slutliga tankar

I denna artikel har vi talat om MINT-1T, det största och mest varierade multimodala sammanflätade öppen källkods-dataset hittills. MINT-1T: Ett 10x större dataset, som innehåller en trillion texttoken och 3,4 miljarder bilder, jämfört med befintliga öppen källkods-dataset. MINT-1T-datasetet introducerar också tidigare outnyttjade källor som PDF-filer och ArXiv-papper. Eftersom multimodala sammanflätade dataset inte skalar lätt, är det viktigt att MINT-1T-datasetet delar datakureringprocessen så att andra också kan utföra experiment på sådana informationsrika varianter. MINT-1T-datasetet visar att dess metod; LM-modeller tränade på MINT-1T är konkurrenskraftiga (om än något) till tidigare state-of-the-art OBELICS.

Kunal Kejriwal är en backend‑ingenjör som specialiserar sig på Python, PostgreSQL, Redis och molninfrastruktur på GCP och AWS. Med tre års erfarenhet av att bygga och skala produktionssystem skriver han om AI‑infrastruktur, distribuerade system och arkitekturen bakom distribution av maskininlärningsarbetsbelastningar.