Modely a platformy AI

MINT-1T: Škálování otevřených multimodálních dat 10x

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Školení velkých multimodálních modelů (LMM) vyžaduje velké datové sady s proloženými sekvencemi obrázků a textu ve volné formě. Ačkoli se otevřené multimodální modely vyvíjejí rychle, stále chybí multimodální proložené datové sady otevřené zdroje ve velkém měřítku. Důležitost těchto dat nelze přehlédnout, protože vytvářejí základ pro vytváření pokročilých systémů umělé inteligence, které jsou schopné porozumět a generovat obsah napříč různými modalitami. Bez dostatečného zásobování komplexními, proloženými datovými sadami je potenciál pro vývoj více sofistikovaných a schopných LMM podstatně omezen. Tyto datové sady umožňují modelům učit se z široké škály vstupů, což je činí více všestrannými a účinnými v různých aplikacích. Kromě toho nedostatek takových dat představuje výzvu pro otevřenou komunitu, která se spoléhá na sdílené zdroje pro pohánění inovace a spolupráce.

Otevřené multimodální modely udělaly významné pokroky v posledních letech, ale jejich růst je brzděn omezenou dostupností velkých, proložených datových sad. Pro překonání této překážky jsou zapotřebí soustředěné úsilí pro kurátování, anotaci a uvolňování více komplexních datových sad, které mohou podporovat pokračující vývoj a rafinaci multimodálních modelů. Kromě toho vytváření a šíření těchto datových sad zahrnuje překonání několika technických a logistických překážek. Sběr dat musí být rozsáhlý a reprezentativní pro různé kontexty, ve kterých budou LMM nasazeny. Anotace vyžaduje pečlivé zvážení, aby se zajistilo, že proložené sekvence obrázků a textu jsou zarovnány způsobem, který zlepšuje schopnosti modelu učit se. Kromě toho zajištění, aby datové sady byly otevřené zdroje, vyžaduje řešení právních a etických otázek souvisejících s ochranou osobních údajů a právy na použití.

MINT-1T, největší a nejrozmanitější multimodální proložená otevřená datová sada do dneška. MINT-1T: 10x větší měřítko, včetně jednoho bilionu textových tokenů a 3,4 miliardy obrázků než stávající otevřené datové sady. Datová sada MINT-1T také představuje dosud nezveřejněné zdroje, jako jsou soubory PDF a články ArXiv. Protože multimodální proložené datové sady se nedají snadno škálovat, je důležité, aby datová sada MINT-1T sdílela proces kurátování dat, aby mohli ostatní také provádět experimenty na takových informačně bohatých variantách. Datová sada MINT-1T demonstruje, že její metoda; modely LM školené na MINT-1T jsou konkurenceschopné (i když somewhat) s předchozími státními multimodálními modely OBELICS.

MINT-1T: Multimodální datová sada s jedním bilionem tokenů

Velké otevřené datové sady pro předškolní vzdělávání byly zásadní pro výzkumnou komunitu při zkoumání datové inženýrství a školení transparentních, otevřených modelů. V textovém doméně hrály rané práce, jako jsou C4 a The Pile, zásadní roli při umožnění komunitě školení první sady otevřených velkých jazykových modelů, jako jsou GPT-J, GPT-Neo a další. Tyto základní úsilí také připravily cestu pro následné zlepšení metod filtrování dat a škálování. Podobně v prostoru obrázků a textu vyvolaly velké otevřené datové sady inovace v lepších metodách kurátování dat, jako jsou sítě filtrování dat a T-MARS. Je patrný posun od laboratoří na hranici směrem ke školení velkých multimodálních modelů (LMM), které vyžadují rozsáhlé multimodální proložené datové sady skládající se z volných sekvencí obrázků a textu. Jak se schopnosti modelů na hranici rychle rozvíjejí, objevuje se významná mezera v multimodálních trénovacích datech mezi uzavřeným a otevřeným zdrojem. Současné otevřené multimodální proložené datové sady jsou menší a méně rozmanité než jejich textové protějšky, pocházející především z dokumentů HTML, což omezuje šíři a rozmanitost dat.

MINT-1T obsahuje celkem jeden bilion textových tokenů a tři miliardy obrázků, pocházejících z rozmanitých zdrojů, jako jsou HTML, PDF a ArXiv. Před MINT-1T byla největší otevřená datová sada v této oblasti OBELICS, která zahrnovala 115 miliard textových tokenů a 353 milionů obrázků, všechny pocházející z HTML.

Přínosy MINT-1T jsou následující:

  • Inženýrství dat: Škálování této multimodální proložené datové sady představuje větší inženýrskou výzvu než budování textových nebo obrázkových párů datových sad. Zpracování mnohem větších velikostí dokumentů a zachování původního pořadí obrázků a textu je zásadní.
  • Rozmanitost: MINT-1T je první v multimodálním proloženém prostoru, který shromažďuje vysoce kvalitní multimodální dokumenty ve velkém měřítku zdrojů, jako jsou soubory PDF a články ArXiv.
  • Experimenty s modely: Experimenty ukazují, že LMM školené na MINT-1T nejen odpovídají, ale potenciálně překonávají výkon modelů školených na nejlepší stávající otevřené datové sadě, OBELICS, a nabízí desetkrát větší měřítko.

MINT-1T: Konstrukce datové sady

MINT-1T kurátuje velkou otevřenou datovou sadu, která využívá více rozmanitých zdrojů proložených dokumentů, jako jsou soubory PDF a články ArXiv. Tato sekce podrobně popisuje metody MINT-1T pro získávání multimodálních dokumentů, filtrování nízkokvalitního obsahu, deduplikaci dat a odstraňování nevhodného nebo nežádoucího materiálu. Konečná datová sada se skládá z 922 miliard (B) tokenů HTML, 106 miliard tokenů PDF a 9 miliard tokenů ArXiv.

Získávání velkých množství multimodálních dokumentů

Proces HTML

MINT-1T následuje metodu OBELICS pro extrakci proložených multimodálních dokumentů z CommonCrawl WARC souborů analýzou DOM stromu každého WARC vstupu. Zatímco OBELICS zpracovávala dokumenty pouze z února 2020 do února 2023 CommonCrawl dumpů, MINT-1T rozšířila fond dokumentů na HTML dokumenty od května 2017 do dubna 2024 (s kompletními dumpami od října 2018 do dubna 2024 a částečnými dumpami z předchozích let). Podobně jako OBELICS, MINT-1T filtrovala dokumenty, které neobsahují žádné obrázky, více než třicet obrázků nebo obrázky s URL, které obsahují nevhodné podřetězce, jako je logo, avatar, pornografie a xxx.

Proces PDF

MINT-1T získává dokumenty PDF z CommonCrawl WAT souborů z února 2023 do dubna 2024 dumpů. Nejprve jsou extrahovány všechny odkazy na soubory PDF z těchto dumpů. MINT-1T pak pokusí stáhnout a přečíst soubory PDF pomocí PyMuPDF, odstraní soubory PDF větší než 50 MB (pravděpodobně obsahující velké obrázky) a ty, které jsou delší než 50 stran. Stránky bez textu jsou vyloučeny a je stanoven čtecí pořadí pro zbývající stránky. Čtecí pořadí je určeno nalezením ohraničujícího rámečku všech textových bloků na stránce, seskupením bloků podle sloupců a seřazením zleva doprava.

Proces ArXiv

MINT-1T vytváří proložené dokumenty ArXiv z LaTeX zdrojového kódu pomocí TexSoup pro nalezení značky figure a proložením obrázků s textem článku. Pro více souborových článků MINT-1T identifikuje hlavní soubor Tex a nahrazuje značky input obsahem svých souborů. LaTeX kód je očištěn odstraněním importů, bibliografie, tabulek a citačních značek. Protože ArXiv je již vysoce kurátorský zdroj dat, nejsou prováděna žádná další filtrování a deduplikace.

Filtrování kvality textu

MINT-1T se vyhýbá použití modelových heuristik pro filtrování textu, následujících postupů stanovených RefinedWeb, Dolma a FineWeb. Nejprve jsou eliminovány dokumenty, které nejsou v angličtině, pomocí modelu identifikace jazyka Fasttext (s prahem spolehlivosti 0,65). Dokumenty s URL, které obsahují nevhodné podřetězce, jsou také odstraněny, aby se vyloučily pornografické a nežádoucí obsahy. Metody filtrování textu z RefinedWeb jsou aplikovány, konkrétně odstraněny dokumenty s nadměrnými duplicitními n-gramy nebo ty, které jsou identifikovány jako nízkokvalitní pomocí pravidel MassiveText.

Filtrování obrázků

Po kurátování souborů PDF a HTML se MINT-1T pokusí stáhnout všechny odkazy na obrázky v datové sadě HTML, odstraní neplatné odkazy a odstraní dokumenty bez platných odkazů na obrázky. Obrázky menší než 150 pixelů jsou odstraněny, aby se zabránilo šumu, jako jsou loga a ikony, a obrázky větší než 20 000 pixelů jsou také odstraněny, protože obvykle odpovídají mimo téma obrázků. Pro dokumenty HTML jsou odstraněny obrázky s poměrem stran větší než dva, aby se filtrovaly nízkokvalitní obrázky, jako jsou reklamní banner. Pro soubory PDF je práh upraven na tři, aby se zachovaly vědecké obrázky a tabulky.

Výše uvedená figura znázorňuje, jak MINT-1T jedinečně zahrnuje data ze souborů PDF a článků ArXiv nad rámec zdrojů HTML.

Filtrování bezpečnosti

  • Filtrování NSFW obrázků: MINT-1T aplikuje detektor NSFW obrázků na všechny obrázky v datové sadě. Pokud dokument obsahuje jeden NSFW obrázek, celý dokument je odstraněn.
  • Odstranění osobních údajů: Pro zmírnění rizika úniku osobních údajů jsou e-mailové adresy a IP adresy v textových datech anonymizovány. E-mailové adresy jsou nahrazeny šablonami, jako je “email@example.com”, a IP adresy jsou nahrazeny náhodně generovanými nefunkčními IP adresami.

Deduplikace

MINT-1T provádí deduplikaci odstavců a dokumentů v rámci každé CommonCrawl snímku a deduplikaci obrázků pro odstranění opakujících se, neinformativních obrázků, jako jsou ikony a loga. Všechny kroky deduplikace jsou prováděny samostatně pro každý zdroj dat.

Deduplikace odstavců a dokumentů

Následujícím způsobem Dolma, MINT-1T používá Bloomův filtr pro efektivní deduplikaci textu, nastavuje falešně pozitivní rychlost na 0,01 a deduplikuje 13-gramové odstavce (označené dvojitými novými řádky) z každého dokumentu. Pokud je více než 80 % odstavců v dokumentu duplikováno, celý dokument je odstraněn.

Odstranění běžných boilerplate textů

Po deduplikaci odstavců MINT-1T odstraní krátké běžné boilerplate věty v dokumentech HTML, jako je “Skip to content” nebo “Blog Archive”. To se provádí spuštěním exact deduplikace odstavců na 2 % každého CommonCrawl snímku, v souladu s postupy CCNet, zajišťujícího odstranění především běžných boilerplate textů.

Výše uvedená figura demonstruje proces filtrování pro MINT-1T a ukazuje, jak jsou tokeny odstraněny v průběhu datové sady pro HTML, PDF a články ArXiv.

Deduplikace obrázků

V rámci každého CommonCrawl snímku MINT-1T odstraní často se opakující obrázky na základě hashů SHA256. Místo striktní deduplikace jsou odstraněny pouze obrázky, které se objevují více než desetkrát v rámci snímku, následujícím postupem Multimodal-C4. Konsistentně s OBELICS, opakující se obrázky v rámci jednoho dokumentu jsou odstraněny, přičemž je zachován pouze první výskyt.

Infrastruktura

Během zpracování dat MINT-1T měl přístup k průměrně 2 350 jader CPU z mixu 190-procesorových a 90-procesorových uzlů. Celkově bylo použito přibližně 4,2 milionu hodin CPU pro sestavení této datové sady.

Porovnání složení dokumentů v MINT-1T s OBELICS

Při hodnocení složení proložených datových sad jsou zkoumány dva klíčové charakteristiky: distribuce textových tokenů na dokument a počet obrázků na dokument. Pro tuto analýzu byly náhodně vybrány 50 000 dokumentů z obou OBELICS a každé datové sady v MINT-1T. Tokenizátor GPT-2 byl použit pro výpočet počtu textových tokenů. Outliery byly odstraněny vyloučením dokumentů, které spadaly mimo 1,5 interkvartilního rozmezí pro počet textových tokenů a obrázků. Jak je znázorněno v následující figurce, podmnožina HTML MINT-1T se blízce shoduje s distribucí tokenů pozorovanou v OBELICS. Nicméně dokumenty pocházející ze souborů PDF a článků ArXiv tendují být delší než dokumenty HTML v průměru, zdůrazňující výhody získávání dat z rozmanitých zdrojů. Figura 5 zkoumá hustotu obrázků napříč všemi dokumenty, odhalující, že soubory PDF a články ArXiv obsahují více obrázků ve srovnání s dokumenty HTML, přičemž články ArXiv jsou nejvíce hustě obrázkové.

Jak různé zdroje dat zlepšují rozmanitost dokumentů?

Důležitou motivací pro rozšíření fondu multimodálních dokumentů za hranice HTML je zlepšení pokrytí domén. Pro kvantifikaci rozmanitosti a hloubky tohoto pokrytí byl vyškolěn model Latent Dirichlet Allocation (LDA) na 100 000 dokumentech vybraných z datové sady OBELICS, podmnožiny HTML MINT-1T a podmnožiny PDF (vyloučené ArXiv) z MINT-1T, aby se získalo 200 témat. Model GPT-4 byl poté použit pro klasifikaci souboru slov, aby se identifikovaly dominantní domény – jako jsou Zdraví a medicína, Věda, Obchod, Humanitní vědy, Historie atd. – na základě domén MMMU. Analýza odhaluje zřetelné trendy v distribuci domén:

  • OBELICS: Tato datová sada vykazuje výraznou koncentraci v “Humanitních a sociálních vědách”. To lze připsat procesu konstrukce dat, který zahrnuje filtrování dokumentů, které se nepodobají článkům Wikipedie, což potenciálně mění distribuci směrem k obecným znalostem a humanitním obsahům.
  • Podmnožina HTML MINT-1T: Na rozdíl od OBELICS je podmnožina HTML MINT-1T nesmírně zkreslena směrem k žádné konkrétní doméně, naznačující širší a vyváženější reprezentaci domén.
  • Podmnožina PDF MINT-1T: Existuje vyšší podíl “Vědy a technologie” dokumentů v rámci dokumentů PDF MINT-1T. Tento trend je pravděpodobně způsoben povahou vědecké komunikace, kde soubory PDF jsou preferovaným formátem pro sdílení podrobných výzkumných prací a technických zpráv.

MINT-1T: Výsledky a experimenty

Pro všechny experimenty MINT-1T školení modelu na 50 % obrazových a textových popisků a 50 % multimodálních proložených dávek. Maximálně 2048 multimodálních tokenů je vzorkováno z každého proloženého dokumentu a 340 tokenů z každého obrazového a textového vzorku. Podobně jako Flamingo, je přidán “end” token pro označení konce sousední obrazové a textové sekvence. Během školení je 50 % jednoduchých obrazových dokumentů náhodně odstraněno, aby se přednostně vybraly dokumenty s více obrázky. Datová sada obrazů a textu se skládá z mixu interně kurátorských datových sad popisků. Schopnost modelu uvažovat o multimodálních proložených sekvencích je hodnocena prostřednictvím jeho schopností učení v kontextu a vícebodového uvažování.

Výše uvedená figura ilustruje procento dokumentů z každé domény v MMMU pro OBELICS a podmnožiny MINT-1T.

Učení v kontextu: Modely jsou hodnoceny na čtyřbodovém a osmibodovém učení v kontextu na různých benchmarcích popisků (COCO (Karpathy test) a TextCaps (validace)) a datových sadách pro vizuální dotazování (VQAv2 (validace), OK-VQA (validace), TextVQA (validace) a VizWiz (validace)). Demonstrace jsou náhodně vybrány z trénovací sady. Skóre jsou průměrována přes více vyhodnocovacích běhů, s náhodně vybranými demonstracemi, aby se zohlednila citlivost na zvolené podněty. Různé podněty jsou testovány pro každou úlohu, aby se vybral ten nejlepší.

Vícebodové uvažování: Modely jsou hodnoceny na MMMU (obsahující jak jednoduché, tak vícebodové otázky) a Mantis-Eval (všechny vícebodové otázky), aby se prozkoumala vícebodová uvažovací schopnost za hranice hodnocení učení v kontextu.

Školení na dokumentech HTML

Zpočátku je porovnávána část HTML MINT-1T s OBELICS, protože OBELICS je předchozí vedoucí proložená datová sada, také kurátorská z dokumentů HTML. Dva modely jsou školeny na částech HTML MINT-1T a OBELICS pro celkem 10 miliard multimodálních tokenů. Jejich učení v kontextu je hodnoceno. Následující tabulka prezentuje čtyřbodový a osmibodový výkon na běžných benchmarcích; model školený na částech HTML MINT-1T vykazuje lepší výkon než OBELICS na úkolech VQA, ale horší na benchmarcích popisků. Průměrně OBELICS vykazuje mírně lepší výkon než MINT-1T (HTML).

Přidání dokumentů PDF a ArXiv

Následně je provedeno školení na plných zdrojích dat MINT-1T, se směsí dokumentů HTML, PDF a ArXiv. Proložené dokumenty jsou vzorkovány se 50 % z HTML, 45 % z PDF a 5 % z ArXiv. Model je školen pro celkem 10 miliard multimodálních tokenů. Jak je vidět v výše uvedené tabulce, model školený na plné datové sadě MINT-1T překonává OBELICS a MINT-1T (HTML) na většině benchmarcích učení v kontextu. Na složitějších multimodálních úkolech uvažování model MINT-1T překonává OBELICS na MMMU, ale vykazuje horší výkon na Mantis-Eval.

Jemné trendy

Jak se učení v kontextu měří se demonstracemi?

Učení v kontextu je hodnoceno, když je model podněcován jednou až osmými demonstracemi. Jeden pokus je proveden pro každý počet demonstrací pro každou vyhodnocovací benchmarkovou úlohu. Jak je vidět v následující figurce, model školený na MINT-1T překonává model školený na podmnožině HTML MINT-1T a OBELICS napříč všemi demonstracemi. Model MINT-1T (HTML) vykazuje mírně horší výkon než OBELICS.

Výkon na úkolech popisků a vizuálního dotazování

Následující figura prezentuje průměrný výkon učení v kontextu na benchmarcích popisků a vizuálního dotazování. OBELICS překonává všechny varianty MINT-1T na čtyřbodových benchmarcích popisků a vykazuje mírně horší výkon ve srovnání s MINT-1T na osmibodových benchmarcích popisků. Nicméně MINT-1T významně překonává obě základní varianty na benchmarcích VQA. MINT-1T (HTML) také překonává OBELICS na úkolech VQA.

Výkon na různých doménách

Zahrnutí rozmanitých domén do MINT-1T je zaměřeno na zlepšení generalizace modelu. Předchozí figura rozkládá výkon na MMMU pro každou doménu. S výjimkou domény Obchod MINT-1T překonává OBELICS a MINT-1T (HTML). Zvýšení výkonu ve vědeckých a technologických doménách pro MINT-1T je připsáno prevalenci těchto domén v dokumentech ArXiv a PDF.

Závěrečné myšlenky

V tomto článku jsme diskutovali o MINT-1T, největší a nejrozmanitější multimodální proložené otevřené datové sadě do dneška. MINT-1T: 10x větší měřítko, včetně jednoho bilionu textových tokenů a 3,4 miliardy obrázků než stávající otevřené datové sady. Datová sada MINT-1T také představuje dosud nezveřejněné zdroje, jako jsou soubory PDF a články ArXiv. Protože multimodální proložené datové sady se nedají snadno škálovat, je důležité, aby datová sada MINT-1T sdílela proces kurátování dat, aby mohli ostatní také provádět experimenty na takových informačně bohatých variantách. Datová sada MINT-1T demonstruje, že její metoda; modely LM školené na MINT-1T jsou konkurenceschopné (i když somewhat) s předchozími státními multimodálními modely OBELICS.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.