Modele și platforme AI
MINT-1T: Scalarea datelor multimodale open-source de 10 ori
Pentru a antrena modele multimodale mari (LMM) este nevoie de seturi de date mari cu secvențe de imagini și text în formă liberă. Deși modelele LMM open-source s-au dezvoltat rapid, încă există o lipsă majoră de seturi de date multimodale intercalate la scară largă care sunt open-source. Importanța acestor seturi de date nu poate fi supraestimată, deoarece ele reprezintă baza pentru crearea unor sisteme avansate de inteligență artificială capabile să înțeleagă și să genereze conținut în diferite moduri. Fără o cantitate suficientă de seturi de date comprehensive și intercalate, potențialul de a dezvolta modele LMM mai sofisticate și capabile este semnificativ împiedicat. Aceste seturi de date permit modelelor să învețe dintr-o varietate de intrări, făcându-le mai versatile și eficiente în diferite aplicații. Mai mult, lipsa acestor seturi de date reprezintă o provocare pentru comunitatea open-source, care se bazează pe resurse partajate pentru a stimula inovația și colaborarea.
Modelele LMM open-source au făcut progrese semnificative în ultimii ani, dar creșterea lor este împiedicată de disponibilitatea limitată a seturilor de date multimodale intercalate la scară largă. Pentru a depăși acest obstacol, sunt necesare eforturi concertate pentru a cura și a publica seturi de date mai comprehensive care să poată susține dezvoltarea și rafinarea continuă a modelelor multimodale. În plus, crearea și diseminarea acestor seturi de date implică depășirea unor obstacole tehnice și logistice. Colectarea datelor trebuie să fie extinsă și reprezentativă pentru contextele diverse în care vor fi utilizate modelele LMM. Anotarea necesită o atenție deosebită pentru a asigura că secvențele de imagini și text sunt aliniate într-un mod care să îmbunătățească capacitățile de învățare ale modelului. Mai mult, asigurarea că seturile de date sunt open-source implică abordarea unor considerații legale și etice legate de confidențialitatea datelor și drepturile de utilizare. Extinderea disponibilității seturilor de date multimodale intercalate de înaltă calitate și la scară largă este esențială pentru viitorul cercetării și dezvoltării inteligenței artificiale. Prin abordarea lipsei actuale, comunitatea inteligenței artificiale poate stimula o inovație și colaborare mai mare, conducând la crearea unor modele LMM mai puternice și versatile capabile să abordeze probleme complexe și reale.
Pe această notă, MINT-1T, cel mai mare și mai divers set de date multimodale intercalate open-source până în prezent. MINT-1T: O scară de 10 ori mai mare, incluzând un trilion de tokeni de text și 3,4 miliarde de imagini decât seturile de date open-source existente. Setul de date MINT-1T introduce, de asemenea, surse niciodată expuse, cum ar fi fișierele PDF și articolele ArXiv. Deoarece seturile de date multimodale intercalate nu se pot scala ușor, este important ca setul de date MINT-1T să împărtășească procesul de curățare a datelor, astfel încât și alții să poată efectua experimente pe astfel de variante informative. Setul de date MINT-1T demonstrează că metoda sa; modelele LM antrenate pe MINT-1T sunt competitive (chiar dacă într-o oarecare măsură) cu cele mai bune seturi de date open-source existente, OBELICS.
MINT-1T: Un set de date multimodale cu un trilion de tokeni
Seturile de date open-source de antrenare la scară largă au fost esențiale pentru comunitatea de cercetare în explorarea ingineriei datelor și a antrenării modelelor transparente și open-source. În domeniul textului, lucrările timpurii, cum ar fi C4 și The Pile, au jucat un rol crucial în permiterea comunității să antreneze primul set de modele de limbaj mare open-source, cum ar fi GPT-J, GPT-Neo și altele. Aceste eforturi fundamentale au deschis, de asemenea, calea pentru îmbunătățiri ulterioare în metodele de filtrare a datelor și de scalare. Similar, în spațiul imagine-text, seturile de date open-source la scară largă au stimulat inovații în metodele de curățare a datelor, cum ar fi rețelele de filtrare a datelor și T-MARS. Există o schimbare evidentă de la laboratoarele de frontieră către antrenarea modelelor multimodale mari (LMM) care necesită seturi de date multimodale intercalate extinse, cuprinzând secvențe libere de imagini și text. Pe măsură ce capacitățile modelelor de frontieră se dezvoltă rapid, o lacună semnificativă apare în datele de antrenare multimodale între modelele închise și cele open-source. Seturile de date multimodale intercalate open-source actuale sunt mai mici și mai puțin diverse decât omologii lor de text, fiind obținute în principal din documente HTML, ceea ce limitează amploarea și varietatea datelor. Această limitare împiedică dezvoltarea unor modele LMM open-source robuste și creează o disparitate între capacitățile modelelor open-source și cele închise.
Pentru a aborda această lacună, MINT-1T a fost creat ca cel mai mare și mai divers set de date multimodale intercalate open-source până în prezent. MINT-1T conține un total de un trilion de tokeni de text și trei miliarde de imagini, obținute din surse diverse, cum ar fi HTML, PDF și ArXiv. Înainte de MINT-1T, cel mai mare set de date open-source în acest domeniu a fost OBELICS, care includea 115 miliarde de tokeni de text și 353 de milioane de imagini, toate obținute din documente HTML.

Contribuțiile MINT-1T sunt următoarele:
- Ingineria datelor: Scalarea acestor date multimodale intercalate prezintă mai mult o provocare de inginerie decât construirea unor seturi de date de text sau imagini-text.
- Diversitate: MINT-1T este primul în spațiul multimodal intercalat care adună documente multimodale de înaltă calitate la scară largă din surse cum ar fi fișierele PDF și articolele ArXiv.
- Experimente cu modele: Experimentele arată că modelele LMM antrenate pe MINT-1T nu numai că se potrivesc, dar pot și depăși performanța modelelor antrenate pe cel mai bun set de date open-source existent, OBELICS, oferind o creștere de zece ori a dimensiunii.
MINT-1T: Construirea setului de date
MINT-1T curăță un set de date open-source la scară largă care utilizează surse mai diverse de documente intercalate, cum ar fi fișierele PDF și articolele ArXiv. Această secțiune detaliază metodele MINT-1T pentru obținerea de documente multimodale, filtrarea conținutului de calitate scăzută, deduplicarea datelor și eliminarea conținutului necorespunzător sau NSFW. Setul de date final cuprinde 922 de miliarde de tokeni HTML, 106 miliarde de tokeni PDF și 9 miliarde de tokeni ArXiv.
Obținerea unor cantități mari de documente multimodale
Pipeline-ul HTML
MINT-1T urmează metoda OBELICS pentru extragerea documentelor multimodale intercalate din fișierele WARC CommonCrawl, prin parsarea arborelui DOM al fiecărui intrare WARC. În timp ce OBELICS a procesat doar documente din perioada februarie 2020 până în februarie 2023 din dump-urile CommonCrawl, MINT-1T a extins baza de documente pentru a include documente HTML din mai 2017 până în aprilie 2024 (cu dump-uri complete din octombrie 2018 până în aprilie 2024 și dump-uri parțiale din anii anteriori). Similar cu OBELICS, MINT-1T filtrează documentele care conțin zero imagini, mai mult de treizeci de imagini sau imagini cu URL-uri care includ substraturi inadecvate, cum ar fi logo, avatar, porn sau xxx.
Pipeline-ul PDF
MINT-1T obține documente PDF din fișierele WAT CommonCrawl din perioada februarie 2023 până în aprilie 2024. Inițial, toate link-urile către fișiere PDF sunt extrase din aceste dump-uri. MINT-1T încearcă apoi să descarce și să citească fișierele PDF folosind PyMuPDF, eliminând fișierele PDF mai mari de 50 MB (probabil conținând imagini mari) și cele mai lungi de 50 de pagini. Paginile fără text sunt excluse, iar o ordine de citire este stabilită pentru paginile rămase. Ordinea de citire este determinată prin găsirea cutiei de delimitare a tuturor blocurilor de text de pe o pagină, gruparea blocurilor pe baza coloanelor și ordonarea lor de la stânga sus la dreapta jos. Imaginile sunt integrate în secvență pe baza proximității lor față de blocurile de text de pe aceeași pagină.

Pipeline-ul ArXiv
MINT-1T construiește documente intercalate ArXiv din codul sursă LaTeX, folosind TexSoup pentru a găsi etichetele de figură și a intercala imagini cu textul articolului. Pentru articole cu mai multe fișiere, MINT-1T identifică fișierul principal TeX și înlocuiește etichetele de intrare cu conținutul fișierelor sale. Codul LaTeX este curățat prin eliminarea importurilor, bibliografiei, tabelelor și etichetelor de citare. Deoarece ArXiv este deja o sursă de date bine curățată, nu se efectuează nicio filtrare și deduplicare suplimentară.
Filtrarea calității textului
MINT-1T evită utilizarea unor heuristici bazate pe modele pentru filtrarea textului, urmând practicile stabilite de RefinedWeb, Dolma și FineWeb. Inițial, documentele non-englезe sunt eliminate folosind modelul de identificare a limbii Fasttext (cu un prag de încredere de 0,65). Documentele cu URL-uri care conțin substraturi NSFW sunt eliminate pentru a exclude conținutul pornografic și nedorit. Metodele de filtrare a textului de la RefinedWeb sunt aplicate, în special eliminând documentele cu n-gramuri duplicate excesive sau cele identificate ca de calitate scăzută folosind regulile MassiveText.
Filtrarea imaginilor
După curățarea fișierelor PDF și HTML, MINT-1T încearcă să descarce toate link-urile de imagini din setul de date HTML, eliminând link-urile care nu pot fi recuperate și eliminând documentele fără link-uri de imagini valabile. Imaginile mai mici de 150 de pixeli sunt eliminate pentru a evita imaginile zgomotoase, cum ar fi logo-urile și iconele, iar imaginile mai mari de 20.000 de pixeli sunt eliminate deoarece de obicei corespund unor imagini off-topic. Pentru documentele HTML, imaginile cu un raport de aspect mai mare de doi sunt eliminate pentru a filtra imaginile de calitate scăzută, cum ar fi bannerele publicitare. Pentru fișierele PDF, pragul este ajustat la trei pentru a păstra figurile științifice și tabelele.

Figura de mai sus reprezintă modul în care MINT-1T include în mod unic date din fișierele PDF și articolele ArXiv, dincolo de sursele HTML.
Filtrarea siguranței
- Filtrarea imaginilor NSFW: MINT-1T aplică un detector de imagini NSFW tuturor imaginilor din setul de date. Dacă un document conține o singură imagine NSFW, întregul document este eliminat.
- Eliminarea informațiilor personale: Pentru a reduce riscul de scurgere de date personale, adresele de e-mail și adresele IP din datele text sunt anonimizate. Adresele de e-mail sunt înlocuite cu șabloane, cum ar fi “email@example.com”, iar adresele IP cu adrese IP nefuncționale generate aleator.
Deduplicarea
MINT-1T efectuează deduplicarea paragrafelor și documentelor de text în cadrul fiecărui snapshot CommonCrawl și deduplicarea imaginilor pentru a elimina imagini repetitive și neinformatice, cum ar fi iconele și logo-urile. Toate pașii de deduplicare sunt efectuați separat pentru fiecare sursă de date.
Deduplicarea paragrafelor și documentelor
Urmând metodologia Dolma, MINT-1T utilizează un filtru Bloom pentru deduplicarea eficientă a textului, setând rata de fals pozitiv la 0,01 și deduplicând paragrafe de 13-grami (indicate prin delimitatoare de linie dublă) din fiecare document. Dacă mai mult de 80% din paragrafele unui document sunt duplicate, întregul document este eliminat.
Eliminarea textului de boilerplate comun
După deduplicarea paragrafelor, MINT-1T elimină propoziții scurte de boilerplate comune în documentele HTML, cum ar fi “Sari la conținut” sau “Arhiva blogului”. Acest lucru se realizează prin executarea deduplicării paragrafelor exacte pe 2% din fiecare snapshot CommonCrawl, în conformitate cu practicile CCNet, asigurând în mare măsură eliminarea textului de boilerplate comun.

Figura de mai sus demonstrează procesul de filtrare pentru MINT-1T și arată cum tokenii sunt eliminați pe tot parcursul pipeline-ului de date pentru HTML, PDF și articole ArXiv.
Deduplicarea imaginilor
În cadrul fiecărui snapshot CommonCrawl, MINT-1T elimină imaginile care apar frecvent pe baza hash-urilor SHA256. În loc de deduplicare strictă, doar imaginile care apar de mai mult de zece ori într-un snapshot sunt eliminate, urmând practicile Multimodal-C4. Conform cu OBELICS, imaginile repetitive în cadrul unui singur document sunt eliminate, păstrându-se doar prima apariție.
Infrastructură
Pe parcursul procesării datelor, MINT-1T a avut acces la o medie de 2.350 de nuclei CPU de la o combinație de noduri cu 190 de procesori și 90 de procesori. În total, aproximativ 4,2 milioane de ore CPU au fost utilizate pentru a construi acest set de date.
Compararea compoziției documentelor în MINT-1T cu OBELICS
La evaluarea compoziției seturilor de date intercalate, două caracteristici cheie sunt examinate: distribuția tokenilor de text pe document și numărul de imagini pe document. Pentru această analiză, 50.000 de documente au fost selectate aleator din OBELICS și din fiecare sursă de date din MINT-1T. Tokenizer-ul GPT-2 a fost utilizat pentru a calcula numărul de tokeni de text. Valorile extreme au fost eliminate prin excluderea documentelor care se aflau în afara intervalului de 1,5 intercuartil pentru numărul de tokeni de text și imagini. Așa cum se arată în figura următoare, subsetul HTML al MINT-1T se aliniază îndeaproape cu distribuția tokenilor din OBELICS. Cu toate acestea, documentele obținute din fișiere PDF și ArXiv tind să fie mai lungi decât documentele HTML, în medie, subliniind beneficiile obținerii de date din surse diverse.

Cum îmbunătățesc sursele de date diferite diversitatea documentelor?
O motivație importantă pentru extinderea bazei de documente multimodale dincolo de HTML este îmbunătățirea acoperirii domeniilor. Pentru a cuantifica diversitatea și profunzimea acestei acoperiri, un model LDA a fost antrenat pe 100.000 de documente selectate din setul de date OBELICS, subsetul HTML al MINT-1T și subsetul PDF (exclusiv ArXiv) din MINT-1T pentru a obține 200 de subiecte. GPT-4 a fost utilizat pentru a clasifica setul de cuvinte pentru a identifica domeniile dominante – cum ar fi Sănătate și Medicină, Știință, Afaceri, Umanități, Istorie, etc. – pe baza domeniilor MMMU. Analiza revelează tendințe distincte în distribuția domeniilor:
- OBELICS: Acest set de date prezintă o concentrare accentuată în “Umanități și Științe Sociale”. Acest lucru poate fi atribuit procesului său de construire a datelor, care implică filtrarea documentelor care nu semănă cu articolele Wikipedia, astfel alterând potențial distribuția către conținut de cunoaștere generală și umanități.
- Subsetul HTML al MINT-1T: În contrast cu OBELICS, subsetul HTML al MINT-1T nu este puternic încadrat într-un anumit domeniu, sugerând o reprezentare mai largă și mai echilibrată a domeniilor.
- Subsetul PDF al MINT-1T: Există o proporție mai mare de documente “Știință și Tehnologie” în documentele PDF din MINT-1T. Această tendință este probabil datorată naturii comunicării științifice, în care fișierele PDF sunt formatul preferat pentru partajarea rapoartelor de cercetare și rapoartelor tehnice detaliate.
MINT-1T: Rezultate și experimente
Pentru toate experimentele, MINT-1T antrenează modelul pe 50% de loturi de imagini-text și 50% de loturi multimodale intercalate. Un maxim de 2048 de tokeni multimodali este selectat din fiecare document intercalat și 340 de tokeni din fiecare eșantion de imagine-text. Similar cu Flamingo, un token “sfârșit” este adăugat pentru a indica sfârșitul unei secvențe de imagine-text adiacentă. În timpul antrenării, 50% din documentele cu o singură imagine intercalate sunt eliminate aleator pentru a supraspecifica documentele cu mai multe imagini. Setul de date de imagine-text este compus dintr-un amestec de seturi de date de caption intern curate.

Figura de mai sus ilustrează procentul de documente din fiecare domeniu în MMMU pentru OBELICS și subseturile MINT-1T.
Învățarea în context: Modelele sunt evaluate pe baza performanței de învățare în context cu patru și opt demonstrații pe diverse benchmark-uri de captionare (COCO și TextCaps) și seturi de date de întrebări și răspunsuri vizuale (VQAv2, OK-VQA, TextVQA și VizWiz). Demonstratiile sunt selectate aleator din setul de antrenare. Scorurile sunt mediate pe multiple rulări de evaluare, cu demonstrații aleatorii pentru a contabiliza sensibilitatea la prompt-urile alese. Prompt-urile diferite sunt abordate pentru fiecare sarcină pentru a selecta cele mai bune.
Raționamentul multi-imaginilor: Modelele sunt evaluate pe MMMU (care conține atât întrebări cu o singură imagine, cât și cu mai multe imagini) și Mantis-Eval (toate întrebările cu mai multe imagini) pentru a testa capacitățile de raționament multi-imagini dincolo de evaluările de învățare în context.
Antrenarea pe documente HTML
Inițial, porțiunea HTML a MINT-1T este comparată cu OBELICS, deoarece OBELICS este setul de date intercalat precedent, de asemenea, curățat din documente HTML. Două modele sunt antrenate pe porțiunile HTML ale MINT-1T și OBELICS pentru un total de 10 miliarde de tokeni multimodali. Performanța lor de învățare în context este evaluată. Tabela următoare prezintă performanța la patru și opt demonstrații pe benchmark-urile comune; modelul antrenat pe documentele HTML MINT-1T performează mai bine decât OBELICS pe sarcinile VQA, dar mai slab pe benchmark-urile de captionare. În medie, OBELICS performează ușor mai bine decât MINT-1T (HTML).

Adăugarea documentelor PDF și ArXiv
Ulterior, antrenamentul este efectuat pe toate sursele de date MINT-1T, cu un amestec de documente HTML, PDF și ArXiv. Documentele intercalate sunt eșantionate cu 50% din HTML, 45% din PDF-uri și 5% din ArXiv. Modelul este antrenat pentru un total de 10 miliarde de tokeni multimodali. Așa cum se arată în tabela de mai sus, modelul antrenat pe setul de date complet MINT-1T depășește OBELICS și MINT-1T (HTML) pe majoritatea benchmark-urilor de învățare în context. Pe benchmark-urile de raționament multimodal mai complex, modelul MINT-1T depășește OBELICS pe MMMU, dar performează mai slab pe Mantis-Eval.
Tendințe fine
Cum se scalează performanța de învățare în context cu demonstrațiile?
Performanța de învățare în context este evaluată atunci când se utilizează de la una la opt demonstrații. Un singur test pe fiecare număr de demonstrații este efectuat pentru fiecare benchmark de evaluare. Așa cum se arată în figura următoare, modelul antrenat pe MINT-1T depășește modelul antrenat pe subsetul HTML al MINT-1T și OBELICS pe toate demonstrațiile. Modelul MINT-1T (HTML) performează ușor mai slab decât OBELICS.

Performanța pe sarcinile de captionare și întrebări și răspunsuri vizuale
Figura următoare prezintă performanța medie de învățare în context pe benchmark-urile de captionare și întrebări și răspunsuri vizuale. OBELICS depășește toate variantele MINT-1T pe benchmark-urile de captionare cu patru demonstrații și performează ușor mai slab decât MINT-1T pe benchmark-urile de captionare cu opt demonstrații. Cu toate acestea, MINT-1T depășește semnificativ ambele benchmark-uri pe sarcinile VQA. MINT-1T (HTML) depășește, de asemenea, OBELICS pe sarcinile VQA.
Performanța pe domenii diferite
Includerea unor domenii diverse în MINT-1T are ca scop îmbunătățirea generalizării modelului. Figura anterioară detaliază performanța pe MMMU pentru fiecare domeniu. Cu excepția domeniului Afaceri, MINT-1T depășește OBELICS și MINT-1T (HTML). Creșterea performanței în domeniile Știință și Tehnologie pentru MINT-1T se datorează prezenței acestor domenii în documentele ArXiv și PDF.
Gânduri finale
În acest articol am discutat despre MINT-1T, cel mai mare și mai divers set de date multimodale intercalate open-source până în prezent. MINT-1T: O scară de 10 ori mai mare, incluzând un trilion de tokeni de text și 3,4 miliarde de imagini decât seturile de date open-source existente. Setul de date MINT-1T introduce, de asemenea, surse niciodată expuse, cum ar fi fișierele PDF și articolele ArXiv. Deoarece seturile de date multimodale intercalate nu se pot scala ușor, este important ca setul de date MINT-1T să împărtășească procesul de curățare a datelor, astfel încât și alții să poată efectua experimente pe astfel de variante informative. Setul de date MINT-1T demonstrează că metoda sa; modelele LM antrenate pe MINT-1T sunt competitive (chiar dacă într-o oarecare măsură) cu cele mai bune seturi de date open-source existente, OBELICS.












