Model dan platform AI
MINT-1T: Mengembangkan Data Multimodal Open-Source 10x
Pelatihan model multimodal besar (LMM) memerlukan dataset besar dengan urutan gambar dan teks yang diinterleaved dalam bentuk bebas. Meskipun LMM open-source telah berkembang pesat, masih ada kekurangan besar dalam dataset multimodal yang diinterleaved dan open-source. Pentingnya dataset ini tidak dapat dilebihkan, karena mereka membentuk dasar untuk menciptakan sistem AI canggih yang dapat memahami dan menghasilkan konten di berbagai modalitas. Tanpa pasokan dataset yang komprehensif dan diinterleaved, potensi untuk mengembangkan LMM yang lebih canggih dan efektif sangat terhambat. Dataset ini memungkinkan model untuk belajar dari berbagai input, membuatnya lebih serbaguna dan efektif dalam berbagai aplikasi. Selain itu, kelangkaan dataset seperti ini merupakan tantangan bagi komunitas open-source, yang mengandalkan sumber daya bersama untuk menggerakkan inovasi dan kolaborasi.
LMM open-source telah membuat kemajuan signifikan dalam beberapa tahun terakhir, tetapi pertumbuhannya terhambat oleh ketersediaan dataset multimodal yang diinterleaved dan besar. Untuk mengatasi hambatan ini, diperlukan upaya terkoordinasi untuk mengkurasi, menandai, dan merilis dataset yang lebih komprehensif yang dapat mendukung pengembangan dan penyempurnaan model multimodal. Selain itu, penciptaan dan penyebaran dataset ini melibatkan mengatasi beberapa hambatan teknis dan logistik. Pengumpulan data harus ekstensif dan representatif dari konteks yang beragam di mana LMM akan diterapkan. Penandaan memerlukan pertimbangan yang cermat untuk memastikan bahwa urutan gambar dan teks diinterleaved dengan cara yang meningkatkan kemampuan belajar model. Selain itu, memastikan bahwa dataset ini open-source memerlukan penanganan pertimbangan hukum dan etika yang terkait dengan privasi data dan hak penggunaan. Meningkatkan ketersediaan dataset multimodal yang diinterleaved dan besar sangat penting untuk masa depan penelitian dan pengembangan AI. Dengan mengatasi kelangkaan saat ini, komunitas AI dapat mendorong inovasi dan kolaborasi yang lebih besar, yang akan mengarah pada penciptaan LMM yang lebih kuat dan serbaguna yang dapat menangani masalah dunia nyata yang kompleks.
Membangun pada catatan itu, MINT-1T, dataset multimodal yang diinterleaved dan open-source terbesar dan paling beragam hingga saat ini. MINT-1T: Skala 10x lebih besar, termasuk satu triliun token teks dan 3,4 miliar gambar dibandingkan dengan dataset open-source yang ada sebelumnya. Dataset MINT-1T juga memperkenalkan sumber yang belum pernah terungkap sebelumnya, seperti file PDF dan makalah ArXiv. Karena dataset multimodal yang diinterleaved tidak mudah diskalakan, penting bahwa dataset MINT-1T membagikan proses pengkurasi data sehingga orang lain juga dapat melakukan eksperimen pada varian yang kaya informasi seperti ini. Dataset MINT-1T menunjukkan bahwa metodenya; model LM yang dilatih pada MINT-1T kompetitif (meskipun sedikit) dengan OBELICS sebelumnya.
MINT-1T: Dataset Multimodal dengan Satu Triliun Token
Dataset pra-pelatihan open-source yang besar telah menjadi penting bagi komunitas penelitian dalam menjelajahi rekayasa data dan melatih model open-source yang transparan. Di domain teks, karya awal seperti C4 dan The Pile memainkan peran penting dalam memungkinkan komunitas untuk melatih model bahasa besar open-source pertama seperti GPT-J, GPT-Neo, dan lain-lain. Upaya ini juga membuka jalan bagi perbaikan metode penyaringan data dan penskalaan. Serupa dengan itu, di ruang gambar-teks, dataset open-source besar telah mendorong inovasi dalam metode pengkurasi data yang lebih baik, seperti jaringan penyaringan data dan T-MARS. Terdapat pergeseran yang jelas dari laboratorium terdepan menuju pelatihan model multimodal besar (LMM) yang memerlukan dataset multimodal yang diinterleaved dan besar yang terdiri dari urutan gambar dan teks bebas. Ketika kemampuan model terdepan berkembang pesat, celah besar muncul dalam data pelatihan multimodal antara model tertutup dan open-source. Dataset multimodal yang diinterleaved dan open-source saat ini lebih kecil dan kurang beragam dibandingkan dengan lawan teks-saja, yang bersumber utama dari dokumen HTML, yang membatasi keluasan dan keragaman data. Keterbatasan ini menghambat pengembangan LMM open-source yang kuat dan menciptakan disparitas antara kemampuan model tertutup dan open-source.
Untuk mengatasi celah ini, MINT-1T diciptakan sebagai dataset multimodal yang diinterleaved dan open-source terbesar dan paling beragam hingga saat ini. MINT-1T berisi total satu triliun token teks dan tiga miliar gambar, yang bersumber dari sumber yang beragam seperti HTML, PDF, dan ArXiv. Sebelum MINT-1T, dataset open-source terbesar di bidang ini adalah OBELICS, yang mencakup 115 miliar token teks dan 353 juta gambar, semua bersumber dari HTML.

Kontribusi MINT-1T adalah sebagai berikut:
- Rekayasa Data: Mengskalakan data multimodal yang diinterleaved ini mempresentasikan lebih banyak tantangan rekayasa daripada membangun dataset teks-saja atau pasangan gambar-teks. Menghandle ukuran dokumen yang lebih besar dan mempertahankan urutan asli gambar dan teks sangat penting.
- Keragaman: MINT-1T adalah yang pertama di ruang multimodal yang diinterleaved untuk mengumpulkan dokumen multimodal berkualitas tinggi dalam skala besar dari sumber seperti CommonCrawl PDF dan ArXiv.
- Eksperimen Model: Eksperimen menunjukkan bahwa LMM yang dilatih pada MINT-1T tidak hanya sesuai dengan kinerja model yang dilatih pada dataset open-source terbaik yang ada sebelumnya, OBELICS, tetapi juga menawarkan peningkatan skala sepuluh kali lipat.
MINT-1T: Membangun Dataset
MINT-1T mengkurasi dataset open-source besar yang menggunakan sumber yang lebih beragam dari dokumen yang diinterleaved, seperti PDF dan makalah ArXiv. Bagian ini menjelaskan metode MINT-1T untuk mengumpulkan dokumen multimodal, menyaring konten berkualitas rendah, deduplikasi data, dan menghapus konten yang tidak aman atau tidak diinginkan. Dataset akhir terdiri dari 922 miliar token HTML, 106 miliar token PDF, dan 9 miliar token ArXiv.
Mengumpulkan Jumlah Besar Dokumen Multimodal
Pipeline HTML
MINT-1T mengikuti metode OBELICS untuk mengekstrak dokumen multimodal yang diinterleaved dari file WARC CommonCrawl dengan memparse pohon DOM setiap entri WARC. Sementara OBELICS hanya memproses dokumen dari dump CommonCrawl Februari 2020 hingga Februari 2023, MINT-1T telah memperluas kolam dokumen untuk mencakup dokumen HTML dari Mei 2017 hingga April 2024 (dengan dump lengkap dari Oktober 2018 hingga April 2024 dan dump parsial dari tahun-tahun sebelumnya). Serupa dengan OBELICS, MINT-1T menyaring dokumen yang mengandung tidak ada gambar, lebih dari tiga puluh gambar, atau gambar dengan URL yang mengandung substring yang tidak pantas seperti logo, avatar, porn, dan xxx.
Pipeline PDF
MINT-1T mengumpulkan dokumen PDF dari file WAT CommonCrawl dari dump Februari 2023 hingga April 2024. Awalnya, semua tautan PDF diekstrak dari dump tersebut. MINT-1T kemudian mencoba mengunduh dan membaca PDF menggunakan PyMuPDF, membuang PDF yang lebih besar dari 50MB (yang mungkin mengandung gambar besar) dan yang lebih panjang dari 50 halaman. Halaman tanpa teks dikecualikan, dan urutan pembacaan ditetapkan untuk halaman yang tersisa. Urutan pembacaan ditentukan dengan menemukan kotak pembatas semua blok teks pada sebuah halaman, mengelompokkan blok berdasarkan kolom, dan mengurutkannya dari kiri atas ke kanan bawah. Gambar diintegrasikan ke dalam urutan berdasarkan kedekatannya dengan blok teks pada halaman yang sama.

Pipeline ArXiv
MINT-1T membangun dokumen yang diinterleaved dari ArXiv menggunakan TexSoup untuk menemukan tag gambar dan menginterleaved gambar dengan teks makalah. Untuk makalah multi-berkas, MINT-1T mengidentifikasi berkas utama Tex dan menggantikan tag input dengan isi berkasnya. Kode LaTeX dibersihkan dengan menghapus impor, bibliografi, tabel, dan tag kutipan. Karena ArXiv sudah merupakan sumber data yang sangat terkurasi, tidak ada penyaringan dan deduplikasi tambahan yang dilakukan.
Penyaringan Kualitas Teks
MINT-1T menghindari menggunakan heuristik model untuk penyaringan teks, mengikuti praktik yang ditetapkan oleh RefinedWeb, Dolma, dan FineWeb. Awalnya, dokumen non-Inggris dihilangkan menggunakan model identifikasi bahasa Fasttext (dengan ambang kepercayaan 0,65). Dokumen dengan URL yang mengandung substring yang tidak pantas dihapus untuk menghilangkan konten pornografi dan tidak diinginkan. Metode penyaringan teks dari RefinedWeb diterapkan, khususnya menghapus dokumen dengan n-gram duplikat berlebihan atau yang diidentifikasi sebagai berkualitas rendah menggunakan aturan MassiveText.
Penyaringan Gambar
Setelah mengkurasi PDF dan file HTML, MINT-1T mencoba mengunduh semua tautan gambar di dataset HTML, membuang tautan yang tidak dapat diunduh dan menghapus dokumen dengan tidak ada tautan gambar yang valid. Gambar dengan ukuran kurang dari 150 piksel dihapus untuk menghindari gambar berisik seperti logo dan ikon, dan gambar dengan ukuran lebih dari 20.000 piksel juga dihapus karena biasanya sesuai dengan gambar yang tidak terkait. Untuk dokumen HTML, gambar dengan rasio aspek lebih dari dua dihapus untuk menyaring gambar berkualitas rendah seperti spanduk iklan. Untuk PDF, ambang batas disesuaikan menjadi tiga untuk melestarikan gambar ilmiah dan tabel.

Gambar di atas mewakili bagaimana MINT-1T secara unik mencakup data dari PDF dan dokumen ArXiv di luar sumber HTML.
Penyaringan Keamanan
- Penyaringan Gambar NSFW: MINT-1T menerapkan detektor gambar NSFW pada semua gambar di dataset. Jika sebuah dokumen mengandung satu gambar NSFW, seluruh dokumen dihapus.
- Penghapusan Informasi Pribadi: Untuk memitigasi risiko kebocoran data pribadi, alamat email dan alamat IP di teks dihapus dan digantikan dengan template seperti “email@example.com” dan alamat IP yang dihasilkan secara acak yang tidak berfungsi.
Deduplikasi
MINT-1T melakukan deduplikasi paragraf dan dokumen teks dalam setiap snapshot CommonCrawl dan deduplikasi gambar untuk menghapus gambar yang berulang dan tidak informatif seperti ikon dan logo. Semua langkah deduplikasi dilakukan secara terpisah untuk setiap sumber data.
Deduplikasi Paragraf dan Dokumen
Mengikuti metodologi Dolma, MINT-1T menggunakan Filter Bloom untuk deduplikasi teks yang efisien, menetapkan tingkat positif palsu menjadi 0,01 dan deduplikasi paragraf 13-gram (ditunjukkan melalui delimiter baris ganda) dari setiap dokumen. Jika lebih dari 80% paragraf dokumen adalah duplikat, seluruh dokumen dihapus.
Menghapus Teks Boilerplate Umum
Setelah deduplikasi paragraf, MINT-1T menghapus kalimat pendek boilerplate umum di dokumen HTML, seperti “Skip to content” atau “Blog Archive.” Ini dilakukan dengan menjalankan deduplikasi paragraf yang tepat pada 2% dari setiap snapshot CommonCrawl, sejalan dengan praktik CCNet, memastikan penghapusan sebagian besar teks boilerplate umum.

Gambar di atas menunjukkan proses penyaringan untuk MINT-1T, dan menunjukkan bagaimana token dihapus sepanjang pipa data untuk HTML, PDF, dan makalah ArXiv.
Deduplikasi Gambar
Dalam setiap snapshot CommonCrawl, MINT-1T menghapus gambar yang sering muncul berdasarkan hash SHA256. Daripada deduplikasi ketat, hanya gambar yang muncul lebih dari sepuluh kali dalam sebuah snapshot yang dihapus, mengikuti praktik Multimodal-C4. Konsisten dengan OBELICS, gambar yang berulang dalam sebuah dokumen dihapus, hanya menyisakan kemunculan pertama.
Infrastruktur
Selama pemrosesan data, MINT-1T memiliki akses rata-rata ke 2.350 inti CPU dari campuran node 190-prosesor dan 90-prosesor. Secara total, sekitar 4,2 juta jam CPU digunakan untuk membangun dataset ini.
Membandingkan Komposisi Dokumen di MINT-1T dengan OBELICS
Dalam mengevaluasi komposisi dataset yang diinterleaved, dua karakteristik kunci diperiksa: distribusi token teks per dokumen dan jumlah gambar per dokumen. Untuk analisis ini, 50.000 dokumen diambil secara acak dari OBELICS dan setiap sumber data di MINT-1T. Tokenizer GPT-2 digunakan untuk menghitung jumlah token teks. Outlier dihilangkan dengan mengeluarkan dokumen yang jatuh di luar 1,5 jangkauan kuartil untuk jumlah token teks dan gambar. Seperti yang ditunjukkan pada gambar berikut, subset HTML dari MINT-1T sejalan erat dengan distribusi token yang terlihat di OBELICS. Namun, dokumen yang bersumber dari PDF dan ArXiv cenderung lebih panjang daripada dokumen HTML rata-rata, menunjukkan manfaat dari mengumpulkan data dari sumber yang beragam. Gambar 5 memeriksa kepadatan gambar di seluruh dokumen, mengungkapkan bahwa PDF dan dokumen ArXiv mengandung lebih banyak gambar dibandingkan dengan dokumen HTML, dengan sampel ArXiv menjadi yang paling padat gambar.

Bagaimana Sumber Data yang Berbeda Meningkatkan Keragaman Dokumen?
Motivasi penting untuk memperluas kolam dokumen multimodal di luar HTML adalah perbaikan cakupan domain. Untuk mengukur keragaman dan kedalaman cakupan ini, model Latent Dirichlet Allocation (LDA) dilatih pada 100.000 dokumen yang diambil secara acak dari dataset OBELICS, subset HTML dari MINT-1T, dan subset PDF (tidak termasuk ArXiv) dari MINT-1T untuk mendapatkan 200 topik. GPT-4 kemudian digunakan untuk mengklasifikasikan set kata untuk mengidentifikasi domain dominan – seperti Kesehatan & Kedokteran, Sains, Bisnis, Humaniora, Sejarah, dll. – berdasarkan domain MMMU. Analisis ini mengungkapkan tren yang berbeda dalam distribusi domain:
- OBELICS: Dataset ini menunjukkan konsentrasi yang kuat dalam “Humaniora dan Ilmu Sosial”. Ini mungkin disebabkan oleh proses konstruksi datanya, yang melibatkan penyaringan dokumen yang tidak menyerupai artikel Wikipedia, sehingga mungkin mengubah distribusi ke konten pengetahuan umum dan humaniora yang lebih fokus.
- Subset HTML MINT-1T: Berbeda dengan OBELICS, subset HTML dari MINT-1T tidak memiliki bias kuat terhadap domain tertentu, menunjukkan representasi domain yang lebih luas dan seimbang.
- Subset PDF MINT-1T: Terdapat proporsi yang lebih tinggi dari dokumen “Sains dan Teknologi” dalam dokumen PDF dari MINT-1T. Tren ini mungkin disebabkan oleh sifat komunikasi ilmiah, di mana PDF adalah format yang disukai untuk berbagi makalah penelitian dan laporan teknis yang rinci.
MINT-1T: Hasil dan Eksperimen
Untuk semua eksperimen, MINT-1T melatih model pada 50% batch penjelasan gambar-teks dan 50% batch dokumen yang diinterleaved. Maksimum 2048 token multimodal disampel dari setiap dokumen yang diinterleaved dan 340 token dari setiap sampel gambar-teks. Serupa dengan Flamingo, token “akhir” ditambahkan untuk menunjukkan akhir dari urutan gambar-teks yang berdekatan. Selama pelatihan, 50% dokumen gambar-tunggal yang diinterleaved dihapus secara acak untuk mensupersampel dokumen multi-gambar. Dataset gambar-teks terdiri dari campuran dataset penjelasan yang dikurasi secara internal. Kemampuan model untuk berpikir tentang urutan multimodal yang diinterleaved dievaluasi melalui kemampuan pembelajaran kontekstual dan kinerja penalaran multi-gambar.

Gambar di atas menggambarkan persentase dokumen dari setiap domain dalam MMMU untuk OBELICS dan subset MINT-1T.
Pembelajaran Kontekstual: Model dievaluasi pada kinerja pembelajaran kontekstual empat-shot dan delapan-shot pada berbagai benchmark penjelasan (COCO dan TextCaps) dan dataset pertanyaan visual (VQAv2, OK-VQA, TextVQA, dan VizWiz). Demonstrasi diambil secara acak dari set pelatihan. Skor dirata-ratakan lebih dari beberapa kali evaluasi, dengan demonstrasi yang diacak untuk mempertimbangkan sensitivitas terhadap prompt yang dipilih. Prompt yang berbeda diablas untuk setiap tugas untuk memilih yang berkinerja terbaik.
Penalaran Multi-Gambar: Model dievaluasi pada MMMU (yang berisi pertanyaan single dan multi-gambar) dan Mantis-Eval (semua pertanyaan multi-gambar) untuk menyelidiki kemampuan penalaran multi-gambar di luar evaluasi pembelajaran kontekstual.
Pelatihan pada Dokumen HTML
Awalnya, bagian HTML dari MINT-1T dibandingkan dengan OBELICS, karena OBELICS adalah dataset yang diinterleaved terkemuka sebelumnya, yang juga dikurasi dari dokumen HTML. Dua model dilatih pada bagian HTML dari MINT-1T dan OBELICS untuk total 10 miliar token multimodal. Kinerja pembelajaran kontekstual mereka dievaluasi. Tabel berikut menyajikan kinerja empat-shot dan delapan-shot pada benchmark umum; model yang dilatih pada dokumen HTML MINT-1T performs lebih baik daripada OBELICS pada tugas VQA tetapi lebih buruk pada benchmark penjelasan. Rata-rata, OBELICS performs sedikit lebih baik daripada MINT-1T (HTML).

Menambahkan Dokumen PDF dan ArXiv
Selanjutnya, pelatihan dilakukan pada sumber data penuh MINT-1T, dengan campuran dokumen HTML, PDF, dan ArXiv. Dokumen yang diinterleaved disampel dengan 50% dari HTML, 45% dari PDF, dan 5% dari ArXiv. Model dilatih untuk total 10 miliar token multimodal. Seperti yang terlihat pada tabel di atas, model yang dilatih pada campuran data penuh MINT-1T outperforms OBELICS dan MINT-1T (HTML) pada sebagian besar benchmark pembelajaran kontekstual. Pada benchmark penalaran multimodal yang lebih kompleks, model MINT-1T outperforms OBELICS pada MMMU tetapi performs lebih buruk pada Mantis-Eval.
Tren Halus
Bagaimana Kinerja Pembelajaran Kontekstual Berkembang dengan Demonstrasi?
Kinerja pembelajaran kontekstual dievaluasi ketika diprompt dengan satu hingga delapan demonstrasi. Satu percobaan per shot dijalankan untuk setiap benchmark evaluasi. Seperti yang terlihat pada gambar berikut, model yang dilatih pada MINT-1T outperforms model yang dilatih pada subset HTML MINT-1T dan OBELICS di semua shot. Model MINT-1T (HTML) performs sedikit lebih buruk daripada OBELICS.

Kinerja pada Tugas Penjelasan dan Pertanyaan Visual
Gambar berikut menyajikan kinerja pembelajaran kontekstual rata-rata pada benchmark penjelasan dan pertanyaan visual (VQA). OBELICS outperforms semua varian MINT-1T pada benchmark penjelasan empat-shot dan performs sedikit lebih buruk daripada MINT-1T pada benchmark penjelasan delapan-shot. Namun, MINT-1T secara signifikan outperforms kedua baseline pada benchmark VQA. MINT-1T (HTML) juga outperforms OBELICS pada tugas VQA.
Kinerja pada Domain yang Berbeda
Inklusi domain yang beragam dalam MINT-1T bertujuan untuk meningkatkan generalisasi model. Gambar sebelumnya memecah kinerja pada MMMU untuk setiap domain. Kecuali untuk domain Bisnis, MINT-1T outperforms OBELICS dan MINT-1T (HTML). Peningkatan kinerja pada domain Sains dan Teknologi untuk MINT-1T dapat dikaitkan dengan prevalensi domain ini dalam dokumen ArXiv dan PDF.
Pemikiran Akhir
Dalam artikel ini, kita telah membahas MINT-1T, dataset multimodal yang diinterleaved dan open-source terbesar dan paling beragam hingga saat ini. MINT-1T: Skala 10x lebih besar, termasuk satu triliun token teks dan 3,4 miliar gambar dibandingkan dengan dataset open-source yang ada sebelumnya. Dataset MINT-1T juga memperkenalkan sumber yang belum pernah terungkap sebelumnya, seperti file PDF dan makalah ArXiv. Karena dataset multimodal yang diinterleaved tidak mudah diskalakan, penting bahwa dataset MINT-1T membagikan proses pengkurasi data sehingga orang lain juga dapat melakukan eksperimen pada varian yang kaya informasi seperti ini. Dataset MINT-1T menunjukkan bahwa metodenya; model LM yang dilatih pada MINT-1T kompetitif (meskipun sedikit) dengan OBELICS sebelumnya.












