Yapay zeka modelleri ve platformları
MINT-1T: Açık Kaynaklı Çoğul Modal Veri Setini 10 Kat Artırma
Büyük ölçekli açık kaynaklı multimodal modelleri (LMM’ler) eğitmek için büyük ölçekli veri setlerine ihtiyaç duyulur. Açık kaynaklı LMM’ler hızlı bir şekilde gelişmesine rağmen, açık kaynaklı ve büyük ölçekli multimodal veri setleri hala eksik. Bu veri setlerinin önemi abartılmaz, çünkü farklı modellerin anlaşılması ve içeriğin oluşturulması için temel oluşturur. Bu veri setlerinin eksikliği, daha gelişmiş ve yetenekli LMM’lerin geliştirilmesini engeller. Bu veri setleri, modellerin çeşitli girdilerden öğrenmesini sağlar ve böylece daha esnek ve etkili hale getirir. Ayrıca, bu veri setlerinin eksikliği, açık kaynaklı topluluğu için bir zorluk oluşturur, çünkü bu topluluk, inovasyonu ve işbirliğini teşvik etmek için paylaşılan kaynaklara dayanır.
Açık kaynaklı LMM’ler son yıllarda önemli ilerleme kaydetmiştir, ancak büyümeleri, büyük ölçekli ve multimodal veri setlerinin sınırlı kullanılabilirliği nedeniyle engellenmektedir. Bu engeli aşmak için, daha kapsamlı veri setlerini toplamak,注释 etmek ve yayınlamak için ortak çaba sarf edilmelidir. Ayrıca, bu veri setlerinin oluşturulması ve yayımlanması, teknik ve lojistik engelleri aşmayı gerektirir. Veri toplama, çeşitli bağlamlarda LMM’lerin kullanılacağı şekilde geniş ve temsil edici olmalıdır. Annotation, modellerin öğrenme yeteneklerini artırmak için dikkatli bir şekilde yapılmalıdır. Ayrıca, veri setlerinin açık kaynaklı olması, veri gizliliği ve kullanım hakları ile ilgili yasal ve etik hususların ele alınmasını gerektirir. Büyük ölçekli ve multimodal veri setlerinin kullanılabilirliğini artırmak, AI araştırması ve geliştirmesi için önemlidir. Mevcut eksikliği gidererek, AI topluluğu daha fazla inovasyon ve işbirliği teşvik edebilir ve daha güçlü ve esnek LMM’lerin oluşturulmasına katkıda bulunabilir.
Bu notta, MINT-1T, bugüne kadar mevcut olan en büyük ve en çeşitli açık kaynaklı multimodal veri setidir. MINT-1T, 1 trilyon metin tokeni ve 3,4 milyar görseli içerir ve mevcut açık kaynaklı veri setlerinden 10 kat daha büyüktür. MINT-1T, PDF dosyaları ve ArXiv makaleleri gibi daha önce kullanılmayan kaynakları da sunar. Multimodal veri setleri kolayca ölçeklenmez, bu nedenle MINT-1T veri seti, veri toplama sürecini paylaşarak, başkalarının da bu tür bilgi zenginleştirilmiş varyantlar üzerinde deneyler yapabilmesini sağlar. MINT-1T veri seti, MINT-1T üzerinde eğitilen LM modellerinin, önceki en iyi açık kaynaklı OBELICS veri setine göre rekabetçi olduğunu göstermektedir.
MINT-1T: 1 Trilyon Tokenlı Bir Multimodal Veri Seti
Büyük açık kaynaklı ön eğitime veri setleri, veri mühendisliği ve şeffaf, açık kaynaklı modellerin eğitilmesi için araştırma topluluğu tarafından önemli bir rol oynamıştır. Metin alanında, C4 ve The Pile gibi erken çalışmalar, ilk açık kaynaklı büyük dil modellerinin eğitilmesi için önemli bir temel oluşturmuştur. Bu temel çalışmalar, daha sonra veri filtreleme yöntemleri ve ölçeklendirme için yol açmıştır. Benzer şekilde, görsel-metin alanında, büyük ölçekli açık kaynaklı veri setleri, daha iyi veri toplama yöntemleri için inovasyonlara yol açmıştır. Büyük ölçekli açık kaynaklı multimodal veri setleri, LMM’lerin geliştirilmesini teşvik etmektedir. LMM’ler, farklı modellerin anlaşılması ve içeriğin oluşturulması için temel oluşturur. Ancak, mevcut açık kaynaklı multimodal veri setleri, metin tabanlı veri setlerine göre daha küçüktür ve daha az çeşitlidir. Bu sınırlama, açık kaynaklı LMM’lerin geliştirilmesini engeller ve açık kaynaklı modellerle kapalı kaynaklı modeller arasında bir uçurum oluşturur.
MINT-1T, bugüne kadar mevcut olan en büyük ve en çeşitli açık kaynaklı multimodal veri setidir. MINT-1T, 1 trilyon metin tokeni ve 3,4 milyar görseli içerir ve mevcut açık kaynaklı veri setlerinden 10 kat daha büyüktür. MINT-1T, PDF dosyaları ve ArXiv makaleleri gibi daha önce kullanılmayan kaynakları da sunar. MINT-1T veri seti, MINT-1T üzerinde eğitilen LM modellerinin, önceki en iyi açık kaynaklı OBELICS veri setine göre rekabetçi olduğunu göstermektedir.

Aşağıdaki şekil, MINT-1T’nin PDF dosyaları ve ArXiv makaleleri gibi kaynaklardan gelen verileri nasıl içerdiğini gösterir.
- Veri Mühendisliği: Bu multimodal veri setini ölçeklendirme, daha büyük belge boyutlarını ve orijinal sırayı koruma açısından bir mühendislik zorluğu oluşturur.
- Çeşitlilik: MINT-1T, multimodal belgeleri büyük ölçekli olarak toplamak için ilk veri setidir. MINT-1T, PDF dosyaları ve ArXiv makaleleri gibi kaynaklardan gelen verileri içerir.
- Model Deneyleri: Deneyler, MINT-1T üzerinde eğitilen LMM’lerin, önceki en iyi açık kaynaklı OBELICS veri setine göre rekabetçi olduğunu göstermektedir.
MINT-1T: Veri Setinin Oluşturulması
MINT-1T, büyük ölçekli açık kaynaklı bir veri seti oluşturur ve daha çeşitli kaynaklardan gelen multimodal belgeleri içerir. Bu bölüm, MINT-1T’nin multimodal belgeleri toplama, düşük kaliteli içerikleri filtreleme, veri tekrarını önleme ve güvenli olmayan içeriği kaldırma yöntemlerini açıklar. Son veri seti, 922 milyar HTML tokeni, 106 milyar PDF tokeni ve 9 milyar ArXiv tokenini içerir.
Büyük Ölçekli Multimodal Belgelerin Toplanması
HTML İşlem Hattı
MINT-1T, OBELICS’in HTML belgelerinden multimodal belgeleri çıkarma yöntemini takip eder. MINT-1T, HTML belgelerini Mayıs 2017’den Nisan 2024’e kadar CommonCrawl WARC dosyalarından toplar. MINT-1T, belgeleri filtreler ve görsel olmayan veya fazla görseli olan belgeleri kaldırır.
PDF İşlem Hattı
MINT-1T, PDF dosyalarını CommonCrawl WAT dosyalarından toplar. MINT-1T, PDF dosyalarını indirir ve okur, 50 MB’dan büyük veya 50 sayfadan uzun olanları kaldırır. MINT-1T, sayfaların okuma sırasını belirler ve görselleri metin bloklarına yakınlığına göre sıralar.

ArXiv İşlem Hattı
MINT-1T, ArXiv makalelerini LaTeX kaynak kodundan çıkarır. MINT-1T, figure etiketlerini bulur ve görselleri metin ile sıralar. MINT-1T, LaTeX kodunu temizler ve import, bibliyografi, tablo ve alıntı etiketlerini kaldırır.
Metin Kalitesi Filtreleme
MINT-1T, model tabanlı heuristikleri kullanmaz ve RefinedWeb, Dolma ve FineWeb’in yöntemlerini takip eder. MINT-1T, İngilizce olmayan belgeleri kaldırır ve NSFW içerikleri filtreler.
Görsel Filtreleme
MINT-1T, görselleri indirir ve küçük veya büyük görselleri kaldırır. MINT-1T, görsellerin Aspect Ratio’sunu kontrol eder ve düşük kaliteli görselleri filtreler.

Aşağıdaki şekil, MINT-1T’nin PDF dosyaları ve ArXiv makaleleri gibi kaynaklardan gelen verileri nasıl içerdiğini gösterir.
Güvenlik Filtreleme
- NSFW Görsel Filtreleme: MINT-1T, görselleri NSFW içerik için filtreler ve tek bir NSFW görseli içeren belgeleri kaldırır.
- Kişisel Bilgilerin Kaldırılması: MINT-1T, kişisel verileri korumak için e-posta adreslerini ve IP adreslerini anonimleştirir.
Veri Tekrarını Önleme
MINT-1T, paragraf ve belge tekrarını önler ve tekrarlanan görselleri kaldırır. MINT-1T, her veri kaynağından ayrı olarak tekrarlanan verileri kaldırır.
Paragraf ve Belge Tekrarını Önleme
MINT-1T, Dolma’nın yöntemini takip eder ve bir Bloom Filtresi kullanır. MINT-1T, 13-gram paragrafları deduplize eder ve %80’den fazla tekrarlanan paragrafları içeren belgeleri kaldırır.
Ortak Metin Bloklarını Kaldırma
MINT-1T, ortak metin bloklarını kaldırır ve kısa ortak cümleleri HTML belgelerinden kaldırır. MINT-1T, CCNet’in yöntemini takip eder ve ortak metin bloklarını %2’lik bir oranla kaldırır.

Aşağıdaki şekil, MINT-1T’nin veri filtreleme sürecini gösterir.
Görsel Tekrarını Önleme
MINT-1T, görsel tekrarını önler ve sık görünen görselleri kaldırır. MINT-1T, her veri kaynağından ayrı olarak tekrarlanan görselleri kaldırır.
Altyapı
MINT-1T, ortalama 2.350 CPU çekirdeğine sahip bir altyapı kullanmıştır. Toplamda, yaklaşık 4,2 milyon CPU saati kullanılmıştır.
MINT-1T ve OBELICS’in Belge Kompozisyonunun Karşılaştırılması
MINT-1T ve OBELICS’in belge kompozisyonu karşılaştırıldığında, iki önemli özellik dikkat çeker: metin tokenlerinin dağılımı ve belge başına görsel sayısı. 50.000 belge rastgele olarak seçilmiştir ve GPT-2’nin tokenleştiricisi kullanılmıştır. Aşağıdaki şekil, MINT-1T’nin HTML alt kümesinin OBELICS ile benzer bir token dağılımına sahip olduğunu gösterir.

Farklı Veri Kaynaklarının Belge Çeşitliliğini Artırması
MINT-1T, OBELICS ve MINT-1T’nin HTML ve PDF alt kümelerinin belge çeşitliliğini karşılaştırır. MINT-1T, PDF dosyaları ve ArXiv makaleleri gibi kaynaklardan gelen verileri içerir. Bu veri kaynakları, bilim ve teknoloji gibi alanlarda daha fazla belge içerir.
- OBELICS: OBELICS, daha çok beşeri bilimler ve sosyal bilimler alanlarına odaklanmıştır.
- MINT-1T’nin HTML Alt Kümesi: MINT-1T’nin HTML alt kümesi, OBELICS’e göre daha dengeli bir alan dağılımına sahiptir.
- MINT-1T’nin PDF Alt Kümesi: MINT-1T’nin PDF alt kümesi, bilim ve teknoloji gibi alanlarda daha fazla belge içerir.
MINT-1T: Sonuçlar ve Deneyler
MINT-1T, 50% görsel-metin etiketleme ve 50% multimodal sıralama için eğitilmiştir. MINT-1T, OBELICS’e göre daha iyi bir performans gösterir. Aşağıdaki şekil, MINT-1T’nin performansını gösterir.

Aşağıdaki şekil, MINT-1T’nin performansını gösterir.
Bağlamda Öğrenme: MINT-1T, OBELICS’e göre daha iyi bir performans gösterir. Aşağıdaki şekil, MINT-1T’nin performansını gösterir.
Çoklu Görsel Anlama: MINT-1T, OBELICS’e göre daha iyi bir performans gösterir. Aşağıdaki şekil, MINT-1T’nin performansını gösterir.
HTML Belgeleri Üzerinde Eğitim
MINT-1T, OBELICS’e göre daha iyi bir performans gösterir. Aşağıdaki şekil, MINT-1T’nin performansını gösterir.
PDF ve ArXiv Belgeleri Eklenmesi
MINT-1T, OBELICS’e göre daha iyi bir performans gösterir. Aşağıdaki şekil, MINT-1T’nin performansını gösterir.
İnce Ayrıntılı Eğilimler
Bağlamda Öğrenme Performansının Gösterimi
MINT-1T, OBELICS’e göre daha iyi bir performans gösterir. Aşağıdaki şekil, MINT-1T’nin performansını gösterir.
Etiketleme ve Görsel Soru Cevaplandırma Görevlerinde Performans
MINT-1T, OBELICS’e göre daha iyi bir performans gösterir. Aşağıdaki şekil, MINT-1T’nin performansını gösterir.
Farklı Alanlarda Performans
MINT-1T, OBELICS’e göre daha iyi bir performans gösterir. Aşağıdaki şekil, MINT-1T’nin performansını gösterir.
Son Düşünceler
Bu makalede, MINT-1T hakkında konuşuldu. MINT-1T, bugüne kadar mevcut olan en büyük ve en çeşitli açık kaynaklı multimodal veri setidir. MINT-1T, 1 trilyon metin tokeni ve 3,4 milyar görseli içerir ve mevcut açık kaynaklı veri setlerinden 10 kat daha büyüktür. MINT-1T, PDF dosyaları ve ArXiv makaleleri gibi daha önce kullanılmayan kaynakları da sunar. Multimodal veri setleri kolayca ölçeklenmez, bu nedenle MINT-1T veri seti, veri toplama sürecini paylaşarak, başkalarının da bu tür bilgi zenginleştirilmiş varyantlar üzerinde deneyler yapabilmesini sağlar. MINT-1T veri seti, MINT-1T üzerinde eğitilen LM modellerinin, önceki en iyi açık kaynaklı OBELICS veri setine göre rekabetçi olduğunu göstermektedir.












