एआई मॉडल और प्लेटफ़ॉर्म
मिंट-1टी: ओपन-सोर्स मल्टीमॉडल डेटा को 10 गुना तक बढ़ाना
बड़े पैमाने पर खुले स्रोत वाले मल्टीमॉडल मॉडल (एलएमएम) को प्रशिक्षित करने के लिए बड़े पैमाने पर डेटासेट की आवश्यकता होती है जिसमें छवियों और पाठ के बीच इंटरलीव्ड अनुक्रम होते हैं। हालांकि खुले स्रोत वाले एलएमएम तेजी से विकसित हुए हैं, फिर भी मल्टीमॉडल इंटरलीव्ड डेटासेट की कमी है जो खुले स्रोत वाले हैं। इन डेटासेट के महत्व को कम नहीं आंका जा सकता है, क्योंकि वे उन उन्नत एआई प्रणालियों के निर्माण के लिए आधार बनाते हैं जो विभिन्न मोडलिटी में सामग्री को समझने और उत्पन्न करने में सक्षम हैं।
खुले स्रोत वाले एलएमएम ने हाल के वर्षों में महत्वपूर्ण प्रगति की है, लेकिन उनकी वृद्धि सीमित मल्टीमॉडल इंटरलीव्ड डेटासेट की उपलब्धता से बाधित है। इस बाधा को दूर करने के लिए, अधिक व्यापक डेटासेट तैयार करने और जारी करने के लिए सामूहिक प्रयासों की आवश्यकता है जो मल्टीमॉडल मॉडलों के निरंतर विकास और परिष्करण का समर्थन कर सकें। इसके अलावा, इन डेटासेट के निर्माण और वितरण में कई तकनीकी और लॉजिस्टिक चुनौतियों का सामना करना पड़ता है।
मिंट-1टी सबसे बड़ा और सबसे विविध मल्टीमॉडल इंटरलीव्ड ओपन-सोर्स डेटासेट है, जिसमें एक ट्रिलियन पाठ टोकन और 3.4 अरब छवियां शामिल हैं। मिंट-1टी में पीडीएफ फाइलें और आरएक्सआईवी पेपर जैसे नए स्रोत शामिल हैं। चूंकि मल्टीमॉडल इंटरलीव्ड डेटासेट आसानी से स्केल नहीं होते हैं, इसलिए यह महत्वपूर्ण है कि मिंट-1टी डेटा क्यूरेशन प्रक्रिया को साझा करे ताकि अन्य लोग भी ऐसे जानकारी से भरपूर वेरिएंट पर प्रयोग कर सकें।
मिंट-1टी: एक ट्रिलियन टोकन वाला मल्टीमॉडल डेटासेट
बड़े पैमाने पर खुले स्रोत प्री-प्रशिक्षण डेटासेट शोध समुदाय के लिए डेटा इंजीनियरिंग और पारदर्शी खुले स्रोत मॉडल को प्रशिक्षित करने में महत्वपूर्ण रहे हैं। पाठ डोमेन में, शुरुआती कार्यों जैसे सी4 और द पाइल ने पहले खुले स्रोत बड़े भाषा मॉडल जैसे जीपीटी-जे, जीपीटी-नियो और अन्य को प्रशिक्षित करने में समुदाय को सक्षम बनाने में महत्वपूर्ण भूमिका निभाई।
मिंट-1टी एक बड़े पैमाने पर खुले स्रोत डेटासेट को तैयार करता है जो विविध स्रोतों से इंटरलीव्ड दस्तावेजों का उपयोग करता है, जैसे कि पीडीएफ और आरएक्सआईवी पेपर। इस अनुभाग में मिंट-1टी के मल्टीमॉडल दस्तावेजों को स्रोत करने, कम गुणवत्ता वाली सामग्री को फिल्टर करने, डुप्लिकेट डेटा को हटाने और असुरक्षित सामग्री को हटाने के तरीकों का विवरण दिया गया है।
मिंट-1टी: डेटासेट का निर्माण
मल्टीमॉडल दस्तावेजों की बड़ी मात्रा में स्रोत
एचटीएमएल पाइपलाइन
मिंट-1टी ओबेलिक्स के तरीके का अनुसरण करता है और कॉमनक्रॉल वारसी फाइलों से इंटरलीव्ड मल्टीमॉडल दस्तावेजों को निकालने के लिए प्रत्येक वारसी प्रविष्टि के डीओएम पेड़ को पार्स करता है।
पीडीएफ पाइपलाइन
मिंट-1टी पीडीएफ दस्तावेजों को कॉमनक्रॉल वाट फाइलों से स्रोत करता है और पीडीएफ लिंक निकालता है।
आरएक्सआईवी पाइपलाइन
मिंट-1टी आरएक्सआईवी से इंटरलीव्ड दस्तावेजों को बनाता है और लेटेक्स स्रोत कोड का उपयोग करके फिगर टैग को ढूंढता है और छवियों को पाठ के साथ इंटरलीव करता है।
पाठ गुणवत्ता फिल्टरिंग
मिंट-1टी गैर-इंग्लिश दस्तावेजों को हटाने के लिए फास्टटेक्स्ट के भाषा पहचान मॉडल का उपयोग करता है और एनएसएफडब्ल्यू सब्स्ट्रिंग वाले यूआरएल वाले दस्तावेजों को हटाता है।
छवि फिल्टरिंग
मिंट-1टी छवियों को डाउनलोड करने का प्रयास करता है और छवियों को हटाता है जो 150 पिक्सल से कम हैं या 20,000 पिक्सल से अधिक हैं।
सुरक्षा फिल्टरिंग
- एनएसएफडब्ल्यू छवि फिल्टरिंग: मिंट-1टी सभी छवियों पर एनएसएफडब्ल्यू छवि डिटेक्टर लागू करता है और यदि एक दस्तावेज़ में एक ही एनएसएफडब्ल्यू छवि होती है, तो पूरे दस्तावेज़ को हटा देता है।
- व्यक्तिगत रूप से पहचान योग्य जानकारी को हटाना: मिंट-1टी पाठ डेटा से ईमेल पते और आईपी पते को हटाता है और उन्हें टेम्पलेट्स जैसे “ईमेल@example.com” और आईपी को यादृच्छिक रूप से उत्पन्न गैर-कार्यात्मक आईपी के साथ बदल देता है।
डुप्लिकेशन
मिंट-1टी प्रत्येक कॉमनक्रॉल स्नैपशॉट के भीतर पैराग्राफ और दस्तावेज़ पाठ डुप्लिकेशन को हटाता है और छवि डुप्लिकेशन को हटाता है।
पैराग्राफ और दस्तावेज़ डुप्लिकेशन
मिंट-1टी डोल्मा के तरीके का अनुसरण करता है और प्रत्येक दस्तावेज़ से 13-ग्राम पैराग्राफ को हटाने के लिए एक ब्लूम फिल्टर का उपयोग करता है।
सामान्य बॉयलरप्लेट पाठ को हटाना
मिंट-1टी पैराग्राफ डुप्लिकेशन के बाद, एचटीएमएल दस्तावेजों से सामान्य बॉयलरप्लेट वाक्यांशों को हटाता है, जैसे कि “सामग्री पर जाएं” या “ब्लॉग आर्काइव”।
बुनियादी ढांचा
मिंट-1टी के पास डेटा प्रोसेसिंग के दौरान 2,350 सीपीयू कोर का औसत उपयोग था, जो 190-प्रोसेसर और 90-प्रोसेसर नोड्स के मिश्रण से था। कुल मिलाकर, लगभग 4.2 मिलियन सीपीयू घंटे इस डेटासेट को बनाने में उपयोग किए गए थे।
मिंट-1टी और ओबेलिक्स में दस्तावेज़ संरचना की तुलना
दस्तावेज़ संरचना का मूल्यांकन करने के लिए, दो मुख्य विशेषताओं की जांच की जाती है: प्रति दस्तावेज़ पाठ टोकन का वितरण और प्रति दस्तावेज़ छवियों की संख्या। इस विश्लेषण के लिए, ओबेलिक्स और मिंट-1टी के प्रत्येक डेटा स्रोत से 50,000 दस्तावेज़ यादृच्छिक रूप से नमूने लिए गए थे।
मिंट-1टी: परिणाम और प्रयोग
सभी प्रयोगों के लिए, मिंट-1टी मॉडल को 50% छवि-पाठ कैप्शन बैच और 50% मल्टीमॉडल इंटरलीव्ड बैच पर प्रशिक्षित किया जाता है। प्रत्येक इंटरलीव्ड दस्तावेज़ से 2048 मल्टीमॉडल टोकन का नमूना लिया जाता है और प्रत्येक छवि-पाठ नमूने से 340 टोकन लिए जाते हैं।
एचटीएमएल दस्तावेजों पर प्रशिक्षण
मिंट-1टी के एचटीएमएल भाग की तुलना ओबेलिक्स से की जाती है, क्योंकि ओबेलिक्स भी एचटीएमएल दस्तावेजों से तैयार किया गया था। दो मॉडल को मिंट-1टी और ओबेलिक्स के एचटीएमएल भाग पर प्रशिक्षित किया जाता है और उनके इन-कॉन्टेक्स्ट लर्निंग प्रदर्शन का मूल्यांकन किया जाता है।
पीडीएफ और आरएक्सआईवी दस्तावेजों को जोड़ना
इसके बाद, मिंट-1टी के पूरे डेटा स्रोतों पर प्रशिक्षण किया जाता है, जिसमें एचटीएमएल, पीडीएफ और आरएक्सआईवी दस्तावेजों का मिश्रण होता है। इंटरलीव्ड दस्तावेजों को 50% एचटीएमएल, 45% पीडीएफ और 5% आरएक्सआईवी से नमूना लिया जाता है।
बारीक प्रवृत्तियां
इन-कॉन्टेक्स्ट लर्निंग प्रदर्शन कैसे प्रदर्शन करता है
इन-कॉन्टेक्स्ट लर्निंग प्रदर्शन का मूल्यांकन एक से आठ प्रदर्शनों के साथ किया जाता है। प्रत्येक शॉट गणना के लिए एक परीक्षण चलाया जाता है। जैसा कि निम्नलिखित आंकड़े में देखा गया है, मिंट-1टी पर प्रशिक्षित मॉडल ओबेलिक्स और मिंट-1टी (एचटीएमएल) पर प्रशिक्षित मॉडल को पार करता है।
कैप्शनिंग और विज़ुअल क्वेश्चन एंसवरिंग टास्क पर प्रदर्शन
निम्नलिखित आंकड़े में कैप्शनिंग और विज़ुअल क्वेश्चन एंसवरिंग बेंचमार्क पर औसत इन-कॉन्टेक्स्ट लर्निंग प्रदर्शन प्रस्तुत किया गया है। ओबेलिक्स चार-शॉट कैप्शनिंग बेंचमार्क पर सभी मिंट-1टी वेरिएंट को पार करता है और आठ-शॉट कैप्शनिंग पर थोड़ा खराब प्रदर्शन करता है। हालांकि, मिंट-1टी विज़ुअल क्वेश्चन एंसवरिंग बेंचमार्क पर ओबेलिक्स और मिंट-1टी (एचटीएमएल) दोनों को पार करता है।
विभिन्न डोमेन पर प्रदर्शन
मिंट-1टी में विभिन्न डोमेन को शामिल करने का उद्देश्य मॉडल के सामान्यीकरण में सुधार करना है। आंकड़े में एमएमएमयू पर प्रत्येक डोमेन के लिए प्रदर्शन का विभाजन किया गया है। व्यवसाय डोमेन के अलावा, मिंट-1टी ओबेलिक्स और मिंट-1टी (एचटीएमएल) दोनों को पार करता है।
अंतिम विचार
इस लेख में, हमने मिंट-1टी के बारे में बात की है, जो अब तक का सबसे बड़ा और सबसे विविध मल्टीमॉडल इंटरलीव्ड ओपन-सोर्स डेटासेट है। मिंट-1टी में एक ट्रिलियन पाठ टोकन और 3.4 अरब छवियां हैं, जो मौजूदा ओपन-सोर्स डेटासेट की तुलना में 10 गुना बड़ा है। मिंट-1टी में पीडीएफ फाइलें और आरएक्सआईवी पेपर जैसे नए स्रोत शामिल हैं। चूंकि मल्टीमॉडल इंटरलीव्ड डेटासेट आसानी से स्केल नहीं होते हैं, इसलिए यह महत्वपूर्ण है कि मिंट-1टी डेटा क्यूरेशन प्रक्रिया को साझा करे ताकि अन्य लोग भी ऐसे जानकारी से भरपूर वेरिएंट पर प्रयोग कर सकें। मिंट-1टी डेटासेट यह प्रदर्शित करता है कि इसकी विधि; एलएम मॉडल जो मिंट-1टी पर प्रशिक्षित होते हैं वे पिछले राज्य-ऑफ-द-आर्ट ओबेलिक्स के समान हैं।












