एआई मॉडल और प्लेटफ़ॉर्म
एमपीटी-30बी: मोज़ेकएमएल जीपीटी-3 से आगे निकलता है एक नए एलएलएम के साथ एनएलपी की सीमाओं को आगे बढ़ाने के लिए
मोज़ेकएमएल एक जनरेटिव एआई कंपनी है जो एआई डिप्लॉयमेंट और स्केलेबिलिटी समाधान प्रदान करती है। उनका नवीनतम बड़ा भाषा मॉडल (एलएलएम) एमपीटी-30बी एआई समुदाय में लहरें पैदा कर रहा है।
मोज़ेकएमएल की एलएलएम यात्रा एमपीटी-7बी (मोज़ेक प्रीट्रेन्ड ट्रांसफॉर्मर) के रिलीज़ के साथ मई 2023 में शुरू हुई, जिसमें तीन वेरिएंट थे:
- एमपीटी-7बी-स्टोरीव्राइटर-65क+ (लंबे फॉर्म स्टोरी जेनरेशन के लिए)
- एमपीटी-7बी-इन्सट्रक्ट (छोटे फॉर्म इंस्ट्रक्शन फॉलोइंग के लिए)
- एमपीटी-7बी-चैट (डायलॉग जेनरेशन के लिए)
मॉडलों ने अपनी ओपन-सोर्स प्रकृति, व्यावसायिक उपयोगिता, और विस्तारित संदर्भ विंडो को संभालने की असाधारण क्षमता के कारण एमएल समुदाय में भारी सफलता देखी।
सबसे महत्वपूर्ण बात, मॉडल अन्य तुलनीय मॉडलों (एलएलएएमए-7बी, स्टेबलएलएम 7बी, आदि) के बराबर और कुछ मामलों में बेहतर प्रदर्शन किया। जून तक, एमपीटी-7बी श्रृंखला को 3 मिलियन से अधिक बार डाउनलोड किया गया था। 22 जून को, मोज़ेकएमएल ने एमपीटी-30बी जारी किया, जिसने ओपन-सोर्स फाउंडेशन मॉडल के लिए बार को और भी आगे बढ़ा दिया।
एमपीटी-30बी: जीपीटी-3 से आगे निकलने वाला एक शक्तिशाली एलएलएम
एमपीटी-30बी एक ओपन-सोर्स और व्यावसायिक रूप से लाइसेंस प्राप्त डिकोडर-आधारित एलएलएम है जो जीपीटी-3-175बी से अधिक शक्तिशाली है, जिसमें केवल 17% जीपीटी-3 पैरामीटर हैं, अर्थात 30बी। यह कई कार्यों पर जीपीटी-3 को पीछे छोड़ देता है। एमपीटी-30बी और जीपीटी-3 के बीच एक तुलना यहां दी गई है।
एमपीटी-30बी पिछले एमपीटी-7बी मॉडल पर बनाया गया है। यह समान आकार के मॉडलों की तुलना में प्रशिक्षण के लिए गणनात्मक रूप से कुशल है। उदाहरण के लिए, एलएलएएमए-30बी ने एमपीटी-30बी की तुलना में लगभग 1.44 गुना अधिक फ्लॉप्स बजट का उपयोग किया, जबकि फाल्कन-40बी के पास एमपीटी-30बी की तुलना में 1.27 गुना अधिक फ्लॉप्स बजट था। एमपीटी-30बी के अपने पूर्ववर्ती पर विभिन्न कार्यों में सुधार का एक चित्रण यहां दिया गया है।
एमपीटी-30बी की कुछ विशेष विशेषताएं इस प्रकार हैं:
8के टोकन संदर्भ विंडो
एलएलएम में संदर्भ विंडो से तात्पर्य मॉडल द्वारा आउटपुट उत्पन्न करने से पहले विचार किए जाने वाले टोकन की सीमा से है। एमपीटी-30बी में प्रशिक्षण समय में 8000 टोकन की संदर्भ विंडो थी। यह पहले 1टी टोकन का उपयोग करके 2के टोकन अनुक्रमों पर प्रशिक्षित किया गया था और फिर 50बी टोकन के 8के टोकन अनुक्रमों (लगभग 6000 शब्द) के साथ अतिरिक्त प्रशिक्षण किया गया था।
एएलआईबी समर्थन
इस सुविधा को समझाने के लिए, आइए एक प्रश्न पर विचार करें:
एमपीटी-30बी प्रशिक्षण के दौरान से अधिक लंबे अनुक्रमों के लिए कैसे समझ सकता है और भविष्यवाणी कर सकता है?
एमपीटी-30बी एटेंशन विद लीनियर बायस (एएलआईबी) तकनीक का उपयोग करके लंबे अनुक्रमों को समझने और संदर्भ विंडो को 8के टोकन से परे बढ़ाने के लिए करता है।
इसके बजाय स्थितिजन्य एम्बेडिंग की गणना करना, जिसमें हम प्रत्येक शब्द को एक वेक्टर से संबोधित करते हैं, एएलआईबी कुंजी और प्रश्न टोकन के बीच ध्यान स्कोर की गणना करता है। जब कुंजी और प्रश्न टोकन एक दूसरे के करीब होते हैं, तो दंड कम होता है, लेकिन अन्यथा अधिक होता है। परिणामस्वरूप, अंतर्निहित ट्रांसफॉर्मर आर्किटेक्चर लंबे फॉर्म इनपुट को समझने के लिए सामान्यीकरण कर सकता है।
फ्लैशएटेंशन के माध्यम से कुशल अनुमान और प्रशिक्षण प्रदर्शन
ध्यान, अर्थात प्रासंगिक इनपुट अनुक्रम के हिस्सों पर ध्यान केंद्रित करना, ट्रांसफॉर्मर का एक महत्वपूर्ण घटक है, लेकिन यह धीमा और मेमोरी-गहन हो सकता है, विशेष रूप से लंबे पाठ अनुक्रमों को संसाधित करते समय।
कॉर्नेल विश्वविद्यालय के शोधकर्ताओं द्वारा प्रस्तावित फ्लैशएटेंशन एमपीटी-30बी के लिए इस समस्या का समाधान है। टाइलिंग नामक एक तकनीक का उपयोग करके, फ्लैशएटेंशन मेमोरी से पढ़ने या लिखने की आवश्यकता को कम कर देता है, जिससे प्रोसेसिंग तेज हो जाती है। इसलिए, मॉडल राज्य-ऑफ-द-आर्ट फ्लैशएटेंशन तकनीक और एनवीडिया के फास्टरट्रांसफॉर्मर ऑप्टिमाइजेशन लाइब्रेरी का उपयोग कुशल प्रशिक्षण और अनुमान के लिए करता है।
प्रशिक्षण और तैनाती में आसानी
डेवलपर एमपीटी-30बी को स्क्रैच से प्रशिक्षित कर सकते हैं या तेजी से तैनाती के लिए मोज़ेकएमएल के चेकपॉइंट का उपयोग कर सकते हैं। इसके अलावा, इसे विशिष्ट डेटासेट पर डोमेन-विशिष्ट उपयोग के मामलों के लिए फ़ाइन-ट्यून किया जा सकता है।
मॉडल का आकार एकल जीपीयू पर सहज तैनाती को सक्षम करने के लिए चुना गया था, विशेष रूप से 1xA100-80GB 16-बिट सटीकता में या 1xA100-40GB 8-बिट सटीकता में। इसका मतलब है कि मॉडल को इन जीपीयू की मेमोरी सीमाओं के भीतर फिट होने के लिए डिज़ाइन किया गया था।
कोडिंग क्षमताएं
एमपीटी-30बी असाधारण कोडिंग क्षमताएं भी प्रदान करता है। ह्यूमनइवल ओपनएआई द्वारा जारी एक डेटासेट है जिसमें 164 हाथ से तैयार किए गए प्रोग्रामिंग समस्याएं हैं। ह्यूमनइवल डेटासेट पर, मॉडल उद्देश्य से निर्मित एलएलएम मॉडल, जैसे स्टार्कोडर श्रृंखला को पार करता है।
फ़ाइन-ट्यून किए गए वेरिएंट: एमपीटी-30बी-इन्सट्रक्ट और एमपीटी-30बी-चैट
एमपीटी-30बी-इन्सट्रक्ट
एलएलएम मुख्य रूप से निर्देशों के लिए उपयोग किए जाते हैं, जैसे प्रश्न उत्तर देना, पाठ सारांश, भाषा अनुवाद, आदि। एमपीटी-30बी-इन्सट्रक्ट एमपीटी-30बी का एक व्यावसायिक रूप से उपयोगी (व्यावसायिक सीसी-बाय-एसए-3.0 लाइसेंस बनाए रखता है) संस्करण है जो विशेष रूप से निर्देश अनुसरण कार्यों के लिए फ़ाइन-ट्यून किया गया है। फ़ाइन-ट्यूनिंग के लिए निम्नलिखित डेटासेट का उपयोग किया गया था:
- फ्लैन
- पी3
- अल्पाका
- डॉली -15के
डॉली डेटासेट को एंथ्रोपिक के हेल्पफुल एंड हार्मलेस डेटासेट के साथ निर्देश फ़ाइन-ट्यूनिंग के लिए आगे बढ़ाया गया था। इसके अलावा, डेटा ऑगमेंटेशन के लिए विविध डेटासेट का उपयोग किया गया था, जो इस प्रकार हैं:
- कॉम्पिटिशनमाथ
- ग्रेडस्कूलमाथ
- डायलॉगसम
- ड्योरसी
- क्यास्पर
- क्वालिटी
- समस्क्रीन
- स्पाइडर
एमपीटी-30बी-चैट
एमपीटी-30बी-चैट एमपीटी-30बी का एक फ़ाइन-ट्यून किया गया संस्करण है जो संवाद उत्पन्न करने के लिए है। यह एक शोध आर्टिफैक्ट है जो सीसी-बाय-एनसी-एसए-4.0 लाइसेंस के तहत जारी किया गया है, जो केवल गैर-व्यावसायिक उपयोग की अनुमति देता है। मॉडल को विभिन्न भाषा डेटासेट का उपयोग करके फ़ाइन-ट्यून किया गया था, जिनमें शामिल हैं:
- एयरोबोरोस/जीपीटी4-1.2
- बैज
- कैमल
- जीपीटीचर
- गुआनाको
- लॉन्गकवर्सेशन
- शेयरजीपीटी
- विज़ार्डलएम
एलएलएम जनरेटिव एआई बाजार का एक बड़ा हिस्सा साझा करते हैं, जो एक अरब डॉलर से अधिक का है, जिसने पिछले साल चैटजीपीटी द्वारा परिदृश्य को क्रांतिकारी बनाने के बाद तेजी से विकास किया है। एमपीटी परिवार इस क्रांति का एक आधारभूत हिस्सा है। निकट भविष्य में, हम एमपीटी परिवार से अधिक शक्तिशाली और कुशल ओपन-सोर्स मॉडल देखने की उम्मीद कर सकते हैं जो व्यावसायिक रूप से उपलब्ध होंगे।
नवीनतम एआई समाचार के लिए, unite.ai पर जाएं।















