एआई मॉडल और प्लेटफ़ॉर्म

जीएलएम-130बी: एक ओपन बाइलिंगुअल प्री-ट्रेन्ड मॉडल

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

जीएलएम-130बी फ्रेमवर्क एक बाइलिंगुअल प्री-ट्रेन्ड लार्ज लैंग्वेज मॉडल है जिसमें 130 बिलियन पैरामीटर हैं और यह अंग्रेजी और चीनी दोनों में टेक्स्ट आउटपुट जनरेट करने में सक्षम है। जीएलएम-130बी फ्रेमवर्क एक ऐसा प्रयास है जो 100 बिलियन पैरामीटर से अधिक के स्केल पर एक लैंग्वेज मॉडल को ओपन सोर्स करने का प्रयास करता है, और चर्चा करता है कि इतने बड़े स्केल पर फ्रेमवर्क को प्री-ट्रेन कैसे किया जा सकता है, क्योंकि वर्तमान में इतने बड़े स्केल के मॉडल को प्रशिक्षित करना अक्सर विचलन और नुकसान के स्पाइक्स जैसी समस्याओं से भरा होता है।

इस लेख में, हम जीएलएम-130बी फ्रेमवर्क के बारे में बात करेंगे, जो बड़े पैमाने पर लैंग्वेज मॉडल को प्रभावी ढंग से प्री-ट्रेन करने के लिए एक विधि विकसित करने का प्रयास करता है। हम जीएलएम-130बी फ्रेमवर्क के कार्य और वास्तुकला के साथ-साथ प्रशिक्षण प्रक्रिया और डिज़ाइन विकल्पों में गहराई से जाएंगे जो не только दक्षता में वृद्धि करने में मदद करते हैं, बल्कि स्थिरता में भी। जीएलएम-130बी फ्रेमवर्क के कार्य का परीक्षण करने के लिए किए गए प्रारंभिक प्रयोगों ने अंग्रेजी बेंचमार्क पर जीएलएम-130बी मॉडल को वर्तमान राज्य के कला जीपीटी-3 फ्रेमवर्क से काफी मार्जिन से बेहतर प्रदर्शन करते हुए दिखाया। तो आइए, जीएलएम-130बी फ्रेमवर्क कैसे इतने सुसंगत, सटीक और स्थिर परिणाम देता है, इसका पता लगाएं।

जीएलएम-130बी फ्रेमवर्क का परिचय

100 बिलियन पैरामीटर से अधिक के साथ बड़े पैमाने पर लैंग्वेज मॉडल, विशेष रूप से जो फ्यू-शॉट और जीरो-शॉट सेटिंग्स में काम कर सकते हैं, आकर्षक स्केलिंग कानून प्रस्तुत करते हैं, जिनमें से जीपीटी-3 फ्रेमवर्क सबसे अच्छा प्रदर्शन करने वाला फ्रेमवर्क है जो अपने पूर्ववर्ती बीईआरटी फ्रेमवर्क की तुलना में काफी प्रदर्शन अपग्रेड प्रदान करता है। हालांकि, जीपीटी-3 फ्रेमवर्क की लोकप्रियता और इसके व्यापक अनुप्रयोगों के बावजूद, प्रशिक्षण प्रक्रिया और कुछ मायनों में, जीपीटी-3 फ्रेमवर्क स्वयं जनता के लिए पारदर्शी नहीं है। इसके अलावा, 100 बिलियन पैरामीटर से अधिक के लिए एलएलएम के लिए सभी संभावित डिज़ाइनों को संख्यात्मक रूप से गिनना गणनात्मक रूप से महंगा है, जो बड़े पैमाने पर एलएलएम फ्रेमवर्क के लिए प्री-ट्रेनिंग विधि विकसित करना और भी महत्वपूर्ण बनाता है।

उपरोक्त बिंदु यह बताता है कि जीपीटी-3 जैसे उच्च गुणवत्ता वाले बड़े पैमाने पर एलएलएम फ्रेमवर्क के कार्य और प्रशिक्षण प्रक्रिया को साझा करना महत्वपूर्ण है, और नैतिक चिंताओं को ध्यान में रखते हुए, जीएलएम-130बी फ्रेमवर्क 100 बिलियन पैरामीटर से अधिक के साथ एक सटीक और ओपन-सोर्स एलएलएम प्री-ट्रेन करने का प्रयास है। अपने प्रयास के दौरान, जीएलएम-130बी विकास टीम ने观察 किया कि एक बड़े पैमाने पर एलएलएम फ्रेमवर्क को प्री-ट्रेन करना अक्सर प्री-ट्रेनिंग स्थिरता, दक्षता और अभिसरण के संदर्भ में एक विस्तृत श्रृंखला के इंजीनियरिंग और तकनीकी चुनौतियों के साथ होता है।

विशेष रूप से, जीएलएम-130बी एक द्विदिशात्मक और द्विभाषी घने फ्रेमवर्क है जिसमें 130 बिलियन पैरामीटर हैं, जो 400 बिलियन टोकन पर 96 एनवीडिया डीजीएक्स-ए100 जीपीयू नोड्स के क्लस्टर पर लगभग दो महीने की अवधि में प्री-ट्रेन किया गया है। इसके अलावा, जीपीटी-शैली की वास्तुकला के बजाय, जीएलएम-130बी फ्रेमवर्क जीएलएम या जनरल लैंग्वेज मॉडल अल्गोरिथ्म का उपयोग अपने स्व-निर्भर खाली भरने के उद्देश्यों और द्विदिशात्मक ध्यान के लाभ का लाभ उठाने के प्रयास में करता है। निम्नलिखित तालिका जीएलएम-130बी फ्रेमवर्क की तुलना 100 बिलियन पैरामीटर से अधिक के साथ अन्य मॉडलों के साथ करती है, जिनमें जीपीटी, ब्लूम-176बी और ऑप्ट-175बी शामिल हैं।

जीएलएम-130बी फ्रेमवर्क में शामिल इंजीनियरिंग और विकास के概念 जीपीटी-3 और पाल्म 540बी जैसे लगभग हर बड़े पैमाने पर एलएलएम फ्रेमवर्क को पार करते हैं, जिसमें 500 बिलियन पैरामीटर से अधिक हैं, और कई बेंचमार्क पर। जीएलएम-130बी फ्रेमवर्क के प्रदर्शन की तुलना 100 बिलियन पैरामीटर से अधिक के साथ मॉडल के साथ की जा सकती है, और जैसा कि यह देखा जा सकता है, जीएलएम-130बी फ्रेमवर्क में अपने समकक्षों की तुलना में काफी कम पीढ़ी विषाक्तता और पूर्वाग्रह है।

अंत में, जीएलएम-130बी को इस तरह से डिज़ाइन किया गया है ताकि 100 बिलियन पैरामीटर से अधिक के साथ फ्रेमवर्क पर अध्ययन करने के लिए विकासकर्ताओं को सक्षम किया जा सके, और जीएलएम-130बी फ्रेमवर्क को यह दो तरीकों से हासिल किया जाता है। पहले, ब्लूम और ऑप्ट की तरह 175 बिलियन पैरामीटर का उपयोग करने के बजाय, जीएलएम-130बी फ्रेमवर्क 130 बिलियन पैरामीटर का उपयोग करता है, क्योंकि मॉडल का आकार एकल ए100 सर्वर पर भी हस्तक्षेप का समर्थन करता है। दूसरा, जीएलएम-130बी फ्रेमवर्क को चलाने के लिए जीपीयू की आवश्यकता अन्य एलएलएम फ्रेमवर्क की तुलना में कम है, और जीएलएम-130बी फ्रेमवर्क इसे अपने मूल फ्रेमवर्क को इंट4 सटीकता में क्वांटाइज़ करके हासिल करता है। जीएलएम-130बी फ्रेमवर्क द्वारा उपयोग की जाने वाली इंट4 क्वांटाइजेशन प्रदर्शन को बढ़ाती है जबकि नगण्य प्रदर्शन हानि को बनाए रखती है।

जीएलएम-130बी: वास्तुकला

एक मशीन लर्निंग मॉडल का प्रेरक पूर्वाग्रह इसकी वास्तुकला द्वारा वर्णित किया जाता है, और यह आश्चर्य की बात नहीं है जब विकासकर्ता बड़े पैमाने पर लैंग्वेज मॉडल के लिए विभिन्न वास्तुकला डिज़ाइनों का अन्वेषण नहीं कर सकते हैं, गणनात्मक किफायत और व्यवहार्यता के कारण। इसके साथ कहा, जीएलएम-130बी की वास्तुकला पर एक नज़र डालते हैं।

पाल्म, जीपीटी और अधिक जैसे बड़े पैमाने पर एलएलएम फ्रेमवर्क में 100 बिलियन पैरामीटर से अधिक हैं, और वे पारंपरिक डिकोडर-ओनली जीपीटी-शैली की वास्तुकला पर आधारित हैं जो स्व-निर्भर भाषा मॉडलिंग के लिए है। दूसरी ओर, जीएलएम-130बी फ्रेमवर्क एक द्विदिशात्मक जनरल लैंग्वेज मॉडल या जीएलएम का उपयोग करने की संभावना का अन्वेषण करता है, जो एक ट्रांसफॉर्मर-आधारित भाषा मॉडल है जो स्व-निर्भर खाली भरने के उद्देश्य का लाभ उठाने का प्रयास करता है। संक्षेप में, एक दिए गए पाठ अनुक्रम के लिए, जीएलएम फ्रेमवर्क पाठ स्पैन को नमूना करता है जो एकल मास्क टोकन से बदल दिया जाता है।

जीएलएम फ्रेमवर्क का द्विदिशात्मक ध्यान, जो अविकृत या अनमास्केड संदर्भों पर है, जीएलएम-130बी फ्रेमवर्क को जीपीटी-शैली के दृष्टिकोण से अलग करता है जो एक एकदिशात्मक दृष्टिकोण का उपयोग करता है। इसके अलावा, डेटा के सृजन और समझने के लिए, जीएलएम फ्रेमवर्क दो भ्रष्टाचार रणनीतियों को मिलाता है, प्रत्येक के साथ एक विशेष और अनोखा मास्क टोकन है।

  • [मास्क]: [मास्क] एक भ्रष्टाचार रणनीति है जो वाक्यों में छोटे खाली स्थान का उपयोग करती है, जिनकी लंबाई इनपुट के एक निश्चित प्रतिशत तक जोड़ देती है।
  • [जीमास्क]: [जीमास्क] एक भ्रष्टाचार रणनीति है जो वाक्य के अंत में यादृच्छिक-लंबाई वाले खाली स्थान का उपयोग करती है, जिसमें प्रीफिक्स संदर्भ होते हैं।

जीएलएम फ्रेमवर्क का दृष्टिकोण जीएलएम-130बी फ्रेमवर्क को जीरो-शॉट लैम्बाडा भाषा मॉडलिंग पर 80% से अधिक का स्कोर रिकॉर्ड करने में मदद करता है, और पाल्म 540बी और जीपीटी-3 फ्रेमवर्क दोनों को पार करता है।

लेयर नॉर्मलाइजेशन

एक एलएलएम फ्रेमवर्क को प्रशिक्षित करने के दौरान विकासकर्ताओं को सामने आने वाली एक प्रमुख चुनौती प्रशिक्षण अस्थिरता है, और एक उपयुक्त एलएन (लेयर नॉर्मलाइजेशन) का उपयोग करने से एलएलएम के प्रशिक्षण में मदद मिल सकती है। जीएलएम-130बी फ्रेमवर्क पोस्ट-एलएन दृष्टिकोण का उपयोग करता है क्योंकि यह डाउनस्ट्रीम कार्यों पर इसके प्रदर्शन के कारण।

एफएफएन और पोज़िशनल एन्कोडिंग

फीडफॉरवर्ड न्यूरल नेटवर्क या एफएफएन और पोज़िशनल एन्कोडिंग जीएलएम-130बी फ्रेमवर्क द्वारा अपनाए गए दो दृष्टिकोण हैं जो उच्च-अंत डाउनस्ट्रीम प्रदर्शन और प्रशिक्षण स्थिरता को पेश करने में मदद करते हैं।

प्री-ट्रेनिंग सेटअप

जीएलएम-130बी फ्रेमवर्क के प्री-ट्रेनिंग उद्देश्यों में न केवल कुछ टोकन के लिए मल्टी-टास्क लर्निंग शामिल है, बल्कि स्व-निर्भर जीएलएम के लिए स्व-निर्भर खाली भरने के लिए भी शामिल है, जिसकी उम्मीद है कि यह दृष्टिकोण जीएलएम-130बी फ्रेमवर्क को डाउनस्ट्रीम कार्यों में मदद करेगा। इसके साथ कहा, जीएलएम-130बी फ्रेमवर्क का प्री-ट्रेनिंग सेटअप निम्नलिखित है।

स्व-निर्भर खाली भरना

जैसा कि पहले उल्लेख किया गया है, जीएलएम-130बी फ्रेमवर्क दो भ्रष्टाचार रणनीतियों का उपयोग करता है, अर्थात [मास्क] और [जीमास्क], और इनमें से एक रणनीति को प्रत्येक प्रशिक्षण अनुक्रम में स्वतंत्र रूप से लागू किया जाता है। खाली भरने के लिए, [मास्क] रणनीति 30% प्रशिक्षण अनुक्रम में इनपुट के 15% तक की लंबाई के साथ समान खाली स्थान को मास्क करती है, जो एक पॉइसन वितरण का पालन करता है। शेष 70% अनुक्रम के लिए, प्रत्येक अनुक्रम का प्रीफिक्स संदर्भ के रूप में रखा जाता है, और [जीमास्क] रणनीति शेष को मास्क करने में मदद करती है, और मास्क की गई लंबाई को यूनिफॉर्म वितरण का उपयोग करके नमूना किया जाता है।

मल्टी-टास्क निर्देश प्री-ट्रेनिंग

यह संकेत दिया गया है कि प्री-ट्रेनिंग के दौरान मल्टी-टास्क लर्निंग दृष्टिकोण का पालन करने से जीरो-शॉट सेटिंग में कार्य स्थानांतरण में बेहतर परिणाम मिल सकते हैं और फाइन-ट्यूनिंग की तुलना में बेहतर परिणाम मिल सकते हैं। इसके अनुसार, जीएलएम-130बी फ्रेमवर्क प्री-ट्रेनिंग के दौरान भाषा पीढ़ी, समझ और जानकारी निकालने सहित विभिन्न निर्देश-प्रेरित डेटासेट का उपयोग करने का प्रस्ताव करता है।

जीपीटी-3 फ्रेमवर्क की तुलना में जीरो-शॉट कार्य स्थानांतरण के लिए मल्टी-टास्क प्रोम्प्टेड फाइन-ट्यूनिंग के अन्य दृष्टिकोणों की तुलना में, जीएलएम-130बी फ्रेमवर्क द्वारा अपनाए गए मल्टी-टास्क निर्देश प्री-ट्रेनिंग दृष्टिकोण केवल 5% टोकन के लिए खाता है, और यह प्री-ट्रेनिंग चरण के दौरान निर्धारित किया जाता है ताकि एलएलएम फ्रेमवर्क की अन्य क्षमताओं को खराब न किया जा सके, या अन्य शब्दों में, अनशर्त मुक्त पीढ़ी।

3डी समांतर रणनीति

बिलियन पैरामीटर के साथ बड़े पैमाने पर मॉडल को प्रशिक्षित करने के लिए दो डी फैक्टो प्रथाएं हैं, टेंसर मॉडल समांतरता और डेटा समांतरता। जीएलएम-130बी फ्रेमवर्क जीपीयू उपयोग को कम करने और विशाल जीपीयू आवश्यकताओं को संभालने के प्रयास में, पाइपलाइन मॉडल समांतरता रणनीति के साथ टेंसर मॉडल समांतरता और डेटा समांतरता रणनीतियों को जोड़ने वाली 3डी समांतर रणनीति को लागू करता है।

जीएलएम-130बी: प्रशिक्षण स्थिरता

प्रशिक्षण स्थिरता एक एलएलएम की गुणवत्ता को निर्धारित करने में एक महत्वपूर्ण कारक है, और प्रशिक्षण स्थिरता इस बात से बहुत प्रभावित होती है कि यह कितने टोकन से गुजरता है। इसके अलावा, फ्लोटिंग पॉइंट प्रारूपों के संबंध में दक्षता और स्थिरता के बीच एक व्यापार-बंद स्थापित करना महत्वपूर्ण है, क्योंकि कम सटीकता वाले फ्लोटिंग पॉइंट प्रारूप गणना दक्षता को बढ़ावा देते हैं, लेकिन अक्सर प्रशिक्षण पतन का कारण बनते हैं क्योंकि वे अंडरफ्लो और ओवरफ्लो त्रुटियों के लिए अतिसंवेदनशील होते हैं।

मिश्रित सटीकता

प्रशिक्षण सटीकता को बढ़ाने और मेमोरी उपयोग को कम करने के प्रयास में, जीएलएम-130बी फ्रेमवर्क मिश्रित सटीकता का उपयोग करता है, अर्थात एफपी16 दोनों आगे और पीछे के लिए, और एफपी32 दोनों मास्टर वजन और ऑप्टिमाइज़र राज्यों के लिए। जीपीटी-3 फ्रेमवर्क की तरह, जीएलएम-130बी फ्रेमवर्क का प्रशिक्षण चरण मिश्रित सटीकता रणनीति का उपयोग करते हुए अक्सर नुकसान स्पाइक्स का सामना करता है, और नुकसान स्पाइक्स की आवृत्ति मॉडल के प्रशिक्षण जारी रहने के साथ बढ़ती रहती है। इसके अलावा, ट्रांसफॉर्मर्स को स्केल अप करने के दौरान विकासकर्ताओं को सामने आने वाली मुख्य समस्याएं हैं।

पहले, प्री-एलएन का उपयोग करते समय ट्रांसफॉर्मर की मुख्य शाखा का मूल्य पैमाने गहरे परतों में विशाल हो सकता है, और जीएलएम-130बी फ्रेमवर्क में यह एक गहरे-नॉर्म आधारित प्री-एलएन का उपयोग करके संबोधित किया जाता है, जो सुनिश्चित करता है कि मूल्य पैमाने हमेशा सीमित रहता है। दूसरा, मॉडल के स्केल अप होने के साथ, ध्यान स्कोर एफपी16 के सीमा से अधिक हो जाते हैं।

एम्बेडिंग-लेयर ग्रेडिएंट श्रिंक या ईजीएस

जीएलएम-130बी फ्रेमवर्क पर काम करने वाले विकासकर्ताओं ने यह पाया कि ग्रेडिएंट नॉर्म प्रशिक्षण पतन के लिए एक सूचक संकेतक के रूप में कार्य कर सकता है, और प्रशिक्षण पतन आमतौर पर ग्रेडिएंट नॉर्म में एक स्पाइक के बाद होता है। इन स्पाइक्स का कारण एम्बेडिंग परत के असामान्य ग्रेडिएंट हैं, और विकासकर्ताओं ने यह देखा कि एम्बेडिंग परत के ग्रेडिएंट नॉर्म अन्य परतों की तुलना में कई गुना बड़ा है, और यह प्रशिक्षण के शुरुआती दौरान नाटकीय रूप से उतार-चढ़ाव करता है। विजन मॉडल भी इस समस्या का सामना करते हैं, और इसे पैच प्रोजेक्शन परत को फ्रीज करके संबोधित किया जाता है। हालांकि, एलएलएम में इसी दृष्टिकोण को लागू नहीं किया जा सकता है क्योंकि भाषा मॉडल में प्रोजेक्शन परतों को फ्रीज नहीं किया जा सकता है।

जीएलएम-130बी: परिणाम और प्रदर्शन

जीएलएम-130बी के प्रदर्शन का मूल्यांकन करने के लिए, यह सामान्य एलएलएम फ्रेमवर्क जैसे पाल्म और जीपीटी-3 द्वारा अपनाए गए समान सेटिंग्स को लागू करता है, और जैसा कि जीएलएम-130बी एक द्विभाषी फ्रेमवर्क है, यह कई चीनी बेंचमार्क पर भी मूल्यांकन किया जाता है। जीएलएम-130बी फ्रेमवर्क के प्रदर्शन को कई बेंचमार्क पर मापा जाएगा, जिनमें भाषा मॉडलिंग, एमएमएलयू या विशाल मल्टी-टास्क भाषा समझ, बिग-बेंच या बियॉन्ड द इमिटेशन गेम बेंचमार्क, और सीएलयूई या चीनी भाषा समझ मूल्यांकन शामिल हैं। तो आइए शुरू करें।

भाषा मॉडलिंग

जीएलएम-130बी फ्रेमवर्क पर भाषा मॉडलिंग बेंचमार्क परीक्षण दो डेटासेट पर किया जाता है: लैम्बाडा और पाइल।

लैम्बाडा डेटासेट एलएलएम की अंतिम शब्द मॉडलिंग क्षमता का परीक्षण करने के लिए उपयोग किया जाता है, और जीएलएम-130बी फ्रेमवर्क द्विभाषी सेटिंग में 80.2 का जीरो-शॉट सटीकता स्कोर प्राप्त करता है, और लैम्बाडा डेटासेट पर एक नया बेंचमार्क रिकॉर्ड स्थापित करता है।

दूसरी ओर, पाइल एक परीक्षण सेट है जो भाषा मॉडल के लिए एक श्रृंखला के बेंचमार्क को शामिल करता है। जीपीटी-3 और जुरासिक-1 की तुलना में, जीएलएम-130बी फ्रेमवर्क 18 साझा परीक्षण सेट पर वजनदार बीपीबी के संदर्भ में अपना सर्वश्रेष्ठ प्रदर्शन देता है। परिणाम जीएलएम-130बी फ्रेमवर्क की मजबूत भाषा क्षमता को प्रदर्शित करते हैं, और परिणाम नीचे दी गई तालिका में शामिल हैं।

एमएमएलयू या विशाल मल्टी-टास्क भाषा समझ

एमएमएलयू या विशाल मल्टी-टास्क भाषा समझ एक विविध बेंचमार्क है जिसमें मानव बुद्धिमत्ता और ज्ञान से संबंधित 50 से अधिक बहुविकल्पी प्रश्न उत्तर देने वाले कार्य शामिल हैं, जो हाई स्कूल से लेकर विशेषज्ञ स्तर तक हैं, और यह पाइल परीक्षण सेट के क्रॉलिंग के बाद जारी किया जाता है, और इसलिए यह एलएलएम की जीरो-शॉट सीखने की क्षमता का मूल्यांकन करने के लिए एक आदर्श परीक्षण सेट के रूप में कार्य करता है।

जैसा कि यह देखा जा सकता है, जीरो-शॉट सेटिंग (5-शॉट) में, जीएलएम-130बी फ्रेमवर्क का प्रदर्शन जीपीटी-3 मॉडल के प्रदर्शन के करीब पहुंचता है जब यह लगभग 300 बिलियन टोकन देखता है। प्रदर्शन प्रशिक्षण के आगे बढ़ने के साथ बढ़ता रहता है, और जब प्रशिक्षण समाप्त होता है, तो फ्रेमवर्क 400 बिलियन टोकन देखने के बाद 44.8 का सटीकता स्कोर प्राप्त करता है।

बिग-बेंच या बियॉन्ड द इमिटेशन गेम बेंचमार्क

बिग-बेंच या बियॉन्ड द इमिटेशन गेम बेंचमार्क चुनौतीपूर्ण कार्य एलएलएम की ज्ञान, तर्क और सामान्य ज्ञान की क्षमता का परीक्षण करते हैं। जैसा कि निम्नलिखित आंकड़ों में दिखाया गया है, जीरो-शॉट सेटिंग में, जीएलएम-130बी फ्रेमवर्क पाल्म 540बी और जीपीटी-3 175बी फ्रेमवर्क दोनों को पार करता है, जो शायद एमआईपी और जीरो-शॉट सेटिंग में जीएलएम-130बी के प्रदर्शन को बढ़ाने के लिए द्विदिशात्मक संदर्भ ध्यान के कारण हो सकता है। इसके अलावा, जैसे ही शॉट्स की संख्या बढ़ती है, जीएलएम-130बी फ्रेमवर्क का प्रदर्शन भी बेहतर होता है, और जीपीटी-3 फ्रेमवर्क को लगातार पार करता है।

सीएलयूई या चीनी भाषा समझ मूल्यांकन

जीएलएम-130बी के चीनी जीरो-शॉट प्रदर्शन का मूल्यांकन स्थापित एनएलपी बेंचमार्क कार्यों पर किया जाता है, जिनमें सीएलयूई और फ्यू-सीएलयूई शामिल हैं, और 260बी ईआरएनआईई टाइटन 3.0 के साथ तुलना की जाती है, जो वर्तमान में सबसे बड़ा चीनी भाषा मॉडल है। जैसा कि यह देखा जा सकता है, जीएलएम-130बी फ्रेमवर्क 12 अलग-अलग कार्यों पर 260बी ईआरएनआईई टाइटन 3.0 फ्रेमवर्क को लगातार पार करता है, और दो सारांश एमआरसी डेटासेट पर ईआरएनआईई फ्रेमवर्क की तुलना में लगभग 260% बेहतर प्रदर्शन करता है।

निष्कर्ष

इस लेख में, हमने जीएलएम-130बी के बारे में बात की है, जो एक द्विभाषी प्री-ट्रेन्ड लार्ज लैंग्वेज मॉडल है जो एलएलएम अनुसंधान को बढ़ावा देने का प्रयास करता है। वास्तुकला, इंजीनियरिंग, और तकनीकी उपक्रम एलएलएम फ्रेमवर्क की वास्तुकला, प्रशिक्षण दक्षता और स्थिरता, प्री-ट्रेनिंग उद्देश्यों और सस्ते हस्तक्षेप के बारे में एआई समुदाय को बेहतर अंतर्दृष्टि प्रदान करने का प्रयास करते हैं।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।