एआई मॉडल और प्लेटफ़ॉर्म

मिस्ट्रल एआई का नवीनतम मिक्स्चर ऑफ एक्सपर्ट्स (मोइ) 8x7B मॉडल

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

मिस्ट्रल एआई

जो एक पेरिस स्थित ओपन-सोर्स मॉडल स्टार्टअप है, ने अपने नवीनतम बड़े भाषा मॉडल (एलएलएम), मोइ 8x7B को एक सरल टोरेंट लिंक के माध्यम से जारी करके मानकों को चुनौती दी है। यह गूगल के पारंपरिक दृष्टिकोण से अलग है, जिसमें उनके जेमिनी रिलीज के साथ एक पेपर, ब्लॉग या प्रेस रिलीज की आवश्यकता होती है, जो एआई समुदाय के भीतर चर्चा और उत्साह को बढ़ावा देता है।

मिस्ट्रल एआई का रिलीज के लिए दृष्टिकोण हमेशा से असामान्य रहा है। अक्सर पेपर, ब्लॉग या प्रेस रिलीज के सामान्य साथियों को छोड़ देते हुए, उनकी रणनीति एआई समुदाय का ध्यान आकर्षित करने में अद्वितीय रूप से प्रभावी रही है।

हाल ही में, कंपनी ने एंड्रेसेन होरोविट्ज द्वारा नेतृत्व वाले एक फंडिंग राउंड के बाद $2 बिलियन का मूल्यांकन हासिल किया, जो यूरोपीय इतिहास में सबसे बड़ा $118 मिलियन का सीड राउंड था। फंडिंग सफलता के अलावा, मिस्ट्रल एआई ओपन-सोर्स एआई में नियामकन को कम करने के लिए ईयू एआई अधिनियम के आसपास की चर्चाओं में सक्रिय रूप से शामिल है।

मोइ 8×7बी क्यों ध्यान आकर्षित कर रहा है

एक “स्केल्ड-डाउन जीपीटी-4” के रूप में वर्णित, मिक्सट्रल 8x7B एक मिक्स्चर ऑफ एक्सपर्ट्स (मोइ) फ्रेमवर्क का उपयोग करता है जिसमें आठ विशेषज्ञ हैं। प्रत्येक विशेषज्ञ में 111B पैरामीटर होते हैं, जो 55B साझा ध्यान पैरामीटर के साथ जुड़े होते हैं, जो प्रति मॉडल कुल 166B पैरामीटर देते हैं। यह डिज़ाइन चुनाव महत्वपूर्ण है क्योंकि यह प्रत्येक टोकन के अनुमान में केवल दो विशेषज्ञों को शामिल करने की अनुमति देता है, जो अधिक कुशल और केंद्रित एआई प्रसंस्करण की ओर एक बदलाव को दर्शाता है।

मिक्सट्रल की एक प्रमुख विशेषता इसकी व्यापक संदर्भ को संभालने की क्षमता है, जो 32,000 टोकन तक है, जो जटिल कार्यों को संभालने के लिए पर्याप्त स्कोप प्रदान करता है। मॉडल की बहुसांस्कृतिक क्षमताओं में अंग्रेजी, फ्रेंच, इतालवी, जर्मन और स्पेनिश के लिए मजबूत समर्थन शामिल है, जो एक वैश्विक डेवलपर समुदाय को पूरा करता है।

मिक्सट्रल का पूर्व-प्रशिक्षण खुले वेब से डेटा से संबंधित है, जिसमें विशेषज्ञों और राउटर्स दोनों के लिए एक ही समय में प्रशिक्षण दृष्टिकोण शामिल है। यह विधि यह सुनिश्चित करती है कि मॉडल न केवल अपने पैरामीटर स्थान में विशाल है, बल्कि विशाल डेटा की बारीकियों के लिए भी बारीकी से ट्यून किया गया है जिसके साथ यह उजागर किया गया है।

मिक्सट्रल 8x7B एक प्रभावशाली स्कोर प्राप्त करता है

मिक्सट्रल 8x7B एक प्रभावशाली स्कोर प्राप्त करता है

मिक्सट्रल 8x7B एलएमए 2 70बी और जीपीटी-3.5 को पार करता है, विशेष रूप से एमबीपीपी कार्य में 60.7% की सफलता दर के साथ, जो अपने समकक्षों की तुलना में काफी अधिक है। यहां तक कि निर्देश-आधारित मॉडल के लिए अनुकूलित एमटी-बेंच पर, मिक्सट्रल 8x7B एक प्रभावशाली स्कोर प्राप्त करता है, जो जीपीटी-3.5 के लगभग बराबर है।

मिक्स्चर ऑफ एक्सपर्ट्स (मोइ) फ्रेमवर्क को समझना

मिक्स्चर ऑफ एक्सपर्ट्स (मोइ) मॉडल, जो हाल के दिनों में मिस्ट्रल एआई के मोइ 8×7बी जैसे राज्य-оф-द-आर्ट भाषा मॉडल में इसके एकीकरण के कारण ध्यान आकर्षित कर रहा है, वास्तव में कई वर्षों पुराने मूलभूत अवधारणाओं में इसकी जड़ें हैं। आइए इस विचार की उत्पत्ति के माध्यम से मूलभूत शोध पत्रों के माध्यम से देखें।

मोइ की अवधारणा

मिक्स्चर ऑफ एक्सपर्ट्स (मोइ) एक तंत्रिका नेटवर्क वास्तुकला में एक परिवर्तन का प्रतिनिधित्व करता है। पारंपरिक मॉडल के विपरीत जो सभी प्रकार के डेटा को संसाधित करने के लिए एक एकल, समान नेटवर्क का उपयोग करते हैं, मोइ एक अधिक विशेषज्ञ और मॉड्यूलर दृष्टिकोण अपनाता है। यह कई ‘विशेषज्ञ’ नेटवर्क से बना होता है, प्रत्येक को विशिष्ट प्रकार के डेटा या कार्यों को संभालने के लिए डिज़ाइन किया जाता है, जो एक ‘गेटिंग नेटवर्क’ द्वारा पर्यवेक्षित किया जाता है जो डेटा को गतिशील रूप से सबसे उपयुक्त विशेषज्ञ को निर्देशित करता है।

एक मिक्स्चर ऑफ एक्सपर्ट्स (मोइ) परत एक पुनरावृत्ति भाषा मॉडल के भीतर निहित

एक मिक्स्चर ऑफ एक्सपर्ट्स (मोइ) परत एक पुनरावृत्ति भाषा मॉडल के भीतर निहित (स्रोत)

 

उपरोक्त छवि एक पुनरावृत्ति भाषा मॉडल के भीतर एक मोइ परत का एक उच्च स्तरीय दृश्य प्रस्तुत करती है। इसके सार में, मोइ परत में कई फीड-फॉरवर्ड उप-नेटवर्क शामिल हैं, जिन्हें ‘विशेषज्ञ’ कहा जाता है, प्रत्येक में विभिन्न डेटा पहलुओं को संसाधित करने में विशेषज्ञता प्राप्त करने की क्षमता है। एक गेटिंग नेटवर्क, जो आरेख में हाइलाइट किया गया है, यह निर्धारित करता है कि कौन से विशेषज्ञों का संयोजन एक दिए गए इनपुट के लिए शामिल किया जाना चाहिए। यह सशर्त सक्रियण नेटवर्क को अपनी क्षमता को बढ़ाने की अनुमति देता है बिना गणनात्मक मांग में एक संबंधित वृद्धि के।

मोइ परत की कार्यक्षमता

अभ्यास में, गेटिंग नेटवर्क इनपुट (आरेख में G(x) के रूप में दर्शाया गया है) का मूल्यांकन करता है और इसे संसाधित करने के लिए विशेषज्ञों का एक विरल सेट चुनता है। यह चयन गेटिंग नेटवर्क के आउटपुट द्वारा संशोधित किया जाता है, प्रभावी रूप से यह निर्धारित करता है कि प्रत्येक विशेषज्ञ का ‘वोट’ या योगदान अंतिम आउटपुट में है। उदाहरण के लिए, जैसा कि आरेख में दिखाया गया है, प्रत्येक विशिष्ट इनपुट टोकन के लिए केवल दो विशेषज्ञ चुने जा सकते हैं, जो प्रक्रिया को कुशल बनाता है bằng गणनात्मक संसाधनों को केंद्रित करना जहां वे सबसे ज्यादा जरूरी हैं।

 

ट्रांसफॉर्मर एनकोडर मोइ परतों के साथ (स्रोत)

दूसरी छवि एक पारंपरिक ट्रांसफॉर्मर एनकोडर की तुलना मोइ परतों से बढ़ाया गया एक के साथ करती है। ट्रांसफॉर्मर वास्तुकला, जो व्यापक रूप से भाषा संबंधित कार्यों में अपनी प्रभावशीलता के लिए जानी जाती है, पारंपरिक रूप से स्व-ध्यान और फीड-फॉरवर्ड परतों की एक श्रृंखला से बनी होती है। मोइ परतों का परिचय देना इनमें से कुछ फीड-फॉरवर्ड परतों को बदलने की अनुमति देता है, जिससे मॉडल को अधिक प्रभावी ढंग से क्षमता के संबंध में स्केल करने की अनुमति मिलती है।

मोइ परतों को कई उपकरणों में वितरित किया जा सकता है, जो एक मॉडल-समानांतर दृष्टिकोण को प्रदर्शित करता है। यह बड़े मॉडल को प्रशिक्षित और तैनात करने के लिए आवश्यक है, क्योंकि यह गणनात्मक भार और मेमोरी आवश्यकताओं को जीपीयू या टीपीयू जैसे उपकरणों के क्लस्टर में वितरित करने की अनुमति देता है। यह वितरण बड़े मॉडल को प्रशिक्षित करने और तैनात करने के लिए आवश्यक है, जैसा कि सैकड़ों अरब से अधिक पैरामीटर वाले मॉडल के प्रशिक्षण में देखा गया है।

स्पार्स मोइ दृष्टिकोण के साथ निर्देश ट्यूनिंग पर एलएलएम

“स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स (मोइ) फॉर स्केलेबल लैंग्वेज मॉडलिंग” शीर्षक वाले एक पत्र में एक नवाचारी दृष्टिकोण का वर्णन किया गया है जो बड़े भाषा मॉडल (एलएलएम) में सुधार करने के लिए मिक्स्चर ऑफ एक्सपर्ट्स वास्तुकला को निर्देश ट्यूनिंग तकनीकों के साथ एकीकृत करता है।

यह एक सामान्य चुनौती को उजागर करता है जहां मोइ मॉडल समान गणनात्मक क्षमता वाले घने मॉडल की तुलना में विशिष्ट कार्यों के लिए फाइन-ट्यूनिंग में कम प्रदर्शन करते हैं क्योंकि सामान्य पूर्व-प्रशिक्षण और कार्य-विशिष्ट फाइन-ट्यूनिंग के बीच विसंगतियां हैं।

निर्देश ट्यूनिंग एक प्रशिक्षण पद्धति है जिसमें मॉडल को प्राकृतिक भाषा निर्देशों का पालन करने के लिए परिष्कृत किया जाता है, प्रभावी रूप से अपने कार्य प्रदर्शन में सुधार करता है। पत्र सुझाव देता है कि मोइ मॉडल निर्देश ट्यूनिंग के साथ संयोजन में उल्लेखनीय सुधार दिखाते हैं, विशेष रूप से अपने घने समकक्षों की तुलना में। यह तकनीक मॉडल के पूर्व-प्रशिक्षित प्रतिनिधित्व को निर्देशों का पालन करने के लिए संरेखित करती है, जिससे महत्वपूर्ण प्रदर्शन में वृद्धि होती है।

शोधकर्ताओं ने तीन प्रयोगात्मक सेटअप में अध्ययन किए, जो दिखाते हैं कि मोइ मॉडल पहले कार्य-विशिष्ट फाइन-ट्यूनिंग में कम प्रदर्शन करते हैं। हालांकि, जब निर्देश ट्यूनिंग लागू की जाती है, तो मोइ मॉडल उत्कृष्ट प्रदर्शन करते हैं, विशेष रूप से जब आगे कार्य-विशिष्ट फाइन-ट्यूनिंग के साथ पूरक होते हैं। यह सुझाव देता है कि निर्देश ट्यूनिंग मोइ मॉडल के लिए एक महत्वपूर्ण चरण है ताकि वे घने मॉडल की तुलना में डाउनस्ट्रीम कार्यों पर बेहतर प्रदर्शन कर सकें।

मोइ पर निर्देश ट्यूनिंग का प्रभाव

मोइ पर निर्देश ट्यूनिंग का प्रभाव

यह फ्लैन-मोइ32बी का परिचय देता है, जो इन अवधारणाओं के सफल अनुप्रयोग को प्रदर्शित करता है। विशेष रूप से, यह फ्लैन-पाल्म62बी को पार करता है, एक घने मॉडल को बेंचमार्क कार्यों पर, जबकि केवल एक-तिहाई गणनात्मक संसाधनों का उपयोग करता है। यह स्पार्स मोइ मॉडल और निर्देश ट्यूनिंग के संयोजन की क्षमता को प्रदर्शित करता है ताकि एलएलएम की दक्षता और प्रदर्शन के लिए नए मानक स्थापित किए जा सकें।

वास्तविक दुनिया के दृश्यों में मिक्स्चर ऑफ एक्सपर्ट्स का कार्यान्वयन

मोइ मॉडल की बहुमुखी प्रकृति इसे विभिन्न अनुप्रयोगों के लिए उपयुक्त बनाती है:

  • प्राकृतिक भाषा प्रसंस्करण (एनएलपी): मोइ मॉडल मानव भाषा की बारीकियों और जटिलताओं को अधिक प्रभावी ढंग से संभाल सकते हैं, जो उन्हें उन्नत एनएलपी कार्यों के लिए उपयुक्त बनाता है।
  • चित्र और वीडियो प्रसंस्करण: उच्च-रिज़ॉल्यूशन प्रसंस्करण के कार्यों में, मोइ विभिन्न चित्र या वीडियो फ्रेम के पहलुओं को संभाल सकता है, दोनों गुणवत्ता और प्रसंस्करण गति में सुधार करता है।
  • कस्टमाइज्ड एआई समाधान: व्यवसाय और शोधकर्ता मोइ मॉडल को विशिष्ट कार्यों के लिए अनुकूलित कर सकते हैं, अधिक लक्षित और प्रभावी एआई समाधानों की ओर ले जा रहे हैं।

चुनौतियां और विचार

मोइ मॉडल कई लाभ प्रदान करते हैं, लेकिन वे अद्वितीय चुनौतियां भी प्रस्तुत करते हैं:

  • प्रशिक्षण और ट्यूनिंग में जटिलता: मोइ मॉडल का वितरित स्वरूप प्रशिक्षण प्रक्रिया को जटिल बना सकता है, जिसमें विशेषज्ञों और गेटिंग नेटवर्क को सावधानीपूर्वक संतुलित और ट्यून करने की आवश्यकता होती है।
  • संसाधन प्रबंधन: मोइ मॉडल के लाभों को अधिकतम करने के लिए विभिन्न विशेषज्ञों में गणनात्मक संसाधनों का कुशलता से प्रबंधन करना आवश्यक है।

मोइ परतों को तंत्रिका नेटवर्क में एकीकृत करना, विशेष रूप से भाषा मॉडल के क्षेत्र में, पहले से असंभव गणनात्मक प्रतिबंधों के कारण मॉडल को बड़े आकार तक स्केल करने का एक मार्ग प्रदान करता है। मोइ परतों द्वारा सक्षम की गई सशर्त गणना गणनात्मक संसाधनों को अधिक कुशलता से वितरित करने की अनुमति देती है, जिससे बड़े और अधिक क्षमता वाले मॉडल को प्रशिक्षित करना संभव हो जाता है। जैसा कि हम अपने एआई प्रणालियों से अधिक मांग करते हैं, मोइ-लैस ट्रांसफॉर्मर जैसे वास्तुकला विभिन्न क्षेत्रों में जटिल, बड़े पैमाने पर कार्यों को संभालने के लिए मानक बन सकते हैं।

मैं पिछले पांच वर्षों से मशीन लर्निंग और डीप लर्निंग की दुनिया में खुद को डूबो रहा हूं। मेरा जुनून और विशेषज्ञता ने मुझे 50 से अधिक विविध सॉफ्टवेयर इंजीनियरिंग परियोजनाओं में योगदान देने के लिए प्रेरित किया है, जिनमें से अधिकांश में एआई/एमएल पर विशेष ध्यान केंद्रित किया गया है। मेरी जारी जिज्ञासा ने मुझे प्राकृतिक भाषा प्रसंस्करण की ओर आकर्षित किया है, जिस क्षेत्र को मैं आगे अन्वेषण करने के लिए उत्सुक हूं।