एआई मॉडल और प्लेटफ़ॉर्म

यूनी-मोइ: मिक्स्चर ऑफ एक्सपर्ट्स के साथ यूनिफाइड मल्टीमॉडल एलएलएम्स को स्केल करना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

हाल के वर्षों में, मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (एमएलएलएम) की वास्तुकला और प्रदर्शन में हुए हाल के उन्नति ने स्केलेबल डेटा और मॉडल्स के महत्व को प्रदर्शित किया है ताकि प्रदर्शन में सुधार किया जा सके। हालांकि यह दृष्टिकोण प्रदर्शन में महत्वपूर्ण परिणाम देता है, यह गणनात्मक लागतें भी बढ़ाता है जो इस तरह के दृष्टिकोण की व्यावहारिकता और उपयोगिता को सीमित करता है। वर्षों से, मिक्स्चर ऑफ एक्सपर्ट (मोइ) मॉडल्स ने एक सफल विकल्प के रूप में उभरा है जो छवि-पाठ और बड़े भाषा मॉडल्स को कुशलता से स्केल करने के लिए है, क्योंकि मिक्स्चर ऑफ एक्सपर्ट मॉडल्स में महत्वपूर्ण रूप से कम गणनात्मक लागतें होती हैं और मजबूत प्रदर्शन होता है। हालांकि, उनके फायदों के बावजूद, मिक्स्चर ऑफ मॉडल्स बड़े भाषा मॉडल्स को स्केल करने के लिए आदर्श दृष्टिकोण नहीं हैं, क्योंकि वे अक्सर कम विशेषज्ञों और सीमित मोडलिटी को शामिल करते हैं, जिससे अनुप्रयोग सीमित हो जाते हैं।

वर्तमान दृष्टिकोणों द्वारा सामना की जाने वाली बाधाओं का मुकाबला करने और बड़े भाषा मॉडल्स को कुशलता से स्केल करने के लिए, इस लेख में, हम यूनी-मोइ के बारे में बात करेंगे, जो एक मिक्स्चर ऑफ एक्सपर्ट वास्तुकला के साथ एक एकीकृत मल्टीमॉडल बड़ा भाषा मॉडल है जो विभिन्न मोडलिटी और विशेषज्ञों को संभालने में सक्षम है। यूनी-मोइ फ्रेमवर्क बड़े भाषा मॉडल्स में एक स्पार्स मिक्स्चर ऑफ एक्सपर्ट वास्तुकला को लागू करने का भी प्रयास करता है ताकि प्रशिक्षण और अनुमान प्रक्रिया को अधिक कुशल बनाने के लिए विशेषज्ञ-स्तर के मॉडल समानांतर और डेटा समानांतर का उपयोग किया जा सके। इसके अलावा, सामान्यीकरण और बहु-विशेषज्ञ सहयोग को बढ़ाने के लिए, यूनी-मोइ फ्रेमवर्क एक प्रगतिशील प्रशिक्षण रणनीति प्रस्तुत करता है जो तीन अलग-अलग प्रक्रियाओं का संयोजन है। पहले, यूनी-मोइ फ्रेमवर्क विभिन्न कनेक्टर्स के साथ विभिन्न क्रॉस-मोडलिटी डेटा का उपयोग करके क्रॉस-मोडलिटी संरेखण प्राप्त करता है। दूसरा, यूनी-मोइ फ्रेमवर्क क्रॉस-मोडलिटी निर्देश डेटा के साथ मोडलिटी-विशिष्ट विशेषज्ञों को प्रशिक्षित करके विशेषज्ञ घटकों की प्राथमिकता को सक्रिय करता है। अंत में, यूनी-मोइ मॉडल मिश्रित मल्टीमॉडल निर्देश डेटा पर लो-रैंक एडाप्टेशन लर्निंग तकनीक या लोरा को लागू करके मॉडल को ट्यून करता है। जब निर्देश-ट्यून किए गए यूनी-मोइ फ्रेमवर्क का मूल्यांकन एक व्यापक सेट मल्टीमॉडल डेटासेट पर किया गया, तो व्यापक प्रयोगात्मक परिणामों ने यूनी-मोइ फ्रेमवर्क के मुख्य लाभ को मिश्रित मल्टीमॉडल डेटासेट को संभालने में महत्वपूर्ण रूप से प्रदर्शन पूर्वाग्रह को कम करने में प्रदर्शित किया। परिणामों ने बहु-विशेषज्ञ सहयोग और सामान्यीकरण में भी महत्वपूर्ण सुधार का संकेत दिया।

यह लेख यूनी-मोइ फ्रेमवर्क को गहराई से कवर करने का उद्देश्य रखता है, और हम फ्रेमवर्क की तंत्र, विधि, वास्तुकला का अन्वेषण करते हैं साथ ही साथ राज्य के साथ इसकी तुलना भी करते हैं। तो आइए शुरू करें।

यूनी-मोइ: स्केलिंग यूनिफाइड मल्टीमॉडल एलएलएम्स

पिछले कुछ वर्षों में, एलएलएमा और इंस्टेंटब्लिप जैसे ओपन-सोर्स मल्टीमॉडल बड़े भाषा मॉडल्स ने छवि-पाठ समझने से संबंधित कार्यों में उल्लेखनीय सफलता और प्रगति को रेखांकित किया है। इसके अलावा, एआई समुदाय एक एकीकृत मल्टीमॉडल बड़ा भाषा मॉडल बनाने की दिशा में काम कर रहा है जो छवि, पाठ, ऑडियो, वीडियो और अधिक जैसी विभिन्न मोडलिटी को समाहित कर सकता है, पारंपरिक छवि-पाठ परिदृश्य से परे। मल्टीमॉडल बड़े भाषा मॉडल्स की क्षमताओं को बढ़ाने के लिए ओपन-सोर्स समुदाय द्वारा अपनाई जाने वाली एक सामान्य दृष्टि दृष्टिकोण है दृश्य फाउंडेशन मॉडल्स के आकार को बढ़ाना, इसे बड़े भाषा मॉडल्स के साथ एकीकृत करना जिसमें अरबों पैरामीटर होते हैं, और विभिन्न मल्टीमॉडल डेटासेट का उपयोग करके निर्देश ट्यूनिंग को बढ़ाना। इन विकासों ने मल्टीमॉडल बड़े भाषा मॉडल्स की मल्टीमॉडल निर्देश डेटा और मॉडल स्केलेबिलिटी को विस्तारित करने की क्षमता को प्रदर्शित किया है।

हालांकि मॉडल को स्केल करना एक परीक्षण किया गया दृष्टिकोण है जो महत्वपूर्ण परिणाम देता है, मॉडल को स्केल करना प्रशिक्षण और अनुमान प्रक्रिया दोनों के लिए गणनात्मक रूप से महंगा है।

उच्च ओवरहेड गणनात्मक लागत के मुद्दे का मुकाबला करने के लिए, ओपन-सोर्स समुदाय बड़े भाषा मॉडल्स में मिक्स्चर ऑफ एक्सपर्ट (मोइ) मॉडल वास्तुकला को एकीकृत करने की दिशा में बढ़ रहा है ताकि प्रशिक्षण और अनुमान दोनों की दक्षता में सुधार किया जा सके। मिक्स्चर ऑफ एक्सपर्ट वास्तुकला के विपरीत, जो प्रत्येक इनपुट को संसाधित करने के लिए सभी उपलब्ध पैरामीटर का उपयोग करती है, मिक्स्चर ऑफ एक्सपर्ट दृष्टिकोण केवल एक इनपुट के लिए विशेषज्ञ पैरामीटर के एक उपसेट को सक्रिय करने की आवश्यकता होती है। परिणामस्वरूप, मिक्स्चर ऑफ एक्सपर्ट दृष्टिकोण बड़े मॉडल्स की दक्षता में सुधार के लिए एक व्यवहार्य मार्ग के रूप में उभरता है जिसमें व्यापक पैरामीटर सक्रियण और उच्च ओवरहेड गणनात्मक लागत नहीं होती है। हालांकि मौजूदा कार्यों ने पाठ-केवल और पाठ-छवि बड़े मॉडल्स के निर्माण में मिक्स्चर ऑफ एक्सपर्ट मॉडल्स के सफल एकीकरण को उजागर किया है, शोधकर्ता अभी तक एकीकृत मल्टीमॉडल बड़े भाषा मॉडल्स के निर्माण के लिए मिक्स्चर ऑफ एक्सपर्ट वास्तुकला की क्षमता का पूरी तरह से अन्वेषण नहीं कर पाए हैं।

यूनी-मोइ एक मल्टीमॉडल बड़ा भाषा मॉडल है जो विभिन्न मोडलिटी और विशेषज्ञों को संभालने का प्रयास करने के लिए स्पार्स मिक्स्चर ऑफ एक्सपर्ट मॉडल्स का लाभ उठाता है। जैसा कि निम्नलिखित छवि में दिखाया गया है, यूनी-मोइ फ्रेमवर्क पहले विभिन्न मोडलिटी के लिए मोडलिटी-विशिष्ट एनकोडर्स का उपयोग करके एनकोडिंग प्राप्त करता है, और फिर इन एनकोडिंग को बड़े भाषा मॉडल्स की भाषा प्रतिनिधित्व स्थान में विभिन्न डिज़ाइन किए गए कनेक्टर्स का उपयोग करके मैप करता है। ये कनेक्टर्स एक प्रशिक्षण योग्य ट्रांसफॉर्मर मॉडल के साथ-साथ आउटपुट प्रतिनिधित्व को परिष्कृत और प्रोजेक्ट करने के लिए रैखिक प्रोजेक्शन के साथ आते हैं। यूनी-मोइ फ्रेमवर्क तब घने बड़े भाषा मॉडल के आंतरिक ब्लॉक के भीतर मिक्स्चर ऑफ एक्सपर्ट परतों को एकीकृत करता है। इसके परिणामस्वरूप, प्रत्येक मिक्स्चर ऑफ एक्सपर्ट-आधारित ब्लॉक में एक साझा स्व-ध्यान परत होती है जो सभी मोडलिटी में लागू होती है, एक स्पार्स राउटर जो टोकन स्तर पर विशेषज्ञता के आवंटन के लिए है, और विभिन्न विशेषज्ञ फीडफॉरवर्ड नेटवर्क पर आधारित होते हैं। इस दृष्टिकोण के कारण, यूनी-मोइ फ्रेमवर्क भाषण, ऑडियो, पाठ, वीडियो, छवि जैसी कई मोडलिटी को समझने में सक्षम है और केवल आंशिक पैरामीटर को सक्रिय करने की आवश्यकता होती है अनुमान के दौरान।

इसके अलावा, बहु-विशेषज्ञ सहयोग और सामान्यीकरण को बढ़ाने के लिए, यूनी-मोइ फ्रेमवर्क एक तीन-चरण प्रशिक्षण रणनीति को लागू करता है। पहले चरण में, फ्रेमवर्क विभिन्न छवि/ऑडियो/भाषण से पाठ जोड़े का उपयोग करके संबंधित कनेक्टर को प्रशिक्षित करता है क्योंकि बड़े भाषा मॉडल की भाषा स्थान में एकीकृत मोडलिटी प्रतिनिधित्व है। दूसरे, यूनी-मोइ मॉडल क्रॉस-मोडलिटी डेटासेट का उपयोग करके मोडलिटी-विशिष्ट विशेषज्ञों को प्रशिक्षित करता है ताकि प्रत्येक विशेषज्ञ की क्षमता को उसके संबंधित डोमेन में परिष्कृत किया जा सके। तीसरे चरण में, यूनी-मोइ फ्रेमवर्क इन प्रशिक्षित विशेषज्ञों को मिक्स्चर ऑफ एक्सपर्ट परत में एकीकृत करता है और पूरे यूनी-मोइ फ्रेमवर्क को मिश्रित मल्टीमॉडल निर्देश डेटा के साथ प्रशिक्षित करता है। प्रशिक्षण लागत को और कम करने के लिए, यूनी-मोइ फ्रेमवर्क स्व-ध्यान परतों और पूर्व-ट्यून किए गए विशेषज्ञों को फाइन-ट्यून करने के लिए लोरा लर्निंग दृष्टिकोण को नियोजित करता है।

यूनी-मोइ: विधि और वास्तुकला

यूनी-मोइ फ्रेमवर्क के पीछे का मूल प्रेरणा मल्टीमॉडल बड़े भाषा मॉडल्स को स्केल करने और मिक्स्चर ऑफ एक्सपर्ट मॉडल्स की दक्षता के बीच है। निम्नलिखित आंकड़ा यूनी-मोइ फ्रेमवर्क में लागू की गई वास्तुकला का प्रतिनिधित्व करता है, जिसमें विभिन्न मोडलिटी के लिए व्यक्तिगत एनकोडर्स और उनके संबंधित मोडलिटी कनेक्टर्स शामिल हैं।

यूनी-मोइ फ्रेमवर्क तब मिक्स्चर ऑफ एक्सपर्ट वास्तुकला को बड़े भाषा मॉडल ब्लॉक्स के साथ एकीकृत करता है, जो प्रशिक्षण और अनुमान प्रक्रिया दोनों की कुल दक्षता में सुधार करने के लिए एक महत्वपूर्ण प्रक्रिया है। यूनी-मोइ फ्रेमवर्क की प्रशिक्षण प्रक्रिया को तीन चरणों में विभाजित किया जा सकता है: क्रॉस-मोडलिटी संरेखण, मोडलिटी-विशिष्ट विशेषज्ञों को प्रशिक्षित करना, और यूनी-मोइ को विविध मल्टीमॉडल निर्देश डेटासेट के साथ ट्यून करना। विभिन्न मोडल इनपुट को एक लिंग्विस्टिक प्रारूप में परिवर्तित करने के लिए, यूनी-मोइ फ्रेमवर्क एलएलएवीए पर आधारित है, एक पूर्व-प्रशिक्षित दृश्य-भाषा फ्रेमवर्क। एलएलएवीए बेस मॉडल में सीएलआईपी को इसके दृश्य एनकोडर के रूप में एकीकृत करता है, साथ ही एक रैखिक प्रोजेक्शन परत जो छवि विशेषताओं को उनके संबंधित नरम छवि टोकन में परिवर्तित करती है। इसके अलावा, वीडियो सामग्री को संसाधित करने के लिए, यूनी-मोइ फ्रेमवर्क प्रत्येक वीडियो से आठ प्रतिनिधि फ्रेम्स का चयन करता है और उन्हें वीडियो टोकन में परिवर्तित करता है ताकि उनके छवि या फ्रेम-आधारित प्रतिनिधित्व को औसत पूलिंग द्वारा एकत्र किया जा सके। ऑडियो कार्यों के लिए, यूनी-मोइ फ्रेमवर्क दो एनकोडर्स, बीट्स और व्हिस्पर एनकोडर को नियोजित करता है ताकि विशेषता निष्कर्षण में सुधार किया जा सके। मॉडल तब ऑडियो विशेषता वेक्टर और निश्चित-लंबाई वाले भाषण को एक रैखिक प्रोजेक्शन परत के माध्यम से भाषण टोकन और नरम ऑडियो में परिवर्तित करता है।

प्रशिक्षण रणनीति

यूनी-मोइ फ्रेमवर्क मॉडल के अनुक्रमिक विकास के लिए एक प्रगतिशील प्रशिक्षण रणनीति प्रस्तुत करता है। प्रगतिशील प्रशिक्षण रणनीति विभिन्न विशेषज्ञों की विशिष्ट क्षमताओं को हार्नेस करने, बहु-विशेषज्ञ सहयोग की दक्षता में सुधार करने और फ्रेमवर्क की कुल सामान्यीकरण को बढ़ाने का प्रयास करती है। प्रशिक्षण प्रक्रिया को तीन चरणों में विभाजित किया जा सकता है जो एकीकृत मिक्स्चर ऑफ एक्सपर्ट्स पर आधारित एमएलएलएम संरचना को वास्तविक बनाने का प्रयास करते हैं।

चरण 1: क्रॉस-मोडलिटी संरेखण

पहले चरण में, यूनी-मोइ फ्रेमवर्क विभिन्न लिंग्विस्टिक्स और मोडलिटी के बीच कनेक्टिविटी स्थापित करने का प्रयास करता है। यूनी-मोइ फ्रेमवर्क विभिन्न कनेक्टर्स का उपयोग करके मोडल डेटा को नरम टोकन में अनुवाद करके ऐसा करता है। पहले प्रशिक्षण चरण का प्राथमिक उद्देश्य जनरेटिव एंट्रोपी हानि को कम करना है। यूनी-मोइ फ्रेमवर्क में, एलएलएम को विभिन्न मोडलिटी के इनपुट के लिए विवरण उत्पन्न करने के लिए अनुकूलित किया जाता है, और मॉडल केवल कनेक्टर्स को प्रशिक्षित करता है, जो यूनी-मोइ फ्रेमवर्क को विभिन्न मोडलिटी को एक एकीकृत भाषा फ्रेमवर्क के भीतर एकीकृत करने में सक्षम बनाता है।

चरण 2: मोडलिटी-विशिष्ट विशेषज्ञों को प्रशिक्षित करना

दूसरे चरण में, यूनी-मोइ फ्रेमवर्क विशिष्ट क्रॉस-मोडलिटी डेटा पर केंद्रित करके एकल मोडलिटी विशेषज्ञों को विकसित करने पर ध्यान केंद्रित करता है। प्राथमिक उद्देश्य प्रत्येक विशेषज्ञ की क्षमता को उसके संबंधित डोमेन में परिष्कृत करना है, जिससे मिक्स्चर ऑफ एक्सपर्ट सिस्टम के कुल प्रदर्शन में सुधार होता है। इसके अलावा, यूनी-मोइ फ्रेमवर्क फीडफॉरवर्ड नेटवर्क को मोडलिटी की विशेषताओं के साथ अधिक संरेखित करने के लिए ट्यून करता है, जबकि जनरेटिव एंट्रोपी हानि को फोकल मेट्रिक प्रशिक्षण के रूप में बनाए रखता है।

चरण 3: यूनी-मोइ को ट्यून करना

तीसरे और अंतिम चरण में, यूनी-मोइ फ्रेमवर्क दूसरे चरण के दौरान विशेषज्ञों द्वारा ट्यून किए गए वजनों को मिक्स्चर ऑफ एक्सपर्ट परतों में एकीकृत करता है। यूनी-मोइ फ्रेमवर्क तब मिश्रित मल्टीमॉडल निर्देश डेटा का उपयोग करके एमएलएलएम को संयुक्त रूप से फाइन-ट्यून करता है। निम्नलिखित छवि में प्रशिक्षण प्रक्रिया की प्रगति को दर्शाने वाले नुकसान की वक्र देखी जा सकती है।

मिक्स्चर ऑफ एक्सपर्ट कॉन्फ़िगरेशन के बीच तुलनात्मक विश्लेषण से पता चला कि दूसरे प्रशिक्षण चरण के दौरान मॉडल द्वारा परिष्कृत विशेषज्ञों ने बेहतर स्थिरता प्रदर्शित की और मिश्रित-मोडल डेटासेट पर तेजी से अभिसरण प्राप्त किया। इसके अलावा, जटिल मल्टीमॉडल डेटा वाले कार्यों में, जिनमें पाठ, छवियां, ऑडियो, वीडियो शामिल हैं, यूनी-मोइ फ्रेमवर्क ने चार विशेषज्ञों का उपयोग करने पर दो विशेषज्ञों का उपयोग करने की तुलना में अधिक सुसंगत प्रशिक्षण प्रदर्शन और कम नुकसान परिवर्तनशीलता प्रदर्शित की।

यूनी-मोइ: प्रयोग और परिणाम

निम्नलिखित तालिका यूनी-मोइ फ्रेमवर्क की वास्तुकला विशिष्टताओं का सारांश प्रस्तुत करती है। यूनी-मोइ फ्रेमवर्क का प्राथमिक उद्देश्य, जो एलएलएएमए-7बी वास्तुकला पर आधारित है, मॉडल के आकार को स्केल करना है।

निम्नलिखित तालिका यूनी-मोइ फ्रेमवर्क के डिज़ाइन और अनुकूलन को विशिष्ट प्रशिक्षण कार्यों द्वारा निर्देशित करती है, जो एमएलपी परतों की क्षमताओं को परिष्कृत करने में महत्वपूर्ण हैं, जिससे उनकी विशेषज्ञ ज्ञान को बेहतर मॉडल प्रदर्शन के लिए उपयोग किया जा सके। यूनी-मोइ फ्रेमवर्क आठ एकल-मोडलिटी विशेषज्ञ कार्यों को अंजाम देता है ताकि विभिन्न प्रशिक्षण विधियों के प्रभावों को स्पष्ट किया जा सके।

मॉडल विभिन्न मॉडल वेरिएंट्स के प्रदर्शन का मूल्यांकन करता है जो दो वीडियो-समझ, तीन ऑडियो-समझ और पांच भाषण-संबंधित कार्यों को शामिल करने वाले बेंचमार्क सेट पर आधारित है। पहले, मॉडल का मूल्यांकन भाषण-छवि और भाषण-पाठ कार्यों पर किया जाता है, और परिणाम निम्नलिखित तालिका में शामिल हैं।

जैसा कि देखा जा सकता है, पिछले बेसलाइन मॉडल्स भाषण समझने वाले कार्यों में निम्न परिणाम प्रस्तुत करते हैं, जो छवि-भाषण तर्क कार्यों पर प्रदर्शन को प्रभावित करता है। परिणाम यह दर्शाते हैं कि मिक्स्चर ऑफ एक्सपर्ट वास्तुकला को पेश करने से एमएलएलएम की सामान्यीकरण में सुधार हो सकता है जो मिश्रित मल्टीमॉडल डेटासेट पर अनदेखे ऑडियो-छवि तर्क कार्यों पर काफी हद तक सुधार कर सकता है। निम्नलिखित तालिका छवि-पाठ समझने वाले कार्यों पर प्रयोगात्मक परिणाम प्रस्तुत करती है। जैसा कि देखा जा सकता है, यूनी-मोइ मॉडल्स के सर्वोत्तम परिणाम बेसलाइन मॉडल्स को पार करते हैं और फाइन-ट्यूनिंग कार्य को औसतन 4 अंकों से पार करते हैं।

अंतिम विचार

इस लेख में, हमने यूनी-मोइ के बारे में बात की है, जो एक मिक्स्चर ऑफ एक्सपर्ट वास्तुकला के साथ एक एकीकृत मल्टीमॉडल बड़ा भाषा मॉडल है जो विभिन्न मोडलिटी और विशेषज्ञों को संभालने में सक्षम है। यूनी-मोइ फ्रेमवर्क बड़े भाषा मॉडल्स में एक स्पार्स मिक्स्चर ऑफ एक्सपर्ट वास्तुकला को लागू करने का भी प्रयास करता है ताकि प्रशिक्षण और अनुमान प्रक्रिया को अधिक कुशल बनाने के लिए विशेषज्ञ-स्तर के मॉडल समानांतर और डेटा समानांतर का उपयोग किया जा सके। इसके अलावा, सामान्यीकरण और बहु-विशेषज्ञ सहयोग को बढ़ाने के लिए, यूनी-मोइ फ्रेमवर्क एक प्रगतिशील प्रशिक्षण रणनीति प्रस्तुत करता है जो तीन अलग-अलग प्रक्रियाओं का संयोजन है। पहले, यूनी-मोइ फ्रेमवर्क विभिन्न कनेक्टर्स के साथ विभिन्न क्रॉस-मोडलिटी डेटा का उपयोग करके क्रॉस-मोडलिटी संरेखण प्राप्त करता है। दूसरा, यूनी-मोइ फ्रेमवर्क क्रॉस-मोडलिटी निर्देश डेटा के साथ मोडलिटी-विशिष्ट विशेषज्ञों को प्रशिक्षित करके विशेषज्ञ घटकों की प्राथमिकता को सक्रिय करता है। अंत में, यूनी-मोइ मॉडल मिश्रित मल्टीमॉडल निर्देश डेटा पर लो-रैंक एडाप्टेशन लर्निंग तकनीक या लोरा को लागू करके मॉडल को ट्यून करता है।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।