एआई मॉडल और प्लेटफ़ॉर्म
MoE-LLaVA: विशाल दृश्य-भाषा मॉडल के लिए विशेषज्ञों का मिश्रण
विशाल दृश्य-भाषा मॉडल (LVLMs) में हाल की प्रगति ने दिखाया है कि इन फ्रेमवर्क को महत्वपूर्ण रूप से बढ़ाने से विभिन्न डाउनस्ट्रीम कार्यों में प्रदर्शन में काफी वृद्धि होती है। LVLMs, जिनमें MiniGPT, LLaMA, और अन्य शामिल हैं, ने अपने आर्किटेक्चर में दृश्य प्रोजेक्शन परतों और एक छवि एनकोडर को शामिल करके उल्लेखनीय क्षमताएं हासिल की हैं। बड़े भाषा मॉडल (LLMs) की दृश्य धारण क्षमताओं को बढ़ाने के लिए इन घटकों को लागू किया जाता है। प्रदर्शन को और बढ़ाया जा सकता है मॉडल के आकार और पैरामीटर की संख्या को बढ़ाकर, साथ ही डेटासेट के आकार का विस्तार करके।
मॉडल जैसे InternVL ने अपने छवि एनकोडर को 6 अरब पैरामीटर से अधिक तक बढ़ाया है, जबकि अन्य ने LVLMs के बैकएंड को 13 अरब पैरामीटर तक बढ़ाया है, जिससे विभिन्न कार्यों पर उत्कृष्ट प्रदर्शन हासिल हुआ है। IDEFICS ने 80 अरब पैरामीटर से अधिक के साथ एक LVLM प्रशिक्षित किया है। इन स्केलिंग विधियों ने 34 अरब, 70 अरब या यहां तक कि 100 अरब पैरामीटर पर पूर्व-प्रशिक्षित LLMs के प्रदर्शन को मेल खाया है या उससे अधिक हासिल किया है। हालांकि, स्केलिंग का एक नकारात्मक पक्ष है: यह प्रशिक्षण और अनुमान लागत को काफी बढ़ा देता है। यह इसलिए है क्योंकि यह प्रत्येक टोकन की गणना के लिए सभी पैरामीटर को सक्रिय करने की आवश्यकता है, जिससे उच्च गणना आवश्यकता और, परिणामस्वरूप, उच्च लागत होती है।
इस लेख में हम MoE-LLaVA पर चर्चा करेंगे, जो एक मिश्रण ऑफ एक्सपर्ट (MoE) आधारित स्पार्स LVLM आर्किटेक्चर है जो LVLMs के लिए एक प्रभावी प्रशिक्षण रणनीति, MoE-Tuning का उपयोग करता है। MoE-Tuning नवाचारी रूप से मल्टी-मॉडल स्पार्सिटी लर्निंग में प्रदर्शन ह्रास को संबोधित करता है, जिससे एक मॉडल बनता है जिसमें पैरामीटर की एक बड़ी संख्या होती है लेकिन प्रशिक्षण और अनुमान लागत स्थिर रहती है। MoE-LLaVA आर्किटेक्चर इस तरह से डिज़ाइन किया गया है कि यह केवल शीर्ष-k विशेषज्ञों को तैनाती के दौरान सक्रिय करता है, जबकि शेष विशेषज्ञों को निष्क्रिय रखता है।
हम MoE-LLaVA फ्रेमवर्क का अन्वेषण करेंगे, इसकी तंत्र, विधि, आर्किटेक्चर, और यह अग्रणी छवि और वीडियो पीढ़ी फ्रेमवर्क के साथ कैसे तुलना करता है।
MoE-LLaVA: विशाल दृश्य-भाषा मॉडल को सस्ते में स्केल करना
विशाल दृश्य-भाषा मॉडल भी दृश्य प्रोजेक्शन परतों और छवि एनकोडर का लाभ उठाते हुए मॉडल के आकार को बढ़ाकर प्रदर्शन में सुधार करते हैं। कुछ उल्लेखनीय उदाहरण जो इस दृष्टिकोण का पालन करते हैं वे हैं MiniGPT-4, InternGPT, InternVL, और अन्य। वास्तविक दुनिया के अनुप्रयोगों में, एक बड़े भाषा मॉडल या एक बड़े दृश्य-भाषा मॉडल को उच्च गुणवत्ता वाले प्रशिक्षण डेटा के साथ स्केल करना अक्सर मॉडल के प्रदर्शन में सुधार करने के लिए आवश्यक होता है। हालांकि, मॉडल के आकार को बढ़ाने से प्रदर्शन में सुधार होता है, लेकिन यह प्रशिक्षण और तैनाती की लागत को भी बढ़ाता है, और समांतर उपकरणों पर मॉडल को तैनात करने में जटिलता और कुशलता को बढ़ाता है। एक मुख्य कारण जो प्रशिक्षण और अनुमान लागत के साथ-साथ गणना आवश्यकताओं में वृद्धि के पीछे है, वह यह है कि फ्रेमवर्क में प्रत्येक टोकन को मॉडल के भीतर हर एक पैरामीटर के साथ गणना की आवश्यकता होती है, जिसे घने मॉडल के रूप में जाना जाता है।
दूसरी ओर, स्पार्स MoE या मिश्रण ऑफ एक्सपर्ट मॉडल ने फ्रेमवर्क को स्केल करने के लिए डेटा को निश्चित सक्रिय पैरामीटर के साथ प्रोसेस करने का एक प्रभावी तरीका दिखाया है, जो प्राकृतिक भाषा प्रसंस्करण क्षेत्र में व्यापक रूप से अपनाया गया है। हालांकि, स्पार्स लार्ज विजन-भाषा मॉडल को सीधे मिश्रण ऑफ एक्सपर्ट का उपयोग करके प्रशिक्षित करना चुनौतीपूर्ण है क्योंकि LLMs को LVLMs में परिवर्तित करना और एक ही समय में मॉडल को स्पार्स करने से महत्वपूर्ण प्रदर्शन ह्रास होता है। MoE-LLaVA फ्रेमवर्क MoE-Tuning की शुरुआत करता है, जो एक सरल लेकिन प्रभावी तीन चरणों वाली प्रशिक्षण रणनीति है।

उपरोक्त चित्र में दिखाया गया है, MoE-Tuning प्रक्रिया पहले चरण में एक MLP या मल्टीलेयर परसेप्ट्रॉन को प्रशिक्षित करती है जो दृश्य टोकन को एक बड़े भाषा मॉडल में अनुकूलित करती है। फ्रेमवर्क तब पूरे LLM पैरामीटर को प्रशिक्षित करता है ताकि बड़े दृश्य-भाषा मॉडल को सामान्य बहु-मोडल समझ क्षमताओं से सशक्त बनाया जा सके। अंत में, तीसरे चरण में, फ्रेमवर्क विशेषज्ञों के लिए प्रारंभिक वजन के रूप में FFN या फीड फॉरवर्ड नेटवर्क की प्रतिलिपि बनाता है और केवल मिश्रण ऑफ एक्सपर्ट परतों को प्रशिक्षित करता है। समग्र प्रशिक्षण प्रक्रिया स्पार्स मॉडल को LVLM प्रारंभिकरण से स्पार्स मिश्रण ऑफ एक्सपर्ट मॉडल में क्रमिक रूप से परिवर्तित करने में मदद करती है।
प्रशिक्षण प्रक्रिया को कवर करने के साथ, आइए MoE-LLaVA पर कुछ प्रकाश डालें, जो मिश्रण ऑफ एक्सपर्ट मॉडल के साथ बड़े दृश्य-भाषा मॉडल के लिए एक बेसलाइन है जो सीखने योग्य राउटर और MoE मॉडल को एकीकृत करता है। MoE-LLaVA मॉडल का मूल में कई स्पार्स पथ होते हैं, और फ्रेमवर्क इन पथों का उपयोग प्रत्येक टोकन को विभिन्न विशेषज्ञों को सीखने योग्य राउटर के माध्यम से भेजने के लिए करता है। टोकन तब सक्रिय विशेषज्ञों द्वारा सामूहिक रूप से संसाधित किए जाते हैं जबकि निष्क्रिय पथों को शांत रखा जाता है। फ्रेमवर्क तब मिश्रण ऑफ एक्सपर्ट एनकोडर परतों को पुनरावृत्ति रूप से ढेर करता है ताकि एक बड़े और अधिक शक्तिशाली LVLM की ओर एक स्पार्स पथ प्रदान किया जा सके।

MoE-LLaVA फ्रेमवर्क द्वारा लागू की गई दृष्टिकोण के कारण, यह समान संख्या में सक्रिय पैरामीटर वाले मॉडल को पार करने में सक्षम है, और POPE ऑब्जेक्ट हॉलुसिनेशन बेंचमार्क पर एक बड़े अंतर से उन्हें पार करता है,尽管 यह केवल 2.2 अरब पैरामीटर है। इसके अलावा, 2.2 अरब पैरामीटर वाला MoE-LLaVA फ्रेमवर्क InternVL-Chat-19B फ्रेमवर्क के साथ तुलनीय प्रदर्शन प्राप्त करने में सक्षम है, जिसमें लगभग 8 गुना अधिक सक्रिय पैरामीटर हैं।
शक्तिशाली बड़े भाषा मॉडल जो मजबूत सामान्यीकरण और निर्देश अनुसरण क्षमताओं के साथ लागू किए गए हैं, उन्हें बड़े दृश्य-भाषा मॉडल में लागू किया गया है। प्रारंभिक LLMs जैसे BLIP ने दृश्य संकेतों को एक दृश्य टोकन की श्रृंखला में एनकोड किया, जिससे उन्हें कई प्रोजेक्शन परतों का उपयोग करके दृष्टि को LLMs में सफलतापूर्वक अनुकूलित किया जा सका। एक ही समय में, हाल के कार्यों पर ध्यान केंद्रित किया गया है मॉडल के प्रदर्शन में सुधार करने के लिए विधियों को लागू करने पर, जैसे कि निर्देश-ट्यूनिंग डेटासेट का विस्तार करना, छवि के रिज़ॉल्यूशन को बढ़ाना, प्रशिक्षण रणनीतियों को अनुकूलित करना, इनपुट को संरेखित करना, छवि एनकोडर को बढ़ाना, और बहुत कुछ। इन दृष्टिकोणों ने LVLMs को शक्तिशाली दृश्य समझ क्षमताओं से सशक्त बनाने में मदद की है दृश्य निर्देश फ़ाइन-ट्यूनिंग डेटासेट और मॉडल स्केल का विस्तार करके। इसके अलावा, कुछ LVLMs में फ़ाइन-ग्रेन्ड इमेज समझ क्षमताएं भी होती हैं, जैसे कि क्षेत्र और बहु-क्षेत्र समझ, साथ ही पिक्सेल-वार ग्राउंडिंग क्षमताएं। हालांकि, घने दृश्य डेटा और मॉडल को स्केल करने के साथ जुड़ी गणना लागत अक्सर बहुत अधिक होती है, जो इसे चुनौतीपूर्ण बना देती है। दूसरी ओर, MoE-LLaVA फ्रेमवर्क LVLM अनुसंधान को अधिक किफायती बनाने का लक्ष्य रखता है MoE मॉडल की क्षमताओं का लाभ उठाकर।
MoE-LLaVA : विधि और आर्किटेक्चर
MoE-LLaVA फ्रेमवर्क का मूल एक दृश्य प्रोजेक्शन परत (मल्टीलेयर परसेप्ट्रॉन), एक दृश्य एनकोडर, MoE ब्लॉक, कई ढेर किए गए LLM ब्लॉक, और एक शब्द एम्बेडिंग परत से बना है।

आर्किटेक्चर
निम्नलिखित तालिका MoE-LLaVA फ्रेमवर्क के विस्तृत कॉन्फ़िगरेशन को सारांशित करती है।

एक दिए गए RGB छवि के लिए, दृश्य एनकोडर छवियों को संसाधित करता है ताकि दृश्य टोकन की एक श्रृंखला प्राप्त की जा सके, और दृश्य प्रोजेक्शन परत दृश्य टोकन श्रृंखला को इनपुट छवियों में मैप करती है। टेक्स्ट इनपुट को शब्द एम्बेडिंग परत द्वारा संसाधित किया जाता है जो इसे टोकन श्रृंखला में परिवर्तित करती है। एक ही समय में, MoE-LLaVA फ्रेमवर्क टेक्स्ट और दृश्य टोकन को एक साथ जोड़ता है और उन्हें LLM में फीड करता है। हालांकि, फ्रेमवर्क केवल दृश्य प्रोजेक्शन परत को बड़े भाषा मॉडल के साथ प्रशिक्षित करता है, जिसमें FFN या फीड फॉरवर्ड न्यूरल नेटवर्क और मल्टी-हेड स्व-ध्यान परतें शामिल हैं। अंत में, फ्रेमवर्क प्रत्येक ब्लॉक में अवशेष कनेक्शन और परत सामान्यीकरण लागू करता है।
आगे बढ़ते हुए, MoE-LLaVA फ्रेमवर्क दूसरे चरण से FFN या फीड फॉरवर्ड न्यूरल नेटवर्क की प्रतिलिपि बनाता है ताकि विशेषज्ञों के लिए प्रारंभिक वजन के रूप में एक एन्सेम्बल बनाया जा सके। राउटर, जो एक रैखिक परत है, प्रत्येक टोकन को प्रत्येक विशेषज्ञ के लिए संभाव्यता की भविष्यवाणी करता है। प्रत्येक टोकन को अधिकतम संभाव्यता वाले शीर्ष-k विशेषज्ञों द्वारा संसाधित किया जाता है, और संभाव्यता के सॉफ्टमैक्स परिणाम के आधार पर भारित योग की गणना की जाती है।
MoE-Tuning
MoE-Tuning एक सरल लेकिन प्रभावी तीन चरणों वाली प्रशिक्षण रणनीति है जो पहले चरण में एक MLP या मल्टीलेयर परसेप्ट्रॉन को प्रशिक्षित करती है जो दृश्य टोकन को एक बड़े भाषा मॉडल में अनुकूलित करती है। फ्रेमवर्क तब पूरे LLM पैरामीटर को प्रशिक्षित करता है ताकि बड़े दृश्य-भाषा मॉडल को सामान्य बहु-मोडल समझ क्षमताओं से सशक्त बनाया जा सके। अंत में, तीसरे चरण में, फ्रेमवर्क विशेषज्ञों के लिए प्रारंभिक वजन के रूप में FFN या फीड फॉरवर्ड नेटवर्क की प्रतिलिपि बनाता है और केवल मिश्रण ऑफ एक्सपर्ट परतों को प्रशिक्षित करता है।
चरण 1
पहले चरण में, प्राथमिक उद्देश्य छवि टोकन को बड़े भाषा मॉडल में अनुकूलित करना है ताकि LLM छवि में उदाहरणों को समझ सके। MoE-LLaVA फ्रेमवर्क एक मल्टीलेयर परसेप्ट्रॉन का उपयोग करता है जो छवि टोकन को बड़े भाषा मॉडल के इनपुट डोमेन में परिवर्तित करता है, और छवि पैच को पseudo-टेक्स्ट टोकन के रूप में मानता है। इस चरण में, MoE-LLaVA फ्रेमवर्क LLM को छवियों का वर्णन करने के लिए प्रशिक्षित करता है, और इस चरण के दौरान LLM में MoE परतों को लागू नहीं करता है।
चरण 2
दूसरे चरण में, MoE-LLaVA फ्रेमवर्क फ्रेमवर्क की क्षमताओं और नियंत्रणीयता को बढ़ाने का प्रयास करता है बहु-मोडल निर्देश डेटा के साथ मॉडल को ट्यून करने के द्वारा। MoE-LLaVA फ्रेमवर्क इसे प्राप्त करने के लिए LLM को एक LVLM में परिवर्तित करता है जिसमें बहु-मोडल समझ क्षमताएं हैं। फ्रेमवर्क अधिक जटिल निर्देशों का उपयोग करता है, जिनमें टेक्स्ट पहचान और तर्कसंगत छवि तर्क कार्य शामिल हैं, जिन्हें मॉडल को मजबूत बहु-मोडल क्षमताओं की आवश्यकता होती है। पारंपरिक रूप से, घने मॉडल के लिए प्रशिक्षण प्रक्रिया इस चरण के बाद पूरी मानी जाती है। हालांकि, MoE-LLaVA फ्रेमवर्क को LLM को एक ही समय में LVLM में परिवर्तित करने और इसे स्पार्स करने में चुनौतियों का सामना करना पड़ा। इस चुनौती का सामना करने के लिए, फ्रेमवर्क अगले चरण में प्रारंभिकरण के लिए इस चरण से वजन का उपयोग करता है, जिससे स्पार्स मॉडल की शिक्षा कठिनाई को कम करने का प्रयास किया जाता है।
चरण 3
तीसरे चरण में, मॉडल विशेषज्ञों के लिए प्रारंभिक वजन के रूप में फीड फॉरवर्ड न्यूरल नेटवर्क की प्रतिलिपि बनाता है। फ्रेमवर्क तब टेक्स्ट और दृश्य टोकन को मिश्रण ऑफ एक्सपर्ट परतों में फीड करता है, जिसके बाद राउटर प्रत्येक टोकन और विशेषज्ञ के बीच मेल खाने वाले वजन की गणना करता है। प्रत्येक टोकन को अधिकतम संभाव्यता वाले शीर्ष-k विशेषज्ञों द्वारा संसाधित किया जाता है, और संभाव्यता के सॉफ्टमैक्स परिणाम के आधार पर भारित योग की गणना की जाती है। एक बार शीर्ष-k विशेषज्ञ सक्रिय हो जाने के बाद, मॉडल शेष विशेषज्ञों को बंद कर देता है, जिससे MoE-LLaVA फ्रेमवर्क को अनंत संभावित स्पार्स पथों से सुसज्जित किया जाता है, जिससे मॉडल को व्यापक क्षमताओं का उपयोग करने में सक्षम बनाया जाता है।
MoE-LLaVA : परिणाम और प्रयोग
MoE-LLaVA फ्रेमवर्क CLIP-Large को दृश्य एनकोडर के रूप में अपनाता है, जिसमें दो परतों वाला एक मल्टीलेयर परसेप्ट्रॉन होता है, जिसमें दो परतों के बीच एक GELU सक्रियण परत होती है। डिफ़ॉल्ट रूप से, फ्रेमवर्क फीड फॉरवर्ड न्यूरल नेटवर्क को मिश्रण ऑफ एक्सपर्ट परतों के साथ वैकल्पिक रूप से बदलता है, जिसका अर्थ है कि मिश्रण ऑफ एक्सपर्ट परतें कुल परतों की संख्या का 50% हिस्सा हैं। निम्नलिखित तालिका में विभिन्न डेटासेट और उनके नमूना आकार शामिल हैं जिनका उपयोग MoE-LLaVA फ्रेमवर्क को प्रशिक्षित करने और मूल्यांकन करने के लिए किया गया है।

शून्य-शॉट छवि प्रश्न उत्तर देना
निम्नलिखित चित्र से पता चलता है कि MoE-LLaVA एक स्पार्स मॉडल है जिसमें एक नरम राउटर है जो LVLM पर आधारित है। फ्रेमवर्क का मूल्यांकन 5 छवि प्रश्न उत्तर देने वाले बेंचमार्क पर किया जाता है, और जैसा कि देखा जा सकता है, MoE-LLaVA फ्रेमवर्क उल्लेखनीय छवि समझ क्षमता प्रदर्शित करता है, और पांच अलग-अलग बेंचमार्क पर LLaVA 1.5 फ्रेमवर्क के समान प्रदर्शन प्रदान करता है।

वस्तु हॉलुसिनेशन मूल्यांकन
वस्तु हॉलुसिनेशन का मूल्यांकन करने के लिए, MoE-LLaVA फ्रेमवर्क POPE मूल्यांकन पाइपलाइन को अपनाता है, जो एक पोलिंग-आधारित प्रश्न विधि है, और परिणाम निम्नलिखित तालिका में दिखाए गए हैं। जैसा कि देखा जा सकता है, सभी फ्रेमवर्क में से, MoE-LLaVA सबसे मजबूत परिणाम प्रदान करता है, जो फ्रेमवर्क की क्षमता को दर्शाता है कि यह इनपुट छवि के साथ संगत वस्तुओं का उत्पादन कर सकता है। इसके अलावा, यह ध्यान देने योग्य है कि MoE-LLaVA फ्रेमवर्क हां अनुपात को अच्छी तरह से संतुलित करता है, जो स्पार्स मॉडल की क्षमता को दर्शाता है कि यह दिए गए प्रश्न के लिए सटीक प्रतिक्रिया प्रदान कर सकता है।

निम्नलिखित छवि में विशेषज्ञ लोडिंग का वितरण दिखाया गया है, जहां असतत रेखाएं मॉडलिटी या विशेषज्ञों के बीच टोकनों के एक अच्छी तरह से संतुलित वितरण का प्रतिनिधित्व करती हैं। पहली छवि विशेषज्ञों के भीतर कार्यभार को दर्शाती है, जबकि शेष छवियां विभिन्न मॉडलिटी के प्रति विशेषज्ञों के प्रदर्शन को प्रदर्शित करती हैं।

इसके अलावा, निम्नलिखित छवि विभिन्न विशेषज्ञों में मॉडलिटी के वितरण को दर्शाती है।

अंतिम विचार
इस लेख में, हमने MoE-LLaVA पर चर्चा की है, जो मिश्रण ऑफ एक्सपर्ट मॉडल के साथ बड़े दृश्य-भाषा मॉडल के लिए एक बेसलाइन है जो सीखने योग्य राउटर और MoE मॉडल को एकीकृत करता है। MoE-LLaVA मॉडल का मूल में कई स्पार्स पथ होते हैं, और फ्रेमवर्क इन पथों का उपयोग प्रत्येक टोकन को विभिन्न विशेषज्ञों को सीखने योग्य राउटर के माध्यम से भेजने के लिए करता है। टोकन तब सक्रिय विशेषज्ञों द्वारा सामूहिक रूप से संसाधित किए जाते हैं जबकि निष्क्रिय पथों को शांत रखा जाता है। फ्रेमवर्क तब मिश्रण ऑफ एक्सपर्ट एनकोडर परतों को पुनरावृत्ति रूप से ढेर करता है ताकि एक बड़े और अधिक शक्तिशाली LVLM की ओर एक स्पार्स पथ प्रदान किया जा सके। MoE-Tuning रणनीति मल्टी-मोडल स्पार्सिटी लर्निंग में प्रदर्शन ह्रास को नवाचारी रूप से संबोधित करती है, जिससे एक मॉडल बनता है जिसमें पैरामीटर की एक बड़ी संख्या होती है लेकिन प्रशिक्षण और अनुमान लागत स्थिर रहती है। MoE-LLaVA फ्रेमवर्क की आर्किटेक्चर इस तरह से डिज़ाइन की गई है कि यह केवल शीर्ष-k विशेषज्ञों को तैनाती के दौरान सक्रिय करता है, जबकि शेष विशेषज्ञों को निष्क्रिय रखता है।












