एआई मॉडल और प्लेटफ़ॉर्म
ईगल: मिश्रण ऑफ एन्कोडर्स का उपयोग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए डिज़ाइन स्पेस का अन्वेषण
मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (एमएलएलएम) में जटिल दृश्य जानकारी की सटीक व्याख्या करने की क्षमता एक महत्वपूर्ण फोकस है। हाल के शोध से पता चलता है कि बेहतर दृश्य धारणा हॉल्यूसिनेशन को कम करती है और रिज़ॉल्यूशन-संवेदनशील कार्यों जैसे ऑप्टिकल कैरेक्टर रिकॉग्निशन और डॉक्यूमेंट विश्लेषण पर प्रदर्शन में सुधार करती है। कई हाल के एमएलएलएम यह करके प्राप्त करते हैं कि वे दृश्य एनकोडर्स के मिश्रण का उपयोग करते हैं। इसके बावजूद, विशेषज्ञ चयन और कई दृश्य विशेषज्ञों के एकीकरण जैसे महत्वपूर्ण पहलुओं को संबोधित करने वाली विस्तृत अपघटन अध्ययनों और तुलनात्मक तुलनाओं की कमी है। यह लेख मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए डिज़ाइन स्पेस का विस्तृत अन्वेषण प्रदान करता है, जो दृश्य एनकोडर्स और रिज़ॉल्यूशन के मिश्रण का उपयोग करता है, ईगल फ्रेमवर्क जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए डिज़ाइन स्पेस का अन्वेषण करने का प्रयास करता है जिसमें एनकोडर्स का मिश्रण होता है। निष्कर्ष कई मौजूदा रणनीतियों में सामान्य मूल सिद्धांतों को उजागर करते हैं, जिससे एक सुव्यवस्थित लेकिन प्रभावी डिज़ाइन दृष्टिकोण की ओर ले जाता है। ईगल यह पता लगाता है कि विभिन्न दृश्य एनकोडर्स से दृश्य टोकन को सरल रूप से संकेत देना जटिल मिश्रण वास्तुकला या रणनीतियों के रूप में प्रभावी है। इसके अलावा, ईगल प्री-अलाइनमेंट पेश करता है ताकि दृश्य-केंद्रित एनकोडर्स और भाषा टोकन के बीच की खाई को पुल कर सके, मॉडल की सुसंगतता को बढ़ाता है। परिणामी एमएलएलएम परिवार, ईगल, प्रमुख मुक्त स्रोत मॉडलों को प्रमुख एमएलएलएम बेंचमार्क पर पार करता है।
ईगल का काम मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (एमएलएलएम) की सामान्य वास्तुकला डिज़ाइन से संबंधित है। उल्लिखित प्रतिनिधि खुले स्रोत अनुसंधान के अलावा, एमएलएलएम के अन्य उल्लेखनीय परिवारों में शामिल हैं लेकिन सीमित नहीं हैं मिनी-जेमिनी, लिंक्स, ओटर, क्वेनवीएल, कॉगवीएलएम, विला, जीपीटी-4वी, जेमिनी और लामा 3.1। दृश्य संकेतों को भाषा मॉडल में एकीकृत करने के तरीके के आधार पर, एमएलएलएम को व्यापक रूप से “क्रॉस-मॉडल अटेंशन” मॉडल और “प्रीफिक्स-ट्यूनिंग” मॉडल में वर्गीकृत किया जा सकता है। पूर्व दृश्य जानकारी को एलएलएम की विभिन्न परतों में क्रॉस-मॉडल अटेंशन का उपयोग करके इंजेक्ट करता है, जबकि बाद वाला दृश्य टोकन को भाषा टोकन अनुक्रम के हिस्से के रूप में मानता है और उन्हें सीधे पाठ एम्बेडिंग के साथ जोड़ता है। ईगल मॉडल एलएलएवीए-शैली की बहुमोड़ल वास्तुकला का पालन करते हुए प्रीफिक्स-ट्यूनिंग परिवार से संबंधित है। चूंकि एमएलएलएम एक तेजी से बढ़ता क्षेत्र है, ईगल विस्तृत अध्ययन और सर्वेक्षणों के लिए आगे के निर्देशों के लिए संदर्भित करने की सलाह देता है।
ईगल का काम एमएलएलएम के लिए दृश्य एनकोडर डिज़ाइन में सुधार पर शोध से निकटता से संबंधित है। शुरुआती कार्यों ने आमतौर पर विज़न-लैंग्वेज अलाइनमेंट जैसे कार्यों पर पूर्व-प्रशिक्षित दृश्य एनकोडर्स को अपनाया था, जैसे कि सीएलआईपी और ईवीए-सीएलआईपी। सिगलआईपी और इंटरनवीएल जैसे मजबूत दृश्य एनकोडर्स को बेहतर डिज़ाइन, बड़े मॉडल आकार और अधिक प्रभावी प्रशिक्षण नुस्खे के साथ दृश्य-भाषा कार्यों में सुधार करने के लिए प्रस्तावित किया गया है। चूंकि मॉडल अक्सर कम-रिज़ॉल्यूशन छवियों पर पूर्व-प्रशिक्षित होते हैं और विस्तृत विवरण को एन्कोड करने में सक्षम नहीं हो सकते हैं, उच्च रिज़ॉल्यूशन अनुकूलन को अक्सर एमएलएलएम इनपुट रिज़ॉल्यूशन को बढ़ाने के लिए किया जाता है। इसके अलावा, मॉडल जैसे एलएलएवीए-नेक्स्ट, एलएलएवीए-यूएचडी, मंकी, इंटरनएलएम-एक्सकंपोज़र और इंटरनवीएल टाइलिंग या अनुकूली टाइलिंग का उपयोग उच्च-रिज़ॉल्यूशन इनपुट को संभालने के लिए करते हैं, जहां छवियों को कम-रिज़ॉल्यूशन पैच में विभाजित किया जाता है और अलग से संसाधित किया जाता है।
ईगल: मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए डिज़ाइन स्पेस का अन्वेषण करने के लिए एनकोडर्स का मिश्रण
बड़े भाषा मॉडल (एलएलएम) की क्षमता को सटीक रूप से जटिल दृश्य जानकारी की व्याख्या करने में सक्षम करने की क्षमता ने महत्वपूर्ण रुचि पैदा की है। मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (एमएलएलएम) के कोर में, छवियों को दृश्य टोकन में परिवर्तित किया जाता है और पाठ एम्बेडिंग के साथ जोड़ा जाता है। सीएलआईपी अक्सर दृश्य एनकोडर के रूप में चुना जाता है क्योंकि इसका दृश्य प्रतिनिधित्व पाठ स्थान के साथ पूर्व-प्रशिक्षित छवि-पाठ जोड़े पर प्रशिक्षित होने के द्वारा संरेखित होता है।
ईगल का काम उन मॉडलों से संबंधित है जो बेहतर धारणा के लिए एकाधिक दृश्य एनकोडर्स का उपयोग करते हैं। मिनी-जेमिनी और एलएलएवीए-एचआर उच्च-रिज़ॉल्यूशन दृश्य विशेषताओं को कम-रिज़ॉल्यूशन दृश्य टोकन में मिलाने का प्रस्ताव करते हैं। इसके अलावा, पूर्व-प्रशिक्षित दृश्य एनकोडर्स में पाठ पढ़ने या वस्तुओं को स्थानीयकृत करने जैसी विशिष्ट क्षमताओं की कमी हो सकती है। इसे संबोधित करने के लिए, विभिन्न मॉडल विभिन्न दृश्य कार्यों पर पूर्व-प्रशिक्षित दृश्य एनकोडर्स को एकीकृत करते हैं ताकि दृश्य एनकोडर की क्षमताओं को बढ़ाया जा सके।
हाल के अध्ययनों से पता चलता है कि एमएलएलएम हॉल्यूसिनेशन को कम करने और रिज़ॉल्यूशन-संवेदनशील कार्यों जैसे ऑप्टिकल कैरेक्टर रिकॉग्निशन पर प्रदर्शन में सुधार करने के लिए मजबूत दृश्य एनकोडर डिज़ाइन महत्वपूर्ण हैं। कई कार्य दृश्य एनकोडर की क्षमता में सुधार पर केंद्रित हैं, या तो पूर्व-प्रशिक्षण डेटा और पैरामीटर को स्केल करने से या छवियों को कम-रिज़ॉल्यूशन पैच में विभाजित करने से। हालांकि, ये दृष्टिकोण अक्सर बड़े प्रशिक्षण संसाधनों की मांग करते हैं। एक कुशल लेकिन शक्तिशाली रणनीति विभिन्न कार्यों और इनपुट रिज़ॉल्यूशन के साथ पूर्व-प्रशिक्षित दृश्य एनकोडर्स को मिलाना है, या तो सीएलआईपी एनकोडर के साथ उच्च-रिज़ॉल्यूशन एनकोडर्स को मिलाना, विभिन्न एनकोडर्स से विशेषताओं को क्रमिक रूप से जोड़ना, या अधिक जटिल मिश्रण और मार्गदर्शन रणनीतियों को अपनाना।
ईगल: विधि और वास्तुकला
पिछले तरीकों के विपरीत जो नए मिश्रण परिदृश्यों या वास्तुकला पर ध्यान केंद्रित करते हैं, ईगल का लक्ष्य दृश्य एनकोडर्स को मिलाने के लिए एक न्यूनतम डिज़ाइन की पहचान करना है, जो विस्तृत अपघटन और अनावश्यक घटकों को हटाने द्वारा समर्थित है।
मजबूत सीएलआईपी एनकोडर
ईगल सीएलआईपी मॉडल से शुरुआत करता है, क्योंकि यह कई एमएलएलएम के लिए प्राथमिक विकल्प बन गया है। जबकि सीएलआईपी मॉडल मल्टीमॉडल कार्यों में सुधार करने के लिए जाने जाते हैं, उनकी सीमाएं भी अच्छी तरह से प्रलेखित हैं। उदाहरण के लिए, कई मौजूदा एमएलएलएम सीएलआईपी के पूर्व-प्रशिक्षित रिज़ॉल्यूशन (जैसे 224 × 224 या 336 × 336) का उपयोग अपने इनपुट रिज़ॉल्यूशन के रूप में करते हैं। इन मामलों में, एनकोडर्स अक्सर विस्तृत विवरण को पकड़ने में संघर्ष करते हैं जो ऑप्टिकल कैरेक्टर रिकॉग्निशन और डॉक्यूमेंट समझ जैसे रिज़ॉल्यूशन-संवेदनशील कार्यों के लिए महत्वपूर्ण होते हैं।
ईगल: प्रयोग और परिणाम
विज़ुअल प्रश्न उत्तर देने वाले कार्य
ईगल तीन विज़ुअल प्रश्न उत्तर देने वाले बेंचमार्क, जीQA, VQAv2 और VizWiz पर मॉडल श्रृंखला की तुलना करता है।
ओसीआर और चार्ट समझने वाले कार्य
ईगल की ओसीआर, डॉक्यूमेंट और चार्ट समझने की क्षमताओं का मूल्यांकन करने के लिए, मॉडल को ओसीआरबेंच, टेक्स्टवीक्यूए और चार्टक्यूए पर बेंचमार्क किया जाता है।
बहुमोड़ल बेंचमार्क मूल्यांकन
ईगल का मूल्यांकन सात बेंचमार्क पर किया जाता है जो एमएलएलएम के लिए विभिन्न दृष्टिकोणों से इसकी क्षमताओं का प्रदर्शन करते हैं।
अंतिम विचार
इस लेख में, हमने ईगल के बारे में बात की है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में दृश्य एनकोडर्स को एकीकृत करने के लिए डिज़ाइन स्पेस का एक गहन विश्लेषण है। पिछले कार्यों के विपरीत जो नए मिश्रण परिदृश्यों पर ध्यान केंद्रित करते हैं, ईगल यह पता लगाता है कि व्यवस्थित डिज़ाइन विकल्प महत्वपूर्ण हैं और उपयोगी तकनीकों की एक श्रृंखला की खोज करता है। चरणबद्ध तरीके से, ईगल व्यक्तिगत दृश्य एनकोडर्स के प्रशिक्षण नुस्खे को अनुकूलित करता है, एक विस्तार योग्य और कुशल मिश्रण विधि की पहचान करता है, और धीरे-धीरे विभिन्न डोमेन ज्ञान के साथ दृश्य एनकोडर्स को जोड़ता है। परिणाम मूल डिज़ाइन स्पेस विचारों के महत्व को रेखांकित करते हैं।












