एआई मॉडल और प्लेटफ़ॉर्म
एलएलएवीए-यूएचडी: किसी भी पहलू अनुपात और उच्च रिज़ॉल्यूशन में छवियों को कुशलता से समझना
हाल के वर्षों में, बड़े भाषा मॉडलों में महत्वपूर्ण प्रगति हुई है, जिससे दृष्टि-भाषा तर्क, समझ और परस्पर क्रिया क्षमताओं में वृद्धि हुई है। आधुनिक फ्रेमवर्क इसे बड़े भाषा मॉडलों में दृश्य संकेतों को प्रोजेक्ट करके प्राप्त करते हैं, जिससे वे दृश्य रूप से विश्व को व्याख्या करने में सक्षम होते हैं, जो विभिन्न परिदृश्यों पर निर्भर करता है जो दृश्य एन्कोडिंग रणनीतियों पर निर्भर करता है। हालांकि, वास्तविक दुनिया की छवियों में न केवल विभिन्न परिदृश्य शामिल हैं, बल्कि वे संकल्पन और पहलू अनुपात में भी महत्वपूर्ण रूप से भिन्न होती हैं, जो बड़े भाषा मॉडलों के लिए विभिन्न डोमेन और कार्यों में महत्वपूर्ण चुनौतियां प्रस्तुत करती हैं। वास्तविक दुनिया की छवियों द्वारा प्रस्तुत की गई महत्वपूर्ण विचरण को संबोधित करने के लिए, आधुनिक बड़े भाषा मॉडल निम्न रिज़ॉल्यूशन में छवियों को समझते हैं, अर्थात 224×224, और एक निश्चित पहलू अनुपात, अर्थात 1:1। हालांकि निम्न रिज़ॉल्यूशन और निश्चित पहलू अनुपात के साथ समझौता करना वास्तविक दुनिया के अनुप्रयोगों में बड़े भाषा मॉडल की सामान्यता को बढ़ाने के लिए उपयोगी है, यह अक्सर छवि की सामग्री को महत्वपूर्ण रूप से धुंधला करता है और गंभीर आकार विकृति का कारण बनता है। यह समझौता विशेष रूप से ऑप्टिकल चित्र पहचान और छोटे वस्तु समझ जैसे सूक्ष्म कार्यों के लिए अनुकूलित बड़े बहु-मोडल मॉडलों या एलएमएम की क्षमताओं पर महत्वपूर्ण प्रभाव डालता है। इसके अलावा, चूंकि रिज़ॉल्यूशन और पहलू अनुपात पूर्व-निर्धारित हैं, मॉडल केवल धुंधली छवियों का अनुमान लगा सकता है, जिससे मॉडल हॉलुसिनेशन होता है, एक स्थिति जिसमें मॉडल छवियों में तथ्यात्मक रूप से आधारित नहीं होने वाले पाठ उत्तर उत्पन्न करता है।
इस लेख में, हम एलएलएवीए-यूएचडी के बारे में चर्चा करेंगे, जो एक नई दृष्टिकोण है जो पहले एलएलएवीए-1.5 और जीपीटी-4वी फ्रेमवर्क को प्रतिनिधि उदाहरण के रूप में लेता है और उनकी दृश्य एन्कोडिंग रणनीति में निहित सिस्टमिक खामियों को उजागर करने का प्रयास करता है। एलएलएवीए-यूएचडी फ्रेमवर्क, एक बहु-मोडल मॉडल, इन चुनौतियों का समाधान करने का प्रयास है। एलएलएवीए-यूएचडी फ्रेमवर्क उच्च रिज़ॉल्यूशन में छवियों को समझने में सक्षम है, साथ ही किसी भी पहलू अनुपात में। एलएलएवीए-यूएचडी फ्रेमवर्क तीन मुख्य घटकों पर आधारित है। पहले, एक छवि मॉड्यूलराइजेशन रणनीति जो मूल-रिज़ॉल्यूशन छवियों को छोटे परिवर्तनशील आकार के स्लाइस में विभाजित करती है ताकि दक्षता और एन्कोडिंग को बढ़ाया जा सके। इसके बाद, एक संपीड़न मॉड्यूल जो दृश्य एन्कोडर द्वारा उत्पादित छवि टोकन को और संकुचित करता है। अंत में, एक स्थानिक योजना जो बड़े भाषा मॉडलों के लिए स्लाइस टोकन को व्यवस्थित करती है। व्यापक प्रयोगों से पता चलता है कि एलएलएवीए-यूएचडी फ्रेमवर्क 9 बेंचमार्क पर राज्य-of-the-आर्ट बड़े भाषा मॉडलों को पार कर सकता है। इसके अलावा, केवल 94% अनुमान गणना का उपयोग करके, एलएलएवीए-यूएचडी फ्रेमवर्क 6 गुना बड़े रिज़ॉल्यूशन वाली छवियों को समर्थन करने में सक्षम है, अर्थात 672×1088।
एलएलएवीए-यूएचडी: किसी भी पहलू अनुपात और उच्च रिज़ॉल्यूशन में छवियों को कुशलता से समझना
दृष्टि-भाषा तर्क, समझ और परस्पर क्रिया ने हाल के वर्षों में महत्वपूर्ण प्रगति की है, जो बड़े भाषा मॉडलों के हाल के प्रयासों के कारण है। आधुनिक फ्रेमवर्क में, यह बड़े भाषा मॉडलों में दृश्य संकेतों को प्रोजेक्ट करके प्राप्त किया जाता है, जिससे वे दृश्य रूप से विश्व को व्याख्या करने में सक्षम होते हैं, जो विभिन्न परिदृश्यों पर निर्भर करता है जो दृश्य एन्कोडिंग रणनीतियों पर निर्भर करता है। वास्तविक दुनिया की छवियों में न केवल विभिन्न परिदृश्य शामिल हैं, बल्कि वे संकल्पन और पहलू अनुपात में भी महत्वपूर्ण रूप से भिन्न होती हैं, जो बड़े भाषा मॉडलों के लिए विभिन्न डोमेन और कार्यों में महत्वपूर्ण चुनौतियां प्रस्तुत करती हैं।
बेंचमार्क एलएलएम मॉडल क्यों उच्च रिज़ॉल्यूशन और विभिन्न पहलू अनुपात वाली छवियों को नहीं समझते हैं? इसके दो मुख्य कारण हैं। पहला, दृश्य एन्कोडर पूर्व-निर्धारित रिज़ॉल्यूशन में प्रशिक्षित होते हैं, जिससे मॉडल और एन्कोडर को विभिन्न पहलू अनुपात और रिज़ॉल्यूशन वाली छवियों को संभालना मुश्किल हो जाता है, जिससे मॉडल की अनुकूलन क्षमता पर महत्वपूर्ण प्रभाव पड़ता है। दूसरा, उच्च रिज़ॉल्यूशन वाली छवियों को सीधे दृश्य ट्रांसफॉर्मर का उपयोग करके एन्कोड करने से महत्वपूर्ण गणना लागतें जुड़ी होती हैं, और बाहरी समस्याएं आगे के प्रदर्शन में गिरावट का कारण बनती हैं। इसके अलावा, उच्च रिज़ॉल्यूशन वाली छवियों के लिए दृश्य टोकन की बड़ी संख्या को संसाधित करने के लिए बड़े भाषा मॉडल के लिए गणना लागतें महत्वपूर्ण रूप से अधिक हो सकती हैं, जिससे मॉडल की कुल दक्षता पर महत्वपूर्ण प्रभाव पड़ता है।
एलएलएवीए-यूएचडी फ्रेमवर्क के तीन मुख्य घटक हैं। पहले, एक छवि मॉड्यूलराइजेशन रणनीति जो मूल-रिज़ॉल्यूशन छवियों को छोटे परिवर्तनशील आकार के स्लाइस में विभाजित करती है ताकि दक्षता और एन्कोडिंग को बढ़ाया जा सके। इसके बाद, एक संपीड़न मॉड्यूल जो दृश्य एन्कोडर द्वारा उत्पादित छवि टोकन को और संकुचित करता है। अंत में, एक स्थानिक योजना जो बड़े भाषा मॉडलों के लिए स्लाइस टोकन को व्यवस्थित करती है।
मॉड्यूलराइज्ड दृश्य एन्कोडिंग
उच्च रिज़ॉल्यूशन वाली छवियों को विभिन्न पहलू अनुपात के साथ संभालने के लिए एक सामान्य दृष्टिकोण दृश्य ट्रांसफॉर्मर या वीआईटी के लिए स्थानिक एम्बेडिंग को लक्ष्य आकार में इंटरपोलेट करना है। हालांकि, इस दृष्टिकोण का कार्यान्वयन अक्सर उच्च गणना लागतों के साथ जुड़ा होता है, और बाहरी समस्याएं आगे के प्रदर्शन में गिरावट का कारण बनती हैं। इस चुनौती का समाधान करने के लिए, एलएलएवीए-यूएचडी फ्रेमवर्क एक मॉड्यूलराइज्ड दृश्य एन्कोडिंग रणनीति प्रस्तुत करता है जो मूल-रिज़ॉल्यूशन छवियों को छोटे परिवर्तनशील आकार के स्लाइस में विभाजित करता है, जिसमें प्रत्येक स्लाइस का आकार मानक पूर्व-प्रशिक्षण सेटिंग के करीब होता है।
संपीड़न परत
उच्च रिज़ॉल्यूशन वाली छवियों को संसाधित करने के लिए बड़े भाषा मॉडलों को अक्सर बड़ी संख्या में दृश्य टोकन को संसाधित करना पड़ता है, जो महत्वपूर्ण गणना संसाधनों और लागतों का कारण बनता है। इस चुनौती का समाधान करने के लिए, एलएलएवीए-यूएचडी मॉडल एक साझा परसेप्टर रीसैम्पलर परत को लागू करता है जो प्रत्येक छवि स्लाइस के दृश्य टोकन को संकुचित करता है।
छवि स्लाइस के लिए स्थानिक योजना
छवि स्लाइस को विभिन्न छवियों में गतिशील रूप से विभाजित किया जाता है, इसलिए बड़े भाषा मॉडल को स्लाइस के स्थानिक संगठन के बारे में सूचित करना आवश्यक है। एलएलएवीए-यूएचडी फ्रेमवर्क एक स्थानिक योजना को डिज़ाइन और लागू करता है जो दो विशेष टोकन का उपयोग करता है ताकि बड़े भाषा मॉडल को स्लाइस के सापेक्ष स्थान के बारे में सूचित किया जा सके।
एलएलएवीए-यूएचडी: प्रयोग और परिणाम
एलएलएवीए-यूएचडी फ्रेमवर्क को 9 लोकप्रिय बेंचमार्क पर मूल्यांकन किया गया है, जिसमें सामान्य दृश्य प्रश्न उत्तर बेंचमार्क, ऑप्टिकल चित्र आधारित दृश्य प्रश्न उत्तर बेंचमार्क, हॉलुसिनेशन बेंचमार्क, और व्यापक बेंचमार्क शामिल हैं। इसके अलावा, एलएलएवीए-यूएचडी फ्रेमवर्क को मजबूत बेसलाइन मॉडलों के साथ तुलना की गई है, जिनमें एलएलएवीए-1.5, मिनीगपीटी-वी2, इंस्ट्रक्टब्लिप, ब्लिप-2, और अधिक शामिल हैं।
अंतिम विचार
इस लेख में, हमने एलएलएवीए-यूएचडी के बारे में चर्चा की है, जो एक नई दृष्टिकोण है जो पहले एलएलएवीए-1.5 और जीपीटी-4वी फ्रेमवर्क को प्रतिनिधि उदाहरण के रूप में लेता है और उनकी दृश्य एन्कोडिंग रणनीति में निहित सिस्टमिक खामियों को उजागर करने का प्रयास करता है। एलएलएवीए-यूएचडी फ्रेमवर्क, एक बहु-मोडल मॉडल, इन चुनौतियों का समाधान करने का प्रयास है। एलएलएवीए-यूएचडी फ्रेमवर्क उच्च रिज़ॉल्यूशन में छवियों को समझने में सक्षम है, साथ ही किसी भी पहलू अनुपात में। एलएलएवीए-यूएचडी फ्रेमवर्क तीन मुख्य घटकों पर आधारित है। पहले, एक छवि मॉड्यूलराइजेशन रणनीति जो मूल-रिज़ॉल्यूशन छवियों को छोटे परिवर्तनशील आकार के स्लाइस में विभाजित करती है ताकि दक्षता और एन्कोडिंग को बढ़ाया जा सके। इसके बाद, एक संपीड़न मॉड्यूल जो दृश्य एन्कोडर द्वारा उत्पादित छवि टोकन को और संकुचित करता है। अंत में, एक स्थानिक योजना जो बड़े भाषा मॉडलों के लिए स्लाइस टोकन को व्यवस्थित करती है। व्यापक प्रयोगों से पता चलता है कि एलएलएवीए-यूएचडी फ्रेमवर्क 9 बेंचमार्क पर राज्य-of-the-आर्ट बड़े भाषा मॉडलों को पार कर सकता है। इसके अलावा, केवल 94% अनुमान गणना का उपयोग करके, एलएलएवीए-यूएचडी फ्रेमवर्क 6 गुना बड़े रिज़ॉल्यूशन वाली छवियों को समर्थन करने में सक्षम है, अर्थात 672×1088।












