एआई मॉडल और प्लेटफ़ॉर्म
मैंबाआउट: क्या विजन के लिए मैंबा वास्तव में आवश्यक है?
आधुनिक मशीन लर्निंग और आर्टिफ़िशियल इंटेलिजेंस फ़्रेमवर्क में, ट्रांसफ़ॉर्मर विभिन्न डोमेन में व्यापक रूप से उपयोग किए जाने वाले घटक हैं, जिनमें जीपीटी श्रृंखला, बीईआरटी और विज़न ट्रांसफ़ॉर्मर शामिल हैं। हालांकि, ट्रांसफ़ॉर्मर के ध्यान मॉड्यूल में एक दोष है जो क्रमिक लंबाई के साथ द्विगुणित रूप से बढ़ता है, जिससे उच्च गणनात्मक चुनौतियाँ उत्पन्न होती हैं।
मैंबा, एक मॉडल परिवार, जिसमें एक पुनरावृत्ति न्यूरल नेटवर्क जैसे टोकन मिक्सर होता है, हाल ही में ध्यान तंत्र की द्विगुणित जटिलता को संबोधित करने के लिए पेश किया गया था और इसका उपयोग दृष्टि कार्यों में किया गया था। शोधकर्ताओं ने पहले से ही मैंबा और एसएसएम या स्टेट स्पेस मॉडल को दृश्य मान्यता कार्यों में शामिल करने के तरीके खोजे हैं, और विज़न मैंबा जो विज़न ट्रांसफ़ॉर्मर के समान समतल दृष्टि मॉडल विकसित करने के लिए मैंबा का उपयोग करता है, इसका एक अच्छा उदाहरण है। दूसरी ओर, लोकलमैंबा स्थानीय प्रेरक पूर्वाग्रहों को शामिल करता है ताकि दृश्य मैंबा मॉडल को बढ़ाया जा सके, और वीएमैंबा फ्रेमवर्क आधार मैंबा मॉडल का उपयोग करके रेसनेट और अलेक्सनेट के समान स्तरीय मॉडल बनाने के लिए करता है। हालांकि, क्या मैंबा फ्रेमवर्क वास्तव में दृश्य संदर्भ कार्यों के लिए आवश्यक है? यह प्रश्न तब उठता है जब मैंबा मॉडल परिवार का प्रदर्शन दृश्य कार्यों में पारंपरिक ध्यान-आधारित और संवोल्यूशनल मॉडल की तुलना में अब तक निराशाजनक रहा है।
मैंबाआउट यह जानने का प्रयास करता है कि क्या मैंबा वास्तव में स्वायत्त और लंबी-क्रम वाले कार्यों के लिए उपयुक्त है। मैंबाआउट फ्रेमवर्क यह अनुमान लगाता है कि मैंबा वास्तव में दृश्य कार्यों के लिए आवश्यक नहीं है, क्योंकि छवि वर्गीकरण न तो लंबी-क्रम वाले और न ही स्वायत्त विशेषताओं के साथ मेल खाता है। हालांकि खंड और पता लगाने वाले कार्य भी स्वायत्त नहीं हैं, वे लंबी-क्रम वाली विशेषताओं को प्रदर्शित करते हैं, जिससे मैंबाआउट फ्रेमवर्क को इन कार्यों के लिए मैंबा की संभावना का अनुमान लगता है। मैंबाआउट फ्रेमवर्क मैंबा ब्लॉक्स को एक दूसरे के ऊपर ढेर करते हुए बनाया गया है, स्टेट स्पेस मॉडल को हटाते हुए, इसका मूल टोकन मिक्सर। प्रायोगिक परिणाम मैंबाआउट फ्रेमवर्क द्वारा प्रस्तुत अनुमान का समर्थन करते हैं, क्योंकि यह इमेजनेट इमेज वर्गीकरण फ्रेमवर्क पर सभी दृश्य मैंबा मॉडल को पार कर जाता है, यह दर्शाता है कि मैंबा वास्तव में दृश्य कार्यों के लिए आवश्यक नहीं है। दूसरी ओर, पता लगाने और खंडन कार्यों के लिए, मैंबाआउट फ्रेमवर्क राज्य-of-the-आर्ट मैंबा मॉडल द्वारा प्रदान किए गए प्रदर्शन को दोहराने में असमर्थ है, लंबी-क्रम वाले दृश्य कार्यों के लिए मैंबा मॉडल परिवार की संभावना का प्रदर्शन करता है।
यह लेख मैंबाआउट फ्रेमवर्क को गहराई से कवर करने का उद्देश्य रखता है, और हम तंत्र, विधि, वास्तुकला और राज्य-of-the-आर्ट फ्रेमवर्क की तुलना के साथ फ्रेमवर्क का अन्वेषण करते हैं। तो आइए शुरू करें।
मैंबाआउट: क्या मैंबा वास्तव में दृश्य के लिए आवश्यक है?
मशीन लर्निंग अनुप्रयोगों और क्षमताओं की प्रगति के साथ, ट्रांसफ़ॉर्मर विभिन्न कार्यों के लिए मुख्यधारा की रीढ़ की हड्डी के रूप में उभरे हैं, जिनमें विज़न ट्रांसफ़ॉर्मर, जीपीटी मॉडल श्रृंखला, बीईआरटी और कुछ अन्य शामिल हैं। हालांकि, ट्रांसफ़ॉर्मर के टोकन मिक्सर में एक दोष है जो क्रमिक लंबाई के साथ द्विगुणित रूप से बढ़ता है, जिससे लंबी क्रमों के लिए महत्वपूर्ण चुनौतियाँ उत्पन्न होती हैं। इस मुद्दे को संबोधित करने के लिए, कई टोकन मिक्सर पेश किए गए हैं जो टोकन लंबाई के साथ रैखिक जटिलता रखते हैं, जैसे कि लिंफ़ॉर्मर, लॉन्गफ़ॉर्मर, परफ़ॉर्मर, डायनेमिक कॉन्वोल्यूशनल और बिग बर्ड। हालांकि,最近, पुनरावृत्ति न्यूरल नेटवर्क जैसे मॉडल प्रमुखता से बढ़ रहे हैं क्योंकि वे लंबी क्रमों पर कुशल प्रदर्शन प्रदान करते हैं।
मैंबाआउट एक प्रयास है जो मैंबा मॉडल परिवार की प्रकृति का अन्वेषण करता है और यह निष्कर्ष निकालता है कि मैंबा स्वायत्त और लंबी-क्रम वाले कार्यों के लिए उपयुक्त है। हालांकि, अधिकांश दृश्य कार्यों में ये विशेषताएं नहीं होती हैं, और कुछ प्रयोगों के आधार पर, मैंबाआउट दो अनुमानों का प्रस्ताव करता है। पहला, स्टेट स्पेस मॉडल छवि वर्गीकरण के लिए आवश्यक नहीं है क्योंकि छवि वर्गीकरण कार्य न तो स्वायत्त और न ही लंबी-क्रम वाले होते हैं। दूसरा, स्टेट स्पेस मॉडल उदाहरण खंडन और वस्तु पता लगाने के लिए लाभकारी हो सकते हैं क्योंकि वे लंबी-क्रम वाली विशेषताओं का प्रदर्शन करते हैं, हालांकि वे स्वायत्त नहीं हैं। प्रायोगिक परिणाम यह निष्कर्ष निकालते हैं कि मैंबा फ्रेमवर्क स्वायत्त और लंबी-क्रम वाले कार्यों के लिए उपयुक्त है, और छवि वर्गीकरण कार्यों के लिए आवश्यक नहीं है। मैंबाआउट फ्रेमवर्क खुद को मैंबा मॉडल पर आधारित है जो स्टेट स्पेस मॉडल के बिना गेटेड कॉन्वोल्यूशनल न्यूरल नेटवर्क ब्लॉक्स पर बनाया गया है, और प्रायोगिक परिणाम यह दर्शाते हैं कि मैंबाआउट फ्रेमवर्क छवि वर्गीकरण कार्यों में मैंबा मॉडल को पार कर जाता है, लेकिन वस्तु पता लगाने और खंडन कार्यों में राज्य-of-the-आर्ट मैंबा मॉडल के प्रदर्शन को दोहराने में असमर्थ है।
मैंबा के लिए उपयुक्त कार्य क्या हैं?
मैंबा फ्रेमवर्क का टोकन मिक्सर एक चयनात्मक स्टेट स्पेस मॉडल है जो चार इनपुट-निर्भर पैरामीटर परिभाषित करता है। फ्रेमवर्क की पुनरावृत्ति संपत्ति इसे कारण ध्यान से अलग करती है। छिपी हुई स्थिति को एक निश्चित-आकार की स्मृति के रूप में देखा जा सकता है जो ऐतिहासिक जानकारी संग्रहीत करती है। निश्चित आकार का अर्थ है कि स्मृति हानिपूर्ण है, लेकिन यह भी सुनिश्चित करती है कि वर्तमान इनपुट के साथ स्मृति को एकीकृत करने की गणनात्मक जटिलता निरंतर रहती है। इसके विपरीत, कारण ध्यान परतें पिछले टोकन से सभी कुंजी और मूल्यों को संग्रहीत करती हैं और प्रत्येक नए इनपुट के साथ वर्तमान टोकन की कुंजी और मूल्य जोड़कर विस्तार करती हैं, और यह स्मृति हानिरहित है, सैद्धांतिक रूप से। हालांकि, स्मृति का आकार अधिक टोकन इनपुट होने के साथ बढ़ता है, जिससे वर्तमान इनपुट के साथ स्मृति को एकीकृत करने की जटिलता बढ़ जाती है। कारण ध्यान और पुनरावृत्ति न्यूरल नेटवर्क जैसे मॉडल के बीच स्मृति तंत्र के बीच का अंतर निम्नलिखित चित्र में दिखाया गया है।

चूंकि स्टेट स्पेस मॉडल की स्मृति स्वाभाविक रूप से हानिपूर्ण है, यह कारण ध्यान की हानिरहित स्मृति से कम हो जाती है, और परिणामस्वरूप, मैंबा मॉडल छोटी क्रमों को संभालने में अपनी ताकत नहीं दिखा सकते हैं, जो क्षेत्र में कारण ध्यान तंत्र आसानी से प्रदर्शन करता है। हालांकि, लंबी क्रमों वाले दृश्यों में, कारण ध्यान दृष्टिकोण द्विगुणित जटिलता के कारण असफल हो जाता है। इस दृश्य में, मैंबा फ्रेमवर्क वर्तमान इनपुट के साथ स्मृति को मिलाने में अपनी कुशलता का प्रदर्शन करता है, और लंबी क्रमों को चिकनी तरह से संभालने में सक्षम है, यह दर्शाता है कि मैंबा मॉडल परिवार लंबी क्रमों के प्रसंस्करण के लिए उपयुक्त है।
यह भी ध्यान देने योग्य है कि जहां स्टेट स्पेस मॉडल की पुनरावृत्ति संपत्ति मैंबा मॉडल को लंबी क्रमों को कुशलता से संभालने में सक्षम बनाती है, यह एक सीमा भी पेश करती है क्योंकि यह केवल वर्तमान और पिछले समय के बारे में जानकारी तक पहुंच सकती है, और इस प्रकार के टोकन मिक्सिंग को कारण मोड कहा जाता है, और निम्नलिखित चित्र में दिखाया गया है। इसकी कारण संपत्ति के कारण, यह विधि स्वायत्त पीढ़ी कार्यों के लिए उपयुक्त है।

पूरी तरह से दिखाई देने वाला मोड समझने वाले कार्यों के लिए उपयुक्त है जहां मॉडल एक बार में सभी इनपुट तक पहुंच सकता है। इसके अलावा, ध्यान पूरी तरह से दिखाई देने वाले मोड में है और इसे कारण मोड में आसानी से बदला जा सकता है ध्यान मानचित्रों पर कारण मास्क लागू करके, और पुनरावृत्ति न्यूरल नेटवर्क जैसे मॉडल स्वाभाविक रूप से कारण मोड में काम करते हैं क्योंकि उनकी पुनरावृत्ति संपत्ति के कारण। सारांश में, मैंबा फ्रेमवर्क लंबी क्रमों या कारण टोकन मिक्सिंग मोड वाले कार्यों के लिए उपयुक्त है।
दृश्य मान्यता कार्य, कारण टोकन मिक्सिंग कोड, और बहुत बड़े क्रम
जैसा कि पहले चर्चा की गई, पूरी तरह से दिखाई देने वाला टोकन मिक्सिंग मोड मिक्सिंग की अनर्स्ट्रिक्टेड श्रृंखला की अनुमति देता है, जबकि कारण मोड वर्तमान टोकन को केवल पिछले टोकन से जानकारी तक पहुंचने की अनुमति देता है। इसके अलावा, दृश्य मान्यता को समझने वाले कार्य के रूप में वर्गीकृत किया जाता है जहां मॉडल एक बार में पूरी छवि को देख सकता है, और यह टोकन मिक्सिंग पर प्रतिबंध लगाने की आवश्यकता को समाप्त करता है, और अतिरिक्त प्रतिबंध लगाने से मॉडल के प्रदर्शन को संभावित रूप से खराब किया जा सकता है। सामान्य तौर पर, पूरी तरह से दिखाई देने वाला मोड समझने वाले कार्यों के लिए उपयुक्त है, जबकि कारण मोड स्वायत्त कार्यों के लिए बेहतर है। इसके अलावा, यह दावा बीईआरटी और वीआईटी मॉडल के द्वारा समर्थित है जो समझने वाले कार्यों के लिए जीपीटी मॉडल की तुलना में अधिक उपयोग किए जाते हैं।
प्रायोगिक सत्यापन और परिणाम
अगला कदम मैंबाआउट फ्रेमवर्क द्वारा प्रस्तुत अनुमानों का प्रायोगिक सत्यापन करना है। जैसा कि निम्नलिखित छवि में दिखाया गया है, मैंबा ब्लॉक गेटेड कॉन्वोल्यूशनल न्यूरल नेटवर्क ब्लॉक पर आधारित है, और मैंबा और गेटेड सीएनएन ब्लॉक्स की मेटा-वास्तुकला को मेटाफ़ॉर्मर फ्रेमवर्क के टोकन मिक्सर और एक एमएलपी के सरल एकीकरण के रूप में माना जा सकता है।

मैंबा ब्लॉक गेटेड कॉन्वोल्यूशनल न्यूरल नेटवर्क को एक अतिरिक्त स्टेट स्पेस मॉडल के साथ विस्तारित करता है, और एसएसएम की उपस्थिति ही गेटेड सीएनएन और मैंबा ब्लॉक को अलग करती है। इसके अलावा, व्यावहारिक गति में सुधार करने के लिए, मैंबाआउट फ्रेमवर्क केवल आंशिक चैनलों पर गहराईवार संयोजन करता है, और जैसा कि निम्नलिखित एल्गोरिदम में दिखाया गया है, गेटेड सीएनएन ब्लॉक का कार्यान्वयन सरल, प्रभावी और सुंदर है।

छवि वर्गीकरण कार्य
इमेजनेट छवि वर्गीकरण कार्यों के लिए एक बेंचमार्क के रूप में कार्य करता है, जिसमें 1000 से अधिक सामान्य वर्ग, 1.3 मिलियन प्रशिक्षण छवियां और 50,000 से अधिक सत्यापन छवियां शामिल हैं। प्रयोग के लिए उपयोग किए जाने वाले डेटा ऑगमेंटेशन में यादृच्छिक आकार बदलना, मिक्सअप, रंग ज़िट्टर, यादृच्छिक मिटाना, कटमिक्स और रैंड ऑगमेंट शामिल हैं। निम्नलिखित तालिका मैंबा मॉडल परिवार, मैंबाआउट मॉडल और अन्य ध्यान-आधारित और संवोल्यूशनल मॉडल के प्रदर्शन को इमेजनेट डेटासेट पर सारांशित करती है। जैसा कि देखा जा सकता है, मैंबाआउट फ्रेमवर्क बिना एसएसएम के सभी दृश्य मैंबा मॉडल को निरंतर रूप से पार करता है, सभी मॉडल आकारों में।

उदाहरण के लिए, मैंबाआउट-स्मॉल मॉडल एक शीर्ष-1 सटीकता स्कोर के साथ 84% से अधिक का उत्पादन करता है, जो इसके निकटतम मैंबा प्रतियोगी से 0.4% अधिक है। यह परिणाम पहले अनुमान का समर्थन करता है जो दावा करता है कि छवि वर्गीकरण कार्यों के लिए स्टेट स्पेस मॉडल को पेश करना आवश्यक नहीं है।
वस्तु पता लगाना और उदाहरण खंडन कार्य
सीओसीओ वस्तु पता लगाने और उदाहरण खंडन कार्यों के लिए एक बेंचमार्क के रूप में कार्य करता है। हालांकि मैंबाआउट फ्रेमवर्क कुछ दृश्य मैंबा मॉडल को पार कर जाता है, यह अभी भी राज्य-of-the-आर्ट दृश्य मैंबा मॉडल जैसे लोकलवीएमैंबा और वीएमैंबा से पीछे है। मैंबाआउट के प्रदर्शन में विसंगति राज्य-of-the-आर्ट दृश्य मॉडल और दृश्य मैंबा मॉडल के बीच एक महत्वपूर्ण प्रदर्शन अंतर को रेखांकित करती है, जो लंबी-क्रम वाले दृश्य कार्यों में मैंबा मॉडल परिवार की संभावना को दर्शाती है।

अंतिम विचार
मैंबा मॉडल परिवार स्वायत्त और लंबी-क्रम वाले कार्यों के लिए उपयुक्त लगता है। मैंबाआउट फ्रेमवर्क यह अनुमान लगाता है कि मैंबा वास्तव में दृश्य कार्यों के लिए आवश्यक नहीं है, क्योंकि छवि वर्गीकरण न तो लंबी-क्रम वाले और न ही स्वायत्त विशेषताओं के साथ मेल खाता है। हालांकि खंड और पता लगाने वाले कार्य भी स्वायत्त नहीं हैं, वे लंबी-क्रम वाली विशेषताओं को प्रदर्शित करते हैं, जिससे मैंबाआउट फ्रेमवर्क को इन कार्यों के लिए मैंबा की संभावना का अनुमान लगता है। मैंबाआउट फ्रेमवर्क मैंबा ब्लॉक्स को एक दूसरे के ऊपर ढेर करते हुए बनाया गया है, स्टेट स्पेस मॉडल को हटाते हुए, इसका मूल टोकन मिक्सर। प्रायोगिक परिणाम मैंबाआउट फ्रेमवर्क द्वारा प्रस्तुत अनुमान का समर्थन करते हैं, क्योंकि यह इमेजनेट इमेज वर्गीकरण फ्रेमवर्क पर सभी दृश्य मैंबा मॉडल को पार कर जाता है, यह दर्शाता है कि मैंबा वास्तव में दृश्य कार्यों के लिए आवश्यक नहीं है। दूसरी ओर, पता लगाने और खंडन कार्यों के लिए, मैंबाआउट फ्रेमवर्क राज्य-of-the-आर्ट मैंबा मॉडल द्वारा प्रदान किए गए प्रदर्शन को दोहराने में असमर्थ है, लंबी-क्रम वाले दृश्य कार्यों के लिए मैंबा मॉडल परिवार की संभावना का प्रदर्शन करता है।












