एआई मॉडल और प्लेटफ़ॉर्म
EfficientViT: मेमोरी कुशल विजन ट्रांसफॉर्मर हाई-रेजोल्यूशन कंप्यूटर विजन के लिए

विजन ट्रांसफॉर्मर मॉडल्स ने हाल के समय में बहुत सफलता प्राप्त की है क्योंकि उनकी उच्च मॉडल क्षमता है। इसके बावजूद, विजन ट्रांसफॉर्मर मॉडल्स में एक बड़ा दोष है: उनकी उल्लेखनीय गणना क्षमता उच्च गणना लागत पर आती है, और यही कारण है कि विजन ट्रांसफॉर्मर वास्तविक समय के अनुप्रयोगों के लिए पहली पसंद नहीं हैं। इस समस्या को हल करने के लिए, एक समूह के डेवलपर्स ने EfficientViT लॉन्च किया, जो एक उच्च गति वाले विजन ट्रांसफॉर्मर का परिवार है।
जब EfficientViT पर काम किया जा रहा था, तो डेवलपर्स ने देखा कि वर्तमान ट्रांसफॉर्मर मॉडल्स की गति अक्सर अक्षम मेमोरी ऑपरेशन द्वारा सीमित होती है, विशेष रूप से एमएचएसए या मल्टी-हेड सेल्फ अटेंशन नेटवर्क में एलिमेंट-वाइज फंक्शन और टेंसर रीशेपिंग। इन अक्षम मेमोरी ऑपरेशन को हल करने के लिए, EfficientViT डेवलपर्स ने एक नए बिल्डिंग ब्लॉक का उपयोग किया है जो एक सैंडविच लेआउट का उपयोग करता है, अर्थात EfficientViT मॉडल एक एकल मेमोरी-बाउंड मल्टी-हेड सेल्फ अटेंशन नेटवर्क का उपयोग करता है जो एफएफएन लेयर्स के बीच में होता है जो मेमोरी दक्षता में सुधार करता है और चैनलों के बीच संचार को बढ़ाता है। इसके अलावा, मॉडल यह भी देखता है कि अटेंशन मैप्स अक्सर हेड्स के बीच में उच्च समानता रखते हैं, जो गणना की पुनरावृत्ति का कारण बनता है। इस पुनरावृत्ति को हल करने के लिए, EfficientViT मॉडल एक कैस्केडेड ग्रुप अटेंशन मॉड्यूल प्रस्तुत करता है जो अटेंशन हेड्स को पूर्ण फीचर के विभिन्न हिस्सों के साथ खिलाता है। यह तरीका न केवल गणना लागत को बचाता है, बल्कि मॉडल की अटेंशन विविधता को भी बढ़ाता है।
विभिन्न परिदृश्यों में EfficientViT मॉडल पर किए गए व्यापक प्रयोगों से पता चलता है कि EfficientViT मॉडल मौजूदा कुशल मॉडल्स को पीछे छोड़ देता है और सटीकता और गति के बीच एक अच्छा संतुलन बनाता है। तो आइए इसे और गहराई से देखें।
विजन ट्रांसफॉर्मर और EfficientViT का परिचय
विजन ट्रांसफॉर्मर कंप्यूटर विजन उद्योग में सबसे लोकप्रिय फ्रेमवर्क में से एक हैं क्योंकि वे उच्च प्रदर्शन और उच्च गणना क्षमता प्रदान करते हैं। हालांकि, विजन ट्रांसफॉर्मर मॉडल्स की सटीकता और प्रदर्शन में सुधार के साथ, ऑपरेशनल लागत और गणना ओवरहेड भी बढ़ जाते हैं। उदाहरण के लिए, वर्तमान मॉडल जो इमेजनेट डेटासेट पर राज्य-of-the-आर्ट प्रदर्शन प्रदान करते हैं, जैसे कि SwinV2 और V-MoE, क्रमशः 3B और 14.7B पैरामीटर्स का उपयोग करते हैं। इन मॉडल्स का आकार और गणना लागत वास्तविक समय डिवाइसों और अनुप्रयोगों के लिए व्यावहारिक रूप से उपयुक्त नहीं है।
EfficientNet मॉडल विजन ट्रांसफॉर्मर मॉडल्स के प्रदर्शन को बढ़ाने और कुशल और प्रभावी ट्रांसफॉर्मर-आधारित फ्रेमवर्क आर्किटेक्चर डिज़ाइन के सिद्धांतों का पता लगाने का लक्ष्य रखता है। EfficientViT मॉडल मौजूदा विजन ट्रांसफॉर्मर फ्रेमवर्क जैसे Swim और DeiT पर आधारित है और यह तीन आवश्यक कारकों का विश्लेषण करता है जो मॉडल्स की हस्तक्षेप गति को प्रभावित करते हैं, जिनमें गणना पुनरावृत्ति, मेमोरी एक्सेस, और पैरामीटर उपयोग शामिल हैं। इसके अलावा, मॉडल यह देखता है कि विजन ट्रांसफॉर्मर मॉडल्स की गति मेमोरी-बाउंड है, जिसका अर्थ है कि सीपीयू/जीपीयू में गणना शक्ति का पूर्ण उपयोग मेमोरी एक्सेस देरी से प्रतिबंधित होता है, जो ट्रांसफॉर्मर्स की रनटाइम गति पर नकारात्मक प्रभाव डालता है। एमएचएसए या मल्टी-हेड सेल्फ अटेंशन नेटवर्क में एलिमेंट-वाइज फंक्शन और टेंसर रीशेपिंग सबसे अधिक मेमोरी-अक्षम ऑपरेशन हैं। मॉडल यह भी देखता है कि एफएफएन और एमएचएसए के बीच अनुपात को अनुकूलित करने से मेमोरी एक्सेस समय को काफी कम किया जा सकता है बिना प्रदर्शन को प्रभावित किए। हालांकि, मॉडल यह भी देखता है कि अटेंशन मैप्स में पुनरावृत्ति होती है क्योंकि अटेंशन हेड्स समान रूप से सीखने की प्रवृत्ति रखते हैं।
मॉडल EfficientViT के लिए एक नए ब्लॉक का उपयोग करता है जो एक सैंडविच लेआउट का उपयोग करता है, जिसमें एक एकल मेमोरी-बाउंड मल्टी-हेड सेल्फ अटेंशन नेटवर्क एफएफएन लेयर्स के बीच में होता है। यह दृष्टिकोण न केवल मेमोरी-बाउंड ऑपरेशन के समय को कम करता है, बल्कि मेमोरी दक्षता को भी बढ़ाता है और चैनलों के बीच संचार को बढ़ाता है। मॉडल यह भी एक नए कैस्केडेड ग्रुप अटेंशन मॉड्यूल का उपयोग करता है जो गणना पुनरावृत्ति को कम करने और मॉडल की अटेंशन विविधता को बढ़ाने के लिए हेड्स को पूर्ण फीचर के विभिन्न हिस्सों के साथ खिलाता है।

जैसा कि ऊपर दी गई छवि में देखा जा सकता है, EfficientViT फ्रेमवर्क वर्तमान राज्य-of-the-आर्ट सीएनएन और वीआईटी मॉडल्स को पीछे छोड़ देता है और सटीकता और गति के बीच एक अच्छा संतुलन बनाता है। लेकिन EfficientViT फ्रेमवर्क ने वर्तमान राज्य-of-the-आर्ट फ्रेमवर्क्स को कैसे पीछे छोड़ दिया? आइए इसे जानने की कोशिश करें।
EfficientViT: विजन ट्रांसफॉर्मर की दक्षता में सुधार
EfficientViT मॉडल विजन ट्रांसफॉर्मर मॉडल्स की दक्षता में सुधार करने का लक्ष्य रखता है, जो तीन दृष्टिकोणों से किया जाता है:
- गणना पुनरावृत्ति
- मेमोरी एक्सेस
- पैरामीटर उपयोग
मॉडल इन तीनों कारकों का विश्लेषण करता है और उनके प्रभाव को समझने की कोशिश करता है। आइए इन तीनों कारकों पर विस्तार से चर्चा करें।
मेमोरी एक्सेस और दक्षता
मॉडल की गति को प्रभावित करने वाले एक महत्वपूर्ण कारक मेमोरी एक्सेस ओवरहेड है। जैसा कि नीचे दी गई छवि में देखा जा सकता है, ट्रांसफॉर्मर में कई ऑपरेटर्स, जैसे कि एलिमेंट-वाइज एडिशन, नॉर्मलाइजेशन, और टेंसर रीशेपिंग, मेमोरी-अक्षम ऑपरेशन हैं।

हालांकि, कुछ मौजूदा तरीके हैं जो मानक सॉफ्टमैक्स सेल्फ अटेंशन गणना को सरल बना सकते हैं, जैसे कि लो-रैंक अप्रॉक्सिमेशन और स्पार्स अटेंशन। लेकिन वे अक्सर सीमित त्वरण प्रदान करते हैं और सटीकता को कम कर देते हैं।
इसके बजाय, EfficientViT फ्रेमवर्क मेमोरी एक्सेस लागत को कम करने के लिए मेमोरी-अक्षम लेयर्स की संख्या को कम करने का लक्ष्य रखता है। मॉडल DeiT-T और Swin-T को छोटे सबनेटवर्क में स्केल डाउन करता है और उनके प्रदर्शन की तुलना करता है। जैसा कि नीचे दी गई छवि में देखा जा सकता है, यह दृष्टिकोण एमएचएसए लेयर्स की सटीकता को 20 से 40% तक बढ़ाता है।

गणना दक्षता
एमएचएसए लेयर्स इनपुट सीक्वेंस को कई सबस्पेस या हेड्स में एम्बेड करते हैं और प्रत्येक हेड के लिए अटेंशन मैप्स की गणना करते हैं। यह दृष्टिकोण प्रदर्शन को बढ़ाता है, लेकिन अटेंशन मैप्स की गणना महंगी हो सकती है। EfficientViT मॉडल छोटे वीआईटी मॉडल्स में गणना पुनरावृत्ति को कम करने का लक्ष्य रखता है।

मॉडल प्रत्येक हेड और शेष हेड्स के बीच अधिकतम कोसाइन समानता को मापता है और यह देखता है कि हेड्स में उच्च समानता होती है, जो गणना पुनरावृत्ति का संकेत देती है।
पैरामीटर दक्षता
आम तौर पर, वीआईटी मॉडल्स एनएलपी ट्रांसफॉर्मर्स से अपनी डिज़ाइन रणनीतियों को विरासत में लेते हैं, जैसे कि प्रोजेक्शन के लिए समान चौड़ाई का उपयोग करना और एफएफएन में विस्तार अनुपात को 4 में सेट करना। हालांकि, इन घटकों को हल्के मॉड्यूल के लिए सावधानी से डिज़ाइन किया जाना चाहिए। EfficientViT मॉडल टेलर संरचित प्रूनिंग का उपयोग करके Swim-T और DeiT-T लेयर्स में महत्वपूर्ण घटकों का पता लगाने का लक्ष्य रखता है और पैरामीटर आवंटन के सिद्धांतों का विश्लेषण करता है।

मॉडल यह देखता है कि पहले दो चरणों में अधिक आयामों को संरक्षित किया जाता है, जबकि अंतिम दो चरणों में कम आयामों को संरक्षित किया जाता है। यह सुझाव देता है कि एक典型 चैनल कॉन्फ़िगरेशन जो प्रत्येक चरण के बाद चैनल को दोगुना करता है या सभी ब्लॉक्स के लिए समान चैनल्स का उपयोग करता है, अंतिम कुछ ब्लॉक्स में महत्वपूर्ण पुनरावृत्ति का कारण बन सकता है।
कुशल विजन ट्रांसफॉर्मर: आर्किटेक्चर
उपरोक्त विश्लेषण के आधार पर, डेवलपर्स ने एक नए हाइरार्किकल मॉडल का निर्माण किया है जो तेज़ हस्तक्षेप गति प्रदान करता है, EfficientViT मॉडल। आइए EfficientViT फ्रेमवर्क की संरचना को विस्तार से देखें।
EfficientViT फ्रेमवर्क के निर्माण खंड
नीचे दी गई छवि में EfficientViT नेटवर्क का निर्माण खंड दिखाया गया है।

फ्रेमवर्क में एक कैस्केडेड ग्रुप अटेंशन मॉड्यूल, मेमोरी-कुशल सैंडविच लेआउट, और एक पैरामीटर रियलोकेशन रणनीति शामिल है जो क्रमशः गणना, मेमोरी, और पैरामीटर की दक्षता में सुधार करने पर केंद्रित है। आइए इन पर विस्तार से चर्चा करें।
सैंडविच लेआउट
मॉडल एक नए सैंडविच लेआउट का उपयोग करके फ्रेमवर्क के लिए एक अधिक प्रभावी और कुशल मेमोरी ब्लॉक बनाता है। सैंडविच लेआउट में कम मेमोरी-बाउंड सेल्फ-अटेंशन लेयर्स होती हैं और अधिक मेमोरी-कुशल फीड फॉरवर्ड नेटवर्क्स का उपयोग चैनल संचार के लिए किया जाता है। विशेष रूप से, मॉडल एक एकल सेल्फ-अटेंशन लेयर को स्पेशियल मिक्सिंग के लिए एफएफएन लेयर्स के बीच में लागू करता है। यह डिज़ाइन न केवल मेमोरी-बाउंड लेयर्स के कारण मेमोरी समय की खपत को कम करता है, बल्कि यह एफएफएन लेयर्स के माध्यम से चैनलों के बीच प्रभावी संचार की भी अनुमति देता है।
कैस्केडेड ग्रुप अटेंशन
एमएचएसए लेयर्स में एक प्रमुख समस्या हेड्स में पुनरावृत्ति है, जो गणना को कम कर देती है। इस समस्या को हल करने के लिए, मॉडल एक नए कैस्केडेड ग्रुप अटेंशन मॉड्यूल का प्रस्ताव करता है जो विजन ट्रांसफॉर्मर्स के लिए प्रेरणा लेता है। इस दृष्टिकोण में, मॉडल प्रत्येक हेड को पूर्ण फीचर के विभिन्न हिस्सों के साथ खिलाता है, जो गणना को विभाजित करता है और मॉडल की अटेंशन विविधता को बढ़ाता है।

पैरामीटर रियलोकेशन
मॉडल पैरामीटर दक्षता में सुधार करने के लिए पैरामीटर्स को फिर से आवंटित करता है और महत्वपूर्ण मॉड्यूल की चैनल चौड़ाई को बढ़ाता है और कम महत्वपूर्ण मॉड्यूल की चौड़ाई को कम करता है। टेलर विश्लेषण के आधार पर, मॉडल प्रत्येक चरण में प्रोजेक्शन के लिए छोटे चैनल आयाम सेट करता है या प्रोजेक्शन को इनपुट के समान आयाम देता है। एफएफएन के विस्तार अनुपात को 4 से 2 में कम किया जाता है ताकि पैरामीटर पुनरावृत्ति को कम किया जा सके।

नीचे दी गई छवि में EfficientViT फ्रेमवर्क का अवलोकन दिखाया गया है, जिसमें:
- EfficientViT की आर्किटेक्चर
- सैंडविच लेआउट ब्लॉक
- कैस्केडेड ग्रुप अटेंशन
EfficientViT: नेटवर्क आर्किटेक्चर

नीचे दी गई छवि में EfficientViT फ्रेमवर्क की नेटवर्क आर्किटेक्चर का अवलोकन दिखाया गया है। मॉडल एक ओवरलैपिंग पैच एम्बेडिंग [20,80] पेश करता है जो 16×16 पैच को सी1 आयाम टोकन में एम्बेड करता है, जो मॉडल की क्षमता को कम स्तर के दृश्य प्रतिनिधित्व सीखने में सुधारता है। मॉडल की आर्किटेक्चर में तीन चरण होते हैं, जिसमें प्रत्येक चरण में प्रस्तावित बिल्डिंग ब्लॉक्स को स्टैक किया जाता है, और प्रत्येक सब्सम्पलिंग लेयर (2× रिज़ॉल्यूशन का सब्सम्पलिंग) में टोकन की संख्या 4X से कम हो जाती है। सब्सम्पलिंग को अधिक कुशल बनाने के लिए, मॉडल एक सब्सम्पल ब्लॉक का प्रस्ताव करता है जिसमें प्रस्तावित सैंडविच लेआउट होता है, लेकिन अटेंशन लेयर को एक इनवर्टेड रेसिडुअल ब्लॉक से बदल दिया जाता है ताकि सैंपलिंग के दौरान जानकारी की हानि को कम किया जा सके। इसके अलावा, मॉडल पारंपरिक लेयरनॉर्म (LN) के बजाय बैचनॉर्म (BN) का उपयोग करता है, जो पिछले लीनियर या कॉन्वोल्यूशनल लेयर्स में फोल्ड किया जा सकता है, जो इसे LN की तुलना में रनटाइम लाभ प्रदान करता है।
EfficientViT मॉडल परिवार
EfficientViT मॉडल परिवार में 6 मॉडल शामिल हैं जिनमें विभिन्न गहराई और चौड़ाई स्केल हैं, और प्रत्येक चरण के लिए एक निर्धारित संख्या में हेड्स हैं। मॉडल प्रारंभिक चरणों में मोबाइलनेटवी3 फ्रेमवर्क के समान कम ब्लॉक्स का उपयोग करता है, क्योंकि बड़े रिज़ॉल्यूशन के साथ प्रारंभिक चरणों का प्रसंस्करण समय लेने वाला होता है। चौड़ाई को चरणों में एक छोटे से कारक द्वारा बढ़ाया जाता है ताकि बाद के चरणों में पुनरावृत्ति को कम किया जा सके। नीचे दी गई तालिका में EfficientViT मॉडल परिवार का विवरण दिया गया है, जहां सी, एल, और एच क्रमशः चौड़ाई, गहराई, और प्रत्येक चरण में हेड्स की संख्या को दर्शाते हैं।

EfficientViT: मॉडल कार्यान्वयन और परिणाम
EfficientViT मॉडल का कुल बैच आकार 2,048 है, जो टिम और पाइथन के साथ बनाया गया है, 300 एपोक्स के लिए 8 नविडिया वी100 जीपीयू का उपयोग करके प्रशिक्षित किया गया है, एक कोसाइन लर्निंग रेट शेड्यूलर, एडमडब्ल्यू ऑप्टिमाइज़र का उपयोग करता है, और इमेजनेट-1के पर छवि वर्गीकरण प्रयोग करता है। इनपुट छवियों को यादृच्छिक रूप से काटा जाता है और 224×224 रिज़ॉल्यूशन में बदल दिया जाता है। डाउनस्ट्रीम छवि वर्गीकरण प्रयोगों के लिए, EfficientViT फ्रेमवर्क मॉडल को 300 एपोक्स के लिए फाइन-ट्यून करता है और एडमडब्ल्यू ऑप्टिमाइज़र के साथ 256 के बैच आकार का उपयोग करता है। मॉडल कोCO पर ऑब्जेक्ट डिटेक्शन के लिए रेटिनेट का उपयोग किया जाता है और मॉडल को 12 एपोक्स के लिए प्रशिक्षित किया जाता है जो समान सेटिंग्स का उपयोग करता है।
इमेजनेट पर परिणाम
EfficientViT मॉडल के प्रदर्शन का विश्लेषण करने के लिए, इसे वर्तमान वीआईटी और सीएनएन मॉडल्स के साथ इमेजनेट डेटासेट पर तुलना की जाती है। नीचे दी गई छवि में तुलना के परिणाम दिखाए गए हैं। जैसा कि देखा जा सकता है, EfficientViT मॉडल परिवार अधिकांश मामलों में वर्तमान फ्रेमवर्क्स को पीछे छोड़ देता है और सटीकता और गति के बीच एक आदर्श संतुलन बनाता है।

कुशल सीएनएन और कुशल वीआईटी के साथ तुलना
मॉडल को पहले कुशल सीएनएन जैसे EfficientNet और वैनिला सीएनएन फ्रेमवर्क जैसे MobileNets के साथ तुलना की जाती है। जैसा कि देखा जा सकता है, मोबाइलनेट फ्रेमवर्क की तुलना में EfficientViT मॉडल बेहतर शीर्ष-1 सटीकता स्कोर प्राप्त करते हैं और इंटेल सीपीयू और वी100 जीपीयू पर क्रमशः 3.0X और 2.5X तेजी से चलते हैं।

नीचे दी गई छवि में EfficientViT मॉडल के प्रदर्शन की तुलना इमेजनेट-1के डेटासेट पर चलने वाले बड़े पैमाने पर वीआईटी मॉडल्स के साथ की जाती है।
डाउनस्ट्रीम छवि वर्गीकरण
EfficientViT मॉडल को विभिन्न डाउनस्ट्रीम कार्यों पर लागू किया जाता है ताकि मॉडल की ट्रांसफर लर्निंग क्षमताओं का अध्ययन किया जा सके। नीचे दी गई छवि में प्रयोग के परिणाम दिखाए गए हैं। जैसा कि देखा जा सकता है, EfficientViT-M5 मॉडल अधिकांश डेटासेट पर बेहतर या समान परिणाम प्राप्त करता है और बहुत अधिक थ्रूपुट बनाए रखता है। कार डेटासेट एकमात्र अपवाद है जहां EfficientViT मॉडल सटीकता में कम प्रदर्शन करता है।

ऑब्जेक्ट डिटेक्शन
EfficientViT मॉडल की ऑब्जेक्ट डिटेक्शन क्षमताओं का मूल्यांकन करने के लिए, इसे कुशल मॉडल्स के साथ सीओसीओ ऑब्जेक्ट डिटेक्शन कार्य पर तुलना की जाती है। नीचे दी गई छवि में तुलना के परिणाम दिखाए गए हैं।

अंतिम विचार
इस लेख में, हमने EfficientViT के बारे में बात की है, जो एक परिवार है जो कैस्केडेड ग्रुप अटेंशन और मेमोरी-कुशल ऑपरेशन प्रदान करता है। व्यापक प्रयोगों से पता चलता है कि EfficientViT मॉडल वर्तमान सीएनएन और वीआईटी मॉडल्स को पीछे छोड़ देता है और अधिकांश मामलों में सटीकता और गति के बीच एक आदर्श संतुलन बनाता है। हमने विजन ट्रांसफॉर्मर्स की हस्तक्षेप गति को प्रभावित करने वाले कारकों का विश्लेषण करने की भी कोशिश की है।












