एआई मॉडल और प्लेटफ़ॉर्म
TinySAM : कुशल सेगमेंट एनीथिंग मॉडल
वस्तु विभाजन एक आधारभूत और आधुनिक कंप्यूटर विजन में महत्वपूर्ण क्षेत्र है। यह वस्तु स्थानीयकरण और पहचान जैसे अनुप्रयोगों में महत्वपूर्ण भूमिका निभाता है, जिसमें व्यापक दृश्य घटकों की आवश्यकता होती है, और वास्तविक समय, तेज़ और सटीक विभाजन की मांग करता है। इस महत्व ने वस्तु विभाजन को एक लगातार गर्म अनुसंधान विषय बना दिया है, जिसमें उदाहरण विभाजन, अर्थव्यवस्था विभाजन और पैनोप्टिक विभाजन जैसे क्षेत्रों में महत्वपूर्ण कार्य किया गया है।
वस्तु विभाजन के विकास के साथ, सेगमेंट एनीथिंग मॉडल (एसएएम) एक उल्लेखनीय उपकरण के रूप में उभरा है, जो उत्कृष्ट विभाजन क्षमता प्रदर्शित करता है और विभिन्न कंप्यूटर विजन अनुप्रयोगों में तेजी से अपनाया जा रहा है। एसएएम वास्तुकला का उपयोग करने वाले फ्रेमवर्क ने डाउनस्ट्रीम दृश्य कार्यों में प्रभावशाली प्रदर्शन हासिल किया है। हालांकि, इसकी क्षमताओं और विभाजन कार्यों में उच्च सटीकता के बावजूद, एसएएम की जटिल और भारी वास्तुकला को महत्वपूर्ण गणनात्मक शक्ति की आवश्यकता होती है, जो इसे कम गणनात्मक संसाधनों वाले उपकरणों पर लागू करने में बाधा उत्पन्न करती है।
एसएएम की गणनात्मक चुनौतियों का समाधान करते हुए, शोधकर्ताओं ने टिनी सेगमेंट एनीथिंग मॉडल (टिनीसैम) विकसित किया है, जो मूल फ्रेमवर्क के शून्य-शॉट प्रदर्शन को बनाए रखते हुए अधिक हल्का है। टिनीसैम एक पूर्ण-चरण ज्ञान संक्षेपण विधि का उपयोग करता है जिसमें ऑनलाइन हार्ड प्रोम्प्ट्स के साथ एक अधिक कुशल छात्र मॉडल बनाने के लिए। पोस्ट-ट्रेनिंग क्वांटीकरण को प्रॉम्प्टेबल सेगमेंटेशन कार्यों के लिए अनुकूलित किया जाता है, जो गणनात्मक आवश्यकताओं को और कम करता है। इसके अलावा, टिनीसैम का डिज़ाइन हायरार्किकल सेगमेंटेशन के लिए है, जो बिना प्रदर्शन को प्रभावित किए लगभग दोगुनी अनुमान गति प्रदान करता है।
इस लेख में हम टिनीसैम फ्रेमवर्क की मूल बातों, वास्तुकला और प्रदर्शन का अन्वेषण करेंगे, जो अन्य राज्य-оф-द-आर्ट सेगमेंटेशन फ्रेमवर्क के साथ तुलना में है। आइए इन पहलुओं को विस्तार से देखें।
टिनीसैम : कुशल सेगमेंट एनीथिंग मॉडल
सेगमेंट एनीथिंग मॉडल ने अपनी प्रशंसनीय विभाजन क्षमताओं और विशाल विभाजन डेटासेट के साथ कई कंप्यूटर विजन अनुप्रयोगों में तेजी से प्रगति की है, जिसमें 11 मिलियन से अधिक छवियों और 1 अरब से अधिक छवि मास्क हैं। इसकी असाधारण प्रदर्शन के कारण, यह फ्रेमवर्क डाउनस्ट्रीम कार्यों जैसे छवि इनपेंटिंग, वस्तु ट्रैकिंग, 3डी दृष्टि और अधिक के लिए आधार बनता है। इसके अलावा, सेगमेंट एनीथिंग मॉडल शून्य-शॉट विभाजन प्रदर्शन प्रदान करता है, जो सीमित डेटा वाले उद्योगों जैसे चिकित्सा अनुसंधान और चिकित्सा इमेजिंग में लाभकारी है।
हालांकि, सेगमेंट एनीथिंग मॉडल की जटिल वास्तुकला और उच्च गणनात्मक आवश्यकताओं के कारण, यह कम गणनात्मक संसाधनों वाले उपकरणों पर लागू करना मुश्किल है। हाल के कार्यों जैसे मोबाइलएसएएम और फास्टएसएएम ने एक अधिक गणनात्मक रूप से कुशल एसएएम मॉडल विकसित करने का प्रयास किया है, लेकिन वे शून्य-शॉट डाउनस्ट्रीम कार्यों पर प्रदर्शन को बनाए रखने में असमर्थ रहे हैं।
टिनीसैम या टिनी सेगमेंट एनीथिंग मॉडल एसएएम मॉडल की गणनात्मक आवश्यकताओं को कम करने का एक प्रयास है जो शून्य-शॉट डाउनस्ट्रीम कार्यों पर प्रदर्शन को प्रभावित नहीं करता है। टिनीसैम फ्रेमवर्क एक पूर्ण-चरण ज्ञान संक्षेपण विधि का प्रस्ताव करता है जो छात्र नेटवर्क की क्षमता में सुधार करने के लिए है। फ्रेमवर्क ऑनलाइन हार्ड प्रोम्प्ट्स के साथ ज्ञान संक्षेपण प्रक्रिया को और बढ़ाता है। इसके अलावा, टिनीसैम फ्रेमवर्क पोस्ट-ट्रेनिंग क्वांटीकरण को प्रॉम्प्टेबल सेगमेंटेशन कार्यों के लिए अनुकूलित करता है।
टिनीसैम : वास्तुकला और विधि
टिनीसैम फ्रेमवर्क की वास्तुकला और विधि को समझने से पहले, एसएएम फ्रेमवर्क को देखना महत्वपूर्ण है। एसएएम मॉडल ने अपनी प्रस्तुति के बाद से उल्लेखनीय प्रदर्शन, बहुमुखी प्रतिभा और सामान्यीकरण क्षमता प्रदर्शित की है।
एसएएम मॉडल में तीन उप-नेटवर्क होते हैं: प्रॉम्प्ट एनकोडर, छवि एनकोडर और मास्क डिकोडर। प्रॉम्प्ट एनकोडर का मुख्य उद्देश्य मनमाने आकार के मास्क, इनपुट बिंदुओं और बॉक्सों और मुक्त-रूप में पाठ को स्थानीय जानकारी के साथ एनकोड करना है। छवि एनकोडर एक भारी वीआईटी या दृश्य ट्रांसफॉर्मर आधारित नेटवर्क है जो इनपुट छवि को एम्बेडिंग में परिवर्तित करता है। मॉडल ज्यामितीय और पाठ प्रॉम्प्ट्स को संसाधित करने के लिए अलग-अलग नेटवर्क का उपयोग करता है। अंत में, मास्क डिकोडर में एक दो-तरफ़ा ट्रांसफॉर्मर होता है जो प्रॉम्प्ट और छवि एनकोडर के आउटपुट को प्राप्त करता है और अंतिम मास्क पूर्वानुमान उत्पन्न करता है।
ज्ञान संक्षेपण
ज्ञान संक्षेपण एक महत्वपूर्ण दृष्टिकोण है जो प्रशिक्षण चरण के दौरान कॉम्पैक्ट नेटवर्क के प्रदर्शन को बढ़ाने में मदद करता है। ज्ञान संक्षेपण विधि शिक्षक नेटवर्क के आउटपुट का उपयोग छात्र नेटवर्क के प्रशिक्षण को पर्यवेक्षित करने के लिए करती है। ज्ञान संक्षेपण विधि को दो उप-श्रेणियों में विभाजित किया जा सकता है: मध्यवर्ती विशेषताओं के लिए संक्षेपण और नेटवर्क आउटपुट के लिए संक्षेपण, जिसमें अधिकांश शोध कार्य ज्ञान संक्षेपण पर केंद्रित है चित्र वर्गीकरण कार्यों पर।
टिनीसैम फ्रेमवर्क ज्ञान संक्षेपण को एसएएम फ्रेमवर्क के लिए विशेष रूप से डिज़ाइन किया गया है, और ऑनलाइन हार्ड प्रोम्प्ट्स के साथ ज्ञान संक्षेपण प्रक्रिया को और बढ़ाता है।
पूर्ण-चरण ज्ञान संक्षेपण
जैसा कि पहले उल्लेख किया गया है, सेगमेंट एनीथिंग मॉडल में तीन उप-नेटवर्क होते हैं: प्रॉम्प्ट एनकोडर, छवि एनकोडर और मास्क डिकोडर, जिसमें छवि एनकोडर घटक एक दृश्य ट्रांसफॉर्मर पर आधारित होता है और उच्च गणनात्मक आवश्यकताओं की आवश्यकता होती है। मोबाइलएसएएम फ्रेमवर्क ने दृश्य ट्रांसफॉर्मर को टिनीवीआईटी से बदल दिया, लेकिन प्रतिस्थापन प्रभावी नहीं था क्योंकि महत्वपूर्ण प्रदर्शन में गिरावट आई थी। टिनीसैम फ्रेमवर्क एक पूर्ण-चरण ज्ञान संक्षेपण विधि को लागू करता है जो छात्र नेटवर्क को कई ज्ञान स्तरों से मार्गदर्शन करता है।
क्वांटीकरण
मॉडल क्वांटीकरण कंप्यूटर विजन फ्रेमवर्क में एक लोकप्रिय दृष्टिकोण है, जो मॉडल को संकुचित करने और गणनात्मक जटिलता और संग्रहण आवश्यकताओं को कम करने के लिए उच्च बैंडविड्थ से निम्न बैंडविड्थ में वजन या सक्रियण को क्वांटाइज़ करने का प्रयास करता है।
टिनीसैम में क्वांटीकरण का मुख्य उद्देश्य फ्लोटिंग पॉइंट टेंसर को बिट इंटिजर टेंसर में परियोजना करना है, जिसमें मैट्रिक्स गुणन और क्वांटाइज्ड मैट्रिक्स के बीच दूरी को मापने वाले मीट्रिक का महत्व स्केलिंग फैक्टर को अनुकूलित करने में महत्वपूर्ण भूमिका निभाता है।
हायरार्किकल सेगमेंट एनीथिंग
सेगमेंट एनीथिंग मॉडल एक स्वचालित मास्क जनरेटर का प्रस्ताव करता है जो ग्रिड बिंदुओं के रूप में बिंदुओं का नमूना लेता है ताकि छवि में सब कुछ विभाजित किया जा सके। हालांकि, यह संकेत दिया गया है कि घने बिंदु ग्रिड का उपयोग करने से अधिक महीन-दानेदार विभाजन आउटपुट होता है और प्रक्रिया में महत्वपूर्ण गणनात्मक आवश्यकताओं और उच्च परिचालन लागतें होती हैं।
टिनीसैम : प्रयोग और परिणाम
टिनीसैम फ्रेमवर्क ने शून्य-शॉट डाउनस्ट्रीम कार्यों पर प्रभावशाली प्रदर्शन प्रदर्शित किया है, जिसमें मौजूदा तरीकों को पार करने वाली उदाहरण विभाजन सटीकता और फ्लॉप्स स्कोर है।
अंतिम विचार
इस लेख में, हमने टिनीसैम के बारे में चर्चा की है, जो एक प्रस्तावित फ्रेमवर्क है जो किसी भी कार्य को विभाजित करने की सीमाओं को आगे बढ़ाता है और एक कुशल मॉडल वास्तुकला प्राप्त करता है जिसमें कम गणनात्मक आवश्यकताएं और मूल एसएएम फ्रेमवर्क के साथ तुलना में सटीकता है। टिनीसैम फ्रेमवर्क एक पूर्ण-चरण ज्ञान संक्षेपण विधि को लागू करता है जो ऑनलाइन हार्ड प्रोम्प्ट्स के साथ एक हल्के छात्र मॉडल को संक्षिप्त करता है। टिनीसैम फ्रेमवर्क पोस्ट-ट्रेनिंग क्वांटीकरण को प्रॉम्प्टेबल सेगमेंटेशन कार्यों के लिए अनुकूलित करता है और हायरार्किकल सेगमेंट एनीथिंग का लक्ष्य रखता है जो बिना प्रदर्शन को प्रभावित किए लगभग दोगुनी अनुमान गति प्रदान करता है।












