Anderson का एंगल

एआई पृष्ठभूमि हटाने में सुधार बिना महंगी मानव अनुसंधान के

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
An interpretation of some of the supplementary video material for the project SAM2Matting, featuring real footage of an Asian woman dropped out onto a green background by the new method. Source: https://henghuiding.com/SAM2Matting/

नई अनुसंधान से पता चलता है कि एआई वीडियो से लोगों को साफ-साफ काट सकता है बिना महंगी मानव लेबलिंग के, गुणवत्ता और स्थिरता में सुधार करते हुए

 

हममें से अधिकांश लोगों ने वीडियो चैट प्लेटफ़ॉर्म पर साधारण पृष्ठभूमि-अल्टरिंग/अस्पष्टता फ़िल्टर के माध्यम से ‘ड्रॉप्ड आउट’ होने का अनुभव किया होगा – और हमें ऐसी प्रणालियों की सीमाओं का एहसास हो सकता है, जो वीडियो कॉन्फ़्रेंस में मिलने वाले सबसे आम प्रकार के मामलों पर प्रशिक्षित होती हैं, और आमतौर पर ‘अप्रत्याशित’ चीजों के लिए मजबूत नहीं होती हैं – या यहां तक कि पredictable वस्तुओं के लिए भी, जैसे कि उंगलियाँ:

एक एआई-ट्रेन्ड फ़ॉरग्राउंड एक्सट्रैक्शन सिस्टम का एक उदाहरण जो स्रोत विषय को बहुत अधिक काट देता है। स्रोत - https://techcommunity.microsoft.com/discussions/microsoftteamspublicpreview/now-in-public-preview-green-screen-feature-in-teams-meetings/3786020

एक एआई-ट्रेन्ड फ़ॉरग्राउंड एक्सट्रैक्शन सिस्टम का एक उदाहरण जो स्रोत विषय को बहुत अधिक काट देता है. स्रोत

सबसे आसान समाधान, और जो विज़न लैंग्वेज मॉडल (वीएलएम) के सामने बढ़ रहा है जो ऐसे कार्यों के लिए विशेष रूप से प्रशिक्षित नहीं हैं, वह है फ़ाइन-ट्यून एक मौजूदा मॉडल को डेटा पर जो सिस्टम द्वारा मिलने की संभावना है।

2020 के पेपर 'रियल-टाइम हाई-रेज़ोल्यूशन बैकग्राउंड मैटिंग' में प्रस्तुत समाधानों के लिए दो उच्च-वॉल्यूम, अत्यधिक एनोटेटेड डेटासेट। स्रोत - https://arxiv.org/pdf/2012.07810

2020 के पेपर ‘रियल-टाइम हाई-रेज़ोल्यूशन बैकग्राउंड मैटिंग’ में प्रस्तुत समाधानों के लिए दो उच्च-वॉल्यूम, अत्यधिक एनोटेटेड डेटासेट. स्रोत

हालांकि, ऐसे डेटा को मानव द्वारा कुछ खर्च और समय की लागत पर एनोटेट किया जाना चाहिए; और किसी भी मामले में, यह एक बहुत ही विशिष्ट और गैर-व्यापक उपकरण का परिणाम है, जो बहुत पैसा खर्च करता है, और आमतौर पर विभिन्न कार्यों के लिए उपयोग नहीं किया जा सकता है।

इसके अलावा, इस प्रकार के ‘लक्षित’ मॉडल विकसित करना वर्तमान में विभिन्न डोमेन में प्रभावी अनुमान के लिए सबसे छोटा मार्ग है, न कि केवल वीडियो और छवि मैटिंग (अर्थात पृष्ठभूमि हटाने/फ़ॉरग्राउंड मैट्स)। अब तक, अधिकांश अनुसंधान समाधानों ने मूल रूप से समस्या को एक प्लेट पर धकेल दिया है।

अब भी, ज़ूम जैसे प्लेटफ़ॉर्म में एआई-संवर्धित फ़िल्टर के प्रसार के बावजूद, ज़ूम अभी भी एक हरे रंग की स्क्रीन की सिफारिश करता है पृष्ठभूमि हटाने के लिए सबसे अच्छा समाधान – एक भारी और थोड़ा ‘पेशेवर’ समाधान जो शायद अधिकांश लोगों को थोड़ा स्वार्थी बना देगा।

काट दें!

हाल के दिनों में, रुचि बढ़ी है स्वचालित और बारीकी से निकालने के लिए सेगमेंट एनीथिंग (एसएएम) परिवार का उपयोग करने में। चूंकि एसएएम को विशेष रूप से ऐसे कार्यों के लिए प्रशिक्षित नहीं किया गया था, बल्कि एनोटेशन में सहायता के लिए, इसकी डिफ़ॉल्ट सीमाएं इस चुनौती का सामना करने के लिए उपयुक्त नहीं हैं:

ज़रूरत पड़ने पर खेलने के लिए क्लिक करें। एक सेगमेंट एनीथिंग मॉडल द्वारा बनाई गई खुरदरी सीमाओं का एक उदाहरण – एनोटेशन के लिए आदर्श, लेकिन वीएफएक्स ड्रॉप-आउट के लिए पर्याप्त नहीं। स्रोत 

चीन से एक हालिया प्रस्ताव ने एसएएम मॉडल का उपयोग करके निकालने की प्रक्रिया में सुधार करने का एक अधिक परिष्कृत तरीका प्रस्तावित किया है – एक समर्पित मैटिंग हेड्स के साथ एक क्षेत्र-प्रस्ताव सेतु के साथ एक मूल ट्रैकर जैसे एसएएम को जोड़कर। इस तरह, प्रणाली सीमा विवरण को पुनरावृत्ति द्वारा परिष्कृत कर सकती है और चुनौतीपूर्ण सीमाओं जैसे कि बालों में गति को हल कर सकती है:

ज़रूरत पड़ने पर खेलने के लिए क्लिक करें। लेखकों की विधि के लिए पूरक वीडियो का एक संग्रह, जो निकालने की जटिलता को प्रदर्शित करता है। स्रोत 

महत्वपूर्ण बात यह है कि नई संयुक्त प्रणाली केवल छवियों पर प्रशिक्षित होती है, वीडियो नहीं, और किसी अतिरिक्त मानव एनोटेशन की आवश्यकता नहीं होती है – पारंपरिक बाधा इस, और विभिन्न अन्य एआई डोमेन में प्रगति के खिलाफ।

नई विधि के साथ प्राप्त छवि और वीडियो मैटिंग के उदाहरण, जिसमें बाल, पारदर्शिता और गति जैसे चुनौतीपूर्ण मामलों को दिखाया गया है, साथ ही वाइल्ड सीक्वेंस भी हैं जहां विधि - लेखकों का दावा है - पिछले दृष्टिकोणों की तुलना में साफ़ और अधिक स्थिर परिणाम उत्पन्न करती है। स्रोत - https://arxiv.org/pdf/2606.27339

नई विधि के साथ प्राप्त छवि और वीडियो मैटिंग के उदाहरण, जिसमें बाल, पारदर्शिता और गति जैसे चुनौतीपूर्ण मामलों को दिखाया गया है, साथ ही वाइल्ड सीक्वेंस भी हैं जहां विधि – लेखकों का दावा है – पिछले दृष्टिकोणों की तुलना में साफ़ और अधिक स्थिर परिणाम उत्पन्न करती है। स्रोत

तीन प्रायोगिक मॉडल का उत्पादन इस काम के लिए किया गया है, लेखक दावा करते हैं कि इस कार्य में नए राज्य-ऑफ-द-आर्ट प्रदर्शन, जबकि आधार मॉडल की उच्च सामान्यीकरण क्षमताओं को बनाए रखना, जिसका अर्थ है कि विधि एक सभी उद्देश्य मॉडल का उत्पादन करती है जिसमें अतिरिक्त क्षमताएं हैं, बल्कि एक सिलो किए गए उपकरण को एकल कार्य के लिए लक्षित किया जाता है।

लेखकों का कहना है:

‘व्यापक प्रयोग यह दिखाते हैं कि एसएएम2मैटिंग छवि और वीडियो मैटिंग दोनों पर राज्य-ऑफ-द-आर्ट (एसओटीए) प्रदर्शन प्राप्त करता है, वीडियो मैटिंग का मूल्यांकन सख्ती से शून्य-शॉट तरीके से किया जाता है। ‘

‘विस्तृत इन-द-वाइल्ड परिणाम आगे इसकी मजबूत सामान्यीकरण को खुले दुनिया के दृश्यों में तेज़ गति, जटिल पृष्ठभूमि और लक्ष्य संलग्नक (जैसे कि आदमी साइकिल चला रहा है) के साथ प्रदर्शित करते हैं। ‘

‘इसके अलावा, हमारे मैटिंग घटक हल्के और कुशल हैं, एसएएम2.1-टिनी संस्करण को 40 एफपीएस पर 200 फ्रेम 1080पी वीडियो का उपयोग करके कम से कम 5GB जीपीयू मेमोरी का उपयोग करके चलने में सक्षम बनाते हैं। ‘

नई कागज़ का शीर्षक एसएएम2मैटिंग: सामान्यीकृत छवि और वीडियो मैटिंग है, और यह फुदान विश्वविद्यालय और शंघाई विश्वविद्यालय ऑफ फाइनेंस एंड इकोनॉमिक्स के चार लेखकों से है। काम में एक गिटहब रिपॉजिटरी है, जिसने लेखन के समय विभिन्न संस्करणों के चेकपॉइंट, अनुमान कोड, और एक इंटरैक्टिव डेमो जारी किया है, और प्रशिक्षण कोड की रिलीज़ का वादा किया है। इसके अलावा, एक प्रोजेक्ट साइट है।

विधि

लेखकों की विधि एक वीडियो ऑब्जेक्ट सेगमेंटेशन (वीओएस) ट्रैकर का उपयोग करके प्रत्येक फ्रेम के लिए एक समय-समय पर सुसंगत खुरदरा मास्क का उत्पादन करने के लिए ट्रैकिंग को फ़ाइन डिटेल निकासी से अलग करती है, जबकि एक समर्पित मैटिंग पाइपलाइन सीमाओं को परिष्कृत करती है:

पाइपलाइन का अवलोकन, जहां एक लचीला प्रॉम्प्ट और इनपुट वीडियो एक वीडियो ऑब्जेक्ट सेगमेंटेशन ट्रैकर में खिलाया जाता है जो एक खुरदरा मास्क का उत्पादन करता है, जिसे एक क्षेत्र-रुचि-डिटेक्टर द्वारा परिष्कृत किया जाता है और एक ट्रिमैप में परिवर्तित किया जाता है trước एक प्रगतिशील बहु-स्केल प्रेडिक्टर द्वारा अंतिम उच्च-विस्तार मैट का उत्पादन किया जाता है।

पाइपलाइन का अवलोकन, जहां एक लचीला प्रॉम्प्ट और इनपुट वीडियो एक वीडियो ऑब्जेक्ट सेगमेंटेशन ट्रैकर में खिलाया जाता है जो एक खुरदरा मास्क का उत्पादन करता है, जिसे एक क्षेत्र-रुचि-डिटेक्टर द्वारा परिष्कृत किया जाता है और एक ट्रिमैप में परिवर्तित किया जाता है पहले एक प्रगतिशील बहु-स्केल प्रेडिक्टर द्वारा अंतिम उच्च-विस्तार मैट का उत्पादन किया जाता है।

एक क्षेत्र-रुचि-डिटेक्टर तब क्षेत्रों की पहचान करता है जिनमें फ़ाइन डिटेल या अर्ध-पारदर्शिता होती है, उन्हें एक ट्रिमैप (एक तीन-क्षेत्र मास्क जो फ़ॉरग्राउंड, पृष्ठभूमि और अनिश्चित क्षेत्रों को विभाजित करता है) में परिवर्तित करता है जो परिष्करण को निर्देशित करता है, जिसके बाद एक प्रगतिशील अल्फ़ा प्रेडिक्टर अंतिम मैट का उत्पादन करता है एक कोarse-से-फ़ाइन कैस्केड के माध्यम से कई स्केल पर

पारंपरिक मैटिंग सिस्टम आमतौर पर मॉर्फोलॉजिकल ऑपरेशन का उपयोग करके या सीधे मास्क को पुनः उपयोग करके रुचि के क्षेत्रों को व्युत्पन्न करते हैं – जो दृष्टिकोण या तो फ़ाइन डिटेल को नजरअंदाज कर सकते हैं, या उन क्षेत्रों को शामिल कर सकते हैं जिन्हें परिष्करण की आवश्यकता नहीं है:

मानक मास्क-आधारित प्रसंस्करण की तुलना में मॉर्फोलॉजिकल ऑपरेशन द्वारा उत्पादित खुरदरी, समान सीमाओं को दिखाता है, जो बाल और पारदर्शिता जैसी फ़ाइन संरचनाओं को याद करते हैं, जिससे अंतिम मैट में विवरण की हानि होती है।

मानक मास्क-आधारित प्रसंस्करण की तुलना में मॉर्फोलॉजिकल ऑपरेशन द्वारा उत्पादित खुरदरी, समान सीमाओं को दिखाता है, जो बाल और पारदर्शिता जैसी फ़ाइन संरचनाओं को याद करते हैं, जिससे अंतिम मैट में विवरण की हानि होती है।

संयुक्त ब्याज

इसके विपरीत, प्रस्तावित क्षेत्र-रुचि-डिटेक्टर इस चरण को एक पिक्सेल-वार वर्गीकरण कार्य के रूप में मानता है (अर्थात प्रत्येक व्यक्ति पिक्सेल को एक अलग निर्णय के रूप में मानता है, और इसे एक लेबल असाइन करता है कि क्या यह एक मैटिंग-क्रिटिकल क्षेत्र से संबंधित है या नहीं) जो वीओएस मास्क, वर्तमान फ्रेम, और मल्टी-स्केल इमेज फीचर्स को एकीकृत करता है, मैटिंग-क्रिटिकल क्षेत्रों को अधिक सटीक रूप से अलग करने के लिए।

नई दृष्टि में, अनुमानित आरओआई को पहले एक पस्यूडो-ट्रिमैप में परिवर्तित किया जाता है जो निश्चित फ़ॉरग्राउंड और पृष्ठभूमि को अनिश्चित क्षेत्रों से अलग करता है, ट्रैकर मास्क का उपयोग ज्ञात क्षेत्रों को असाइन करने के लिए करता है, जबकि आरओआई को अस्पष्ट के रूप में चिह्नित किया जाता है, ताकि बाद की प्रसंस्करण विशेष रूप से उन सीमाओं पर ध्यान केंद्रित कर सके जहां विवरण को हल किया जाना चाहिए।

परिष्करण तब एक प्रगतिशील अल्फ़ा प्रेडिक्टर द्वारा संभाला जाता है जो मैटिंग को एक कदम-दर-कदम प्रक्रिया के रूप में मानता है, मध्यवर्ती परिणामों को खुरदरे से अधिक बारीक स्केल पर पारित करता है, प्रत्येक चरण में छवि, ट्रिमैप, और पिछले अनुमान का उपयोग करके संरचना को धीरे-धीरे तेज करने और फ़ाइन विवरण को पुनः प्राप्त करने के लिए।

अंतिम चरण में, उच्चतम-रेज़ोल्यूशन आउटपुट को अपसैम्पल किया जाता है ताकि पूरा मैट बनाया जा सके, जिससे व्यापक आकार को पहले स्थापित किया जा सके जबकि फ़ाइनर तत्व जैसे कि बाल और पारदर्शिता बाद के पास में हल किए जाते हैं।

प्रशिक्षण के दौरान, लेखकों ने वीओएस ट्रैकर को जमाया, जबकि केवल मैटिंग घटकों को उच्च-गुणवत्ता वाली छवि डेटा पर प्रशिक्षित किया – जिससे फ़ाइन विवरण को परिष्कृत किया जा सके बिना ट्रैकिंग सुसंगतता को बिगाड़े। प्रत्येक फ्रेम पर पर्यवेक्षण लागू किया गया था, जिसमें रुचि के क्षेत्रों को मैदान-त्रुटि अल्फ़ा मैट से व्युत्पन्न किया गया था, और सीखने को निर्देशित करने के लिए उपयोग किया गया था, जबकि आरओआई डिटेक्टर को नुकसान के साथ प्रशिक्षित किया गया था जो सटीक सीमा वर्गीकरण को प्रोत्साहित करने और खुरदरे कलाकृतियों को कम करने के लिए डिज़ाइन किया गया था।

अल्फ़ा अनुमान के लिए, नुकसान को कई स्केल पर लागू किया गया था ताकि विवरण में सुधार हो सके, साथ ही एक अतिरिक्त प्रतिबंध जो अनुमानित मैट को मूल मास्क के साथ संरेखित रखने में मदद करता है – संरचना को संरक्षित करने और खोखले या टूटे हुए क्षेत्रों को अंतिम आउटपुट में रोकने में मदद करता है।

डेटा और परीक्षण

आठ छवि मैटिंग डेटासेट का उपयोग शुरू में परीक्षण के लिए किया गया था: आई-एचआईएम50के; पी3एम-10के; सेलेबीएएचएयरमास्क-एचक्यू; एआईएम-500; विभेद-646; एएम-2के; यूएचआरआईएम; और रेफमैट; और तीन संस्करणों को ‘सैम2मैटिंग’ दृष्टिकोण के रूप में विकसित किया गया था, जो क्रमशः एसएएम2.1-टिनी; एसएएम2.1-बेस+; और एसएएम3 का उपयोग करते हैं।

ट्रैकर घटक को जमाया गया था, जबकि केवल मैटिंग घटकों को अनुकूलित किया गया था। सभी संस्करणों को पांच प्रायोगिक के लिए प्रशिक्षित किया गया था चार एनवीडिया ए6000 जीपीयू पर, प्रत्येक के पास 48GB का वीआरएएम आवंटन था। एक बैच आकार 32 का उपयोग किया गया था, एडमडब्ल्यू ऑप्टिमाइज़र के तहत। मीट्रिक का उपयोग किया गया था मीन एब्सोल्यूट डिफ़रेंस (एमएडी); मीन स्क्वायर्ड एरर (एमएसई); ग्रेडिएंट (ग्रेड); कनेक्टिविटी (कॉन); और dtSSD (केवल वीडियो मैटिंग के लिए)।

मात्रात्मक परीक्षण

लेखकों ने छवि मैटिंग पर नए सिस्टम के मात्रात्मक परीक्षण के साथ शुरू किया, पी3एम-500-एनपी; एएम-2के (‘जीएफएम’ परिणाम में); एमएएम (‘मैट एनीथिंग’, परिणाम में); ई2ई-एचआईएम; लाइटवेट; और पीपीएम-100 (‘मॉडनेट’, परिणाम में) के बेंचमार्क का उपयोग करते हुए:

पी3एम-500-एनपी, एएम-2के, और पीपीएम-100 पर मात्रात्मक परिणाम, सभी मीट्रिक पर बेहतर प्रदर्शन दिखाते हुए, और सर्वोत्तम, दूसरा सर्वोत्तम, और तीसरा सर्वोत्तम परिणाम लाल, नारंगी, और पीले रंग में हैं।

पी3एम-500-एनपी, एएम-2के, और पीपीएम-100 पर मात्रात्मक परिणाम, सभी मीट्रिक पर बेहतर प्रदर्शन दिखाते हुए, और सर्वोत्तम, दूसरा सर्वोत्तम, और तीसरा सर्वोत्तम परिणाम लाल, नारंगी, और पीले रंग में हैं।

इन परिणामों में, पत्र में कहा गया है:

‘जैसा कि [ऊपर] दिखाया गया है, एसएएम2मैटिंग के तीनों संस्करण लगातार विभिन्न मीट्रिक पर पिछले बेसलाइन को पार करते हैं। उदाहरण के लिए, एसएएम2.1-टिनी संस्करण पी3एम-500-एनपी पर एमएएम की तुलना में 11.48 कम एमएडी हासिल करता है। ‘

लेखकों का दावा है कि परिणामों से पता चलता है कि उनका दृष्टिकोण मुख्य रूप से डेटा क्यूरेशन के स्तर के कारण नहीं, बल्कि मूल अवधारणात्मक डिज़ाइन के कारण बेहतर परिणाम प्राप्त करता है।

वीडियो मैटिंग के लिए, एसएएम2मैटिंग का मूल्यांकन वी-एचआईएम60 और वीडियोमैट पर एक शून्य-शॉट सेटिंग में किया गया था, वीडियो-प्रशिक्षित सिस्टम मैटएनीथिंग2, मैटएनीथिंग, मैगी, एफटीपी-वीएम, और आरवीएम के खिलाफ, मध्यम और कठिन विभाजन दोनों पर निरंतर लाभ की सूचना दी गई थी।

सभी बेंचमार्क पर, तीन संस्करणों ने एमएडी, एमएसई, ग्रेड, कॉन, और डीटीएसएसडी पर कम त्रुटियों को दर्ज किया, एसएएम3 ने समग्र रूप से सबसे मजबूत परिणाम हासिल किए, जबकि निम्नतम डीटीएसएसडी मूल्यों ने अधिक स्थिर फ्रेम-टू-फ्रेम सुसंगतता का संकेत दिया:

वी-एचआईएम60 और वीडियोमैट पर वीडियो मैटिंग बेंचमार्क, शून्य-शॉट सेटिंग में मूल्यांकन किया गया, सभी मीट्रिक पर कम त्रुटियों को दिखाते हुए, और सर्वोत्तम, दूसरा सर्वोत्तम, और तीसरा सर्वोत्तम परिणाम लाल, नारंगी, और पीले रंग में हैं।

वी-एचआईएम60 और वीडियोमैट पर वीडियो मैटिंग बेंचमार्क, शून्य-शॉट सेटिंग में मूल्यांकन किया गया, सभी मीट्रिक पर कम त्रुटियों को दिखाते हुए, और सर्वोत्तम, दूसरा सर्वोत्तम, और तीसरा सर्वोत्तम परिणाम लाल, नारंगी, और पीले रंग में हैं।

लेखकों का दावा है कि ये परिणाम डिकपल्ड डिज़ाइन को प्रतिबिंबित करते हैं, जहां वीओएस ट्रैकर समय-समय पर संरचना को संरक्षित करता है और मैटिंग मॉड्यूल सीमा विवरण पर ध्यान केंद्रित करते हैं, जिससे छवि-प्रशिक्षित मॉडल पूरी तरह से पर्यवेक्षित वीडियो दृष्टिकोणों से बेहतर हो जाते हैं।

गुणात्मक परीक्षण

मानव मैटिंग के लिए गुणात्मक परीक्षण में, लेखकों ने पाया कि सैम2मैटिंग प्रतिस्पर्धी बेसलाइन को पार करता है:

मानव और वाइल्ड वीडियो मैटिंग पर गुणात्मक तुलना, जहां एसएएम2मैटिंग आरवीएम और मैटएनीथिंग की तुलना में बालों के पतले धागे और अर्ध-पारदर्शी क्षेत्रों को अधिक सटीक रूप से संरक्षित करता है, जिससे चुनौतीपूर्ण क्षेत्रों में साफ़ सीमाएं और कम गुम हुए संरचनाएं बनती हैं।

मानव और वाइल्ड वीडियो मैटिंग पर गुणात्मक तुलना, जहां एसएएम2मैटिंग आरवीएम और मैटएनीथिंग की तुलना में बालों के पतले धागे और अर्ध-पारदर्शी क्षेत्रों को अधिक सटीक रूप से संरक्षित करता है, जिससे चुनौतीपूर्ण क्षेत्रों में साफ़ सीमाएं और कम गुम हुए संरचनाएं बनती हैं।

जैसा कि नीचे दिखाया गया है, मौजूदा वीडियो मैटिंग सिस्टम जैसे मैटएनीथिंग2 और मैगी, जो डोमेन-विशिष्ट और अक्सर मानव-केंद्रित डेटासेट पर प्रशिक्षित होते हैं, वाइल्ड सीक्वेंस पर सामान्यीकरण करने में संघर्ष करते हैं, विशेष रूप से जब तेजी से चलते विषयों जैसे बढ़ती जड़ें, अर्ध-पारदर्शी तितली और तेजी से गिरते पानी को संभालना होता है:

वाइल्ड सीक्वेंस पर गुणात्मक तुलना, जहां एसएएम2मैटिंग मैटएनीथिंग2 और मैगी की तुलना में फ़ाइन संरचनाओं और समय-समय पर सुसंगतता को अधिक प्रभावी ढंग से संरक्षित करता है, विशेष रूप से गैर-मानव विषयों, तेज़ गति और अर्ध-पारदर्शी तत्वों जैसे पानी, ग्लास और कीट के पंखों के लिए।

वाइल्ड सीक्वेंस पर गुणात्मक तुलना, जहां एसएएम2मैटिंग मैटएनीथिंग2 और मैगी की तुलना में फ़ाइन संरचनाओं और समय-समय पर सुसंगतता को अधिक प्रभावी ढंग से संरक्षित करता है, विशेष रूप से गैर-मानव विषयों, तेज़ गति और अर्ध-पारदर्शी तत्वों जैसे पानी, ग्लास और कीट के पंखों के लिए।

इसके विपरीत, एसएएम2मैटिंग इन चुनौतीपूर्ण दृश्यों में स्थिर ट्रैकिंग बनाए रखने और विवरण को अधिक विश्वसनीय रूप से निकालने में सक्षम साबित हुआ।

अंत में, जैसा कि नीचे दिखाया गया है, एसएएम2मैटिंग ने जुड़े हुए वस्तुओं वाले लक्ष्यों को प्रभावी ढंग से संभाला, जैसे कि साइकिल चला रहे लोग या स्की पोल पकड़े हुए, जबकि निकटवर्ती पृष्ठभूमि विकर्षण को दबा दिया, पहले वर्णित मैट-मास्क सुसंगतता प्रतिबंध से लाभान्वित हुआ:

जुड़े हुए वस्तुओं और पृष्ठभूमि विकर्षण वाले सीक्वेंस पर गुणात्मक तुलना, जहां एसएएम2मैटिंग मैटएनीथिंग2 की तुलना में साइकिल और स्की पोल जैसी संरचनाओं को अधिक सटीक रूप से संरक्षित करता है, जबकि निकटवर्ती क्लUTTER को दबा देता है और फ्रेम में साफ़ सिल्हूट बनाए रखता है।

जुड़े हुए वस्तुओं और पृष्ठभूमि विकर्षण वाले सीक्वेंस पर गुणात्मक तुलना, जहां एसएएम2मैटिंग मैटएनीथिंग2 की तुलना में साइकिल और स्की पोल जैसी संरचनाओं को अधिक सटीक रूप से संरक्षित करता है, जबकि निकटवर्ती क्लUTTER को दबा देता है और फ्रेम में साफ़ सिल्हूट बनाए रखता है।

निष्कर्ष

नई पत्र में वर्णित उपलब्धियां दर्शाती हैं कि निकासी, कंप्यूटर विजन में सबसे पुराने कार्यों में से एक, अभी भी असुलझा हुआ है और सामान्य दृष्टिकोणों के लिए प्रतिरोधी है। जैसा कि कई अन्य दृष्टि-आधारित मॉडल के साथ है, समस्या यह है कि निकासी एल्गोरिदम डोमेन ज्ञान से चिपक जाते हैं और अज्ञात और अनदेखी वस्तुओं के लिए आसानी से अनुकूलित नहीं होते हैं; यह विशेष कार्य मॉडल की सामान्यीकरण की बाहरी सीमा को तनाव देता है।

जबकि नई कार्य एक पूर्ववर्ती पर निर्भरता से आगे एक कदम है, अभी भी बहुत काम करना बाकी है, यह देखते हुए कि यह कार्य हमारे दैनिक जीवन में वीडियो चैट पोर्टल के माध्यम से कितना गहराई से जुड़ा हुआ है।

 

सोमवार, 13 जुलाई, 2026 को पहली बार प्रकाशित

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai