Anderson का एंगल
सीन को समझने वाली AI इमेज मैटिंग

2003 DVD रिलीज़ के साथ जारी एक्स्ट्रा डॉक्यूमेंट्री में, जिसमें Alien3 (1992) शामिल है, विज़ुअल इफ़ेक्ट्स के दिग्गज रिचर्ड एडलंड ने फ़ोटोकेमिकल मैट एक्सट्रैक्शन की ‘सूमो रेसलिंग’ को भयावह रूप में याद किया, जो देर 1930 के दशक से लेकर देर 1980 के दशक तक विज़ुअल इफ़ेक्ट्स कार्य को हावी करता रहा। एडलंड ने प्रक्रिया की अनियमित प्रकृति को ‘सूमो रेसलिंग’ कहा, जो शुरुआती 1990 के दशक में डिजिटल नीला/हरा स्क्रीन तकनीकों से तुलना में था (और उन्होंने तब से इस रूपक को दोबारा अपनाया)।
पृष्ठभूमि से एक अग्रभूमि तत्व (जैसे व्यक्ति या अंतरिक्ष यान मॉडल) को निकालना, ताकि कट‑आउट छवि को पृष्ठभूमि प्लेट में सम्मिलित किया जा सके, मूल रूप से एक समान नीले या हरे पृष्ठभूमि के सामने अग्रभूमि वस्तु को फिल्माकर हासिल किया जाता था।

ILM द्वारा ‘Return of the Jedi’ (1983) के VFX शॉट के लिए श्रमसाध्य फोटोकेमिकल एक्सट्रैक्शन प्रक्रियाएँ।
परिणामी फुटेज में, पृष्ठभूमि रंग को रासायनिक रूप से अलग किया जाता और फिर अग्रभूमि वस्तु (या व्यक्ति) को एक ऑप्टिकल प्रिंटर में पुनः प्रिंट करने के लिए टेम्प्लेट के रूप में उपयोग किया जाता, जिससे वह अन्यथा पारदर्शी फिल्म सेल में एक ‘फ़्लोटिंग’ वस्तु बन जाता।
इस प्रक्रिया को कलर सेपरेशन ओवरले (CSO) कहा जाता था – हालांकि यह शब्द अंततः 1970 और 1980 के दशक के कम बजट वाले टेलीविजन आउटपुट में कच्चे ‘Chromakey’ वीडियो इफ़ेक्ट्स से अधिक जुड़ गया, जो रासायनिक या डिजिटल तरीकों के बजाय एनालॉग द्वारा प्राप्त किए जाते थे।

1970 में ब्रिटिश बाल शो ‘Blue Peter’ के लिए कलर सेपरेशन ओवरले का एक प्रदर्शन। Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx
किसी भी स्थिति में, चाहे फ़िल्म हो या वीडियो तत्व, उसके बाद निकाली गई फुटेज को किसी भी अन्य फुटेज में सम्मिलित किया जा सकता था।
हालाँकि डिज़्नी की उल्लेखनीय रूप से महँगी और स्वामित्व वाली सोडियम‑वापर प्रक्रिया (जो विशेष रूप से पीले रंग पर की गई थी, और अल्फ़्रेड हिचकॉक की 1963 हॉरर The Birds में भी उपयोग की गई) बेहतर परिभाषा और स्पष्ट मैट प्रदान करती थी, फिर भी फोटोकेमिकल एक्सट्रैक्शन कठिन और अविश्वसनीय बना रहा।

डिज़्नी की स्वामित्व वाली सोडियम वॉपर एक्सट्रैक्शन प्रक्रिया को स्पेक्ट्रम के पीले अंत के निकट पृष्ठभूमि की आवश्यकता होती थी। यहाँ, एंजेला लैंसबरी को ‘Bedknobs and Broomsticks’ (1971) के VFX‑युक्त अनुक्रम के उत्पादन के दौरान तारों पर लटकाया गया है। Source
डिजिटल मैटिंग से परे
1990 के दशक में, डिजिटल क्रांति ने रसायनों को समाप्त कर दिया, लेकिन हरे स्क्रीन की आवश्यकता नहीं। अब यह संभव हो गया था कि फ़ोटोशॉप जैसे पिक्सेल‑एडिटिंग सॉफ़्टवेयर में उस रंग की सहनशीलता सीमा के भीतर पिक्सेल खोजकर हरे (या किसी भी रंग) पृष्ठभूमि को हटाया जा सके, और नई पीढ़ी के वीडियो‑कॉम्पोज़िटिंग सूट जो स्वचालित रूप से रंगीन पृष्ठभूमियों को की कर सकते थे। लगभग एक रात में, साठ साल की ऑप्टिकल प्रिंटिंग उद्योग इतिहास में लिख दी गई।
GPU‑सहायित कंप्यूटर विज़न अनुसंधान के पिछले दस वर्ष मैट एक्सट्रैक्शन को तीसरी युग में ले जा रहे हैं, शोधकर्ताओं को ऐसे सिस्टम विकसित करने की चुनौती दे रहे हैं जो हरे स्क्रीन की आवश्यकता के बिना उच्च‑गुणवत्ता वाले मैट निकाल सकें। केवल Arxiv पर, मशीन लर्निंग‑आधारित अग्रभूमि एक्सट्रैक्शन में नवाचारों से संबंधित पेपर साप्ताहिक रूप से प्रकाशित होते हैं।
हमें चित्र में रखना
AI एक्सट्रैक्शन में शैक्षणिक और उद्योगीय रुचि का यह केंद्र पहले ही उपभोक्ता क्षेत्र को प्रभावित कर चुका है: मोटे लेकिन काम करने योग्य कार्यान्वयन हम सभी को Zoom और Skype फ़िल्टरों के रूप में परिचित हैं, जो वीडियो कॉन्फ़्रेंस कॉल में हमारे लिविंग‑रूम पृष्ठभूमि को उष्णकटिबंधीय द्वीपों आदि से बदल सकते हैं।
हालाँकि, सबसे अच्छे मैट अभी भी हरे स्क्रीन की आवश्यकता रखते हैं, जैसा कि Zoom ने पिछले बुधवार बताया।

बाएँ, एक पुरुष हरे स्क्रीन के सामने, Zoom के वर्चुअल बैकग्राउंड फीचर द्वारा अच्छी तरह से निकाले गए बालों के साथ। दाएँ, एक महिला सामान्य घरेलू दृश्य के सामने, एल्गोरिदमिक रूप से निकाले गए बालों के साथ, कम सटीकता और अधिक कंप्यूटिंग आवश्यकताओं के साथ। Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image
Zoom सपोर्ट प्लेटफ़ॉर्म से एक और पोस्ट चेतावनी देती है कि गैर‑हरे‑स्क्रीन एक्सट्रैक्शन के लिए कैप्चर डिवाइस में अधिक कंप्यूटिंग शक्ति की आवश्यकता होती है।
कट‑आउट की आवश्यकता
गुणवत्ता, पोर्टेबिलिटी और संसाधन अर्थव्यवस्था में सुधार, जो ‘इन द वाइल्ड’ मैट एक्सट्रैक्शन सिस्टम (अर्थात् हरे स्क्रीन की आवश्यकता के बिना लोगों को अलग करना) के लिए है, केवल वीडियो‑कॉन्फ़्रेंसिंग फ़िल्टरों से अधिक कई क्षेत्रों और प्रयोजनों के लिए प्रासंगिक हैं।
डेटासेट विकास के लिए, उन्नत चेहरे, पूर्ण‑सिर और पूर्ण‑शरीर पहचान यह सुनिश्चित करने की संभावना प्रदान करती है कि अनावश्यक पृष्ठभूमि तत्व मानव विषयों के कंप्यूटर विज़न मॉडलों में प्रशिक्षित न हों; अधिक सटीक अलगाव सेमांटिक सेगमेंटेशन तकनीकों को बहुत सुधार देगा, जो डोमेनों (जैसे ‘cat’, ‘person’, ‘boat’) को अलग करने और सम्मिलित करने के लिए डिज़ाइन की गई हैं, और VAE और ट्रांसफ़ॉर्मर-आधारित इमेज सिंथेसिस सिस्टम जैसे OpenAI के नए DALL‑E 2 को सुधारेंगे; और बेहतर एक्सट्रैक्शन एल्गोरिदम महंगे मैन्युअल रोटोस्कोपिंग की आवश्यकता को कम करेंगे, जो महंगे VFX पाइपलाइन में होती है।
वास्तव में, मल्टीमॉडल (आमतौर पर टेक्स्ट/इमेज) पद्धतियों का उदय, जहाँ ‘cat’ जैसे डोमेन को इमेज और संबंधित टेक्स्ट संदर्भ दोनों के रूप में एन्कोड किया जाता है, पहले ही इमेज प्रोसेसिंग में प्रवेश कर रहा है। एक हालिया उदाहरण Text2Live आर्किटेक्चर है, जो मल्टीमॉडल (टेक्स्ट/इमेज) प्रशिक्षण का उपयोग करके वीडियो बनाता है, जिसमें अनगिनत संभावनाओं में क्रिस्टल स्वान और ग्लास जिराफ़ शामिल हैं।
सीन‑अवेयर AI मैटिंग
AI‑आधारित स्वचालित मैटिंग पर बहुत सारे शोध ने छवि या वीडियो फ्रेम के भीतर पिक्सेल‑आधारित समूहों की सीमा पहचान और मूल्यांकन पर ध्यान केंद्रित किया है। हालांकि, चीन से नया शोध एक एक्सट्रैक्शन पाइपलाइन प्रस्तुत करता है जो सीन की टेक्स्ट‑आधारित विवरणों (एक मल्टीमॉडल दृष्टिकोण जो पिछले 3‑4 वर्षों में कंप्यूटर विज़न शोध क्षेत्र में लोकप्रिय हुआ है) का उपयोग करके विभेदन और मैट गुणवत्ता को सुधारता है, और कई तरीकों से पूर्व विधियों से बेहतर होने का दावा करता है।

एक उदाहरण SPG‑IM एक्सट्रैक्शन (अंतिम छवि, नीचे दाएँ), जो प्रतिस्पर्धी पूर्व विधियों के साथ तुलना करता है। Source: https://arxiv.org/pdf/2204.09276.pdf
एक्सट्रैक्शन अनुसंधान उप‑क्षेत्र के सामने चुनौती यह है कि ऐसे कार्य‑प्रवाह तैयार किए जाएँ जिनके लिए न्यूनतम मैन्युअल एनोटेशन और मानवीय हस्तक्षेप की आवश्यकता हो – आदर्श रूप में, कोई नहीं। लागत प्रभावों के अलावा, नए पेपर के शोधकर्ता देखते हैं कि विभिन्न संस्कृतियों में आउटसोर्स्ड क्राउडवर्कर्स द्वारा किए गए एनोटेशन और मैन्युअल सेगमेंटेशन छवियों को विभिन्न तरीकों से लेबल या विभाजित कर सकते हैं, जिससे असंगत और असंतोषजनक एल्गोरिदम उत्पन्न होते हैं।
इसका एक उदाहरण है कि ‘फ़ोरग्राउंड ऑब्जेक्ट’ को कैसे परिभाषित किया जाता है, इसका व्यक्तिपरक व्याख्या:

नए पेपर से: पूर्व विधियों LFM और MODNet (‘GT’ का अर्थ ग्राउंड ट्रुथ है, एक ‘आदर्श’ परिणाम जो अक्सर मैन्युअल रूप से या गैर‑एल्गोरिदमिक तरीकों से प्राप्त किया जाता है), के पास फ़ोरग्राउंड सामग्री की परिभाषा पर विभिन्न और विविध प्रभावी दृष्टिकोण हैं, जबकि नया SPG‑IM विधि सीन संदर्भ के माध्यम से ‘नज़दीकी सामग्री’ को अधिक प्रभावी ढंग से विभेदित करती है।
इसे संबोधित करने के लिए, शोधकर्ताओं ने Situational Perception Guided Image Matting (SPG‑IM) नामक दो‑स्तरीय पाइपलाइन विकसित की है। दो‑स्तरीय एन्कोडर/डिकोडर आर्किटेक्चर में Situational Perception Distillation (SPD) और Situational Perception Guided Matting (SPGM) शामिल हैं।
पहले, SPD दृश्य‑से‑पाठ फीचर ट्रांसफ़ॉर्मेशन को प्री‑ट्रेन करता है, जिससे उनकी संबंधित छवियों के अनुरूप कैप्शन उत्पन्न होते हैं। इसके बाद, पाइपलाइन को एक नवीन सैलिएंसी प्रेडिक्शन तकनीक से जोड़कर फ़ोरग्राउंड मास्क भविष्यवाणी सक्षम की जाती है।
फिर SPGM पहले मॉड्यूल में प्राप्त किए गए जनरेटेड मास्क और कच्चे RGB इमेज इनपुट के आधार पर अनुमानित अल्फ़ा मैट आउटपुट करता है।
उद्देश्य सीन‑अवेयर परसेप्शन गाइडेंस है, जिसमें सिस्टम को छवि के घटकों की संदर्भात्मक समझ होती है, जिससे वह उदाहरण के तौर पर जटिल बालों को पृष्ठभूमि से निकालने की चुनौती को उस विशिष्ट कार्य की ज्ञात विशेषताओं के विरुद्ध फ्रेम कर सके।
नीचे के उदाहरण में, SPG‑IM समझता है कि डोरी ‘पैराशूट’ का अभिन्न हिस्सा हैं, जहाँ MODNet इन विवरणों को बनाए रखने और परिभाषित करने में विफल रहता है। इसी प्रकार ऊपर, खेल के उपकरण की पूरी संरचना MODNet में मनमाने ढंग से खो जाती है।
नया पेपर शीर्षक Situational Perception Guided Image Matting रखता है, और यह OPPO रिसर्च इंस्टीट्यूट, PicUp.ai, और Xmotors के शोधकर्ताओं द्वारा लिखा गया है।
बुद्धिमान स्वचालित मैट्स
SPG‑IM एक Adaptive Focal Transformation (AFT) रीफ़ाइनमेंट नेटवर्क भी प्रदान करता है जो स्थानीय विवरण और वैश्विक संदर्भ को अलग‑अलग प्रोसेस कर सकता है, जिससे ‘बुद्धिमान मैट्स’ को सक्षम बनाता है।
सीन संदर्भ को समझना, इस मामले में ‘घोड़े के साथ लड़की’, संभावित रूप से अग्रभूमि एक्सट्रैक्शन को पूर्व विधियों की तुलना में आसान बना सकता है।
The paper states:
‘We believe that visual representations from the visual-to-textual task, e.g. image captioning, focus on more semantically comprehensive signals between a)object to object and b)object to the ambient environment to generate descriptions that can cover both the global info and local details. In addition, compared with the expensive pixel annotation of image matting, textual labels can be massively collected at a very low cost.’
आर्किटेक्चर की SPD शाखा को University of Michigan के VirTex ट्रांसफ़ॉर्मर‑आधारित टेक्स्टुअल डिकोडर के साथ संयुक्त रूप से प्री‑ट्रेन किया गया है, जो अर्थ‑सघन कैप्शन से दृश्य प्रतिनिधित्व सीखता है।

अन्य परीक्षणों और एब्लेशन अध्ययनों के बीच, शोधकर्ताओं ने SPG‑IM को अत्याधुनिक ट्रिमैप-आधारित विधियों जैसे Deep Image Matting (DIM), IndexNet, Context‑Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, और Semantic Image Mapping (SIM) के विरुद्ध परीक्षण किया।
परीक्षित अन्य पूर्व फ्रेमवर्क में ट्रिमैप‑फ्री दृष्टिकोण जैसे LFM, HAttMatting, और MODNet शामिल थे। निष्पक्ष तुलना के लिए, परीक्षण विधियों को विभिन्न कार्यप्रणालियों के आधार पर अनुकूलित किया गया; जहाँ कोड उपलब्ध नहीं था, पेपर की तकनीकों को वर्णित आर्किटेक्चर से पुनः निर्मित किया गया।
The new paper states:
‘Our SPG-IM outperforms all competing trimap-free methods ([LFM], [HAttMatting], and [MODNet]) by a large margin. Meanwhile, our model also shows remarkable superiority over the state-of-the-art (SOTA) trimap-based and mask-guided methods in terms of all four metrics across the public datasets (i.e. Composition-1K, Distinction-646, and Human-2K), and our Multi-Object-1K benchmark.’
और जारी है:
‘It can be obviously observed that our method preserves fine details (e.g. hair tip sites, transparent textures, and boundaries) without the guidance of trimap. Moreover, compared to other competing trimap-free models, our SPG-IM can retain better global semantic completeness.’
पहली बार प्रकाशित 24 अप्रैल 2022।













