Anderson का एंगल

सीन को समझने वाली AI इमेज मैटिंग

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

2003 DVD रिलीज़ के साथ जारी एक्स्ट्रा डॉक्यूमेंट्री में, जिसमें Alien3 (1992) शामिल है, विज़ुअल इफ़ेक्ट्स के दिग्गज रिचर्ड एडलंड ने फ़ोटोकेमिकल मैट एक्सट्रैक्शन की ‘सूमो रेसलिंग’ को भयावह रूप में याद किया, जो देर 1930 के दशक से लेकर देर 1980 के दशक तक विज़ुअल इफ़ेक्ट्स कार्य को हावी करता रहा। एडलंड ने प्रक्रिया की अनियमित प्रकृति को ‘सूमो रेसलिंग’ कहा, जो शुरुआती 1990 के दशक में डिजिटल नीला/हरा स्क्रीन तकनीकों से तुलना में था (और उन्होंने तब से इस रूपक को दोबारा अपनाया)।

पृष्ठभूमि से एक अग्रभूमि तत्व (जैसे व्यक्ति या अंतरिक्ष यान मॉडल) को निकालना, ताकि कट‑आउट छवि को पृष्ठभूमि प्लेट में सम्मिलित किया जा सके, मूल रूप से एक समान नीले या हरे पृष्ठभूमि के सामने अग्रभूमि वस्तु को फिल्माकर हासिल किया जाता था।

Laborious photochemical extraction processes for a VFX shot by ILM for 'Return of the Jedi' (1983).

ILM द्वारा ‘Return of the Jedi’ (1983) के VFX शॉट के लिए श्रमसाध्य फोटोकेमिकल एक्सट्रैक्शन प्रक्रियाएँ।

परिणामी फुटेज में, पृष्ठभूमि रंग को रासायनिक रूप से अलग किया जाता और फिर अग्रभूमि वस्तु (या व्यक्ति) को एक ऑप्टिकल प्रिंटर में पुनः प्रिंट करने के लिए टेम्प्लेट के रूप में उपयोग किया जाता, जिससे वह अन्यथा पारदर्शी फिल्म सेल में एक ‘फ़्लोटिंग’ वस्तु बन जाता।

इस प्रक्रिया को कलर सेपरेशन ओवरले (CSO) कहा जाता था – हालांकि यह शब्द अंततः 1970 और 1980 के दशक के कम बजट वाले टेलीविजन आउटपुट में कच्चे ‘Chromakey’ वीडियो इफ़ेक्ट्स से अधिक जुड़ गया, जो रासायनिक या डिजिटल तरीकों के बजाय एनालॉग द्वारा प्राप्त किए जाते थे।

A demonstration of Color Separation Overlay in 1970 for the British children's show 'Blue Peter'. Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

1970 में ब्रिटिश बाल शो ‘Blue Peter’ के लिए कलर सेपरेशन ओवरले का एक प्रदर्शन। Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

किसी भी स्थिति में, चाहे फ़िल्म हो या वीडियो तत्व, उसके बाद निकाली गई फुटेज को किसी भी अन्य फुटेज में सम्मिलित किया जा सकता था।

हालाँकि डिज़्नी की उल्लेखनीय रूप से महँगी और स्वामित्व वाली सोडियम‑वापर प्रक्रिया (जो विशेष रूप से पीले रंग पर की गई थी, और अल्फ़्रेड हिचकॉक की 1963 हॉरर The Birds में भी उपयोग की गई) बेहतर परिभाषा और स्पष्ट मैट प्रदान करती थी, फिर भी फोटोकेमिकल एक्सट्रैक्शन कठिन और अविश्वसनीय बना रहा।

Disney's proprietary sodium vapor extraction process required backgrounds near the yellow end of the spectrum. Here, Angela Lansbury is suspended on wires during the production of a VFX-laced sequence for 'Bedknobs and Broomsticks' (1971). Source

डिज़्नी की स्वामित्व वाली सोडियम वॉपर एक्सट्रैक्शन प्रक्रिया को स्पेक्ट्रम के पीले अंत के निकट पृष्ठभूमि की आवश्यकता होती थी। यहाँ, एंजेला लैंसबरी को ‘Bedknobs and Broomsticks’ (1971) के VFX‑युक्त अनुक्रम के उत्पादन के दौरान तारों पर लटकाया गया है। Source

डिजिटल मैटिंग से परे

1990 के दशक में, डिजिटल क्रांति ने रसायनों को समाप्त कर दिया, लेकिन हरे स्क्रीन की आवश्यकता नहीं। अब यह संभव हो गया था कि फ़ोटोशॉप जैसे पिक्सेल‑एडिटिंग सॉफ़्टवेयर में उस रंग की सहनशीलता सीमा के भीतर पिक्सेल खोजकर हरे (या किसी भी रंग) पृष्ठभूमि को हटाया जा सके, और नई पीढ़ी के वीडियो‑कॉम्पोज़िटिंग सूट जो स्वचालित रूप से रंगीन पृष्ठभूमियों को की कर सकते थे। लगभग एक रात में, साठ साल की ऑप्टिकल प्रिंटिंग उद्योग इतिहास में लिख दी गई।

GPU‑सहायित कंप्यूटर विज़न अनुसंधान के पिछले दस वर्ष मैट एक्सट्रैक्शन को तीसरी युग में ले जा रहे हैं, शोधकर्ताओं को ऐसे सिस्टम विकसित करने की चुनौती दे रहे हैं जो हरे स्क्रीन की आवश्यकता के बिना उच्च‑गुणवत्ता वाले मैट निकाल सकें। केवल Arxiv पर, मशीन लर्निंग‑आधारित अग्रभूमि एक्सट्रैक्शन में नवाचारों से संबंधित पेपर साप्ताहिक रूप से प्रकाशित होते हैं।

हमें चित्र में रखना

AI एक्सट्रैक्शन में शैक्षणिक और उद्योगीय रुचि का यह केंद्र पहले ही उपभोक्ता क्षेत्र को प्रभावित कर चुका है: मोटे लेकिन काम करने योग्य कार्यान्वयन हम सभी को Zoom और Skype फ़िल्टरों के रूप में परिचित हैं, जो वीडियो कॉन्फ़्रेंस कॉल में हमारे लिविंग‑रूम पृष्ठभूमि को उष्णकटिबंधीय द्वीपों आदि से बदल सकते हैं।

हालाँकि, सबसे अच्छे मैट अभी भी हरे स्क्रीन की आवश्यकता रखते हैं, जैसा कि Zoom ने पिछले बुधवार बताया

Left, a man in front of a green screen, with well-extracted hair via Zoom's Virtual Background feature. Left, a woman in front of a normal domestic scene, with hair extracted algorithmically, less accurately, and with higher computing requirements. Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

बाएँ, एक पुरुष हरे स्क्रीन के सामने, Zoom के वर्चुअल बैकग्राउंड फीचर द्वारा अच्छी तरह से निकाले गए बालों के साथ। दाएँ, एक महिला सामान्य घरेलू दृश्य के सामने, एल्गोरिदमिक रूप से निकाले गए बालों के साथ, कम सटीकता और अधिक कंप्यूटिंग आवश्यकताओं के साथ। Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Zoom सपोर्ट प्लेटफ़ॉर्म से एक और पोस्ट चेतावनी देती है कि गैर‑हरे‑स्क्रीन एक्सट्रैक्शन के लिए कैप्चर डिवाइस में अधिक कंप्यूटिंग शक्ति की आवश्यकता होती है।

कट‑आउट की आवश्यकता

गुणवत्ता, पोर्टेबिलिटी और संसाधन अर्थव्यवस्था में सुधार, जो ‘इन द वाइल्ड’ मैट एक्सट्रैक्शन सिस्टम (अर्थात् हरे स्क्रीन की आवश्यकता के बिना लोगों को अलग करना) के लिए है, केवल वीडियो‑कॉन्फ़्रेंसिंग फ़िल्टरों से अधिक कई क्षेत्रों और प्रयोजनों के लिए प्रासंगिक हैं।

डेटासेट विकास के लिए, उन्नत चेहरे, पूर्ण‑सिर और पूर्ण‑शरीर पहचान यह सुनिश्चित करने की संभावना प्रदान करती है कि अनावश्यक पृष्ठभूमि तत्व मानव विषयों के कंप्यूटर विज़न मॉडलों में प्रशिक्षित न हों; अधिक सटीक अलगाव सेमांटिक सेगमेंटेशन तकनीकों को बहुत सुधार देगा, जो डोमेनों (जैसे ‘cat’, ‘person’, ‘boat’) को अलग करने और सम्मिलित करने के लिए डिज़ाइन की गई हैं, और VAE और ट्रांसफ़ॉर्मर-आधारित इमेज सिंथेसिस सिस्टम जैसे OpenAI के नए DALL‑E 2 को सुधारेंगे; और बेहतर एक्सट्रैक्शन एल्गोरिदम महंगे मैन्युअल रोटोस्कोपिंग की आवश्यकता को कम करेंगे, जो महंगे VFX पाइपलाइन में होती है।

वास्तव में, मल्टीमॉडल (आमतौर पर टेक्स्ट/इमेज) पद्धतियों का उदय, जहाँ ‘cat’ जैसे डोमेन को इमेज और संबंधित टेक्स्ट संदर्भ दोनों के रूप में एन्कोड किया जाता है, पहले ही इमेज प्रोसेसिंग में प्रवेश कर रहा है। एक हालिया उदाहरण Text2Live आर्किटेक्चर है, जो मल्टीमॉडल (टेक्स्ट/इमेज) प्रशिक्षण का उपयोग करके वीडियो बनाता है, जिसमें अनगिनत संभावनाओं में क्रिस्टल स्वान और ग्लास जिराफ़ शामिल हैं।

सीन‑अवेयर AI मैटिंग

AI‑आधारित स्वचालित मैटिंग पर बहुत सारे शोध ने छवि या वीडियो फ्रेम के भीतर पिक्सेल‑आधारित समूहों की सीमा पहचान और मूल्यांकन पर ध्यान केंद्रित किया है। हालांकि, चीन से नया शोध एक एक्सट्रैक्शन पाइपलाइन प्रस्तुत करता है जो सीन की टेक्स्ट‑आधारित विवरणों (एक मल्टीमॉडल दृष्टिकोण जो पिछले 3‑4 वर्षों में कंप्यूटर विज़न शोध क्षेत्र में लोकप्रिय हुआ है) का उपयोग करके विभेदन और मैट गुणवत्ता को सुधारता है, और कई तरीकों से पूर्व विधियों से बेहतर होने का दावा करता है।

An example SPG-IM extraction (last image, lower right), compared against competing prior methods. Source: https://arxiv.org/pdf/2204.09276.pdf

एक उदाहरण SPG‑IM एक्सट्रैक्शन (अंतिम छवि, नीचे दाएँ), जो प्रतिस्पर्धी पूर्व विधियों के साथ तुलना करता है। Source: https://arxiv.org/pdf/2204.09276.pdf

एक्सट्रैक्शन अनुसंधान उप‑क्षेत्र के सामने चुनौती यह है कि ऐसे कार्य‑प्रवाह तैयार किए जाएँ जिनके लिए न्यूनतम मैन्युअल एनोटेशन और मानवीय हस्तक्षेप की आवश्यकता हो – आदर्श रूप में, कोई नहीं। लागत प्रभावों के अलावा, नए पेपर के शोधकर्ता देखते हैं कि विभिन्न संस्कृतियों में आउटसोर्स्ड क्राउडवर्कर्स द्वारा किए गए एनोटेशन और मैन्युअल सेगमेंटेशन छवियों को विभिन्न तरीकों से लेबल या विभाजित कर सकते हैं, जिससे असंगत और असंतोषजनक एल्गोरिदम उत्पन्न होते हैं।

इसका एक उदाहरण है कि ‘फ़ोरग्राउंड ऑब्जेक्ट’ को कैसे परिभाषित किया जाता है, इसका व्यक्तिपरक व्याख्या:

From the new paper: prior methods LFM and MODNet ('GT' signifies Ground Truth, an 'ideal' result often achieved manually or by non-algorithmic methods), have different and variously effective takes on the definition of foreground content, whereas the new SPG-IM method more effectively delineates 'near content' through scene context.

नए पेपर से: पूर्व विधियों LFM और MODNet (‘GT’ का अर्थ ग्राउंड ट्रुथ है, एक ‘आदर्श’ परिणाम जो अक्सर मैन्युअल रूप से या गैर‑एल्गोरिदमिक तरीकों से प्राप्त किया जाता है), के पास फ़ोरग्राउंड सामग्री की परिभाषा पर विभिन्न और विविध प्रभावी दृष्टिकोण हैं, जबकि नया SPG‑IM विधि सीन संदर्भ के माध्यम से ‘नज़दीकी सामग्री’ को अधिक प्रभावी ढंग से विभेदित करती है।

इसे संबोधित करने के लिए, शोधकर्ताओं ने Situational Perception Guided Image Matting (SPG‑IM) नामक दो‑स्तरीय पाइपलाइन विकसित की है। दो‑स्तरीय एन्कोडर/डिकोडर आर्किटेक्चर में Situational Perception Distillation (SPD) और Situational Perception Guided Matting (SPGM) शामिल हैं।

The SPG-IM architecture.

SPG‑IM आर्किटेक्चर।

पहले, SPD दृश्य‑से‑पाठ फीचर ट्रांसफ़ॉर्मेशन को प्री‑ट्रेन करता है, जिससे उनकी संबंधित छवियों के अनुरूप कैप्शन उत्पन्न होते हैं। इसके बाद, पाइपलाइन को एक नवीन सैलिएंसी प्रेडिक्शन तकनीक से जोड़कर फ़ोरग्राउंड मास्क भविष्यवाणी सक्षम की जाती है।

फिर SPGM पहले मॉड्यूल में प्राप्त किए गए जनरेटेड मास्क और कच्चे RGB इमेज इनपुट के आधार पर अनुमानित अल्फ़ा मैट आउटपुट करता है।

उद्देश्य सीन‑अवेयर परसेप्शन गाइडेंस है, जिसमें सिस्टम को छवि के घटकों की संदर्भात्मक समझ होती है, जिससे वह उदाहरण के तौर पर जटिल बालों को पृष्ठभूमि से निकालने की चुनौती को उस विशिष्ट कार्य की ज्ञात विशेषताओं के विरुद्ध फ्रेम कर सके।

In the example below, SPG-IM understands that the cords are intrinsic to a 'parachute', where MODNet fails to retain and define these details. Likewise above, the complete structure of the playground apparatus is arbitrarily lost in MODNet.

नीचे के उदाहरण में, SPG‑IM समझता है कि डोरी ‘पैराशूट’ का अभिन्न हिस्सा हैं, जहाँ MODNet इन विवरणों को बनाए रखने और परिभाषित करने में विफल रहता है। इसी प्रकार ऊपर, खेल के उपकरण की पूरी संरचना MODNet में मनमाने ढंग से खो जाती है।

नया पेपर शीर्षक Situational Perception Guided Image Matting रखता है, और यह OPPO रिसर्च इंस्टीट्यूट, PicUp.ai, और Xmotors के शोधकर्ताओं द्वारा लिखा गया है।

बुद्धिमान स्वचालित मैट्स

SPG‑IM एक Adaptive Focal Transformation (AFT) रीफ़ाइनमेंट नेटवर्क भी प्रदान करता है जो स्थानीय विवरण और वैश्विक संदर्भ को अलग‑अलग प्रोसेस कर सकता है, जिससे ‘बुद्धिमान मैट्स’ को सक्षम बनाता है।

Understanding scene context, in this case 'girl with horse', can potentially make foreground extraction easier than prior methods.

सीन संदर्भ को समझना, इस मामले में ‘घोड़े के साथ लड़की’, संभावित रूप से अग्रभूमि एक्सट्रैक्शन को पूर्व विधियों की तुलना में आसान बना सकता है।

The paper states:

‘We believe that visual representations from the visual-to-textual task, e.g. image captioning, focus on more  semantically comprehensive signals between a)object to object and b)object to the ambient environment to generate descriptions that can cover both the global info and local details. In addition, compared with the expensive pixel annotation of image matting, textual labels can be massively collected at a very low cost.’

आर्किटेक्चर की SPD शाखा को University of Michigan के VirTex ट्रांसफ़ॉर्मर‑आधारित टेक्स्टुअल डिकोडर के साथ संयुक्त रूप से प्री‑ट्रेन किया गया है, जो अर्थ‑सघन कैप्शन से दृश्य प्रतिनिधित्व सीखता है।

VirTex jointly trains a ConvNet and Transformers via image-caption couplets, and transfers the obtained insights to downstream vision tasks such as object detection. Source: https://arxiv.org/pdf/2006.06666.pdf VirTex इमेज‑कैप्शन युग्मों के माध्यम से ConvNet और Transformers को संयुक्त रूप से प्रशिक्षित करता है, और प्राप्त अंतर्दृष्टि को ऑब्जेक्ट डिटेक्शन जैसे डाउनस्ट्रीम विज़न कार्यों में स्थानांतरित करता है। Source: https://www.unite.ai/wp-content/uploads/2022/04/virtex.jpg

अन्य परीक्षणों और एब्लेशन अध्ययनों के बीच, शोधकर्ताओं ने SPG‑IM को अत्याधुनिक ट्रिमैप-आधारित विधियों जैसे Deep Image Matting (DIM), IndexNet, Context‑Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, और Semantic Image Mapping (SIM) के विरुद्ध परीक्षण किया।

परीक्षित अन्य पूर्व फ्रेमवर्क में ट्रिमैप‑फ्री दृष्टिकोण जैसे LFM, HAttMatting, और MODNet शामिल थे। निष्पक्ष तुलना के लिए, परीक्षण विधियों को विभिन्न कार्यप्रणालियों के आधार पर अनुकूलित किया गया; जहाँ कोड उपलब्ध नहीं था, पेपर की तकनीकों को वर्णित आर्किटेक्चर से पुनः निर्मित किया गया।

The new paper states:

‘Our SPG-IM outperforms all competing trimap-free methods ([LFM], [HAttMatting], and [MODNet]) by a large margin. Meanwhile, our model also shows remarkable superiority over the state-of-the-art (SOTA) trimap-based and mask-guided methods in terms of all four metrics across the public datasets (i.e. Composition-1K, Distinction-646, and Human-2K), and our Multi-Object-1K benchmark.’

और जारी है:

‘It can be obviously observed that our method preserves fine details (e.g. hair tip sites, transparent textures, and boundaries) without the guidance of trimap. Moreover, compared to other competing trimap-free models, our SPG-IM can retain better global semantic completeness.’

 

पहली बार प्रकाशित 24 अप्रैल 2022।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai