Anderson का एंगल
वीडियो से वस्तुओं और लोगों को एआई के साथ मिटाना

नहीं, बच्चा तस्वीर में नहीं रहता है, अगर एआई कुछ करने के लिए है तो。
छवियों और वीडियो से लोगों और वस्तुओं को हटाना वीएफएक्स-केंद्रित एआई साहित्य में एक लोकप्रिय उप-धारा है, जिसमें इस चुनौती का सामना करने वाले डेटासेट और फ्रेमवर्क की बढ़ती संख्या है। चीन के फुदान विश्वविद्यालय के इंस्टीट्यूट ऑफ बिग डेटा से नवीनतम, इफेक्टइरेज है, एक ‘प्रभाव जागरूक’ वीडियो वस्तु हटाने वाला प्रणाली है जो लेखकों का दावा है कि परीक्षणों में राज्य की कला में काफी सुधार करता है:
[वीडियो चौड़ाई=”836″ ऊंचाई=”484″ mp4=”https://www.unite.ai/wp-content/uploads/2026/03/EffectErase-Composite-examples_AE_encoded.mp4″ लूप=”सच” ऑटोप्ले=”सच” प्रीलोड=”ऑटो”][/वीडियो]
परियोजना वेबसाइट से सामग्री को इकट्ठा करके, इफेक्टइरेज विधि के उदाहरण (कृपया ध्यान दें कि जबकि हम एक लिंक प्रदान करते हैं, स्रोत साइट में कई हाई-रेज़ोल्यूशन और गैर-ऑप्टिमाइज़ड ऑटोप्ले वीडियो हैं जो आपके वेब ब्राउज़र की स्थिरता को प्रभावित कर सकते हैं। संलग्न यूट्यूब वीडियो एक आसान और पूर्ण संदर्भ है, और इस लेख के अंत में एम्बेड किया गया है)। स्रोत
नई कार्य में लगभग 350 मूल वास्तविक दुनिया और सिंथेटिक दृश्यों के निर्माण/संग्रह की आवश्यकता थी, जो सार्वजनिक भंडार* का उपयोग करके या खुले स्रोत ब्लेंडर 3डी फ्रेमवर्क के आसपास एक कार्य प्रवाह में स्रोत और पुनः उपयोग किया गया था।
हाइब्रिड वीडियो वस्तु हटाने (वीओआर) डेटासेट इफेक्टइरेज अनुप्रयोग के लिए आधार बनाता है, जो वान2.1 वीडियो-निर्माण प्रणाली पर बनाया गया है। प्रणाली दो नए संबंधित बेंचमार्क भी परिभाषित करती है: वीओआर मूल्यांकन और वीओआर वाइल्ड – क्रमशः, मैदान सच्चाई के साथ और बिना नमूनों के लिए।
(हालांकि पेपर में एक साथी परियोजना साइट है, यह बहुत अधिक हाई-रेज़ोल्यूशन वीडियो से भरा हुआ है, और लोड करना मुश्किल है; इसलिए, यदि आप परियोजना साइट का उपयोग करना मुश्किल पाते हैं, तो कृपया मैंने जो अंश संकलित किए हैं उन्हें देखें, जो इस लेख के अंत में एम्बेड किए गए वीडियो में हैं।
[कैप्शन आईडी=”अटैचमेंट_394156″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1094″]
शोधकर्ताओं का दावा है कि उनका दृष्टिकोण मात्रात्मक मूल्यांकन और मानव अध्ययन के माध्यम से निर्णय लिए गए गुणात्मक परिणामों में राज्य की कला का प्रदर्शन करता है।
वे ध्यान देते हैं कि पिछले कार्यों ने वस्तु के साथ जुड़े प्रभावों को हटाने में हमेशा सफलता नहीं पाई है, जैसे कि छाया और प्रतिबिंब, और उनके डेटासेट को इस कमी को सुधारने के लिए सावधानी से बनाया गया है:
[कैप्शन आईडी=”अटैचमेंट_394157″ संरेखित=”संरेखित-नहीं” चौड़ाई=”711″]
नया कार्य नए पेपर है, जो इफेक्टइरेज: ज्वाइंट वीडियो वस्तु हटाने और सम्मिलन के लिए उच्च गुणवत्ता वाले प्रभाव मिटाने नामक है, और फुदान विश्वविद्यालय के कंप्यूटर विज्ञान और कृत्रिम बुद्धिमत्ता कॉलेज के चार शोधकर्ताओं से आया है।
विधि
हाइब्रिड वीओआर डेटासेट को वीडियो वस्तु हटाने के प्रयास के सभी निहितार्थों को शामिल करने के लिए डिज़ाइन किया गया था:
[कैप्शन आईडी=”अटैचमेंट_394158″ संरेखित=”संरेखित-नहीं” चौड़ाई=”908″]
पांच प्रतिनिधि प्रकार के ‘हस्तक्षेप’ को संबोधित करने के लिए लेखकों द्वारा परिभाषित किया गया है: अवरोध, जिसमें विभिन्न प्रकार के ग्लास और धुएं का अवरोध शामिल है; छाया; प्रकाश (जैसे कि जब एक वस्तु को हटाने से प्रकाश का मार्ग बनता है या बदल जाता है); प्रतिबिंब; और विकृति (जैसे कि जब एक उपयोगकर्ता का एक कुशन पर निशान होता है, जो व्यक्ति के हटाने के बाद नहीं रहना चाहिए).
[कैप्शन आईडी=”अटैचमेंट_394160″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1081″]<img class=" wp-छवि-394160" src="https://www.unite.ai/wp-content/uploads/2026/03/figure-4.jpg" alt="वीओआर के लिए डेटासेट निर्माण पाइपलाइन, जो ब्लेंडर-जनित सिंथेटिक दृश्यों को वास्तविक दुनिया के कैप्चर के साथ जोड़ती है, जहां सिंथेटिक डेटा क्यूरेटेड 3डी वातावरण, वस्तुओं और कैमरा ट्राजेक्टरी से बनाया जाता है, और वास्तविक फुटेज विभिन्न दृश्यों में रिकॉर्ड किया जाता है, जिसे केन बर्न्स गति के साथ बढ़ाया जाता है। एसएएम2 सेगमेंटेशन और मैनुअल रिफाइनमेंट तब संरेखित अग्रभूमि और पृष्ठभूमि वीडियो त्रिपलेट का उत्पादन करते हैं जो संबंधित मास्क के साथ होते हैं।[/कैप्शन]
वास्तविक दुनिया के मूल डेटा के लिए, शोधकर्ताओं ने ‘साथ’ और ‘बिना’ दृश्यों को रिकॉर्ड करने के लिए स्थिर कैमरों का उपयोग किया, जो विभिन्न वातावरण, दिन के समय और मौसम की स्थितियों को कवर करते हैं।
सिंथेटिक डेटा के लिए, कई दृष्टिकोणों को रेंडर किया गया, और मल्टी-वस्तु दृश्य बनाए गए, जो जानबूझकर जटिल और चुनौतीपूर्ण प्रकार के कैमरा आंदोलनों को प्रदर्शित करते हैं, जैसा कि वास्तविक दुनिया के फुटेज में हो सकता है; और शोधकर्ता यह देखते हैं कि यह दृष्टिकोण रिमूव ऑब्जेक्ट्स विद साइड इफेक्ट्स इन वीडियोज (आरओएसई) डेटासेट के लिए उपयोग किए जाने वाले दृष्टिकोण से अधिक परिष्कृत और प्रयासपूर्ण है।
गति विविधता बढ़ाने के लिए, केन बर्न्स प्रभाव को कैमरा-कैप्चर्ड जोड़ों पर लागू किया गया, जिसमें नियंत्रित पैन, ज़ूम और हल्के हाथ से आंदोलन जोड़े गए, चौदह पूर्वनिर्धारित नियमों के तहत, प्रत्येक जोड़े के लिए पांच गति पैटर्न नमूने लिए गए, जबकि फसल को मूल फ्रेम के भीतर रखा गया।
मास्क को कुंजी फ्रेम पर मैनुअल पॉइंट प्रॉम्प्ट रखकर, सेगमेंट एनीथिंग 2 (एसएएम2) के साथ सेगमेंटेशन को प्रसारित करके, परिणामों को साफ़ करके और प्रशिक्षण के लिए मान्य अग्रभूमि, पृष्ठभूमि और मास्क त्रिपलेट को इकट्ठा करके पैमाने और विविधता को और बढ़ाया गया।
अंतिम संग्रह 60,000 जोड़े वीडियो के माध्यम से 145 घंटे के वीडियो तक फैला हुआ है, जो 366 वस्तु वर्गों में 443 दृश्यों में वास्तविक और सिंथेटिक दोनों हैं।
इफेक्टइरेज नेटवर्क स्वयं वैरिएशनल ऑटो-एन्कोडर (वीएई) के माध्यम से सामग्री को प्राप्त करता है, जिसमें वान2.1 द्वारा शोर मिटाने का काम किया जाता है। इस बैकबोन पर, इफेक्टइरेज रिमूवल-इन्सर्शन ज्वाइंट लर्निंग का संचालन करता है, जो एक ही क्षेत्र पर दोनों कार्यों को एक साथ प्रशिक्षित करता है; टास्क-एवेयर रीजन गाइडेंस (टीएआरजी), जो वस्तु और कार्य टोकन को क्रॉस-ध्यान के साथ जोड़ता है ताकि वस्तुओं और उनके प्रभावों के बीच स्थानिक और समयिक लिंक को मॉडल किया जा सके और कार्य स्विचिंग की अनुमति दी जा सके; और इफेक्ट संगतता हानि, जो हटाने और सम्मिलन कार्यों में प्रभाव क्षेत्रों को संरेखित करता है:
[कैप्शन आईडी=”अटैचमेंट_394161″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1045″]
स्वयं हटाने और सम्मिलन प्रक्रियाएं एक साझा प्रसार बैकबोन का उपयोग करके एक साथ प्रशिक्षित की जाती हैं, ताकि मॉडल एक ही प्रभावित क्षेत्रों और संरचनात्मक संकेतों पर ध्यान केंद्रित करना सीखे।
वीडियो, पृष्ठभूमि केवल वीडियो, और मास्क, को पहले एक लेटेंट स्पेस में एन्कोड किया जाता है; शोर जोड़ा जाता है प्रसार प्रशिक्षण के लिए, और मॉडल शोर मिटाने के लिए सीखता है कार्य-विशिष्ट मार्गदर्शन के तहत। एक हल्का एडाप्टर फिर शोर से भरे सुविधाओं को हटाने या सम्मिलन की स्थिति के साथ जोड़ता है, दोनों कार्यों को साझा पर्यवेक्षण की अनुमति देता है, जबकि नियंत्रणीय बने रहना।
टास्क-एवेयर रीजन गाइडेंस एक कार्य-विशिष्ट संकेत बनाता है वस्तु टोकन को दृश्य विशेषताओं के साथ जोड़कर, सीएलआईपी का उपयोग करके, एक सामान्य वस्तु टोकन को वास्तविक छवि सामग्री से व्युत्पन्न एक एम्बेडिंग के साथ बदल देता है। यह संमिश्रित प्रतिनिधित्व पार्श्व में क्रॉस-ध्यान के माध्यम से बैकबोन में इंजेक्ट किया जाता है, मॉडल को वस्तु और उसके दृश्य प्रभावों को स्थान और समय में विकसित होते हुए ट्रैक करने की अनुमति देता है, जबकि हटाने और सम्मिलन के बीच लचीले स्विचिंग को सक्षम बनाता है।
इफेक्ट संगतता हानि हटाने और सम्मिलन प्रक्रियाओं को एक ही परिवर्तित क्षेत्रों पर ध्यान केंद्रित करने के लिए मजबूर करता है, क्योंकि दोनों कार्य एक ही वस्तु और उसके दृश्य प्रभावों से संबंधित हैं। प्रत्येक शाखा से ध्यान मानचित्रों को तब एक सॉफ्ट क्षेत्र मानचित्रों में जोड़ा जाता है, और वस्तु और पृष्ठभूमि वीडियो से गणना की गई एक अंतर मानचित्र के साथ संरेखित किया जाता है, ताकि प्रकाश और छाया जैसे सूक्ष्म परिवर्तन संरक्षित हों। यह अतिरिक्त हानि सम्मिलन को हटाने का मार्गदर्शन करने में मदद करती है और दोनों कार्यों को संगत बनाए रखती है।
डेटा और परीक्षण
शोधकर्ताओं ने अपने दृष्टिकोण का परीक्षण विभिन्न पेंटिंग, वीडियो पेंटिंग, और वस्तु हटाने की विधियों के खिलाफ किया: ओम्निपेंट; ऑब्जेक्टक्लियर; वीएसई; डिफ्यूएरेजर; प्रोपेंटर; आरओएसई; और मिनिमैक्स-रिमूवर.
वान2.1 को लोरा के साथ वीओआर डेटासेट पर 832x480px के रिज़ॉल्यूशन पर परिष्कृत किया गया था। 81 समानंतर फ्रेम (वान के लिए प्रभावी सीमा, जिसके परे त्रुटियां होने की प्रवृत्ति होती है) प्रशिक्षण के लिए यादृच्छिक रूप से नमूने लिए गए, जो 129,000 पुनरावृत्तियों के लिए आठ एच100 जीपीयू पर हुआ, प्रत्येक में 80जीबी वीआरएएम। सीखने की दर 1×102 पर सेट की गई थी, और लोरा रैंक 256 पर था।
आरओएसई-बेंचमार्क सिंथेटिक संग्रह एकमात्र बाहरी डेटासेट था जिसका परीक्षण किया गया; अन्य दो वीओआर-मूल्यांकन थे, जो वीओआर डेटासेट परीक्षण विभाजन था; और वीओआर-वाइल्ड, एक परीक्षण सेट जिसमें 195 वास्तविक वीडियो शामिल थे जो इंटरनेट से स्क्रैप किए गए थे, जिनमें ‘डायनामिक वस्तुएं’ थीं।
इस्तेमाल किए गए मेट्रिक्स में पीक सिग्नल-टू-नॉइज़ रेशियो (पीएसएनआर); स्ट्रक्चरल सिमिलैरिटी इंडेक्स (एसएसआईएम); लर्न्ड परसेप्टुअल इमेज पैच सिमिलैरिटी (एलपीआईपीएस); और फ्रेचेट वीडियो दूरी (एफवीडी) शामिल थे। वीओआर-वाइल्ड से 195 जेनरेट किए गए वीडियो का एक उपयोगकर्ता अध्ययन भी विचार किया गया था, जिसमें 20 स्वयंसेवकों से औसत रेटिंग ली गई थी।
इसके अलावा, लेखकों ने क्यूस्कोर नामक एक मेट्रिक विकसित की, जो क्यूवेन-वीएल बहुमोड़ल मॉडल का लाभ उठाती है, वस्तु-हटाने वाले वीडियो आउटपुट की गुणवत्ता का मूल्यांकन करने के लिए, जैसे कि शेष अवशेष या पर्यावरणीय हटाने की कमी जैसे छाया और प्रकाश प्रभाव:
[कैप्शन आईडी=”अटैचमेंट_394162″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1054″]
इन परिणामों के संबंध में, लेखकों का कहना है:
‘[वर्तमान] छवि पेंटिंग विधियां व्यक्तिगत फ्रेम पर 2डी मॉडल का उपयोग करती हैं और इसलिए वीडियो में समयिक संगति बनाए रखने में विफल रहती हैं।
हाल की वीडियो पेंटिंग [विधियां] वस्तु के द्वारा उत्पन्न पक्ष प्रभावों को स्पष्ट रूप से मॉडल नहीं करती हैं, जिससे अप्राकृतिक हटाने के परिणाम होते हैं। मौजूदा वीडियो वस्तु हटाने [विधियां] वस्तु और उसके पक्ष प्रभावों के बीच स्थानिक और समयिक संबंध मॉडलिंग की कमी के कारण अक्सर कलाकृतियों और अवशेषों का उत्पादन करती हैं।
‘कुल मिलाकर, इफेक्टइरेज सभी डेटासेट और मूल्यांकन मेट्रिक्स में राज्य की कला का प्रदर्शन करता है। यह वीडियो गुणवत्ता मेट्रिक फवीडी पर सर्वश्रेष्ठ स्कोर प्राप्त करता है, जो उत्पन्न वीडियो की समयिक चिकनाई और संगति की श्रेष्ठता को प्रदर्शित करता है।
‘हमारी विधि क्यूस्कोर और उपयोगकर्ता प्रतिक्रिया रेटिंग में भी उच्चतम स्कोर प्राप्त करती है, जो दृश्य रूप से आश्वस्त हटाने के परिणामों का उत्पादन करने में इसकी प्रभावशीलता को और प्रदर्शित करती है।[/em>
गुणात्मक मूल्यांकन के लिए, स्थिर परिणाम कागज़ में प्रदर्शित किए गए हैं (नीचे दिखाए गए हैं), साथ ही चलते हुए परिणाम परियोजना साइट और संलग्न यूट्यूब वीडियो प्रस्तुति में उपलब्ध हैं:
[कैप्शन आईडी=”अटैचमेंट_394163″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1032″]
हम पाठकों को विविध संबंधित उदाहरणों के लिए परियोजना साइट पर भी संदर्भित करते हैं, जो नीचे दिए गए हैं:
[वीडियो चौड़ाई=”1204″ ऊंचाई=”172″ mp4=”https://www.unite.ai/wp-content/uploads/2026/03/comp_vor_remove_WILD_ENV001_00024_stack_encoded.mp4″ लूप=”सच” ऑटोप्ले=”सच” प्रीलोड=”ऑटो”][/वीडियो]
प्ले करने के लिए क्लिक करें। इफेक्टइरेज की परियोजना साइट से एक नमूना तुलना। कृपया बेहतर रिज़ॉल्यूशन (उपरोक्त सावधानियों के साथ) और आगे के उदाहरणों के लिए साइट पर जाएं।
लेखकों का कहना है:
वीडियो पेंटिंग [विधियां] अक्सर मास्क्ड क्षेत्रों में कलाकृतियों का उत्पादन करती हैं और वस्तु के हटाने से उत्पन्न पक्ष प्रभावों को पूरी तरह से हटाने में विफल रहती हैं। पिछले वस्तु हटाने के दृष्टिकोण, जैसे कि [आरओएसई] और [मिनिमैक्स-रिमूवर], लक्ष्य वस्तुओं को हटाने में अच्छा प्रदर्शन करते हैं, लेकिन अभी भी पक्ष प्रभावों के साथ संघर्ष करते हैं, विशेष रूप से अवरोध, छाया, प्रकाश और विकृति दृश्यों में।
इसके विपरीत, इफेक्टइरेज दोनों लक्ष्य वस्तुओं और उनके संबंधित प्रभावों को हटा देता है, जिससे साफ़, सुसंगत और उच्च गुणवत्ता वाले परिणाम प्राप्त होते हैं।[/em>
अंत में, शोधकर्ता यह देखते हैं कि उनकी विधि को सम्मिलन के बजाय हटाने के कार्यों के लिए अनुकूलित किया जा सकता है, बिना किसी अतिरिक्त प्रशिक्षण की आवश्यकता के:
[कैप्शन आईडी=”अटैचमेंट_394165″ संरेखित=”संरेखित-नहीं” चौड़ाई=”913″]
वीडियो परिणाम सम्मिलन कार्य के लिए (समय-विशिष्ट) यूट्यूब वीडियो में देखे जा सकते हैं (साथ ही लेख के अंत में समय-स्टैम्प के बिना एम्बेड किए गए हैं)।
निष्कर्ष
साहित्य में समान परियोजनाओं की जांच करने से पता चलता है कि कई अभी भी आशा करते हैं कि सामान्य-उद्देश्य वीएफएक्स मॉडल अंततः इस प्रकार की कार्यक्षमता को एक सामान्य ‘टूलकिट’ मॉडल में शामिल करेंगे, जो विभिन्न प्रभावों के लिए डिज़ाइन किया गया है, न कि केवल इस विशिष्ट कार्य के लिए।
हालांकि, ‘जैक ऑफ ऑल ट्रेड्स’ सिद्धांत के अनुसार, यह तर्कसंगत लगता है कि समर्पित प्रणाली जैसे इफेक्टइरेज इस प्रकार की कार्यक्षमता में सामान्य दृष्टिकोणों पर एक बढ़त बनाए रखना जारी रखेंगे; इस सावधानी के साथ कि अंतर अंततः इतना संकुचित हो जाएगा कि अतिरिक्त प्रयास के लायक नहीं होगा।
* एक आशा करता है कि सभी ऐसे स्रोतों का हवाला दिया जाएगा, लेकिन यदि नए कार्य से उपलब्ध सामग्री 3डी मॉडल के स्रोत को सूचीबद्ध करती है, तो मैं इस संदर्भ को स्थित नहीं कर सका।
† प्रदान किया गया संदर्भ 2013 का एक सामान्य व्याख्यात्मक पाठ है, जिसमें विशिष्ट वीएई का विवरण नहीं किया गया है।
†† पेपर से लिया गया, यह एक सेमेन्टिक रूप से अस्पष्ट विवरण है, क्योंकि फाइन-ट्यूनिंग और लोरा अलग-अलग प्रक्रियाएं हैं जिनकी बहुत अलग मांगें हैं।
शनिवार, 21 मार्च, 2026 को पहली बार प्रकाशित।












