Anderson का एंगल

संगत एआई वीडियो सामग्री संपादन टेक्स्ट-निर्देशित इनपुट के साथ

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

व्यावसायिक वीएफएक्स समुदाय नए नवाचारों से आकर्षित होता है – और कभी-कभी छवि और वीडियो सिंथेसिस में खतरा महसूस करता है, लेकिन अधिकांश एआई-आधारित वीडियो संपादन परियोजनाओं में समयिक निरंतरता की कमी उन्हें ‘मानसिक’ क्षेत्र में सीमित कर देती है, जिसमें चमकते और तेजी से बदलते टेक्सचर और संरचनाएं, असंगत प्रभाव और प्रकार की क्रूड प्रौद्योगिकी-प्रबंधन होती है जो फोटोकेमिकल युग की याद दिलाती है।

यदि आप किसी वीडियो में कुछ विशिष्ट बदलना चाहते हैं जो गहरे नकली (यानी, किसी व्यक्ति की मौजूदा फुटेज पर एक नई पहचान थोपा) के क्षेत्र में नहीं आता है, तो अधिकांश वर्तमान समाधान उत्पादन-गुणवत्ता वाले दृश्य प्रभावों के लिए आवश्यक सटीकता के संदर्भ में काफी सख्त सीमाओं के तहत संचालित होते हैं।

एक अपवाद विज़मैन इंस्टीट्यूट ऑफ साइंस के एक ढीले संघ के शोधकर्ताओं का चल रहा काम है। 2021 में, इसके तीन शोधकर्ताओं ने, एडोबी के साथ मिलकर, घोषणा की एक नई विधि के लिए वीडियो को विभाजित करने और एक सुसंगत आंतरिक मानचित्र – एक परतदार तंत्रिका मानचित्र – को एक संयुक्त आउटपुट में शामिल करने के लिए, जिसमें अल्फा चैनल और समयिक रूप से संगत आउटपुट शामिल हैं।

2021 के पेपर से: स्रोत क्लिप में सड़क के पूर्ण पारगमन का एक अनुमान तंत्रिका नेटवर्क द्वारा संपादित किया गया है जिस तरह से पारंपरिक रूप से व्यापक रोटोस्कोपिंग और मैच-मूविंग की आवश्यकता होगी। चूंकि पृष्ठभूमि और अग्रभूमि तत्व अलग-अलग नेटवर्क द्वारा संभाले जाते हैं, मास्क वास्तव में 'स्वचालित' हैं। स्रोत: https://layered-neural-atlases.github.io/

2021 के पेपर से: स्रोत क्लिप में सड़क के पूर्ण पारगमन का एक अनुमान तंत्रिका नेटवर्क द्वारा संपादित किया गया है जिस तरह से पारंपरिक रूप से व्यापक रोटोस्कोपिंग और मैच-मूविंग की आवश्यकता होगी। चूंकि पृष्ठभूमि और अग्रभूमि तत्व अलग-अलग नेटवर्क द्वारा संभाले जाते हैं, मास्क वास्तव में ‘स्वचालित’ हैं। स्रोत: https://layered-neural-atlases.github.io/

हालांकि यह वीएफएक्स पाइपलाइनों में ऑप्टिकल फ्लो द्वारा कवर किए गए क्षेत्र में कहीं गिरता है, परतदार मानचित्र में पारंपरिक सीजीआई कार्य प्रवाह में कोई सीधा समकक्ष नहीं है, क्योंकि यह मूल रूप से एक ‘कालिक बनावट मानचित्र’ का गठन करता है जिसे पारंपरिक सॉफ्टवेयर विधियों के माध्यम से उत्पादित और संपादित किया जा सकता है।

उपरोक्त चित्रण में ‘अनफोल्ड’ मानचित्र केवल व्यक्तिगत व्याख्या किए गए फ्रेम का प्रतिनिधित्व करते हैं; लक्ष्य वीडियो फ्रेम में संगत परिवर्तन वापस मूल फ्रेम में मैप किए जाते हैं, जिसमें आवश्यक ओक्लूजन और अन्य आवश्यक दृश्य प्रभाव शामिल होते हैं, जैसे कि छाया या परावर्तन।

मूल वास्तुकला एक मल्टीलेयर परसेप्ट्रॉन (एमएलपी) का उपयोग परतदार मानचित्रों, अल्फा चैनलों और मानचित्रों का प्रतिनिधित्व करने के लिए करती है, जो सभी 2डी स्थान में पूरी तरह से अनुकूलित होते हैं, जो 3डी ज्यामिति बिंदुओं, गहराई मानचित्रों और समान सीजीआई-शैली के अन्य पूर्व ज्ञान की आवश्यकता को समाप्त करते हैं।

व्यक्तिगत वस्तुओं के संदर्भ मानचित्र को भी विश्वसनीय रूप से बदला जा सकता है:

2021 के फ्रेमवर्क के तहत एक चलती वस्तु में संगत परिवर्तन। स्रोत: https://www.youtube.com/watch?v=aQhakPFC4oQ

2021 के फ्रेमवर्क के तहत एक चलती वस्तु में संगत परिवर्तन। स्रोत: https://www.youtube.com/watch?v=aQhakPFC4oQ

मूल रूप से, 2021 प्रणाली ज्यामितीय संरेखण, मैच-मूविंग, मानचित्रण, पुनः-टेक्सचराइजेशन और रोटोस्कोपिंग को एक विच्छिन्न तंत्रिका प्रक्रिया में जोड़ती है।

Text2Live

2021 के पेपर के तीन मूल शोधकर्ता, NVIDIA शोध के साथ मिलकर, एक नए नवाचार में योगदानकर्ता हैं जो परतदार मानचित्रों की शक्ति को उस प्रकार के टेक्स्ट-निर्देशित CLIP प्रौद्योगिकी के साथ जोड़ती है जो इस सप्ताह OpenAI के DALL-E 2 फ्रेमवर्क की रिलीज के साथ प्रमुखता में वापस आया है।

नई वास्तुकला, जिसे Text2Live कहा जाता है, एक अंतिम उपयोगकर्ता को टेक्स्ट प्रोम्प्ट के आधार पर वास्तविक वीडियो सामग्री में स्थानीय संपादन बनाने की अनुमति देती है:

अग्रभूमि संपादन के दो उदाहरण। बेहतर रिज़ॉल्यूशन और परिभाषा के लिए, मूल वीडियो को https://text2live.github.io/sm/pages/video_results_atlases.html पर देखें

अग्रभूमि संपादन के दो उदाहरण। बेहतर रिज़ॉल्यूशन और परिभाषा के लिए, मूल वीडियो को https://text2live.github.io/sm/pages/video_results_atlases.html पर देखें

Text2Live बिना पूर्व-प्रशिक्षित जनरेटर का उपयोग किए सेमेंटिक और अत्यधिक स्थानीय संपादन प्रदान करता है, जो प्रभावित वीडियो क्लिप के लिए विशिष्ट एक आंतरिक डेटाबेस का उपयोग करता है।

Text2Live के तहत पृष्ठभूमि और अग्रभूमि (वस्तु) परिवर्तन। स्रोत: https://text2live.github.io/sm/pages/video_results_atlases.html

Text2Live के तहत पृष्ठभूमि और अग्रभूमि (वस्तु) परिवर्तन। स्रोत: https://text2live.github.io/sm/pages/video_results_atlases.html

यह तकनीक पारंपरिक रोटोस्कोपिंग या ग्रीन-स्क्रीन वर्कफ्लो जैसे उपयोगकर्ता-प्रदत्त मास्क की आवश्यकता नहीं है, बल्कि 2021 के शोध से एक बूटस्ट्रैपिंग तकनीक के माध्यम से प्रासंगिकता मानचित्र का अनुमान लगाता है।

एक ट्रांसफॉर्मर-आधारित जेनेरिक ध्यान मॉडल द्वारा उत्पन्न आउटपुट मानचित्र।

एक ट्रांसफॉर्मर-आधारित जेनेरिक ध्यान मॉडल द्वारा उत्पन्न आउटपुट मानचित्र।

नई पेपर का शीर्षक Text2LIVE: टेक्स्ट-निर्देशित परतदार छवि और वीडियो संपादन है। मूल 2021 टीम विज़मैन के ओमेर बार-ताल और NVIDIA रिसर्च के योनी कास्टेन द्वारा शामिल की जाती है।

वास्तुकला

Text2Live में एक जनरेटर शामिल है जो एकमात्र इनपुट छवि और लक्ष्य टेक्स्ट प्रोम्प्ट पर प्रशिक्षित होता है। 400 मिलियन टेक्स्ट/छवि जोड़ियों पर पूर्व-प्रशिक्षित एक CLIP मॉडल से संबंधित दृश्य सामग्री प्रदान करता है जिससे उपयोगकर्ता-इनपुट परिवर्तनों की व्याख्या की जा सकती है।

जनरेटर एक इनपुट छवि (फ्रेम) स्वीकार करता है और एक लक्ष्य आरजीबी ए लेयर का उत्पादन करता है जिसमें रंग और अपारदर्शिता जानकारी शामिल है। इस परत को तब मूल फुटेज में अतिरिक्त अभिवृद्धि के साथ संयुक्त किया जाता है।

उत्पन्न आरजीबी ए लेयर में अल्फा चैनल एक आंतरिक संयोजन कार्य प्रदान करता है जो पारंपरिक पाइपलाइनों को शामिल नहीं करता है जिसमें पिक्सेल-आधारित सॉफ्टवेयर जैसे कि आफ्टर इफेक्ट्स शामिल हैं।

उत्पन्न आरजीबी ए लेयर में अल्फा चैनल एक आंतरिक संयोजन कार्य प्रदान करता है जो पारंपरिक पाइपलाइनों को शामिल नहीं करता है जिसमें पिक्सेल-आधारित सॉफ्टवेयर जैसे कि आफ्टर इफेक्ट्स शामिल हैं।

आंतरिक छवियों पर प्रशिक्षण द्वारा जो लक्ष्य वीडियो या छवि से संबंधित हैं, Text2Live इनपुट छवि को एक जेनरेटिव एडवर्सारियल नेटवर्क (GAN) के लेटेंट स्पेस में इनवर्ट करने या एक डिफ्यूजन मॉडल का उपयोग करने की आवश्यकता से बचता है, जो उत्पादन-वीडियो संपादन आवश्यकताओं के लिए पर्याप्त सटीक नहीं है।

Text2Live से प्रोम्प्ट-आधारित परिवर्तन संपादन।

Text2Live से प्रोम्प्ट-आधारित परिवर्तन संपादन।

पिछले दृष्टिकोणों ने या तो प्रसार-आधारित विधियों या ऑप्टिकल फ्लो-आधारित दृष्टिकोण का उपयोग किया है। चूंकि ये तकनीकें किसी न किसी हद तक फ्रेम-आधारित हैं, वे आउटपुट वीडियो में परिवर्तनों की संगत कालिक उपस्थिति बनाने में सक्षम नहीं हैं। एक तंत्रिका परतदार मानचित्र, इसके बजाय, एक एकल स्थान प्रदान करता है जिसमें परिवर्तनों को संबोधित किया जा सकता है, जो तब प्रतिबद्ध परिवर्तन के प्रति वफादार रहता है क्योंकि वीडियो आगे बढ़ता है।

कोई 'सिज़लिंग' या यादृच्छिक हॉलुसिनेशन नहीं: Text2Live टेक्स्ट प्रोम्प्ट 'रस्टी जीप' की व्याख्या प्राप्त करता है और इसे वीडियो में कार के तंत्रिका परतदार मानचित्र में एक बार लागू करता है, प्रत्येक व्याख्या किए गए फ्रेम के लिए परिवर्तन को पुनः आरंभ करने के बजाय।

कोई ‘सिज़लिंग’ या यादृच्छिक हॉलुसिनेशन नहीं: Text2Live टेक्स्ट प्रोम्प्ट ‘रस्टी जीप’ की व्याख्या प्राप्त करता है और इसे वीडियो में कार के तंत्रिका परतदार मानचित्र में एक बार लागू करता है, प्रत्येक व्याख्या किए गए फ्रेम के लिए परिवर्तन को पुनः आरंभ करने के बजाय।

जीप को एक जंग खाए हुए अवशेष में Text2Live के संगत परिवर्तन का कार्यप्रवाह।

जीप को एक जंग खाए हुए अवशेष में Text2Live के संगत परिवर्तन का कार्यप्रवाह।

Text2Live एआई-आधारित संयोजन में एक सफलता के करीब है, न कि टेक्स्ट-टू-इमेज स्थान में जिसने इस सप्ताह OpenAI के DALL-E फ्रेमवर्क की दूसरी पीढ़ी की रिलीज के साथ बहुत ध्यान आकर्षित किया है।

इसके बजाय, Text2Live अंतिम उपयोगकर्ता को एक मानचित्र निकालने और फिर इसे एक ही पास में उच्च-नियंत्रण पिक्सेल-आधारित वातावरण जैसे फोटोशॉप (और तर्कसंगत रूप से अधिक अमूर्त छवि संश्लेषण फ्रेमवर्क जैसे NeRF) में संपादित करने की अनुमति देता है, इससे पहले कि इसे एक सही ढंग से उन्मुख वातावरण में वापस खिलाया जाए जो 3डी अनुमान या पीछे की ओर देखने वाले सीजीआई-आधारित दृष्टिकोण पर निर्भर नहीं करता है।

इसके अलावा, Text2Live, लेखकों का दावा है, एक पूरी तरह से स्वचालित तरीके से मास्किंग और संयोजन हासिल करने वाला पहला तुलनीय फ्रेमवर्क है।

 

पहली बार 7 अप्रैल 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]