Anderson का एंगल

NeRF: फेसबुक के सह-शोध ने मिश्रित स्थिर/गतिशील वीडियो संश्लेषण विकसित किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

वर्जीनिया पॉलिटेक्निक इंस्टीट्यूट और स्टेट यूनिवर्सिटी और फेसबुक के बीच एक सहयोग ने न्यूरल रेडिएंस फील्ड्स (NeRF) वीडियो संश्लेषण में एक प्रमुख चुनौती का समाधान किया है: स्थिर और गतिशील छवियों और वीडियो को मुक्त रूप से मिलाना।

सिस्टम नेविगेबल दृश्य उत्पन्न कर सकता है जिनमें गतिशील वीडियो तत्व और स्थिर पर्यावरण दोनों शामिल हैं, प्रत्येक स्थान पर रिकॉर्ड किया गया है, लेकिन एक आभासी पर्यावरण के नियंत्रित पहलुओं में अलग किया गया है:

इसके अलावा, यह एक ही दृष्टिकोण से ऐसा करता है, बिना उस प्रकार के मल्टी-कैमरा सरणी की आवश्यकता के जो इस तरह की पहलों को एक स्टूडियो वातावरण से बांध सकता है।

शोध पत्र, जिसका शीर्षक डायनामिक मोनोक्युलर वीडियो से डायनामिक दृश्य संश्लेषण है, पहला नहीं है जिसने एक मोनोक्युलर नेरफ़ वर्कफ़्लो विकसित किया है, लेकिन यह पहला लगता है जो एक ही इनपुट से समय-परिवर्तनशील और समय-स्थिर मॉडल दोनों को एक साथ प्रशिक्षित करता है, और एक फ्रेमवर्क उत्पन्न करता है जो गति वीडियो को एक ‘प्री-मैप्ड’ नेरफ़ स्थान में अस्तित्व में आने देता है, जैसे कि आभासी पर्यावरण जो अक्सर उच्च बजट के एसएफ आउटिंग में अभिनेताओं को घेरते हैं।

बियॉन्ड डी-नेरफ़

शोधकर्ताओं को मूल रूप से डायनामिक नेरफ़ (डी-नेरफ़) की बहुमुखी प्रतिभा को एक ही दृष्टिकोण के साथ पुनः बनाना पड़ा, न कि डी-नेरफ़ द्वारा उपयोग किए जाने वाले कैमरों की बहुलता। इसे हल करने के लिए, उन्होंने आगे और पीछे दृश्य प्रवाह की भविष्यवाणी की और इस जानकारी का उपयोग एक विकृत प्राकाशिक क्षेत्र विकसित करने के लिए किया जो समय-समय पर सुसंगत है।

केवल एक दृष्टिकोण के साथ, 2डी ऑप्टिकल प्रवाह विश्लेषण का उपयोग करके संदर्भ फ्रेम में 3डी बिंदु प्राप्त करने के लिए आवश्यक था। गणना किया गया 3डी बिंदु तब आभासी कैमरे में वापस फीड किया जाता है ताकि एक ‘दृश्य प्रवाह’ स्थापित किया जा सके जो गणना किए गए ऑप्टिकल प्रवाह को अनुमानित ऑप्टिकल प्रवाह के साथ मिलाता है।

प्रशिक्षण समय पर, गतिशील तत्व और स्थिर तत्व एक पूर्ण मॉडल में अलग से सुलभ पहलुओं के रूप में सुलह किए जाते हैं।

गहराई क्रम हानि की गणना को शामिल करके और डी-नेरफ़ में दृश्य प्रवाह भविष्यवाणी को कठोर नियमन करके, गति धुंधलापन की समस्या को बहुत कम किया जाता है।

हालांकि शोध नेरफ़ गणना को नियमित करने और एकल दृष्टिकोण से आउटपुट के लिए अन्वेषण की दक्षता और सुविधा में बहुत कुछ प्रदान करता है, कम से कम उतना ही महत्वपूर्ण है गतिशील और स्थिर नेरफ़ तत्वों का नोवेल पृथक्करण और पुनः एकीकरण।

एक ही कैमरे पर निर्भर करते हुए, ऐसी प्रणाली मल्टी-कैमरा सरणी नेरफ़ सेटअप के पैनोप्टिकन दृश्य को दोहरा नहीं सकती है, लेकिन यह कहीं भी जा सकती है, और बिना ट्रक के।

नेरफ़ – स्थिर या वीडियो?

हाल ही में हमने चीन से कुछ प्रभावशाली नए नेरफ़ शोध को देखा है जो 16 कैमरों के साथ कब्जा किए गए एक गतिशील नेरफ़ दृश्य में तत्वों को अलग करने में सक्षम है।

एसटी-नेरफ़

एसटी-नेरफ़ (ऊपर) दर्शक को एक कब्जा किए गए दृश्य में व्यक्तिगत तत्वों को पुनः स्थित करने, उन्हें आकार बदलने, उनकी प्लेबैक दर बदलने, उन्हें जमाने या उन्हें उल्टा चलाने की अनुमति देता है। इसके अलावा, एसटी-नेरफ़ उपयोगकर्ता को 16 कैमरों द्वारा कब्जा किए गए 180-डिग्री आर्क के किसी भी हिस्से के माध्यम से ‘स्क्रॉल’ करने की अनुमति देता है।

हालांकि, एसटी-नेरफ़ पेपर के शोधकर्ता स्वीकार करते हैं कि इस प्रणाली के तहत समय हमेशा किसी न किसी दिशा में चलता रहता है, और यह परिवेशों पर प्रभाव लगाने और उन्हें वीडियो के बजाय ‘स्थिर-मैप्ड’ नेरफ़ पर्यावरण में बदलना मुश्किल है जो वास्तव में गतिशील घटकों को शामिल नहीं करते हैं और कब्जा करने की आवश्यकता नहीं है।

उच्च संपादन योग्य स्थिर नेरफ़ पर्यावरण

एक स्थिर न्यूरल रेडिएंस फील्ड दृश्य, अब गति वीडियो खंडों से अलग है, कई तरीकों से उपचार और पूरक करने में आसान है, जिसमें पुनः प्रकाश व्यवस्था भी शामिल है, जैसा कि पहले इस वर्ष नेरवी (न्यूरल प्रतिबिंब और दृश्यता क्षेत्र पुनः प्रकाश व्यवस्था और दृश्य संश्लेषण के लिए) द्वारा प्रस्तावित किया गया था, जो एक नेरफ़ पर्यावरण या वस्तु की प्रकाश व्यवस्था और/या पाठ्यक्रम को बदलने के लिए एक प्रारंभिक कदम प्रदान करता है:

नेरवी के साथ नेरफ़ वस्तु को पुनः प्रकाश व्यवस्था करना। स्रोत: https://www.youtube.com/watch?v=4XyDdvhhjVo

नेरवी के साथ नेरफ़ वस्तु को पुनः प्रकाश व्यवस्था करना। स्रोत: https://www.youtube.com/watch?v=4XyDdvhhjVo

नेरवी में पुनः पाठ्यक्रम, जिसमें फोटोरियलिस्टिक स्पेक्युलर प्रभाव भी शामिल हैं। चूंकि छवियों की सरणी का आधार स्थिर है, इसलिए इस तरह से नेरफ़ पहलू को संसाधित और पूरक करना आसान है कि वीडियो फ्रेमों की एक श्रृंखला में प्रभाव को शामिल करने की तुलना में प्रारंभिक पूर्व-प्रसंस्करण और अंतिम प्रशिक्षण हल्का और आसान है।

नेरवी में पुनः पाठ्यक्रम, जिसमें फोटोरियलिस्टिक स्पेक्युलर प्रभाव भी शामिल हैं। चूंकि छवियों की सरणी का आधार स्थिर है, इसलिए इस तरह से नेरफ़ पहलू को संसाधित और पूरक करना आसान है कि वीडियो फ्रेमों की एक श्रृंखला में प्रभाव को शामिल करने की तुलना में प्रारंभिक पूर्व-प्रसंस्करण और अंतिम प्रशिक्षण हल्का और आसान है।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]