Anderson का एंगल
NeRF एक और कदम CGI को बदलने के लिए करीब आता है

एमआईटी और गूगल के शोधकर्ताओं ने एक उभरती हुई एआई-चालित प्रौद्योगिकी के लिए सबसे मूलभूत बाधाओं में से एक को हल करने में एक बड़ा कदम उठाया है, जो अंततः सीजीआई को बदल सकता है – न्यूरल रेडिएंस फील्ड (नेरफ) इमेजरी को इसके संविधानिक दृश्य घटकों में विभाजित करना, ताकि इमेजरी को फिर से बनाया जा सके और पुनः प्रकाशित किया जा सके।
नई दृष्टिकोण, जिसे नेरफैक्टर कहा जाता है, प्रभावी रूप से कब्जा की गई इमेजरी को प्रति-वस्तु सामान्य (जिस पर बनावट सौंपी जा सकती हैं), प्रकाश दृश्यता, अल्बेडो (प्रतिबिंबित प्रकाश का अनुपात जो एक सतह से दूर हो जाता है) और द्विदिश प्रतिबिंब वितरण कार्यों (बीआरडीएफ) में विभाजित करता है।
इन पहलुओं को अलग करने के साथ, यह न केवल व्यक्तिगत वस्तुओं या वस्तु समूहों के लिए बनावट बदलने के लिए संभव है, बल्कि नए और अनोखे प्रकाश स्रोतों और छाया कार्यान्वयन जोड़ने के लिए भी संभव है, जो कि बहु-कैमरा सरणियों द्वारा कब्जा किए गए इनपुट के लिए नेरफ इमेजरी द्वारा कब्जा किए गए किसी भी प्रकाश को छोड़ देता है।

नेरफैक्टर के तहत सामान्य, दृश्यता, अल्बेडो और बीआरडीएफ अलग किए गए। स्रोत: https://www.youtube.com/watch?v=UUVSPJlwhPg
मॉडल उपयोगकर्ता-परिभाषित प्रकाश स्रोतों से नरम या कठोर छाया का समर्थन करता है, और एक पुनर्निर्माण हानि, पिछली बीआरडीएफ गणनाओं के डेटा और बुनियादी सरल चिकनाई नियमितीकरण का उपयोग करके चार कब्जा किए गए वीडियो के पहलुओं को कार्यक्रमिक रूप से अलग करता है।


नेरफैक्टर का कार्य-प्रवाह, बहु-कैमरा सरणियों से व्युत्पन्न इमेजरी के स्वतंत्र रूप से कार्रवाई योग्य पहलुओं को निकालता है। स्रोत: https://arxiv.org/pdf/2106.01970.pdf
नेरफैक्टर एक एचडीआर लाइट प्रोब का उपयोग करता है, जो एक अच्छी तरह से स्थापित दृष्टिकोण है जो 1998 में इसकी पेश के बाद से दृश्य उद्योग और कला दृश्य में प्रवेश कर चुका है, संभावित मार्गों के लिए किरणों का मूल्यांकन करने के लिए, जो मनमाने प्रकाश को सक्षम बनाता है।
विचार के लिए कारण
नई शोध शायद सबसे अधिक महत्वपूर्ण है जो कब्जा की गई इमेजरी की परतों को अलग करती है जो प्रतिबिंब को नियंत्रित करती है। यह न्यूरल रेडिएंस फील्ड इमेजरी के लिए सबसे बड़ी चुनौतियों में से एक बनी हुई है, क्योंकि एक वास्तव में नए और लचीले नेरफ सिस्टम को न केवल बनावट को बदलने में सक्षम होने की आवश्यकता होगी, बल्कि महत्वपूर्ण रूप से यह सुनिश्चित करने की आवश्यकता होगी कि यह सामान्य तय किए गए वातावरण (इसके अलावा कि केवल स्थिर) के अलावा चलती वस्तुओं को प्रतिबिंबित करने में सक्षम हो।

यह मुद्दा हाल ही में इंटेल के प्रभावशाली नए शोध के संबंध में उल्लेख किया गया था, जो कि वीडियोगेम फुटेज को कॉनवोल्यूशनल न्यूरल नेटवर्क के माध्यम से फोटोरियलिस्टिक वीडियो में परिवर्तित करने के लिए था।
इसलिए, नेरफ वीडियो में परतों को अलग करना जो प्रतिबिंब को सुविधा प्रदान करता है, नेरफ को अपनी ‘प्रतिबिंब चुनौती’ को हल करने के लिए एक कदम करीब लाता है।
हडीआर वातावरण का उपयोग पहले से ही दुनिया के पर्यावरण प्रतिबिंब (जैसे कि आकाश, परिदृश्य और अन्य ‘स्थिर’ पर्यावरण कारक) को उत्पन्न करने के मुद्दे का समाधान करता है, लेकिन चलती और गतिशील प्रतिबिंब पेश करने के लिए नए दृष्टिकोण की आवश्यकता होगी।
नेरफ के साथ फोटोग्रामेट्री
न्यूरल रेडिएंस फील्ड इमेजरी मशीन लर्निंग विश्लेषण का उपयोग करके एक दृश्य या वस्तु से एक पूरी तरह से वolumetric स्थान विकसित करती है जो कई कोणों से कब्जा की गई है।

नेरफ-आधारित योजनाओं के विभिन्न जो पिछले वर्ष में उभरे हैं, एक विविध संख्या में योगदान कैमरा उपकरणों का उपयोग किया है; कुछ 16 या अधिक कैमरों का उपयोग करते हैं, अन्य एक या दो का उपयोग करते हैं। सभी मामलों में, मध्यवर्ती दृश्य ‘इन्फिल्ड’ (अर्थात व्याख्या की जाती है) ताकि दृश्य या वस्तु को तरल रूप से नेविगेट किया जा सके।
परिणामी इकाई एक पूरी तरह से वolumetric स्थान है, जिसमें एक अंतर्निहित 3डी समझ है जो कई तरीकों से शोषित की जा सकती है, जिसमें 3डी-पार्स्ड योग के इनपुट छवियों से पारंपरिक सीजीआई जाले उत्पन्न करने की क्षमता भी शामिल है।
नेरफ एक ‘न्यू सीजीआई’ के संदर्भ में
न्यूरल रेडिएंस फील्ड इमेजरी सीधे वास्तविक दुनिया की छवियों से निकाली जाती है, जिसमें चलती छवियों के साथ-साथ लोग, वस्तुओं और दृश्यों की छवियां शामिल हैं। इसके विपरीत, एक सीजीआई पद्धति ‘अध्ययन’ और व्याख्या करती है दुनिया, कुशल श्रमिकों को जाले, रिग और बनावट बनाने की आवश्यकता होती है जो वास्तविक दुनिया की छवियों (जैसे कि चेहरे और पर्यावरणीय कब्जे) का उपयोग करते हैं। यह एक मूलभूत रूप से व्याख्यात्मक और कारीगर दृष्टिकोण है जो महंगा और श्रमसाध्य है।
इसके अलावा, सीजीआई को मानव समानता को पुनः बनाने में ‘असहज घाटी’ प्रभाव के साथ समस्याएं हुई हैं, जो नेरफ-चालित दृष्टिकोण के लिए कोई प्रतिबंध नहीं है, जो कि वास्तविक लोगों और इसे मैनिपुलेट करने के लिए वीडियो या छवियों को कैप्चर करता है।
इसके अलावा, नेरफ पारंपरिक सीजीआई-शैली के जाले ज्यामिति को सीधे फोटो से उत्पन्न कर सकता है, और वास्तव में सीजीआई में हमेशा से आवश्यक कई मैनुअल प्रक्रियाओं को प्रतिस्थापित कर सकता है।
नेरफ के लिए चुनौतियां
यह最新 शोध एमआईटी और गूगल से नेरफ की विभिन्न चुनौतियों को हल करने के लिए कई शोध पत्रों के बीच आता है जो पिछले वर्ष में सामने आए हैं।
अप्रैल में, एक चीनी शोध संघ ने एक तरीका प्रदान किया विविधता नेरफ दृश्य में पहलुओं के व्यक्तिगत समयरेखा को अलग करने के लिए, जिसमें लोग शामिल हैं।

चीनी शोध उपयोगकर्ताओं को कब्जा की गई तत्वों को कॉपी, पेस्ट और आकार बदलने की अनुमति देता है, उन्हें मूल स्रोत वीडियो की रैखिक समयरेखा से अलग करता है। स्रोत: https://www.youtube.com/watch?v=Wp4HfOwFGP4
यह दृष्टिकोण न केवल दृश्य को कैमरा सरणी द्वारा कब्जा की गई किसी भी दृश्य से पुनः कल्पना करने में सक्षम बनाता है (और केवल एक विशिष्ट वीडियो कब्जा में प्रतिनिधित्व किया गया है), लेकिन यह भी बहुमुखी संयोजन – और यहां तक कि दो पहलुओं को प्रतिनिधित्व करने की क्षमता प्रदान करता है जो同 एक ही फुटेज से चल रहे हैं जो अपने स्वयं के व्यक्तिगत समय-फ्रेम (या यहां तक कि उल्टा भी चल रहे हैं, यदि आवश्यक हो) में चल रहे हैं।

एक ही दृश्य में दो अलग-अलग नेरफ पहलू अलग-अलग गति से चलते हैं। स्रोत: https://www.youtube.com/watch?v=Wp4HfOwFGP4
नेरफ के लिए एक बड़ी चुनौती दृश्य को प्रशिक्षित करने के लिए आवश्यक महत्वपूर्ण संसाधनों को कम करना है, और यह हाल के कई शोध पत्रों में संबोधित किया गया है। उदाहरण के लिए, मैक्स प्लैंक इंस्टीट्यूट फॉर इंटेलिजेंट सिस्टम ने किलोनेरफ पेश किया है, जो न केवल रेंडरिंग समय को 1000 गुना तेज कर देता है, बल्कि नेरफ को इंटरैक्टिव रूप से संचालित करने में भी सक्षम बनाता है।

एक जीटीएक्स 1080ti पर 50fps पर इंटरैक्टिव वातावरण में किलोनेरफ चल रहा है। स्रोत: https://github.com/creiser/kilonerf
हालांकि, नेरफ की गति नवाचार जो वास्तव में 2021 में शोधकर्ताओं और जनता की कल्पना को पकड़ लिया है, वह यूसी बर्कले के नेतृत्व वाले प्लेनोक्ट्रीज सहयोग है, जो न्यूरल रेडिएंस फील्ड्स के वास्तविक समय रेंडरिंग की पेशकश करता है:
प्लेनोक्ट्रीज़ की इंटरैक्टिव क्षमताओं का प्रभाव एक लाइव, वेब-आधारित इंटरफ़ेस में पुनः उत्पन्न किया गया है।

फायरफॉक्स में प्लेनोक्ट्रीज़ ऑब्जेक्ट की लाइव इंटरैक्टिव मूवमेंट (गति अधिक चिकनी और गतिशील है)। स्रोत: http://alexyu.net/plenoctrees/demo/
इसके अलावा, रिकर्सिव-नेरफ (मई 2021 में त्सिंगहुआ विश्वविद्यालय के शोधकर्ताओं द्वारा एक पत्र से) मांग पर उच्च गुणवत्ता वाली पुनरावृत्ति रेंडरिंग प्रदान करता है – जेपीईजी की हानिपूर्ण संपीड़न के समान कुछ प्रदान करता है, और विशिष्ट अतिरिक्त छवियों को संभालने के लिए विशिष्ट उप-नेरफ़ उत्पन्न कर सकता है – गणनात्मक संसाधनों में एक बड़ा बचत हासिल करता है।

रिकर्सिव-नेरफ के साथ अनावश्यक रेंडर गणना को छोड़ते हुए विवरण बनाए रखना। स्रोत: https://arxiv.org/pdf/2105.09103.pdf
अन्य दृष्टिकोणों में फास्टनेरफ शामिल है, जो 200fps पर उच्च-विश्वसनीयता वाली न्यूरल रेंडरिंग का दावा करता है।
यह ध्यान दिया गया है कि नेरफ के लिए कई अनुकूलन तकनीकों में दृश्य को ‘बेक’ करना शामिल है, जिसमें रेंडरिंग के लिए वांछित पहलुओं के लिए प्रतिबद्धता और अन्य पहलुओं को छोड़ना शामिल है, जो अन्वेषण को सीमित करता है लेकिन इंटरैक्टिविटी को बहुत तेज कर देता है।
इसका नुकसान यह है कि तनाव जीपीयू से स्टोरेज में स्थानांतरित हो जाता है, क्योंकि बेक्ड दृश्य बहुत अधिक डिस्क स्थान लेते हैं; इसे कुछ हद तक बेक्ड डेटा को डाउनसैंपल करके कम किया जा सकता है, हालांकि यह भी एक निश्चित प्रतिबद्धता को शामिल करता है, अन्वेषण या इंटरैक्टिविटी के मार्गों को बंद करने के संदर्भ में।
मोशन कैप्चर और रिगिंग के संबंध में, झेजियांग और कॉर्नेल विश्वविद्यालयों से, मई में खुलासा एक विधि प्रदान की जो इनपुट वीडियो से व्याख्या की गई हड्डी ढांचे और मिश्रण भार क्षेत्रों का उपयोग करके एनिमेटेबल मानवों को पुनः बनाने में सक्षम बनाती है:

एनिमेटेबल नेरफ में व्युत्पन्न हड्डी ढांचा। स्रोत: https://www.youtube.com/watch?v=eWOSWbmfJo4

नेरफ को अपना ‘जुरासिक पार्क’ पल कब मिलेगा?
नेरफ के माध्यम से छवि संश्लेषण की तेजी से प्रगति के बावजूद, यह केवल इस अवधि में है कि नेरफ कितना तैनात किया जा सकता है, इसके लिए किसी तरह का ‘थर्मोडायनामिक्स का नियम’ स्थापित किया जाएगा। सीजीआई के इतिहास के संदर्भ में, नेरफ वर्तमान में 1973 के आसपास है, जो सीजीआई के पहले उपयोग से पहले वेस्टवर्ल्ड में।
इसका मतलब यह नहीं है कि नेरफ को अपने समकक्ष व्राथ ऑफ खान मील का पत्थर के लिए नौ साल प्रतीक्षा करने की आवश्यकता होगी, या जेम्स कैमरून के 1989 के द एबिस या 1991 के टर्मिनेटर 2 में सीजीआई द्वारा प्राप्त किए गए समान विकास के लिए दशकों की प्रतीक्षा करनी होगी – और फिर, प्रौद्योगिकी का वास्तव में क्रांतिकारी ब्रेकआउट मोमेंट 1993 के जुरासिक पार्क में।

इमेजिंग दृश्य बहुत कुछ बदल गया है फिल्म और टेलीविजन उत्पादन में फोटो-रासायनिक दृश्य प्रभावों के लिए लंबे समय से स्थिरता की अवधि के बाद से। पीसी क्रांति और मूर के नियम की त्वरण के आगमन ने सीजीआई क्रांति को जन्म दिया, जो अन्यथा 1960 के दशक में उतनी ही जल्दी हो सकती थी।
यह देखना बाकी है कि क्या कोई ऐसी बाधा है जो नेरफ की प्रगति को इतने लंबे समय तक रोक सकती है – और यदि बाद के नवाचारों में कंप्यूटर दृष्टि नेरफ को सीजीआई के ताज के मुख्य दावेदार के रूप में पूरी तरह से पार कर सकती है, न्यूरल रेडिएंस फील्ड्स को नेरफ के ‘फैक्स मशीन’ के रूप में वर्णित करती है।
अब तक, नेरफ का उपयोग किसी भी संदर्भ में शोध अनुसंधान के बाहर नहीं किया गया है; लेकिन यह ध्यान देने योग्य है कि गूगल रिसर्च जैसे प्रमुख खिलाड़ी और अधिकांश प्रमुख कंप्यूटर दृष्टि अनुसंधान प्रयोगशालाएं नेरफ के लिए नवीनतम ब्रेकथ्रू के लिए प्रतिस्पर्धा कर रहे हैं।
नेरफ की कई बड़ी बाधाओं को इस साल सीधे तौर पर संबोधित किया गया है; यदि बाद के शोध ‘प्रतिबिंब मुद्दे’ का समाधान प्रदान करते हैं, और नेरफ-ऑप्टिमाइज़िंग शोध के कई तार एक निर्णायक समाधान में एकजुट हो जाते हैं प्रौद्योगिकी की महत्वपूर्ण प्रोसेसिंग और/या स्टोरेज मांगों के लिए, नेरफ वास्तव में ‘नया सीजीआई’ बनने का मौका है अगले पांच वर्षों में।













