Anderson का एंगल

न्यूरल रेंडरिंग: NeRF ने ताज़ी हवा में सैर की

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Google Research और हार्वर्ड विश्वविद्यालय के बीच सहयोग ने एक नई विधि विकसित की है जो Neural Radiance Fields (NeRF) का उपयोग करके पूर्ण दृश्यों का 360-डिग्री न्यूरल वीडियो बनाती है। यह नवीन दृष्टिकोण NeRF को किसी भी वातावरण में सहज सारगर्भित उपयोग के एक कदम और करीब ले जाता है, बिना टेबलटॉप मॉडल या बंद इंटीरियर परिदृश्यों तक सीमित रहे।

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

पूरा वीडियो देखने के लिए लेख के अंत देखें। स्रोत: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 विस्तारित पृष्ठभूमियों और आकाश जैसे ‘अनंत’ वस्तुओं को संभाल सकता है, क्योंकि अधिकांश पूर्व संस्करणों के विपरीत यह प्रकाश किरणों की व्याख्या पर सीमाएँ निर्धारित करता है, और ध्यान की सीमाएँ बनाता है जो अन्यथा लंबी प्रशिक्षण अवधि को तर्कसंगत बनाती हैं। अधिक उदाहरणों और प्रक्रिया की विस्तृत जानकारी के लिए इस लेख के अंत में एम्बेड किया गया नया सहायक वीडियो देखें।

यह नया पेपर शीर्षक Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields रखता है, और इसे Google Research के वरिष्ठ स्टाफ रिसर्च साइंटिस्ट Jon Barron ने नेतृत्व किया है।

इस प्रगति को समझने के लिए, यह आवश्यक है कि आप न्यूरल रेडियंस फ़ील्ड-आधारित इमेज सिंथेसिस कैसे कार्य करता है, इसकी बुनियादी समझ रखें।

NeRF क्या है?

NeRF नेटवर्क को ‘वीडियो’ के संदर्भ में वर्णित करना समस्याग्रस्त है, क्योंकि यह पूर्ण 3D-प्रकाशित लेकिन AI-आधारित वर्चुअल वातावरण के अधिक करीब है, जहाँ एकल फ़ोटो (वीडियो फ्रेम सहित) के कई दृष्टिकोणों का उपयोग करके एक दृश्य को जोड़ते हैं जो तकनीकी रूप से केवल मशीन लर्निंग एल्गोरिदम की लेटेंट स्पेस में मौजूद होता है – लेकिन जिससे मनचाहे रूप में असंख्य दृष्टिकोण और वीडियो निकाले जा सकते हैं।

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

NeRF द्वारा एक न्यूरल दृश्य में संयोजित किए जाने वाले डेटा प्रदान करने वाले कई कैमरा कैप्चर पॉइंट्स का चित्रण (दाएँ दिखाया गया)।

योगदान करने वाली फ़ोटो से प्राप्त जानकारी को एक मैट्रिक्स में प्रशिक्षित किया जाता है जो CGI कार्यप्रवाहों में पारंपरिक वॉक्सेल ग्रिड के समान होता है, जहाँ 3D स्थान के प्रत्येक बिंदु को एक मान मिलता है, जिससे दृश्य नेविगेटेबल बन जाता है।

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

एक पारंपरिक वॉक्सेल मैट्रिक्स पिक्सेल जानकारी (जो सामान्यतः 2D संदर्भ में होती है, जैसे JPEG फ़ाइल की पिक्सेल ग्रिड) को त्रि-आयामी स्थान में रखता है। स्रोत: ResearchGate

फ़ोटो के बीच अंतरिक्ष (यदि आवश्यक हो) की गणना करने के बाद, प्रत्येक योगदान करने वाली फ़ोटो के प्रत्येक संभावित पिक्सेल का मार्ग प्रभावी रूप से ‘रे-ट्रेस’ किया जाता है और एक रंग मान, साथ ही पारदर्शिता मान सौंपा जाता है (जिसके बिना न्यूरल मैट्रिक्स पूरी तरह अपारदर्शी या पूरी तरह खाली हो जाएगा)।

वॉक्सेल ग्रिड की तरह, और CGI-आधारित 3D कोऑर्डिनेट स्पेस के विपरीत, एक ‘बंद’ वस्तु का ‘आंतरिक’ भाग NeRF मैट्रिक्स में अस्तित्व नहीं रखता। आप चाहें तो एक CGI ड्रम किट को खोलकर अंदर देख सकते हैं; लेकिन NeRF के दृष्टिकोण से, ड्रम किट का अस्तित्व तब समाप्त हो जाता है जब उसकी सतह का अपारदर्शिता मान ‘1’ के बराबर हो जाता है।

पिक्सेल का व्यापक दृश्य

Mip-NeRF 360, मार्च 2021 के शोध का एक विस्तार है, जिसने प्रभावी रूप से NeRF में व्यापक सुपरसैंपलिंग के बिना कुशल एंटी-एलियासिंग पेश किया।

NeRF पारंपरिक रूप से केवल एक पिक्सेल पथ की गणना करता है, जो शुरुआती इंटरनेट इमेज फ़ॉर्मेट्स की विशेषता वाले ‘जैगीज़’ और पहले के गेम सिस्टम जैसी किनारों को उत्पन्न करने की प्रवृत्ति रखता है। इन खुरदुरे किनारों को विभिन्न तरीकों से हल किया गया, आमतौर पर निकटवर्ती पिक्सेल को सैंपल करके औसत प्रतिनिधित्व निकालने से।

क्योंकि पारंपरिक NeRF केवल उस एक पिक्सेल पथ को सैंपल करता है, Mip-NeRF ने एक ‘कोनिकल’ कैचमेंट एरिया पेश किया, जैसे व्यापक बीम टॉर्च, जो निकटवर्ती पिक्सेल के बारे में पर्याप्त जानकारी प्रदान करता है ताकि बेहतर विवरण के साथ किफायती एंटी-एलियासिंग उत्पन्न हो सके।

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Mip-NeRF द्वारा उपयोग किया गया कोनिकल कैचमेंट को कोनिकल फ्रस्टम (नीचे) में विभाजित किया गया है, जिन्हें आगे ‘ब्लर’ किया जाता है ताकि एक अस्पष्ट गॉसियन स्पेस बन सके जिसका उपयोग पिक्सेल की सटीकता और एलियासिंग की गणना में किया जा सके। स्रोत: https://www.youtube.com/watch?v=EpH175PY1A0

मानक NeRF कार्यान्वयन की तुलना में सुधार उल्लेखनीय था:

Mip-NeRF (right), released in मार्च 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (दाएँ), मार्च 2021 में जारी, अधिक व्यापक लेकिन किफायती एलियासिंग पाइपलाइन के माध्यम से बेहतर विवरण प्रदान करता है, न कि केवल खुरदुरे किनारों से बचने के लिए पिक्सेल को ‘ब्लर’ करने से। स्रोत: https://jonbarron.info/mipnerf/

NeRF अनबाउंडेड

मार्च के पेपर ने Mip-NeRF को अनबाउंडेड परिवेशों में उपयोग करने के संबंध में तीन समस्याएँ अनसुलझी छोड़ दीं, जिनमें बहुत दूर स्थित वस्तुएँ और आकाश शामिल हो सकते हैं। नया पेपर इसे Mip-NeRF गॉसियनों पर एक कल्मन-शैली वॉर्प लागू करके हल करता है।

दूसरा, बड़े दृश्यों को अधिक प्रोसेसिंग शक्ति और विस्तारित प्रशिक्षण समय की आवश्यकता होती है, जिसे Mip-NeRF 360 एक छोटे ‘प्रस्ताव’ मल्टी-लेयर पर्सेप्ट्रॉन (MLP) के साथ दृश्य ज्यामिति को ‘डिस्टिल’ करके हल करता है, जो बड़े मानक NeRF MLP द्वारा अनुमानित ज्यामिति को पूर्व-सीमित करता है। इससे प्रशिक्षण गति तीन गुना बढ़ जाती है।

अंत में, बड़े दृश्यों से व्याख्यायित ज्यामिति का डिस्क्रीटाइज़ेशन अस्पष्ट हो जाता है, जिससे गेम आउटपुट ‘टियर्स’ की तरह आर्टिफैक्ट्स उत्पन्न होते हैं, जिनसे गेमर्स परिचित होते हैं। नया पेपर इस समस्या को Mip-NeRF रे इंटरवल्स के लिए एक नया रेग्युलराइज़र बनाकर संबोधित करता है।

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

दाएँ तरफ, हम Mip-NeRF में बड़े दृश्य को सीमित करने में कठिनाई के कारण अनचाहे आर्टिफैक्ट्स देखते हैं। बाएँ तरफ, हम देखते हैं कि नया रेग्युलराइज़र दृश्य को पर्याप्त रूप से अनुकूलित कर चुका है जिससे ये व्यवधान हट गए हैं।

नए पेपर के बारे में अधिक जानने के लिए, नीचे दिया गया वीडियो देखें, और साथ ही Mip-NeRF का मार्च 2021 वीडियो परिचय देखें। आप अब तक हमारी कवरेज को देख कर NeRF शोध के बारे में और अधिक जानकारी प्राप्त कर सकते हैं।

मूल रूप से प्रकाशित 25 नवंबर 2021
21 दिसंबर 2021, 12:25pm – मृत वीडियो को बदल दिया गया। – MA

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai