Anderson का एंगल

NeRFocus: न्यूरल रेडिएंस फील्ड्स में लाइटवेट फोकस कंट्रोल लाना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

चीन से नए शोध में न्यूरल रेडिएंस फील्ड्स (NeRF) के लिए डेप्थ ऑफ फील्ड प्रभावों पर सस्ता नियंत्रण प्राप्त करने का एक तरीका प्रस्तुत किया गया है, जिससे अंतिम उपयोगकर्ता फोकस रैक कर सकता है और रेंडरिंग स्पेस में वर्चुअल लेंस की कॉन्फ़िगरेशन को गतिशील रूप से बदल सकता है।

इस तकनीक को NeRFocus नाम दिया गया है, जो ‘थिन लेंस इमेजिंग’ दृष्टिकोण को लागू करती है और पी-ट्रेनिंग नामक एक संभावित प्रशिक्षण रणनीति को लागू करती है, जो डेप्थ ऑफ फील्ड डेटासेट की आवश्यकता को समाप्त करती है और फोकस-सक्षम प्रशिक्षण कार्य प्रवाह को सरल बनाती है।

इस पेपर का शीर्षक NeRFocus: न्यूरल रेडिएंस फील्ड फॉर 3डी सिंथेटिक डीफोकस है, और यह पीकिंग विश्वविद्यालय के शेन्ज़ेन ग्रेजुएट स्कूल और शेन्ज़ेन के पेंग चेंग लेबोरेटरी से चार शोधकर्ताओं द्वारा लिखा गया है, जो एक गुआंगडोंग प्रांतीय सरकार द्वारा वित्तपोषित संस्थान है।

न्यूरल रेडिएंस फील्ड्स में फोवेटेड लोकस ऑफ अटेंशन को संबोधित करना

यदि न्यूरल रेडिएंस फील्ड्स वास्तविक और बढ़ी हुई वास्तविकता के लिए एक वैध ड्राइविंग प्रौद्योगिकी के रूप में अपना स्थान बनाना चाहता है, तो इसे वास्तविक फोवेटेड रेंडरिंग की अनुमति देने के लिए एक हल्के तरीके की आवश्यकता होगी, जहां अधिकांश रेंडरिंग संसाधन उपयोगकर्ता की नज़र के आसपास केंद्रित होते हैं, न कि पूरे उपलब्ध दृश्य स्थान में कम रिज़ॉल्यूशन पर असमान रूप से वितरित किए जाते हैं।

2021 के पेपर फोवेटेड न्यूरल रेडिएंस फील्ड्स फॉर रियल-टाइम और एगोसेंट्रिक वर्चुअल रियलिटी से, हम न्यूरल रेडिएंस फील्ड्स के लिए एक नए फोवेटेड रेंडरिंग योजना में ध्यान केंद्रित करते हैं। स्रोत: https://arxiv.org/pdf/2103.16365.pdf

2021 के पेपर फोवेटेड न्यूरल रेडिएंस फील्ड्स फॉर रियल-टाइम और एगोसेंट्रिक वर्चुअल रियलिटी से, हम न्यूरल रेडिएंस फील्ड्स के लिए एक नए फोवेटेड रेंडरिंग योजना में ध्यान केंद्रित करते हैं। स्रोत: https://arxiv.org/pdf/2103.16365.pdf

भविष्य के न्यूरल रेडिएंस फील्ड्स के एगोसेंट्रिक तैनाती की प्रामाणिकता का एक आवश्यक हिस्सा प्रणाली की क्षमता होगी जो मानव आंख की अपनी क्षमता को प्रतिबिंबित करेगी जो दृष्टि के एक पीछे हटने वाले विमान पर फोकस स्विच करने के लिए (ऊपर दी गई पहली छवि देखें)।

यह फोकस का ग्रेडिएंट दृश्य के पैमाने का एक संवेदी संकेतक भी है; एक हेलीकॉप्टर से शहर के ऊपर उड़ान भरने का दृश्य कोई नेविगेट करने योग्य फील्ड ऑफ फोकस नहीं होगा, क्योंकि पूरा दृश्य दर्शक की बाहरी फोकसिंग क्षमता से परे है, जबकि एक मिनिएचर या ‘नियर फील्ड’ दृश्य की जांच नहीं только ‘फोकस रैकिंग’ की अनुमति देगी, लेकिन वास्तविकता के लिए, एक संकीर्ण गहराई का क्षेत्र होना चाहिए।

नीचे NeRFocus की प्रारंभिक क्षमताओं का प्रदर्शन करने वाला एक वीडियो है, जो पेपर के संबंधित लेखक द्वारा हमें प्रदान किया गया है:

प्रतिबंधित फोकल विमान से परे

फोकस नियंत्रण की आवश्यकता के बारे में जागरूक, पिछले वर्षों में कई न्यूरल रेडिएंस फील्ड्स परियोजनाओं ने इसके लिए प्रावधान किया है, हालांकि अब तक के सभी प्रयास वास्तव में किसी तरह के हाथ के खेल या पोस्ट-प्रोसेसिंग दिनचर्या के हैं जो उन्हें वास्तविक समय के वातावरण के लिए उपयुक्त योगदान बनाते हैं जो अंततः न्यूरल रेडिएंस फील्ड्स प्रौद्योगिकियों के लिए कल्पना की जाती है।

न्यूरल रेंडरिंग फ्रेमवर्क में सिंथेटिक फोकल नियंत्रण का प्रयास विभिन्न तरीकों से पिछले 5-6 वर्षों में किया गया है – उदाहरण के लिए, एक सेगमेंटेशन नेटवर्क का उपयोग करके फोरग्राउंड और बैकग्राउंड डेटा को बाड़ लगाने के लिए, और फिर जेनेरिक रूप से बैकग्राउंड को डीफोकस करने के लिए – एक सामान्य समाधान दो-विमान फोकस प्रभाव के लिए।

पेपर 'ऑटोमैटिक पोर्ट्रेट सेगमेंटेशन फॉर इमेज स्टाइलाइजेशन' से, एक साधारण, एनिमेशन-शैली का फोकल विमानों का पृथक्करण। स्रोत: https://jiaya.me/papers/portrait_eg16.pdf

पेपर ‘ऑटोमैटिक पोर्ट्रेट सेगमेंटेशन फॉर इमेज स्टाइलाइजेशन’ से, एक साधारण, एनिमेशन-शैली का फोकल विमानों का पृथक्करण। स्रोत: https://jiaya.me/papers/portrait_eg16.pdf

मल्टीप्लेन प्रतिनिधित्व इस दृष्टिकोण में कुछ आभासी ‘एनिमेशन सेल’ जोड़ते हैं, उदाहरण के लिए, गहराई अनुमान का उपयोग करके दृश्य को विभिन्न फोकल विमानों में काटने के लिए, और फिर गहराई-निर्भर कERNEL को सिंथेटिक ब्लर करने के लिए ऑर्केस्ट्रेट करने के लिए।

इसके अलावा, और संभावित एआर/वीआर वातावरण के लिए अत्यधिक प्रासंगिक, स्टीरियो कैमरा सेटअप के दो दृष्टिकोणों के बीच विपरीतता को गहराई प्रॉक्सी के रूप में उपयोग किया जा सकता है – एक विधि जिसे 2015 में गूगल रिसर्च द्वारा प्रस्तावित किया गया था।

गूगल के नेतृत्व वाले पेपर फास्ट बिलेटेरल-स्पेस स्टीरियो फॉर सिंथेटिक डीफोकस से, दो दृष्टिकोणों के बीच अंतर एक गहराई मानचित्र प्रदान करता है जो ब्लर को सुविधाजनक बना सकता है। हालांकि, यह दृष्टिकोण ऊपर वर्णित स्थिति में अस्वाभाविक है, जहां फोटो स्पष्ट रूप से 35-50 मिमी (एसएलआर मानक) लेंस के साथ लिया गया है, लेकिन पृष्ठभूमि का अत्यधिक डीफोकसिंग केवल एक लेंस के साथ ही हो सकता है जो 200 मिमी से अधिक है, जो सामान्य मानव-आकार के वातावरण में संकीर्ण गहराई का क्षेत्र उत्पन्न करने वाले एक अत्यधिक प्रतिबंधित फोकल विमान का उत्पादन करता है। स्रोत

गूगल के नेतृत्व वाले पेपर फास्ट बिलेटेरल-स्पेस स्टीरियो फॉर सिंथेटिक डीफोकस से, दो दृष्टिकोणों के बीच अंतर एक गहराई मानचित्र प्रदान करता है जो ब्लर को सुविधाजनक बना सकता है। हालांकि, यह दृष्टिकोण ऊपर वर्णित स्थिति में अस्वाभाविक है, जहां फोटो स्पष्ट रूप से 35-50 मिमी (एसएलआर मानक) लेंस के साथ लिया गया है, लेकिन पृष्ठभूमि का अत्यधिक डीफोकसिंग केवल एक लेंस के साथ ही हो सकता है जो 200 मिमी से अधिक है, जो सामान्य मानव-आकार के वातावरण में संकीर्ण गहराई का क्षेत्र उत्पन्न करने वाले एक अत्यधिक प्रतिबंधित फोकल विमान का उत्पादन करता है। स्रोत

इस तरह के दृष्टिकोण में अक्सर एज आर्टिफैक्ट्स का प्रदर्शन होता है, क्योंकि वे दो अलग-अलग और एज-सीमित गोले को एक निरंतर फोकल ग्रेडिएंट के रूप में प्रस्तुत करने का प्रयास करते हैं।

2021 में, RawNeRF पहल ने हाई डायनामिक रेंज (HDR) कार्यक्षमता की पेशकश की, जिसमें कम रोशनी वाली स्थितियों पर अधिक नियंत्रण और फोकस रैकिंग की क्षमता थी:

RawNeRF फोकस रैकिंग सुंदरता से (यदि इस मामले में, अवास्तविक फोकल विमानों के कारण), लेकिन एक उच्च गणना लागत पर आता है। स्रोत: https://bmild.github.io/rawnerf/

RawNeRF फोकस रैकिंग सुंदरता से (यदि इस मामले में, अवास्तविक फोकल विमानों के कारण), लेकिन एक उच्च गणना लागत पर आता है। स्रोत: https://bmild.github.io/rawnerf/

हालांकि, RawNeRF को अपने प्रशिक्षित NeRF के लिए मल्टीप्लेन प्रतिनिधित्व के लिए भारी प्रीकंप्यूटेशन की आवश्यकता होती है, जिससे एक कार्य प्रवाह बनता है जिसे NeRF के हल्के या कम विलंबता वाले कार्यान्वयन में आसानी से अनुकूलित नहीं किया जा सकता है।

एक वर्चुअल लेंस को मॉडलिंग करना

न्यूरल रेडिएंस फील्ड्स स्वयं पिनहोल इमेजिंग मॉडल पर आधारित है, जो दृश्य को एक मANNER में तेजी से प्रस्तुत करता है जो एक डिफ़ॉल्ट सीजीआई दृश्य (गहराई के क्षेत्र के आधार पर ब्लर को प्रस्तुत करने वाले विभिन्न दृष्टिकोणों से पहले) के समान है।

NeRFocus एक आभासी ‘पतली लेंस’ (एक ‘ग्लासलेस’ एपर्चर के बजाय) बनाता है जो प्रत्येक आगमन पिक्सेल के बीम पथ की गणना करता है और इसे सीधे रेंडर करता है, प्रभावी रूप से मानक छवि कैप्चर प्रक्रिया को उलट देता है, जो प्रकाश के साथ पहले से ही लेंस डिज़ाइन के प्रवर्तनक गुणों से प्रभावित होने के बाद काम करता है।

इस मॉडल में फ्रुस्टम (ऊपर दी गई छवि में सबसे बड़ा प्रभाव का वृत्त) के भीतर सामग्री रेंडरिंग के लिए कई संभावनाएं पेश की जाती हैं।

इस विस्तृत श्रृंखला में संभावनाओं के लिए प्रत्येक बहुस्तरीय परसेप्ट्रॉन (एमएलपी) के लिए सही रंग और घनत्व की गणना करना एक अतिरिक्त कार्य है। यह पहले हल किया गया था उच्च संख्या में डीएसएलआर छवियों पर पर्यवेक्षित प्रशिक्षण लागू करके, जिसमें अतिरिक्त डेटासेट का निर्माण और एक संभावित प्रशिक्षण कार्य प्रवाह के लिए भंडारण शामिल था।

NeRFocus इसे पी-प्रशिक्षण द्वारा पार करता है, जहां प्रशिक्षण डेटासेट बुनियादी ब्लर ऑपरेशन पर आधारित होते हैं। इस प्रकार, मॉडल में ब्लर ऑपरेशन स्वाभाविक रूप से और नेविगेट करने योग्य होते हैं।

प्रशिक्षण के दौरान एपर्चर व्यास शून्य पर सेट किया जाता है, और पूर्वनिर्धारित संभावनाओं का उपयोग यादृच्छिक रूप से एक ब्लर कर्नल चुनने के लिए किया जाता है। इस प्राप्त व्यास का उपयोग प्रत्येक संयुक्त शंकु के व्यास को बढ़ाने के लिए किया जाता है, जिससे एमएलपी फ्रुस्टम (ऊपर दी गई छवियों में व्यापक सर्कल, प्रत्येक पिक्सेल के लिए परिवर्तन का अधिकतम क्षेत्र का प्रतिनिधित्व करते हैं) की किरण और घनत्व को सटीक रूप से भविष्यवाणी कर सकता है।

प्रशिक्षण के दौरान एपर्चर व्यास शून्य पर सेट किया जाता है, और पूर्वनिर्धारित संभावनाओं का उपयोग यादृच्छिक रूप से एक ब्लर कर्नल चुनने के लिए किया जाता है। इस प्राप्त व्यास का उपयोग प्रत्येक संयुक्त शंकु के व्यास को बढ़ाने के लिए किया जाता है, जिससे एमएलपी फ्रुस्टम (ऊपर दी गई छवियों में व्यापक सर्कल, प्रत्येक पिक्सेल के लिए परिवर्तन का अधिकतम क्षेत्र का प्रतिनिधित्व करते हैं) की किरण और घनत्व को सटीक रूप से भविष्यवाणी कर सकता है।

पेपर के लेखकों का अवलोकन है कि NeRFocus संभावित रूप से RawNeRF के एचडीआर-चालित दृष्टिकोण के साथ संगत है, जो कुछ चुनौतीपूर्ण खंडों को रेंडर करने में मदद कर सकता है, जैसे कि डीफोकस्ड स्पेक्युलर हाइलाइट्स, और कई अन्य गणनात्मक रूप से तीव्र प्रभाव जो तीस या अधिक वर्षों से सीजीआई कार्य प्रवाह को चुनौती दे रहे हैं।

प्रक्रिया में पूर्ववर्ती दृष्टिकोणों जैसे कोर NeRF और Mip-NeRF (और, संभावित रूप से, Mip-NeRF 360, हालांकि यह पेपर में संबोधित नहीं किया गया है) की तुलना में समय और/या पैरामीटर के लिए कोई अतिरिक्त आवश्यकता नहीं है, और यह न्यूरल रेडिएंस फील्ड्स के केंद्रीय तरीके के एक सामान्य विस्तार के रूप में लागू किया जा सकता है।

 

पहली बार 12 मार्च 2022 को प्रकाशित किया गया था।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai