Anderson का एंगल
एसटी-नेर्फ: वीडियो सिंथेसिस के लिए संपादन और संयोजन

एक चीनी अनुसंधान संघ ने विकसित तकनीकों को विकसित किया है जो संपादन और संयोजन क्षमताओं को लाते हैं एक गर्म छवि सिंथेसिस अनुसंधान क्षेत्र में – न्यूरल रेडिएंस फील्ड्स (नेर्फ)। प्रणाली को एसटी-नेर्फ (स्पेसियो-टेम्पोरल सुसंगत न्यूरल रेडिएंस फील्ड) कहा जाता है।
नीचे दी गई छवि में जो एक भौतिक कैमरा पैन की तरह दिखाई देता है, वास्तव में यह केवल एक उपयोगकर्ता है जो 4डी स्पेस में वीडियो सामग्री पर दृष्टिकोण के माध्यम से स्क्रॉल कर रहा है। पीओवी प्रदर्शित लोगों के प्रदर्शन से बंद नहीं है, जिनकी गतिविधियों को 180-डिग्री त्रिज्या के किसी भी हिस्से से देखा जा सकता है।

वीडियो के भीतर प्रत्येक पहलू एक विवेकपूर्ण रूप से कब्जा किया गया तत्व है, जो एक सुसंगत दृश्य में संयुक्त होता है जिसे गतिविधि से अन्वेषण किया जा सकता है।
पहलू को दृश्य में स्वतंत्र रूप से दोहराया जा सकता है, या पुनः आकार दिया जा सकता है:

इसके अलावा, प्रत्येक पहलू का समयवार व्यवहार आसानी से बदला जा सकता है, धीमा किया जा सकता है, पीछे की ओर चलाया जा सकता है, या विभिन्न तरीकों से हेरफेर किया जा सकता है, जो फिल्टर वास्तुकला और एक अत्यधिक उच्च स्तर की व्याख्या की ओर खुलता है।

दो अलग नेर्फ पहलू एक ही दृश्य में विभिन्न गति पर चलते हैं। स्रोत: https://www.youtube.com/watch?v=Wp4HfOwFGP4

प्रदर्शनकर्ताओं या पर्यावरण को रोटोस्कोप करने की आवश्यकता नहीं है, या प्रदर्शनकर्ताओं को अपनी गतिविधियों को अंधेरे में और इरादित दृश्य के संदर्भ से बाहर करने की आवश्यकता नहीं है। इसके बजाय, फुटेज को प्राकृतिक रूप से 16 वीडियो कैमरों के माध्यम से कब्जा किया जाता है जो 180 डिग्री को कवर करते हैं:


ऊपर दिखाए गए तीन तत्व, दो लोग और पर्यावरण, अलग-अलग हैं और केवल स्पष्टीकरण के लिए रेखांकित किए गए हैं। प्रत्येक को प्रतिस्थापित किया जा सकता है, और प्रत्येक को उनके व्यक्तिगत कब्जा समयरेखा में एक पहले या बाद के बिंदु पर दृश्य में डाला जा सकता है।
एसटी-नेर्फ न्यूरल रेडिएंस फील्ड्स (नेर्फ) में अनुसंधान पर एक नवाचार है, एक मशीन लर्निंग फ्रेमवर्क जिसमें कई दृष्टिकोण कब्जा को एक नेविगेबल वर्चुअल स्पेस में संश्लेषित किया जाता है व्यापक प्रशिक्षण द्वारा (हालांकि एकल दृष्टिकोण कब्जा नेर्फ अनुसंधान का एक उप-क्षेत्र भी है)।

न्यूरल रेडिएंस फील्ड्स कई कब्जा दृष्टिकोण को एक सुसंगत और नेविगेबल 3डी स्पेस में संयुक्त करते हैं, जिसमें कवरेज के बीच के अंतर को एक न्यूरल नेटवर्क द्वारा अनुमानित और प्रस्तुत किया जाता है। जहां वीडियो (चित्रों के बजाय) का उपयोग किया जाता है, आवश्यक रेंडरिंग संसाधन अक्सर काफी महत्वपूर्ण होते हैं।स्रोत: https://www.matthewtancik.com/nerf
नेर्फ में रुचि पिछले नौ महीनों में तीव्र हो गई है, और एक रेडिट-रखरखाव सूची नेर्फ के व्युत्पन्न या अन्वेषणात्मक नेर्फ पेपर वर्तमान में साठ परियोजनाओं को सूचीबद्ध करती है।

मूल नेर्फ पेपर के कई ऑफशूट्स में से कुछ। स्रोत: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/
सस्ती प्रशिक्षण
यह पेपर शंघाई टेक यूनिवर्सिटी और डीजीने डिजिटल टेक्नोलॉजी के शोधकर्ताओं के बीच एक सहयोग है, और इसे ओपन रिव्यू में कुछ उत्साह के साथ स्वीकार किया गया है।
एसटी-नेर्फ पिछले पहलों पर कई नवाचार प्रदान करता है एमएल-व्युत्पन्न नेविगेबल वीडियो स्पेस में। कम से कम, यह केवल 16 कैमरों के साथ एक उच्च स्तर की वास्तविकता प्राप्त करता है। हालांकि फेसबुक का डाइनर्फ इसके अलावा केवल दो कैमरे अधिक उपयोग करता है, यह एक बहुत अधिक प्रतिबंधित नेविगेबल आर्क प्रदान करता है।

फेसबुक के डाइनर्फ पर्यावरण का एक उदाहरण, जिसमें आंदोलन का एक अधिक सीमित क्षेत्र है, और प्रति वर्ग फुट के लिए अधिक कैमरे आवश्यक हैं दृश्य को पुनर्निर्माण करने के लिए। स्रोत: https://neural-3d-video.github.io
इसके अलावा, डाइनर्फ में व्यक्तिगत पहलुओं को संपादित और संयुक्त करने की क्षमता की कमी है, यह गणनात्मक संसाधनों के संदर्भ में विशेष रूप से महंगा है। इसके विपरीत, चीनी शोधकर्ता कहते हैं कि उनके डेटा के लिए प्रशिक्षण लागत लगभग $900-$3,000 के बीच है, राज्य-ऑफ-द-आर्ट वीडियो पीढ़ी मॉडल डीवीडीजीएन के लिए $30,000 की तुलना में, और गहन प्रणाली जैसे डाइनर्फ।
समीक्षकों ने यह भी ध्यान दिया है कि एसटी-नेर्फ गति सीखने की प्रक्रिया को छवि संश्लेषण की प्रक्रिया से अलग करने में एक बड़ा नवाचार करता है। यह पृथक्करण ही संपादन और संयोजन को सक्षम बनाता है, पिछले दृष्टिकोणों की तुलना में प्रतिबंधित और रैखिक है।
हालांकि 16 कैमरे एक पूरे अर्ध-वृत्त के दृश्य के लिए एक बहुत ही सीमित सरणी है, शोधकर्ता उम्मीद करते हैं कि वे बाद के काम में प्रॉक्सी पूर्व-स्कैन किए गए स्थिर पृष्ठभूमि के माध्यम से और अधिक डेटा-चालित दृश्य मॉडलिंग दृष्टिकोण के माध्यम से इस संख्या को और कम कर सकते हैं। वे री-लाइटिंग क्षमताओं को भी शामिल करने की उम्मीद करते हैं, नेर्फ अनुसंधान में एक हाल का नवाचार।
एसटी-नेर्फ की सीमाओं को संबोधित करना
शैक्षणिक सीएस पेपर्स के संदर्भ में, जो अक्सर एक नए सिस्टम की वास्तविक उपयोगिता को एक फेंक-आउट अंतिम अनुच्छेद में ट्रैश करते हैं, एसटी-नेर्फ के लिए शोधकर्ताओं द्वारा स्वीकार की गई सीमाएं असामान्य हैं।
वे यह देखते हैं कि प्रणाली वर्तमान में दृश्य में विशिष्ट वस्तुओं को अलग से पहचान और प्रस्तुत नहीं कर सकती है, क्योंकि फुटेज में लोग एक मानव को पहचानने वाली प्रणाली द्वारा व्यक्तिगत इकाइयों में खंडित होते हैं और नहीं वस्तुओं – एक समस्या जो योलो और समान फ्रेमवर्क के साथ आसानी से हल हो सकती है, मानव वीडियो को निकालने का कठिन काम पहले ही पूरा हो चुका है।
हालांकि शोधकर्ता यह ध्यान देते हैं कि धीमी गति का उत्पादन वर्तमान में संभव नहीं है, ऐसा लगता है कि मौजूदा नवाचारों का उपयोग करके इसका कार्यान्वयन करने में कुछ भी नहीं है डीएआईएन और आरआईएफई जैसे फ्रेम इंटरपोलेशन में।
नेर्फ के सभी कार्यान्वयन के साथ, और कंप्यूटर दृष्टि अनुसंधान के कई अन्य क्षेत्रों में, एसटी-नेर्फ गंभीर ऑक्लूजन के मामलों में विफल हो सकता है, जहां विषय को अस्थायी रूप से किसी अन्य व्यक्ति या वस्तु द्वारा अवरुद्ध किया जाता है, और बाद में इसे लगातार ट्रैक करना या सटीक रूप से पुनः प्राप्त करना मुश्किल हो सकता है। जैसा कि अन्य जगहों पर, यह कठिनाई को अपस्ट्रीम समाधानों की प्रतीक्षा करनी पड़ सकती है। इस बीच, शोधकर्ता स्वीकार करते हैं कि ऑक्लूडेड फ्रेम में मैनुअल हस्तक्षेप आवश्यक है।
अंत में, शोधकर्ता यह देखते हैं कि मानव खंडन प्रक्रियाएं वर्तमान में रंग अंतरों पर निर्भर करती हैं, जो दो लोगों को एक ही खंडन ब्लॉक में अनजाने में एकत्रित करने का कारण बन सकती है – एक अवरोध जो केवल एसटी-नेर्फ तक सीमित नहीं है, लेकिन पुस्तकालय के लिए अंतर्निहित है जिसका उपयोग किया जा रहा है, और जिसे ऑप्टिकल फ्लो विश्लेषण और अन्य उभरते तकनीकों द्वारा हल किया जा सकता है।
पहली बार 7 मई 2021 को प्रकाशित।












