Anderson का एंगल
न्यूरल रेंडरिंग: इनपुट के मामले में आप कितना कम जा सकते हैं?

कल कुछ असाधारण नए काम न्यूरल इमेज सिंथेसिस में इंटरनेट और कल्पना का ध्यान आकर्षित किया, क्योंकि इंटेल शोधकर्ताओं ने सिंथेटिक छवियों की वास्तविकता को बढ़ाने के लिए एक नई विधि का खुलासा किया।
सिस्टम, जैसा कि इंटेल द्वारा एक वीडियो में प्रदर्शित किया गया है, ग्रैंड थेफ्ट ऑटो वी वीडियो गेम के लिए छवि पाइपलाइन में सीधे हस्तक्षेप करता है, और एक कनवोल्यूशनल न्यूरल नेटवर्क (सीएनएन) पर प्रशिक्षित एक छवि सिंथेसिस एल्गोरिदम के माध्यम से स्वचालित रूप से छवियों को बढ़ाता है, जो मैपिलरी डेटासेट से वास्तविक दुनिया की छवियों का उपयोग करता है, और जीटीए गेम इंजन की कम वास्तविक रोशनी और टेक्सचर को स्वैप आउट करता है।

टिप्पणीकार, रेडिट और हैकर न्यूज जैसे समुदायों में व्यापक प्रतिक्रियाओं में, न केवल यह सुझाव दे रहे हैं कि इस प्रकार की न्यूरल रेंडरिंग पारंपरिक गेम इंजन और वीएफएक्स-स्तर के सीजीआई के कम फोटोरियलिस्टिक आउटपुट को प्रभावी ढंग से बदल सकती है, बल्कि यह प्रक्रिया जीटीए5 डेमो में प्रदर्शित की गई तुलना में बहुत अधिक बुनियादी इनपुट के साथ प्राप्त की जा सकती है – वास्तव में ‘पपेट’ प्रॉक्सी इनपुट के साथ ‘पपेट’ प्रॉक्सी इनपुट बनाकर बहुत वास्तविक आउटपुट बना सकती है।
जोड़े गए डेटासेट
यह सिद्धांत पिछले तीन वर्षों में जीएन और एनकोडर/डिकोडर सिस्टम की एक नई पीढ़ी द्वारा प्रदर्शित किया गया है, जैसे कि एनवीडिया का गौगन, जो कच्चे डब्स से फोटोरियलिस्टिक दृश्य छवियों को उत्पन्न करता है।
प्रभावी रूप से, यह सिद्धांत कंप्यूटर विजन में सेमांटिक सेगमेंटेशन के पारंपरिक उपयोग को बदल देता है, जो मशीन प्रणालियों को देखी गई वस्तुओं की पहचान करने और अलग करने की अनुमति देने के लिए एक निष्क्रिय विधि है, एक रचनात्मक इनपुट में जहां उपयोगकर्ता एक नकली सेमांटिक सेगमेंटेशन मैप “पेंट” करता है और प्रणाली एक छवि उत्पन्न करती है जो संबंधों के साथ संगत है जो यह पहले से ही वर्गीकृत और खंडित एक विशिष्ट डोमेन, जैसे दृश्य से समझता है।

एक मशीन लर्निंग फ्रेमवर्क विभिन्न बाहरी दृश्यों में सेमांटिक सेगमेंटेशन लागू करता है, जो एक वास्तुकला परिदृश्य प्रदान करता है जो इंटरैक्टिव सिस्टम के विकास की अनुमति देता है, जहां उपयोगकर्ता एक सेमांटिक सेगमेंटेशन ब्लॉक “पेंट” करता है और प्रणाली एक डोमेन-विशिष्ट डेटासेट से उपयुक्त छवियों के साथ ब्लॉक को भर देती है, जैसे कि जर्मनी का मैपिलरी स्ट्रीट व्यू सेट, जिसका उपयोग इंटेल के जीटीए5 न्यूरल रेंडरिंग डेमो में किया गया था। स्रोत: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf स्रोत: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
जोड़े गए डेटासेट छवि सिंथेसिस सिस्टम दो डेटासेट पर सेमांटिक लेबल को संबंधित करके काम करते हैं: एक समृद्ध और पूर्ण छवि सेट, या तो वास्तविक दुनिया की छवियों (जैसे मैपिलरी सेट का उपयोग जीटीए5 में किया गया था) से उत्पन्न या सिंथेटिक छवियों से (जैसे सीजीआई छवियों)।

एक छवि सिंथेसिस सिस्टम के लिए जोड़े गए डेटासेट के उदाहरण जो मोटे स्केच से न्यूरल-रेंडरेड पात्रों को बनाने के लिए डिज़ाइन किए गए हैं। बाएं, सीजीआई डेटासेट के नमूने। मध्य, ‘स्केच’ डेटासेट से संबंधित नमूने। दाएं, स्केच को उच्च-गुणवत्ता वाली छवियों में अनुवादित न्यूरल रेंडर। स्रोत: https://www.youtube.com/watch?v=miLIwQ7yPkA
बाहरी वातावरण इस प्रकार के जोड़े गए डेटासेट परिवर्तन बनाने में अपेक्षाकृत कम चुनौतीपूर्ण होते हैं, क्योंकि प्रोट्रूशंस आमतौर पर बहुत सीमित होते हैं, टोपोग्राफी में एक सीमित श्रृंखला होती है जिसे एक डेटासेट में पूरी तरह से कब्जा किया जा सकता है, और हमें कृत्रिम लोगों का निर्माण करने या अनकैनी वैली (अभी तक) के साथ सौदा करने की आवश्यकता नहीं होती है।
सेगमेंटेशन मैप्स को उलटना
गूगल ने गौगन स्कीमा का एक एनिमेटेड संस्करण विकसित किया है, जिसे इन्फिनिट नेचर कहा जाता है, जो न्यूरल नेटवर्क के एसपीएडीई इन्फिल सिस्टम के माध्यम से फोटोरियलिस्टिक छवियों में नकली सेमांटिक मैप्स को अनुवादित करके जानबूझकर “हॉलुसिनेट” जारी और अंतहीन काल्पनिक परिदृश्यों को बनाने में सक्षम है:

स्रोत: https://www.youtube.com/watch?v=oXUf6anNAtc
हालांकि, इन्फिनिट नेचर एक छवि को प्रारंभिक बिंदु के रूप में उपयोग करता है और केवल आगामी फ्रेमों में गायब होने वाले खंडों को पेंट करने के लिए एसपीएडीई का उपयोग करता है, जबकि एसपीएडीई स्वयं सेगमेंटेशन मैप्स से सीधे छवि परिवर्तन बनाता है।
यह क्षमता प्रतीत होती है कि इंटेल इमेज एन्हांसमेंट सिस्टम के प्रशंसकों को उत्तेजित करती है – बहुत उच्च गुणवत्ता वाली फोटोरियलिस्टिक छवियों को प्राप्त करने की संभावना, यहां तक कि वास्तविक समय में (अंततः), बहुत ही कच्चे इनपुट से।
न्यूरल रेंडरिंग के साथ टेक्सचर और लाइटिंग को बदलना
जीटीए5 इनपुट के मामले में, कुछ लोगों ने आश्चर्य व्यक्त किया है कि क्या गेम इंजन आउटपुट के लिए प्रोसेसर-महंगे प्रोसीजरल और बिटमैप टेक्सचर और लाइटिंग वास्तव में भविष्य के न्यूरल रेंडरिंग सिस्टम में आवश्यक होंगे, या क्या यह संभव हो सकता है कि वायरफ्रेम-स्तर के इनपुट को फोटोरियलिस्टिक वीडियो में परिवर्तित किया जाए जो गेम इंजन की शेडिंग, टेक्सचर और लाइटिंग क्षमताओं को पार कर जाए, ‘प्रॉक्सी’ प्रॉक्सी इनपुट से हाइपर-रियलिस्टिक दृश्य बनाते हैं।
यह स्पष्ट लगता है कि गेम-जनित फेसेट्स जैसे प्रतिबिंब, टेक्सचर और अन्य प्रकार के पर्यावरणीय विवरण न्यूरल रेंडरिंग सिस्टम के लिए आवश्यक जानकारी के स्रोत होंगे। हालांकि, यह कुछ वर्षों से है जब न्यूरल नेटवर्क के यूनिट (अनसुपरवाइज्ड इमेज-टू-इमेज ट्रांसलेशन नेटवर्क) ने प्रदर्शित किया है कि केवल डोमेन ही महत्वपूर्ण है, और यहां तक कि ‘रात या दिन’ जैसे व्यापक पहलू भी शैली स्थानांतरण द्वारा संभाले जाने वाले मुद्दे हैं:
इनपुट की आवश्यकता के संदर्भ में, यह संभावित रूप से गेम इंजन को केवल आधार भूगोल और भौतिकी सिमुलेशन उत्पन्न करने की आवश्यकता छोड़ देता है, क्योंकि न्यूरल रेंडरिंग इंजन सेमांटिक मैप्स के माध्यम से एक व्याख्या परत के रूप में कैप्चर किए गए डेटासेट से वांछित छवियों को सिंथेसाइज करके सभी अन्य पहलुओं को ओवर-पेंट कर सकता है।

इंटेल की प्रणाली एक पूरी तरह से खत्म और जीटीए5 से रेंडर की गई फ्रेम को बढ़ाती है, सेगमेंटेशन और मूल्यांकित गहराई मानचित्र जोड़ती है – दो पहलू जो संभावित रूप से एक स्ट्रिप्ड-डाउन गेम इंजन द्वारा सीधे आपूर्ति की जा सकती हैं। स्रोत: https://www.youtube.com/watch?v=P1IcaBn3ej0
इंटेल के न्यूरल रेंडरिंग दृष्टिकोण में पूरी तरह से रेंडर की गई जीटीए5 फ्रेमों का विश्लेषण शामिल है, और न्यूरल सिस्टम को गहराई मानचित्र और सेगमेंटेशन मानचित्र दोनों बनाने का भार है। चूंकि गहराई मानचित्र पारंपरिक 3डी पाइपलाइनों में अनुमानित रूप से उपलब्ध हैं (और टेक्सचरिंग, रे-ट्रेसिंग या ग्लोबल इल्युमिनेशन की तुलना में कम मांग वाले हैं), यह संभवतः संसाधनों का बेहतर उपयोग होगा कि गेम इंजन उन्हें संभाले।
न्यूरल रेंडरिंग इंजन के लिए स्ट्रिप्ड-डाउन इनपुट
इंटेल इमेज एन्हांसमेंट नेटवर्क का वर्तमान कार्यान्वयन, इसलिए, कई अतिरिक्त गणना चक्रों को शामिल कर सकता है, क्योंकि गेम इंजन न्यूरल रेंडरिंग इंजन की आवश्यकता के बिना कम्प्यूटेशनल रूप से महंगे टेक्सचरिंग और लाइटिंग का उत्पादन करता है। प्रणाली को इस तरह से डिज़ाइन किया गया है क्योंकि यह एक न्यूरल रेंडरिंग इंजन को एक मौजूदा पाइपलाइन में अनुकूलित करना आसान है, एक नए गेम इंजन को न्यूरल रेंडरिंग दृष्टिकोण के लिए अनुकूलित करने की तुलना में अधिक आसान है।
इस प्रकार की गेमिंग प्रणाली में संसाधनों का सबसे किफायती उपयोग न्यूरल रेंडरिंग सिस्टम द्वारा जीपीयू का पूर्ण अधिग्रहण हो सकता है, स्ट्रिप्ड-डाउन प्रॉक्सी इनपुट को सीपीयू द्वारा संभाला जा सकता है।
इसके अलावा, गेम इंजन अपने आउटपुट में सभी शेडिंग और लाइटिंग को बंद करके स्वयं प्रतिनिधि सेगमेंटेशन मानचित्र का उत्पादन कर सकता है। इसके अलावा, यह सामान्य रूप से इसकी आवश्यकता से बहुत कम रिज़ॉल्यूशन पर वीडियो का उत्पादन कर सकता है, क्योंकि वीडियो को केवल सामग्री का सामान्य प्रतिनिधित्व करने की आवश्यकता होगी, उच्च-रिज़ॉल्यूशन विवरण को न्यूरल इंजन द्वारा संभाला जा सकता है, स्थानीय कंप्यूटिंग संसाधनों को और अधिक मुक्त कर सकता है।
इंटेल आईएसएल का सेगमेंटेशन>इमेज के साथ पिछला काम
सेगमेंटेशन से फोटोरियलिस्टिक वीडियो का सीधा अनुवाद कल्पना से परे नहीं है। 2017 में, इंटेल आईएसएल, जिसने कल के हलचल का कारण बना, शहरी वीडियो सिंथेसिस के लिए शोध जारी किया जो सेमांटिक सेगमेंटेशन से सीधे किया जा सकता है:

इंटेल आईएसएल का 2017 में सेगमेंटेशन से छवि का काम। स्रोत: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
वास्तव में, उस मूल 2017 पाइपलाइन को केवल जीटीए5 के पूरी तरह से रेंडर किए गए आउटपुट में फिट करने के लिए विस्तारित किया गया है।
वीएफएक्स में न्यूरल रेंडरिंग
कृत्रिम सेगमेंटेशन मानचित्रों से न्यूरल रेंडरिंग वीएफएक्स के लिए भी एक आशाजनक प्रौद्योगिकी प्रतीत होती है, जिसमें बहुत बुनियादी वीडियोग्राम को सीधे समाप्त विज़ुअल इफेक्ट्स फुटेज में अनुवादित करने की संभावना है, डोमेन-विशिष्ट डेटासेट का उपयोग करके जो मॉडल या सिंथेटिक (सीजीआई) छवियों से लिया जा सकता है:


एक कल्पनात्मक न्यूरल रेंडरिंग सिस्टम, जहां प्रत्येक लक्ष्य वस्तु के व्यापक कवरेज को एक योगदान डेटासेट में समाहित किया जाता है, और जहां कृत्रिम रूप से उत्पन्न सेगमेंटेशन मानचित्र का उपयोग पूर्ण-रिज़ॉल्यूशन फोटोरियलिस्टिक आउटपुट के आधार के रूप में किया जाता है। स्रोत: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
इस प्रकार की प्रणालियों का विकास और अपनाना कलात्मक प्रयास के केंद्र को एक व्याख्यात्मक से एक प्रतिनिधित्व कार्य प्रवाह में स्थानांतरित कर देगा, और डोमेन-चालित डेटा संग्रह को दृश्य कला में एक सहायक से एक केंद्रीय भूमिका में बढ़ावा देगा।
लेख 4:55 बजे अपडेट किया गया है ताकि इंटेल आईएसएल 2017 शोध के बारे में सामग्री जोड़ी जा सके।














