Anderson का एंगल

ड्राइविंग सिमुलेशन में फोटोरियलिज्म को बेहतर बनाने के लिए जनरेटिव एडवर्सेरियल नेटवर्क्स का उपयोग

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

एक नए शोध पहल के बीच अमेरिका और चीन ने ड्राइविंग सिमुलेटर की वास्तविकता को बढ़ाने के लिए जनरेटिव एडवर्सेरियल नेटवर्क्स (GANs) का उपयोग करने का प्रस्ताव किया है।

फोटोरियलिस्टिक पीओवी ड्राइविंग दृश्यों को उत्पन्न करने की चुनौती पर एक नए दृष्टिकोण में, शोधकर्ताओं ने एक हाइब्रिड विधि विकसित की है जो विभिन्न दृष्टिकोणों की ताकत का फायदा उठाती है, जो साइकलजीएन-आधारित प्रणालियों के अधिक फोटोरियलिस्टिक आउटपुट को अधिक परंपरागत रूप से उत्पन्न तत्वों के साथ मिलाती है, जिन्हें विवरण और स्थिरता का उच्च स्तर आवश्यक है, जैसे कि सड़क के निशान और चालक के दृष्टिकोण से देखे जाने वाले वाहन।

हाइब्रिड जनरेटिव न्यूरल ग्राफिक्स (HGNG) ड्राइविंग सिमुलेशन के लिए एक नई दिशा प्रदान करते हैं जो 3D मॉडल की सटीकता को आवश्यक तत्वों के लिए बनाए रखते हुए, जैसे कि सड़क के निशान और वाहन, जबकि जीएनए की ताकत का फायदा उठाते हुए पृष्ठभूमि और पर्यावरणीय विवरण को उत्पन्न करने में मदद करते हैं। स्रोत

हाइब्रिड जनरेटिव न्यूरल ग्राफिक्स (HGNG) ड्राइविंग सिमुलेशन के लिए एक नई दिशा प्रदान करते हैं जो 3D मॉडल की सटीकता को आवश्यक तत्वों के लिए बनाए रखते हुए, जैसे कि सड़क के निशान और वाहन, जबकि जीएनए की ताकत का फायदा उठाते हुए पृष्ठभूमि और पर्यावरणीय विवरण को उत्पन्न करने में मदद करते हैं। स्रोत स्रोत

इस प्रणाली, जिसे हाइब्रिड जनरेटिव न्यूरल ग्राफिक्स (HGNG) कहा जाता है, एक पारंपरिक, सीजीआई-आधारित ड्राइविंग सिमुलेटर के आउटपुट को एक जीएनए पाइपलाइन में इंजेक्ट करता है, जहां एनवीडिया SPADE फ्रेमवर्क पर्यावरण उत्पादन का काम संभालता है।

लेखकों के अनुसार, इसका लाभ यह है कि ड्राइविंग पर्यावरण अधिक विविध हो सकते हैं, जिससे एक अधिक इमर्सिव अनुभव बनता है। जैसा कि यह खड़ा है, यहां तक कि रूपांतरण सीजीआई आउटपुट को फोटोरियल न्यूरल रेंडरिंग आउटपुट में नहीं कर सकता है, क्योंकि न्यूरल पाइपलाइन में प्रवेश करने वाला मूल फुटेज मॉडल पर्यावरण की सीमाओं और उनकी प्रवृत्ति के कारण दोहराव की समस्या को हल नहीं कर सकता है।

स्रोत: https://www.youtube.com/watch?v=0fhUJT21-bs

2021 के पेपर ‘फोटोरियलिज्म एन्हांसमेंट’ से परिवर्तित फुटेज, जो सीजीआई-रेंडर्ड फुटेज, पृष्ठभूमि और सामान्य पर्यावरणीय विवरण पर निर्भर रहता है, जो सिम्युलेटेड अनुभव में पर्यावरण की विविधता को सीमित करता है। स्रोत: https://www.youtube.com/watch?v=P1IcaBn3ej0

लेख में कहा गया है*:

‘एक पारंपरिक ड्राइविंग सिमुलेटर की विश्वसनीयता इसके कंप्यूटर ग्राफिक्स पाइपलाइन की गुणवत्ता पर निर्भर करती है, जिसमें 3D मॉडल, टेक्सचर और एक रेंडरिंग इंजन शामिल हैं। उच्च गुणवत्ता वाले 3D मॉडल और टेक्सचर के लिए कौशल की आवश्यकता होती है, जबकि रेंडरिंग इंजन को प्रकाश और छाया के वास्तविक प्रतिनिधित्व के लिए जटिल भौतिकी गणना चलानी होती हैं।’

नया लेख शीर्षक ड्राइविंग सिमुलेशन में फोटोरियलिज्म: जनरेटिव एडवर्सेरियल इमेज सिंथेसिस को रेंडरिंग के साथ मिलाना है, और यह ओहियो स्टेट यूनिवर्सिटी के इलेक्ट्रिकल और कंप्यूटर इंजीनियरिंग विभाग और चोंगकिंग चांगन ऑटोमोबाइल कंपनी लिमिटेड, चोंगकिंग, चीन से शोधकर्ताओं द्वारा आया है।

पृष्ठभूमि सामग्री

HGNG एक सीजीआई-उत्पन्न दृश्य के सेमांटिक लेआउट को बदल देता है जो आंशिक रूप से रेंडर्ड फोरग्राउंड सामग्री को जीएनए-उत्पन्न पर्यावरण के साथ मिलाता है। हालांकि शोधकर्ताओं ने विभिन्न डेटासेट पर मॉडल को प्रशिक्षित करने के लिए प्रयोग किया, सबसे प्रभावी साबित हुआ किट्टी विजन बेंचमार्क सूट, जो मुख्य रूप से जर्मन शहर कर्लस्रुहे से ड्राइवर-दृष्टिकोण सामग्री को प्रदर्शित करता है।

HGNG सीजीआई-रेंडर्ड आउटपुट से एक सेमांटिक सेगमेंटेशन लेआउट उत्पन्न करता है, और फिर विभिन्न शैली एन्कोडिंग के साथ SPADE को अंतरिक्ष में रखने के लिए रैंडम और विविध फोटोरियलिस्टिक पृष्ठभूमि छवियों का निर्माण करता है, जिसमें शहरी दृश्यों में निकटवर्ती वस्तुएं शामिल हैं। नए लेख में कहा गया है कि दोहराव वाले पैटर्न, जो संसाधन-सीमित सीजीआई पाइपलाइनों में सामान्य हैं, 'मानव चालकों के लिए इमर्सन तोड़ते हैं' जो एक सिमुलेटर का उपयोग करते हैं, और जीएनए द्वारा प्रदान की जाने वाली अधिक विविध पृष्ठभूमि इस समस्या को दूर कर सकती है।

HGNG सीजीआई-रेंडर्ड आउटपुट से एक सेमांटिक सेगमेंटेशन लेआउट उत्पन्न करता है, और फिर विभिन्न शैली एन्कोडिंग के साथ SPADE को अंतरिक्ष में रखने के लिए रैंडम और विविध फोटोरियलिस्टिक पृष्ठभूमि छवियों का निर्माण करता है, जिसमें शहरी दृश्यों में निकटवर्ती वस्तुएं शामिल हैं। नए लेख में कहा गया है कि दोहराव वाले पैटर्न, जो संसाधन-सीमित सीजीआई पाइपलाइनों में सामान्य हैं, ‘मानव चालकों के लिए इमर्सन तोड़ते हैं’ जो एक सिमुलेटर का उपयोग करते हैं, और जीएनए द्वारा प्रदान की जाने वाली अधिक विविध पृष्ठभूमि इस समस्या को दूर कर सकती है।

शोधकर्ताओं ने दोनों कंडीशनल जीएनए (सीजीएन) (सीजीएन) और साइकलजीएन (साइजीएन) (साइजीएन) को जनरेटिव नेटवर्क के रूप में प्रयोग किया, और पाया कि प्रत्येक की अपनी ताकत और कमजोरियां हैं: सीजीएन को जोड़े गए डेटासेट की आवश्यकता होती है, और साइजीएन को नहीं। हालांकि, साइजीएन अभी तक पारंपरिक सिमुलेटरों में राज्य के कला को पार नहीं कर सकता है, जो कि आगे के सुधार पर निर्भर करता है डोमेन अनुकूलन और चक्र स्थिरता में। इसलिए, सीजीएन, जोड़े गए डेटा आवश्यकताओं के साथ, वर्तमान में सबसे अच्छे परिणाम प्राप्त करता है।

HGNG की概念ात्मक वास्तुकला.

HGNG की概念ात्मक वास्तुकला.

HGNG न्यूरल ग्राफिक्स पाइपलाइन में, 2D प्रतिनिधित्व सीजीआई-सिंथेटिक दृश्यों से बनाए जाते हैं। जीएनए प्रवाह में प्रवेश करने वाले सीजीआई रेंडरिंग से वस्तुएं ‘आवश्यक’ तत्वों तक सीमित होती हैं, जिनमें सड़क के निशान और वाहन शामिल हैं, जिन्हें जीएनए स्वयं वर्तमान में पर्याप्त समय स्थिरता और अखंडता के साथ एक ड्राइविंग सिमुलेटर में प्रस्तुत नहीं कर सकता है। सीजीएन-सिंथेटिक छवि को फिर आंशिक भौतिकी-आधारित रेंडर के साथ मिलाया जाता है।

परीक्षण

प्रणाली का परीक्षण करने के लिए, शोधकर्ताओं ने सिटीस्केप्स पर प्रशिक्षित एसपीएडीई का उपयोग किया, जो दृश्य के सेमांटिक लेआउट को फोटोरियलिस्टिक आउटपुट में परिवर्तित करने के लिए किया गया था। सीजीआई स्रोत खुले स्रोत ड्राइविंग सिमुलेटर कार्ला से आया था, जो यूनरियल इंजन 4 (यूई4) का लाभ उठाता है।

कार्ला खुले स्रोत ड्राइविंग सिमुलेटर का आउटपुट. स्रोत: https://arxiv.org/pdf/1711.03938.pdf

कार्ला खुले स्रोत ड्राइविंग सिमुलेटर का आउटपुट. स्रोत: https://arxiv.org/pdf/1711.03938.pdf

यूई4 का शेडिंग और लाइटिंग इंजन सेमांटिक लेआउट और आंशिक रूप से रेंडर्ड छवियों को प्रदान किया, जिसमें केवल वाहन और लेन मार्किंग आउटपुट थे। मिश्रण एक जीपी-जीएन उदाहरण के साथ प्राप्त किया गया था, जो ट्रांज़िट एट्रिब्यूट्स डेटाबेस पर प्रशिक्षित किया गया था, और सभी प्रयोगों को एनवीडिया आरटीएक्स 2080 पर चलाया गया था, जिसमें 8 जीबी जीडीडीआर6 वीआरएएम था।

शोधकर्ताओं ने सेमांटिक रिटेंशन के लिए परीक्षण किया – आउटपुट छवि की क्षमता जो प्रारंभिक सेमांटिक सेगमेंटेशन मास्क के साथ मेल खाती है जो दृश्य के लिए एक टेम्पलेट के रूप में अभिप्रेत थी।

उपरोक्त परीक्षण छवियों में, हम देखते हैं कि ‘केवल रेंडर’ छवि (नीचे बाएं) में पूर्ण रेंडर वास्तविक छाया प्राप्त नहीं करता है। शोधकर्ताओं ने नोट किया कि यहां (पीला सर्कल) पेड़ों की छाया जो साइडवॉक पर पड़ती है, को डीपलैबवी3 (सेमांटिक सेगमेंटेशन फ्रेमवर्क जिसका उपयोग इन प्रयोगों के लिए किया गया था) द्वारा ‘सड़क’ सामग्री के रूप में गलत तरीके से वर्गीकृत किया गया था।

मध्य स्तंभ-प्रवाह में, हम देखते हैं कि सीजीएन-निर्मित वाहनों में पर्याप्त स्थिर परिभाषा नहीं है जो एक ड्राइविंग सिमुलेटर में उपयोगी हो सकती है (लाल सर्कल)। दाईं-सबसे अधिक स्तंभ-प्रवाह में, मिश्रित छवि मूल सेमांटिक परिभाषा के अनुरूप है, जबकि आवश्यक सीजीआई-आधारित तत्वों को बनाए रखती है।

वास्तविकता का मूल्यांकन करने के लिए, शोधकर्ताओं ने फ्रेचेट इन्सेप्शन दूरी (एफआईडी) का उपयोग एक प्रदर्शन मीट्रिक के रूप में किया, क्योंकि यह जोड़े गए डेटा या अनजोड़े डेटा पर काम कर सकता है।

तीन डेटासेट का उपयोग मूल सत्य के रूप में किया गया था: सिटीस्केप्स, किट्टी और एडी20के.

आउटपुट छवियों की तुलना एक दूसरे के साथ एफआईडी स्कोर का उपयोग करके की गई थी, और भौतिकी-आधारित (अर्थात, सीजीआई) पाइपलाइन के साथ, जबकि सेमांटिक रिटेंशन का भी मूल्यांकन किया गया था।

उपरोक्त परिणाम, जो सेमांटिक रिटेंशन से संबंधित हैं, उच्च स्कोर बेहतर हैं, जिसमें सीजीएन पिरामिड-आधारित दृष्टिकोण (शोधकर्ताओं द्वारा परीक्षण किए गए कई पाइपलाइनों में से एक) ने उच्चतम स्कोर प्राप्त किया है।

सीधे ऊपर दिखाए गए परिणाम एफआईडी स्कोर से संबंधित हैं, जिसमें एचजीएनजी ने किट्टी डेटासेट का उपयोग करके उच्चतम स्कोर प्राप्त किया है।

‘केवल रेंडर’ विधि (जिसे [23] के रूप में चिह्नित किया गया है) कार्ला से आउटपुट से संबंधित है, जो एक सीजीआई प्रवाह है जो फोटोरियलिस्टिक होने की उम्मीद नहीं है।

पारंपरिक रेंडरिंग इंजन (‘सी’ छवि में) पर गुणात्मक परिणाम असली दूरस्थ पृष्ठभूमि जानकारी को प्रदर्शित करते हैं, जैसे कि पेड़ और वनस्पति, जिसमें विस्तृत मॉडल और जस्ट-इन-टाइम मेश लोडिंग की आवश्यकता होती है, साथ ही अन्य प्रोसेसर-गहन प्रक्रियाएं भी होती हैं। मध्य में (बी), हम देखते हैं कि सीजीएन पर्याप्त परिभाषा प्राप्त नहीं कर पाता है जो आवश्यक तत्वों के लिए उपयोगी हो सकता है, जैसे कि कार और सड़क के निशान। प्रस्तावित मिश्रित आउटपुट (ए) में, वाहन और सड़क की परिभाषा अच्छी है, जबकि पर्यावरण विविध और फोटोरियलिस्टिक है।

लेख का निष्कर्ष यह है कि जीएनए-उत्पन्न रेंडरिंग पाइपलाइन की समय स्थिरता को बड़े शहरी डेटासेट का उपयोग करके बढ़ाया जा सकता है, और इस दिशा में भविष्य का काम सीजीआई-आधारित स्ट्रीम के महंगे न्यूरल रूपांतरण के विकल्प के रूप में काम कर सकता है, जबकि अधिक वास्तविकता और विविधता प्रदान करता है।

* मेरा लेखकों के इनलाइन संदर्भों को हाइपरलिंक में परिवर्तन।

पहली बार 23 जुलाई 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai