Anderson का एंगल

लिडार को फोटो-रियल इमेजरी में परिवर्तित करना एक जेनरेटिव एडवर्सेरियल नेटवर्क के साथ

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

इस सप्ताह की शुरुआत में, एक टेस्ला ऑटोपायलट सिस्टम का फुटेज जारी किया गया था जिसमें एक मोटरवे पर एक खड़े वाहन में सीधे टक्कर मारने का दृश्य दिखाया गया था। यह दुर्घटना जून 2021 में हुई थी। यह तथ्य कि कार काली थी और इसे पहचानना मुश्किल था, ने स्वायत्त ड्राइविंग परिदृश्यों में कंप्यूटर विजन पर निर्भरता की सीमाओं पर चर्चा को प्रेरित किया है।

दिसंबर 2021 में जारी फुटेज में टक्कर का दृश्य दिखाया गया है। स्रोत: https://twitter.com/greentheonly/status/1473307236952940548

दिसंबर 2021 में जारी फुटेज में टक्कर का दृश्य दिखाया गया है। स्रोत: https://twitter.com/greentheonly/status/1473307236952940548

हालांकि वीडियो संपीड़न ने फुटेज को थोड़ा बढ़ा-चढ़ा कर प्रस्तुत किया है, लेकिन एक उच्च गुणवत्ता वाला वीडियो यह दर्शाता है कि एक पूरी तरह से सतर्क ड्राइवर भी इस स्थिति में प्रतिक्रिया करने में संघर्ष करता।

यह फुटेज टेस्ला के ऑटोपायलट सिस्टम से रडार सेंसर हटाने के निर्णय और लिडार जैसी अन्य इको-लोकेशन प्रौद्योगिकियों के बजाय दृष्टि-आधारित प्रणालियों को प्राथमिकता देने के उनके रुख के इर्द-गिर्द के विवाद को बढ़ाता है।

इस बीच, इज़राइल से एक नए शोध पत्र में लिडार और कंप्यूटर विजन डोमेन के बीच एक पुल बनाने के लिए एक दृष्टिकोण प्रस्तुत किया गया है, जिसमें लिडार पॉइंट क्लाउड को फोटो-रियल इमेजरी में परिवर्तित करने के लिए एक जेनरेटिव एडवर्सेरियल नेटवर्क (GAN) का उपयोग किया जाता है।

इज़राइल के नए परियोजना में, लिडार फुटेज में पहचाने गए काले वाहनों को 'दिन के उजाले' दृश्य में परिवर्तित किया जाता है, जो टेस्ला के ऑटोपायलट सिस्टम के विकास के लिए अपनाई जा रही रणनीति के समान है।

इज़राइल के नए परियोजना में, लिडार फुटेज में पहचाने गए काले वाहनों को ‘दिन के उजाले’ दृश्य में परिवर्तित किया जाता है। स्रोत: https://arxiv.org/pdf/2112.11245.pdf

लेखकों का कहना है:

‘हमारे मॉडल ने केवल पॉइंट क्लाउड डेटा से वास्तविक दिखने वाली छवियों की भविष्यवाणी करना सीख लिया है, यहां तक कि काले वाहनों वाली छवियों के साथ भी।’

‘काले वाहनों का पता लगाना सीधे पॉइंट क्लाउड से मुश्किल है क्योंकि उनकी परावर्तितता का स्तर कम होता है। यह दृष्टिकोण भविष्य में लिडार पॉइंट क्लाउड से उत्पन्न फोटो-रियलिस्टिक छवियों पर दृश्य वस्तु पहचान करने के लिए उपयोग किया जा सकता है।’

फोटो-रियल, लिडार-आधारित इमेज स्ट्रीम

नया शोध पत्र लिडार पॉइंट क्लाउड से फोटो-रियलिस्टिक इमेजेज़ उत्पन्न करने के लिए जेनरेटिव एडवर्सेरियल नेटवर्क शीर्षक से है, और यह इज़राइल के तीन अकादमिक संकायों के सात शोधकर्ताओं और इज़राइल स्थित इनोविज़ टेक्नोलॉजीज़ के छह शोधकर्ताओं द्वारा लिखा गया है।

शोधकर्ताओं ने यह जानने का प्रयास किया कि क्या लिडार सिस्टम द्वारा उत्पन्न पॉइंट क्लाउड से पर्याप्त दर पर जीएएन-आधारित सिंथेटिक इमेजरी उत्पन्न की जा सकती है, ताकि परिणामी इमेज स्ट्रीम को वस्तु पहचान और सेमेंटिक सेगमेंटेशन वर्कफ्लो में उपयोग किया जा सके।

डेटा

मुख्य विचार, जैसा कि कई नए [x] > [x] इमेज ट्रांस्लिटरेशन परियोजनाओं में, पेयर्ड डेटा पर एक एल्गोरिदम को प्रशिक्षित करना है, जहां लिडार पॉइंट क्लाउड छवियों (जो डिवाइस-उत्सर्जित प्रकाश पर निर्भर करती हैं) को एक मिलान फ्रेम से एक फ्रंट-फेसिंग कैमरे के खिलाफ प्रशिक्षित किया जाता है।

चूंकि फुटेज दिन के समय में लिया गया था, जहां एक कंप्यूटर विजन सिस्टम एक अन्यथा छुपी हुई सभी काली वाहन (जैसे कि जून में टेस्ला द्वारा टकराई गई वाहन) को अधिक आसानी से पहचान सकता है, यह प्रशिक्षण एक केंद्रीय ग्राउंड ट्रुथ प्रदान करना चाहिए जो अंधेरे परिस्थितियों के प्रति अधिक प्रतिरोधी है।

डेटा इनोविज़वन लिडार सेंसर के साथ एकत्र किया गया था, जो 10fps या 15fps कैप्चर दर प्रदान करता है, मॉडल के आधार पर।

इनोविज़ डिवाइस द्वारा कब्जा किया गया लिडार डेटा।

इनोविज़ डिवाइस द्वारा कब्जा किया गया लिडार डेटा। स्रोत: https://www.youtube.com/watch?v=wmcaf_VpsQI

परिणामी डेटासेट में लगभग 30,000 छवियों और 200,000 एकत्र 3डी बिंदुओं की सुविधा थी। शोधकर्ताओं ने दो परीक्षण किए: एक जिसमें पॉइंट क्लाउड डेटा में केवल परावर्तितता जानकारी थी; और दूसरा, जिसमें पॉइंट क्लाउड डेटा में दो चैनल थे, एक-एक परावर्तितता और दूरी के लिए।

पहले प्रयोग के लिए, जीएएन को 50 एपोक्स तक प्रशिक्षित किया गया था, जिसके बाद ओवरफिटिंग एक समस्या के रूप में दिखाई दी।

पहले प्रयोग से जीएएन-निर्मित छवियां। बाएं, पॉइंट क्लाउड डेटा; मध्य में, कब्जा की गई फुटेज के वास्तविक फ्रेम, जो ग्राउंड ट्रुथ के रूप में उपयोग किए जाते हैं; दाएं, जेनरेटिव एडवर्सेरियल नेटवर्क द्वारा निर्मित सिंथेटिक प्रतिनिधित्व।

पहले प्रयोग से जीएएन-निर्मित छवियां.

लेखकों का कहना है:

‘परीक्षण सेट एक पूरी तरह से नई रिकॉर्डिंग है जिसे जीएएन ने पहले कभी नहीं देखा था। यह केवल पॉइंट क्लाउड से परावर्तितता जानकारी का उपयोग करके अनुमानित किया गया था। ‘

‘हमने काले वाहनों वाले फ्रेम दिखाने का चयन किया क्योंकि काले वाहनों का पता लगाना लिडार से मुश्किल है। हम देख सकते हैं कि जनरेटर ने काले वाहनों को उत्पन्न करना सीखा है, संभवतः संदर्भ जानकारी से, क्योंकि अनुमानित छवियों में रंग और वस्तुओं के आकार वास्तविक छवियों के समान नहीं हैं।’

दूसरे प्रयोग के लिए, लेखकों ने जीएएन को 40 एपोक्स तक प्रशिक्षित किया, जिसमें एक बैच आकार 1 था, जिसके परिणामस्वरूप एक समान प्रस्तुति ‘प्रतिनिधि’ काले वाहन प्राप्त हुए, जो मुख्य रूप से संदर्भ से प्राप्त हुए थे। इस कॉन्फ़िगरेशन का उपयोग एक वीडियो को उत्पन्न करने के लिए भी किया गया था जो जीएएन-उत्पन्न फुटेज (नीचे दिए गए नमूना छवि में ऊपर) को ग्राउंड ट्रुथ फुटेज के साथ दिखाता है।

मूल्यांकन

इस परियोजना की विशिष्ट प्रकृति के कारण, मूल्यांकन और मौजूदा राज्य-ऑफ-द-आर्ट की तुलना करना संभव नहीं था। इसके बजाय, शोधकर्ताओं ने एक कस्टम मेट्रिक विकसित की, जो लिडार/जेनरेट की गई छवियों के 100 जोड़ों का चयन करती है और स्रोत फुटेज में मौजूद कार छवियों की संख्या को जेनरेट की गई छवियों में मौजूद कार छवियों की संख्या से विभाजित करती है, जिससे 0 से 1 का मेट्रिक स्केल प्राप्त होता है।

वे कहते हैं:

‘दोनों प्रयोगों में स्कोर 0.7 और 0.8 के बीच था। यह देखते हुए कि अनुमानित छवियों की सामान्य गुणवत्ता वास्तविक छवियों की तुलना में कम है (यह सामान्य रूप से कम गुणवत्ता वाली छवियों में वस्तुओं का पता लगाना अधिक कठिन है), यह स्कोर यह दर्शाता है कि अनुमानित छवियों में अधिकांश कारें जो ग्राउंड ट्रुथ में मौजूद हैं। ‘

शोधकर्ताओं ने निष्कर्ष निकाला कि काले वाहनों का पता लगाना, जो कंप्यूटर विजन-आधारित प्रणालियों और लिडार दोनों के लिए एक समस्या है, छवियों के खंडों में डेटा की कमी की पहचान करके किया जा सकता है:

‘अनुमानित छवियों में, रंग जानकारी और वस्तुओं के सटीक आकार वास्तविक छवियों के समान नहीं हैं, यह सुझाव देते हुए कि काले वाहनों की भविष्यवाणी मुख्य रूप से संदर्भ जानकारी से की जाती है, न कि पॉइंट क्लाउड के बिंदुओं की परावर्तितता से। ‘

‘हम सुझाव देते हैं कि पारंपरिक लिडार प्रणाली के अलावा, एक दूसरी प्रणाली जो लिडार पॉइंट क्लाउड से फोटो-रियलिस्टिक छवियां उत्पन्न करती है, वास्तविक समय में दृश्य वस्तु पहचान के लिए समानांतर चलेगी।’

शोधकर्ता भविष्य में इस काम को विकसित करने की योजना बना रहे हैं, जिसमें बड़े डेटासेट शामिल होंगे।

विलंबता, और भीड़भाड़ वाला एसडीवी प्रोसेसिंग स्टैक

टेस्ला के ऑटोपायलट सिस्टम के साथ हुई दुर्घटना के बारे में एक ट्विटर पोस्ट पर एक टिप्पणीकार ने अनुमान लगाया कि 75 मील प्रति घंटे (110 फीट प्रति सेकंड) की गति से, 20fps पर चलने वाला वीडियो फीड प्रति फ्रेम केवल 5.5 फीट को कवर करेगा। हालांकि, यदि वाहन टेस्ला के नवीनतम हार्डवेयर और सॉफ्टवेयर का उपयोग कर रहा था, तो फ्रेम दर 36fps (मुख्य कैमरे के लिए) होगी, जो मूल्यांकन दर को 110 फीट प्रति सेकंड (प्रति फ्रेम तीन फीट) तक ले जाती है।

लागत और एर्गोनोमिक्स के अलावा, लिडार को एक सहायक डेटा स्ट्रीम के रूप में उपयोग करने की समस्या एसडीवी प्रोसेसिंग फ्रेमवर्क में सेंसर इनपुट की जानकारी की भीड़भाड़ है। संयुक्त रूप से महत्वपूर्ण कार्य के साथ, यह ऑटोपायलट स्टैक में रडार और लिडार को छोड़कर छवि-आधारित मूल्यांकन विधियों को प्राथमिकता देने के लिए प्रतीत होता है।

इसलिए, यह लगता है कि लिडार का उपयोग करके फोटो-रियल इमेजरी का अनुमान लगाने वाली एक प्रणाली टेस्ला के दृष्टिकोण से व्यावहारिक नहीं होगी, जो खुद में ऑटोपायलट पर एक प्रोसेसिंग बोतलनेक जोड़ देगी।

टेस्ला के संस्थापक एलोन मस्क लिडार के खिलाफ कोई खुला आलोचक नहीं हैं, जो यह बताते हैं कि यह प्रौद्योगिकी स्पेसएक्स द्वारा डॉकिंग प्रक्रियाओं के लिए उपयोग की जाती है, लेकिन वे सोचते हैं कि यह स्वायत्त वाहनों के लिए ‘निरर्थक’ है। मस्क का सुझाव है कि एक ऑक्लूजन-पेनेट्रेटिंग वेवलेंथ, जैसे कि ~4mm की सटीकता वाला रडार, अधिक उपयोगी होगा।

हालांकि, जून 2021 तक, टेस्ला वाहन रडार से भी सुसज्जित नहीं हैं। ऐसे परियोजनाओं की कमी लगती है जो इस्राइली परियोजना की तरह रडार से इमेज स्ट्रीम उत्पन्न करने का प्रयास करती हैं (हालांकि संयुक्त राज्य अमेरिका के ऊर्जा विभाग ने 2018 में रडार-सourced जीएएन इमेजरी के लिए एक प्रयास का प्रायोजन किया था)।

 

पहली बार 23 दिसंबर 2021 को प्रकाशित।

 

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai