एआई मॉडल और प्लेटफ़ॉर्म

नए तकनीक से एआई 3डी वस्तुओं की पहचान करने में मदद मिलती है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

उत्तरी कैरोलिना स्टेट यूनिवर्सिटी के शोधकर्ताओं द्वारा विकसित एक नए तकनीक से कृत्रिम बुद्धिमत्ता (एआई) कार्यक्रमों को 3डी वस्तुओं की पहचान करने में मदद मिलती है। मोनोकोन नामक इस तकनीक से एआई को 2डी छवियों का उपयोग करके 3डी वस्तुओं के बीच संबंधों को सीखने में भी मदद मिलती है।

मोनोकोन के कई अनुप्रयोग हो सकते हैं, जिनमें स्वायत्त वाहनों को 2डी छवियों का उपयोग करके अन्य वाहनों के चारों ओर नेविगेट करने में मदद करना शामिल है। यह विनिर्माण और रोबोटिक्स में भी भूमिका निभा सकता है।

तियानफू वू इस शोध पत्र के सह-लेखक हैं और उत्तरी कैरोलिना स्टेट यूनिवर्सिटी में इलेक्ट्रिकल और कंप्यूटर इंजीनियरिंग के सहायक प्रोफेसर हैं।

“हम 3डी दुनिया में रहते हैं, लेकिन जब आप एक तस्वीर लेते हैं, तो यह दुनिया को 2डी छवि में रिकॉर्ड करता है,” वू कहते हैं।

“एआई कार्यक्रम कैमरों से दृश्य इनपुट प्राप्त करते हैं। इसलिए, यदि हम चाहते हैं कि एआई दुनिया के साथ बातचीत करे, तो हमें यह सुनिश्चित करना होगा कि यह 2डी छवियों से 3डी स्थान के बारे में क्या बता सकता है। इस शोध में, हम एक चुनौती पर केंद्रित हैं: हम एआई को 2डी छवियों में 3डी वस्तुओं को कैसे सटीक रूप से पहचान सकते हैं और उन्हें स्थान में रख सकते हैं,” वू जारी रखते हैं।

स्वायत्त वाहन

स्वायत्त वाहन अक्सर 3डी स्थान को नेविगेट करने के लिए लिडार पर निर्भर करते हैं। लिडार, जो दूरी मापने के लिए लेजर का उपयोग करता है, महंगा है, जिसका अर्थ है कि स्वायत्त प्रणालियों में बहुत अधिक अतिरेक नहीं है। एक मास-उत्पादित ड्राइवरलेस कार पर दर्जनों लिडार सेंसर लगाना अविश्वसनीय रूप से महंगा होगा।

“लेकिन यदि एक स्वायत्त वाहन दृश्य इनपुट का उपयोग करके स्थान के माध्यम से नेविगेट कर सकता है, तो आप अतिरेक बना सकते हैं,” वू कहते हैं। “क्योंकि कैमरे लिडार की तुलना में काफी सस्ते हैं, इसलिए अतिरेक को प्रणाली में बनाना और इसे सुरक्षित और अधिक मजबूत बनाना आर्थिक रूप से व्यवहार्य होगा।

“यह एक व्यावहारिक अनुप्रयोग है। हालांकि, हम इस काम की मूलभूत उन्नति से भी उत्साहित हैं: यह संभव है कि 2डी वस्तुओं से 3डी डेटा प्राप्त किया जा सकता है।”

एआई को प्रशिक्षित करना

मोनोकोन 2डी छवियों में 3डी वस्तुओं की पहचान कर सकता है और उन्हें एक “बाउंडिंग बॉक्स” में रख सकता है, जो एआई को वस्तु के बाहरी किनारों को बताता है।

“हमारे काम को क्या अलग बनाता है वह यह है कि हम एआई को कैसे प्रशिक्षित करते हैं, जो पिछली प्रशिक्षण तकनीकों पर आधारित है,” वू कहते हैं। “पिछले प्रयासों की तरह, हम प्रशिक्षण के दौरान एआई को 3डी बाउंडिंग बॉक्स में वस्तुओं को रखते हैं। हालांकि, हम एआई से कैमरा-वस्तु दूरी और बाउंडिंग बॉक्स के आयामों की भविष्यवाणी करने के अलावा, हम एआई से बॉक्स के आठ बिंदुओं के स्थानों और इसके केंद्र से दो आयामों में इसकी दूरी की भविष्यवाणी करने के लिए भी कहते हैं। हम इसे ‘ऑक्सिलरी संदर्भ’ कहते हैं, और हमने पाया कि यह एआई को 2डी छवियों के आधार पर 3डी वस्तुओं की अधिक सटीक पहचान करने में मदद करता है।

“प्रस्तावित विधि माप सिद्धांत में एक प्रसिद्ध प्रमेय, क्रामर-वोल्ड प्रमेय से प्रेरित है। यह संभावित रूप से कंप्यूटर दृष्टि में अन्य संरचित-आउटपुट पूर्वानुमान कार्यों के लिए भी लागू हो सकता है।”

मोनोकोन को एक व्यापक रूप से उपयोग किए जाने वाले बेंचमार्क डेटासेट किट्टी के साथ परीक्षण किया गया था।

“जब हमने इस पत्र को जमा किया, मोनोकोन ने 2डी छवियों से ऑटोमोबाइल पर 3डी डेटा निकालने के लिए एआई कार्यक्रमों की दर्जनों की तुलना में बेहतर प्रदर्शन किया,” वू कहते हैं।

टीम अब प्रक्रिया को बड़े डेटासेट के साथ बढ़ाने की योजना बना रही है।

“आगे बढ़ते हुए, हम इसे बड़े डेटासेट के साथ बढ़ा रहे हैं और स्वायत्त ड्राइविंग में मोनोकोन का मूल्यांकन और परिष्कार करने के लिए काम कर रहे हैं,” वू कहते हैं। “हम विनिर्माण में अनुप्रयोगों की खोज करना चाहते हैं, यह देखने के लिए कि क्या हम रोबोटिक आर्म्स जैसे कार्यों के प्रदर्शन में सुधार कर सकते हैं।”

एलेक्स मैकफारलैंड एक एआई पत्रकार और लेखक हैं जो कृत्रिम बुद्धिमत्ता में नवीनतम विकासों का अन्वेषण कर रहे हैं। उन्होंने विश्वभर के कई एआई स्टार्टअप्स और प्रकाशनों के साथ सहयोग किया है।