रोबोटिक्स और भौतिक एआई
मशीन लर्निंग मॉडल वस्तु संबंधों को समझता है
मैसाचुसेट्स इंस्टीट्यूट ऑफ टेक्नोलॉजी (एमआईटी) के शोधकर्ताओं ने एक नए मशीन लर्निंग (एमएल) मॉडल का विकास किया है जो दृश्य में वस्तुओं के बीच अंतर्निहित संबंधों को समझता है। मॉडल व्यक्तिगत संबंधों को एक समय में एक करके प्रस्तुत करता है और फिर उन्हें दृश्य का वर्णन करने के लिए संयुक्त करता है।
इस नए दृष्टिकोण के माध्यम से, एमएल मॉडल पाठ विवरणों से अधिक सटीक छवियां उत्पन्न कर सकता है, और यह तब भी कर सकता है जब दृश्य में कई परियोजनाएं एक दूसरे के साथ विभिन्न संबंधों में व्यवस्थित हों।
यह नई प्रगति तब महत्वपूर्ण है जब कई गहरे शिक्षण मॉडल व्यक्तिगत वस्तुओं के बीच जटिल संबंधों को समझने में असमर्थ होते हैं।
टीम का मॉडल उन मामलों में उपयोग किया जा सकता है जहां औद्योगिक रोबोटों को बहु-चरण मैनिपुलेशन कार्य करना होता है, जैसे कि वस्तुओं को ढेर करना या उपकरणों को असेंबल करना। यह मशीनों को अंततः अपने वातावरण से सीखने और बातचीत करने में मदद करता है, जैसा कि मनुष्य करते हैं।
यिलुन डू कंप्यूटर साइंस एंड आर्टिफिशियल इंटेलिजेंस लेबोरेटरी (सीएसएआईएल) में पीएचडी छात्र और पेपर के सह-लेखक हैं। डू ने शोध का नेतृत्व शुआंग ली, सीएसएआईएल के पीएचडी छात्र, और नान लियू, इलिनोइस विश्वविद्यालय में स्नातक छात्र के साथ किया। इसमें जोशुआ बी। टेनेनबाम, पॉल ई। न्यूटन कारियर डेवलपमेंट प्रोफेसर ऑफ कॉग्निटिव साइंस एंड कंप्यूटेशन इन डिपार्टमेंट ऑफ ब्रेन एंड कॉग्निटिव साइंसेज, और वरिष्ठ लेखक एंटोनियो टोराल्बा, डेल्टा इलेक्ट्रॉनिक्स प्रोफेसर ऑफ इलेक्ट्रिकल इंजीनियरिंग एंड कंप्यूटर साइंस शामिल हैं। टेनेनबाम और टोराल्बा दोनों सीएसएआईएल के सदस्य हैं।
नया फ्रेमवर्क
“जब मैं एक टेबल देखता हूं, तो मैं यह नहीं कह सकता कि एक वस्तु एक्सवाईजेड स्थान पर है। हमारे दिमाग ऐसे नहीं काम करते। हमारे दिमाग में, जब हम एक दृश्य को समझते हैं, तो हम वास्तव में वस्तुओं के बीच संबंधों के आधार पर समझते हैं। हम सोचते हैं कि वस्तुओं के बीच संबंधों को समझने वाला एक सिस्टम बनाकर, हम उस सिस्टम का उपयोग अधिक प्रभावी ढंग से अपने वातावरण को बदलने और मैनिपुलेट करने के लिए कर सकते हैं,” डू कहते हैं।
नया फ्रेमवर्क वस्तुओं और उनके संबंधों के पाठ विवरण के आधार पर एक दृश्य की छवि उत्पन्न कर सकता है।
सिस्टम तब इन वाक्यों को छोटे टुकड़ों में तोड़ सकता है जो प्रत्येक व्यक्तिगत संबंध का वर्णन करते हैं। प्रत्येक भाग को अलग से मॉडल किया जाता है, और टुकड़ों को एक अनुकूलन प्रक्रिया के माध्यम से जोड़ा जाता है जो दृश्य की छवि उत्पन्न करता है।
वाक्यों को छोटे टुकड़ों में तोड़ने के साथ, सिस्टम उन्हें विभिन्न तरीकों से फिर से जोड़ सकता है, जिससे यह नए दृश्य विवरणों के लिए अनुकूलन कर सकता है जिनसे यह पहले कभी नहीं मिला है।
“अन्य सिस्टम सभी संबंधों को एक साथ लेते हैं और विवरण से एक ही शॉट में छवि उत्पन्न करते हैं। हालांकि, ऐसे दृष्टिकोण तब विफल हो जाते हैं जब हमें वितरित विवरण होते हैं, जैसे कि अधिक संबंधों वाले विवरण, क्योंकि ये मॉडल वास्तव में एक ही शॉट में अधिक संबंधों वाली छवियों को उत्पन्न करने के लिए अनुकूलित नहीं हो सकते हैं। हालांकि, जब हम इन अलग-अलग, छोटे मॉडलों को एक साथ जोड़ते हैं, तो हम अधिक संबंधों को मॉडल कर सकते हैं और नए संयोजनों के लिए अनुकूलित कर सकते हैं,” डू कहते हैं।
सिस्टम इस प्रक्रिया को उल्टा भी कर सकता है। यदि इसे एक छवि दी जाती है, तो यह दृश्य में वस्तुओं के बीच संबंधों से मेल खाने वाले पाठ विवरण खोज सकता है।
मॉडल का मूल्यांकन
शोधकर्ताओं ने मानवों से पूछा कि क्या उत्पन्न की गई छवियां मूल दृश्य विवरण से मेल खाती हैं। जब विवरणों में तीन संबंध थे, जो सबसे जटिल प्रकार था, 91 प्रतिशत प्रतिभागियों ने कहा कि नया मॉडल अन्य गहरे शिक्षण विधियों की तुलना में बेहतर प्रदर्शन करता है।
“एक दिलचस्प बात जो हमने पाई है कि हमारे मॉडल के लिए, हम अपने वाक्य को एक संबंध विवरण से दो या तीन, या यहां तक कि चार विवरणों तक बढ़ा सकते हैं, और हमारा दृष्टिकोण अभी भी उन विवरणों द्वारा सही ढंग से वर्णित छवियां उत्पन्न करने में सक्षम है, जबकि अन्य विधियां विफल हो जाती हैं,” डू कहते हैं।
मॉडल ने पहले से अनुभव नहीं किए गए विवरणों के साथ काम करने की एक प्रभावशाली क्षमता भी प्रदर्शित की।
“यह बहुत ही आशाजनक है क्योंकि यह मानवों के काम करने के तरीके के करीब है। मानव केवल कुछ उदाहरणों को देख सकते हैं, लेकिन हम उन कुछ उदाहरणों से उपयोगी जानकारी निकाल सकते हैं और उन्हें एक साथ मिलाकर असीमित संयोजन बना सकते हैं। और हमारे मॉडल में ऐसा गुण है जो कम डेटा से सीखने और अधिक जटिल दृश्यों या छवि पीढ़ी के लिए सामान्यीकरण करने की अनुमति देता है,” ली कहते हैं।
टीम अब अधिक जटिल वास्तविक दुनिया की छवियों पर मॉडल का परीक्षण करने और अंततः रोबोटिक्स प्रणालियों में मॉडल को शामिल करने के तरीके खोजने के लिए आगे बढ़ेगी।












