रोबोटिक्स और भौतिक एआई

Motional ने nuReasoning डेटासेट जारी किया और ECCV चुनौती लॉन्च की

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Motional ने 8 सितंबर, 2026 को nuReasoning के रिलीज़ की घोषणा की, इसे स्वायत्त वाहनों के लिए विश्व का पहला तर्क‑केंद्रित, लोंग‑टेल परिदृश्य खुला डेटासेट बताया, और स्वीडन में यूरोपियन कॉन्फ़्रेंस ऑन कंप्यूटर विज़न में एक सहायक शोध चुनौती लॉन्च की। यह डेटासेट UCLA Mobility Lab और उसके निदेशक, प्रोफेसर जियाकी मा के साथ साझेदारी में बनाया गया।

यह Motional घोषणा nuReasoning को एंड‑टू‑एंड स्वायत्त सिस्टमों के लिए प्रशिक्षण सामग्री के रूप में प्रस्तुत करती है, उन दुर्लभ एज केसों को लक्षित करती है जहाँ केवल परसेप्शन पर्याप्त नहीं होता। Vision‑Language‑Action मॉडल दृश्य पहचान को कार्रवाई के निर्णयों के साथ मिलाते हैं, और Motional कहता है कि ऐसे मॉडलों को प्रशिक्षण डेटा चाहिए जो ड्राइविंग कार्रवाई के पीछे की तर्कशक्ति को दर्शाए, न कि केवल सही कार्रवाई को। यह डेटासेट मॉडल को स्थानिक संबंध, ड्राइविंग‑निर्णय तर्क, जोखिम की भविष्यवाणी, और वैकल्पिक परिणामों पर विचार करना सिखाने के लिए डिजाइन किया गया है।

डेटासेट संरचना

nuReasoning में 20,000 लोंग‑टेल परिदृश्य शामिल हैं, प्रत्येक कम से कम 20 सेकंड का वीडियो क्लिप है जिसमें मानव‑प्रमाणित तर्क एनोटेशन एम्बेडेड है। ये घटनाएँ Motional के फ़्लीट डेटा से निकाली गईं, जो लास वेगास, पिट्सबर्ग, लॉस एंजेलिस, बॉस्टन और सिंगापुर में एकत्रित की गई थीं, और कंपनी रिपोर्ट करती है कि 105 घंटे से अधिक तर्क‑गहन एज केस मौजूद हैं, जिनमें असामान्य पैदल यात्री गतिविधि, कार्य क्षेत्र और रात की सड़क निर्माण, पशु पारगमन, और सीमित दृश्यता वाले परिदृश्य शामिल हैं। एनोटेशन सेट में तीन प्रकार: स्पैशियल रीज़निंग, डिसीजन रीज़निंग, और काउंटरफ़ैक्चुअल रीज़निंग के कुल 247,000 मानव‑प्रमाणित तर्क एनोटेशन हैं, साथ ही तीन‑आयामी दृश्य प्रतिनिधित्व के लिए मल्टी‑मोडल सेंसर डेटा भी।

आधिकारिक nuReasoning रिकॉर्ड अतिरिक्त संरचना प्रदान करता है। क्लिप लगभग 20 सेकंड लंबे होते हैं और 10 हर्ट्ज़ पर सैंपल किए जाते हैं, जिसमें 17,000 प्रशिक्षण क्लिप, 2,000 वैलिडेशन क्लिप, और 1,000 निजी परीक्षण क्लिप शामिल हैं। सेंसर डेटा में समन्वित मल्टी‑व्यू कैमरे, समर्थित क्लिपों के लिए LiDAR, कैलिब्रेशन और इगो स्टेट, 3D ऑब्जेक्ट एनोटेशन, वेक्टराइज़्ड HD मैप, ट्रैफ़िक लाइट, रूट पाथ, और नेविगेशन कमांड शामिल हैं। लोंग‑टेल सामग्री चुनने के लिए, एक AI मूल्यांकनकर्ता ने 10,000 घंटे से अधिक ड्राइविंग से निकाले गए 100,000 से अधिक प्री‑फ़िल्टर किए गए 30‑सेकंड उम्मीदवार क्लिपों को स्कोर किया, जिसके बाद मानव सत्यापन और कीफ़्रेम चयन किया गया।

स्पैशियल रीज़निंग एनोटेशन वस्तु‑केंद्रित 2D‑3D समझ, मानचित्र और टोपोलॉजी संदर्भ, सापेक्ष स्थिति, वेग, भविष्य की गति, और इगो वाहन के साथ अंतःक्रियाओं को कवर करते हैं, जो 1 हर्ट्ज़ पर एनोटेट किए गए हैं। डिसीजन रीज़निंग दृश्य विवरण, महत्वपूर्ण घटकों, लोंजीट्यूडिनल और लैटरल मेटा‑एक्शन, और चयनित व्यवहार को समझाने वाले कारणीय ट्रेस को कैप्चर करता है। काउंटरफ़ैक्चुअल रीज़निंग वैकल्पिक इगो क्रियाओं का मूल्यांकन सुरक्षा‑सम्बंधित परिणामों और जोखिम स्तरों (सुरक्षित, अधूरा, या असुरक्षित) के खिलाफ करता है; डिसीजन और काउंटरफ़ैक्चुअल एनोटेशन 0.2 हर्ट्ज़ पर रिकॉर्ड किए जाते हैं। रिकॉर्ड यह भी बताता है कि डेटासेट गोपनीयता‑संरक्षण प्रक्रिया लागू करता है, जिसमें मानव चेहरों और लाइसेंस प्लेटों का अनामिकरण शामिल है।

Motional ने अपना स्वामित्व वाला Omnitag सर्च इंजन एकीकृत किया है, जो शोधकर्ताओं को परिदृश्य प्रकार, कठिनाई स्तर, और स्थान के आधार पर वितरण क्वेरी करने और सामरिक अंतःक्रियाओं के लिए प्राकृतिक भाषा सेमांटिक खोज चलाने की अनुमति देता है। कंपनी द्वारा वर्णित एक एनोटेटेड परिदृश्य में रात के समय का निर्माण क्षेत्र दिखाया गया है जहाँ वाहन रुक गया: एनोटेशन बताता है कि रुकना सही था क्योंकि आगे एक छोटा पशु पार कर रहा था, और वैकल्पिक मार्ग निर्माण बाधाओं और पशु की अज्ञात गति एवं दिशा के कारण अस्वीकृत किए गए।

कंपनी रिपोर्ट करती है कि इस वर्ष की शुरुआत में जारी किया गया nuReasoning मिनीसेट 50,000 से अधिक बार डाउनलोड किया गया है। सार्वजनिक रिलीज़ में Hugging Face पर प्रशिक्षण और वैलिडेशन स्प्लिट शामिल हैं, जबकि 1,000 निजी परीक्षण क्लिप चुनौती मूल्यांकन के लिए रखी गई हैं। GitHub पर एक ओपन‑सोर्स डेवकिट VLA प्रशिक्षण, तर्क और योजना लक्ष्यों, बेसलाइन मॉडल, और मूल्यांकन मीट्रिक के लिए डेटा प्रोसेसिंग प्रदान करता है।

nuReasoning चुनौती

Motional और UCLA Mobility Lab nuReasoning चुनौती की मेजबानी कर रहे हैं, जो ECCV में लॉन्च हुई। प्रतियोगिता को 1,000 निजी‑टेस्ट परिदृश्यों पर योजना और तर्क के संयुक्त मूल्यांकन के रूप में संरचित किया गया है। मुख्य योजना कार्य प्रतिभागियों को 10 सेकंड का ड्राइविंग संदर्भ देता है — मल्टी‑व्यू इमेज, HD मानचित्र जानकारी, नेविगेशन कमांड, और इगो स्टेट — और अगले पाँच सेकंड के लिए भविष्यवाणी किया गया इगो ट्रैजेक्टरी चाहिए। सहायक तर्क कार्य समान संदर्भ का उपयोग करके ज्यामिति, गति, निर्णय, और काउंटरफ़ैक्चुअल तर्क को कवर करने वाले विज़ुअल प्रश्न उत्तर देता है, जिसमें बहु‑विकल्प, संख्यात्मक, कोऑर्डिनेट, और ट्रैजेक्टरी उत्तर प्रारूप शामिल हैं।

अंतिम चुनौती स्कोर 75% योजना स्कोर और 25% तर्क स्कोर को मिलाता है, और कुल पुरस्कार राशि $10,000 है। पंजीकरण खुला है, और विजेताओं की घोषणा दिसंबर 2026 में कॉन्फ़्रेंस ऑन न्यूरल इन्फ़ॉर्मेशन प्रोसेसिंग सिस्टम्स में की जाएगी।

“AV बेड़ों को सुरक्षित रूप से विस्तारित करने के लिए, स्वायत्त ड्राइविंग सिस्टम को दुर्लभ, अराजक एज केसों पर अनुभवी मानव ड्राइवर की समान भरोसेमंद तर्कशक्ति के साथ प्रतिक्रिया देनी चाहिए,” Phil Michel, Motional के सीनियर वाइस प्रेसिडेंट ऑफ ऑटोनॉमी एंड AI ने कहा। उन्होंने कहा कि कंपनी पारदर्शी AI को प्राथमिकता दे रही है ताकि वास्तविक समय निर्णय‑निर्धारण और जोखिम मूल्यांकन को स्पष्ट रूप से आंका जा सके, और nuReasoning को खुला उपलब्ध कराना एज केसों को हल करने के लिए एक साझा आधार प्रदान करता है।

शोध आधार और उपलब्धता

साथ में प्रकाशित पेपर, जिसका शीर्षक “nuReasoning: एक तर्क‑केंद्रित डेटासेट और बेंचमार्क फॉर लोंग‑टेल ऑटोनॉमस ड्राइविंग” है, 29 मई, 2026 को arXiv पर जमा किया गया था, जिसमें लेखक UCLA और Motional से जुड़े हैं और टॉनी श्युएवेई क़ी को प्रोजेक्ट लीड के रूप में सूचीबद्ध किया गया है। पेपर में लेखक रिपोर्ट करते हैं कि nuReasoning पर विज़न‑लैंग्वेज मॉडल को फाइन‑ट्यून करने से ड्राइविंग‑विशिष्ट प्रश्न उत्तर में उल्लेखनीय सुधार होता है, और VLA प्रशिक्षण में तर्क‑सुपरविजन को शामिल करने से योजना प्रदर्शन में सुधार होता है, भले ही अनुमान समय पर टेक्स्टुअल तर्क आउटपुट बंद हो। पेपर के योजना मॉडल, nuVLA, विज़न‑लैंग्वेज बैकबोन को ट्रैजेक्टरी जनरेशन के साथ मिलाता है।

nuReasoning, Motional की ओपन‑डेटा श्रृंखला को विस्तारित करता है जो 2019 में nuScenes से शुरू हुई, जिसे कंपनी उद्योग का पहला मल्टी‑मॉडल सार्वजनिक AV डेटासेट मानती है, और यह nuImages, Panoptic nuScenes, और nuPlan तक जारी रहा। ये डेटासेट व्यावसायिक लाइसेंस या Motional की गैर‑व्यावसायिक शर्तों और नियमों के तहत मुफ्त शैक्षणिक उपयोग के लिए उपलब्ध हैं।

इलारा निक्स यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो परिवहन, गतिशीलता प्रणाली, और स्वायत्त प्रौद्योगिकियों में कृत्रिम बुद्धिमत्ता को कवर करती है। उनका काम स्व-ड्राइविंग वाहनों, विमान प्रणालियों, रेल नेटवर्क, और सार्वजनिक परिवहन पर केंद्रित है - जहां नवाचार के साथ-साथ विश्वसनीयता, सुरक्षा, और वास्तविक दुनिया में तैनाती भी महत्वपूर्ण है।