रोबोटिक्स और भौतिक एआई

डायना रोबोटिक्स ने एक मिलियन घंटे के मानव वीडियो पर डायना-2 को प्रशिक्षित किया, कोई रोबोट डेटा नहीं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

यह दावा महत्वपूर्ण है क्योंकि यह क्षेत्र की सीमा कहां है। सामान्य रोबोट नीतियों को मुख्य रूप से टेलीओपरेटेड एक्शन डेटा पर प्रशिक्षित किया गया है: मानव रोबोटों को कार्यों के माध्यम से शारीरिक रूप से मार्गदर्शन करते हैं, घंटे दर घंटे। यह डेटा महंगा और इकट्ठा करने में धीमा है, और इसने रोबोट फाउंडेशन मॉडल को स्केल करने की सीमा को सीमित कर दिया है। डायना-2 का दांव यह है कि रोबोटों को जो शारीरिक अंतर्दृष्टि की आवश्यकता होती है वह मानवों द्वारा चीजों को करने के वीडियो से सीखी जा सकती है, और फिर रोबोट हार्डवेयर में स्थानांतरित की जा सकती है।

“एक वर्ल्ड-एक्शन मॉडल बनाकर जो कार्रवाई करने से पहले भौतिक दुनिया की कल्पना करता है, हम रोबोटों को स्थानिक तर्क और संपर्क भौतिकी प्रदान करते हैं जो पारंपरिक दृष्टि-भाषा मॉडल में बस नहीं होते हैं।”

डायना-2 वीडियो से सीखता है बिना रोबोट को देखे

आर्किटेक्चर यह है जिसे डायना एक वर्ल्ड-एक्शन मॉडल कहता है, जो वीडियो जनरेशन पर बनाया गया है और दृष्टि-भाषा-क्रिया अनुकूलन के बजाय जो क्षेत्र में प्रमुख हैं। प्री-प्रशिक्षण के दौरान, मॉडल मानव वीडियो निगम पर एक दोहरा उद्देश्य (अगले फ्रेम और अगली क्रिया की भविष्यवाणी) चलाता है। कंपनी का कहना है कि इससे मॉडल को संपर्क भौतिकी और स्थानिक तर्क का एक कार्य मॉडल मिलता है जो निहित रूपों में स्थानांतरित होता है: स्टेशनरी रोबोट आर्म, मानववंशी प्रोटोटाइप, और दextrous पांच-उंगली वाले हाथ, उन रोबोटों में से कोई भी प्रशिक्षण में नहीं दिखाई देता है।

परिणाम को एक विशिष्ट प्लेटफ़ॉर्म के लिए अनुकूलित करने में स्थानीय फ़ाइन-ट्यूनिंग के कुछ घंटे लगते हैं और नहीं डेटा संग्रह के हफ्ते। एक मामले में डायना का हवाला देते हैं, 13 मिनट का डेटा एक जोड़ी पांच-उंगली वाले रोबोट हाथों को एक बोतल कैप खोलने के लिए सिखाने के लिए पर्याप्त था। 15 बेंचमार्क कार्यों पर, मानव डेटा पर पूर्व-प्रशिक्षित नीतियां लगातार कम डेटा पर प्रशिक्षित नीतियों को बेहतर प्रदर्शन करती हैं, स्केलिंग कर्व जो कंपनी कानून के रूप में इंगित करती है।

सबसे स्पष्ट तुलना डायना के अपने पिछले मॉडल के खिलाफ है। डायना-1, दृष्टि-भाषा-क्रिया मॉडल जो कंपनी के व्यावसायिक तैनाती में चलता है, डायना-2 का सामना किया मैच किए गए प्रशिक्षण चरणों और डेटासेट के तहत शारीरिक मूल्यांकन में। दextrous कार्यों जैसे खाद्य चॉपिंग और कार्यस्थान साफ़ करने पर, डायना का कहना है कि डायना-2 शारीरिक व्यवधानों से मानव हस्तक्षेप के बिना पुनर्प्राप्त किया, जहां वीएलए बेसलाइन विफल रही और मैनुअल रीसेट की आवश्यकता थी। एक वीडियो सह-प्रशिक्षण एल्गोरिदम ने उपयोगकर्ता आदेशों के प्रति विभिन्न गतियों की आवश्यकता वाले कार्यों पर निर्देश-आधारित स्कोर में 133% की वृद्धि की।

डायना-2 संख्या से

  • 1 मिलियन+ घंटे मानव वीडियो प्री-प्रशिक्षण में — कंपनी द्वारा लगभग 170 वर्षों के निरंतर जागरण के अनुभव के रूप में वर्णित
  • 20% → 80–90% कार्य सफलता दर उच्च-सटीक विनिर्माण कार्यों पर, प्री-प्रशिक्षण पैमाने से अकेले
  • 1.55x अधिक कार्य वास्तविक दुनिया के सिर-टू-सिर मूल्यांकन में डायना-1 की तुलना में पूरे किए गए
  • 87% बनाम 46% पास दर एक ग्राहक तैनाती पर, डायना-2 बनाम डायना-1
  • 13 मिनट डेटा पांच-उंगली वाले हाथों को एक बोतल कैप खोलने के लिए प्रशिक्षित करने के लिए
  • 133% सुधार निर्देश-आधारित कार्यों पर वीडियो सह-प्रशिक्षण एल्गोरिदम से
  • 10 मिलियन घंटे: प्रशिक्षण-डेटा पैमाने जो कंपनी का कहना है कि दृष्टिकोण खोलता है

डायना के तैनाती पहले से ही परीक्षण बिस्तर थे

डायना-2 एक असामान्य रूप से ठोस व्यावसायिक आधार पर आता है एक कंपनी के लिए इतनी कम उम्र में। डायना के रोबोट, डायना-1 चला रहे हैं, उत्पादन में होटल, रेस्तरां, लॉन्ड्रोमैट, और जिम में तैनात हैं। कंपनी के अपने सामग्री डायना-1 को 40 से अधिक शर्ट प्रति घंटे लगातार और 16 घंटे प्रति दिन ग्राहक साइटों पर चलाने का वर्णन करते हैं, 24 घंटे निरंतर संचालन पर 99%-प्लस सफलता दर के साथ।

यह तैनाती फुटप्रिंट शोध के पीछे डेटा फ्लाईव्हील भी है।

कंपनी का घोषित मार्ग यहां से स्केल है: यदि मानव-वीडियो स्केलिंग कर्व धारण करता है, तो डायना का कहना है कि 10 मिलियन घंटे पर प्रशिक्षण वीडियो इकट्ठा करने की बजाय टेलीओपरेशन रिग्स के बेड़े का निर्माण करने का मामला है। 1-मिलियन-घंटे का परिणाम यह साक्ष्य है कि कर्व मौजूद है। यह 10 गुना पर धारण करता है या नहीं यह खुला इंजीनियरिंग प्रश्न है — और यह अब वह है जिस पर डायना ने अपने रोडमैप को दांव पर लगा दिया है।

ओरियन सातो एक एआई-जनरेटेड पत्रकार है जो रोबोटिक्स, स्वचालन, और बुद्धिमान मशीनों पर केंद्रित है। उनके लेखन में रोबोटिक्स के क्षेत्र में हो रही प्रगति के माध्यम से विनिर्माण, लॉजिस्टिक्स, स्वास्थ्य सेवा, और दैनिक जीवन में स्वचालन के बढ़ते प्रभाव का अन्वेषण किया जाता है।