साझेदारियाँ
NVIDIA ने S1 रोबोट फाउंडेशन मॉडल के पीछे Skild AI सहयोग का विवरण दिया

NVIDIA ने 10 सितंबर, 2026 को बताया कि Skild AI ने अपने S1 रोबोट फाउंडेशन मॉडल को NVIDIA AI इन्फ्रास्ट्रक्चर पर कैसे बनाया, और कहा कि रोबोटिक्स कंपनी ने अपने पहले व्यावसायिक तैनाती के 10 महीने बाद $100 मिलियन वार्षिक राजस्व दर हासिल की।
In the NVIDIA blog post, the company said Skild built S1 and conducted the underlying research on its infrastructure as part of a broader collaboration spanning synthetic data generation, model training, simulation and real-world physical AI deployment. “Learning by experience, and not preprogramming, is the step change that has happened in robotics,” said Deepak Pathak, cofounder and CEO of Skild AI, adding that NVIDIA Isaac Lab and NVIDIA Cosmos help Skild create the scalable, diverse experience its robots need to learn across many scenarios and embodiments. The companies said they are working to move adaptable robot intelligence from the lab into factories and other dynamic operating environments.
एक वीडियो से अनदेखे कार्यों का सीखना
Skild ने 18 अगस्त, 2026 के शोध पोस्ट में S1 को प्रस्तुत किया, इसे एक रोबोटिक फाउंडेशन मॉडल के रूप में वर्णित किया जो मूल से इन‑कंटेक्स्ट लर्नर के रूप में बनाया गया है। मॉडल कार्य का वीडियो प्रदर्शन इनपुट के रूप में लेता है और बिना अपने वज़न अपडेट किए या कार्य‑विशिष्ट पोस्ट‑ट्रेनिंग के बिना उसे निष्पादित करता है। Skild S1 को पहला रोबोटिक्स फाउंडेशन मॉडल बताता है जो लंबी अवधि के कार्यों पर इन‑कंटेक्स्ट लर्निंग दिखाता है, जो 10 मिनट तक चलते हैं और जिन्हें प्री‑ट्रेनिंग के दौरान कभी नहीं देखा गया था।
एक ऑपरेटर इच्छित कार्य का वीडियो रिकॉर्ड करता है और उसे मॉडल को प्रॉम्प्ट के रूप में देता है। मॉडल प्रदर्शित इरादा, वस्तुओं और क्रम को समझता है, फिर उन्हें सामने वाले रोबोट के लिए क्रियाओं में परिवर्तित करता है, बिना पुनः प्रशिक्षण के, और अक्सर ऐसे कार्य के लिए भी जो उसके प्री‑ट्रेनिंग डेटासेट में नहीं था। दोनों कंपनियों के अनुसार, S1 पौधे लगाना, पैनकेक बनाना, पोर‑ओवर कॉफ़ी बनाना और किट असेंबली जैसे अपरिचित कार्य कर सकता है, ऐसे काम जो दहाईयों हेरफेर चरणों को कवर करते हैं और क्रम में कौशल को संयोजित करने की आवश्यकता होती है, जिन्हें मॉडल ने पहले नहीं किया था।
Skild के शोध पोस्ट में दर्ज एक पौधा‑लगाने परीक्षण में, मिट्टी, एक गमला, एक पानी की बाल्टी और एक पौधा कार्यालय में 8:54 PM पर पहुँचे, रिकॉर्डिंग 9:16 PM पर शुरू हुई, एक एगोसेंट्रिक मानव वीडियो प्रदर्शन 9:22 PM पर रिकॉर्ड किया गया, और S1 ने 9:27 PM पर हार्डवेयर पर कार्य को स्वायत्त रूप से निष्पादित करना शुरू किया। Skild कहता है कि प्रदर्शन से स्वायत्त निष्पादन तक का समय 11 मिनट था।
Skild रिपोर्ट करता है कि S1 कार्य के मध्य में वस्तुओं के स्थानांतरित होने पर समायोजित हो सकता है, त्रुटियों से उबर सकता है, और समान उपयोगिता वाली वस्तुओं को बदल सकता है; एक मामले में जब प्रदर्शन में पानी की बाल्टी दिखायी गई थी, तब मॉडल ने पानी का कप उपयोग किया। कंपनी यह भी बताती है कि मॉडल कभी‑कभी त्रुटिपूर्ण प्रदर्शनों को सुधारता है, प्रदर्शन को लक्ष्य की विशिष्टता के रूप में लेता है, न कि दोहराने योग्य पथ के रूप में।
भाषा‑प्रॉम्प्टेड नीतियों के खिलाफ रिपोर्टेड परिणाम
NVIDIA के पोस्ट में बताया गया है कि Skild के नए, बहु‑चरणीय कार्यों के परीक्षणों में, S1 प्रत्येक चरण में लगभग 66 % बार सफल रहा, जबकि समान AI सिस्टम के लिए यह 9 % था, जिसे NVIDIA ने सात गुना से अधिक सुधार के रूप में वर्णित किया। Skild के शोध पोस्ट में तुलना को एक नियंत्रित अध्ययन के रूप में बताया गया है जो भाषा‑प्रॉम्प्टेड VLA नीति के खिलाफ किया गया, जो कार्य विशिष्टता को भाषा में प्राप्त करता है न कि प्रदर्शन के माध्यम से। दोनों नीतियों को समान डेटा, आर्किटेक्चर और कंप्यूट पर 1,000 से 100,000 घंटे के प्री‑ट्रेनिंग डेटासेट्स पर प्रशिक्षित किया गया, और 66 % और 9 % के आंकड़े 100,000 घंटे पर अनदेखे लंबी‑होराइज़न कार्यों पर दर्ज किए गए, Skild के अनुसार।
प्री‑ट्रेनिंग के दौरान देखे गए कार्यों पर, Skild रिपोर्ट करता है कि इन‑कंटेक्स्ट लर्निंग ने सबसे बड़े पैमाने पर 96 % सफलता हासिल की, जबकि 1,000 घंटे पर भाषा‑शर्तित नीति ने 53 % स्कोर किया, जबकि इन‑कंटेक्स्ट लर्निंग ने 43 % स्कोर किया। Skild ने वितरण शिफ्ट के पाँच स्तरों में मजबूती का भी मूल्यांकन किया, और बताया कि सबसे कठोर स्थिति में, जहाँ रोबोट की आधी क्रियाएँ विपरीत हाथ से करनी पड़ती हैं, भाषा‑प्रॉम्प्टेड नीति ने इन‑कंटेक्स्ट नीति की तुलना में तीन गुना अधिक गिरावट दिखाई।
प्रदर्शन दक्षता के संबंध में, Skild अनुमान लगाता है कि एकल इन‑कंटेक्स्ट वीडियो लगभग 380 पोस्ट‑ट्रेनिंग एपिसोड के बराबर है, यह आंकड़ा मापे गए बिंदुओं के बीच इंटरपोलेशन से प्राप्त किया गया है, और रिपोर्ट करता है कि 380 लंबी‑होराइज़न प्रदर्शन एकत्र करने में 50 से 100 घंटे का टेलीऑपरेशन लगा। पोस्ट‑ट्रेन्ड बेसलाइन ने अंततः 2,000 प्रदर्शनों के साथ 86 % सफलता हासिल की, Skild के अनुसार।
व्यावसायिक आकर्षण और फॉक्सकॉन तैनाती
NVIDIA के पोस्ट में कहा गया है कि Skild ने 60 से अधिक तैनाती साझेदारियाँ बनाई हैं, जिनका कार्यक्षेत्र निर्माण, लॉजिस्टिक्स, निरीक्षण, सुरक्षा, खाद्य तैयारी और अन्य अनुप्रयोगों तक विस्तृत है।
फ़ैक्टरी फ़्लोर पर, Skild, NVIDIA और Foxconn NVIDIA Blackwell सिस्टमों की उच्च‑सटीकता असेंबली के लिए ड्यूल‑आर्म मैनीपुलेटर पर Skild Brain को तैनात कर रहे हैं। एक प्रदर्शित कार्यप्रवाह में, एक रोबोट बसबार और लिमिट ब्लॉक स्थापित करता है, 16 स्क्रू को कसता है और बहु‑चरणीय कार्य में उत्पन्न व्यवधानों के अनुसार अनुकूलित होता है। NVIDIA के पोस्ट में कहा गया है कि इस काम को सटीक गति, संपर्क‑जागरूक नियंत्रण, क्रम‑ट्रैकिंग और जब दृश्य योजना से भिन्न हो तो पुनर्प्राप्ति की आवश्यकता होती है।
Skild ने Blackwell उत्पादन‑लाइन योजना की पहली घोषणा 19 मार्च, 2026 के पोस्ट में की, जिसमें ABB Robotics, Universal Robots और Mobile Industrial Robots के साथ साझेदारियों का भी खुलासा किया गया। उस घोषणा में, Skild ने असेंबली क्रम को फॉक्सकॉन लाइन पर मनुष्यों द्वारा किए गए वास्तविक कार्य के रूप में वर्णित किया, जो लिमिट ब्लॉक को हटाने पर समाप्त होता है, और कहा कि उसके ब्रेन को इस कार्यप्रवाह के लिए थोड़े से रोबोट डेटा से फाइन‑ट्यून किया गया था।
S1 के पीछे NVIDIA स्टैक
NVIDIA के अनुसार, उसके Cosmos ओपन वर्ल्ड फाउंडेशन मॉडल Skild को प्रशिक्षण डेटा विविध बनाने और वीडियो को संरचित विवरणों में बदलने में मदद करते हैं, जबकि Cosmos Curator बड़े पैमाने पर डेटा को एनोटेट, फ़िल्टर और व्यवस्थित करने में सहायता करता है। NVIDIA Omniverse लाइब्रेरी और Isaac Sim फ्रेमवर्क भौतिक‑आधारित वर्चुअल वातावरण प्रदान करते हैं जो डेटा उत्पन्न करने, एज केस परीक्षण करने और वास्तविक‑दुनिया में डिप्लॉयमेंट से पहले व्यवहारों को मान्य करने के लिए उपयोग होते हैं।
Skild Isaac Lab में रिइन्फोर्समेंट लर्निंग का उपयोग करता है, जो एक ओपन मॉड्यूलर रोबोट लर्निंग फ्रेमवर्क है और Newton फिजिक्स इंजन द्वारा संचालित है, जिससे बल, संपर्क, टकराव और दबाव जैसे भौतिक पैरामीटरों को मॉडल किया जाता है और सिमुलेशन‑से‑वास्तविकता अंतर को कम किया जाता है। जैसे-जैसे मॉडल उत्पादन की ओर बढ़ते हैं, NVIDIA Nsight टूल इंजीनियरों को प्रशिक्षण के दौरान प्रदर्शन बाधाओं को खोजने में मदद करते हैं, और TensorRT सॉफ़्टवेयर डेवलपमेंट किट इनफ़रेंस को अनुकूलित करता है ताकि रोबोट भौतिक दुनिया में तेज़ी से प्रतिक्रिया दे सकें।
Skild और NVIDIA भी मिलकर GPU‑त्वरित सिमुलेशन सॉल्वर विकसित कर रहे हैं जो यह मॉडल करते हैं कि रोबोट भौतिक रूप से वस्तुओं को कैसे छूते, पकड़ते और हेरफेर करते हैं। कंपनियों ने कहा कि ये सॉल्वर जल्द ही Newton के हिस्से के रूप में सभी डेवलपर्स के लिए उपलब्ध कराए जाएंगे।












