شراكات
نڤيديا تكشف تفاصيل التعاون مع Skild AI خلف نموذج الأساس للروبوت S1

في 10 سبتمبر 2026، قدّمت نڤيديا تفاصيل حول كيفية بناء Skild AI لنموذج الأساس للروبوت S1 على بنية نڤيديا التحتية للذكاء الاصطناعي، وأعلنت أن شركة الروبوتات وصلت إلى معدل إيرادات سنوية قدره 100 مليون دولار بعد 10 أشهر من أول نشر تجاري لها.
في مقال مدونة نڤيديا، صرّحت الشركة أن Skild قامت ببناء S1 وأجرت الأبحاث الأساسية على بنيتها كجزء من تعاون أوسع يشمل توليد البيانات الاصطناعية، تدريب النماذج، المحاكاة ونشر الذكاء الاصطناعي الفيزيائي في العالم الحقيقي. وقال ديباك باتاك، المؤسس المشارك والرئيس التنفيذي لـ Skild AI: “التعلم من خلال الخبرة، وليس البرمجة المسبقة، هو التحول الجذري الذي حدث في مجال الروبوتات”. وأضاف أن NVIDIA Isaac Lab وNVIDIA Cosmos يساعدان Skild في إنشاء تجربة قابلة للتوسع ومتنوعة يحتاجها روبوتاتها للتعلم عبر العديد من السيناريوهات والتجسيدات. وأعلنت الشركتان أنهما تعملان على نقل الذكاء الروبوتي القابل للتكيف من المختبر إلى المصانع وغيرها من بيئات التشغيل الديناميكية.
التعلم من مهام غير مرئية من فيديو واحد
قدمت Skild نموذج S1 في منشور بحثي بتاريخ 18 أغسطس 2026، ووصفتها بأنها نموذج أساس للروبوتات تم بناؤه من الصفر كمتعلم ضمن السياق. يأخذ النموذج فيديوًا يوضح مهمة كمدخل وينفّذها دون تعديل أوزانه أو خضوع لتدريب لاحق مخصص للمهمة. وتصف Skild S1 بأنه أول نموذج أساس للروبوتات يُظهر التعلم ضمن السياق على مهام طويلة الأمد تصل إلى 10 دقائق، والتي لم تُرَ خلال مرحلة ما قبل التدريب.
يقوم المشغل بتسجيل فيديو للمهمة المطلوبة ويقدّمه للنموذج كإشارة. يفسّر النموذج النية والكيانات والتسلسل المُظهرين في الفيديو، ثم يحوّله إلى إجراءات للروبوت أمامه، دون الحاجة إلى إعادة تدريب، وغالبًا لمهمة لا يغطيها مجموعة بيانات ما قبل التدريب الخاصة به. وفقًا لكلتا الشركتين، يستطيع S1 تنفيذ مهام غير مألوفة تشمل زرع النباتات، إعداد الفطائر، تحضير القهوة بطريقة الصب، وتجميع الأدوات، وهي أعمال تمتد عبر عشرات خطوات التلاعب وتتطلب تركيب مهارات في تسلسلات لم يُجرِّب النموذج تنفيذها من قبل.
في اختبار زرع نبات واحد تم توثيقه في منشور أبحاث Skild، وصل التربة والإناء وعلبة الري والنبات إلى المكتب في الساعة 8:54 م، وبدأ التسجيل في الساعة 9:16 م، وسُجل فيديو توضيحي إنساني ذاتي المنظور في الساعة 9:22 م، وبدأ S1 بتنفيذ المهمة تلقائيًا على الأجهزة في الساعة 9:27 م. وتذكر Skild أن الوقت بين العرض والتنفيذ المستقل كان 11 دقيقة.
تُفيد Skild أن S1 يمكنه التكيف عندما تُنقل الكائنات أثناء المهمة، ويتعافى من الأخطاء، ويستبدل الكائنات بأخرى ذات خصائص مماثلة، ففي حالة واحدة استُخدم كوب ماء حين أظهر العرض علبة ري. كما تُشير الشركة إلى أن النموذج أحيانًا يُحسّن من العروض المعيبة، معتبرًا العرض كتعريف للهدف بدلاً من مسار يجب تكراره.
النتائج المبلغ عنها مقابل السياسات الموجهة باللغات
تشير مشاركة نڤيديا إلى أن اختبارات Skild على مهام جديدة متعددة الخطوات أظهرت أن S1 نجح في حوالي 66٪ من الوقت في كل خطوة، مقارنةً بـ 9٪ لنظام ذكاء اصطناعي مشابه، وهو فرق وصفت نڤيديا أنه تحسين يزيد عن سبعة أضعاف. يصف منشور أبحاث Skild المقارنة بأنها دراسة محكمة ضد سياسة VLA موجهة باللغات، حيث تتلقى مواصفات المهمة عبر اللغة بدلاً من العرض. تم تدريب كلتا السياسات على بيانات وهوية ومعمارية وحوسبة متطابقة عبر مجموعات بيانات ما قبل التدريب التي تتراوح من 1,000 إلى 100,000 ساعة، وسُجلت نسب 66٪ و9٪ عند 100,000 ساعة على مهام طويلة الأمد غير مرئية، وفقًا لـ Skild.
في المهام التي شوهدت أثناء ما قبل التدريب، تُفيد Skild أن التعلم ضمن السياق وصل إلى نسبة نجاح 96٪ عند أكبر حجم، بينما عند 1,000 ساعة سجّلت السياسة المشروطة باللغة 53٪ مقابل 43٪ للتعلم ضمن السياق. كما قيمت Skild المتانة عبر خمسة مستويات من تحول التوزيع، مشيرةً إلى أنه تحت أقسى الظروف، حيث يجب تنفيذ نصف إجراءات الروبوت بالذراع المقابلة، تدهورت السياسة الموجهة باللغات بما يصل إلى ثلاثة أضعاف ما تدهورت به السياسة ضمن السياق.
فيما يتعلق بكفاءة العرض، تُقدّر Skild أن فيديوًا واحدًا ضمن السياق يعادل تقريبًا 380 حلقة ما بعد التدريب، وهو رقم تقول إنه استُنتج بين نقاط قياس، وتفيد أن جمع 380 عرضًا طويل الأمد استغرق من 50 إلى 100 ساعة من التحكم عن بُعد. وأشار الخط الأساسي ما بعد التدريب إلى أنه وصل في النهاية إلى نسبة نجاح 86٪ مع 2,000 عرض، وفقًا لـ Skild.
الزخم التجاري ونشر Foxconn
تذكر مشاركة نڤيديا أن Skild أقامت أكثر من 60 شراكة نشر، تشمل أعمالًا في التصنيع واللوجستيات والتفتيش والأمن وإعداد الطعام وتطبيقات أخرى.
في أرضية المصنع، تقوم Skild ونڤيديا وFoxconn بنشر نظام Skild Brain على مُتحكمات ذات ذراعين لتجميع عالي الدقة لأنظمة NVIDIA Blackwell. في أحد سير العمل المعروض، يركّب الروبوت شريط توصيل وكتلة حد، يثبت 16 مسمارًا ويتكيّف مع الاضطرابات عبر المهمة متعددة الخطوات. وتوضح مشاركة نڤيديا أن هذا العمل يتطلب حركة دقيقة، وتحكمًا مدركًا للاتصال، وتتبعًا للتسلسل، واستعادةً عندما يختلف المشهد عن الخطة.
أعلنت Skild لأول مرة عن خطة خط إنتاج Blackwell في منشور بتاريخ 19 مارس 2026 الذي كشف أيضًا عن شراكات مع ABB Robotics وUniversal Robots وMobile Industrial Robots. في ذلك الإعلان، وصفت Skild تسلسل التجميع كمهام حقيقية يؤديها البشر على خط Foxconn، تنتهي بإزالة كتلة الحد، وأشارت إلى أن دماغها تم تحسينه بدقة باستخدام كمية قليلة من بيانات الروبوت لهذا سير العمل.
البنية التحتية من نڤيديا خلف S1
وفقًا لنڤيديا، تساعد نماذج الأساس المفتوحة Cosmos الخاصة بها Skild على تنويع بيانات التدريب وتحويل الفيديو إلى أوصاف مُنظمة، بينما يُسهم Cosmos Curator في توضيح البيانات وتصفية وتنظيمها على نطاق واسع. وتوفر مكتبات NVIDIA Omniverse وإطار عمل Isaac Sim بيئات افتراضية مبنية على الفيزياء لتوليد البيانات، واختبار الحالات القصوى، والتحقق من السلوكيات قبل النشر في العالم الحقيقي.
تستخدم Skild التعلم المعزز في Isaac Lab، وهو إطار تعلم الروبوتات مفتوح ومعياري مدعوم بمحرك الفيزياء Newton، لنمذجة المعلمات الفيزيائية مثل القوى والاتصال والاصطدام والضغط وتقليل الفجوة بين المحاكاة والواقع. ومع تقدم النماذج نحو الإنتاج، تساعد أدوات NVIDIA Nsight المهندسين على اكتشاف عنق الزجاجة في الأداء أثناء التدريب، ويُحسّن مجموعة تطوير البرمجيات TensorRT عملية الاستدلال بحيث يمكن للروبوتات الاستجابة بسرعة في العالم الفيزيائي.
تعمل Skild ونڤيديا أيضًا معًا على تطوير حلول محاكاة مسرّعة بواسطة وحدات معالجة الرسوميات تُحاكي كيفية لمس الروبوتات للأجسام الصلبة وإمساكها والتعامل معها. وذكرت الشركتان أن هذه الحلول ستُتاح قريبًا لجميع المطورين كجزء من Newton.












