Партнёрства
NVIDIA раскрывает детали сотрудничества Skild AI над фундаментальной моделью робота S1

10 сентября 2026 года NVIDIA подробно рассказала, как Skild AI построила свою фундаментальную модель робота S1 на инфраструктуре NVIDIA AI, и сообщила, что робототехническая компания достигла годового дохода в 100 млн долларов уже через 10 месяцев после первой коммерческой эксплуатации.
В посте блога NVIDIA компания заявила, что Skild создала S1 и провела фундаментальные исследования на её инфраструктуре в рамках более широкого сотрудничества, охватывающего генерацию синтетических данных, обучение моделей, симуляцию и внедрение физического ИИ в реальном мире. «Обучение через опыт, а не предзапрограммирование, — это качественный скачок, произошедший в робототехнике», — сказал Дипак Патхак, соучредитель и генеральный директор Skild AI, добавив, что NVIDIA Isaac Lab и NVIDIA Cosmos помогают Skild создавать масштабируемый и разнообразный опыт, необходимый роботам для обучения в многочисленных сценариях и воплощениях. Компании заявили, что работают над тем, чтобы перенести адаптивный интеллект роботов из лаборатории в заводы и другие динамичные эксплуатационные среды.
Обучение невидимым задачам по одному видео
Skild представила S1 в исследовательском посте от 18 августа 2026 года, описав её как робототехническую фундаментальную модель, построенную с нуля как обучающийся в контексте. Модель принимает в качестве входных данных видеодемонстрацию задачи и исполняет её без обновления весов и без последующего обучения, специфичного для задачи. Skild характеризует S1 как первую робототехническую фундаментальную модель, демонстрирующую обучение в контексте на длительных задачах (до 10 минут), которые никогда не встречались во время предобучения.
Оператор записывает видео желаемой задачи и подаёт его модели в качестве подсказки. Модель интерпретирует продемонстрированные намерения, объекты и последовательность, затем преобразует их в действия для стоящего перед ней робота без повторного обучения, часто для задачи, не представленной в её наборе данных предобучения. По словам обеих компаний, S1 способна выполнять незнакомые задачи, включая высадку растений в горшки, приготовление блинчиков, заваривание кофе методом pour‑over и сборку наборов — работа, охватывающая десятки манипуляционных шагов и требующая комбинирования навыков в последовательностях, которых модель ранее не выполняла.
В одном тесте по высадке растений, зафиксированном в исследовательском посте Skild, почва, горшок, лейка и растение прибыли в офис в 8:54, запись началась в 9:16, одна эгоцентричная видеодемонстрация человека была снята в 9:22, и S1 начала автономно выполнять задачу на аппаратуре в 9:27. Skild указывает, что время от демонстрации до автономного выполнения составило 11 минут.
Skild сообщает, что S1 может корректировать действия, когда объекты перемещаются в процессе задачи, восстанавливать работу после ошибок и заменять объекты с аналогичной функцией, в одном случае используя стакан воды вместо лейки, показанной в демонстрации. Компания также отмечает, что модель иногда улучшает результаты по сравнению с ошибочными демонстрациями, рассматривая их как спецификацию цели, а не как траекторию для воспроизведения.
Сообщённые результаты против политик, управляемых языковыми подсказками
В посте NVIDIA сообщается, что в тестах Skild на новых многократных задачах S1 достигала успеха примерно в 66 % случаев на каждом этапе, по сравнению с 9 % у аналогичной ИИ‑системы, что NVIDIA охарактеризовала как более чем семикратное улучшение. Исследовательский пост Skild описывает сравнение как контролируемое исследование против языковой подсказки VLA‑policy, получающей спецификацию задачи в виде текста, а не демонстрации. Обе политики обучались на одинаковых данных, архитектурах и вычислительных ресурсах с предобучающими наборами от 1 000 до 100 000 часов, а показатели 66 % и 9 % были зафиксированы при 100 000 часах на невидимых длительных задачах, согласно Skild.
Для задач, встречавшихся в процессе предобучения, Skild сообщает, что обучение в контексте достигло 96 % успеха при максимальном масштабе, тогда как при 1 000 часах языковая политика набрала 53 % против 43 % для обучения в контексте. Skild также оценивала надёжность на пяти уровнях смещения распределения, отмечая, что в самом тяжёлом случае, когда половина действий робота должна выполняться противоположной рукой, политика, управляемая языковой подсказкой, деградировала в три раза сильнее, чем политика обучения в контексте.
Что касается эффективности демонстраций, Skild оценивает, что одно видео в контексте примерно соответствует 380 эпизодам пост‑обучения; эта цифра, по её словам, получена интерполяцией между измеренными точками, и компания сообщает, что сбор 380 длительных демонстраций занял от 50 до 100 часов телеприсутствия. По словам Skild, базовая модель после пост‑обучения в конечном итоге достигла 86 % успеха при 2 000 демонстрациях.
Коммерческий успех и внедрение Foxconn
В посте NVIDIA говорится, что Skild наладила более 60 партнёрств по внедрению, охватывающих производство, логистику, инспекцию, безопасность, приготовление пищи и другие области.
На заводском этаже Skild, NVIDIA и Foxconn внедряют Skild Brain на двухруких манипуляторах для высокоточной сборки систем NVIDIA Blackwell. В одной продемонстрированной последовательности робот устанавливает шину питания и ограничительный блок, закручивает 16 винтов и адаптируется к возмущениям в процессе многократных шагов. По данным поста NVIDIA, работа требует точного движения, контроля контактов, отслеживания последовательности и восстановления при отклонении сцены от плана.
Skild впервые объявила о планах производства Blackwell в посте от 19 марта 2026 года, где также раскрыла партнёрства с ABB Robotics, Universal Robots и Mobile Industrial Robots. В этом объявлении Skild описала последовательность сборки как реальную задачу, выполняемую людьми на линии Foxconn, завершающуюся снятием ограничительного блока, и заявила, что её «мозг» был доработан с помощью небольшого объёма данных роботов для данного рабочего процесса.
Стек NVIDIA, лежащий в основе S1
По словам NVIDIA, её открытые фундаментальные модели Cosmos помогают Skild разнообразить обучающие данные и преобразовывать видео в структурированные описания, в то время как Cosmos Curator помогает аннотировать, фильтровать и упорядочивать данные в больших объёмах. Библиотеки NVIDIA Omniverse и фреймворк Isaac Sim предоставляют физически обоснованные виртуальные среды для генерации данных, тестирования граничных случаев и валидации поведения до реального внедрения.
Skild использует обучение с подкреплением в Isaac Lab, открытой модульной платформе обучения роботов, работающей на физическом движке Newton, для моделирования физических параметров, таких как силы, контакты, столкновения и давление, и снижения разрыва между симуляцией и реальностью. По мере перехода моделей к производству инструменты NVIDIA Nsight помогают инженерам выявлять узкие места производительности во время обучения, а набор средств разработки TensorRT оптимизирует вывод, позволяя роботам быстро реагировать в физическом мире.
Skild и NVIDIA также совместно разрабатывают ускоренные графическим процессором симуляционные решатели, моделирующие, как роботы физически касаются, захватывают и манипулируют твёрдыми объектами. Компании заявили, что эти решатели вскоре будут доступны всем разработчикам в рамках Newton.












