Партнёрства

NVIDIA раскрывает детали сотрудничества Skild AI над фундаментальной моделью робота S1

mm
Добавьте Unite.AI в избранные источники в Google

10 сентября 2026 года NVIDIA подробно рассказала, как Skild AI построила свою фундаментальную модель робота S1 на инфраструктуре NVIDIA AI, и сообщила, что робототехническая компания достигла годового дохода в 100 млн долларов уже через 10 месяцев после первой коммерческой эксплуатации.

В посте блога NVIDIA компания заявила, что Skild создала S1 и провела фундаментальные исследования на её инфраструктуре в рамках более широкого сотрудничества, охватывающего генерацию синтетических данных, обучение моделей, симуляцию и внедрение физического ИИ в реальном мире. «Обучение через опыт, а не предзапрограммирование, — это качественный скачок, произошедший в робототехнике», — сказал Дипак Патхак, соучредитель и генеральный директор Skild AI, добавив, что NVIDIA Isaac Lab и NVIDIA Cosmos помогают Skild создавать масштабируемый и разнообразный опыт, необходимый роботам для обучения в многочисленных сценариях и воплощениях. Компании заявили, что работают над тем, чтобы перенести адаптивный интеллект роботов из лаборатории в заводы и другие динамичные эксплуатационные среды.

Обучение невидимым задачам по одному видео

Skild представила S1 в исследовательском посте от 18 августа 2026 года, описав её как робототехническую фундаментальную модель, построенную с нуля как обучающийся в контексте. Модель принимает в качестве входных данных видеодемонстрацию задачи и исполняет её без обновления весов и без последующего обучения, специфичного для задачи. Skild характеризует S1 как первую робототехническую фундаментальную модель, демонстрирующую обучение в контексте на длительных задачах (до 10 минут), которые никогда не встречались во время предобучения.

Оператор записывает видео желаемой задачи и подаёт его модели в качестве подсказки. Модель интерпретирует продемонстрированные намерения, объекты и последовательность, затем преобразует их в действия для стоящего перед ней робота без повторного обучения, часто для задачи, не представленной в её наборе данных предобучения. По словам обеих компаний, S1 способна выполнять незнакомые задачи, включая высадку растений в горшки, приготовление блинчиков, заваривание кофе методом pour‑over и сборку наборов — работа, охватывающая десятки манипуляционных шагов и требующая комбинирования навыков в последовательностях, которых модель ранее не выполняла.

В одном тесте по высадке растений, зафиксированном в исследовательском посте Skild, почва, горшок, лейка и растение прибыли в офис в 8:54, запись началась в 9:16, одна эгоцентричная видеодемонстрация человека была снята в 9:22, и S1 начала автономно выполнять задачу на аппаратуре в 9:27. Skild указывает, что время от демонстрации до автономного выполнения составило 11 минут.

Skild сообщает, что S1 может корректировать действия, когда объекты перемещаются в процессе задачи, восстанавливать работу после ошибок и заменять объекты с аналогичной функцией, в одном случае используя стакан воды вместо лейки, показанной в демонстрации. Компания также отмечает, что модель иногда улучшает результаты по сравнению с ошибочными демонстрациями, рассматривая их как спецификацию цели, а не как траекторию для воспроизведения.

Сообщённые результаты против политик, управляемых языковыми подсказками

В посте NVIDIA сообщается, что в тестах Skild на новых многократных задачах S1 достигала успеха примерно в 66 % случаев на каждом этапе, по сравнению с 9 % у аналогичной ИИ‑системы, что NVIDIA охарактеризовала как более чем семикратное улучшение. Исследовательский пост Skild описывает сравнение как контролируемое исследование против языковой подсказки VLA‑policy, получающей спецификацию задачи в виде текста, а не демонстрации. Обе политики обучались на одинаковых данных, архитектурах и вычислительных ресурсах с предобучающими наборами от 1 000 до 100 000 часов, а показатели 66 % и 9 % были зафиксированы при 100 000 часах на невидимых длительных задачах, согласно Skild.

Для задач, встречавшихся в процессе предобучения, Skild сообщает, что обучение в контексте достигло 96 % успеха при максимальном масштабе, тогда как при 1 000 часах языковая политика набрала 53 % против 43 % для обучения в контексте. Skild также оценивала надёжность на пяти уровнях смещения распределения, отмечая, что в самом тяжёлом случае, когда половина действий робота должна выполняться противоположной рукой, политика, управляемая языковой подсказкой, деградировала в три раза сильнее, чем политика обучения в контексте.

Что касается эффективности демонстраций, Skild оценивает, что одно видео в контексте примерно соответствует 380 эпизодам пост‑обучения; эта цифра, по её словам, получена интерполяцией между измеренными точками, и компания сообщает, что сбор 380 длительных демонстраций занял от 50 до 100 часов телеприсутствия. По словам Skild, базовая модель после пост‑обучения в конечном итоге достигла 86 % успеха при 2 000 демонстрациях.

Коммерческий успех и внедрение Foxconn

В посте NVIDIA говорится, что Skild наладила более 60 партнёрств по внедрению, охватывающих производство, логистику, инспекцию, безопасность, приготовление пищи и другие области.

На заводском этаже Skild, NVIDIA и Foxconn внедряют Skild Brain на двухруких манипуляторах для высокоточной сборки систем NVIDIA Blackwell. В одной продемонстрированной последовательности робот устанавливает шину питания и ограничительный блок, закручивает 16 винтов и адаптируется к возмущениям в процессе многократных шагов. По данным поста NVIDIA, работа требует точного движения, контроля контактов, отслеживания последовательности и восстановления при отклонении сцены от плана.

Skild впервые объявила о планах производства Blackwell в посте от 19 марта 2026 года, где также раскрыла партнёрства с ABB Robotics, Universal Robots и Mobile Industrial Robots. В этом объявлении Skild описала последовательность сборки как реальную задачу, выполняемую людьми на линии Foxconn, завершающуюся снятием ограничительного блока, и заявила, что её «мозг» был доработан с помощью небольшого объёма данных роботов для данного рабочего процесса.

Стек NVIDIA, лежащий в основе S1

По словам NVIDIA, её открытые фундаментальные модели Cosmos помогают Skild разнообразить обучающие данные и преобразовывать видео в структурированные описания, в то время как Cosmos Curator помогает аннотировать, фильтровать и упорядочивать данные в больших объёмах. Библиотеки NVIDIA Omniverse и фреймворк Isaac Sim предоставляют физически обоснованные виртуальные среды для генерации данных, тестирования граничных случаев и валидации поведения до реального внедрения.

Skild использует обучение с подкреплением в Isaac Lab, открытой модульной платформе обучения роботов, работающей на физическом движке Newton, для моделирования физических параметров, таких как силы, контакты, столкновения и давление, и снижения разрыва между симуляцией и реальностью. По мере перехода моделей к производству инструменты NVIDIA Nsight помогают инженерам выявлять узкие места производительности во время обучения, а набор средств разработки TensorRT оптимизирует вывод, позволяя роботам быстро реагировать в физическом мире.

Skild и NVIDIA также совместно разрабатывают ускоренные графическим процессором симуляционные решатели, моделирующие, как роботы физически касаются, захватывают и манипулируют твёрдыми объектами. Компании заявили, что эти решатели вскоре будут доступны всем разработчикам в рамках Newton.

Орион Сато - это корреспондент, сгенерированный ИИ, который фокусируется на робототехнике, автоматизации и интеллектуальных машинах. Его статьи исследуют, как достижения в робототехнике меняют производство, логистику, здравоохранение и повседневную жизнь посредством все более автономных систем.
С технической и ориентированной на выполнение точки зрения, Орион анализирует робототехнические архитектуры, слияние датчиков, системы управления и слияние ИИ с механической интеллектом. Он особенно интересуется тем, как автоматизация переходит из контролируемых сред в реальное внедрение, где надежность, безопасность и эффективность имеют наибольшее значение.
Статьи, написанные Орионом Сато, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и соответствие редакционным стандартам.