Партнерства
NVIDIA розкриває співпрацю Skild AI щодо фундаментальної моделі роботів S1

10 вересня 2026 р. NVIDIA докладно розповіла, як Skild AI створила свою фундаментальну модель роботів S1 на інфраструктурі NVIDIA AI, і зазначила, що компанія з робототехніки досягла річного обороту у 100 мільйонів доларів вже через 10 місяців після першого комерційного впровадження.
У пості у блозі NVIDIA компанія зазначила, що Skild створила S1 і провела фундаментальні дослідження на своїй інфраструктурі в рамках ширшої співпраці, що охоплює генерацію синтетичних даних, навчання моделей, симуляцію та реальне розгортання фізичного AI. «Навчання через досвід, а не попереднє програмування, — це переломний крок, який відбувся в робототехніці», — сказав Діпак Патхак, співзасновник і CEO Skild AI, додаючи, що NVIDIA Isaac Lab і NVIDIA Cosmos допомагають Skild створювати масштабований, різноманітний досвід, необхідний роботам для навчання в багатьох сценаріях і конфігураціях. Компанії заявили, що працюють над тим, щоб перенести адаптивний інтелект роботів з лабораторії у фабрики та інші динамічні операційні середовища.
Навчання невидимих завдань за одним відео
Skild представила S1 у дослідницькому пості від 18 серпня 2026, описавши її як робототехнічну фундаментальну модель, створену з нуля як навчальник у контексті. Модель приймає відео‑демонстрацію завдання як вхід і виконує його без оновлення ваг або проходження специфічного післянавчання. Skild описує S1 як першу робототехнічну фундаментальну модель, що демонструє навчання у контексті на довготривалих завданнях, тривалістю до 10 хвилин, які ніколи не були бачені під час передтренування.
Оператор записує відео бажаного завдання і подає його моделі як підказку. Модель інтерпретує продемонстровану мету, об’єкти та послідовність, потім перетворює їх у дії для стоячого перед нею робота без додаткового навчання, часто для завдання, яке не входить до набору даних передтренування. За словами обох компаній, S1 може виконувати незнайомі завдання, включаючи посадку рослин у горщики, приготування млинців, приготування кави методом pour‑over та збірку комплектів, роботу, що охоплює десятки кроків маніпуляції та вимагає складання навичок у послідовностях, які модель раніше не виконувала.
У одному тесті з посадки рослин у горщик, задокументованому у дослідницькому пості Skild, грунт, горщик, лійка та рослина прибули до офісу о 8:54 PM, запис розпочався о 9:16 PM, одна егоцентрична відеодемонстрація людини була зафіксована о 9:22 PM, і S1 почала автономно виконувати завдання на апаратурі о 9:27 PM. Skild зазначає, що час від демонстрації до автономного виконання склав 11 хвилин.
Skild повідомляє, що S1 може коригуватися, коли об’єкти переміщуються під час завдання, відновлювати роботу після помилок і замінювати об’єкти з подібною функціональністю, у одному випадку використавши чашку води, коли у демонстрації був лійка. Компанія також зазначає, що модель іноді покращує недосконалі демонстрації, сприймаючи їх як специфікацію мети, а не як траєкторію для відтворення.
Звітні результати проти політик, які задаються мовними підказками
У пості NVIDIA зазначається, що в тестах Skild на нових багатокрокових завданнях S1 досягала успіху приблизно в 66 % випадків на кожному кроці, у порівнянні з 9 % у подібної AI‑системи, що, за словами NVIDIA, є покращенням більш ніж у сім разів. Дослідницький пост Skild описує порівняння як контрольоване дослідження проти мовно‑підказуваної політики VLA, яка отримує специфікацію завдання мовою, а не через демонстрацію. Обидві політики були навчені на ідентичних даних, архітектурах та обчислювальних ресурсах на наборах даних передтренування від 1 000 до 100 000 годин, і показники 66 % та 9 % були зафіксовані при 100 000 годинах на невідомих довготривалих завданнях, згідно зі Skild.
Для завдань, які були присутні під час передтренування, Skild повідомляє, що навчання у контексті досягло 96 % успішності при найбільшому масштабі, тоді як при 1 000 годинах мовно‑умовна політика отримала 53 % проти 43 % у навчанні у контексті. Skild також оцінювала стійкість за п’ятьма рівнями зсуву розподілу, повідомляючи, що в найсерйознішій умові, коли половину дій робота доводиться виконувати протилежною рукою, мовно‑підказувана політика погіршилася до трьох разів більше, ніж політика у контексті.
Щодо ефективності демонстрацій, Skild оцінює, що одне відео у контексті приблизно відповідає 380 післятренувальним епізодам, цифра, яку, за їх словами, інтерполювали між виміряними точками, і повідомляє, що збір 380 довготривалих демонстрацій зайняв від 50 до 100 годин телеперетворення. Базова модель після тренування зрештою досягла 86 % успішності при 2 000 демонстраціях, згідно зі Skild.
Комерційний успіх та впровадження у Foxconn
У пості NVIDIA зазначається, що Skild створила понад 60 партнерств з розгортанням, охоплюючи виробництво, логістику, інспекцію, безпеку, приготування їжі та інші застосування.
На виробничій лінії Skild, NVIDIA та Foxconn розгортають Skild Brain на двохманіпуляторних маніпуляторах для високоточних збірок систем NVIDIA Blackwell. У одній продемонстрованій робочій послідовності робот встановлює шинну смугу та обмежувальний блок, закручує 16 гвинтів і адаптується до збурень протягом багатокрокового завдання. У пості NVIDIA зазначається, що ця робота вимагає точного руху, управління з урахуванням контакту, відстеження послідовності та відновлення, коли сцена відрізняється від плану.
Skild вперше оголосила про план виробничої лінії Blackwell у пості від 19 березня 2026, який також розкрив партнерства з ABB Robotics, Universal Robots та Mobile Industrial Robots. У цьому оголошенні Skild описала послідовність збірки як реальне завдання, виконане людьми на лінії Foxconn, завершуючись видаленням обмежувального блоку, і зазначила, що її мозок був доопрацьований за допомогою невеликої кількості даних роботів для цього робочого процесу.
Стек NVIDIA, що стоїть за S1
За словами NVIDIA, її відкриті фундаментальні моделі Cosmos допомагають Skild диверсифікувати навчальні дані та перетворювати відео у структуровані описи, тоді як Cosmos Curator допомагає масштабно анотувати, фільтрувати та організовувати дані. Бібліотеки NVIDIA Omniverse та фреймворк Isaac Sim забезпечують фізично обґрунтовані віртуальні середовища для генерації даних, тестування крайових випадків та валідації поведінки перед реальним розгортанням.
Skild використовує підкріплювальне навчання в Isaac Lab, відкритій модульній платформі навчання роботів, що працює на фізичному движку Newton, для моделювання фізичних параметрів, таких як сили, контакти, зіткнення та тиск, і зменшення розриву між симуляцією та реальністю. Коли моделі переходять до виробництва, інструменти NVIDIA Nsight допомагають інженерам виявляти вузькі місця продуктивності під час навчання, а набір розробки TensorRT оптимізує інференс, щоб роботи могли швидко реагувати у фізичному світі.
Skild та NVIDIA також спільно розробляють прискорені графічним процесором симуляційні розв’язувачі, які моделюють, як роботи фізично торкаються, захоплюють і маніпулюють твердими об’єктами. Компанії зазначили, що розв’язувачі незабаром будуть доступні всім розробникам у складі Newton.












