Parteneriate
NVIDIA detaliază colaborarea cu Skild AI în spatele modelului de bază pentru roboți S1

NVIDIA, pe 10 septembrie 2026, a detaliat modul în care Skild AI și-a construit modelul de bază pentru robotul S1 pe infrastructura AI de la NVIDIA și a declarat că compania de robotică a atins o rată de venit anual de 100 de milioane de dolari la 10 luni după prima sa implementare comercială.
În postarea de pe blogul NVIDIA, compania a afirmat că Skild a construit S1 și a realizat cercetarea de bază pe infrastructura sa, ca parte a unei colaborări mai ample care cuprinde generarea de date sintetice, antrenarea modelelor, simularea și implementarea AI fizic în lumea reală. „Învățarea prin experiență, și nu prin preprogramare, reprezintă schimbarea de paradigmă care a avut loc în robotică”, a declarat Deepak Pathak, cofondator și CEO al Skild AI, adăugând că NVIDIA Isaac Lab și NVIDIA Cosmos ajută Skild să creeze experiența scalabilă și diversă de care roboții săi au nevoie pentru a învăța în numeroase scenarii și întruchipări. Companiile au spus că lucrează pentru a transfera inteligența robotică adaptabilă din laborator în fabrici și alte medii de operare dinamice.
Învățarea sarcinilor nevăzute dintr-un singur video
Skild a prezentat S1 într-o postare de cercetare din 18 august 2026, descriindu-l ca un model de bază robotic construit de la zero ca un învățător în context. Modelul primește ca intrare o demonstrație video a unei sarcini și o execută fără a-și actualiza greutățile sau a suferi antrenament post-specific sarcinii. Skild descrie S1 ca fiind primul model de bază pentru robotică care demonstrează învățare în context pe sarcini cu orizont lung, de până la 10 minute, care nu au fost niciodată văzute în timpul pre-antrenamentului.
Un operator înregistrează un video al sarcinii dorite și îl furnizează modelului ca prompt. Modelul interpretează intenția demonstrată, obiectele și secvența, apoi le transformă în acțiuni pentru robotul aflat în fața lui, fără reantrenare, și adesea pentru o sarcină neacoperită de setul său de date de pre-antrenament. Conform ambelor companii, S1 poate executa sarcini necunoscute, inclusiv plantarea în ghiveci, prepararea clătitelor, prepararea cafelei prin turnare și asamblarea de kituri, activități ce cuprind zeci de pași de manipulare și necesită compunerea de abilități în secvențe pe care modelul nu le-a efectuat anterior.
Într-un test de plantare în ghiveci înregistrat în postarea de cercetare a Skild, solul, un ghiveci, un stropitor și o plantă au ajuns la birou la ora 8:54 PM, înregistrarea a început la 9:16 PM, o demonstrație video egocentrică a unui om a fost înregistrată la 9:22 PM, iar S1 a început să execute sarcina autonom pe hardware la 9:27 PM. Skild afirmă că timpul de la demonstrație la execuție autonomă a fost de 11 minute.
Skild raportează că S1 poate ajusta când obiectele sunt mutate în timpul sarcinii, se poate recupera din erori și poate înlocui obiecte cu aceeași affordanță, într-un caz utilizând un pahar cu apă când demonstrația arăta un stropitor. Compania mai raportează că modelul uneori îmbunătățește demonstrațiile defectuoase, tratând demonstrația ca o specificație a obiectivului mai degrabă decât ca o traiectorie de reprodus.
Rezultate raportate în comparație cu politicile bazate pe limbaj
Postarea NVIDIA raportează că în testele Skild pe sarcini noi, cu mai mulți pași, S1 a reușit în aproximativ 66% din cazuri la fiecare pas, comparativ cu 9% pentru un sistem AI similar, o diferență pe care NVIDIA a caracterizat-o ca o îmbunătățire de peste șapte ori. Postarea de cercetare a Skild descrie comparația ca un studiu controlat împotriva unei politici VLA bazate pe limbaj, care primește specificația sarcinii în limbaj în loc de demonstrație. Ambele politici au fost antrenate pe date, arhitecturi și calcul identice pe seturi de date de pre-antrenament de la 1.000 la 100.000 de ore, iar valorile de 66% și 9% au fost înregistrate la 100.000 de ore pe sarcini cu orizont lung nevăzute, conform Skild.
În sarcinile văzute în timpul pre-antrenamentului, Skild raportează că învățarea în context a atins un succes de 96% la cea mai mare scară, în timp ce la 1.000 de ore politica condiționată de limbaj a obținut 53% comparativ cu 43% pentru învățarea în context. Skild a evaluat, de asemenea, robustețea pe cinci niveluri de schimbare a distribuției, raportând că în cea mai severă condiție, în care jumătate din acțiunile robotului trebuie executate cu brațul opus, politica bazată pe limbaj s-a degradat de până la trei ori mai mult decât politica în context.
În ceea ce privește eficiența demonstrațiilor, Skild estimează că un singur video în context echivalează aproximativ cu 380 de episoade post-antrenament, o cifră pe care spune că a fost interpolată între punctele măsurate, și raportează că colectarea a 380 de demonstrații cu orizont lung a necesitat între 50 și 100 de ore de teleoperare. Linia de bază post-antrenată a atins în cele din urmă un succes de 86% cu 2.000 de demonstrații, conform Skild.
Tracțiune comercială și implementarea la Foxconn
Postarea NVIDIA afirmă că Skild a încheiat peste 60 de parteneriate de implementare, cu activități ce acoperă producția, logistica, inspecția, securitatea, prepararea alimentelor și alte aplicații.
Pe linia de producție, Skild, NVIDIA și Foxconn implementează Skild Brain pe manipulatoare cu două brațe pentru asamblarea de înaltă precizie a sistemelor NVIDIA Blackwell. Într-un flux de lucru demonstrat, un robot montează o bară de alimentare și un bloc limită, strânge 16 șuruburi și se adaptează la perturbări pe parcursul sarcinii cu mai mulți pași. Postarea NVIDIA precizează că munca necesită mișcare precisă, control conștient de contact, urmărirea secvenței și recuperare atunci când scena diferă de plan.
Skild a anunțat pentru prima dată planul de linie de producție Blackwell într-o postare din 19 martie 2026 care a dezvăluit, de asemenea, parteneriate cu ABB Robotics, Universal Robots și Mobile Industrial Robots. În acel anunț, Skild a descris secvența de asamblare ca o sarcină reală efectuată de oameni pe o linie Foxconn, încheindu-se cu îndepărtarea blocului limită, și a precizat că creierul său a fost ajustat fin cu o cantitate mică de date robotice pentru fluxul de lucru.
Stiva NVIDIA din spatele S1
Conform NVIDIA, modelele sale de bază Cosmos open world ajută Skild să diversifice datele de antrenament și să transforme video în descrieri structurate, în timp ce Cosmos Curator ajută la etichetarea, filtrarea și organizarea datelor la scară largă. Bibliotecile NVIDIA Omniverse și cadrul Isaac Sim furnizează medii virtuale bazate pe fizică pentru generarea de date, testarea cazurilor limită și validarea comportamentelor înainte de implementarea în lumea reală.
Skild folosește învățarea prin consolidare în Isaac Lab, un cadru de învățare robotică modular și deschis, alimentat de motorul fizic Newton, pentru a modela parametri fizici precum forțele, contactul, coliziunea și presiunea și pentru a reduce decalajul dintre simulare și realitate. Pe măsură ce modelele avansează spre producție, instrumentele NVIDIA Nsight ajută inginerii să identifice blocajele de performanță în timpul antrenamentului, iar kitul de dezvoltare software TensorRT optimizează inferența astfel încât roboții să poată răspunde rapid în lumea fizică.
Skild și NVIDIA dezvoltă, de asemenea, în comun soluții de simulare accelerate prin GPU care modelează modul în care roboții ating, apucă și manipulează obiecte solide din punct de vedere fizic. Companiile au declarat că aceste soluții vor fi în curând disponibile pentru toți dezvoltatorii ca parte a Newton.












