Partnerskap
NVIDIA redovisar Skild AI‑samarbetet bakom S1‑robotens grundmodell

NVIDIA redogjorde den 10 september 2026 för hur Skild AI byggde sin S1‑robotgrundmodell på NVIDIAs AI‑infrastruktur och meddelade att robotikföretaget nådde en årlig intäktsnivå på 100 miljoner dollar tio månader efter sin första kommersiella lansering.
I NVIDIAs blogginlägg sade företaget att Skild byggde S1 och utförde den underliggande forskningen på sin infrastruktur som en del av ett bredare samarbete som omfattar syntetisk datagenerering, modellträning, simulering och verklig fysisk AI‑implementering. ”Att lära sig genom erfarenhet, och inte genom förprogrammering, är den omvälvning som har skett inom robotik,” sade Deepak Pathak, medgrundare och VD för Skild AI, och tillade att NVIDIA Isaac Lab och NVIDIA Cosmos hjälper Skild att skapa den skalbara, mångsidiga upplevelse som deras robotar behöver för att lära sig över många scenarier och embodiment. Företagen uppgav att de arbetar för att föra anpassningsbar robotintelligens från laboratoriet till fabriker och andra dynamiska driftsmiljöer.
Lära sig osedda uppgifter från en video
Skild presenterade S1 i ett forskningsinlägg den 18 augusti 2026, där de beskrev den som en robotgrundmodell byggd från grunden som en in‑kontext‑lärande modell. Modellen tar en videodemonstration av en uppgift som indata och utför den utan att uppdatera sina vikter eller genomgå uppgifts‑specifik efterträning. Skild beskriver S1 som den första robotgrundmodellen som visar in‑kontext‑inlärning på långsiktiga uppgifter, med körning upp till 10 minuter, som aldrig setts under förträning.
En operatör spelar in en video av den önskade uppgiften och ger den till modellen som en prompt. Modellen tolkar den demonstrerade avsikten, objekten och sekvensen och översätter dem till handlingar för roboten framför den, utan någon om‑träning, och ofta för en uppgift som inte täcks av dess förträningsdatamängd. Enligt båda företagen kan S1 utföra okända uppgifter såsom plantering, pannkaksbakning, bryggning av pour‑over‑kaffe och montering av kit, arbete som omfattar dussintals manipuleringssteg och kräver sammansatta färdigheter i sekvenser som modellen tidigare inte utfört.
I ett plantningsprov som loggades i Skilds forskningsinlägg anlände jord, en kruka, en vattenkanna och en växt till kontoret kl 20:54, inspelningen startade kl 21:16, en egocentrisk mänsklig videodemonstration spelades in kl 21:22, och S1 började utföra uppgiften autonomt på hårdvara kl 21:27. Skild uppger att tiden från demonstration till autonom utförande var 11 minuter.
Skild rapporterar att S1 kan anpassa sig när objekt flyttas mitt i en uppgift, återhämta sig från fel och ersätta objekt med motsvarande funktion, i ett fall genom att använda en kopp vatten när demonstrationen visade en vattenkanna. Företaget rapporterar också att modellen ibland förbättrar bristfälliga demonstrationer genom att betrakta demonstrationen som en specifikation av målet snarare än en bana att reproducera.
Rapporterade resultat mot språk‑promptade policyer
NVIDIAs inlägg rapporterar att i Skilds tester på nya, flerstegsuppgifter lyckades S1 ungefär 66 % av gångerna på varje steg, jämfört med 9 % för ett liknande AI‑system, ett gap som NVIDIA beskrev som en mer än sjusidig förbättring. Skilds forskningsinlägg beskriver jämförelsen som en kontrollerad studie mot en språk‑promptad VLA‑policy, som får sin uppgiftsspecifikation i språk snarare än genom demonstration. Båda policyerna tränades på identiska data, arkitekturer och beräkningsresurser över förträningsdatamängder från 1 000 till 100 000 timmar, och siffrorna 66 % och 9 % registrerades vid 100 000 timmar på osedda långsiktiga uppgifter, enligt Skild.
För uppgifter som sågs under förträning rapporterar Skild att in‑kontext‑inlärning nådde 96 % framgång på den största skalan, medan vid 1 000 timmar fick den språk‑styrda policyn 53 % jämfört med 43 % för in‑kontext‑inlärning. Skild utvärderade också robusthet över fem nivåer av distributionsskifte och rapporterade att under den mest extrema förhållandet, där hälften av robotens handlingar måste utföras med motsatt arm, försämrades den språk‑promptade policyn upp till tre gånger mer än in‑kontext‑policyn.
När det gäller demonstrations‑effektivitet uppskattar Skild att en enskild in‑kontext‑video motsvarar ungefär 380 efter‑tränings‑episoder, ett tal som de säger har interpolerats mellan uppmätta punkter, och rapporterar att insamling av 380 långsiktiga demonstrationer tog 50 till 100 timmar av teleoperation. Den efter‑tränade baslinjen nådde så småningom 86 % framgång med 2 000 demonstrationer, enligt Skild.
Komersiell genomslag och Foxconn‑implementeringen
NVIDIAs inlägg uppger att Skild har etablerat mer än 60 implementeringspartnerskap, med arbete som sträcker sig över tillverkning, logistik, inspektion, säkerhet, livsmedelsberedning och andra tillämpningar.
På fabriksgolvet implementerar Skild, NVIDIA och Foxconn Skild Brain på tvåarmade manipulatorer för högprecisionsmontering av NVIDIA Blackwell‑system. I ett demonstrerat arbetsflöde installerar en robot en bussstång och ett begränsningsblock, fäster 16 skruvar och anpassar sig till störningar under den flerstegsuppgift. NVIDIAs inlägg konstaterar att arbetet kräver exakt rörelse, kontakt‑medveten styrning, sekvensspårning och återhämtning när scenen avviker från planen.
Skild presenterade först Blackwell‑produktionslinjeplanen i ett inlägg den 19 mars 2026 som också avslöjade partnerskap med ABB Robotics, Universal Robots och Mobile Industrial Robots. I det meddelandet beskrev Skild monteringssekvensen som en verklig uppgift som utfördes av människor på en Foxconn‑linje, avslutad med borttagning av begränsningsblocket, och uppgav att dess hjärna finjusterades med en liten mängd robotdata för arbetsflödet.
NVIDIAs stack bakom S1
Enligt NVIDIA hjälper dess Cosmos‑öppna‑värld‑grundmodeller Skild att diversifiera träningsdata och omvandla video till strukturerade beskrivningar, medan Cosmos Curator hjälper till att annotera, filtrera och organisera data i stor skala. NVIDIAs Omniverse‑bibliotek och Isaac Sim‑ramverk erbjuder fysiskt baserade virtuella miljöer för att generera data, testa kantfall och validera beteenden innan verklig implementering.
Skild använder förstärkningsinlärning i Isaac Lab, ett öppet modulärt robotlärningsramverk drivet av Newton‑fysikmotorn, för att modellera fysiska parametrar såsom krafter, kontakt, kollision och tryck och minska gapet mellan simulering och verklighet. När modeller närmar sig produktion hjälper NVIDIAs Nsight‑verktyg ingenjörer att hitta prestandaflaskhalsar under träning, och TensorRT‑programvaruutvecklingspaketet optimerar inferens så att robotar kan svara snabbt i den fysiska världen.
Skild och NVIDIA utvecklar också gemensamt GPU‑accelererade simulationslösare som modellerar hur robotar fysiskt rör vid, greppar och manipulerar fasta föremål. Företagen uppgav att lösarna snart kommer att göras tillgängliga för alla utvecklare som en del av Newton.












