Partnerskaber
NVIDIA uddyber Skild AI‑samarbejde bag S1‑robotfundamentmodel

NVIDIA detaljerede den 10. september 2026, hvordan Skild AI byggede sin S1‑robotfundamentmodel på NVIDIA AI‑infrastruktur, og oplyste, at robotikvirksomheden nåede en årlig omsætningsrate på $100 millioner 10 måneder efter sin første kommercielle implementering.
I NVIDIA‑blogindlægget sagde virksomheden, at Skild byggede S1 og udførte den underliggende forskning på sin infrastruktur som en del af et bredere samarbejde, der spænder over syntetisk datagenerering, modeltræning, simulering og fysisk AI‑implementering i den virkelige verden. “Læring gennem erfaring, og ikke forudprogrammering, er det skridtskifte, der er sket inden for robotik,” sagde Deepak Pathak, medstifter og administrerende direktør for Skild AI, og tilføjede, at NVIDIA Isaac Lab og NVIDIA Cosmos hjælper Skild med at skabe den skalerbare, mangfoldige erfaring, som deres robotter har brug for at lære på tværs af mange scenarier og embodimenter. Virksomhederne sagde, at de arbejder på at flytte tilpasningsdygtig robotintelligens fra laboratoriet til fabrikker og andre dynamiske driftsmiljøer.
Læring af usete opgaver fra én video
Skild introducerede S1 i et august‑18‑2026 forskningsindlæg, hvor de beskrev den som en robotisk fundamentmodel bygget fra bunden som en in‑context‑learner. Modellen tager en video‑demonstration af en opgave som input og udfører den uden at opdatere sine vægte eller gennemgå opgave‑specifik efter‑træning. Skild beskriver S1 som den første robotfundamentmodel, der viser in‑context‑learning på lang‑horisont‑opgaver, som kan vare op til 10 minutter, og som aldrig er set under fortræning.
En operatør optager en video af den ønskede opgave og giver den til modellen som en prompt. Modellen fortolker den demonstrerede intention, objekter og sekvens, og kortlægger dem til handlinger for robotten foran den, uden gen‑træning, ofte for en opgave som ikke er dækket af dens fortrænings‑datasæt. Ifølge begge virksomheder kan S1 udføre ukendte opgaver inklusive potteplantning, pandekagebagning, pour‑over kaffebrygning og samling af kits, arbejde der omfatter dusinvis af manipulations‑trin og kræver sammensatte færdigheder i sekvenser, som modellen ikke tidligere har udført.
I en potteplantningstest, der er logget i Skilds forskningsindlæg, ankom jord, en potte, en vandkande og en plante til kontoret kl. 8:54 PM, optagelsen startede kl. 9:16 PM, en egocentrisk menneskelig video‑demonstration blev optaget kl. 9:22 PM, og S1 begyndte at udføre opgaven autonomt på hardware kl. 9:27 PM. Skild angiver, at tiden fra demonstration til autonom udførelse var 11 minutter.
Skild rapporterer, at S1 kan justere sig, når objekter flyttes midt i opgaven, komme sig efter fejl og erstatte objekter med tilsvarende affordance, i ét tilfælde ved at bruge en kop vand, da demonstrationen viste en vandkande. Virksomheden rapporterer også, at modellen nogle gange forbedrer fejlbehæftede demonstrationer ved at betragte demonstrationen som en specifikation af målet snarere end en bane, der skal reproduceres.
Rapporterede resultater mod sprog‑promptede politikker
NVIDIAs indlæg rapporterer, at i Skilds tests på nye, flertrins‑opgaver lykkedes S1 omkring 66 % af tiden på hvert trin, sammenlignet med 9 % for et lignende AI‑system, en forskel som NVIDIA karakteriserede som en mere end syv‑fold forbedring. Skilds forskningsindlæg beskriver sammenligningen som en kontrolleret undersøgelse mod en sprog‑promptet VLA‑politik, som modtager sin opgavespecifikation i sprog i stedet for gennem demonstration. Begge politikker blev trænet på identiske data, arkitekturer og beregningsressourcer på fortrænings‑datasæt fra 1 000 til 100 000 timer, og de 66 % og 9 % tal blev registreret ved 100 000 timer på usete lang‑horisont‑opgaver, ifølge Skild.
På opgaver, der blev set under fortræning, rapporterer Skild, at in‑context‑learning nåede 96 % succes på den største skala, mens den sprog‑betingede politik ved 1 000 timer opnåede 53 % i forhold til 43 % for in‑context‑learning. Skild evaluerede også robusthed på tværs af fem niveauer af distributions‑skift og rapporterede, at under den mest alvorlige betingelse, hvor halvdelen af robotens handlinger skulle udføres med den modsatte arm, forringedes den sprog‑promptede politik op til tre gange så meget som in‑context‑politikken.
Ved demonstrationseffektivitet anslår Skild, at en enkelt in‑context‑video svarer til cirka 380 efter‑trænings‑episoder, et tal som de siger er interpoleret mellem målte punkter, og rapporterer, at indsamling af 380 lang‑horisont‑demonstrationer tog 50 til 100 timer med fjernbetjening. Den efter‑trænede baseline nåede til sidst 86 % succes med 2 000 demonstrationer, ifølge Skild.
Kommerciel traction og Foxconn‑implementeringen
NVIDIAs indlæg angiver, at Skild har opbygget mere end 60 implementerings‑partnerskaber, med arbejde der spænder over fremstilling, logistik, inspektion, sikkerhed, madlavning og andre anvendelser.
På fabriksgulvet implementerer Skild, NVIDIA og Foxconn Skild Brain på dual‑arm‑manipulatorer til højpræcisions‑samling af NVIDIA Blackwell‑systemer. I et demonstreret arbejdsgang installerer en robot en busstang og en grænseblok, fastgør 16 skruer og tilpasser sig forstyrrelser gennem den flertrins‑opgave. NVIDIAs indlæg angiver, at arbejdet kræver præcis bevægelse, kontakt‑bevidst kontrol, sekvens‑sporing og genopretning, når scenen afviger fra planen.
Skild annoncerede først Blackwell‑produktionslinjeplanen i et 19‑march‑2026 indlæg, som også afslørede partnerskaber med ABB Robotics, Universal Robots og Mobile Industrial Robots. I den meddelelse beskrev Skild samlingssekvensen som en reel opgave udført af mennesker på en Foxconn‑linje, afsluttet med fjernelse af grænseblokken, og sagde, at dens hjerne var finjusteret med en lille mængde robotdata til arbejdsgangen.
NVIDIA‑stakken bag S1
Ifølge NVIDIA hjælper deres Cosmos‑open‑world‑fundamentmodeller Skild med at diversificere træningsdata og omdanne video til strukturerede beskrivelser, mens Cosmos Curator hjælper med at annotere, filtrere og organisere data i stor skala. NVIDIA Omniverse‑bibliotekerne og Isaac Sim‑rammen leverer fysisk baserede virtuelle miljøer til at generere data, teste kant‑tilfælde og validere adfærd før implementering i den virkelige verden.
Skild bruger forstærknings‑læring i Isaac Lab, en åben modulær robot‑læringsramme drevet af Newton‑fysikmotoren, til at modellere fysiske parametre såsom kræfter, kontakt, kollision og tryk og reducere simulerings‑til‑virkelighed‑kløften. Efterhånden som modellerne bevæger sig mod produktion, hjælper NVIDIA Nsight‑værktøjer ingeniører med at finde ydelsesflaskehalse under træning, og TensorRT‑software‑udviklingskittet optimerer inferens, så robotter kan reagere hurtigt i den fysiske verden.
Skild og NVIDIA udvikler også i fællesskab GPU‑accelererede simulations‑løsningsalgoritmer, der modellerer, hvordan robotter fysisk berører, griber og manipulerer solide objekter. Virksomhederne sagde, at løsningsalgoritmerne snart vil blive gjort tilgængelige for alle udviklere som en del af Newton.












