Partnerskap
NVIDIA beskriver Skild AI‑samarbeidet bak S1‑robotens grunnlagsmodell

NVIDIA detaljerte den 10. september 2026 hvordan Skild AI bygde sin S1‑robotgrunnlagsmodell på NVIDIA‑AI‑infrastruktur, og opplyste at robotikkfirmaet nådde en årlig inntektsrate på 100 millioner dollar 10 måneder etter sin første kommersielle utrulling.
I NVIDIA‑blogginnlegget sa selskapet at Skild bygde S1 og utførte den underliggende forskningen på sin infrastruktur som en del av et bredere samarbeid som omfatter syntetisk datagenerering, modelltrening, simulering og fysisk AI‑utrulling i den virkelige verden. «Å lære gjennom erfaring, og ikke forhåndsprogrammering, er det steg‑forandringen som har skjedd innen robotikk», sa Deepak Pathak, medgründer og administrerende direktør i Skild AI, og la til at NVIDIA Isaac Lab og NVIDIA Cosmos hjelper Skild med å skape den skalerbare, mangfoldige opplevelsen robotene trenger for å lære på tvers av mange scenarier og former. Selskapene sa at de arbeider for å flytte tilpasningsdyktig robotintelligens fra laboratoriet inn i fabrikker og andre dynamiske driftsmiljøer.
Lære seg usette oppgaver fra én video
Skild introduserte S1 i et forskningsinnlegg fra 18. august 2026, og beskrev den som en robotisk grunnlagsmodell bygget fra bunnen av som en in‑kontekst‑lærer. Modellen tar en videodemonstrasjon av en oppgave som input og utfører den uten å oppdatere vektene eller gjennomgå oppgave‑spesifikk etter‑trening. Skild beskriver S1 som den første robotikk‑grunnlagsmodellen som viser in‑kontekst‑læring på lang‑horisont‑oppgaver, med varighet opptil 10 minutter, som aldri ble sett under forhåndstrening.
En operatør spiller inn en video av den ønskede oppgaven og gir den til modellen som en prompt. Modellen tolker den demonstrerte intensjonen, objektene og sekvensen, og oversetter dem til handlinger for roboten foran seg, uten ny trening, ofte for en oppgave som ikke er dekket av dens forhåndstrenings‑datasett. Ifølge begge selskapene kan S1 utføre ukjente oppgaver som å plante i potte, lage pannekaker, brygge pour‑over‑kaffe og montere sett, arbeid som omfatter dusinvis av manipulasjonstrinn og krever sammensetting av ferdigheter i sekvenser modellen ikke tidligere har utført.
I én plante‑potte‑test som er loggført i Skilds forskningsinnlegg, ankom jord, en potte, en vannkanne og en plante kontoret kl. 8:54 PM, opptaket startet kl. 9:16 PM, én egosentrisk menneskelig videodemonstrasjon ble spilt inn kl. 9:22 PM, og S1 begynte å utføre oppgaven autonomt på maskinvaren kl. 9:27 PM. Skild oppgir at tiden fra demonstrasjon til autonom utførelse var 11 minutter.
Skild rapporterer at S1 kan justere seg når objekter flyttes midt i oppgaven, komme seg etter feil, og erstatte objekter med tilsvarende affordans, i ett tilfelle ved å bruke en kopp vann da demonstrasjonen viste en vannkanne. Selskapet rapporterer også at modellen noen ganger forbedrer feilaktige demonstrasjoner, ved å behandle demonstrasjonen som en spesifikasjon av målet snarere enn en bane som skal reproduseres.
Rapporterte resultater mot språk‑promptede policyer
NVIDIAs innlegg rapporterer at i Skilds tester på nye, flerstegs‑oppgaver, lyktes S1 omtrent 66 % av gangene på hvert trinn, sammenlignet med 9 % for et lignende AI‑system, et gap NVIDIA karakteriserte som en mer enn syv‑fold forbedring. Skilds forskningsinnlegg beskriver sammenligningen som en kontrollert studie mot en språk‑promptet VLA‑policy, som mottar sin oppgavespesifikasjon i språk i stedet for gjennom demonstrasjon. Begge policyene ble trent på identiske data, arkitekturer og beregningsressurser over forhåndstrenings‑datasett fra 1 000 til 100 000 timer, og de 66 % og 9 % tallene ble registrert ved 100 000 timer på usette lang‑horisont‑oppgaver, ifølge Skild.
På oppgaver som ble sett under forhåndstrening rapporterer Skild at in‑kontekst‑læring nådde 96 % suksess på største skala, mens ved 1 000 timer oppnådde den språk‑betingede policyen 53 % mot 43 % for in‑kontekst‑læring. Skild evaluerte også robusthet over fem nivåer av distribusjons‑skifte, og rapporterte at under den mest alvorlige tilstanden, hvor halvparten av robotens handlinger måtte utføres med motsatt arm, forverret den språk‑promptede policyen seg opptil tre ganger så mye som in‑kontekst‑policyen.
Når det gjelder demonstrasjonseffektivitet, anslår Skild at én in‑kontekst‑video tilsvarer omtrent 380 etter‑trenings‑episoder, et tall de sier er interpolert mellom målte punkter, og rapporterer at innsamling av 380 lang‑horisont‑demonstrasjoner tok 50 til 100 timer med teleoperasjon. Den etter‑trente basislinjen nådde til slutt 86 % suksess med 2 000 demonstrasjoner, ifølge Skild.
Komersiell oppslutning og Foxconn‑utrullingen
NVIDIAs innlegg oppgir at Skild har bygget mer enn 60 utrullings‑partnerskap, med arbeid som spenner over produksjon, logistikk, inspeksjon, sikkerhet, matlaging og andre anvendelser.
På fabrikkgulvet distribuerer Skild, NVIDIA og Foxconn Skild Brain på to‑arm‑manipulatorer for høy‑presisjons‑montering av NVIDIA Blackwell‑systemer. I ett demonstrert arbeidsflyt installerer en robot en bussstang og en grenseblokk, strammer 16 skruer og tilpasser seg forstyrrelser gjennom den flerstegs‑oppgaven. NVIDIAs innlegg sier arbeidet krever presis bevegelse, kontakt‑bevisst kontroll, sekvenssporing og gjenoppretting når scenen avviker fra planen.
Skild kunngjorde først Blackwell‑produksjonslinjeplanen i et innlegg fra 19. mars 2026 som også avslørte partnerskap med ABB Robotics, Universal Robots og Mobile Industrial Robots. I den kunngjøringen beskrev Skild monteringssekvensen som en reell oppgave utført av mennesker på en Foxconn‑linje, som avsluttes med fjerning av grenseblokken, og sa at hjernen var finjustert med en liten mengde robotdata for arbeidsflyten.
NVIDIA‑stakken bak S1
Ifølge NVIDIA hjelper deres Cosmos‑åpne‑verden‑grunnlagsmodeller Skild med å diversifisere treningsdata og gjøre video om til strukturerte beskrivelser, mens Cosmos Curator hjelper med å annotere, filtrere og organisere data i stor skala. NVIDIA Omniverse‑biblioteker og Isaac Sim‑rammeverket gir fysisk baserte virtuelle miljøer for å generere data, teste kant‑tilfeller og validere atferd før utrulling i den virkelige verden.
Skild bruker forsterkende læring i Isaac Lab, et åpent modulært robot‑læringsrammeverk drevet av Newton‑fysikkmotoren, for å modellere fysiske parametere som krefter, kontakt, kollisjon og trykk og redusere simulerings‑til‑virkelighet‑gapet. Etter hvert som modeller nærmer seg produksjon, hjelper NVIDIA Nsight‑verktøy ingeniører med å finne ytelsesflaskehalser under trening, og TensorRT‑programvareutviklingssettet optimaliserer inferens slik at roboter kan svare raskt i den fysiske verden.
Skild og NVIDIA utvikler også i fellesskap GPU‑akselererte simulerings‑løsningsalgoritmer som modellerer hvordan roboter fysisk berører, griper og manipulerer solide objekter. Selskapene sa at løserne snart vil bli gjort tilgjengelige for alle utviklere som en del av Newton.












