Partnerství
NVIDIA podrobně popisuje spolupráci Skild AI na robotickém základním modelu S1

NVIDIA 10. září 2026 podrobně popsala, jak Skild AI vytvořila svůj robotický základní model S1 na AI infrastruktuře NVIDIA, a uvedla, že robotická společnost dosáhla ročního obratu 100 milionů dolarů pouhých 10 měsíců po svém prvním komerčním nasazení.
V příspěvku na blogu NVIDIA společnost uvedla, že Skild vytvořil S1 a prováděl související výzkum na své infrastruktuře jako součást širší spolupráce zahrnující generování syntetických dat, trénink modelů, simulaci a nasazení fyzické AI ve skutečném světě. „Učení zkušenostmi, nikoli předprogramováním, představuje zásadní posun, který nastal v robotice,“ řekl Deepak Pathak, spoluzakladatel a CEO Skild AI, a dodal, že NVIDIA Isaac Lab a NVIDIA Cosmos pomáhají Skildu vytvořit škálovatelnou a rozmanitou zkušenost, kterou jeho roboti potřebují k učení v mnoha scénářích a podobách. Společnosti uvedly, že pracují na přenesení adaptabilní robotické inteligence z laboratoře do továren a dalších dynamických provozních prostředí.
Učení neviděných úkolů z jednoho videa
Skild představil S1 v výzkumném příspěvku ze 18. srpna 2026, kde jej popsal jako robotický základní model postavený od základů jako učící se v kontextu. Model přijímá video ukázku úkolu jako vstup a vykoná jej, aniž by aktualizoval své váhy nebo podstoupil specifické doplňkové trénování. Skild popisuje S1 jako první robotický základní model, který ukazuje učení v kontextu na dlouhodobých úkolech trvajících až 10 minut, které nebyly během předtréninku nikdy viděny.
Operátor zaznamená video požadovaného úkolu a poskytne jej modelu jako výzvu. Model interpretuje demonstrovaný záměr, objekty a sekvenci a poté je převádí na akce pro robota před sebou, bez nutnosti dalšího tréninku, a často i pro úkol, který není zahrnut v jeho předtréninkovém datasetu. Podle obou společností může S1 vykonávat neznámé úkoly, včetně sázení rostlin, přípravy palačinek, vaření filtrované kávy a montáže souprav, práce, která zahrnuje desítky manipulačních kroků a vyžaduje skládání dovedností v sekvencích, které model doposud neprovedl.
V jednom testu sázení rostlin zaznamenaném ve výzkumném příspěvku Skildu dorazily do kanceláře půda, květináč, konvička a rostlina v 8:54 PM, nahrávání začalo v 9:16 PM, jedna egocentrická lidská video ukázka byla zaznamenána v 9:22 PM a S1 začal úkol autonomně vykonávat na hardwaru v 9:27 PM. Skild uvádí, že čas od demonstrace po autonomní provedení byl 11 minut.
Skild uvádí, že S1 dokáže upravit své chování, když jsou objekty během úkolu přesunuty, zotavit se z chyb a nahradit objekty s odpovídajícími vlastnostmi, například v jednom případě použil sklenici vody, když demonstrace ukazovala konvičku. Společnost také uvádí, že model někdy vylepšuje nedokonalé demonstrace a považuje je za specifikaci cíle spíše než za trajektorii k napodobení.
Uvedené výsledky proti jazykově podněcovaným politikám
Příspěvek NVIDIA uvádí, že ve Skildových testech nových, vícekrokových úkolů dosáhl S1 úspěšnosti přibližně 66 % na každém kroku, oproti 9 % u podobného AI systému, což NVIDIA charakterizovala jako více než sedminásobné zlepšení. Skildův výzkumný příspěvek popisuje srovnání jako kontrolovanou studii proti jazykově podněcované politice VLA, která získává specifikaci úkolu v jazyce místo prostřednictvím demonstrace. Obě politiky byly trénovány na identických datech, architekturách a výpočetním výkonu napříč předtréninkovými datasety od 1 000 do 100 000 hodin a hodnoty 66 % a 9 % byly zaznamenány při 100 000 hodinách na neviděných dlouhodobých úkolech, podle Skildu.
U úkolů viděných během předtréninku Skild uvádí, že učení v kontextu dosáhlo 96 % úspěšnosti při největším měřítku, zatímco při 1 000 hodinách jazykově podmíněná politika dosáhla 53 % oproti 43 % pro učení v kontextu. Skild také hodnotil robustnost napříč pěti úrovněmi posunu distribuce a uvádí, že za nejzávažnější podmínky, kdy polovina robotových akcí musí být provedena opačnou rukou, jazykově podněcovaná politika degradovala až třikrát více než politika učení v kontextu.
Co se týče efektivity demonstrací, Skild odhaduje, že jedno video v kontextu odpovídá zhruba 380 po-tréninkovým epizodám, což je údaj, který byl podle nich interpolován mezi měřenými body, a uvádí, že shromáždění 380 dlouhodobých demonstrací trvalo 50 až 100 hodin teleoperace. Po tréninku základní linie nakonec dosáhla 86 % úspěšnosti při 2 000 demonstracích, podle Skildu.
Komerční úspěch a nasazení ve Foxconn
Příspěvek NVIDIA uvádí, že Skild vybudoval více než 60 partnerských nasazení, přičemž práce zahrnuje výrobu, logistiku, inspekci, zabezpečení, přípravu potravin a další aplikace.
Na výrobní lince nasazují Skild, NVIDIA a Foxconn Skild Brain na dvouramenné manipulátory pro vysoce přesnou montáž systémů NVIDIA Blackwell. V jedné demonstrované pracovní sekvenci robot instaloval sběrnici, limitní blok, utáhl 16 šroubů a přizpůsobil se rušením během vícekrokového úkolu. Příspěvek NVIDIA uvádí, že tato práce vyžaduje přesný pohyb, kontrolu citlivou na kontakt, sledování sekvence a obnovu, když se scéna liší od plánu.
Skild poprvé oznámil plán výroby Blackwell v příspěvku ze 19. března 2026, který také odhalil partnerství s ABB Robotics, Universal Robots a Mobile Industrial Robots. V tomto oznámení Skild popsal montážní sekvenci jako skutečný úkol prováděný lidmi na lince Foxconn, končící odstraněním limitního bloku, a uvedl, že jeho mozek byl doladěn pomocí malé množství robotických dat pro tento pracovní tok.
Technologický stack NVIDIA za S1
Podle NVIDIA jeho otevřené světové základní modely Cosmos pomáhají Skildu diverzifikovat tréninková data a převádět video na strukturované popisy, zatímco Cosmos Curator pomáhá anotovat, filtrovat a organizovat data ve velkém měřítku. Knihovny NVIDIA Omniverse a framework Isaac Sim poskytují fyzikálně založená virtuální prostředí pro generování dat, testování okrajových případů a ověřování chování před nasazením ve skutečném světě.
Skild využívá posilovací učení v Isaac Lab, otevřeném modulárním frameworku pro učení robotů poháněném fyzikálním enginem Newton, k modelování fyzických parametrů, jako jsou síly, kontakt, kolize a tlak, a ke snížení mezery mezi simulací a realitou. Jakmile se modely posouvají k produkci, nástroje NVIDIA Nsight pomáhají inženýrům najít výkonnostní úzká místa během tréninku a sadu vývojářských nástrojů TensorRT optimalizuje inferenci, aby roboti mohli rychle reagovat ve fyzickém světě.
Skild a NVIDIA také společně vyvíjejí GPU-akcelerované simulační řešiče, které modelují, jak roboti fyzicky dotýkají, uchopují a manipulují se solidními objekty. Společnosti uvedly, že řešiče budou brzy k dispozici všem vývojářům jako součást Newtonu.












