Partnerstwa
NVIDIA przedstawia współpracę Skild AI przy modelu podstawowym robota S1

NVIDIA w dniu 10 września 2026 r. przedstawiła, jak Skild AI zbudował swój model podstawowy robota S1 na infrastrukturze AI NVIDIA oraz poinformowała, że firma robotyczna osiągnęła roczny przychód w wysokości 100 milionów dolarów 10 miesięcy po pierwszym komercyjnym wdrożeniu.
W poście na blogu NVIDIA firma poinformowała, że Skild zbudował S1 i przeprowadził podstawowe badania na swojej infrastrukturze w ramach szerszej współpracy obejmującej generowanie danych syntetycznych, trening modeli, symulację oraz wdrożenia fizycznej sztucznej inteligencji w rzeczywistym świecie. „Uczenie się poprzez doświadczenie, a nie programowanie wstępne, to przełom, który nastąpił w robotyce” – powiedział Deepak Pathak, współzałożyciel i dyrektor generalny Skild AI, dodając, że NVIDIA Isaac Lab i NVIDIA Cosmos pomagają Skild tworzyć skalowalne, różnorodne doświadczenia, których ich roboty potrzebują, aby uczyć się w wielu scenariuszach i formach. Firmy oświadczyły, że pracują nad przeniesieniem elastycznej inteligencji robotów z laboratorium do fabryk i innych dynamicznych środowisk operacyjnych.
Nauka niewidzianych zadań z jednego wideo
Skild przedstawił S1 w poście badawczym z 18 sierpnia 2026 r., opisując go jako model podstawowy robotyki zbudowany od podstaw jako uczeń w kontekście. Model przyjmuje jako wejście demonstrację wideo zadania i wykonuje je bez aktualizacji wag ani dodatkowego treningu specyficznego dla zadania. Skild opisuje S1 jako pierwszy model podstawowy robotyki, który wykazuje uczenie się w kontekście przy zadaniach o długim horyzoncie, trwających do 10 minut, które nigdy nie były widziane podczas wstępnego treningu.
Operator nagrywa wideo pożądanego zadania i podaje je modelowi jako podpowiedź. Model interpretuje wykazaną intencję, obiekty i kolejność, a następnie przekształca je w działania dla stojącego przed nim robota, bez ponownego treningu, często dla zadania nieobjętego jego zestawem danych wstępnego treningu. Według obu firm, S1 potrafi wykonywać nieznane zadania, w tym sadzenie roślin, przygotowywanie naleśników, parzenie kawy metodą pour‑over oraz montaż zestawów, prace obejmujące dziesiątki kroków manipulacyjnych i wymagające łączenia umiejętności w sekwencjach, których model wcześniej nie wykonywał.
W jednym teście sadzenia roślin, odnotowanym w poście badawczym Skild, gleba, doniczka, konewka i roślina dotarły do biura o 20:54, nagrywanie rozpoczęło się o 21:16, jedna egocentryczna demonstracja wideo człowieka została zarejestrowana o 21:22, a S1 rozpoczął autonomiczne wykonywanie zadania na sprzęcie o 21:27. Skild podaje, że czas od demonstracji do autonomicznego wykonania wyniósł 11 minut.
Skild informuje, że S1 potrafi dostosować się, gdy przedmioty zostaną przesunięte w trakcie zadania, odzyskać po błędach oraz zastąpić przedmioty o dopasowanej funkcji, w jednym przypadku używając szklanki wody zamiast konewki pokazanej w demonstracji. Firma podaje również, że model czasami ulepsza nieprawidłowe demonstracje, traktując je jako specyfikację celu, a nie trajektorię do odtworzenia.
Zgłoszone wyniki w porównaniu z politykami wywoływanymi językiem
W poście NVIDIA podano, że w testach Skild na nowych, wieloetapowych zadaniach, S1 odniósł sukces w około 66 % przypadków na każdym etapie, w porównaniu z 9 % dla podobnego systemu AI, co NVIDIA określiła jako ponad siedmiokrotną poprawę. Post badawczy Skild opisuje to porównanie jako kontrolowane badanie przeciwko polityce VLA wywoływanej językiem, która otrzymuje specyfikację zadania w formie językowej, a nie poprzez demonstrację. Obie polityki były trenowane na identycznych danych, architekturach i mocy obliczeniowej przy zestawach danych wstępnego treningu od 1 000 do 100 000 godzin, a wartości 66 % i 9 % zostały odnotowane przy 100 000 godzinach na niewidzianych zadaniach o długim horyzoncie, według Skild.
W przypadku zadań widzianych podczas wstępnego treningu, Skild podaje, że uczenie się w kontekście osiągnęło 96 % sukcesu przy największej skali, podczas gdy przy 1 000 godzin polityka warunkowana językiem uzyskała 53 % w porównaniu do 43 % dla uczenia się w kontekście. Skild ocenił również odporność na pięciu poziomach przesunięcia rozkładu, informując, że w najcięższym warunku, gdy połowa działań robota musi być wykonywana przeciwną ręką, polityka wywoływana językiem pogorszyła się aż trzykrotnie bardziej niż polityka w kontekście.
Jeśli chodzi o wydajność demonstracji, Skild szacuje, że pojedyncze wideo w kontekście odpowiada mniej więcej 380 epizodom po‑treningowym, co, jak podaje, zostało wyliczone interpolacją między zmierzonymi punktami, oraz informuje, że zebranie 380 demonstracji długiego horyzontu zajęło od 50 do 100 godzin teleoperacji. Podstawowy model po treningu ostatecznie osiągnął 86 % sukcesu przy 2 000 demonstracjach, według Skild.
Komercyjny przyrost i wdrożenie w Foxconn
W poście NVIDIA stwierdzono, że Skild nawiązał ponad 60 partnerstw wdrożeniowych, obejmujących prace w zakresie produkcji, logistyki, inspekcji, bezpieczeństwa, przygotowywania żywności i innych zastosowań.
Na hali produkcyjnej Skild, NVIDIA i Foxconn wdrażają Skild Brain na manipulatorach dwuramiennych do precyzyjnego montażu systemów NVIDIA Blackwell. W jednym zaprezentowanym przebiegu pracy robot montuje szynę zasilającą i blok ograniczający, przykręca 16 śrub i dostosowuje się do zakłóceń w trakcie wieloetapowego zadania. W poście NVIDIA podkreślono, że praca wymaga precyzyjnego ruchu, sterowania uwzględniającego kontakt, śledzenia sekwencji oraz odzyskiwania po sytuacjach, gdy scena odbiega od planu.
Skild po raz pierwszy ogłosił plan linii produkcyjnej Blackwell w poście z 19 marca 2026 r., który również ujawnił partnerstwa z ABB Robotics, Universal Robots oraz Mobile Industrial Robots. W tym ogłoszeniu Skild opisał sekwencję montażu jako rzeczywiste zadanie wykonywane przez ludzi na linii Foxconn, kończące się usunięciem bloku ograniczającego, i zaznaczył, że jego mózg został dopracowany przy użyciu niewielkiej ilości danych robotycznych dla tego przebiegu pracy.
Stos NVIDIA stojący za S1
Według NVIDIA, jego modele podstawowe Cosmos w otwartym świecie pomagają Skild dywersyfikować dane treningowe i przekształcać wideo w ustrukturyzowane opisy, podczas gdy Cosmos Curator wspomaga anotację, filtrowanie i organizację danych w dużej skali. Biblioteki NVIDIA Omniverse oraz framework Isaac Sim dostarczają fizycznie oparte środowiska wirtualne do generowania danych, testowania przypadków brzegowych i weryfikacji zachowań przed wdrożeniem w rzeczywistym świecie.
Skild wykorzystuje uczenie ze wzmocnieniem w Isaac Lab, otwartym modularnym frameworku uczenia robotów zasilanym silnikiem fizycznym Newton, aby modelować parametry fizyczne takie jak siły, kontakt, kolizje i ciśnienie oraz zmniejszyć lukę między symulacją a rzeczywistością. W miarę jak modele przechodzą do produkcji, narzędzia NVIDIA Nsight pomagają inżynierom wykrywać wąskie gardła wydajności podczas treningu, a zestaw SDK TensorRT optymalizuje wnioskowanie, aby roboty mogły szybko reagować w świecie fizycznym.
Skild i NVIDIA wspólnie opracowują przyspieszone na GPU rozwiązania symulacyjne, które modelują, jak roboty fizycznie dotykają, chwytają i manipulują solidnymi obiektami. Firmy oświadczyły, że rozwiązania te wkrótce będą dostępne dla wszystkich deweloperów jako część Newton.












