파트너십
NVIDIA, S1 로봇 기반 모델 뒤에 있는 Skild AI 협업 상세 공개

NVIDIA는 2026년 9월 10일, Skild AI가 NVIDIA AI 인프라스트럭처 위에 S1 로봇 기반 모델을 구축한 방식을 상세히 설명했으며, 이 로봇 기업이 첫 상업적 배치 후 10개월 만에 연간 매출 1억 달러 규모에 도달했다고 밝혔다.
NVIDIA 블로그 게시물(NVIDIA blog post)에서, 회사는 Skild가 S1을 구축하고 그 기반 연구를 인프라스트럭처 상에서 수행했으며, 이는 합성 데이터 생성, 모델 훈련, 시뮬레이션 및 실제 물리 AI 배치를 아우르는 광범위한 협업의 일환이라고 밝혔다. Skild AI의 공동창업자이자 CEO인 Deepak Pathak는 “경험을 통한 학습, 즉 사전 프로그래밍이 아닌 방식이 로봇공학에 혁신을 가져왔다”고 말했으며, NVIDIA Isaac Lab과 NVIDIA Cosmos가 Skild가 다양한 시나리오와 형태에서 로봇이 학습할 수 있는 확장 가능하고 다양한 경험을 만들도록 돕는다고 덧붙였다. 양사는 적응형 로봇 인텔리전스를 실험실에서 공장 및 기타 동적 운영 환경으로 옮기기 위해 협력하고 있다고 전했다.
한 비디오만으로 보지 못한 작업 학습
Skild는 2026년 8월 18일 연구 게시물에서 S1을 소개하면서, 이를 맨 처음부터 인-컨텍스트 학습자로 구축된 로봇 기반 모델이라고 설명했다. 이 모델은 작업에 대한 비디오 시연을 입력으로 받아 가중치를 업데이트하거나 작업별 사후 훈련을 거치지 않고 실행한다. Skild는 S1이 사전 훈련 중에 전혀 보지 못한 장기 작업(최대 10분)에서 인-컨텍스트 학습을 보여주는 최초의 로봇 기반 모델이라고 설명한다.
운영자는 원하는 작업의 비디오를 녹화하여 모델에 프롬프트로 제공한다. 모델은 시연된 의도, 객체 및 순서를 해석한 뒤 이를 앞에 있는 로봇의 행동으로 매핑하며, 재훈련 없이도 종종 사전 훈련 데이터셋에 포함되지 않은 작업을 수행한다. 양사에 따르면 S1은 식물 심기, 팬케이크 만들기, 푸어오버 커피 추출, 키트 조립 등 익숙하지 않은 작업을 수행할 수 있으며, 이러한 작업은 수십 단계의 조작을 포함하고 모델이 이전에 수행하지 않았던 순서로 기술을 조합해야 한다.
Skild의 연구 게시물에 기록된 한 식물 심기 테스트에서, 흙, 화분, 물뿌리개 및 식물이 오후 8:54에 사무실에 도착했고, 녹화는 오후 9:16에 시작되었으며, 인간의 1인칭 비디오 시연이 오후 9:22에 기록되었고, S1은 오후 9:27에 하드웨어에서 작업을 자율적으로 실행하기 시작했다. Skild는 시연부터 자율 실행까지의 시간이 11분이었다고 밝혔다.
Skild는 S1이 작업 중에 물체가 이동하면 조정하고, 오류에서 복구하며, 일치하는 어포던스를 가진 물체를 대체할 수 있다고 보고했으며, 한 사례에서는 시연에 물뿌리개가 나타났음에도 물컵을 사용했다. 또한 이 회사는 모델이 때때로 결함이 있는 시연을 개선하여, 시연을 재현할 궤적이라기보다 목표의 명세로 취급한다고 보고했다.
언어 프롬프트 정책에 대한 보고된 결과
NVIDIA의 게시물에 따르면 Skild가 새로운 다단계 작업에 대해 수행한 테스트에서 S1은 각 단계마다 약 66%의 성공률을 보였으며, 유사한 AI 시스템은 9%에 그쳤다. NVIDIA는 이 격차를 7배 이상 향상된 것으로 설명했다. Skild의 연구 게시물은 이 비교를 언어 프롬프트 VLA 정책과의 통제된 연구로 설명하는데, 해당 정책은 시연이 아닌 언어로 작업 명세를 받는다. 두 정책은 1,000시간부터 100,000시간까지의 사전 훈련 데이터셋을 사용해 동일한 데이터, 아키텍처 및 연산으로 훈련되었으며, 66%와 9% 수치는 100,000시간에서 보지 못한 장기 작업에 대해 기록된 것이라고 Skild는 밝혔다.
사전 훈련 중에 본 작업에 대해서는, Skild는 인-컨텍스트 학습이 가장 큰 규모에서 96%의 성공률을 달성했으며, 1,000시간에서는 언어 조건부 정책이 53%를 기록한 반면 인-컨텍스트 학습은 43%를 기록했다고 보고했다. Skild는 또한 다섯 단계의 분포 변화에 대한 견고성을 평가했으며, 가장 심각한 상황인 로봇의 동작 절반을 반대 팔로 수행해야 하는 경우, 언어 프롬프트 정책이 인-컨텍스트 정책보다 최대 세 배 정도 성능이 저하된다고 보고했다.
시연 효율성에 대해 Skild는 단일 인-컨텍스트 비디오가 대략 380개의 사후 훈련 에피소드에 해당한다고 추정했으며, 이는 측정된 지점 사이를 보간한 수치라고 밝혔다. 또한 380개의 장기 시연을 수집하는 데 텔레오퍼레이션으로 50~100시간이 소요됐다고 보고했다. 사후 훈련된 기준선은 2,000개의 시연을 통해 최종적으로 86%의 성공률에 도달했다고 Skild는 전했다.
상업적 견인 및 Foxconn 배치
NVIDIA의 게시물에 따르면 Skild는 60개 이상의 배치 파트너십을 구축했으며, 그 작업은 제조, 물류, 검사, 보안, 식품 준비 및 기타 응용 분야에 걸쳐 있다.
공장 현장에서 Skild, NVIDIA 및 Foxconn은 NVIDIA Blackwell 시스템의 고정밀 조립을 위해 이중 팔 매니퓰레이터에 Skild Brain을 배치하고 있다. 한 시연된 작업 흐름에서는 로봇이 버스바와 리미트 블록을 설치하고, 16개의 나사를 고정하며, 다단계 작업 중 발생하는 교란에 적응한다. NVIDIA의 게시물은 이 작업이 정밀한 움직임, 접촉 인식 제어, 순서 추적 및 장면이 계획과 다를 때 복구를 필요로 한다고 밝혔다.
Skild는 2026년 3월 19일 게시물에서 Blackwell 생산 라인 계획을 처음 발표했으며, 이와 함께 ABB Robotics, Universal Robots 및 Mobile Industrial Robots와의 파트너십도 공개했다. 해당 발표에서 Skild는 조립 순서를 Foxconn 라인에서 인간이 수행하는 실제 작업으로 설명했으며, 리미트 블록을 제거하는 것으로 마무리하고, 해당 작업 흐름을 위해 소량의 로봇 데이터로 뇌를 미세 조정했다고 밝혔다.
S1 뒤의 NVIDIA 스택
NVIDIA에 따르면, Cosmos 오픈 월드 기반 모델은 Skild가 훈련 데이터를 다양화하고 비디오를 구조화된 설명으로 변환하도록 돕고, Cosmos Curator는 대규모로 데이터를 주석 달고, 필터링하며, 조직하는 데 기여한다. NVIDIA Omniverse 라이브러리와 Isaac Sim 프레임워크는 물리 기반 가상 환경을 제공해 데이터를 생성하고, 엣지 케이스를 테스트하며, 실제 배치 전에 행동을 검증한다.
Skild는 뉴턴 물리 엔진으로 구동되는 오픈 모듈식 로봇 학습 프레임워크인 Isaac Lab에서 강화 학습을 활용해 힘, 접촉, 충돌 및 압력과 같은 물리적 매개변수를 모델링하고 시뮬레이션‑실제 격차를 줄인다. 모델이 생산 단계에 접어들면서 NVIDIA Nsight 도구는 엔지니어가 훈련 중 성능 병목을 찾도록 돕고, TensorRT 소프트웨어 개발 키트는 추론을 최적화해 로봇이 물리적 세계에서 빠르게 반응할 수 있게 한다.
Skild와 NVIDIA는 또한 로봇이 물리적으로 접촉하고, 잡으며, 고체 물체를 조작하는 방식을 모델링하는 GPU 가속 시뮬레이션 솔버를 공동 개발하고 있다. 양사는 이 솔버가 곧 Newton의 일부로 모든 개발자에게 제공될 것이라고 밝혔다.












