Hợp tác
NVIDIA tiết lộ hợp tác với Skild AI trong mô hình nền tảng robot S1

Vào ngày 10 tháng 9 năm 2026, NVIDIA đã chi tiết cách Skild AI xây dựng mô hình nền tảng robot S1 trên hạ tầng AI của NVIDIA, và cho biết công ty robot đã đạt tốc độ doanh thu hàng năm 100 triệu USD chỉ sau 10 tháng kể từ lần triển khai thương mại đầu tiên.
Trong bài đăng trên blog của NVIDIA, công ty cho biết Skild đã xây dựng S1 và thực hiện nghiên cứu nền tảng trên hạ tầng của mình như một phần của sự hợp tác rộng hơn, bao gồm tạo dữ liệu tổng hợp, huấn luyện mô hình, mô phỏng và triển khai AI vật lý thực tế. “Học thông qua trải nghiệm, chứ không phải lập trình trước, là bước tiến quan trọng đã xảy ra trong lĩnh vực robot,” Deepak Pathak, đồng sáng lập và CEO của Skild AI, nói, đồng thời cho biết NVIDIA Isaac Lab và NVIDIA Cosmos giúp Skild tạo ra trải nghiệm quy mô lớn, đa dạng mà robot của họ cần để học trong nhiều kịch bản và hình thái. Hai công ty cho biết họ đang nỗ lực đưa trí tuệ robot thích nghi từ phòng thí nghiệm vào các nhà máy và các môi trường vận hành động.
Học các Nhiệm vụ chưa thấy từ một Video
Skild đã giới thiệu S1 trong một bài đăng nghiên cứu ngày 18 tháng 8 năm 2026, mô tả nó như một mô hình nền tảng robot được xây dựng từ đầu như một bộ học trong ngữ cảnh. Mô hình nhận video minh họa một nhiệm vụ làm đầu vào và thực thi mà không cập nhật trọng số hoặc thực hiện đào tạo sau cho nhiệm vụ cụ thể. Skild mô tả S1 là mô hình nền tảng robot đầu tiên cho thấy khả năng học trong ngữ cảnh trên các nhiệm vụ dài hạn, kéo dài tới 10 phút, mà trước đây chưa từng xuất hiện trong quá trình tiền huấn luyện.
Một người vận hành ghi lại video của nhiệm vụ mong muốn và cung cấp cho mô hình như một lời nhắc. Mô hình giải thích ý định, vật thể và chuỗi hành động được minh họa, sau đó chuyển chúng thành các hành động cho robot phía trước, mà không cần đào tạo lại, và thường cho một nhiệm vụ không có trong bộ dữ liệu tiền huấn luyện của nó. Theo cả hai công ty, S1 có thể thực hiện các nhiệm vụ chưa quen thuộc như trồng cây trong chậu, làm bánh kếp, pha cà phê pour‑over và lắp ráp bộ dụng cụ, công việc bao gồm hàng chục bước thao tác và đòi hỏi kết hợp kỹ năng trong các chuỗi mà mô hình chưa từng thực hiện trước đó.
Trong một thử nghiệm trồng cây trong chậu được ghi lại trong bài đăng nghiên cứu của Skild, đất, chậu, bình tưới và cây đã đến văn phòng vào lúc 8:54 PM, việc ghi hình bắt đầu lúc 9:16 PM, một video minh họa từ góc nhìn người tự thân được ghi lại lúc 9:22 PM, và S1 bắt đầu thực thi nhiệm vụ một cách tự động trên phần cứng vào lúc 9:27 PM. Skild cho biết thời gian từ việc minh họa đến thực thi tự động là 11 phút.
Skild báo cáo rằng S1 có thể điều chỉnh khi các vật thể bị di chuyển giữa chừng nhiệm vụ, phục hồi từ lỗi, và thay thế các vật thể có khả năng tương thích, trong một trường hợp sử dụng một cốc nước khi video minh họa ban đầu dùng bình tưới. Công ty cũng cho biết mô hình đôi khi cải thiện các minh họa không hoàn hảo, xem chúng như một mô tả mục tiêu thay vì một quỹ đạo cần sao chép.
Kết quả Báo cáo Đối chiếu với Chính sách Dựa trên Ngôn ngữ
Bài đăng của NVIDIA cho biết trong các thử nghiệm của Skild trên các nhiệm vụ mới, đa bước, S1 đạt thành công khoảng 66% mỗi bước, so với 9% của một hệ thống AI tương tự, khoảng cách này được NVIDIA mô tả là cải thiện hơn bảy lần. Bài đăng nghiên cứu của Skild mô tả so sánh như một nghiên cứu kiểm soát đối chiếu với chính sách VLA dựa trên ngôn ngữ, nhận thông số nhiệm vụ bằng ngôn ngữ thay vì qua minh họa. Cả hai chính sách đều được huấn luyện trên cùng một dữ liệu, kiến trúc và tính toán trên các bộ dữ liệu tiền huấn luyện từ 1.000 đến 100.000 giờ, và các con số 66% và 9% được ghi nhận ở mức 100.000 giờ trên các nhiệm vụ dài hạn chưa từng thấy, theo Skild.
Đối với các nhiệm vụ đã xuất hiện trong quá trình tiền huấn luyện, Skild báo cáo rằng học trong ngữ cảnh đạt 96% thành công ở quy mô lớn nhất, trong khi ở mức 1.000 giờ, chính sách dựa trên ngôn ngữ đạt 53% so với 43% của học trong ngữ cảnh. Skild cũng đã đánh giá độ bền vững qua năm mức độ dịch chuyển phân phối, và cho biết trong điều kiện nghiêm trọng nhất, khi một nửa các hành động của robot phải được thực hiện bằng cánh tay đối diện, chính sách dựa trên ngôn ngữ suy giảm tới ba lần so với chính sách trong ngữ cảnh.
Về hiệu quả minh họa, Skild ước tính rằng một video trong ngữ cảnh tương đương khoảng 380 tập huấn luyện sau, một con số họ cho là được nội suy giữa các điểm đo, và báo cáo rằng việc thu thập 380 minh họa dài hạn mất từ 50 đến 100 giờ điều khiển từ xa. Dòng cơ sở đã được huấn luyện sau đó cuối cùng đạt 86% thành công với 2.000 minh họa, theo Skild.
Tiến Trình Thương Mại và Triển Khai tại Foxconn
Bài đăng của NVIDIA cho biết Skild đã xây dựng hơn 60 đối tác triển khai, với công việc bao gồm sản xuất, logistics, kiểm tra, an ninh, chuẩn bị thực phẩm và các ứng dụng khác.
Trong nhà máy, Skild, NVIDIA và Foxconn đang triển khai Skild Brain trên các bộ điều khiển hai cánh tay để lắp ráp chính xác cao các hệ thống NVIDIA Blackwell. Trong một quy trình làm việc được minh họa, robot lắp đặt thanh bus và khối giới hạn, siết 16 vít và thích nghi với các nhiễu trong suốt nhiệm vụ đa bước. Bài đăng của NVIDIA cho biết công việc này đòi hỏi chuyển động chính xác, điều khiển nhận biết tiếp xúc, theo dõi chuỗi và khôi phục khi cảnh thực tế khác với kế hoạch.
Skild lần đầu tiên công bố kế hoạch dây chuyền sản xuất Blackwell trong một bài đăng ngày 19 tháng 3 năm 2026, đồng thời tiết lộ các quan hệ đối tác với ABB Robotics, Universal Robots và Mobile Industrial Robots. Trong thông báo đó, Skild mô tả chuỗi lắp ráp như một nhiệm vụ thực tế do con người thực hiện trên dây chuyền Foxconn, kết thúc bằng việc tháo khối giới hạn, và cho biết bộ não của nó đã được tinh chỉnh bằng một lượng nhỏ dữ liệu robot cho quy trình này.
Bộ công nghệ NVIDIA Đằng sau S1
Theo NVIDIA, các mô hình nền tảng thế giới mở Cosmos giúp Skild đa dạng hoá dữ liệu huấn luyện và chuyển video thành các mô tả có cấu trúc, trong khi Cosmos Curator hỗ trợ chú thích, lọc và tổ chức dữ liệu ở quy mô lớn. Các thư viện NVIDIA Omniverse và khung công tác Isaac Sim cung cấp môi trường ảo dựa trên vật lý để tạo dữ liệu, kiểm tra các trường hợp biên và xác thực hành vi trước khi triển khai thực tế.
Skild sử dụng học tăng cường trong Isaac Lab, một khung học robot mở mô-đun được hỗ trợ bởi động cơ vật lý Newton, để mô hình hoá các tham số vật lý như lực, tiếp xúc, va chạm và áp suất và giảm khoảng cách giữa mô phỏng và thực tế. Khi các mô hình tiến tới sản xuất, công cụ NVIDIA Nsight giúp kỹ sư tìm các nút thắt hiệu suất trong quá trình huấn luyện, và bộ công cụ phát triển phần mềm TensorRT tối ưu hoá suy luận để robot có thể phản hồi nhanh chóng trong thế giới vật lý.
Skild và NVIDIA cũng đang cùng nhau phát triển các bộ giải mô phỏng tăng tốc bằng GPU, mô phỏng cách robot chạm, nắm và thao tác các vật thể rắn. Hai công ty cho biết các bộ giải này sẽ sớm được cung cấp cho tất cả các nhà phát triển như một phần của Newton.












