ความร่วมมือ
NVIDIA รายละเอียดความร่วมมือกับ Skild AI เบื้องหลังโมเดลพื้นฐานหุ่นยนต์ S1

NVIDIA เมื่อวันที่ 10 กันยายน 2026 รายละเอียดว่า Skild AI สร้างโมเดลพื้นฐานหุ่นยนต์ S1 บนโครงสร้างพื้นฐาน AI ของ NVIDIA อย่างไร และระบุว่าบริษัทหุ่นยนต์นี้ได้บรรลุอัตรารายได้ต่อปี 100 ล้านดอลลาร์ภายใน 10 เดือนหลังจากการเปิดตัวเชิงพาณิชย์ครั้งแรก
ใน NVIDIA blog post บริษัทกล่าวว่า Skild สร้าง S1 และทำการวิจัยพื้นฐานบนโครงสร้างพื้นฐานของตนเป็นส่วนหนึ่งของความร่วมมือที่กว้างขวาง ครอบคลุมการสร้างข้อมูลสังเคราะห์ การฝึกโมเดล การจำลอง และการใช้งาน AI ทางกายภาพในโลกจริง “การเรียนรู้จากประสบการณ์ ไม่ใช่การเขียนโปรแกรมล่วงหน้า คือการเปลี่ยนแปลงครั้งสำคัญที่เกิดขึ้นในหุ่นยนต์” Deepak Pathak ผู้ร่วมก่อตั้งและซีอีโอของ Skild AI กล่าว พร้อมชี้ว่า NVIDIA Isaac Lab และ NVIDIA Cosmos ช่วย Skild สร้างประสบการณ์ที่ปรับขนาดได้และหลากหลายซึ่งหุ่นยนต์ของพวกเขาต้องการเพื่อเรียนรู้ผ่านหลายสถานการณ์และรูปแบบต่าง ๆ บริษัทต่างกล่าวว่ากำลังทำงานเพื่อย้ายความฉลาดของหุ่นยนต์ที่ปรับตัวได้จากห้องทดลองสู่โรงงานและสภาพแวดล้อมการทำงานที่เปลี่ยนแปลงได้อย่างไดนามิก
การเรียนรู้ภารกิจที่ไม่เคยเห็นจากวิดีโอเดียว
Skild แนะนำ S1 ใน โพสต์วิจัยวันที่ 18 สิงหาคม 2026 โดยอธิบายว่าเป็นโมเดลพื้นฐานหุ่นยนต์ที่สร้างจากศูนย์เป็นผู้เรียนในบริบท โมเดลรับวิดีโอสาธิตภารกิจเป็นอินพุตและดำเนินการโดยไม่ต้องอัปเดตน้ำหนักหรือผ่านการฝึกหลังงานเฉพาะ Skild บรรยาย S1 ว่าเป็นโมเดลพื้นฐานหุ่นยนต์แรกที่แสดงการเรียนรู้ในบริบทบนภารกิจระยะยาวที่ดำเนินการได้นานถึง 10 นาที ซึ่งไม่เคยปรากฏในช่วงการฝึกล่วงหน้า
ผู้ปฏิบัติงานบันทึกวิดีโอของภารกิจที่ต้องการและให้เป็นพรอมต์แก่โมเดล โมเดลตีความเจตนาที่สาธิต วัตถุ และลำดับขั้น แล้วแปลงเป็นการกระทำสำหรับหุ่นยนต์ที่อยู่ต่อหน้าโดยไม่ต้องฝึกใหม่ และมักจะทำภารกิจที่ไม่ได้อยู่ในชุดข้อมูลการฝึกล่วงหน้า ตามที่ทั้งสองบริษัทระบุ S1 สามารถทำภารกิจที่ไม่คุ้นเคยได้ เช่น การปลูกต้นไม้ การทำแพนเค้ก การชงกาแฟแบบ pour‑over และการประกอบชุดอุปกรณ์ งานเหล่านี้ต้องใช้ขั้นตอนการจัดการหลายสิบขั้นตอนและต้องผสมทักษะในลำดับที่โมเดลไม่เคยทำมาก่อน
ในหนึ่งการทดสอบการปลูกต้นไม้ที่บันทึกในโพสต์วิจัยของ Skild ดิน, กระถาง, กระบอกฉีดน้ำและต้นไม้มาถึงสำนักงานเวลา 8:54 PM การบันทึกเริ่มที่ 9:16 PM การสาธิตวิดีโอจากมุมมองมนุษย์หนึ่งครั้งบันทึกที่ 9:22 PM และ S1 เริ่มดำเนินการภารกิจอย่างอัตโนมัติบนฮาร์ดแวร์ที่ 9:27 PM Skild ระบุว่าระยะเวลาตั้งแต่การสาธิตจนถึงการดำเนินการอัตโนมัติคือ 11 นาที
Skild รายงานว่า S1 สามารถปรับตัวเมื่อวัตถุถูกย้ายระหว่างภารกิจ ฟื้นฟูจากข้อผิดพลาด และแทนที่วัตถุด้วยของที่มีคุณสมบัติที่ตรงกัน ในกรณีหนึ่งใช้ถ้วยน้ำแทนกระบอกฉีดน้ำที่แสดงในสาธิต บริษัทยังระบุว่าโมเดลบางครั้งสามารถปรับปรุงจากสาธิตที่มีข้อบกพร่องได้ โดยมองสาธิตเป็นข้อกำหนดของเป้าหมาย ไม่ใช่เส้นทางที่ต้องทำซ้ำ
ผลลัพธ์ที่รายงานเมื่อเทียบกับนโยบายที่ใช้ภาษาสั่งงาน
โพสต์ของ NVIDIA รายงานว่าในการทดสอบของ Skild บนภารกิจใหม่หลายขั้นตอน S1 ประสบความสำเร็จประมาณ 66 % ของแต่ละขั้นตอน เทียบกับ 9 % สำหรับระบบ AI ที่คล้ายกัน ซึ่งช่องว่างนี้ NVIDIA อธิบายว่าเป็นการปรับปรุงมากกว่าหกเท่าโพสต์วิจัยของ Skild อธิบายการเปรียบเทียบนี้เป็นการศึกษาที่ควบคุมกับนโยบาย VLA ที่ใช้ภาษาสั่งงาน ซึ่งรับข้อกำหนดภารกิจเป็นภาษาแทนการสาธิต ทั้งสองนโยบายได้รับการฝึกด้วยข้อมูล สถาปัตยกรรม และคอมพิวเตอร์ที่เหมือนกันบนชุดข้อมูลการฝึกล่วงหน้าตั้งแต่ 1,000 ถึง 100,000 ชั่วโมง และตัวเลข 66 % และ 9 % ถูกบันทึกที่ 100,000 ชั่วโมงบนภารกิจระยะยาวที่ไม่เคยเห็นตามที่ Skild ระบุ
สำหรับภารกิจที่เคยเห็นในการฝึกล่วงหน้า Skild รายงานว่าการเรียนรู้ในบริบทบรรลุความสำเร็จ 96 % ที่สเกลใหญ่สุด ในขณะที่ที่ 1,000 ชั่วโมงนโยบายที่ใช้ภาษาสั่งงานได้คะแนน 53 % เทียบกับ 43 % สำหรับการเรียนรู้ในบริบท Skild ยังประเมินความทนทานผ่านห้าระดับของการเปลี่ยนแปลงการกระจาย โดยรายงานว่าภายใต้สภาวะที่รุนแรงที่สุด ซึ่งครึ่งหนึ่งของการกระทำของหุ่นยนต์ต้องทำด้วยแขนตรงข้าม นโยบายที่ใช้ภาษาสั่งงานเสื่อมสภาพมากกว่านโยบายในบริบทถึงสามเท่า
ในเรื่องประสิทธิภาพการสาธิต Skild ประมาณว่าวิดีโอในบริบทหนึ่งเทียบเท่ากับประมาณ 380 ตอนหลังการฝึก ซึ่งตัวเลขนี้ถูกสรุปจากจุดวัดที่มีและรายงานว่าการเก็บรวบรวมสาธิตระยะยาว 380 ครั้งใช้เวลา 50 ถึง 100 ชั่วโมงของการควบคุมระยะไกล ฐานหลังการฝึกสุดท้ายในที่สุดบรรลุความสำเร็จ 86 % ด้วยสาธิต 2,000 ครั้งตามที่ Skild ระบุ
การเติบโตเชิงพาณิชย์และการใช้งานกับ Foxconn
โพสต์ของ NVIDIA ระบุว่า Skild ได้สร้างความร่วมมือการใช้งานมากกว่า 60 รายการ ครอบคลุมการผลิต โลจิสติกส์ การตรวจสอบ ความปลอดภัย การเตรียมอาหารและการใช้งานอื่น ๆ
บนพื้นโรงงาน Skild, NVIDIA และ Foxconn กำลังนำ Skild Brain ไปใช้บนหุ่นยนต์มือสองแขนสำหรับการประกอบที่แม่นยำสูงของระบบ NVIDIA Blackwell ในหนึ่งกระบวนการที่สาธิต หุ่นยนต์ติดตั้งบัสบาร์และบล็อกจำกัด ยึดสกรู 16 ตัวและปรับตัวต่อการรบกวนในภารกิจหลายขั้นตอน โพสต์ของ NVIDIA ระบุว่างานนี้ต้องการการเคลื่อนที่ที่แม่นยำ การควบคุมที่รับรู้การสัมผัส การติดตามลำดับและการฟื้นฟูเมื่อฉากแตกต่างจากแผน
Skild ประกาศแผนสายการผลิต Blackwell ครั้งแรกใน โพสต์วันที่ 19 มีนาคม 2026 ซึ่งยังเปิดเผยความร่วมมือกับ ABB Robotics, Universal Robots และ Mobile Industrial Robots ในประกาศนั้น Skild อธิบายลำดับการประกอบเป็นภารกิจจริงที่มนุษย์ทำบนสายการผลิตของ Foxconn โดยจบด้วยการถอดบล็อกจำกัด และระบุว่ามันสมองได้รับการปรับแต่งด้วยข้อมูลหุ่นยนต์จำนวนเล็กน้อยสำหรับกระบวนการดังกล่าว
สแต็กของ NVIDIA ที่อยู่เบื้องหลัง S1
ตามที่ NVIDIA กล่าว โมเดลพื้นฐาน Cosmos แบบโลกเปิดช่วย Skild กระจายข้อมูลการฝึกและแปลงวิดีโอเป็นคำอธิบายเชิงโครงสร้าง ในขณะเดียวกัน Cosmos Curator ช่วยทำการอธิบาย ปรับกรอง และจัดระเบียบข้อมูลในระดับใหญ่ ไลบรารี NVIDIA Omniverse และกรอบงาน Isaac Sim ให้สภาพแวดล้อมเสมือนที่อิงฟิสิกส์สำหรับการสร้างข้อมูล การทดสอบกรณีขอบและการตรวจสอบพฤติกรรมก่อนการนำไปใช้จริง
Skild ใช้การเรียนรู้เสริมใน Isaac Lab ซึ่งเป็นกรอบงาน robot learning แบบเปิดโมดูลาร์ที่ขับเคลื่อนด้วยเอนจินฟิสิกส์ Newton เพื่อจำลองพารามิเตอร์ทางกายภาพเช่น แรง การสัมผัส การชนและความดันและลดช่องว่างระหว่างการจำลองและความเป็นจริง เมื่อโมเดลก้าวสู่การผลิต เครื่องมือ NVIDIA Nsight ช่วยวิศวกรค้นหาจุดคอขวดประสิทธิภาพระหว่างการฝึก และชุดพัฒนา TensorRT ปรับแต่งการอนุมานเพื่อให้หุ่นยนต์ตอบสนองได้อย่างรวดเร็วในโลกกายภาพ
Skild และ NVIDIA ยังร่วมกันพัฒนาโซลูชันการจำลองที่เร่งด้วย GPU ซึ่งจำลองวิธีที่หุ่นยนต์สัมผัส จับและจัดการกับวัตถุแข็ง บริษัทระบุว่าโซลูชันเหล่านี้จะเร็ว ๆ นี้เปิดให้ผู้พัฒนาทุกคนใช้เป็นส่วนหนึ่งของ Newton












