โมเดลและแพลตฟอร์ม AI
CoreWeave เชื่อมต่อ GPU Rubin จำนวนหลายร้อยตัวในคลัสเตอร์หลายแร็คเดียว

CoreWeave เมื่อวันที่ 16 กันยายน 2026 ประกาศ การเปิดตัวระบบหลายแร็ค NVIDIA Vera Rubin NVL72 บน CoreWeave Cloud โดยวาง GPU NVIDIA Rubin จำนวนหลายร้อยตัวไว้ในคลัสเตอร์สเกลเอาต์แบบเดียวสำหรับ AI แบบเอเจนท์ บริษัทยังเปิดตัวความสามารถใหม่สองประการใน CoreWeave AI Object Storage คือ การเร่งการเขียนข้ามภูมิภาคและระดับ Archive ใหม่
Chen Goldberg รองประธานฝ่ายผลิตภัณฑ์และวิศวกรรมของ CoreWeave กล่าวว่า CoreWeave เป็นผู้ให้บริการคลาวด์ AI รายแรกที่ตรวจสอบและเปิดตัว Vera Rubin NVL72 และแสดงให้เห็นว่าโครงสร้างสเกลแร็คสามารถทำงานเป็นบริการคลาวด์ที่เชื่อถือได้และมีประสิทธิภาพสูง “ด้วย Vera Rubin แบบหลายแร็ค เรากำลังเชื่อมต่อ GPU Rubin จำนวนหลายร้อยตัวเป็นคลัสเตอร์สเกลเอาต์เดียว,” Goldberg กล่าวต่อว่า สำหรับลูกค้าที่สร้าง AI แบบเอเจนท์ นั่นหมายถึงการขยายขนาดที่มากขึ้น การทำซ้ำที่เร็วขึ้น และผลผลิตที่สูงขึ้น เนื่องจากโมเดลและเอเจนท์เรียนรู้และพัฒนาอย่างต่อเนื่อง
สถาปัตยกรรมหลายแร็คและการเปิดตัว
แร็ค Vera Rubin NVL72 หนึ่งแร็คประกอบด้วย GPU Rubin จำนวน 72 ตัว คู่กับ CPU Vera จำนวน 36 ตัว, NVIDIA NVLink 6, ConnectX-9 SuperNICs, และ BlueField-4 DPU. ด้วย Vera Rubin NVL72 แบบหลายแร็ค CoreWeave รวมแร็คของเครื่องเร่งหลายร้อยตัวโดยใช้เครือข่าย Ethernet NVIDIA Spectrum‑X เป็นคลัสเตอร์สเกลเอาต์เดียว CoreWeave กล่าวว่าระบบนี้ให้ความสามารถในการฝึกโมเดลที่ใหญ่ขึ้น ให้บริการงานอินเฟอร์เรนซ์ที่ต้องการมากขึ้น และดำเนินการเรียนรู้แบบเสริมแรงในระดับใหญ่
บริษัทระบุว่าการดำเนินงานฝึกและอินเฟอร์เรนซ์บน GPU Rubin จำนวนหลายร้อยตัวมีความสำคัญต่อเวิร์กโหลด AI แบบเอเจนท์หลายขั้นตอน ซึ่งมีความไวต่อความหน่วงของการเข้าถึงข้อมูล เนื่องจากความล่าช้าสามารถสะสมได้จากการเรียกโมเดลและการใช้เครื่องมือซ้ำหลายครั้ง
CoreWeave กล่าวว่ามันนำหลายแร็คขึ้นเป็นระบบเดียวผ่านการควบคุมวงจรชีวิตแร็คแบบอัตโนมัติ การตรวจสอบระดับระบบ และการขยายเครือข่าย CoreWeave Mission Control ทำให้การตั้งค่าแร็คเป็นอัตโนมัติผ่าน Rack LifeCycle Controller โดยมีงานตั้งค่าที่ครอบคลุมการตรวจจับฮาร์ดแวร์ การอัปเดตเฟิร์มแวร์ การตรวจสอบ พลังงาน และการทำความเย็น; Racky ดูแลการควบคุมระดับแร็คในขณะที่ Valvey ดำเนินการทำความเย็น ก่อนที่แร็คจะเข้าสู่การผลิต CoreWeave จะผสานการวินิจฉัยสนามของ NVIDIA กับการทดสอบภาระงานเต็มแร็คและเปรียบเทียบผลลัพธ์ทุกอย่าง และเฉพาะแร็คที่ผ่านเกณฑ์ในฐานะระบบเท่านั้นที่จะเข้าสู่การผลิต
ในด้านเครือข่าย ทุก GPU Rubin มี ConnectX-9 SuperNIC สองตัว ให้ความเร็วการเชื่อมต่อสเกลเอาต์ 1.6 Tb/s ต่อ GPU ผ่านเส้นทางหลายระนาบและหลายราง CoreWeave กล่าวว่าการออกแบบนี้รองรับประมาณ 128,000 GPU ต่อรางในโครงข่ายที่ไม่บล็อก และโทโพโลยีโมดูลาร์ทำให้สามารถเพิ่มแร็คได้โดยไม่ต้องออกแบบโครงข่ายใหม่ทุกครั้งที่ขยาย
AI Object Storage ข้ามภูมิภาค
CoreWeave AI Object Storage ทำให้ข้อมูลอยู่ใกล้กับงานประมวลผลมากขึ้นผ่าน LOTA (Local Object Transport Accelerator) ซึ่งใช้การแคชที่จัดการบนโหนด CoreWeave Kubernetes Service ทุกโหนด CoreWeave กล่าวว่า LOTA ให้การอ่านที่ความเร็ว NVMe ระดับท้องถิ่น ลดความหน่วงเวลาได้ 8 เท่าเมื่อเทียบกับการอ่านจากคลัสเตอร์สตอเรจแบบดั้งเดิม และให้อัตราการส่งผ่านสูงสุด 7 GB/s ต่อ GPU พร้อมกับการขยายเชิงเส้นเมื่อคลัสเตอร์เพิ่มขนาด
การเร่งการเขียนข้ามภูมิภาคใหม่ทำให้สามารถเขียนเช็คพอยต์ในระดับท้องถิ่นภายในภูมิภาคเดียวโดยมีความหน่วงระดับท้องถิ่น ในขณะที่ข้อมูลย้ายไปยังภูมิภาคระยะไกลที่สองในพื้นหลัง เนื่องจากแอปพลิเคชันมองเห็นบัคเก็ตเดียว ไม่มีการเปลี่ยนแปลงโค้ด และสิทธิ์และกฎการเก็บรักษาทำงานเช่นเดียวกันไม่ว่าการเขียนมาจากภูมิภาคใด CoreWeave กล่าวว่าฟีเจอร์นี้ลดระยะเวลาการหยุดฝึกและขจัดความจำเป็นในการคัดลอกหรือย้ายข้อมูลด้วยมือระหว่างภูมิภาค
การเพิ่มอีกส่วนคือ Archive ซึ่งเป็นระดับสตอเรจต้นทุนต่ำที่ไม่มีค่าธรรมเนียมในการเรียกคืนข้อมูล ไม่มีค่าธรรมเนียมในการลบล่วงหน้า และไม่มีค่าธรรมเนียมเมื่ออ่านจากระดับนี้ CoreWeave อธิบายว่าเป็นการจัดเก็บข้อมูลที่ทีมงานมักจะลบออก เช่น เช็คพอยต์จากการรันที่เกือบสำเร็จ ชุดข้อมูลที่จำเป็นสำหรับการทำซ้ำผลลัพธ์ หรือเวอร์ชันโมเดลที่อาจมีผู้สอบถามในหกเดือนข้างหน้า
“ชุดข้อมูลของเราครอบคลุมหลายภูมิภาคและเราไม่สามารถยอมให้กำหนดการฝึกของเราถูกกำหนดโดยความล่าช้าในการเรียกข้อมูลข้ามภูมิภาค” Cécile Robert-Michon ผู้อำนวยการโครงสร้างพื้นฐานภายในของ Cohere กล่าว “CoreWeave AI Object Storage ทำให้เรามีรอยเท้าชุดข้อมูลที่สอดคล้องกันข้ามภูมิภาคโดยการแคชการอ่านในระดับท้องถิ่น ดังนั้นไม่มีอะไรต้องรอคอยบนเครือข่าย”
สเปค NVIDIA Vera Rubin NVL72
NVIDIA’s หน้าเพจผลิตภัณฑ์ Vera Rubin NVL72 ระบุว่าระบบนี้เป็นซูเปอร์คอมพิวเตอร์ AI แบบเอเจนท์ระดับแร็คที่สร้างบนการออกแบบแร็ค MGX NVL72 รุ่นที่สามและอยู่ในขั้นตอนการผลิตเต็มรูปแบบ ข้อมูลสเปคที่ NVIDIA เผยแพร่ระบุว่า มีหน่วยความจำ GPU HBM4 ขนาด 20.7 TB พร้อมแบนด์วิดท์ 1,400 TB/s, แบนด์วิดท์ NVLink 216 TB/s บน NVLink รุ่นที่หก, และการคำนวณอินเฟอร์เรนซ์ NVFP4 แบบสแปรส 3,600 PFLOPS ต่อแร็ค CPU Vera 36 ตัวให้ 3,168 คอร์ Olympus แบบกำหนดเองและหน่วยความจำ LPDDR5X สูงสุด 54 TB
NVIDIA ระบุว่า Vera Rubin NVL72 ฝึกโมเดล mixture-of-experts ด้วยจำนวน GPU เพียงหนึ่งในสี่ของ GB200 NVL72, และให้การอินเฟอร์เรนซ์ในต้นทุนหนึ่งในสิบต่อหนึ่งล้านโทเคนสำหรับ AI แบบเอเจนท์ที่มีการโต้ตอบสูงและการให้เหตุผลเชิงลึก, พร้อมกับจำนวนโทเคนต่อเมกะวัตต์สูงสุดถึง 10 เท่า หมายเหตุในเชิงอรรถของหน้าแสดงว่าตัวเลขอินเฟอร์เรนซ์อาจมีการเปลี่ยนแปลงและการเปรียบเทียบการฝึกเป็นการคาดการณ์ประสิทธิภาพ
ในการประกาศ CoreWeave ยังได้ชี้ให้เห็นบันทึกการทำงานของตน โดยอ้างอิงผลการทดสอบ MLPerf ที่ทำลายสถิติในด้านการสรุปผลและการฝึกโมเดล รวมถึงตำแหน่งของบริษัทในฐานะคลาวด์ AI เพียงแห่งเดียวที่ได้รับการจัดอันดับ Platinum ระดับสูงสุดในทั้ง SemiAnalysis ClusterMAX 1.0 และ 2.0 อีกทั้งบริษัทยังอ้างอิงอันดับที่ 1 ด้านความเร็วการสรุปผลและประสิทธิภาพด้านราคา‑ประสิทธิภาพสำหรับโมเดล Kimi K2.6 และ Kimi K2.7 Code ของ Moonshot AI จากการทดสอบสรุปผลอิสระที่ดำเนินการโดย Artificial Analysis












