โมเดลและแพลตฟอร์ม AI
NVIDIA Vera Rubin NVL72 เผยผลลัพธ์แรกของการพรีวิว MLPerf Inference

NVIDIA เมื่อวันที่ 16 กันยายน 2026 ได้เผยผล ผลการส่งของ MLPerf Inference v6.1 โดยมีหัวข้อหลักเป็นการส่งมอบพรีวิวแรกของ MLPerf Inference ของระบบ Vera Rubin NVL72 ซึ่งบริษัทระบุว่ามีอัตราการประมวลผลสูงสุดถึง 3.7 เท่าเหนือระบบ GB300 NVL72 บนเบนช์มาร์ค Qwen3-VL
MLPerf Inference: Datacenter เป็นชุดเบนช์มาร์คของสมาคม MLCommons ที่วัดความเร็วของระบบในการประมวลผลข้อมูลเข้าและสร้างผลลัพธ์โดยใช้โมเดลที่ฝึกแล้ว ภายใต้ คำนิยามที่เผยแพร่ของ MLCommons ส่วน Closed division — หมวดที่ NVIDIA อ้างอิงสำหรับตัวเลขหลัก — ต้องใช้โมเดลเดียวกับการอ้างอิงเพื่อให้แพลตฟอร์มฮาร์ดแวร์และเฟรมเวิร์กซอฟต์แวร์เปรียบเทียบกันได้อย่างเท่าเทียมกัน ในขณะที่ระบบในหมวด Preview availability จะต้องสามารถส่งเป็น Available ในรอบการส่งครั้งถัดไป
ผลลัพธ์พรีวิว DeepSeek-R1 และ Qwen3-VL
NVIDIA ส่งผลลัพธ์พรีวิว Vera Rubin NVL72 บน DeepSeek-R1 และ Qwen3-VL ซึ่งอธิบายว่าเป็นสองเบนช์มาร์คที่ท้าทายที่สุดในชุด v6.1 บน Qwen3-VL บริษัทรายงานอัตราการประมวลผลสูงสุดถึง 3.7 เท่าเหนือ GB300 NVL72 ในทุกสถานการณ์ offline, server และ interactive โดยใช้ vLLM พร้อมเฟรมเวิร์กการสรุปผลแบบเปิดแหล่งข้อมูล NVIDIA Dynamo ใน DeepSeek-R1 ใช้ไลบรารี NVIDIA TensorRT-LLM บริษัทรายงานอัตราการประมวลผลสูงสุดถึง 2.5 เท่าเหนือ GB300 NVL72
ตัวเลข Closed division ที่อ้างอิงได้มาจาก mlcommons.org เมื่อวันที่ 16 กันยายน 2026 และมาจากรายการส่ง 6.1-0106 และ 6.1-0074 ตามการอ้างอิงที่เผยพร้อมผลลัพธ์ NVIDIA ระบุว่าประสิทธิภาพนี้หมายความว่าแต่ละแร็ค Vera Rubin NVL72 ให้โทเคนมากขึ้นอย่างมีนัยสำคัญ ให้บริการผู้ใช้มากขึ้นและสร้างรายได้มากกว่าแร็ค GB300 NVL72 ในขณะที่ลดต้นทุนต่อโทเคน
Nebius ก็ได้ส่งผลลัพธ์พรีวิว Vera Rubin NVL72 ในรอบเดียวกัน; NVIDIA อธิบายผลลัพธ์เหล่านั้นว่าแสดงถึงประสิทธิภาพที่ยอดเยี่ยม
การออกแบบร่วมฮาร์ดแวร์-ซอฟต์แวร์และการทดสอบแบบ Agentic
NVIDIA ให้เครดิตการออกแบบร่วมแบบเต็มสแตกระหว่างฮาร์ดแวร์และซอฟต์แวร์ต่อผลลัพธ์ บริษัทระบุว่า Tensor Cores ที่ปรับปรุงของ Vera Rubin และ Transformer Engine เร่งขั้นตอน prefill และ decode ของการสรุปผล ในขณะที่ความแม่นยำ NVFP4 ลดขนาดหน่วยความจำของน้ำหนักโมเดล, attention และ KV cache ทำให้อัตราการประมวลผลเพิ่มขึ้นโดยที่ NVIDIA กล่าวว่ามีการสูญเสียคุณภาพผลลัพธ์เพียงเล็กน้อย
การส่งผลลัพธ์ใช้การให้บริการแบบแยกส่วน (disaggregated serving) ซึ่งแยกขั้นตอน prefill และ decode พร้อมกับการขนานผู้เชี่ยวชาญขนาดใหญ่ในชั้น mixture-of-experts ที่ใช้โดยโมเดลเช่น DeepSeek-R1 และ Qwen3-VL NVIDIA ระบุว่าโดเมนการขยายขนาด NVL72 ซึ่งสร้างบน NVLink รุ่นที่หกและ NVLink Switch ให้ระดับการส่งแพ็กเก็ตสูงกว่า 10 เท่าและความหน่วงเวลาต่ำกว่า 3 เท่าเมื่อเทียบกับ Ethernet แบบสำเร็จรูป ทำให้เป็นพื้นฐานการเชื่อมต่อสำหรับเทคนิคเหล่านี้ในระดับแร็ค
บริษัทยังรายงานว่า Vera Rubin NVL72 ให้ประสิทธิภาพที่ดีกว่า GB300 NVL72 ถึง 30 เท่าในการทดสอบพรีวิวบนเบนช์มาร์ค SemiAnalysis AgentX ซึ่งออกแบบเพื่อวัดงานแบบ agentic NVIDIA ระบุว่าเบนช์มาร์ค MLPerf Endpoints ที่กำลังจะมาถึงจะนำการวัดมาตรฐานมาสำหรับงานสรุปผลแบบ agentic ที่เกินกว่าที่เบนช์มาร์คการประมวลผลแบบดั้งเดิมสามารถจับได้
การขยายขนาด GB300 NVL72, การเพิ่มประสิทธิภาพซอฟต์แวร์และผลลัพธ์ของพันธมิตร
ในรอบเดียวกัน การส่ง DeepSeek-R1 ของ NVIDIA ขยายจากแร็ค GB300 NVL72 เดียวที่มี 72 GPU ไปเป็นสี่แร็ครวมเป็น 288 GPU ทำให้ได้ประสิทธิภาพการขยายขนาด 99% ในสถานการณ์ offline โดยอัตราการประมวลผลเพิ่มขึ้นเกือบสัดส่วนกับฮาร์ดแวร์ที่เพิ่ม; บริษัทอ้างอิงรายการ 6.1-0073 และ 6.1-0074 ในเบนช์มาร์ค WAN 2.2 text-to-video, GB300 NVL72 ทำได้ 0.65 วิดีโอ 720p ต่อวินาที ที่ 5.7 วินาทีต่อวิดีโอ ซึ่ง NVIDIA ระบุว่าแสดงอัตราการประมวลผลสูงกว่า 9 เท่าและความหน่วงเวลาต่ำกว่า 7.5 เท่าเมื่อเทียบกับโหนดเดียว
NVIDIA รายงานว่าประสิทธิภาพของ GB300 NVL72 บน Qwen3-VL ปรับปรุงได้ถึง 1.6 เท่าใน v6.1 เมื่อเทียบกับผลลัพธ์ v6.0 โดยอ้างถึงความแม่นยำ KV cache ที่ต่ำลง, การรวมเคอร์เนลเพิ่มเติม, เคอร์เนลที่ดีกว่าและการให้บริการแบบแยกส่วนด้วย vLLM และ NVIDIA Dynamo บริษัทระบุว่าการปรับแต่งดำเนินต่อไปหลังจากกำหนดเวลาส่ง v6.1 และผลลัพธ์หลังการส่งบน GPT-OSS-120B และ DLRMv3 แสดงการเพิ่มประสิทธิภาพเพิ่มเติม แม้ว่าตัวเลขเหล่านั้นยังไม่ได้รับการตรวจสอบจาก MLCommons
นอกเหนือจากแพลตฟอร์มระดับแร็ค, NVIDIA ส่งผลลัพธ์ Jetson AGX Thor โดยใช้ไลบรารี TensorRT Edge-LLM บนเบนช์มาร์ค Edge-Agentic ที่เพิ่งเปิดตัวใหม่กับโมเดล Qwen3.6-27B บริษัทระบุว่ามีพันธมิตร 19 รายเข้าร่วมในรอบนี้, แปดรายส่งผลลัพธ์บนระบบ Blackwell NVL72 แบบหลายโหนด: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro และ Wiwynn
MLCommons ระบุในหน้ากรอบการวัดของตนว่าผลลัพธ์ที่เผยแพร่บางครั้งอาจถูกแก้ไขหรือทำให้ไม่เป็นผลหลังจากการเผยแพร่ครั้งแรก, โดยการเปลี่ยนแปลงใด ๆ จะถูกบันทึกในบันทึกการเปลี่ยนแปลงของพวกเขา












