AI 모델 및 플랫폼

NVIDIA Vera Rubin NVL72, 최초 MLPerf Inference 프리뷰 결과 발표

mm
Unite.AI를 Google의 선호 소스에 추가

NVIDIA는 2026년 9월 16일에 MLPerf Inference v6.1 제출 결과를 발표했으며, 이는 Vera Rubin NVL72 시스템의 최초 MLPerf Inference 프리뷰 제출을 강조한 것으로, 회사는 이 시스템이 Qwen3-VL 벤치마크에서 GB300 NVL72 시스템보다 최대 3.7배 높은 처리량을 제공한다고 밝혔습니다.

MLPerf Inference: Datacenter는 MLCommons Association이 제공하는 벤치마크 스위트로, 학습된 모델을 사용하여 시스템이 입력을 처리하고 결과를 생성하는 속도를 측정합니다. MLCommons의 공개 정의에 따르면, 닫힌(Closed) 부문—NVIDIA가 주요 수치에 인용한 카테고리—은 하드웨어 플랫폼과 소프트웨어 프레임워크를 “사과 대 사과”로 비교할 수 있도록 참조 구현과 동일한 모델을 사용해야 하며, 프리뷰(Preview) 가용성 카테고리의 시스템은 다음 제출 라운드에서 사용 가능(Available)으로 제출될 수 있어야 합니다.

DeepSeek-R1 및 Qwen3-VL 프리뷰 결과

NVIDIA는 DeepSeek-R1 및 Qwen3-VL에 대한 Vera Rubin NVL72 프리뷰 결과를 제출했으며, 이를 v6.1 스위트에서 가장 까다로운 벤치마크 중 두 개라고 설명했습니다. Qwen3-VL에서는 vLLM과 NVIDIA Dynamo 오픈소스 추론 프레임워크를 사용해 오프라인, 서버, 인터랙티브 시나리오 전반에서 GB300 NVL72 대비 최대 3.7배 높은 처리량을 기록했다고 회사는 밝혔습니다. DeepSeek-R1에서는 NVIDIA TensorRT-LLM 라이브러리를 사용해 GB300 NVL72 대비 최대 2.5배 높은 처리량을 보고했습니다.

인용된 Closed 부문 수치는 2026년 9월 16일 mlcommons.org에서 확인했으며, 결과와 함께 공개된 인용에 따르면 제출 항목 6.1-0106 및 6.1-0074에서 가져온 것입니다. NVIDIA는 이 성능이 각 Vera Rubin NVL72 랙이 GB300 NVL72 랙보다 훨씬 더 많은 토큰을 제공하고, 더 많은 사용자를 지원하며, 더 높은 수익을 창출하면서 토큰당 비용을 낮춘다고 설명했습니다.

Nebius도 같은 라운드에서 Vera Rubin NVL72 프리뷰 결과를 제출했으며, NVIDIA는 해당 결과가 뛰어난 성능을 보여준다고 설명했습니다.

하드웨어-소프트웨어 공동 설계 및 에이전시 테스트

NVIDIA는 하드웨어와 소프트웨어 전반에 걸친 풀스택 공동 설계가 이번 결과의 원인이라고 밝혔습니다. 회사는 Vera Rubin의 향상된 Tensor Core와 Transformer Engine이 추론의 프리필(pre-fill) 및 디코드 단계 모두를 가속화하며, NVFP4 정밀도가 모델 가중치, 어텐션 및 KV 캐시의 메모리 사용량을 줄여 처리량을 높이면서 출력 품질 손실은 최소화된다고 설명했습니다.

제출물은 프리필과 디코드를 분리하는 디스어그리게이티드 서빙(disaggregated serving)과 DeepSeek-R1 및 Qwen3-VL과 같은 모델이 사용하는 혼합 전문가(mixture-of-experts) 레이어 전반에 걸친 대규모 전문가 병렬성을 결합했습니다. NVIDIA는 6세대 NVLink와 NVLink Switch를 기반으로 구축된 NVL72 스케일업 도메인이 상용 이더넷보다 10배 높은 패킷 전송률과 3배 낮은 지연 시간을 제공하여 랙 규모에서 이러한 기술을 위한 인터커넥트 기반을 제공한다고 밝혔습니다.

또한 회사는 Vera Rubin NVL72가 에이전시 워크로드를 측정하도록 설계된 SemiAnalysis AgentX 벤치마크에서 프리뷰 테스트 시 GB300 NVL72 대비 30배 뛰어난 성능을 보여줬다고 보고했습니다. NVIDIA는 향후 출시될 MLPerf Endpoints 벤치마크가 기존 처리량 벤치마크가 포착하지 못하는 에이전시 추론 워크로드에 대한 표준화된 측정을 제공할 것이라고 밝혔습니다.

GB300 NVL72 확장, 소프트웨어 향상 및 파트너 결과

같은 라운드에서 NVIDIA의 DeepSeek-R1 제출은 72개의 GPU를 탑재한 단일 GB300 NVL72 랙에서 288개의 GPU를 갖춘 네 개의 랙으로 확장되었으며, 오프라인 시나리오에서 99%의 스케일링 효율을 달성했고, 처리량은 추가된 하드웨어에 거의 비례하여 증가했습니다; 회사는 항목 6.1-0073 및 6.1-0074를 인용했습니다. WAN 2.2 텍스트‑투‑비디오 벤치마크에서 GB300 NVL72는 초당 0.65개의 720p 비디오(비디오당 5.7초)를 기록했으며, 이는 단일 노드 대비 9배 높은 처리량과 7.5배 낮은 지연 시간을 의미한다고 NVIDIA는 밝혔습니다.

NVIDIA는 Qwen3-VL에서 GB300 NVL72의 성능이 v6.0 결과 대비 v6.1에서 최대 1.6배 향상되었으며, 이는 KV 캐시 정밀도 감소, 추가 커널 융합, 향상된 커널 및 vLLM과 NVIDIA Dynamo를 활용한 디스어그리게이티드 서빙 덕분이라고 설명했습니다. 회사는 최적화가 v6.1 제출 마감일 이후에도 계속 진행되었으며, GPT-OSS-120B와 DLRMv3에 대한 제출 후 결과가 추가적인 향상을 보여주지만, 해당 수치는 아직 MLCommons에 의해 검증되지 않았다고 밝혔습니다.

랙 규모 플랫폼을 넘어, NVIDIA는 Qwen3.6-27B 모델을 사용한 신규 Edge-Agentic 벤치마크에서 TensorRT Edge-LLM 라이브러리를 활용한 Jetson AGX Thor 결과를 제출했습니다. 회사는 이번 라운드에 19개의 파트너가 참여했으며, 그 중 8개는 멀티노드 Blackwell NVL72 시스템으로 제출했으며, 파트너는 ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro 및 Wiwynn입니다.

MLCommons는 벤치마크 페이지에 게시된 결과가 초기 공개 후에 수정되거나 무효화될 수 있으며, 모든 변경 사항은 변경 로그에 기록된다고 명시하고 있습니다.

테오 내쉬유나이트.AI의 AI 생성 전문가로, AI 인프라, 컴퓨팅, 및 현대적인 인공 지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드를 위한 기술적 기초에 중점을 두고 있으며, 데이터 센터, 가속기, 네트워킹, 및 이를 연결하는 소프트웨어 스택을 포함합니다.
분석적이고 엔지니어링 중심의 관점에서 테오 내쉬는 GPU, 커스텀 실리콘, 메모리 아키텍처, 및 분산 시스템의 발전에 따라 새로운 세대의 AI 모델이 어떻게 가능해지는지 조사합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성, 및 실제로 AI 인프라를 배치하는 실질적인 제약에 특별한 주의를 기울입니다.
테오 내쉬가 작성한 기사들은 AI로 생성되어 유나이트.AI의 편집 팀에 의해 검토되어 기술적 정확성, 명확성, 및 급변하는 AI 컴퓨팅 환경에 대한 책임 있는 보도를 보장합니다.