AI 모델 및 플랫폼
CoreWeave, 수백 대의 Rubin GPU를 하나의 멀티랙 클러스터에 연결

CoreWeave는 2026년 9월 16일 발표했다 멀티랙 NVIDIA Vera Rubin NVL72을 CoreWeave Cloud에 구축했으며, 수백 대의 NVIDIA Rubin GPU를 에이전트 AI용 단일 스케일아웃 클러스터에 배치했습니다. 또한 회사는 CoreWeave AI Object Storage에 두 가지 새로운 기능을 도입했습니다: 지역 간 쓰기 가속화와 새로운 Archive 계층.
CoreWeave의 제품 및 엔지니어링 담당 부사장인 Chen Goldberg는 CoreWeave가 Vera Rubin NVL72을 검증하고 구축한 최초의 AI 클라우드 제공업체이며, 랙 스케일 아키텍처가 신뢰할 수 있는 고성능 클라우드 서비스로 운영될 수 있음을 입증했다고 말했습니다. “멀티랙 Vera Rubin을 통해 우리는 수백 대의 Rubin GPU를 단일 스케일아웃 클러스터로 연결하고 있습니다,”라고 Goldberg는 말했으며, 에이전트 AI를 구축하는 고객에게 이는 더 큰 규모, 더 빠른 반복, 그리고 모델과 에이전트가 지속적으로 학습하고 개선함에 따라 생산성이 향상된다는 의미라고 덧붙였습니다.
멀티랙 아키텍처 및 구축
단일 Vera Rubin NVL72 랙은 72개의 Rubin GPU와 36개의 Vera CPU, NVIDIA NVLink 6, ConnectX-9 SuperNIC, 그리고 BlueField-4 DPU를 결합합니다. 멀티랙 Vera Rubin NVL72를 사용하면 CoreWeave는 NVIDIA Spectrum-X 이더넷 네트워킹을 이용해 수백 대의 가속기를 하나의 스케일아웃 클러스터로 통합합니다. CoreWeave는 이 시스템이 더 큰 모델을 학습하고, 보다 까다로운 추론 워크로드를 제공하며, 대규모 강화학습을 실행할 수 있는 용량을 제공한다고 밝혔습니다.
회사에 따르면, 수백 대의 Rubin GPU에 걸쳐 학습 및 추론 작업을 실행하는 것은 다단계 에이전트 워크로드에 중요합니다. 이러한 워크로드는 데이터 접근 지연에 민감한데, 지연이 반복적인 모델 호출 및 도구 사용 시 누적될 수 있기 때문입니다.
CoreWeave는 자동화된 랙 라이프사이클 제어, 시스템 수준 검증 및 네트워크 확장을 통해 여러 랙을 단일 시스템으로 구축한다고 밝혔습니다. CoreWeave Mission Control은 Rack LifeCycle Controller를 통해 랙 설정을 자동화하며, 하드웨어 감지, 펌웨어 업데이트, 검증, 전원 및 냉각 등 설정 작업을 수행합니다; Racky는 랙 수준 제어를 담당하고 Valvey는 냉각 작업을 수행합니다. 랙이 생산에 들어가기 전에 CoreWeave는 NVIDIA 현장 진단과 전체 랙 워크로드 테스트를 결합해 모든 결과를 비교하며, 시스템 기준을 통과한 랙만이 생산에 투입됩니다.
네트워크 측면에서, 각 Rubin GPU는 두 개의 ConnectX-9 SuperNIC를 탑재하여 멀티플레인·멀티레일 경로를 통해 GPU당 1.6 Tb/s의 스케일아웃 연결성을 제공합니다. CoreWeave는 이 설계가 비차단 패브릭에서 레일당 약 128,000개의 GPU를 지원하며, 모듈형 토폴로지를 통해 확장 시마다 패브릭을 재설계하지 않고도 랙을 추가할 수 있다고 밝혔습니다.
지역 간 AI 객체 스토리지
CoreWeave AI Object Storage는 LOTA(Local Object Transport Accelerator)를 통해 데이터와 워크로드 간 거리를 가깝게 만들며, 각 CoreWeave Kubernetes Service 노드에 관리형 캐싱을 적용합니다. CoreWeave는 LOTA가 로컬 NVMe 속도로 읽기를 제공하고, 기존 스토리지 클러스터에서 읽는 것에 비해 지연 시간을 8배 감소시키며, 클러스터가 성장함에 따라 선형적으로 확장되는 GPU당 최대 7 GB/s의 처리량을 제공한다고 밝혔습니다.
새로운 지역 간 쓰기 가속화 기능은 체크포인트를 지역 내에서 로컬 지연 시간으로 기록하게 하며, 데이터는 백그라운드에서 두 번째 원격 지역으로 이동합니다. 애플리케이션이 단일 버킷을 보게 되므로 코드 변경이 필요 없으며, 쓰기가 발생한 지역에 관계없이 권한 및 보존 규칙이 동일하게 작동합니다. CoreWeave는 이 기능이 학습 중단 시간을 최소화하고, 지역 간 데이터를 수동으로 복사하거나 이동할 필요를 없앤다고 밝혔습니다.
두 번째 추가 기능인 Archive는 데이터를 검색하거나 조기에 삭제하거나 계층에서 읽을 때 비용이 전혀 들지 않는 저비용 스토리지 계층입니다. CoreWeave는 이를 팀이 보통 삭제할 데이터, 예를 들어 거의 성공한 실행의 체크포인트, 결과 재현에 필요한 데이터셋, 혹은 6개월 후에 누군가 물어볼 수 있는 모델 버전 등을 위해 구축된 것으로 설명했습니다.
“우리 데이터셋은 여러 지역에 걸쳐 있으며, 지역 간 검색 지연 때문에 학습 일정이 좌우될 여유가 없습니다,” 라고 Cohere의 내부 인프라 담당 이사 Cécile Robert-Michon이 말했습니다. “CoreWeave AI Object Storage는 지역별로 로컬 캐시된 읽기를 제공해 통합된 데이터셋 발자국을 만들며, 네트워크 대기 시간이 없습니다.”
NVIDIA Vera Rubin NVL72 사양
NVIDIA의 Vera Rubin NVL72 제품 페이지는 이 시스템을 3세대 MGX NVL72 랙 설계를 기반으로 구축된 랙 스케일 에이전트 AI 슈퍼컴퓨터이며 현재 전량 생산 중이라고 설명합니다. NVIDIA가 공개한 사양에는 20.7 TB의 HBM4 GPU 메모리와 1,400 TB/s 대역폭, 6세대 NVLink 기반 216 TB/s NVLink 대역폭, 그리고 랙당 3,600 PFLOPS의 희소 NVFP4 추론 연산 능력이 포함됩니다. 이 랙의 36개 Vera CPU는 3,168개의 맞춤형 Olympus 코어와 최대 54 TB의 LPDDR5X 메모리를 제공합니다.
NVIDIA는 Vera Rubin NVL72가 GB200 NVL72에 비해 GPU 수를 1/4로 줄여 혼합 전문가 모델을 학습하며, 고도로 인터랙티브하고 깊은 추론을 수행하는 에이전트 AI에 대해 백만 토큰당 비용을 1/10로 낮추고, 메가와트당 최대 10배 더 많은 토큰을 처리할 수 있다고 밝혔습니다. 페이지의 각주에서는 추론 수치는 변동될 수 있으며, 학습 비교는 예상 성능임을 명시하고 있습니다.
발표에서 CoreWeave는 성능 기록을 강조하며, 추론 및 학습에서 기록적인 MLPerf 벤치마크 결과와 SemiAnalysis ClusterMAX 1.0 및 2.0에서 최고 플래티넘 등급을 획득한 유일한 AI 클라우드라는 위치를 언급했습니다. 또한 회사는 인공 분석(Artificial Analysis)이 수행한 독립 추론 벤치마크에서 Moonshot AI의 Kimi K2.6 및 Kimi K2.7 Code 모델에 대해 추론 속도와 가격‑성능 부문에서 1위 순위를 차지했다고 밝혔습니다.












