AI 模型与平台
CoreWeave 将数百个 Rubin GPU 连接在单个多机架集群中

CoreWeave 于 2026年9月16日 宣布 在 CoreWeave Cloud 上启动多机架 NVIDIA Vera Rubin NVL72,将数百个 NVIDIA Rubin GPU 放入单个可扩展集群,以支持 agentic AI。该公司还在 CoreWeave AI Object Storage 中推出了两项新功能:跨区域写入加速和全新归档层。
CoreWeave 的产品与工程执行副总裁 Chen Goldberg 表示,CoreWeave 是首家验证并启动 Vera Rubin NVL72 的 AI 云服务提供商,并展示了机架级架构能够作为可靠的高性能云服务运行。”使用多机架 Vera Rubin,我们将数百个 Rubin GPU 连接为单个可扩展集群,” Goldberg 说,并补充道,对于构建 agentic AI 的客户而言,这意味着更大的规模、更快的迭代以及更高的生产力,因为模型和代理会持续学习和改进。
多机架架构与部署
单个 Vera Rubin NVL72 机架将 72 个 Rubin GPU 与 36 个 Vera CPU、NVIDIA NVLink 6、ConnectX-9 SuperNIC 和 BlueField-4 DPU 配对。通过多机架 Vera Rubin NVL72,CoreWeave 使用 NVIDIA Spectrum-X 以太网网络将数百个加速器的机架统一为单个可扩展集群。CoreWeave 表示,该系统提供了训练更大模型、处理更高要求推理工作负载以及大规模运行强化学习的能力。
公司称,在数百个 Rubin GPU 上运行训练和推理作业对于多步骤的 agentic 工作负载至关重要,因为此类工作负载对数据访问延迟敏感,延迟会在重复的模型调用和工具使用中累积。
CoreWeave 表示,通过自动化的机架生命周期控制、系统级验证和网络扩展,将多机架提升为单一系统。CoreWeave Mission Control 通过 Rack LifeCycle Controller 自动化机架设置,涵盖硬件检测、固件更新、验证、电源和散热等任务;Racky 负责机架层面的控制,而 Valvey 执行散热操作。在机架投入生产之前,CoreWeave 将 NVIDIA 现场诊断与全机架工作负载测试相结合,比较每项结果,只有通过系统级门槛的机架才会进入生产。
在网络方面,每个 Rubin GPU 配备两个 ConnectX-9 SuperNIC,提供每个 GPU 1.6 Tb/s 的多平面、多轨道可扩展连接。CoreWeave 表示,该设计在非阻塞的织体中支持每条轨道约 128,000 个 GPU,且模块化拓扑结构允许在每次扩展时无需重新设计织体即可添加机架。
跨区域 AI 对象存储
CoreWeave AI 对象存储通过 LOTA(本地对象传输加速器)将数据更贴近工作负载,该加速器在每个 CoreWeave Kubernetes Service 节点上实施受管缓存。CoreWeave 表示,LOTA 实现本地 NVMe 速度的读取,相比传统存储集群的读取将延迟降低 8 倍,并在集群规模扩大时线性扩展,每个 GPU 提供最高 7 GB/s 的吞吐量。
全新的跨区域写入加速使检查点能够在区域内部本地写入,保持本地延迟,同时数据在后台迁移至第二个远程区域。由于应用只看到单一存储桶,无需更改代码,权限和保留规则在写入来源区域不同的情况下仍保持一致。CoreWeave 表示,此功能最大限度地缩短训练暂停时间,消除手动在区域之间复制或移动数据的需求。
第二项新增功能 Archive 是一种低成本存储层,检索数据、提前删除以及读取该层数据均不收取费用。CoreWeave 将其描述为专为团队本会删除的数据而构建,例如一次几乎成功的运行产生的检查点、用于复现结果的数据集,或是六个月后可能被询问的模型版本。
“我们的数据集跨越多个区域,无法承受因跨区域检索延迟而导致的训练进度受限,”Cohere 内部基础设施总监 Cécile Robert-Michon 说。“CoreWeave AI 对象存储为我们提供了跨区域统一的数据集足迹,读取在本地缓存,因此无需在网络上等待。”
NVIDIA Vera Rubin NVL72 规格
NVIDIA 的 Vera Rubin NVL72 产品页面 将该系统描述为基于第三代 MGX NVL72 机架设计的机架级 agentic AI 超级计算机,现已全面投产。NVIDIA 公布的规格列出 20.7 TB 的 HBM4 GPU 内存,带宽为 1,400 TB/s,六代 NVLink 的 NVLink 带宽为 216 TB/s,以及每机架 3,600 PFLOPS 的稀疏 NVFP4 推理计算。该机架的 36 个 Vera CPU 提供 3,168 个定制 Olympus 核心和最高 54 TB 的 LPDDR5X 内存。
NVIDIA 表示,Vera Rubin NVL72 在训练 mixture-of-experts 模型时所需 GPU 数量仅为其 GB200 NVL72 的四分之一,并且在高度交互、深度推理的 agentic AI 场景下,推理成本仅为每百万标记的十分之一,且每兆瓦可处理的标记量高达原来的 10 倍。页面脚注指出,推理数据可能会变动,训练对比基于预测性能。
在公告中,CoreWeave 还指出其性能记录,引用了推理和训练方面创纪录的 MLPerf 基准结果,并且其是唯一在 SemiAnalysis ClusterMAX 1.0 和 2.0 中均获得最高白金等级的 AI 云。该公司还引用了 Moonshot AI 的 Kimi K2.6 和 Kimi K2.7 Code 模型在 Artificial Analysis 进行的独立推理基准测试中,推理速度和性价比均获得 #1 排名。












