AI 模型与平台
CoreWeave 将在机架规模上以裸金属方式运行 NVIDIA Vera CPU

CoreWeave 在 2026 年 9 月 30 日表示,将通过 NVIDIA Vera CPU 扩展其计算产品组合,称其为首款为 AI 代理设计的 CPU,并将在机架规模上以裸金属方式运行该处理器,以支持代理式 AI 和强化学习工作负载。
该消息在位于旧金山的 CoreWeave AI 云会议 Fully Connected 上发布,CoreWeave 称该会议汇聚了超过 4,500 名客户、合作伙伴、开发者和 AI 领袖。Fully Connected 2026 将于 2026 年 9 月 29 日至 10 月 1 日在 Moscone South(地址 747 Howard Street)举行。
代理式 AI 背后的 CPU 工作
CoreWeave 将代理式 AI 描述为通过运行、观察、策划、改进和评估的连续循环来运作。在该循环中,GPU 负责模型训练和推理,而 CPU 则处理每一步的相关工作:隔离的沙箱、强化学习环境、工具调用、代码执行以及数据流水线。
CoreWeave 称对数据预处理流水线和强化学习训练回合的需求呈突发且难以预测的特性:循环中的单一步骤可能在一小时内需要数千个环境,而在下一次运行前几乎没有需求。随着后训练和代理式工作负载的增长,公司表示,这类 CPU 密集型工作正日益决定 AI 循环的节奏,基础设施既需要满足这种需求的密度,又需具备随需求变化而弹性扩展的能力。
公司表示,Vera CPU 的运行方式与 CoreWeave 其余计算资源相同:裸金属部署,使用相同的平台、计费模型和经济性。
机架规模部署与 CoreWeave 沙箱
CoreWeave 表示,衡量代理式 AI 的关键性能指标之一是团队能够同时运行的隔离代理环境数量,以及随着该数量增加时每个沙箱的性能是否保持一致。其机架规模的 Vera 部署在单个机架中容纳了 128 颗 CPU 和 11,264 个核心,配备 BlueField-4 DPU 和 Spectrum-X 以太网交换机连接 Vera 节点;公司称这能够支持超过 11,000 个并发环境的容量。
CoreWeave 表示,其 Sandboxes 产品在部署这些代理时实现完整的硬件隔离,并直接放置在其支持的训练作业旁边。公司在测试中报告称,使用 NVIDIA Vera CPU 的代理沙箱启动时间比在 x86 CPU 上快超过 3 倍。
“通用基础设施限制了代理式 AI 的发展;Vera 是首款专为加速它而设计的 CPU,” CoreWeave 产品与工程执行副总裁 Chen Goldberg 在 公司的公告 中表示。Goldberg 说,CoreWeave 平台通过诸如 CoreWeave Sandboxes 等产品原生支持 Vera,使团队能够立即启动数千个隔离环境,而无需额外的运维摩擦。
Signal65 总裁兼总经理 Ryan Shrout 表示,代理循环中越来越多的部分是 CPU 工作,并且随着后训练和代理部署的规模扩大,这一比例只会进一步提升。他指出,周边平台决定团队是否能够真正利用这些容量,而运维差异来源于在裸金属上与已有的训练集群并行运行 CPU 工作,并在现有编排系统下进行管理。
CoreWeave 推出 CoreWeave Sandboxes 于 2026 年 5 月 14 日,作为提供安全、隔离环境的执行层,AI 研究人员和平台团队可在其中运行强化学习、代理工具使用以及模型评估。该产品可通过 CoreWeave Kubernetes Service 在客户自有的 CoreWeave 基础设施上使用,或通过 Weights & Biases 作为无服务器运行时使用,并配备包含会话管理、存储集成和监控工具的 Python SDK。CoreWeave 表示,默认情况下,每个沙箱都在完全隔离的虚拟环境中运行,因而一个沙箱中的故障或失控进程不会蔓延到其他沙箱。
CoreWeave 还提到了其在推理和训练方面的 MLPerf 基准测试结果,并指出其是唯一连续三次获得 SemiAnalysis ClusterMAX 顶级白金排名的 AI 云服务提供商。
NVIDIA Vera CPU 规格
NVIDIA 的 Vera CPU 产品页面 将该处理器描述为专为 CPU 在代理式 AI 背后的工作以及强化学习而构建:代码执行、工具使用、沙箱化、分析、数据流水线以及模型之外的编排。根据 NVIDIA 的说法,Vera 搭载 88 核定制的 Olympus 核心,其空间多线程技术能够创建 176 条线程,并对核心资源进行分区。
NVIDIA 表示,内存带宽在 LPDDR5X 上可达每秒 1.2 TB,内存容量最高可达 1.5 TB。第二代 NVIDIA 可扩展一致性互连结构将所有 88 核心、缓存、内存、IO 和 NVLink-C2C 在单个计算芯片上连接,提供 3.4 TB/s 的分割带宽,而 NVLink-C2C 在 Vera CPU 与 NVIDIA GPU 之间提供最高 1.8 TB/s 的一致性带宽。
NVIDIA 表示,Vera 在编译、代码分析以及 Python 工具链工作负载方面,比领先的 x86 CPU 快最高 1.8 倍,并且其 LPDDR5X 内存子系统提供的带宽是领先 x86 CPU(DDR5)的 2 倍,且每核带宽是其 3 倍。产品页面指出,这些相对性能数据基于测量数据,以最新一代 x86 CPU 为基准,并可能会更改。
NVIDIA 将 Vera 定位为加速系统的宿主 CPU,涵盖包括 Vera Rubin NVL72 和 HGX Vera Rubin NVL8 平台在内的方案,同时也作为面向代理式 AI、强化学习、数据处理和分析的独立 CPU。根据公司介绍,基于 NVIDIA MGX 构建的 Vera CPU Rack 可容纳最多 256 粒 Vera CPU,并能够运行超过 22.5K 个并发环境。Vera Rubin NVL72 在一个机架规模平台中集成了 72 块 Rubin GPU、36 粒 Vera CPU、ConnectX-9 SuperNIC 和 BlueField-4 DPU。












