AI 模型与平台

OceanStor M900 为华为 SuperPoDs 引入 PB 级上下文内存

mm
将 Unite.AI 添加到您在 Google 上的首选来源

华为于2026年9月17日在上海的 HUAWEI CONNECT 2026 上推出了 OceanStor M900 Context Memory Storage,揭示了一款面向超大规模数据中心 AI 推理的存储系统。华为董事会副主席兼轮值主席 David Wang 在主题演讲中展示了该产品,华为表示单个集群可提供 64 PB 的 KV 缓存容量。

华为称,该系统为 SuperPoDs 提供了全共享内存空间,具备 PB 级容量和 TB/s 级性能,基于公司统一总线(UnifiedBus)互连网络构建。Wang 的主题演讲题为《推进代理世界,构建坚实硅基基础》,华为将此次发布描述为 AI 基础设施从计算中心模型向计算、网络和存储更深度协同转变的标志。

大规模 AI 推理中的内存限制

在公告中,华为将 2026 年描述为 AI 从技术突破迈向大规模落地的一年,应用从聊天机器人演进为能够自主完成复杂任务的代理。公司称这些代理已在科研、医疗、金融和公共服务等领域广泛采用,并将此转变形容为代理 AI 时代的开端。

华为表示,大模型的参数规模正增长至 10 万亿级别,而主流模型已支持超过一百万 token 的上下文窗口,使多轮推理和复杂任务成为常态,并推动 KV 缓存数据持续增长。随着这些数据的累积,公司称片上内存和 DRAM 在容量和成本效益方面已被逼至极限。公告附带的 FAQ 将 KV 缓存定义为在大模型推理过程中生成的键值数据存储,以便在后续推理中重复使用,避免冗余计算。华为描述了业界围绕构建多层存储的共识,即将片上内存、DRAM 和 SSD 协调为全共享内存空间,并称 M900 的设计旨在突破超长上下文和多轮推理中的内存容量瓶颈。公司还将 SuperPoDs 定位为模型规模化时的 AI 基础设施最佳选择。

M900 背后的三大技术

在容量方面,华为称统一总线(UnifiedBus)互连使 OceanStor M900 能够构建 PB 级、全球多层 KV 缓存,实现单跳连接,在具备分层存储的集群中对缓存进行汇聚和共享。该设计将 SuperPoD 的 KV 缓存从片上内存和 DRAM 扩展至 SSD,据公司称单个集群可提供 64 PB 的容量。华为表示,每个 NPU 可用的 KV 缓存容量从 GB 级提升至 TB 级,能够存储、共享和重复使用更多上下文,从而显著提升 KV 缓存命中率。

在性能方面,华为将 OceanStor M900 描述为业界首个将 CPU、网络控制单元和 NAND 控制单元集成的架构,提供原生 KV 语义,使 SuperPoD 的 NPU 能够实现对 SSD 的单跳连接。公司称,消除协议转换和 CPU 转发将访问延迟从毫秒级降低至 60 微秒,下降幅度达 90%。华为还报告单个集群的聚合访问带宽为 40 TB/s,称该数值比同类方案高出 1.5 倍。在典型的 AI 编程场景中,公司表示,该架构可使 推理 集群的 token 吞吐量翻倍,并将首次 token 的时间缩短一半。

在成本方面,华为表示 M900 采用业界首个 KV 感知自适应存储技术,该技术依据数据价值预测 KV 缓存生命周期,并相应地在存储介质之间分配数据。公司称该技术支持每日最多 24 次磁盘写入,将 SSD 耐久性提升 16 倍,并保证三年稳定性,从而降低 大规模推理 基础设施的介质更换及运维成本。

产品定位与活动详情

在 FAQ 中,华为将以 M900 为代表的上下文存储描述为面向超大规模数据中心 SuperPoDs 的全新数据基础设施,提供 PB 级全共享内存,并实现跨片上内存、DRAM 与 SSD 的分层存储和 KV 缓存高效调度。公司表示,随着持续提升超大规模推理 KV 缓存的容量和访问效率,上下文存储将变得至关重要。华为还称将继续推动硬件与软件的协同以及系统级创新,提供开放、高效、可持续的 AI 基础设施,以支撑各行业的智能转型。

HUAWEI CONNECT 2026 主题为“推进代理世界”,于 2026 年 9 月 17 日至 19 日在上海世博展览会议中心和上海世博中心举办,公告称本次活动将从战略、技术和生态系统层面审视 AI。官方活动页面列出包括三场主题演讲、20 场峰会、60 多场分会以及 200 多场公开演讲的日程,已确认的主题演讲嘉宾包括 Linux Foundation CEO Jim Zemlin、科大讯飞董事长刘庆峰以及华为云 CEO Peter Zhou。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。