AI 模型与平台

WEKA 推出 NeuralMesh 6 和 WEKApod 3,AI 基础设施转向推理

mm
将 Unite.AI 添加到您在 Google 上的首选来源

WEKA 推出了一项协调的软件和硬件改进,针对 AI 行业最昂贵的新兴问题之一:保持 GPU 在模型从训练转向持续的大规模推理时的高效利用。

宣布包括 NeuralMesh 6,这是公司数据和内存平台的重大更新,以及为 AI 云、模型开发人员、研究组织和使用 GPU 基础设施的企业设计的第三代 WEKApod 设备。

这些发布反映了 AI 基础设施设计的更广泛变化,存储从被动存储库演变为主动内存和数据传递层。

统一推向生产 AI

AI 推理的基础设施要求与模型训练大不相同。训练作业通常通过相对可预测的管道处理大型数据集。代理 AI、检索增强生成和长上下文推理系统必须访问不断变化的数据、在重复交互中保持上下文,并支持多个并发用户,而不会让昂贵的 GPU 等待信息。

WEKA 的回应是将存储、内存扩展、文件访问、对象访问和数据移动视为同一平台的组成部分。NeuralMesh 旨在为训练、推理和高性能计算提供共享的数据基础,适用于本地环境、公有云和混合部署。

新的版本扩展了该架构,增加了多租户、原生对象存储、分布式缓存、自动数据减少、Kubernetes 操作和集中式可观察性。

而不是将软件和设备公告视为无关的升级,公司将它们呈现为同一系统的两个部分。NeuralMesh 6 控制数据的存储、移动、隔离和传递,而 WEKApod 3 提供了围绕这些功能设计的硬件。

NeuralMesh 6 统一文件和对象工作负载

NeuralMesh 6 中最重要的添加之一是 原生 S3 实现,运行在 NVMe 存储上。同一底层数据块可以通过 S3 对象协议和 POSIX 或网络文件系统接口访问,而无需维护单独的副本。

这很重要,因为 AI 管道通常在对象存储、高性能文件系统、训练环境和推理集群之间移动信息。每个副本都会消耗容量、引入延迟并复杂化治理。统一命名空间可以使通过一种协议创建的数据立即通过另一种协议可用。

WEKA 表示,其实现支持每个节点 2,000 到 5,000 个并发 S3 连接。它还支持通过远程直接内存访问 (RDMA) 进行 S3 访问,允许数据在不经过多个 CPU 和操作系统层的情况下移动到 GPU 内存。

平台引入了两级多租户。可组合集群为每个租户分配专用处理器、内存和存储资源,而虚拟多租户提供网络隔离、独立加密、单独身份验证和每租户的服务质量控制。

虚拟环境可以支持每个集群超过 1,000 个隔离租户,根据公司的说法。结合物理和虚拟模型可以允许大型基础设施运营商在不为每个客户部署独立存储集群的情况下支持数万个逻辑上分离的客户。

将数据移动到 GPU 可用的任何位置

NeuralMesh 6 还引入了元数据优先复制和 AI 工作负载的远程缓存,分布在数据中心、云和地理区域中。

传统复制通常需要在工作负载开始之前复制整个数据集。NeuralMesh 相反,使目标的元数据立即可见,然后在请求时传输底层数据。

这可以让运营商在不必先复制与项目相关的每个文件的情况下,将作业移动到可用的 GPU 容量。这种方法旨在支持云爆发、分布式 AI 基础设施以及地理上分散的研究或工程团队之间的协作。

它还代表了一个全球命名空间模型的早期步骤,在该模型中,数据可以在原始存储位置无关的情况下一致地寻址。

另一个新功能是连续应用指纹、相似性哈希、去重和压缩,而不是将数据减少视为可选的后台过程。

WEKA 声称 NeuralMesh 6 可以在 AI 训练数据上提供高达六倍的容量节省,写入开销不到 5%。实际减少将取决于数据集。检查点、容器层、模型版本和迭代训练数据可能包含大量重复,而其他数据类型可能压缩效果较差。

公司计划在部署前分析代表性的客户数据,并使用生成的估计作为其容量和性能承诺的一部分。

将存储转变为扩展 AI 内存层

NeuralMesh 还包含 WEKA 的增强内存网格,它使用 NVMe 存储作为推理的 GPU 内存的持久扩展。

大型语言模型创建一个包含从提示或对话中计算出的信息的键值缓存。对于长上下文和代理工作流,该缓存可能变得非常大。当它不能保留在高带宽的 GPU 内存中时,系统可能需要丢弃它、重新计算它或将其移动到较慢的基础设施中。

增强内存网格将该缓存存储在持久的 NVMe 支持层中,并使用远程直接内存访问和 NVIDIA GPUDirect 存储将其移回 GPU。

目标是保留可重用上下文,同时减少重复的预填计算,这是长上下文推理中最耗资源的阶段之一。

WEKA 报告称,在使用 NVIDIA H100 GPU 的 Oracle (ORCL ) 云基础设施上进行的测试产生了十倍的令牌吞吐量、十倍的并发用户和每个 GPU 七倍的令牌。

这些数字是特定于工作负载的基准,而不是通用性能期望,但它们说明了为什么持久缓存管理正在成为推理基础设施设计的重要组成部分。

WEKApod 3 控制硬件层

虽然以前的 WEKApod 系统将 WEKA 软件与预验证基础设施相结合,但第三代系统更进一步地转向垂直集成系统设计。

WEKA 设计了新的两件式机箱、驱动器互连、冷却体系、故障域和服务系统。设备使用内部 PCI Express Gen 6 和 NVIDIA (NVDA ) ConnectX 网络连接到 Spectrum-X 以太网基础设施。

WEKApod 系列现在由三种可配置系统组成。Nitro 优化用于带宽密集型推理和 AI 工厂工作负载。Prime 结合三层单元和四层单元闪存,以平衡性能和容量。Prime Max 优先考虑最大存储密度,可以在两件式机箱中容纳多达 70 个 NVMe 驱动器。

在满机箱规模上,WEKA 表示 Prime Max 可以提供 441.5 PB 的原始容量和在 NeuralMesh 数据减少后 1.1 EB 的有效容量。机箱级系统的吞吐量最高可达每秒 10.2 TB,输入/输出操作每秒最高可达 2100 万。

原始容量和有效容量之间的区别很重要。艾字节的数字取决于存储数据的可实现的减少量,不应被解释为超过艾字节的物理闪存。

即使如此,更大的密度也可以在存储与 GPU 竞争机架空间、冷却和电力容量的设施中产生有意义的后果。

为受限数据中心设计

新的系统还解决了 日益影响 AI 基础设施项目的物理限制

GPU 集群需要大量电力、冷却、网络和地板空间。效率低下的存储系统会消耗这些资源,从而减少设施可以支持的加速器数量。

WEKA 声称新的设备提供了 267% 更高的有效容量密度和 114% 更高的性能密度,相比同类中最好的公开可用替代品。

公司还设计了这些系统,以便在高达 35 度 Celsius 的环境温度下运行。软件控制的电力节制旨在在热应力期间逐渐降低性能,而不是触发关机。

无背板驱动器设计创建了较小的故障域,而热插拔启动驱动器和引导式更换程序旨在减少维护时间。客户可以配置机箱类型、内存、驱动器容量和驱动器数量,部署范围从不到 1 PB 到超过 100 PB。

围绕 AI 工厂构建生态系统

伴随的合作伙伴公告表明,该平台将通过基础设施集成商、云提供商和 AI 编排供应商到达客户。

Spectro Cloud 将 NeuralMesh 定位为一种可以与 PaletteAI 结合用于部署和操作企业 AI 工厂的数据层。World Wide Technology 和 Computacenter 计划将这些系统纳入更广泛的基础设施项目中,而 Glocomp 强调了客户对更好 AI 性能和更可预测基础设施成本的需求。

这种生态系统战略很重要,因为大多数组织不会从单一供应商组装生产 AI 环境。

典型的部署可能包括来自多个供应商的 GPU、网络、存储、Kubernetes、模型服务软件、可观察性、安全性和治理产品。联合验证的配置可以减少集成工作,尽管客户仍需要使用自己的模型、数据集、网络和并发性要求测试性能。

这对 AI 基础设施意味着什么

公告中最重要的方面不是任何单个容量或吞吐量数字。它是存储、分布式缓存、内存管理、数据移动和租户隔离的日益融合。

随着 AI 代理保留更长的历史、访问更多企业信息并连续运行,围绕 GPU 的基础设施将越来越多地决定每个有用的响应的成本。

添加更多加速器不会解决由重复上下文处理、慢速数据移动、碎片化协议或未充分利用的存储容量引起的瓶颈。因此,AI 基础设施的下一阶段将取决于高效地为 GPU 提供数据和管理它们的能力,就像增加原始计算能力一样。

NeuralMesh 6 计划在 2026 年下半年成为普遍可用,现有客户有资格通过标准软件渠道升级。新的 WEKApod Nitro、Prime 和 Prime Max 系统可供订购,预计将于 2026 年秋季开始交付。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。