思想领袖

五步将内存从AI的最大限制转变为竞争优势

mm
将 Unite.AI 添加到您在 Google 上的首选来源

过去几年,AI基础设施的重点一直放在计算能力上。更多的加速器、更大的集群和更高的FLOPS驱动了对GPU的需求。这一方法在模型进步主要依赖于训练规模时是合理的。现在,随着AI生产部署的优先性,新的限制出现了:内存。

今天,许多最艰难的限制出现在内存容量、带宽、延迟和数据在系统中移动的时间和能耗上。上下文窗口不断扩大,像Anthropic这样的公司现在在其标准定价中提供了百万令牌窗口。推理工作负载正在增长。多代理系统的增长意味着AI系统正在在各个阶段之间传递越来越多的数据。操作员可以继续尝试添加更多的GPU,但他们仍然无法达到预期的性能,因为这些系统由于每个服务器仅限于系统内的RAM而饥饿于足够的RAM来高效地为加速器提供服务。

这种转变影响了超大规模计算和数据中心操作者的吞吐量和成本。当内存成为限制因素时,组织通常通过过度配置昂贵的硬件来响应,这会导致GPU容量被低效利用,并增加电力和基础设施成本。AI规模的下一个阶段将更少地依赖于添加原始计算能力,而是更多地依赖于构建适合生产AI实际运行方式的内存体系结构。

以下是基础设施领导者可以采取的五个步骤,以准备好应对不断增长的内存需求。

1. 首先测量真正的瓶颈

许多组织仍然通过计算优先的视角来评估AI性能。他们跟踪集群利用率、加速器数量和顶级吞吐量,然后假设改进将来自于添加更多的GPU加速器。那样的观点往往忽略了真正的问题。

内存压力通常表现为加速器停滞、更高的每令牌延迟和在负载下不一致的吞吐量。如果GPU由于等待来自另一个内存层、另一个服务器或应用程序中的另一个阶段的数据而看起来未被充分利用,则可能会发生这种情况。推理使得这个问题更加明显,因为KV缓存大小增长,更多的同时会话竞争带宽。

操作员需要更好的内存利用率可见性,查看每令牌移动的字节数、加速器停滞时间和跨CPU、GPU和相邻内存层的内存访问模式。他们还需要管道跟踪,可以将内存相关的延迟与网络或存储问题分开。如果没有这种可见性,团队可能会在没有解决实际减速源的情况下花费更多的计算资源。

2. 在添加更多容量之前减少数据移动

在大型AI系统中,移动数据可以像处理数据一样创建开销。

这在推理中尤其如此。随着上下文窗口的扩大,KV缓存可以成为系统中最大的内存消费者。多租户服务和多代理工作流可以添加更多。第一个阶段生成输出,然后另一个阶段使用它,基础设施通过在GPU之间、服务器之间或通过框架级序列化处理数据传递来处理这个传递。

这些传递具有真正的成本。它们消耗带宽,添加延迟,并让昂贵的计算资源等待下一次传递完成。它们还促使操作员购买比工作负载实际需要更多的高成本内存。

在投资更多加速器之前,团队应该确定系统中数据移动的位置。GPU到GPU传输、服务器到服务器的复制以及代理管道中间状态的重复移动是好的起点。在许多环境中,减少不必要的移动可以提供比添加另一个服务器更有用的性能。

3. 根据工作负载行为构建内存层次

AI基础设施在操作员停止将内存视为单一来源并开始将其视为具有不同角色的层次结构时效果更好。

最热的数据应该保持在加速器附近。包括需要最低延迟和最高带宽的工作集。其他活跃缓冲区和频繁访问的状态可以放在DRAM中。需要规模而不是绝对速度的更大结构可以移动到池化内存中。较冷的数据和不太活跃的模型属于层次结构的下方。

这种方法需要团队了解哪些数据不断变化,哪些数据由多个进程共享,哪些数据可以容忍一定的延迟权衡而不会影响服务质量。太多的部署仍然默认将所有内容推入最快的HBM层,因为它感觉更安全。这种方法会增加成本,通常会将效率留在桌面上。

分层内存策略为操作员提供了对性能和经济的更多控制。在生产AI中,这种平衡正在成为一个核心设计要求。

4. 将共享内存视为代理AI的体系结构的一部分

多代理AI正在提高分散内存设计的成本。

在许多代理系统中,一个代理生成输出,另一个代理立即使用它。第三个服务可能对输出进行排名,添加上下文或将其路由到另一个模型中。如果每个阶段都创建同一状态的新副本,流量会迅速增加。随着上下文的增长,复制的数据大小也会随之增长。系统花费的时间更多的是移动信息而不是处理数据。

这就是共享内存变得越来越重要的地方,特别是对于共享的KV缓存和其他状态,这些状态需要由多个代理或服务访问。共享内存可以减少冗余副本,降低网络流量,并在整个应用程序路径上提高利用率。它还可以帮助代理系统有效地扩展,因为不同的节点或代理可以使用共享内存重用KV缓存。

对于超大规模计算,这已经不再是一个边缘案例。随着代理AI的成熟,共享内存正在成为高效部署的实际要求。

5. 为生产基础设施采用CXL

过去几年,行业将CXL视为一个有前途的标准,但需要更多时间来成熟,因为CXL迅速从版本1升级到版本2。现在,随着3.x硬件即将推出,CXL已经达到功能完善、向后兼容和准备好承担生产负载的程度。

CXL已经达到了一种成熟的水平,超大规模计算和数据中心操作员应该将其视为生产内存扩展、池化和共享内存体系结构的实际选择。它现在属于严肃的基础设施规划,特别是对于需要更灵活的内存扩展和更好的推理经济效益的环境。

这并不意味着每个工作负载都应该转移到基于CXL的内存。局部内存将保持对最热和最延迟敏感数据的必要性。但是,操作员不再需要等待某个未来的标准版本才采取行动。更有用的问题是CXL可以在哪里解决今天的实际生产问题。

最明显的机会在于内存扩展、池化内存和共享内存设计,这些设计可以在AI工作流中减少不必要的副本。这些用例直接对应当前的压力点:不断增长的KV缓存需求、代理到代理的数据传输以及在不推高所有权总成本的情况下提高GPU利用率的需求。

操作员仍然需要仔细设计。延迟、可预测性和软件支持仍然很重要。内存管理策略需要在正确的时间将数据放入正确的层次。但是,这些是实施问题,而不是推迟规划的理由。

在XCENA,我们将内存、数据移动和利用率视为生产AI基础设施的核心限制。这就是为什么我们专注于基于CXL的计算内存和减少不必要复制、支持共享访问并帮助操作员更好地利用昂贵的计算资源的体系结构的原因。

行业花了多年时间将内存视为AI进步的次要资源。这种观点不再适用于生产部署的现实。内存现在在整个堆栈的每个级别上塑造利用率、效率和成本。早期认识到这种转变的操作员将拥有一个优势,这个优势不仅体现在性能上,还体现在他们如何在现实世界中扩展AI的有效性上。

金金XCENA 的首席执行官和联合创始人,XCENA 是一家位于韩国的无厂半导体公司,专注于为人工智能和大规模数据处理构建下一代内存解决方案。金金在 SK Hynix 任职期间担任过高级领导职务,是最年轻的公司副总裁之一,他在数据中心计算和半导体架构方面拥有深厚的专业知识。