AI 模型与平台

AWS 重新设计 Bedrock AgentCore 运行时,实现弹性内存和快速冷启动

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Amazon Web Services 宣布 新的 AgentCore 运行时于 2026 年 9 月 18 日发布,这是 Amazon Bedrock AgentCore 中受管计算层的重新设计版本,公司称其在代理会话释放内存时回收内存,并且无论容器镜像大小或并发度如何,都能提供一致的冷启动时间。

AgentCore 运行时是受管计算层,为开发者提供一个完全托管的环境,以部署和运行代理而无需构建或维护基础设施。AWS 表示,自发布以来已有数千个团队使用它来运行生产代理,并且首个版本奠定了具备会话隔离、零规模行为和按使用付费定价的无服务器基础。该消费模型仍然适用:计费依据资源使用量,对等待 I/O 的空闲 CPU 不收取费用,且当代理没有工作时,平台会完全缩减至零。

发布旨在解决的问题

在原始运行时中,会话从分配内存的那一刻起一直占用该内存,直至会话结束,因为期间没有任何回收机制。AWS 表示,这导致长期运行或突发性的代理即使在内存不再使用后仍需为其峰值内存全天付费,这对偶尔出现流量峰值但大部分时间处于空闲状态的代理尤为不利。

启动行为是第二个挑战。AWS 表示,落在已初始化环境上的会话启动时间不足 100 毫秒,但要保持环境足够热以保证此速度,就必须预留计算资源,因此大多数会话仍会经历冷启动,即启动全新环境、拉取镜像并在首次请求执行前初始化代理。该延迟随镜像大小和并发度增加而上升,在突发流量下表现最差——此时会有最多的会话到达且可用的就绪环境最少。根据 AWS 的说法,客户通过预留备用环境、优化内存分配以及削减容量来规避这两个问题,以控制成本。

AWS 的测量指标

为了隔离平台本身对冷启动的影响,AWS 测试了一个空回声代理,该代理仅返回输入且不调用模型或工具。位于 us-west-2 区域的 Amazon EC2 实例上的 Python 客户端通过公共互联网(未使用 VPC 对等)调用 us-east-1 区域的代理,使用 boto3 SDK,因此每次客户端测量都包含两个 AWS 区域之间的往返时间,加上平台自身的启动时间。公司在默认账户配额范围内,对两种运行时版本和五种镜像大小的每个代理发送了 5,000 次冷调用。

通过上述方式测量后,AWS 报告称新运行时在 200 MB 至 2 GB 的镜像范围内实现了约 2 秒的 P75 冷启动延迟,因为镜像大小对其没有影响;而原始运行时的延迟随镜像大小从约 5.4 秒上升至接近 30 秒。在回声测试中,代理自身的代码在 P75 时约耗时 34 毫秒,因此几乎全部测得时间均为平台启动时间。AWS 建议通过在用户交互时立即启动会话(例如用户打开聊天时)来隐藏交互式代理的启动时间,从而在用户输入首个请求时环境已预热。

新运行时的工作原理

新运行时从小内存配置而非完整预置容量启动每个会话,然后根据工作负载的需求按需分配并分页加载额外内存。当代理释放每次请求的缓冲区或让缓存数据在请求间过期时,平台会回收这些内存,而不是等到会话结束后才释放。AWS 表示,它基于对数十亿会话的分配模式分析,对回收行为进行了调优。

冷启动会有所改变,因为每个代理只加载一次,然后从快照运行。创建或更新运行时时,AgentCore 启动容器,等待其报告健康状态,并捕获运行环境的快照,从而一次性初始化工作(如加载模型工件和获取静态配置)已完成。每个新实例恢复该快照,而不是从头初始化。AWS 表示,运行时会从快照中剔除缓存和瞬态内存,使其大小随容器镜像增大而基本保持不变,从而在广泛的镜像尺寸范围内保持恢复延迟稳定。

计费随内存模型而变化。新运行时按代理实际使用的内存计费,即按需加载、空闲时回收,而不是在会话期间始终占用整个容器镜像的内存。AWS 将此变化描述为对更少的 GB‑小时使用更高的费率,并指出对大多数代理而言,内存占用的下降幅度大于费率的上升,因此费用会降低。

平台版本、区域和限制

开发者在创建或更新运行时时,通过将 platformVersion 字段设置为 V2 来启用新运行时,依据 AgentCore 开发者指南。V1 为默认值:在创建时省略该字段会生成 V1 运行时,更新时省略则保持运行时当前的平台版本。V2 在 us-east-1、us-east-2、us-west-2、eu-west-1 和 ap-northeast-1 可用。

因为 V2 创建或更新会准备并快照环境,这些操作需要几分钟才能让运行时达到 READY 状态,而 V1 运行时则在秒级内就准备就绪。AgentCore 在容器的 /ping 端点首次返回健康响应时进行快照,如果容器在启动后 120 秒内未报告健康,则创建会因健康检查错误而失败。指南还指出,V2 当前对环境变量的总大小上限为直接代码部署 1.5 KB、容器代理 2.5 KB,而 V1 为 4 KB,并且 AWS CloudFormation 和 AWS CDK 目前不支持设置 platformVersion。

快照遵循运行时的版本和端点,而不是直接管理。AgentCore 在端点指向某个版本时会准备快照,在没有端点指向该版本时会删除快照,删除过程可能长达 8 小时,即最大会话生命周期,因为已经在该快照上运行的会话会持续到结束。会话在专用的 microVM 中运行,拥有独立的 CPU、内存和文件系统资源,最长可持续 8 小时,若 15 分钟无活动则会终止,随后 microVM 被销毁,内存被清理。

路线图与入门指南

在发布之后,AWS 列出了多项即将推出的功能:承诺的基线折扣,可为每个会话预留内存底线并在其上进行按需突发,针对持续始终活跃的会话;更大的 RAM、vCPU 和会话存储;x86 microVM 支持;带内存快照的挂起‑恢复功能以及在活动会话结束前用于序列化状态的运行时钩子;以及会话上下文键,为每个会话提供面向无人值守代理的作用域身份。

AWS 引导开发者查阅 AgentCore 开发者指南、GitHub 上的 AgentCore 示例仓库,以及一个配套的负载测试示例,展示新运行时在用户自有 AWS 账户中的冷启动延迟。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。