AI 模型与平台

Fireworks AI 推出训练 API 正式可用

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Fireworks AI 于 2026 年 8 月 31 日宣布其训练 API 与 Fireworks Lab 正式对外开放,为希望在开源模型上运行自定义训练循环的机器学习团队提供托管的训练与部署基础设施。训练 API 将客户自有的 Python 训练循环连接到 Fireworks 管理的分布式计算资源,涵盖计算梯度并更新模型的训练器以及生成样本的部署环节。

根据公告的描述,客户可以在任意位置编排循环,保持对损失或奖励函数、数据以及环境的控制。Fireworks 负责训练器与部署之间的交互,包括权重同步、失败交换恢复以及训练‑部署对齐。公司将该 API 定位为对现有训练工作流中团队反馈的限制的回应:模型与方法选择受限、参数与训练循环的控制受限、计算资源僵化以及训练与部署基础设施碎片化。

无服务器和专用计算

训练 API 提供两种计算选项。无服务器训练让客户在共享基础设施上以每 token 计费的方式训练 LoRA 适配器,采样在同一会话中进行;Fireworks 将其描述为适用于实验迭代、降低大规模运行风险或执行在部署与训练之间交替的强化学习循环。专用训练面向全参数训练、超出无服务器池的模型、更长的上下文长度或 LoRA 维度,以及持续吞吐量,按每 GPU 小时计费,弹性容量根据每次运行进行调配。

无服务器层级接入始终在线的共享池,提供精选的流行模型、共享容量以及每个账户的速率限制。专用层级为每次运行配置训练器和部署,支持 LoRA 与全参数模式,最高可达最大混合专家模型,并且不存在争用或速率限制。可将有前景的检查点通过 UI 或 API 部署到生产推理,且多 LoRA 部署让每个客户或用例拥有独立调优的模型,无需额外基础设施,公司如此表示。

三种训练场景

训练 API 与 Fireworks 训练平台上的另外两种场景并存。Managed Training 面向机器学习工程师,运行内置作业,客户选择方法——SFT、DPO 或 RL——以及基础模型,可通过 UI 或 API 启动。Fireworks Lab 同样在本次公告后正式可用,将前置部署的研究员和工程师嵌入客户团队;合作首先进行诊断,界定能力、基线、成功标准和范围,然后进入限时实现阶段,客户保留生产就绪的模型、评估框架、数据管道、训练循环和配方。

训练 API 本身面向机器学习研究者,支持 SFT、DPO、ORPO、RL 与蒸馏,从无服务器计算上的 LoRA 到专用集群上的全参数训练均可实现。

大规模强化学习

Fireworks 表示,其是少数在前沿实验室之外能够在超过 10,000 块 GPU 上运行强化学习的组织之一,并将 RL 训练围绕三大需求展开:正确性、性能效率和开发速度。

在正确性方面,公司指出,部署引擎和训练器必须使用相同的数值定义,因为微小的数值漂移可能通过 token 裁剪或奖励崩溃破坏学习信号,即使表面上看一切正常。Fireworks 从端到端对齐数值格式,包括 BF16、块级 FP8 与 NVFP4,对齐两条路径的内核和归约行为,并使用 Router Replay 在部署与反向传播之间保持混合专家路由决策,同时采用批次不变内核和确定性归约。公司通过在部署引擎和训练器上运行相同序列并测量训练‑推理 KL 散度来验证对齐,并对所有在 Fireworks 训练平台上启动的模型持续验证。

在性能方面,Fireworks 采用异步 RL,将部署采集与训练重叠,使部署 GPU 在训练器更新前一批次时即可生成下一批次数据,算法允许的情况下保持权重的有界陈旧度。每个训练步骤后,更新后的权重会热加载到运行中的部署,而不是拆除并重新加载完整模型。对于全参数检查点,公司表示会计算当前权重与前一次权重的 XOR 差异并使用 zstd 压缩,传输带宽可降低至原来的 1/10。

在开发速度方面,公司描述了在同一平台上持续的训练‑部署‑评估‑再训练循环,检查点直接进入服务与生产追踪、评估以及反馈,推动下一轮运行。公司称团队在相同训练预算下实现了两到四倍的迭代次数提升。

引用的客户成果

公告中列举了多位客户案例。Harvey 使用异步 RL 对 Kimi K3 进行长时序法律工作后训练,其 Harvey Tenet 模型在 LAB 上的全通过率为 19.7%,而 Claude Fable 5 为 11.5%,成本约为任务的三分之一,Fireworks 如是称。Vercel 采用强化微调和推测解码用于 v0 的自动修复器,实现了 93% 的零错误生成率,并将端到端延迟提升了 40 倍。Heidi Health 将其临床记录员迁移至微调的开源模型,从概念验证到生产仅四周完成,延迟降低了 3.5 倍。Factory 在开源 Qwen 基础模型上微调了两个小型 LoRA 适配器用于检测泄露的机密信息;在 5% 的误报预算下,训练模型捕获了约 70% 的真实机密,而 GPT-5.5 仅约 59%,Fireworks 报告。

训练 API 现已通过 Fireworks 的自助注册开放,使用无服务器方式无需预置资源,需手把手支持的团队可联系 Fireworks Lab 进行咨询。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。