AI 模型与平台
微软通过 Fireworks AI 在 Foundry 上向初创公司开放 26 个开放模型

微软 (MSFT ) 正在其新推出的 Fireworks AI 集成中推动初创公司市场,于 2026 年 8 月 4 日发布了一个 部署蓝图,该蓝图将微软 Foundry 上运行开放模型的参考架构与计费优惠相结合:微软为初创公司计划的成员可以将其 Azure 信用额度应用于 Fireworks 模型部署,该计划最多可提供 15 万美元的信用额度。
Fireworks 集成本身已经 达到一般可用性,将 DeepSeek、Moonshot AI、Z.ai、MiniMax、Qwen、Google 和 OpenAI 的开放权重 gpt-oss 线在 Azure 的模型目录中提供,具有 Azure 方面的治理和计费。Fireworks AI 是服务于模型目录后面的推理提供者;Foundry 提供控制平面。该蓝图是微软使该组合成为 Azure 上构建的 AI 本土公司的默认起始堆栈的尝试。
Fireworks 蓝图要求初创公司构建什么
该 参考架构 完全运行在初创公司自己的 Azure 订阅中。Azure 容器应用中的容器化应用程序调用通过 Foundry 部署的 Fireworks 模型端点,Azure 容器注册表保存图像,Azure 密钥保管库存储凭据。从那里,蓝图分阶段扩展:通过 Azure API 管理路由流量以实现速率限制,添加 Azure 缓存以减少冗余的推理调用,并在 Azure Monitor 中跟踪延迟、错误率和令牌消耗。
文档的框架是,推理是 AI 本土公司可以控制的最大成本之一,该架构的设计使得团队从单个无服务器模型端点开始,然后仅在测量流量需要时添加组件。模型发现、治理和计费保持在一个控制平面中,因此初创公司永远不需要建立或管理自己的 GPU 集群。
目录中有 26 个模型,计费带有例外
Foundry 目录现在列出了 26 个由 Fireworks 提供的模型,包括 Moonshot AI 的 Kimi K2.5、DeepSeek V3.2、MiniMax M2.5、OpenAI 的 gpt-oss-120b 和一个被描述为 1.6 万亿参数旗舰的 DeepSeek V4 Pro。其中 6 个,包括 Kimi K2.6 和 Z.ai 的 GLM-5.1,提供按令牌付费的无服务器计费;其余模型运行在预留容量单位上,即 Azure 的预留容量定价。团队还可以通过自带权重工作流导入自定义或微调权重,LoRA 适配器支持公共预览。
初创公司信用额度条款带有真正的限制:信用额度仅适用于按令牌 Data Zone 标准使用,预留容量单位除外。合规边界更加狭窄。无服务器部署仅限于六个美国 Azure 区域,该服务不在微软的 EU 数据边界承诺之内,不具有 FedRAMP 授权,也不能处理支付卡数据。微软自己的透明度说明添加指出,它不评估 Fireworks 提供的模型的安全性或行为,而是将该评估留给客户。
一个近期的到期项目:GLM-5.1 和 MiniMax M2.5 的按令牌计费将于 2026 年 8 月 7 日弃用,尽管这两个模型仍可在预留容量单位上使用,另外四个目录模型的按令牌计费已经弃用。
微软几个月来一直在为 Foundry 的目录做准备
Fireworks 蓝图是目录构建的一个举动。微软在 2026 年 7 月扩大了其 Mistral 安排,以吸引受监管的买家,如 Unite.AI 报道,并且它一直在将一些自己的 Office AI 工作负载转移到模型提供者,以管理成本,如 之前的报道。Fireworks 集成将这种多供应商姿态扩展到开放模型,推理层外包给专家,而不是自行构建。
对于正在权衡其选择的初创公司,微软自己发布的比较很有启发性:文档将 Fireworks on Foundry 与自托管 vLLM trên GPU 群集、前沿闭源 API 和通用云 AI 服务进行比较,并将其定位为 AI 是核心产品区别的公司。一般可用性里程碑、信用额度资格和现在出现在目录文档中的弃用通知都表明同一件事:这是一个具有附加条款的生产级产品,微软希望下一波 AI 本土公司在其架构固化之前阅读这些条款。












