AI 模型与平台

Ramp 推出 Router.com 模型网关,免费路由服务至 2026 年

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Ramp,作为每年支持超过 2000 亿美元采购的企业支出平台,于 2026 年 8 月 19 日推出 Router.com: 一个单一的 API 端点,可将每个 AI 请求发送到满足开发者质量标准的最低成本模型。根据公司公告,已经使用该服务的客户平均将推理成本降低了 40%。路由服务在 2026 年之前免费,用户仅按消耗的 token 支付标价,新用户可获得 26 美元的额度。

该产品是 Ramp 三年前为内部构建的工具的公开版本。通过将每个内部任务匹配到合适的模型,公司称其在保持 99.9% 以上生产流量可靠性的同时,将自身的推理成本降低约 30%。Router 网站称当前生产流量已超过每月 2.75 万亿 token。

“AI 是大多数公司增长最快的支出项目,也是最难衡量的,”Ramp 首席技术官 Rahul Sengottuvelu 在公告中表示。“Router 将所有 token 集中在一起,并将每个请求发送到在性能和成本上都合适的模型。”

这一时机与 Ramp 自己的数据相吻合。Ramp AI 指数跟踪平台客户的企业 AI 支出,公告称自 2025 年 6 月以来,AI 支出已增长 20.7 倍。

单一端点,27 种模型并在增长

开发者通过兼容 OpenAI 和 Anthropic 的单一 API 进行连接,可访问来自 OpenAI、Anthropic 和 SpaceXAI 的模型,Gemini 支持即将推出。包括 Nvidia、Kimi、DeepSeek、GLM 和 Qwen 在内的开源模型由 Fireworks AI 等提供商提供,Google、AWS、Together AI、Baseten 和 Crusoe 也在路上,公告称。Ramp 的 Router 页面上的模型选择器目前覆盖 27 种模型,从 Claude Opus 5 和 GPT-5.6 Sol 到预算级别的 GPT-5.4 Nano 和 DeepSeek V4 Flash。Grok 的加入扩展了分发力度,使得 Grok 4.6 同日在 Amazon Bedrock 上实现通用可用。

路由引擎在模型选择、缓存、压缩、时序和请求处理等方面应用了超过 100 项优化,并在提供商故障时自动回退。团队可以采用 Ramp 的默认路由策略,或根据请求类型自行配置成本‑性能优先级。所有模型均托管在美国基础设施上,并提供零数据保留选项。

基于生产工作构建的基准

核心组件是 Ramp SWE-Bench,这是一套基于公司真实生产工程任务而非公开排行榜构建的基准。Router 持续对新模型进行该工作负载的测试,并自动将表现优异者纳入默认配置。已发布的结果表显示了路由器利用的差异: Claude Opus 5 的平均每次运行成本为 1.84 美元,而 Qwen3.7 Plus 以 0.15 美元实现相似的解题率,GPT-5.4 Nano 则以 0.09 美元处理更廉价的任务。

随着模型种类的增多,这种每请求的套利正是推理经济学的发展方向。针对可比的解题率,基准服务成本在不同模型之间已相差一个数量级以上,这一差距体现在 Ramp 的 SWE-Bench 表中,也体现在如 Runware 的容器化数据中心等低成本推理方案中。

客户报告与条款说明

产品页面上列出的早期用户报告的节省幅度远超 40% 的平均水平。Delphi 的 Valentin De Matos 表示,其公司通过 Router 处理了数十亿 token,模型成本降低了 92%。Anthropic 平台工程负责人 Katelyn Lesse 称 Claude 从第一天起即可通过 Router 使用,SpaceXAI 表示 Grok 的加入扩大了团队将其模型集成到应用中的方式。

细则:免费路由服务截至 2026 年,之后 Ramp 尚未在公告中设定价格。Router 会存储模型的输入、输出和元数据并利用这些数据改进服务,用户可在设置中关闭此功能并选择零数据保留的美国托管模型。该服务在发布时仅限美国开发者和团队使用,企业功能及更多国家地区将于近期推出。Ramp 表示无需 Ramp 卡或公司账户,OpenAI 或 Anthropic SDK 用户只需更改一行基础 URL 即可切换现有集成。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。