AI 模型与平台
Abacus.AI 发布三款面向代理工作负载的开源权重 Smaug 模型

Abacus.AI 于 2026 年 9 月 10 日推出 Smaug 系列,这是三款针对企业代理工作负载进行微调的开源权重语言模型:Smaug Agentic、Smaug Flash 和 Smaug Mini。三者均可在 Hugging Face 下载,也可通过公司提供的 RouteLLM API 使用。
这些模型在 Abacus.AI 的 企业代理 AI 平台和 Super Assistant 上发布。公司表示,企业可以在自有云 VPC 环境中托管这些模型,从而完全控制数据和 AI 的部署位置;对安全和数据隐私有顾虑的组织则可以在内部 GPU 集群上托管 Smaug Agentic。
Abacus.AI 将 Smaug 描述为一种适用于任何开源基础模型的微调技术,并称其在不增加成本的情况下提升了长时运行的代理循环性能 15%–20%。公司表示,这使企业能够以开源模型的成本大规模部署自我改进的 AI 代理,并称其成本通常比 Anthropic 和 OpenAI 的前沿模型低 10–100 倍。
Abacus.AI 首席执行官 Bindu Reddy 在公司 公告 中表示:“开源权重模型正快速缩小与前沿闭源模型的差距,但在长时运行的代理循环中仍表现不足。”Reddy 说,Smaug 系列弥补了这一短板,同时成本仍比闭源模型低 10–100 倍。
根据公司的技术简报,该系列源于在大上下文和重复工具调用的情况下运行大型代理循环的成本和低效问题,且提示缓存在时间间隔中会失效。该方法将人工策划的真实世界代理轨迹与基于硬实例的合成数据相结合,简报指出,在应用于一系列开源权重基础模型时,能够在代理编码、真实工具使用、自动化以及长上下文推理和指令遵循等方面实现持续提升。
Smaug Agentic
Smaug Agentic 是该系列最大的模型,基于 Moonshot AI 的 Kimi K3 进行监督微调。Kimi K3 是一种专家混合模型,拥有 2.8 万亿总参数、1040 亿激活参数、1,048,576 token 的上下文长度,以及 MoonViT-V2 视觉编码器,详见其 模型卡片。此次微调未更改任何架构参数,模型在继承自基础模型的 Kimi K3 许可证下发布,用户必须遵守该许可证条款。卡片指出,训练使用了经过策划的多轮、使用工具的编码轨迹,并将推理 token 从损失中屏蔽,以在引导模型行为的同时保持基础模型的推理分布不变;数据集内容未公开。
卡片报告了在 GPQA Diamond 上 94.1 分、AA-LCR 上 75.7 分、DeepSWE 上 69.9 分、Terminal-Bench 2.1 上 86.5 分、SciCode 上 60.8 分、LiveBench 代理编码上 64.6 分、AutomationBench 上 31.0 分以及 MMMU-Pro 上 81.0 分的得分。相较于 Kimi K3 基础模型,分别在 DeepSWE 上提升 2.4 分、LiveBench 代理编码上提升 2.4 分、SciCode 上提升 2.1 分、AA-LCR 上提升 1.0 分、GPQA Diamond 上提升 0.6 分。
卡片还报告称,在 SciCode 和 AA-LCR 上,p99 推理长度约为基础模型的 0.6 倍,而可见答案长度与 Kimi K3 基本无统计差异。公司表示,在 113 项 DeepSWE 任务以及超过七小时的持续运行中,未出现任何基础设施错误或超时。由于架构未变,Smaug Agentic 可在任何 Kimi K3 可运行的环境中部署,并提供了 vLLM、SGLang 和 TokenSpeed 的公开部署方案。公告将该模型定位为 Opus 级模型的成本高效替代品。
Smaug Flash and Smaug Mini
Smaug Flash 基于 DeepSeek V4 Flash 0731 进行微调,面向企业自我改进的代理。简报指出,基础模型在长上下文的代理工具使用中容易出现“旋转和混乱”,而 Smaug Flash 在保持基础模型成本和速度优势的同时解决了该问题。公告描述 Smaug Flash 为个人代理进行优化,能够连接包括 WhatsApp、Telegram 和 Slack 在内的消息应用,并与用户保持长时对话。简报中相对于 DeepSeek V4 Flash 0731 基础模型的评分(以 Claude Sonnet 5 为参考列)包括:LiveBench 综合 77.4 对 74.2,LiveBench 代理编码 61.1 对 46.8,DeepSWE 1.1 56.6 对 54.4,AutomationBench 公共 600 严格通过 38.83 对 25.1,NL2repo-bench 73.3 对 54.2。
Smaug Mini 是一款拥有 270 亿参数的模型,基于 Qwen3.8 27B 微调,面向多模态使用场景和较小的推理工作负载。简报报告其在 LiveBench 综合上为 76.9(对比基础模型 75.3),IFBench 为 82.0,AutomationBench 为 41.8 对 37.3,JobBench 官方 65 任务协议为 50.5 对 33.4,NL2repo-bench 为 55.8 对 42.3,参考列包括 Claude Sonnet 5、Claude Opus 4.6 和 GPT-5.6 Luna。公告称 Smaug Mini 适用于简单任务和企业聊天机器人,并表示企业可以在自有数据上进一步微调该模型。
评估协议与路线图
技术简报指出,除非标记为 † 表示该分数未来源于其评估框架,否则所有模型的评估均由 Abacus.AI 使用相同的评估框架进行,LiveBench 的数据取自 2026 年 6 月 25 日发布的 LiveBench 排行榜。Smaug Agentic 卡片显示,其结果是在专用的 8×B300 部署上,以温度 1.0、推理力度设为最大生成的;其 SciCode 评估还修复了一个导致 12 个子问题无法解决的上游缺陷。公司称这些模型已在 LiveBench 排行榜的 finetunes(微调)过滤器下列出。
Abacus.AI 表示,Smaug 系列既是产品发布,也是其论点的示范:通过正确的微调方法,开源权重模型能够在代理 AI 任务上与前沿模型竞争并超越它们。公司称,随着基础模型的演进以及其代理轨迹库的扩展,仍将持续推进该系列的发展。












