AI 模型与平台

Baseten 将 DeepSeek-V4.1-Flash 添加到模型 API,支持 1M 令牌上下文

mm
将 Unite.AI 添加到您在 Google 上的首选来源

DeepSeek-V4.1-Flash 现已在 Baseten Model APIs 上可用,Baseten 宣布于 2026 年 9 月 11 日,将 552B 参数的多模态混合专家(MoE)模型引入该推理平台,该模型在 1M 令牌上下文窗口中,预填阶段使用 8B 活跃参数,解码阶段使用 16B。

DeepSeek 在 Hugging Face 上发布了模型的开放权重,DeepSeek 的官方公告日期为 2026 年 9 月 9 日。该模型接受文本和图像输入并生成文本输出,模型卡片指出仓库和权重采用 MIT 许可证。Baseten 将 V4.1-Flash 描述为 DeepSeek 2026 年的第三次开放权重 flash 发布,并且是唯一在其规模上使用 DeepSeek 所称的因果编码器-解码器架构的模型。公司表示,Baseten 的 Loops 训练产品支持即将推出。

报告的基准测试结果

模型卡片报告了在最大推理努力设置 100 下的指令模型结果:V4.1-Flash 在 Terminal-Bench 2.1 上得分 90.6,V4-Flash 为 82.7,V4-Pro 为 87.9;在 DeepSWE v1.1 上得分 74.2,分别为 54.4 和 62.7;在 AutomationBench 上得分 54.8,分别为 37.7 和 43.2。Baseten 强调了相同的编码和代理指标,称 V4.1-Flash 在参数总量约为三分之一的情况下胜过 V4-Pro,同时警示 AutomationBench 上的 54.8 表明模型在约一半的复杂工作流中失败,并建议团队在代理流水线中保持人工参与。

在卡片对比前沿模型的最大努力下,V4.1-Flash 在 GPQA Diamond 上得分 90.9,Codeforces 评级为 3471,并在带工具的 HLE 上得分 63.9。Baseten 表示,V4.1-Flash 是 DeepSeek 首个具备原生图像输入的非实验模型,此功能此前仅限于实验性的 V4-Flash-Vision-Exp;其表格显示新模型在 Chartography 上得分 78.9,ZeroBench 上得分 49,而实验模型分别为 64.3 和 35。

因果编码器-解码器架构

根据模型卡片,V4.1-Flash 将 40 层 Transformer 组织为 20 层因果编码器后接 20 层解码器,解码器的全局键值(KV)缓存从最终编码器隐藏状态投射,而非来源于每层解码器自身的隐藏状态。该设计在预填阶段每个令牌激活 8B 参数,在解码阶段激活 16B 参数;Baseten 将其与 V4-Flash 进行对比,后者在两阶段均激活 13B 参数,称此变化是用更轻的预填换取更重的解码,Baseten 表示此配置提升了编码代理的成本效率,因为其代理循环产生的预填令牌远多于解码令牌。

卡片报告称,模型的压缩稀疏注意力 2 为每个注意力层分配三种静态模式之一(Full、Reindex 或 Reuse),解码器中的层次稀疏索引器使更深层的索引成本与上下文长度无关。结合 FP4 主 KV 缓存,这些设计将全局 KV 缓存降低至每个令牌 890 字节,约为 V4-Flash 的四分之一,卡片指出。另一机制 SWA Bounded Replay 通过仅回放最近的令牌来重建缺失的滑动窗口注意力 KV 状态,将持久 KV 占用降低至约 V4-Flash 的八分之一。DeepSeek 的公告称,这相当于前一代 HBM 的四分之一、SSD 存储的八分之一。

根据卡片,每个 MoE 层使用一个共享专家和 384 个路由专家,每个令牌激活六个路由专家,模型还加入了 196B 参数的 Engram 条件记忆以及 DSpark 推测解码。DeepSeek 从头在 45T 令牌的多模态语料上训练模型,稀疏注意力在 64K 序列长度下训练,并将上下文扩展至 1M 令牌(共 34T 令牌)。后训练阶段采用标准的监督微调、强化学习以及策略内蒸馏序列,实质性改动集中在大规模自动合成代理任务和环境上,模型提供了从 1 到 100 的可持续可控推理努力设置。

DeepSeek API 迁移与 Baseten 服务

DeepSeek 表示,V4-Flash 和 V4-Flash-Vision-Exp 已在其平台上退役,旧 API 模型名称暂时路由至 V4.1-Flash 以保持兼容性。新 API 定价于 2026 年 9 月 10 日 04:00 UTC 生效,非高峰费率为高峰费率的 50%,且 DeepSeek 将官方合作伙伴 WorkBuddy(包括 CodeBuddy)和 OpenCode 列为全面支持 V4.1-Flash 的合作伙伴。

Baseten 表示,其 推理 堆栈使用 NVIDIA Dynamo 并具备 KV 缓存感知路由来提供模型服务,将每个请求引导至已持有其前缀的副本,而非任意空闲副本。该模型通过 Baseten 的模型库提供,针对需要预留容量的团队提供专用部署。

自 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求将以 V4.1-Flash 的费率路由至 V4.1-Flash,DeepSeek 表示此安排将持续至 V4.1-Pro 推出;实验室称,多方测试显示 V4.1-Flash 在性能、成本、速度和总体运行时间上均优于 V4-Pro。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。