AI 模型与平台
小米新旗舰模型以46分领跑开放权重排行榜

小米于2026年9月22日宣布发布并开源MiMo-V2.6 series,该系列的旗舰模型在基准拥有者Artificial Analysis的智能指数上得分为46,创下该排行榜上最高的开放权重成绩。
该系列包括两款原生全模态模型:MiMo-V2.6-Pro, 小米称其为迄今为止最强大的模型;以及 MiMo-V2.6-Flash, 公司表示该模型在智能、效率和成本之间取得了平衡。第三种变体 MiMo-V2.6-Pro-UltraSpeed 能以相同质量提供高达20倍更快的输出,适用于需要极致生成速度的用户。
Artificial Analysis 基准排名
Artificial Analysis 的 model page(针对 MiMo-V2.6-Pro)记录了 Intelligence Index v4.3.2 上的 46 分,这是一项由 10 项评估组成的综合指标,包含 AA‑Briefcase v1.1、GDPval‑AA v2.1、AutomationBench‑AA、Terminal‑Bench 4.0、SciCode 和 Humanity’s Last Exam。基准评测方的 open-source model comparison 将 MiMo-V2.6-Pro 排在开放权重模型之首,领先 Z AI 的 GLM‑5.3(max)45 分和 Kimi K3(max)44 分,并将 MiMo-V2.6-Pro 与 GLM‑5.3(max)描述为最高智能的开源模型。
在专有系统中,Artificial Analysis 的 page for Grok 4.7 (xhigh) 将 SpaceXAI 模型列为同样的 46 分。小米的公告引用了指数上 46.32 分,并称 MiMo-V2.6-Pro 为“迄今为止最强的开源模型”,表示其超越了 Kimi K3 和 Qwen3.8 Max。Artificial Analysis 将该模型的成本定为每个 Intelligence Index 任务 0.13 美元,并报告在指数上进行评估的费用为 206.66 美元。小米表示,该系列保持 V2.5 系列的 API 定价,并称其将智能‑成本的帕累托前沿向外推进。
Artificial Analysis 将模型的发布日期列为2026年9月21日;小米的公告发布时间为2026年9月22日。
稀疏 MoE 架构与 MIT 许可证权重
根据小米MiMo团队发布的模型卡,旗舰MiMo-V2.6-Pro-RL检查点是一个稀疏的专家混合模型,拥有1.02万亿总参数,每个标记激活420亿参数,1M 标记的上下文长度,支持文本、图像、视频和音频输入以及文本输出。Artificial Analysis的规格列出了相同的参数数量、上下文窗口和模态,并记录了MIT许可证,允许商业使用。
该卡片详细说明了一个 70 层的主干网络,60 个滑动窗口注意力层与 10 个全局注意力层交错排列,拥有 384 个路由专家,其中每个 token 有 8 个处于激活状态。一个 681M 参数的 MiMo ViT 负责视觉处理,308M 参数的 AudioTokenizer 和 127M 参数的音频补丁编码器负责音频处理,五层多 token 预测的投机解码器在每次前向传播中预测七个后续 token。
MiMo-V2.6-Pro-RL 和 MiMo-V2.6-Flash-RL 的权重已在 Hugging Face 上发布,并在发布时提供 ModelScope 可用性。小米表示,还将开源完整的技术报告、训练环境以及 RL 代码,以便研究人员复现和验证结果。
实时直播的强化学习运行
小米表示,他们实时直播了生产强化学习的运行过程。在不到六天的时间里,MiMo-V2.6-Flash 和 MiMo-V2.6-Pro 各完成了 30 步强化学习,共约 75 万条轨迹,报告的成本分别约为 85 万美元和 262 万美元。训练任务的平均通过率相对提升了 25% 和 12%,在 DeepSWE v1.1(一个留出的长时程软件工程基准)上,Flash 的分数从 48.8 提升至 65.68,Pro 的分数从 58.4 提升至 72.57, 小米报告称。
公司表示,他们在三个维度上扩展了强化学习计算:在完全异步架构下使用更大的批次,每次更新 1,568 个样本,训练时上下文长度最高可达 1M,步长为 35 至 37 亿 token;一个跨编码、通用代理、视觉和网络任务的多任务套件,跨多个平台混合使用;以及更多的评估计算,利用每组内部的相对比较生成更精确的奖励信号。
模型卡片规定了在每步使用 1,568 个提示、每个提示 16 次回滚的完全异步组相对策略优化(Group Relative Policy Optimization),以及组级奖励合成(Groupwise Reward Synthesis),通过对比回滚离线构建任务特定的评估标准,并通过组级优势再分配(Groupwise Advantage Redistribution)在线对通过的轨迹进行排序。随后进行名为 MOPD2 的多前缀多教师在线蒸馏阶段,以配合混合强化学习运行。小米描述了覆盖奖励设计、对抗评估、异常检测以及验证者之间交叉检查的奖励作弊防御措施。
定价、可用性与示例用途
在小米自有的基准表中,MiMo-V2.6-Pro 在 DeepSWE v1.1 上得分 71.9,Flash 为 67.9,MiMo-V2.5-Pro 为 19.0,落后于 DeepSeek V4.1 Flash(74.2)、Claude Opus 5(74.0)和 GPT 6 Astra(74.0)。小米将 Pro 的 GDPVal 2.1 评分列为 1,673,这是人工分析报告的 Elo 评级,低于 Claude Fable 5.1(1,735)和 Claude Opus 5(1,708)。其他报告的 Pro 结果包括 Toolathlon 验证的 76.9、Automation Bench v1.0.6 的 53.1、Terminal Bench 4.0 的 34.9,以及 CyberGym 的 94.0,其中 Flash 为 95.1,GLM 5.3 为 84.5。
两款模型均可在 AI Studio、MiMo Code 和 MiMo Desktop 中使用,也可通过 MiMo API 平台和 OpenRouter 访问。MiMo Desktop 在首次正式发布时结束早期访问,内置 Pro 和 Flash,小米表示 UltraSpeed 早期访问计划将再运行一周,现有用户需切换到新模型名称。
API 定价与 V2.5 系列保持不变:按每百万 token 计费,MiMo-V2.6-Pro 的缓存命中输入费用为 $0.0036,缓存未命中输入费用为 $0.435,输出费用为 $0.87;MiMo-V2.6-Flash 的费用分别为 $0.0028、$0.14 和 $0.28;MiMo-V2.6-Pro-UltraSpeed 在同三类中的费用分别为 $0.036、$4.35 和 $8.70。人工分析测得小米 API 的输出速率为每秒 129.7 token,首次 token 的响应时间为 2.17 秒。
小米的演示涵盖多代理游戏开发、Blender 3D 建模、通过多视角摄像头对 Franka Panda 机械臂的闭环控制、前端与演示设计、端到端视频创作以及音乐创作,其中包括一段名为《Night Road》的管弦乐作品,模型自行配乐并转换为 MIDI。在公司报告的两项研究案例中,MiMo-V2.6-Pro 与小米材料专家共同设计了用于吸附 PFAS 化合物的金属有机框架候选材料,并生成了超过 6,000 行代码的 Lean 4 形式化实现,证明了 Li 与 Yorke 的“周期三暗示混沌”定理,且经 Lean 核心验证未留下未完成的证明占位符。












