AI 模型与平台

Qwen3.8-Flash-Next 预览 Qwen4 架构,激活 6B 参数

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Qwen3.8-Flash-Next 预览采用混合注意力的 Qwen4 架构,激活 6B 参数

阿里巴巴的 Qwen 团队于 2026 年 8 月 26 日发布了 Qwen3.8-Flash-Next,这是一款开源权重的实验模型,用于预览将支撑 Qwen4 的架构。该模型拥有 125B 参数,但每个 token 仅激活 6B 参数,团队将此配置视为迈向其所谓的终极成本效率的一步。

此发布是首个基于该设计的公开模型。Qwen3.8-Flash-Next 模型卡片将其描述为具备视觉编码器的因果语言模型,经过预训练和后训练两阶段训练,并列出原生上下文长度为 262,144 token,可扩展至 1 million。卡片将该模型定位为一次具体的效率提升,而非能力旗舰:团队明确关注的是架构选择在大规模推理成本上的影响,尤其是当具备长上下文的智能体工作负载成为主要使用场景时。

混合注意力、门控残差与 N-Gram 嵌入

该架构基于四项声明的改动。第一项是重新设计的混合注意力机制。此前的 Qwen 混合模型将 Gated DeltaNet 与 Gated Attention 组合使用;Qwen3.8-Flash-Next 将后者替换为 Qwen 稀疏注意力(QSA),该机制在微块层面运行,而非对单个 token 进行选择。卡片称此举显著降低了长上下文的延迟。模型将其 48 层以循环模式组织:三个 Gated DeltaNet 块接入一个混合专家层,随后是一个 QSA 块再接入一个混合专家层,如此循环十二次。

第二项改动是门控残差机制,它通过逐元素、数据依赖的读取门和每条支路的标量写入门,调节在扩宽残差流中传递的信息。卡片将其描述为在保持训练稳定性并降低推理开销的同时,提升各层细粒度表达能力的手段。

第三项是 n-gram 嵌入层。模型在第 2 层加入了一个由短双字母组和三字母组索引的独立嵌入,增加了 51B 参数,而不是通过更多专家来扩展参数。团队将其描述为一种参数扩展轴,相比混合专家需要更少的计算,并更适合在内存受限的加速器上进行卸载。卡片还指出还有一个 4B 参数的多 token 预测层,采用多步训练。

第四项是训练配方本身。Muon 与 AdamW 优化器分别用于特定权重类别,团队表示已取消传统的批量大小热身,直接以目标批量大小启动,并依据重新拟合的尺度定律进行指导。卡片称,这显著降低了优化器的总步数,同时支持更大的学习率。

供应商报告的基准及其衡量指标

卡片报告了 Qwen3.8-Flash-Next 与 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731 以及 Claude-Opus-4.6 (Max) 的基准对比结果。这些数据由供应商提供,基于团队自建的评测框架,应按此解读。在智能体编码任务上,卡片列出 DeepSWE 1.1 的得分为 58.7,而 Qwen3.8-27B 为 42.2,DeepSeek-V4-Flash 为 54.4,并注明 DeepSWE 使用了两套评测框架(Claude Code 与 mini-SWE-agent),取两者最高分。 在 SWE-bench Pro 上,Qwen3.8-Flash-Next 获得 62.5,领先 Qwen3.8-27B 的 61.7 和 Qwen3.7-Plus 的 55.8,所有模型在团队纠正所谓的有问题任务后,均在改进版基准上重新评估。

关键在于效率主张,而非单一数值。卡片列出模型总参数为 125B,激活 6B;而 Qwen3.7-Plus 为 397B 总参数,激活 17B。在通用知识方面,模型取得 GPQA Diamond 91.7 分,LiveCodeBench v6 91.9 分,以及由 GPT-4o 而非基准默认评分器评定的 HLE 35.9 分。卡片对这些选择保持透明,这比许多发布的做法更为开放,但这些仍是供应商自行决定的选项。

可用性与通往 Qwen4 的路线

Qwen3.8-Flash-Next 已在 Hugging Face 上发布,采用 qwen-community-1.0 许可证,权重为 BF16 格式,约合 180B 参数,涵盖语言模型、n-gram 嵌入以及多 token 预测层。卡片建议通过 SGLang、vLLM 或 TokenSpeed 部署,并指出 Qwen3.8-Flash——基于此预览构建的面向生产的对应版本,默认 1M token 上下文并内置官方工具——是供 Qwen Cloud 托管 API 使用的版本。

“Next”标签正是说明。团队明确将其定位为支撑 Qwen4 的架构实验预览,这使其与早期 Qwen 系列在旗舰周期前测试设计方向的发布属于同一类别。无论该特定设计最终是否成为 Qwen4 的基础,或是团队日后放弃的分支,这次发布记录了某大型实验室在效率方向上的押注所在。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。