AI 模型与平台
Multiverse Computing的4位修复技术超越全精度模型

Multiverse Computing 于 2026 年 8 月 25 日发布了一项技术,颠覆了模型部署中最可靠的权衡之一:将大型语言模型压缩至原参数量的一半并量化至 4 位,其得分高于其原始全精度检查点。该方法名为 Quantization-Aware Healing(QAH),在公司博客文章和配套论文中有详细说明,并已应用于 OpenAI 的 GPT-OSS 120B,压缩至 60B 参数并量化为 MXFP4。得到的 4 位模型在 9 项基准中有 7 项优于其自身的 bfloat16 源模型,其中在长上下文推理上提升了 7.4 分,数学竞赛上提升了 5.6 分。
该结果并非新前沿模型的排行榜条目,而是对压缩流水线中恢复步骤的主张——即在模型被缩小和量化后,通过再训练恢复这些步骤所破坏的能力。Multiverse 在Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs论文中指出,领域内标准的恢复方法将量化模型锚定在错误的教师上,修正这一单一选择即可消除压缩模型性能的上限。
教师是瓶颈
标准的高效部署方案包括三个阶段:通过移除层、头或神经元对架构进行结构压缩;将剩余权重量化至 4 位;随后通过进一步训练修复损伤。主流的修复方法是量化感知训练(quantization-aware training),即在模拟低精度前向传播的过程中对模型进行微调。另一种方法是量化感知蒸馏(quantization-aware distillation),让量化学生匹配冻结的全精度教师的输出分布。
当量化是唯一变化时,两者都能工作,因为存在同一模型的全精度副本可供教学。结构压缩打破了这一假设。一个从 120B 缩减到 60B 的模型从未在全精度下独立训练过;唯一的 bfloat16 候选是通过对原始模型进行蒸馏得到的检查点。Multiverse 认为,从该检查点蒸馏 4 位学生会将其准确率限制在该检查点自身的上限。
QAH 通过完全跳过中间教师来消除上限。4 位学生直接从原始、未压缩的 120B 模型蒸馏,通过对 logits 使用 KL 散度损失匹配其输出分布。教师和学生在规模和精度上均不相同,作者指出这并不重要:教师的输出分布会无论学生的架构如何都能转移。在此框架下,量化不再是有损的后处理步骤,而是对最强教师进行的第二轮完整蒸馏,而该教师(bfloat16 检查点)本身从未接受过此类监督。
基准测试显示的结果
标题对比将 QAH 处理的 60B MXFP4 模型与同架构的最佳全精度版本——恢复后的 60B bfloat16 检查点进行比较。4 位模型在 9 项基准中赢得了 7 项:
- AA-LCR(长上下文推理):42.7 对 35.3,提升 7.4 分
- AIME 2025(数学):76.3 对 70.7,提升 5.6 分
- Aider(代理编码):40.9 对 38.2
- τ²-bench(工具使用):61.7 对 59.4
- GPQA Diamond(科学):67.4 对 65.7
- IFBench(指令遵循):59.9 对 58.4
- LiveCodeBench(编码):66.5 对 65.5
两项失分——MMLU-Pro(73.8 对 74.0)和 SciCode(34.2 对 35.6)均在一点半以内。最大提升恰好出现在压缩通常损伤最大的领域:长上下文推理和数学。
相较于原始 120B 教师,4 位学生在参数量仅为教师一半、权重内存约为教师四分之一的情况下,在 LiveCodeBench(66.5 对 66.0)上略胜一筹,并在 GPQA Diamond 上仅差 1.6 分。剩余差距最大的仍是 AA-LCR,教师得分 50.0 而学生为 42.7,论文将此能力描述为在容量被削减后最难恢复的。
训练更快且不会崩溃
第二个实验隔离了损失函数。在相同条件下将 GPT-OSS 9B 模型量化为 MXFP4,QAH 与 QAT 的峰值得分基本持平,分别为 54.9 与 54.6(在 MMLU-Pro、LiveCodeBench、GPQA Diamond 上的平均)。此后两者路径分化。QAH 在约 100 步训练后达到峰值,速度约为 QAT 700 步的 1/7,并在第 1,200 步仍保持在峰值两分以内。QAT 在超过峰值后急剧下滑,同一点下降近 19 分。
实际后果是部署风险的差异:作者指出,QAT 检查点需要在持出信号上进行谨慎的提前停止,否则团队可能会发布已经开始退化的模型。而 QAH 检查点由于与冻结教师分布绑定,一旦追平后就没有梯度再推动其进一步变化,完整训练的检查点可以直接上线,无需额外监控。论文将差异归因于损失本身:交叉熵目标会无限推动模型趋向硬标签,而针对固定目标的 KL 蒸馏在收敛时会自行安静下来。
细则
这些数据均为 Multiverse Computing 对其自身流水线的测量,发表于其论文和博客文章,并非独立评估。论文声明 QAH 学生已以HyperNova-60B的形式开源权重发布,这是公司基于 gpt-oss-120b 构建的 Apache 2.0 模型。
该技术还依赖于公司早期工作的工具。对训练语料库中 32,000 标记上下文长度的修复复用了分块 KL 散度损失,该损失一次只计算一个序列切片的散度,而不是一次性构建完整的词表‑序列网格,相关内容详见配套论文与博客文章(2026 年 8 月 10 日发布)。该早期工作在一次孤立基准中将 32K 标记蒸馏的峰值内存从 85.2 GiB 降至 5.45 GiB,使得长上下文修复能够适配固定的 GPU 预算。新论文还指出分布式训练后端之间存在可复现的质量差距,作为部署教训提出,但未在博客摘要中指明具体赢家。
结果为何具有推广价值
效率算式正是最初推动压缩的动因,这也是准确率逆转具有意义的根本原因。以 4 位精度运行时,QAH 模型的权重内存约为 bfloat16 学生的四分之一,参数量仅为教师的一半,因而每个标记的计算量约减半;对于仍以 bfloat16 而非 4 位发布的模型族来说,综合降幅接近每标记计算量的八分之一。Multiverse 当前的发布系列体现了相同理念:其Hypernova 60B 2605 检查点的权重为 32GB,而 gpt-oss-120b 为 65GB,公司报告在单卡 NVIDIA H200 上的吞吐量更高。
如果该配方能够超出当前流水线使用,那么对开源权重部署的意义在于,4 位服务的准确率损耗并非自然法则,而是由“谁在教学生”决定的。Multiverse 的压缩工作已应用于其他实验室的开源模型,公司正将该配方作为无需多周超参数搜索即可部署的方案出售。4 位检查点在 9 项基准中击败其 16 位父模型的事实,就是他们选择作为宣传重点的证据。












