AI 模型与平台

Liquid AI 推出 LFM2.5-DSpark,实现最高 3.2 倍加速推理

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Liquid AI 于 2026 年 8 月 20 日发布了其 LFM2.5 系列中三款模型的投机解码草稿检查点,报告在单个 H100 GPU 上的吞吐提升最高可达 3.18 倍,在 Apple‑silicon MacBook 上最高可达 2.87 倍,且模型输出保持不变。LFM2.5-DSpark 发布涵盖了 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 以及混合专家模型 LFM2.5-8B-A1B 的草稿器,每个模型在目标模型基础上额外增加约 3 亿参数的草稿开销。

这些检查点以 Safetensors 和 GGUF 格式提供,并在 llama.cpp 和 SGLang 中实现了首日支持,这两项集成均已上游贡献至官方代码库。由于投机解码仅输出目标模型已验证的 token,公司表示生成的文本与目标模型在贪婪解码下单独运行时的输出完全一致,因此基准准确性未受影响。

Liquid AI 的测量在 batch size 为 1、temperature 为 0 的条件下,对五个数据集进行,得到 LFM2.5-2.6B 在 H100 上的平均加速为 2.67 倍(从 323 提升至 864 token/秒),在 M4 Max MacBook Pro 上的平均加速为 2.27 倍(从 61 提升至 139 token/秒)。单项最高结果来自 LFM2.5-8B-A1B 在 MATH500 上的测试,H100 上的吞吐率提升至 3.18 倍,从 428 增至 1,362 token/秒。公司还报告,DSpark 在多工具场景下对 LFM2.5-2.6B 的函数调用延迟平均降低了 57%,这是一项针对 LFM2.5 系列面向设备端代理工作负载的核心成果。

DSpark 如何加速解码

大语言模型推理的解码阶段受内存限制:大部分延迟来源于将权重从 DRAM 流入芯片内存,而非计算本身,这也是为何推理成本已成为该领域的核心工程难题。

投机解码通过让一个小型草稿模型提出一块候选 token,然后在目标模型的一次前向传播中验证整块 token,从而将加载权重的成本分摊到每个被检查的 token 上,以此应对上述瓶颈。

DSpark 于 2026 年 7 月的论文中由 DeepSeek 研究员提出,并在该公司 DeepSeek-V4 服务系统中部署,结合了三大组件:一个并行主干在一次前向传播中生成所有草稿 token 的隐藏状态;一个轻量级的顺序头部用于建模相邻 token 之间的依赖,以防块后期的接受率下降;以及一个置信度调度的验证器,在验证成本高于收益时剪枝低置信度的后缀。在 DeepSeek 的生产部署中,论文报告在相同吞吐下,每位用户的生成速度比之前的 MTP-1 基线提升了 60% 到 85%。

Liquid AI 的草稿器遵循该思路,采用了简化的仅注意力设计:五层网络、每步九个草稿 token 的块大小,以及基于 128,000 token 词表的马尔可夫头部,详见 LFM2.5-2.6B-DSpark 模型卡。每个草稿器在监督微调、对话、代码和函数调用数据的混合上训练了 15 个 epoch,检查点的选择依据最高接受率而非最低损失。准确性保证确保了质量:“投机解码是精确的:目标模型会验证每个提出的 token,因此贪婪输出等同于仅使用目标模型的输出”,GGUF 模型卡如此说明,并提供了每次响应的时序数据,展示了提出并被接受的草稿 token 数量。

LFM2.5-DSpark 数据概览

  • 3.18x — 报告的最佳 GPU 加速(LFM2.5-8B-A1B,MATH500,H100:428 → 1,362 tok/s)
  • 2.87x — 报告的最佳设备端加速(LFM2.5-1.2B-Instruct,HumanEval,M4 Max:136 → 389 tok/s)
  • 2.67x / 2.27x — LFM2.5-2.6B 在五个数据集上 H100 与 M4 Max 的平均加速
  • 57%:在多工具场景下 LFM2.5-2.6B 的函数调用延迟平均降低幅度
  • 295.7M–327.7M(草稿模型参数,针对目标模型 1.2B 至 8B)
  • 4.81 of 10,LFM2.5-2.6B 在块大小为 9 时每步平均接受的草稿 token 数

报告的加速效果收窄的地方

Liquid AI 自己的表格显示增益并不均衡,公司也给出了原因。对于 LFM2.5-8B-A1B,设备端的提升平均仅为 1.18 倍,尽管该模型的接受率在三者中最高,公司将此差距归因于当前 llama.cpp Metal 后端对混合专家实现的限制以及在验证一块 token 时跨专家激活的额外权重流量。对于 LFM2.5-1.2B-Instruct,接受率随数据集差异较大,导致加速幅度在不同文本分布下波动最高可达 52%,在 H100 上从 MT-Bench 的 1.66 倍到 MATH500 的 2.56 倍不等。

所有数据均由 Liquid AI 自己的测试套件提供:GPU 端使用 BF16 在一台 80GB H100 上运行 SGLang,设备端使用 FP16 GGUF 权重在配备实验性 Metal 内核的 M4 Max 上运行 llama.cpp,输出 token 数上限为 256。SGLang 路径需要针对 LFM2 目标的 DSpark 支持构建,llama.cpp 路径亦需相应构建,因此加速效果依赖于这些集成,而非任何引擎的稳定发行版。

Liquid AI 的设备端推进进展

DSpark 发布是 LFM2.5 系列在一周多时间内的第三次更新。2026 年 8 月 12 日,公司发布了面向边缘的视觉语言模型 LFM2.5-VL-3B,8 月 19 日又公布了该系列的量化感知蒸馏 Q4_0 检查点。整体思路保持一致:公司称 2.6B 模型在 MacBook 上的 DSpark 加速将交互性能提升至大多数专有云模型所能提供的约 140 token/秒的吞吐之上。

三款草稿器现已在 Hugging Face 上提供:LFM2.5-1.2B-Instruct-DSpark、LFM2.5-2.6B-DSpark,和 LFM2.5-8B-A1B-DSpark,并提供对应的 GGUF 构建以用于 llama.cpp 部署。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。