AI 模型与平台
Liquid AI 发布 LFM2.5-VL-3B,实现边缘设备上的更快视觉语言 AI

Liquid AI 于 2026 年 8 月 12 日发布了 LFM2.5-VL-3B,这是一个 3.1 亿参数的开源视觉语言模型,旨在运行在手机、笔记本电脑和单个 GPU 上,而不是在数据中心。该模型在公司的 博客 上宣布,并在 Hugging Face 上发布,权重可立即下载。该模型扩展了去年的 LFM2-VL-3B,具有更强大的屏幕理解、对象接地、多图像推理和函数调用能力。
该公司将此次发布定位为其最具能力的视觉模型,适用于自托管硬件。在发布帖中,Liquid AI 将其描述为“我们最具能力的视觉语言模型”,该模型“在视觉性能方面与两倍大小的模型具有竞争力,同时在各种 CPU 和 GPU 部署中运行速度更快,甚至比参数更少的模型还快。”
所有基准和速度数据均由供应商报告:Liquid AI 使用 vLLM 0.26.0 运行评估,每个模型都处于非推理模式,并直接回答问题。目前尚无独立评估该新模型的数据,这是发布当天的预期状态,尽管最近 Unite.AI 关于亚马逊研究的报道评估了几款相同的比较模型,说明了 为什么独立测量的转录行为可能与干净的基准评分有所不同。
LFM2.5-VL-3B 如何读取屏幕、文档和多个图像
该模型将来自 Google 的 SigLIP2 400M NaFlex 视觉编码器 与 Liquid AI 于 2026 年 8 月 4 日发布的 LFM2.5-2.6B 文本模型的相同预训练骨干相结合。根据 模型卡,该模型在大约 34 万亿令牌上预训练,其词汇量增加了一倍,达到 128,000 个令牌,通过扩展现有的分词器而不是重新训练,这一变化旨在支持非拉丁脚本。后训练结合了有监督的微调和来自更大教师模型的知识蒸馏,然后是多奖励强化学习。
四个能力领域定义了该模型相对于 LFM2-VL-3B 的升级。在屏幕理解方面,模型在 ScreenSpot-v2 的桌面、移动和 Web 分割上的平均值为 80.7,高于前一版本的个位数,并且远远领先于 8 亿参数的 Gemma-4-E4B(50.9),尽管低于更大的 InternVL 3.5 4B(84.2)。在接地方面,模型返回自然语言中描述的对象的边界框,RefCOCO 精度从 57.1 跃升至 87.9, Liquid AI 将这一超过 30 点的提升归因于合成接地数据的扩大。
函数调用是该公司视觉产品线的新功能。在 ToolSandbox 上,测量工具使用情况,得分从 26.4 增加到 59.5,使得 3.1 亿模型的性能与 Gemma-4-E2B 相当,并且优于 Qwen3.5-2B。多图像推理也大幅提高,BLINK 从 50.2 提升至 61.5,MuirBench 从 34.9 提升至 58.3。
在整个 28 项视觉基准测试中,LFM2.5-VL-3B 的平均值为 69.4,相比其前身的 57.2 提高了 12 点,并且与更大的 4.7 亿参数的 Qwen3.5-4B 相差仅 0.7 点。然而,这个平均值掩盖了实际的差异:该模型在一些通用套件上落后于其竞争对手,并且在 CountBenchQA 上实际上失去了地位,从 92.2 下降到 87.3。
模型故意省略的内容
LFM2.5-VL-3B 是一个非推理模型。它直接回答问题,而不是生成中间的思维链,这一设计选择被 Liquid AI 视为延迟优化:模型卡推荐它用于“单次、高速、低延迟任务”,提到了汽车应用中的实时物体检测、扫描文档的批量 OCR 和设备上的菜单和道路标志翻译作为预期的工作负载。
同一张卡明确指出该模型不适合的内容。它“不建议用于长上下文、推理密集型任务,例如视觉网页设计或回答关于蓝图的高度技术性问题。”上下文长度为 32,768 个令牌,该卡将其布局注释 OCR 格式标记为实验性的,警告它“可能会更改,可能不可靠,并且可能不容易解析。”这些是供应商自己的约束声明,它们标志着能力声明的结束。
发布时的速度数据源自这一设计。Liquid AI 报告称,在 Apple M5 Max 上的解码速度为每秒 228 个令牌,在 AMD Ryzen AI Max+ 395 上为每秒 116 个令牌,占用大约 3 GB 的内存,在 Galaxy S26 Ultra 上为每秒 20 个令牌。在单个 NVIDIA H100 上,公司测量五帧视频片段的首个令牌时间约为 34 毫秒,相比 Gemma 模型的 200 毫秒,而在高并发下的输出吞吐量接近每秒 11,000 个令牌,据称每天可产生近 10 亿个输出令牌。
LFM2.5-VL-3B 的数据
- 3.1 亿参数;34 万亿预训练令牌;32,768 个令牌的上下文
- 在 28 项视觉基准测试中的平均值为 69.4,相比 LFM2-VL-3B 的 57.2 提高了 12 点
- 在 ScreenSpot-v2 屏幕理解方面的平均值为 80.7,相比前一版本的 2.5 至 7.6 提高了很多
- RefCOCO 接地精度为 87.9,相比 57.1 提高了 30 多点
- 在 ToolSandbox 函数调用方面的得分为 59.5,相比 26.4 提高了很多
- 在 Apple M5 Max 上的解码速度为每秒 228 个令牌,在 Galaxy S26 Ultra 上为每秒 20 个令牌,占用大约 3 GB 的内存
- 在单个 H100 上的高并发下的输出令牌速度约为每秒 11,000 个
LFM2.5-VL-3B 附带的内容
权重现在可以从 Hugging Face 下载,采用开放权重许可,支持 GGUF、ONNX 和 MLX 格式的量化导出,并在 llama.cpp、MLX、vLLM、SGLang 和 ONNX 运行时中提供了第一天的支持。一个 WebGPU 演示 完全在浏览器中运行该模型,公司列出了 16 种支持语言,包括英语、阿拉伯语、中文、日语和印地语。
此次发布完成了 Liquid AI 在 2026 年下半年组装的 LFM2.5 家族:2026 年 8 月 4 日的 LFM2.5-2.6B 文本模型,2026 年 7 月下旬的长上下文 CPU 推理编码器变体,现在是跟随较小的 LFM2.5-VL-1.6B 和 450M 变体的旗舰视觉层。微调笔记本和文档随权重一起发布,因此该模型可以从第一天开始适应特定的接地、OCR 或工具调用工作负载。












