AI 모델 및 플랫폼
Liquid AI, LFM2.5-VL-3B 에지에서 더 빠른 비전-언어 AI를 위해 출시

Liquid AI는 2026년 8월 12일, 3.1억 파라미터의 오픈 웨이트 비전-언어 모델인 LFM2.5-VL-3B를 출시했습니다. 이 모델은 데이터 센터가 아닌 전화, 랩톱, 싱글 GPU에서 실행하도록 설계되었으며, 회사 블로그와 Hugging Face에 발표되었습니다. 이 모델은 지난 해의 LFM2-VL-3B를 확장하여 더 강력한 화면 이해, 객체 그라운드, 멀티 이미지推論, 함수 호출을 제공합니다.
회사는 이 출시를 가장 강력한 비전 모델로 пози션합니다. 출시 게시물에서 Liquid AI는 “우리의 가장 강력한 비전-언어 모델”이라고 설명하며, “모델 크기의 두 배인 모델에 비해 경쟁력 있는 비전 성능을 제공하면서도 CPU와 GPU 배포에서 더 빠르게 실행”된다고 합니다.
이 출시에서 모든 벤치마크와 속도 수치는 벤더가 보고한 것입니다. Liquid AI는 vLLM 0.26.0을 사용하여 평가를 수행했으며, 모든 모델은 비추론 모드에서 직접 답변하도록 프롬프트되었습니다. 아직 독립적인 평가가 없습니다. 그러나 최근 Unite.AI의 아마존 연구에 대한 보도는 독립적으로 측정된 전사 동작이 깨끗한 벤치마크 점수와 어떻게 다를 수 있는지를 보여줍니다.
LFM2.5-VL-3B가 화면, 문서, 여러 이미지를 읽는 방법
이 모델은 구글의 SigLIP2 400M NaFlex 비전 인코더와 Liquid AI의 LFM2.5-2.6B 텍스트 모델의 동일한 사전 학습된 백본을 결합합니다. 모델 카드에 따르면, 이는 약 34조 토큰으로 사전 학습되었으며, 이전 모델보다 4배 더 많은 비전 데이터를 사용했습니다. 또한 어휘가 128,000 토큰으로 확장되었으며, 기존 토크나이저를 확장하여 재학습하지 않았습니다. 이는 비라틴 스크립트를 위한 것입니다. 사후 학습은 지도 학습 및 더 큰 교사 모델에서 지식 증류를 결합한 후 다중 보상 강화 학습을 수행합니다.
업그레이드의 네 가지 기능 영역이 정의됩니다. 화면 이해에서, 모델은 ScreenSpot-v2의 데스크톱, 모바일, 웹 분할에서 평균 80.7을 달성하며, 이전 모델의 2.5에서 7.6까지의 분할에서 크게 향상되었습니다. 또한 Gemma-4-E4B의 50.9를 앞섰습니다. 그러나 더 큰 InternVL 3.5 4B의 84.2에는 뒤처졌습니다. 그라운드에서, 모델은 자연어로 설명된 객체에 대한 바운딩 박스를 반환하며, RefCOCO 정밀도는 57.1에서 87.9로 증가했습니다. 이는 30점 이상의 증가로, Liquid AI는 이 증가를 합성 그라운드 데이터의 확장으로 설명합니다.
함수 호출은 회사의 비전 라인에서 새로운 기능입니다. ToolSandbox에서, 모델은 26.4에서 59.5로 점수를 두 배 이상 늘렸습니다. 이는 Gemma-4-E2B와 동등하며 Qwen3.5-2B보다 앞섭니다. 또한 멀티 이미지推論이 크게 향상되었습니다. BLINK는 50.2에서 61.5로, MuirBench는 34.9에서 58.3으로 증가했습니다.
전체 28개의 비전 벤치마크에서, LFM2.5-VL-3B는 평균 69.4를 달성했습니다. 이는 이전 모델의 57.2보다 12점 향상되었으며, 더 큰 4.7억 파라미터 Qwen3.5-4B와 0.7점 차이로競爭합니다. 그러나 모델은 일부 일반적인 스위트에서 뒤처지며, CountBenchQA에서 92.2에서 87.3으로 감소했습니다.
모델이 의도적으로 생략하는 것
LFM2.5-VL-3B는 비추론 모델입니다. 모델은 중간 생각의 사슬을 생성하지 않고 직접 답변하며, 이는 지연 시간 최적화로 설계되었습니다. 모델 카드는 “단일 턴, 고 처리량, 저 지연 시간 작업”에 적합하다고 설명하며, 자동차 응용 프로그램을 위한 실시간 객체 감지, 스캔된 문서의 배치 OCR, 메뉴 및 도로 표지판의 기기 내 번역을 예로 들었습니다.
同じ 카드는 모델이 무엇을 위한 것이 아닌지 명확하게 설명합니다. “장기 문맥, 추론 집중적인 작업, 예를 들어 시각적 웹 디자인 또는 청사진에 대한 기술적인 질문에 대한 답변”에 추천하지 않습니다. 문맥 길이는 32,768 토큰이며, 레이아웃 주석 OCR 형식은 실험적이며 “변경, 신뢰할 수 없거나 구문 분석하기 어려울 수” 있다고 경고합니다. 이는 벤더의 자체 제약이며, 여기서 기능 주장이 끝납니다.
출시를 주도하는 속도 수치는 이러한 설계에서 비롯됩니다. Liquid AI는 Apple M5 Max에서 초당 228 토큰, AMD Ryzen AI Max+ 395에서 초당 116 토큰, 약 3GB의 메모리에서, Galaxy S26 Ultra에서 초당 20 토큰의 디코딩 속도를 보고했습니다. 또한 싱글 NVIDIA H100에서 5프레임 비디오 클립에서 첫 토큰까지의 시간을 약 34 밀리초로 측정했으며, Gemma 모델에서는 약 200 밀리초였습니다. 또한 높은 동시성에서 약 11,000 토큰/초의 출력 처리량을 달성했으며, 이는 하루에 한 카드당 약 10억 토큰을 생성할 수 있다고 합니다.
LFM2.5-VL-3B의 숫자
- 3.1억 파라미터, 34조 토큰의 사전 학습, 32,768 토큰의 문맥
- 28개의 비전 벤치마크에서 평균 69.4, LFM2-VL-3B의 57.2보다 12점 향상
- ScreenSpot-v2 화면 이해에서 평균 80.7, 이전 모델의 2.5에서 7.6까지의 분할에서 크게 향상
- RefCOCO 그라운드에서 87.9의 정밀도, 57.1에서 30점 이상의 증가
- ToolSandbox 함수 호출에서 59.5, 26.4에서 두 배 이상의 증가
- Apple M5 Max에서 228 토큰/초의 디코딩, Galaxy S26 Ultra에서 20 토큰/초, 약 3GB의 메모리 사용
- 싱글 H100에서 약 11,000 토큰/초의 출력 처리량, 높은 동시성
LFM2.5-VL-3B와 함께 제공되는 것
가중치는 Hugging Face에서 오픈 웨이트 라이선스로 다운로드할 수 있으며, GGUF, ONNX, MLX 형식의 양자화된 내보내기와 llama.cpp, MLX, vLLM, SGLang, ONNX 런타임에서 제공되는 첫날 지원이 포함됩니다. WebGPU 데모는 브라우저에서 모델을 실행하며, 회사는 영어, 아랍어, 중국어, 일본어, 힌디를 포함한 16개의 언어를 지원합니다.
이 출시로 LFM2.5 패밀리가 완성되었습니다. 2026년 8월 4일 LFM2.5-2.6B 텍스트 모델, 2026년 7월 말에 긴 문맥 CPU 추론을 위한 인코더 변형, 그리고 이제는 플래그십 비전 티어입니다. 이는 더 작은 LFM2.5-VL-1.6B와 450M 변형을 따릅니다. 미세 조정 노트북과 문서는 가중치와 함께 제공되므로 모델을 첫째 날부터 특정 그라운드, OCR 또는 툴 호출 작업負荷에 적응시킬 수 있습니다.
riants for long-context CPU inference in late 2026년 7월, and now the flagship vision tier, which follows the smaller LFM2.5-VL-1.6B and 450M variants. Fine-tuning notebooks and documentation ship alongside the weights, so the model can be adapted to specific grounding, OCR, or tool-calling workloads from the first day.












