AI 모델 및 플랫폼

Liquid AI, LFM2.5-VL-3B 에지에서 더 빠른 비전-언어 AI를 위해 출시

mm
Unite.AI를 Google의 선호 소스에 추가

Liquid AI는 2026년 8월 12일 31억 파라미터의 공개 가중치 비전·언어 모델 LFM2.5-VL-3B를 출시했습니다. 데이터센터보다 휴대폰, 노트북, GPU 한 대에서 실행하도록 설계했으며 가중치는 즉시 이용 가능합니다. 모델은 회사 블로그와 Hugging Face에 공개됐습니다. 지난해 LFM2-VL-3B를 확장해 화면 이해, 자연어와 객체 위치의 연결, 여러 이미지에 대한 추론, 함수 호출 능력을 강화했습니다.

회사는 직접 운영하는 하드웨어용으로 자사의 가장 뛰어난 비전 모델이라고 설명합니다. 크기가 두 배인 모델과 견줄 비전 성능을 내며, 다양한 CPU·GPU 환경에서 파라미터가 더 적은 모델과 비교해도 더 빠르게 실행된다는 주장입니다.

이 출시에서 모든 벤치마크와 속도 수치는 벤더가 보고한 것입니다. Liquid AI는 vLLM 0.26.0을 사용하여 평가를 수행했으며, 모든 모델은 비추론 모드에서 직접 답변하도록 프롬프트되었습니다. 아직 독립적인 평가가 없습니다. 그러나 최근 Unite.AI의 아마존 연구에 대한 보도는 독립적으로 측정된 전사 동작이 깨끗한 벤치마크 점수와 어떻게 다를 수 있는지를 보여줍니다. (AMZN )

LFM2.5-VL-3B가 화면, 문서, 여러 이미지를 읽는 방법

이 모델은 구글의 SigLIP2 400M NaFlex 비전 인코더와 2026년 8월 4일 출시한 Liquid AI LFM2.5-2.6B 텍스트 모델의 사전학습 기반을 결합합니다. 모델 카드에 따르면 사전학습 토큰은 약 34조 개이며 이전 모델보다 시각 데이터를 네 배 더 사용했습니다. 비라틴 문자 지원을 위해 토크나이저를 다시 학습하는 대신 기존 것을 확장해 어휘 수를 두 배인 12만8,000토큰으로 늘렸습니다. 후속 학습은 지도 미세조정과 더 큰 교사 모델의 지식 증류를 결합한 뒤 다중 보상 강화학습을 수행합니다.

이전 LFM2-VL-3B 대비 네 영역을 강화했습니다. 화면 이해는 ScreenSpot-v2의 데스크톱·모바일·웹 평가 평균 80.7로 이전의 한 자릿수 점수에서 올랐습니다. 80억 파라미터 Gemma-4-E4B의 50.9보다 높지만 더 큰 InternVL 3.5 4B의 84.2에는 못 미칩니다. 자연어로 지칭한 객체의 경계 상자를 찾는 그라운딩에서는 RefCOCO 정밀도가 57.1에서 87.9로 30점 이상 올랐으며 회사는 합성 위치 연결 데이터 확대의 효과라고 설명합니다.

함수 호출은 회사 비전 제품군의 새 기능입니다. 도구 사용을 측정하는 ToolSandbox 점수는 26.4에서 59.5로 두 배 넘게 올라, 31억 파라미터 모델이 Gemma-4-E2B와 비슷하고 Qwen3.5-2B를 앞섰습니다. 여러 이미지 추론도 개선돼 BLINK는 50.2에서 61.5, MuirBench는 34.9에서 58.3으로 올랐습니다.

전체 비전 벤치마크 28개의 평균은 69.4로 이전 모델의 57.2보다 약 12점 높고, 더 큰 47억 파라미터 Qwen3.5-4B와 0.7점 이내 차이입니다. 다만 일부 범용 평가에서는 경쟁 모델에 뒤지고 CountBenchQA는 92.2에서 87.3으로 낮아져 평균만으로는 차이를 다 보여 주지 못합니다.

모델이 의도적으로 생략하는 것

LFM2.5-VL-3B는 중간 사고 사슬을 생성하지 않고 직접 답하는 비추론 모델입니다. 회사는 이를 지연 최소화 설계로 설명합니다. 모델 카드는 단일 턴·고처리량·저지연 작업에 권하며, 자동차용 준실시간 객체 탐지, 스캔 문서의 일괄 OCR, 메뉴·도로 표지판의 기기 내 번역을 용도로 제시합니다.

같은 모델 카드는 긴 문맥이나 집중적인 추론이 필요한 시각적 웹 디자인, 설계도에 관한 고도의 기술적 질의 등에 권하지 않는다고 명시합니다. 문맥 길이는 32,768토큰이며 레이아웃 주석 OCR 형식은 실험적이어서 바뀌거나 불안정하거나 파싱이 쉽지 않을 수 있다고 설명합니다. 공급업체가 스스로 밝힌 기능의 한계입니다.

출시를 주도하는 속도 수치는 이러한 설계에서 비롯됩니다. Liquid AI는 Apple M5 Max에서 초당 228 토큰, AMD Ryzen AI Max+ 395에서 초당 116 토큰, 약 3GB의 메모리에서, Galaxy S26 Ultra에서 초당 20 토큰의 디코딩 속도를 보고했습니다. 또한 싱글 NVIDIA H100에서 5프레임 비디오 클립에서 첫 토큰까지의 시간을 약 34 밀리초로 측정했으며, Gemma 모델에서는 약 200 밀리초였습니다. 또한 높은 동시성에서 약 11,000 토큰/초의 출력 처리량을 달성했으며, 이는 하루에 한 카드당 약 10억 토큰을 생성할 수 있다고 합니다.

LFM2.5-VL-3B의 숫자

  • 31억 파라미터, 사전학습 34조 토큰, 문맥 길이 32,768토큰
  • 28개의 비전 벤치마크에서 평균 69.4, LFM2-VL-3B의 57.2보다 12점 향상
  • ScreenSpot-v2 화면 이해에서 평균 80.7, 이전 모델의 2.5에서 7.6까지의 분할에서 크게 향상
  • RefCOCO 그라운드에서 87.9의 정밀도, 57.1에서 30점 이상의 증가
  • ToolSandbox 함수 호출에서 59.5, 26.4에서 두 배 이상의 증가
  • Apple M5 Max에서 228 토큰/초의 디코딩, Galaxy S26 Ultra에서 20 토큰/초, 약 3GB의 메모리 사용
  • 싱글 H100에서 약 11,000 토큰/초의 출력 처리량, 높은 동시성

LFM2.5-VL-3B와 함께 제공되는 것

가중치는 Hugging Face에서 오픈 웨이트 라이선스로 다운로드할 수 있으며, GGUF, ONNX, MLX 형식의 양자화된 내보내기와 llama.cpp, MLX, vLLM, SGLang, ONNX 런타임에서 제공되는 첫날 지원이 포함됩니다. WebGPU 데모는 브라우저에서 모델을 실행하며, 회사는 영어, 아랍어, 중국어, 일본어, 힌디를 포함한 16개의 언어를 지원합니다.

이번 출시는 Liquid AI가 2026년 하반기에 구축해 온 LFM2.5 제품군을 완성한다. 7월 말 긴 문맥의 CPU 추론용 인코더 변형, 8월 4일 LFM2.5-2.6B 텍스트 모델에 이어, 이제 소형 LFM2.5-VL-1.6B 및 450M 변형보다 상위에 해당하는 주력 비전 모델이 추가됐다. 가중치와 함께 미세조정 노트북 및 문서도 제공되므로, 처음부터 특정 근거 연결, OCR, 도구 호출 작업에 맞게 모델을 조정할 수 있다.

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.