AI-modeller och plattformar
Liquid AI Levererar LFM2.5-VL-3B fÃķr Snabbare Vision-SprÃĨk AI pÃĨ Kanten

Liquid AI slÃĪppte LFM2.5-VL-3B den 12 augusti 2026, en 3,1-miljardersparametrar Ãķppenvikt vision-sprÃĨkmodell byggd fÃķr att kÃķras pÃĨ telefoner, bÃĪrbara datorer och enskilda GPU:er snarare ÃĪn i ett datacenter. Modellen, tillkÃĪnnagiven pÃĨ fÃķretagets blogg och publicerad pÃĨ Hugging Face med vikter tillgÃĪngliga omedelbart, utÃķkar fÃķrra ÃĨrets LFM2-VL-3B med starkare skÃĪrmfÃķrstÃĨelse, objektfÃķrankring, multi-bildresonemang och funktionssamtal.
FÃķretaget positionerar utgÃĨvan som sin mest kapabla visionmodell fÃķr sjÃĪlvvÃĪrd hÃĨrdvara. I utgivningsinlÃĪgget beskriver Liquid AI det som âvÃĨr mest kapabla vision-sprÃĨkmodellâ, en som âerbjuder konkurrenskraftig visionprestanda mot modeller som ÃĪr dubbelt sÃĨ stora, samtidigt som den kÃķrs snabbare Ãķver ett urval av CPU- och GPU-distributioner, ÃĪven jÃĪmfÃķrt med modeller som har fÃĪrre parametrarâ.
Alla benchmark- och hastighetsfigurer i den hÃĪr utgÃĨvan ÃĪr rapporterade av leverantÃķren: Liquid AI genomfÃķrde utvÃĪrderingarna sjÃĪlv med vLLM 0.26.0, med varje modell i icke-resonemlÃĪge och uppmanad att svara direkt. Inga oberoende utvÃĪrderingar av den nya modellen finns ÃĪnnu, vilket ÃĪr det fÃķrvÃĪntade tillstÃĨndet pÃĨ utgivningsdagen, ÃĪven om en nylig Unite.AI-tÃĪckning av en Amazon-studie som utvÃĪrderade flera av samma jÃĪmfÃķrelsemodeller illustrerar varfÃķr oberoende mÃĪtningar av transkriptionsbeteende kan avvika frÃĨn rena benchmark-poÃĪng.
Hur LFM2.5-VL-3B LÃĪser SkÃĪrmar, Dokument och Flera Bilder
Modellen parar en SigLIP2 400M NaFlex vision-encoder frÃĨn Google med samma fÃķrtrÃĪnade ryggrad som Liquid AI:s LFM2.5-2.6B textmodell, slÃĪppt den 4 augusti 2026. Enligt modellkortet var den fÃķrtrÃĪnad pÃĨ cirka 34 biljoner token med fyra gÃĨnger mer visiondata ÃĪn sin fÃķregÃĨngare, och dess ordfÃķrrÃĨd fÃķrdubblades till 128 000 token genom att utÃķka den befintliga tokenisatorn snarare ÃĪn omtrÃĪna, en fÃķrÃĪndring som syftade till icke-latinska skript. EftertrÃĪning kombinerar Ãķvervakad finjustering med kunskapsdestillering frÃĨn en stÃķrre lÃĪrarmodell, fÃķljt av multi-belÃķningsfÃķrstÃĪrkt inlÃĪrning.
Fyra fÃķrmÃĨgeomrÃĨden definierar uppgraderingen av LFM2-VL-3B. NÃĪr det gÃĪller skÃĪrmfÃķrstÃĨelse ÃĪr modellen i genomsnitt 80,7 Ãķver skrivbords-, mobil- och webbdelarna av ScreenSpot-v2, upp frÃĨn enstaka siffror pÃĨ den tidigare versionen och lÃĨngt fÃķre den 8-miljardersparametrar Gemma-4-E4B pÃĨ 50,9, ÃĪven om den ligger bakom den stÃķrre InternVL 3.5 4B pÃĨ 84,2. NÃĪr det gÃĪller fÃķrankring, dÃĪr modellen returnerar begrÃĪnsningsrutor fÃķr objekt som beskrivs i naturligt sprÃĨk, Ãķkar RefCOCO-precisionen frÃĨn 57,1 till 87,9, en vinst pÃĨ Ãķver 30 poÃĪng som Liquid AI tillskriver skalad syntetisk fÃķrankringsdata.
Funktionsanrop ÃĪr nytt fÃķr fÃķretagets visionsserie. PÃĨ ToolSandbox, som mÃĪter verktygsanvÃĪndning, mer ÃĪn fÃķrdubblar poÃĪngen frÃĨn 26,4 till 59,5, vilket placerar 3,1-miljardersmodellen pÃĨ samma nivÃĨ som Gemma-4-E2B och fÃķre Qwen3.5-2B. Multi-bildresonemang fÃķrbÃĪttras ocksÃĨ kraftigt, med BLINK som stiger frÃĨn 50,2 till 61,5 och MuirBench frÃĨn 34,9 till 58,3.
Ãver hela den 28-benchmark-visionssviten ÃĪr LFM2.5-VL-3B i genomsnitt 69,4, en 12-poÃĪngsfÃķrbÃĪttring jÃĪmfÃķrt med fÃķregÃĨngarens 57,2 och inom 0,7 poÃĪng frÃĨn den stÃķrre 4,7-miljardersparametrar Qwen3.5-4B. Genomsnittet dÃķljer verklig textur, dock: modellen slÃĪpar efter sina rivaler pÃĨ vissa allmÃĪnna sviter och fÃķrlorar faktiskt mark pÃĨ CountBenchQA, som sjunker frÃĨn 92,2 till 87,3.
Vad Modellen Medvetet UtelÃĪmnar
LFM2.5-VL-3B ÃĪr en icke-resonemodell. Den svarar direkt snarare ÃĪn att generera en mellanliggande kedja av tankar, ett designval som Liquid AI rammer in som latensoptimering: modellkortet rekommenderar det fÃķr âenkelomsvÃĪng, hÃķggenomstrÃķmning, lÃĨglatensuppgifterâ, och nÃĪmner nÃĪra-realtidssobjektdetektering fÃķr fordonsapplikationer, batch-OCR av skannade dokument och enhetsÃķversÃĪttning av menyer och vÃĪgskyltar som avsedda arbetsbelastningar.
Samma kort anger tydligt vad modellen inte ÃĪr till fÃķr. Den ârekommenderas inte fÃķr lÃĨngkontext, resonemstunga uppgifter, sÃĨsom visuell webbdesign eller att besvara hÃķgt tekniska frÃĨgor om ritningarâ. KontextlÃĪngden ÃĪr 32 768 token, och kortet flaggar dess layout-annoterings-OCR-format som experimentellt, varnar fÃķr att det âkan ÃĪndras, kan vara opÃĨlitligt och kan inte vara trivialt att tolkaâ. Detta ÃĪr leverantÃķrens egna uttalade begrÃĪnsningar, och de markerar var kapacitetsansprÃĨken slutar.
De hastighetsnummer som fÃķrankrar utgÃĨvan fÃķljer av detta designval. Liquid AI rapporterar avkodningshastigheter pÃĨ 228 token per sekund pÃĨ en Apple M5 Max och 116 token per sekund pÃĨ en AMD Ryzen AI Max+ 395, i cirka 3 GB minne, och 20 token per sekund pÃĨ en Galaxy S26 Ultra. PÃĨ en enskild NVIDIA H100 mÃĪter fÃķretaget tid till fÃķrsta token pÃĨ cirka 34 millisekunder pÃĨ en femramsvideoklipp, mot cirka 200 millisekunder fÃķr Gemma-modellerna, och utmatningsgenomstrÃķmning nÃĪra 11 000 token per sekund vid hÃķg samtidighet, vilket det sÃĪger motsvarar nÃĪstan en miljard utmatningstoken per dag pÃĨ ett kort.
LFM2.5-VL-3B i Siffror
- 3,1 miljarder parametrar; 34 biljoner fÃķrtrÃĪnings-token; 32 768-token kontext
- 69,4 i genomsnitt Ãķver 28 vision-benchmark, jÃĪmfÃķrt med 57,2 fÃķr LFM2-VL-3B
- 80,7 i genomsnitt pÃĨ ScreenSpot-v2 skÃĪrmfÃķrstÃĨelse, upp frÃĨn 2,5 till 7,6 per del pÃĨ den tidigare modellen
- 87,9 RefCOCO-fÃķrankringsprecision, upp frÃĨn 57,1
- 59,5 pÃĨ ToolSandbox-funktionsanrop, upp frÃĨn 26,4
- 228 token/s avkodning pÃĨ Apple M5 Max; 20 token/s pÃĨ Galaxy S26 Ultra; cirka 3 GB minnesavtryck
- UngefÃĪr 11 000 utmatningstoken/s vid hÃķg samtidighet pÃĨ en enskild H100
Vad som FÃķljer med LFM2.5-VL-3B
Vikterna ÃĪr nedladdningsbara nu frÃĨn Hugging Face under en Ãķppenviktslicens, med kvantiserade exporter i GGUF-, ONNX- och MLX-format och dag-1-stÃķd Ãķver llama.cpp, MLX, vLLM, SGLang och ONNX-kÃķrningar. En WebGPU-demo kÃķr modellen helt i webblÃĪsaren, och fÃķretaget listar 16 stÃķdda sprÃĨk, inklusive engelska, arabiska, kinesiska, japanska och hindi.
UtgÃĨvan avrundar LFM2.5-familjen som Liquid AI har sammanstÃĪllt under den senare hÃĪlften av 2026: LFM2.5-2.6B-textmodellen den 4 augusti 2026, encoder-varianter fÃķr lÃĨngkontext-CPU-inferens i slutet av juli 2026, och nu flaggskeppsvisionstier, som fÃķljer den mindre LFM2.5-VL-1.6B och 450M-varianten. FinjusteringsanteckningsbÃķcker och dokumentation levereras tillsammans med vikterna, sÃĨ att modellen kan anpassas till specifika fÃķrankrings-, OCR- eller verktygsanropsarbetsbelastningar frÃĨn den fÃķrsta dagen.












