AI-modellen en platforms
Liquid AI brengt LFM2.5-VL-3B uit voor snellere visie-taal AI op de edge

Liquid AI heeft LFM2.5-VL-3B uitgebracht op 12 augustus 2026, een 3,1-miljard-parameter open-weight visie-taalmodel dat is gebouwd om te draaien op telefoons, laptops en enkele GPUs in plaats van in een datacenter. Het model, aangekondigd op de blog van het bedrijf en geplaatst op Hugging Face met gewichten die onmiddellijk beschikbaar zijn, breidt het LFM2-VL-3B van vorig jaar uit met een beter schermverstand, objectgronding, multi-image redenering en functieaanroep.
Het bedrijf positioneert de release als zijn meest capabele visiemodel voor zelfgehoste hardware. In het releasebericht beschrijft Liquid AI het als “ons meest capabele visie-taalmodel”, een model dat “concurrerende visieprestaties levert tegen modellen die twee keer zo groot zijn, terwijl het sneller draait over een reeks CPU- en GPU-implementaties, zelfs in vergelijking met modellen met minder parameters”.
Alle benchmark- en snelheidsgegevens in deze release zijn door de leverancier gerapporteerd: Liquid AI heeft de evaluaties zelf uitgevoerd met vLLM 0.26.0, met elk model in non-reasoning-modus en aangestuurd om direct te antwoorden. Er zijn nog geen onafhankelijke evaluaties van het nieuwe model, wat de verwachte staat van play is op de releasedatum, hoewel recente Unite.AI-coverage van een Amazon-studie die een aantal van dezelfde comparator-modellen heeft geëvalueerd, illustreert waarom onafhankelijk gemeten transcriptiegedrag kan afwijken van schone benchmark-scores.
Hoe LFM2.5-VL-3B schermen, documenten en meerdere afbeeldingen leest
Het model combineert een SigLIP2 400M NaFlex-visie-encoder van Google met hetzelfde voorgetrainde backbone als het LFM2.5-2.6B-tekstmodel van Liquid AI, dat op 4 augustus 2026 is uitgebracht. Volgens de modelkaart is het voorgetraind op ongeveer 34 biljoen tokens met vier keer meer visiedata dan zijn voorganger, en is de woordenschat verdubbeld tot 128.000 tokens door het bestaande tokenizertool uit te breiden in plaats van opnieuw te trainen, een verandering die is gericht op niet-Latijnse scripts. Post-training combineert gesuperviseerde fijne afstemming met kennisdistillatie van een groter lerend model, gevolgd door multi-reward-versterking van het leren.
Vier capaciteitsgebieden definiëren de upgrade ten opzichte van LFM2-VL-3B. Op schermverstand, haalt het model gemiddeld 80,7 over de desktop-, mobiele- en webdelen van ScreenSpot-v2, een stijging van enkele cijfers in de vorige release en ver voor de 8-miljard-parameter Gemma-4-E4B op 50,9, hoewel het achterblijft bij de grotere InternVL 3.5 4B op 84,2. Op gronding, waarbij het model begrenzingskaders teruggeeft voor objecten die in natuurlijke taal worden beschreven, stijgt de RefCOCO-nauwkeurigheid van 57,1 naar 87,9, een winst van meer dan 30 punten die Liquid AI toeschrijft aan geschaalde synthetische grondinggegevens.
Functieaanroep is nieuw in de visielijn van het bedrijf. Op ToolSandbox, dat toolgebruik meet, stijgt de score meer dan verdubbelt van 26,4 naar 59,5, waardoor het 3,1-miljard-parametermodel gelijk is aan Gemma-4-E2B en voor Qwen3.5-2B. Meerdere afbeeldingen redeneren verbeteren ook scherp, met BLINK stijgend van 50,2 naar 61,5 en MuirBench van 34,9 naar 58,3.
Over de volledige 28-benchmark-visiesuite gemiddeld, haalt LFM2.5-VL-3B 69,4, een verbetering van 12 punten ten opzichte van de 57,2 van zijn voorganger en binnen 0,7 punten van de grotere 4,7-miljard-parameter Qwen3.5-4B. Het gemiddelde verhult echter echte texturen: het model verliest terrein op sommige algemene suites en verliest zelfs terrein op CountBenchQA, dat daalt van 92,2 naar 87,3.
Wat het model bewust weglaat
LFM2.5-VL-3B is een non-reasoning-model. Het antwoordt direct in plaats van een tussenliggende keten van gedachten te genereren, een ontwerpkeuze die Liquid AI kaderen als latentie-optimalisatie: de modelkaart beveelt het aan voor “single-turn, high-throughput, low-latency-taken”, waarbij near-real-time-objectdetectie voor automotive-toepassingen, batch-OCR van gescande documenten en on-device-vertaling van menu’s en wegborden worden genoemd als bedoelde workloads.
Dezelfde kaart vermeldt duidelijk wat het model niet is voor. Het “wordt niet aanbevolen voor lange-context, redeneringsintensieve taken, zoals visuele webdesign of het beantwoorden van zeer technische vragen over blauwdrukken.” Contextlengte is 32.768 tokens en de kaart markeert zijn lay-out-annotatie-OCR-formaat als experimenteel, met een waarschuwing dat het “kan veranderen, onbetrouwbaar kan zijn en niet triviaal kan zijn om te parseren”. Dit zijn de door de leverancier gestelde beperkingen en deze markeren waar de capaciteitsclaims stoppen.
De snelheidsnummers die de release ankeren, volgen uit die ontwerpkeuze. Liquid AI rapporteert decodesnelheden van 228 tokens per seconde op een Apple M5 Max en 116 tokens per seconde op een AMD Ryzen AI Max+ 395, in ongeveer 3 GB aan geheugen, en 20 tokens per seconde op een Galaxy S26 Ultra. Op een enkele NVIDIA H100 meet het bedrijf de tijd tot het eerste token op ongeveer 34 milliseconden op een vijf-frame-videoclip, tegen ongeveer 200 milliseconden voor de Gemma-modellen, en outputdoorvoer in de buurt van 11.000 tokens per seconde bij hoge gelijktijdigheid, wat het zegt toevoegt aan bijna een miljard outputtokens per dag op één kaart.
LFM2.5-VL-3B in cijfers
- 3,1 miljard parameters; 34 biljoen voorafgaande tokens; 32.768-tokencontext
- 69,4 gemiddeld over 28 visiebenchmarks, versus 57,2 voor LFM2-VL-3B
- 80,7 gemiddeld op ScreenSpot-v2-schermverstand, omhoog van 2,5 tot 7,6 per split op het vorige model
- 87,9 RefCOCO-grondingnauwkeurigheid, omhoog van 57,1
- 59,5 op ToolSandbox-functieaanroep, omhoog van 26,4
- 228 tokens/s decode op Apple M5 Max; 20 tokens/s op Galaxy S26 Ultra; ongeveer 3 GB geheugenvoetafdruk
- Ongeveer 11.000 outputtokens/s bij hoge gelijktijdigheid op een enkele H100
Wat er bij LFM2.5-VL-3B wordt geleverd
De gewichten zijn nu beschikbaar voor download op Hugging Face onder een open-weight-licentie, met gequantificeerde exporten in GGUF-, ONNX- en MLX-formats en dag-één-ondersteuning voor llama.cpp, MLX, vLLM, SGLang en ONNX-runtimes. Een WebGPU-demo draait het model volledig in de browser en het bedrijf vermeldt 16 ondersteunde talen, waaronder Engels, Arabisch, Chinees, Japans en Hindi.
De release rondt de LFM2.5-familie af die Liquid AI in de tweede helft van 2026 heeft opgebouwd: het LFM2.5-2.6B-tekstmodel op 4 augustus 2026, encoder-varianten voor lange-context-CPU-inferentie in late juli 2026 en nu de vlaggenschip-visielijn, die de kleinere LFM2.5-VL-1.6B- en 450M-varianten volgt. Fijne-afstelling-notebooks en documentatie worden geleverd samen met de gewichten, zodat het model kan worden aangepast aan specifieke gronding-, OCR- of tool-calling-workloads vanaf de eerste dag.












