AI-modeller og platforme

Liquid AI udgiver LFM2.5-VL-3B til hurtigere vision-sprog AI på kanten

mm
Føj Unite.AI til dine foretrukne kilder på Google

Liquid AI udgav LFM2.5-VL-3B den 12. august 2026, en 3,1 milliards-parameter åben-vægt vision-sprog model bygget til at køre på telefoner, bærbare computere og enkelt GPU’er i stedet for i et datacenter. Modellen, annonceret på virksomhedens blog og udgivet på Hugging Face med vægte tilgængelige med det samme, udvider sidste års LFM2-VL-3B med stærkere skærmforståelse, objektfundament, multi-billede resonans og funktionkald.

Virksomheden positionerer udgivelsen som sin mest kapable vision-model til selv-værtede hardware. I udgivelsesposten beskriver Liquid AI det som “vores mest kapable vision-sprog model,” en model, der “leverer konkurrencedygtig vision-præstation mod modeller, der er dobbelt så store, samtidig med at den kører hurtigere på en række CPU- og GPU-installationer, selv sammenlignet med modeller, der har færre parametre.”

Alle benchmark- og hastighedsfigurer i denne udgivelse er rapporteret af leverandøren: Liquid AI udførte evalueringerne selv ved hjælp af vLLM 0.26.0, med hver model i non-reasoning tilstand og opfordret til at svare direkte. Der findes ikke selvstændige evalueringer af den nye model endnu, hvilket er den forventede tilstand på udgivelsesdagen, selv om Unite.AIs dækning af en Amazon-studie, der evaluerede flere af de samme comparator-modeller, illustrerer hvorfor uafhængigt målt transskriptionsadfærd kan afvige fra rene benchmark-scores.

How LFM2.5-VL-3B Reads Screens, Documents, and Multiple Images

Modellen parer en SigLIP2 400M NaFlex vision encoder fra Google med den samme forudtrænede ryggrad som Liquid AI’s LFM2.5-2.6B tekstmodel, udgivet den 4. august 2026. Ifølge modelkortet blev det forudtrænet på omtrent 34 billioner tokens med fire gange mere vision-data end sin forgænger, og dens ordbog blev fordoblet til 128.000 tokens ved at udvide den eksisterende tokenizer i stedet for at gen-træne, en ændring rettet mod ikke-latinske skripter. Efter-træning kombinerer overvåget fin-justering med viden-destillation fra en større lærer-model, efterfulgt af multi-belønning forstærket læring.

Fire kapacitetsområder definerer opgraderingen over LFM2-VL-3B. På skærmforståelse gennemsnitter modellen 80,7 på de skrivebords-, mobile- og web-udgaver af ScreenSpot-v2, op fra enkelte cifre på den forrige udgivelse og langt foran den 8-milliard-parameter Gemma-4-E4B på 50,9, selv om den er bag den større InternVL 3.5 4B på 84,2. På grundlæggelse, hvor modellen returnerer begrænsningsbokse for objekter beskrevet i naturligt sprog, springer RefCOCO-præcision fra 57,1 til 87,9, en gevinst på mere end 30 point, som Liquid AI tilskriver skaleret syntetisk grundlæggelse-data.

Funktionskald er nyt for virksomhedens vision-linje. På ToolSandbox, der måler værktøjsbrug, mere end fordobles scoren fra 26,4 til 59,5, hvilket bringer den 3,1-milliard-parameter-model på lige fod med Gemma-4-E2B og foran Qwen3.5-2B. Multi-billede resonans forbedres også skarpt, med BLINK, der stiger fra 50,2 til 61,5, og MuirBench fra 34,9 til 58,3.

På tværs af det fulde 28-benchmark vision-suite gennemsnitter LFM2.5-VL-3B 69,4, en 12-punkts forbedring over forgængeren på 57,2, og inden for 0,7 point fra den større 4,7-milliard-parameter Qwen3.5-4B. Gennemsnittet skjuler dog virkelig tekstur: modellen er bag sine rivaler på nogle generelle suiter, og den taber faktisk terræn på CountBenchQA, der falder fra 92,2 til 87,3.

What the Model Deliberately Leaves Out

LFM2.5-VL-3B er en non-reasoning model. Den svarer direkte i stedet for at generere en mellemvarende tankekæde, en designvalg, som Liquid AI rammer som latency-optimering: modelkortet anbefaler det til “single-turn, high-throughput, low-latency opgaver”, og nævner near-real-time objektgenkendelse til automatiske formål, batch-OCR af skannede dokumenter og på-enhed-oversættelse af menuer og vejvisningsskilter som målrettede arbejdslaster.

Dets samme kort siger åbent, hvad modellen ikke er til. Den “er ikke anbefalet til lange-kontekst, resonans-intensive opgaver, såsom visuel web-design eller besvarelse af højt tekniske spørgsmål om tegninger.” Kontekstlængde er 32.768 tokens, og kortet markerer sin layout-annotation OCR-format som eksperimentelt, og advarer, at det “kan ændre sig, kan være upålideligt og kan ikke være trivialt at parse.” Dette er leverandørens egne udtalte begrænsninger, og de markerer, hvor kapacitetskravene stopper.

Hastighedsfigurerne, der fastgør udgivelsen, følger fra den design. Liquid AI rapporterer afkodningshastigheder på 228 tokens per sekund på en Apple M5 Max og 116 tokens per sekund på en AMD Ryzen AI Max+ 395, i omkring 3 GB hukommelse, og 20 tokens per sekund på en Galaxy S26 Ultra. På en enkelt NVIDIA H100 måler virksomheden tid til første token på omtrent 34 millisekunder på en fem-ramme video-klip, mod omkring 200 millisekunder for Gemma-modellerne, og output-gennemstrømning nær 11.000 tokens per sekund ved høj samtidighed, hvilket det siger tilføjer op til næsten en milliard output-tokens per dag på ét kort.

LFM2.5-VL-3B by the Numbers

  • 3,1 milliarder parametre; 34 billioner forudtrænings-tokens; 32.768-token kontekst
  • 69,4 gennemsnit på 28 vision-benchmark, versus 57,2 for LFM2-VL-3B
  • 80,7 gennemsnit på ScreenSpot-v2 skærmforståelse, op fra 2,5 til 7,6 per split på den forrige model
  • 87,9 RefCOCO grundlæggelse-præcision, op fra 57,1
  • 59,5 på ToolSandbox funktionkald, op fra 26,4
  • 228 tokens/s afkodning på Apple M5 Max; 20 tokens/s på Galaxy S26 Ultra; omkring 3 GB hukommelsesaftryk
  • Omtrent 11.000 output-tokens/s ved høj samtidighed på en enkelt H100

What Ships With LFM2.5-VL-3B

Vægtene er downloadbare nu fra Hugging Face under en åben-vægt licens, med kvantificerede eksportér i GGUF, ONNX og MLX-formater og dag-en-understøttelse på tværs af llama.cpp, MLX, vLLM, SGLang og ONNX-kørsler. En WebGPU-demo kører modellen helt i browseren, og virksomheden nævner 16 understøttede sprog, herunder engelsk, arabisk, kinesisk, japansk og hindi.

Udgivelsen afrunder LFM2.5-familien, som Liquid AI har samlet i anden halvdel af 2026: LFM2.5-2.6B tekstmodellen den 4. august 2026, encoder-variationer til lang-kontekst CPU-inferens i slutningen af juli 2026, og nu det flagskib vision-niveau, der følger den mindre LFM2.5-VL-1.6B og 450M-variationer. Fin-justerings-notebøger og dokumentation følger med vægtene, så modellen kan tilpasses til bestemte grundlæggelse-, OCR- eller værktøjskalds-arbejdslaster fra første dag.

riants for long-context CPU inference in late juli 2026, and now the flagship vision tier, which follows the smaller LFM2.5-VL-1.6B and 450M variants. Fine-tuning notebooks and documentation ship alongside the weights, so the model can be adapted to specific grounding, OCR, or tool-calling workloads from the first day.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, der fokuserer på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde udforsker, hvordan læring, resonnering, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og hvordan der kan trækkes forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål i kognitiv videnskab og filosofi om sindet.
Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som resonneringsmodeller, agente systemer, emergent kognition og alignment-teori, med det formål at klargøre, hvad fremgang mod AGI faktisk betyder - og hvad det ikke gør. I stedet for at jagte tidsfrister eller hype lægger han vægt på første principper, konceptuel rigor og grænserne for nuværende modeller.
Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncepter.