AI-modeller og plattformer

Liquid AI lanserer LFM2.5-VL-3B for raskere visuell-språklig AI på kanten

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Liquid AI lanserte LFM2.5-VL-3B den 12. august 2026, en 3,1 milliarder-parametere åpen-vekt visuell-språklig modell bygget for å kjøre på telefoner, bærbare datamaskiner og enkelt-GPU’er i stedet for i et datacenter. Modellen, annonsert på selskapets blogg og publisert på Hugging Face med vekter tilgjengelig umiddelbart, utvider LFM2-VL-3B fra i fjor med sterkere skjermforståelse, objektfestning, multi-bilde resonnering og funksjonskall.

Selskapet stiller lanseringen som sin mest kompetente visuell modell for selvvertede maskiner. I lanseringsposten beskriver Liquid AI det som “vår mest kompetente visuell-språklig modell,” en som “leverer konkurranse-evne visuell ytelse mot modeller som er dobbelt så store, samtidig som den kjører raskere over en rekke CPU- og GPU-distribusjoner, selv sammenlignet med modeller som har færre parametre.”

Alle benchmark- og hastighetsfigurer i denne lanseringen er rapportert av leverandøren: Liquid AI kjørte evalueringene selv ved hjelp av vLLM 0.26.0, med hver modell i ikke-resonneringsmodus og bedt om å svare direkte. Ingen uavhengige evalueringer av den nye modellen eksisterer ennå, hvilket er den forventede tilstanden på lanseringsdagen, selv om nylig Unite.AI-dekning av en Amazon-studie som evaluerte flere av de samme komparativmodellene illustrerer hvorfor uavhengig målt transkripsjonsatferd kan avvike fra rene benchmark-poeng.

Hvordan LFM2.5-VL-3B leser skjermer, dokumenter og flere bilder

Modellen parer en SigLIP2 400M NaFlex visuell encoder fra Google med samme forhånds-trent backbone som Liquid AI’s LFM2.5-2.6B tekstmodell, lansert den 4. august 2026. Ifølge modellkortet ble den forhåndstrent på omtrent 34 billioner token med fire ganger mer visuell data enn sin forgjenger, og dens vokabular ble doblet til 128 000 token ved å utvide den eksisterende tokenisereren i stedet for å gjennomføre om-trening, en endring rettet mot ikke-latinske skript. Etter-trening kombinerer overvåket fin-justering med kunnskaps-destillasjon fra en større lærermodell, etterfulgt av multi-belønning forsterket læring.

Fire evne-områder definerer oppgraderingen over LFM2-VL-3B. På skjermforståelse, gjennomsnittlig 80,7 over desktop-, mobil- og web-deler av ScreenSpot-v2, opp fra en-sifrede på den forrige utgaven og langt foran 8-milliarder-parametere Gemma-4-E4B på 50,9, selv om bak den større InternVL 3.5 4B på 84,2. På festning, hvor modellen returnerer avgrensningsskjermer for objekter beskrevet i naturlig språk, RefCOCO-presisjon hopper fra 57,1 til 87,9, en økning på over 30 poeng som Liquid AI tilskriver skalert syntetisk festningsdata.

Funksjonskall er nytt for selskapets visuell linje. På ToolSandbox, som måler verktøybruk, scorer den mer enn dobbelt fra 26,4 til 59,5, og plasserer 3,1-milliarder-modellen på lik linje med Gemma-4-E2B og foran Qwen3.5-2B. Flere-bilde resonnering forbedres også skarpt, med BLINK som stiger fra 50,2 til 61,5 og MuirBench fra 34,9 til 58,3.

Over hele 28-benchmark visuell-suitten, gjennomsnittlig LFM2.5-VL-3B 69,4, en 12-poengs forbedring over sin forgjengers 57,2 og innen 0,7 poeng fra den større 4,7-milliarder-parametere Qwen3.5-4B. Gjennomsnittet skjuler virkelig tekstur, selv om modellen taper terreng på noen generelle suiter, og den faktisk mister terreng på CountBenchQA, som synker fra 92,2 til 87,3.

Hva modellen med vilje lar være ute

LFM2.5-VL-3B er en ikke-resonneringsmodell. Den svarer direkte i stedet for å generere en mellomliggende tankekjede, en designvalg Liquid AI rammer inn som latensoptimalisering: modellkortet anbefaler det for “enkel-omgang, høy-gjennomstrømming, lav-latens oppgaver,” og nevner nær-sanntids objektdeteksjon for automotive-applikasjoner, batch-OCR av skannede dokumenter og på-enhet-oversettelse av meny og veiskilt som mål-arbeidsbelastninger.

Samme kort sier klart hva modellen ikke er for. Den “er ikke anbefalt for lange-kontekst, resonans-intensive oppgaver, som visuell web-design, eller å svare på høyt tekniske spørsmål om blueprints.” Kontekstlengde er 32 768 token, og kortet flagger sin layout-annoterings-OCR-format som eksperimentell, og advarer at det “kan endre seg, kan være upålitelig, og kan ikke være enkelt å parsere.” Dette er leverandørens egne uttalede begrensninger, og de markerer hvor evne-kravene stopper.

Hastighets-tallene som forankrer lanseringen følger fra denne designvalget. Liquid AI rapporterer avkodningshastigheter på 228 token per sekund på en Apple M5 Max og 116 token per sekund på en AMD Ryzen AI Max+ 395, i omtrent 3 GB minne, og 20 token per sekund på en Galaxy S26 Ultra. På en enkelt NVIDIA H100, måler selskapet tid til første token på omtrent 34 millisekunder på en fem-ramme video-klipp, mot rundt 200 millisekunder for Gemma-modellene, og utgangs-gjennomstrømming nær 11 000 token per sekund ved høy samtidighet, som det sier tilsvarer nesten en milliard utgangs-token per dag på ett kort.

LFM2.5-VL-3B i tall

  • 3,1 milliarder parametre; 34 billioner forhånds-trent token; 32 768-token kontekst
  • 69,4 gjennomsnitt over 28 visuelle benchmark, versus 57,2 for LFM2-VL-3B
  • 80,7 gjennomsnitt på ScreenSpot-v2 skjermforståelse, opp fra 2,5 til 7,6 per del på den forrige modellen
  • 87,9 RefCOCO-festningspresisjon, opp fra 57,1
  • 59,5 på ToolSandbox funksjonskall, opp fra 26,4
  • 228 token/s avkodning på Apple M5 Max; 20 token/s på Galaxy S26 Ultra; omtrent 3 GB minne-avtrykk
  • Omtrent 11 000 utgangs-token/s ved høy samtidighet på en enkelt H100

Hva som følger med LFM2.5-VL-3B

Vektene er lastbare nå fra Hugging Face under en åpen-vekt-lisens, med kvantiserte eksport i GGUF, ONNX og MLX-formater og dag-en-støtte over llama.cpp, MLX, vLLM, SGLang og ONNX-kjører. En WebGPU-demo kjører modellen helt i nettleseren, og selskapet listar 16 støttede språk, inkludert engelsk, arabisk, kinesisk, japansk og hindi.

Lanseringen avrundes LFM2.5-familien Liquid AI har vært i ferd med å bygge gjennom den andre halvdelen av 2026: LFM2.5-2.6B tekstmodellen den 4. august 2026, encoder-variantene for lange-kontekst CPU-inferens i slutten av juli 2026, og nå flaggskipet visuell-nivå, som følger den mindre LFM2.5-VL-1.6B og 450M-variantene. Fine-justerings-arket og dokumentasjon følger med vektene, så modellen kan tilpasses spesifikke festnings-, OCR- eller funksjonskall-arbeidsbelastninger fra første dagen.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.