AI-modeller och plattformar

Liquid AI Levererar LFM2.5-VL-3B för Snabbare Vision-Språk AI på Kanten

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Liquid AI släppte LFM2.5-VL-3B den 12 augusti 2026, en 3,1-miljardersparametrar öppenvikt vision-språkmodell byggd för att köras på telefoner, bärbara datorer och enskilda GPU:er snarare än i ett datacenter. Modellen, tillkännagiven på företagets blogg och publicerad på Hugging Face med vikter tillgängliga omedelbart, utökar förra årets LFM2-VL-3B med starkare skärmförståelse, objektförankring, multi-bildresonemang och funktionssamtal.

Företaget positionerar utgåvan som sin mest kapabla visionmodell för självvärd hårdvara. I utgivningsinlägget beskriver Liquid AI det som “vår mest kapabla vision-språkmodell”, en som “erbjuder konkurrenskraftig visionprestanda mot modeller som är dubbelt så stora, samtidigt som den körs snabbare över ett urval av CPU- och GPU-distributioner, även jämfört med modeller som har färre parametrar”.

Alla benchmark- och hastighetsfigurer i den här utgåvan är rapporterade av leverantören: Liquid AI genomförde utvärderingarna själv med vLLM 0.26.0, med varje modell i icke-resonemläge och uppmanad att svara direkt. Inga oberoende utvärderingar av den nya modellen finns ännu, vilket är det förväntade tillståndet på utgivningsdagen, även om en nylig Unite.AI-täckning av en Amazon (AMZN ) -studie som utvärderade flera av samma jämförelsemodeller illustrerar varför oberoende mätningar av transkriptionsbeteende kan avvika från rena benchmark-poäng.

Hur LFM2.5-VL-3B Läser Skärmar, Dokument och Flera Bilder

Modellen parar en SigLIP2 400M NaFlex vision-encoder från Google med samma förtränade ryggrad som Liquid AI:s LFM2.5-2.6B textmodell, släppt den 4 augusti 2026. Enligt modellkortet var den förtränad på cirka 34 biljoner token med fyra gånger mer visiondata än sin föregångare, och dess ordförråd fördubblades till 128 000 token genom att utöka den befintliga tokenisatorn snarare än omträna, en förändring som syftade till icke-latinska skript. Efterträning kombinerar övervakad finjustering med kunskapsdestillering från en större lärarmodell, följt av multi-belöningsförstärkt inlärning.

Fyra förmågeområden definierar uppgraderingen av LFM2-VL-3B. När det gäller skärmförståelse är modellen i genomsnitt 80,7 över skrivbords-, mobil- och webbdelarna av ScreenSpot-v2, upp från enstaka siffror på den tidigare versionen och långt före den 8-miljardersparametrar Gemma-4-E4B på 50,9, även om den ligger bakom den större InternVL 3.5 4B på 84,2. När det gäller förankring, där modellen returnerar begränsningsrutor för objekt som beskrivs i naturligt språk, ökar RefCOCO-precisionen från 57,1 till 87,9, en vinst på över 30 poäng som Liquid AI tillskriver skalad syntetisk förankringsdata.

Funktionsanrop är nytt för företagets visionsserie. På ToolSandbox, som mäter verktygsanvändning, mer än fördubblar poängen från 26,4 till 59,5, vilket placerar 3,1-miljardersmodellen på samma nivå som Gemma-4-E2B och före Qwen3.5-2B. Multi-bildresonemang förbättras också kraftigt, med BLINK som stiger från 50,2 till 61,5 och MuirBench från 34,9 till 58,3.

Över hela den 28-benchmark-visionssviten är LFM2.5-VL-3B i genomsnitt 69,4, en 12-poängsförbättring jämfört med föregångarens 57,2 och inom 0,7 poäng från den större 4,7-miljardersparametrar Qwen3.5-4B. Genomsnittet döljer verklig textur, dock: modellen släpar efter sina rivaler på vissa allmänna sviter och förlorar faktiskt mark på CountBenchQA, som sjunker från 92,2 till 87,3.

Vad Modellen Medvetet Utelämnar

LFM2.5-VL-3B är en icke-resonemodell. Den svarar direkt snarare än att generera en mellanliggande kedja av tankar, ett designval som Liquid AI rammer in som latensoptimering: modellkortet rekommenderar det för “enkelomsväng, höggenomströmning, låglatensuppgifter”, och nämner nära-realtidssobjektdetektering för fordonsapplikationer, batch-OCR av skannade dokument och enhetsöversättning av menyer och vägskyltar som avsedda arbetsbelastningar.

Samma kort anger tydligt vad modellen inte är till för. Den “rekommenderas inte för långkontext, resonemstunga uppgifter, såsom visuell webbdesign eller att besvara högt tekniska frågor om ritningar”. Kontextlängden är 32 768 token, och kortet flaggar dess layout-annoterings-OCR-format som experimentellt, varnar för att det “kan ändras, kan vara opålitligt och kan inte vara trivialt att tolka”. Detta är leverantörens egna uttalade begränsningar, och de markerar var kapacitetsanspråken slutar.

De hastighetsnummer som förankrar utgåvan följer av detta designval. Liquid AI rapporterar avkodningshastigheter på 228 token per sekund på en Apple M5 Max och 116 token per sekund på en AMD Ryzen AI Max+ 395, i cirka 3 GB minne, och 20 token per sekund på en Galaxy S26 Ultra. På en enskild NVIDIA H100 mäter företaget tid till första token på cirka 34 millisekunder på en femramsvideoklipp, mot cirka 200 millisekunder för Gemma-modellerna, och utmatningsgenomströmning nära 11 000 token per sekund vid hög samtidighet, vilket det säger motsvarar nästan en miljard utmatningstoken per dag på ett kort.

LFM2.5-VL-3B i Siffror

  • 3,1 miljarder parametrar; 34 biljoner förtränings-token; 32 768-token kontext
  • 69,4 i genomsnitt över 28 vision-benchmark, jämfört med 57,2 för LFM2-VL-3B
  • 80,7 i genomsnitt på ScreenSpot-v2 skärmförståelse, upp från 2,5 till 7,6 per del på den tidigare modellen
  • 87,9 RefCOCO-förankringsprecision, upp från 57,1
  • 59,5 på ToolSandbox-funktionsanrop, upp från 26,4
  • 228 token/s avkodning på Apple M5 Max; 20 token/s på Galaxy S26 Ultra; cirka 3 GB minnesavtryck
  • Ungefär 11 000 utmatningstoken/s vid hög samtidighet på en enskild H100

Vad som Följer med LFM2.5-VL-3B

Vikterna är nedladdningsbara nu från Hugging Face under en öppenviktslicens, med kvantiserade exporter i GGUF-, ONNX- och MLX-format och dag-1-stöd över llama.cpp, MLX, vLLM, SGLang och ONNX-körningar. En WebGPU-demo kör modellen helt i webbläsaren, och företaget listar 16 stödda språk, inklusive engelska, arabiska, kinesiska, japanska och hindi.

Utgåvan avrundar LFM2.5-familjen som Liquid AI har sammanställt under den senare hälften av 2026: LFM2.5-2.6B-textmodellen den 4 augusti 2026, encoder-varianter för långkontext-CPU-inferens i slutet av juli 2026, och nu flaggskeppsvisionstier, som följer den mindre LFM2.5-VL-1.6B och 450M-varianten. Finjusteringsanteckningsböcker och dokumentation levereras tillsammans med vikterna, så att modellen kan anpassas till specifika förankrings-, OCR- eller verktygsanropsarbetsbelastningar från den första dagen.

Jonas Reeve är en AI‑genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.