Modely a platformy AI
Liquid AI Spustí LFM2.5-VL-3B pro Rychlejší Vize-Jazykový AI na Okraji

Liquid AI vydal LFM2.5-VL-3B dne 12. srpna 2026, 3,1-miliardový parametr otevřeného modelu vize-jazyka, který je navržen tak, aby běžel na telefonech, noteboocích a jednom GPU místo v datovém centru. Model, oznámený na blogu společnosti a zveřejněný na Hugging Face s okamžitě dostupnými váhami, rozšiřuje loňský LFM2-VL-3B se silnějším pochopením obrazovky, objektovým zakotvením, vícebodovým odůvodněním a voláním funkcí.
Společnost představuje vydání jako svůj nejvýkonnější model vize pro samo-hostovaný hardware. V příspěvku o vydání společnost Liquid AI popisuje jej jako “našeho nejvýkonnějšího model vize-jazyka”, který “poskytuje konkurenceschopný výkon vize proti modelům dvakrát větších, zatímco běží rychleji napříč celou řadou CPU a GPU nasazení, dokonce i ve srovnání s modely, které mají méně parametrů.”
Všechny referenční a rychlostní údaje v tomto vydání jsou hlášeny dodavatelem: Liquid AI provedl hodnocení sám pomocí vLLM 0.26.0, se všemi modely v režimu bez odůvodnění a vyzván k přímé odpovědi. Neexistují žádné nezávislé hodnocení nového modelu, což je očekávaný stav hry v den vydání, ačkoli nedávné pokrytí Unite.AI studie Amazonu, která vyhodnotila několik stejných srovnávacích modelů, ilustruje proč nezávisle měřené transkripční chování může odchylovat od čistých referenčních skórů.
Jak LFM2.5-VL-3B Čte Obrazovky, Dokumenty a Více Obrázků
Model spojuje SigLIP2 400M NaFlex vizuální kodér od Google se stejným předtrénovaným základem jako textový model Liquid AI LFM2.5-2.6B, vydáný 4. srpna 2026. Podle modelové karty byl předtrénován na přibližně 34 bilionech tokenů se čtyřnásobně více vizuálními daty než jeho předchůdce a jeho slovník se zdvojnásobil na 128 000 tokenů rozšířením existujícího tokenizéru, a nikoli opětovným trénováním, což je změna zaměřená na ne-latinové skripty. Post-trénink kombinuje dohledované jemné doladění s znalostní destilací z většího učitele, následované vícebodovým upevněním.
Čtyři oblasti schopností definují upgrade nad LFM2-VL-3B. Na pochopení obrazovky model průměruje 80,7 napříč desktopovými, mobilními a webovými rozdělenými ScreenSpot-v2, oproti jednomu číslici na předchozím vydání a daleko před 8-miliardovým parametrem Gemma-4-E4B na 50,9, ačkoli za větším InternVL 3.5 4B na 84,2. Na zakotvení, kde model vrací ohraničující rámečky pro objekty popsány v přirozeném jazyce, RefCOCO přesnost skokově vzrostla z 57,1 na 87,9, což je zisk více než 30 bodů, které společnost Liquid AI přisuzuje škálovatelným syntetickým zakotvením dat.
Funkční volání je nové v produktové řadě vize společnosti. Na ToolSandbox, který měří použití nástrojů, skóre více než zdvojnásobilo z 26,4 na 59,5, což umístilo 3,1B model na stejné úrovni jako Gemma-4-E2B a před Qwen3.5-2B. Vícebodové odůvodnění se také výrazně zlepšilo, s BLINK se zvyšujícím z 50,2 na 61,5 a MuirBench z 34,9 na 58,3.
Příčinou celého 28-benchmarkového souboru vize je LFM2.5-VL-3B průměruje 69,4, což je 12-bodové zlepšení oproti 57,2 jeho předchůdce a do 0,7 bodů od většího 4,7-miliardového parametru Qwen3.5-4B. Průměr skrývá skutečnou texturu, ačkoli: model zaostává za svými rivaly na některých obecných souborech a skutečně ztrácí půdu na CountBenchQA, který klesá z 92,2 na 87,3.
Co Model Úmyslně Vynechává
LFM2.5-VL-3B je modelem bez odůvodnění. Odpovídá přímo, místo generování meziproduktu řetězce myšlenek, což je designové rozhodnutí, které společnost Liquid AI rámcuje jako optimalizaci latence: modelová karta doporučuje jej pro “jednotlivé, vysoce propustné, nízké latence úkoly”, jmenovitě near-real-time objektové detekce pro automobilové aplikace, dávkové OCR skenovaných dokumentů a na zařízení překlad menu a dopravních značek jako zamýšlené úkoly.
Stejná karta jasně uvádí, co model není pro. “Není doporučen pro dlouhodobé, odůvodnění-intenzivní úkoly, jako je vizuální webový design, nebo odpovědi na vysoce technické otázky o plánech.” Délka kontextu je 32 768 tokenů a karta označuje jeho formát OCR layout-annotation jako experimentální, varuje, že “může změnit, může být nespolehlivý a nemusí být triviální pro analýzu.” Tyto jsou vlastní omezení dodavatele a označují, kde se zastavují tvrzení o schopnostech.
Rychlostní čísla, která kotví vydání, vyplývají z tohoto designu. Společnost Liquid AI hlásí dekódovací rychlosti 228 tokenů za sekundu na Apple M5 Max a 116 tokenů za sekundu na AMD Ryzen AI Max+ 395, v přibližně 3 GB paměti, a 20 tokenů za sekundu na Galaxy S26 Ultra. Na jednom NVIDIA H100 společnost měří čas na první token přibližně 34 milisekund na pětiraňovém videoklipu, proti přibližně 200 milisekundám pro modely Gemma, a výstupní propustnost blízko 11 000 tokenů za sekundu při vysoké konkurzenci, což prý přidává až miliardu výstupních tokenů za den na jedné kartě.
LFM2.5-VL-3B Čísly
- 3,1 miliardy parametrů; 34 bilionů tokenů předtrénování; 32 768 tokenů kontextu
- 69,4 průměr napříč 28 benchmarky vize, oproti 57,2 pro LFM2-VL-3B
- 80,7 průměr na ScreenSpot-v2 pochopení obrazovky, oproti 2,5 až 7,6 na předchozím modelu
- 87,9 RefCOCO přesnost zakotvení, oproti 57,1
- 59,5 na ToolSandbox volání funkcí, oproti 26,4
- 228 tokenů/s dekódování na Apple M5 Max; 20 tokenů/s na Galaxy S26 Ultra; přibližně 3 GB stopa paměti
- Přibližně 11 000 výstupních tokenů/s při vysoké konkurzenci na jednom H100
Co Je Dodáváno S LFM2.5-VL-3B
Váhy jsou nyní dostupné ke stažení z Hugging Face pod otevřenou licencí váhy, s kvantizovanými exporty v GGUF, ONNX a MLX formátech a denní podporou napříč llama.cpp, MLX, vLLM, SGLang a ONNX běhy. WebGPU demo běží model zcela v prohlížeči a společnost uvádí 16 podporovaných jazyků, včetně angličtiny, arabštiny, čínštiny, japonštiny a hindštiny.
Vydání doplňuje rodinu LFM2.5, kterou společnost Liquid AI sestavovala v druhé polovině roku 2026: textový model LFM2.5-2.6B dne 4. srpna 2026, varianty encoderu pro dlouhodobou CPU inferenci na konci července 2026 a nyní vlajkovou loď vize, která následuje menší varianty LFM2.5-VL-1.6B a 450M. Poznámky a dokumentace k jemnému doladění jsou dodávány spolu s váhami, takže model může být přizpůsoben konkrétním úlohám zakotvení, OCR nebo volání funkcí od prvního dne.












