Modely a platformy AI

Liquid AI Spustí LFM2.5-VL-3B pro Rychlejší Vize-Jazykový AI na Okraji

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Liquid AI vydal LFM2.5-VL-3B dne 12. srpna 2026, 3,1-miliardový parametr otevřeného modelu vize-jazyka, který je navržen tak, aby běžel na telefonech, noteboocích a jednom GPU místo v datovém centru. Model, oznámený na blogu společnosti a zveřejněný na Hugging Face s okamžitě dostupnými váhami, rozšiřuje loňský LFM2-VL-3B se silnějším pochopením obrazovky, objektovým zakotvením, vícebodovým odůvodněním a voláním funkcí.

Společnost představuje vydání jako svůj nejvýkonnější model vize pro samo-hostovaný hardware. V příspěvku o vydání společnost Liquid AI popisuje jej jako “našeho nejvýkonnějšího model vize-jazyka”, který “poskytuje konkurenceschopný výkon vize proti modelům dvakrát větších, zatímco běží rychleji napříč celou řadou CPU a GPU nasazení, dokonce i ve srovnání s modely, které mají méně parametrů.”

Všechny referenční a rychlostní údaje v tomto vydání jsou hlášeny dodavatelem: Liquid AI provedl hodnocení sám pomocí vLLM 0.26.0, se všemi modely v režimu bez odůvodnění a vyzván k přímé odpovědi. Neexistují žádné nezávislé hodnocení nového modelu, což je očekávaný stav hry v den vydání, ačkoli nedávné pokrytí Unite.AI studie Amazonu, která vyhodnotila několik stejných srovnávacích modelů, ilustruje proč nezávisle měřené transkripční chování může odchylovat od čistých referenčních skórů.

Jak LFM2.5-VL-3B Čte Obrazovky, Dokumenty a Více Obrázků

Model spojuje SigLIP2 400M NaFlex vizuální kodér od Google se stejným předtrénovaným základem jako textový model Liquid AI LFM2.5-2.6B, vydáný 4. srpna 2026. Podle modelové karty byl předtrénován na přibližně 34 bilionech tokenů se čtyřnásobně více vizuálními daty než jeho předchůdce a jeho slovník se zdvojnásobil na 128 000 tokenů rozšířením existujícího tokenizéru, a nikoli opětovným trénováním, což je změna zaměřená na ne-latinové skripty. Post-trénink kombinuje dohledované jemné doladění s znalostní destilací z většího učitele, následované vícebodovým upevněním.

Čtyři oblasti schopností definují upgrade nad LFM2-VL-3B. Na pochopení obrazovky model průměruje 80,7 napříč desktopovými, mobilními a webovými rozdělenými ScreenSpot-v2, oproti jednomu číslici na předchozím vydání a daleko před 8-miliardovým parametrem Gemma-4-E4B na 50,9, ačkoli za větším InternVL 3.5 4B na 84,2. Na zakotvení, kde model vrací ohraničující rámečky pro objekty popsány v přirozeném jazyce, RefCOCO přesnost skokově vzrostla z 57,1 na 87,9, což je zisk více než 30 bodů, které společnost Liquid AI přisuzuje škálovatelným syntetickým zakotvením dat.

Funkční volání je nové v produktové řadě vize společnosti. Na ToolSandbox, který měří použití nástrojů, skóre více než zdvojnásobilo z 26,4 na 59,5, což umístilo 3,1B model na stejné úrovni jako Gemma-4-E2B a před Qwen3.5-2B. Vícebodové odůvodnění se také výrazně zlepšilo, s BLINK se zvyšujícím z 50,2 na 61,5 a MuirBench z 34,9 na 58,3.

Příčinou celého 28-benchmarkového souboru vize je LFM2.5-VL-3B průměruje 69,4, což je 12-bodové zlepšení oproti 57,2 jeho předchůdce a do 0,7 bodů od většího 4,7-miliardového parametru Qwen3.5-4B. Průměr skrývá skutečnou texturu, ačkoli: model zaostává za svými rivaly na některých obecných souborech a skutečně ztrácí půdu na CountBenchQA, který klesá z 92,2 na 87,3.

Co Model Úmyslně Vynechává

LFM2.5-VL-3B je modelem bez odůvodnění. Odpovídá přímo, místo generování meziproduktu řetězce myšlenek, což je designové rozhodnutí, které společnost Liquid AI rámcuje jako optimalizaci latence: modelová karta doporučuje jej pro “jednotlivé, vysoce propustné, nízké latence úkoly”, jmenovitě near-real-time objektové detekce pro automobilové aplikace, dávkové OCR skenovaných dokumentů a na zařízení překlad menu a dopravních značek jako zamýšlené úkoly.

Stejná karta jasně uvádí, co model není pro. “Není doporučen pro dlouhodobé, odůvodnění-intenzivní úkoly, jako je vizuální webový design, nebo odpovědi na vysoce technické otázky o plánech.” Délka kontextu je 32 768 tokenů a karta označuje jeho formát OCR layout-annotation jako experimentální, varuje, že “může změnit, může být nespolehlivý a nemusí být triviální pro analýzu.” Tyto jsou vlastní omezení dodavatele a označují, kde se zastavují tvrzení o schopnostech.

Rychlostní čísla, která kotví vydání, vyplývají z tohoto designu. Společnost Liquid AI hlásí dekódovací rychlosti 228 tokenů za sekundu na Apple M5 Max a 116 tokenů za sekundu na AMD Ryzen AI Max+ 395, v přibližně 3 GB paměti, a 20 tokenů za sekundu na Galaxy S26 Ultra. Na jednom NVIDIA H100 společnost měří čas na první token přibližně 34 milisekund na pětiraňovém videoklipu, proti přibližně 200 milisekundám pro modely Gemma, a výstupní propustnost blízko 11 000 tokenů za sekundu při vysoké konkurzenci, což prý přidává až miliardu výstupních tokenů za den na jedné kartě.

LFM2.5-VL-3B Čísly

  • 3,1 miliardy parametrů; 34 bilionů tokenů předtrénování; 32 768 tokenů kontextu
  • 69,4 průměr napříč 28 benchmarky vize, oproti 57,2 pro LFM2-VL-3B
  • 80,7 průměr na ScreenSpot-v2 pochopení obrazovky, oproti 2,5 až 7,6 na předchozím modelu
  • 87,9 RefCOCO přesnost zakotvení, oproti 57,1
  • 59,5 na ToolSandbox volání funkcí, oproti 26,4
  • 228 tokenů/s dekódování na Apple M5 Max; 20 tokenů/s na Galaxy S26 Ultra; přibližně 3 GB stopa paměti
  • Přibližně 11 000 výstupních tokenů/s při vysoké konkurzenci na jednom H100

Co Je Dodáváno S LFM2.5-VL-3B

Váhy jsou nyní dostupné ke stažení z Hugging Face pod otevřenou licencí váhy, s kvantizovanými exporty v GGUF, ONNX a MLX formátech a denní podporou napříč llama.cpp, MLX, vLLM, SGLang a ONNX běhy. WebGPU demo běží model zcela v prohlížeči a společnost uvádí 16 podporovaných jazyků, včetně angličtiny, arabštiny, čínštiny, japonštiny a hindštiny.

Vydání doplňuje rodinu LFM2.5, kterou společnost Liquid AI sestavovala v druhé polovině roku 2026: textový model LFM2.5-2.6B dne 4. srpna 2026, varianty encoderu pro dlouhodobou CPU inferenci na konci července 2026 a nyní vlajkovou loď vize, která následuje menší varianty LFM2.5-VL-1.6B a 450M. Poznámky a dokumentace k jemnému doladění jsou dodávány spolu s váhami, takže model může být přizpůsoben konkrétním úlohám zakotvení, OCR nebo volání funkcí od prvního dne.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.