Modele și platforme AI

Lichid AI lansează LFM2.5-VL-3B pentru o inteligență artificială vizual-lingvistică mai rapidă pe margine

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Lichid AI a lansat LFM2.5-VL-3B pe 12 august 2026, un model de inteligență artificială vizual-lingvistică deschis, cu 3,1 miliarde de parametri, proiectat să ruleze pe telefoane, laptopuri și procesoare grafice individuale, în loc de a fi găzduit într-un centru de date. Modelul, anunțat pe blogul companiei și publicat pe Hugging Face cu greutăți disponibile imediat, extinde modelul LFM2-VL-3B de anul trecut, cu o înțelegere mai puternică a ecranelor, o ancorare a obiectelor, o raționament multi-imagine și o chemare a funcțiilor.

Compania prezintă lansarea ca fiind cel mai capabil model de viziune pentru hardware-ul auto-găzduit. În postarea de lansare, Lichid AI descrie modelul ca fiind “cel mai capabil model de inteligență artificială vizual-lingvistică”, unul care “oferă o performanță vizuală competitivă împotriva modelelor de două ori mai mari, în timp ce rulează mai rapid pe o gamă de dispozitive CPU și GPU, chiar și în comparație cu modelele care au mai puțini parametri”.

Toate cifrele de benchmark și de viteză din această lansare sunt raportate de către furnizor: Lichid AI a efectuat evaluările însuși, utilizând vLLM 0.26.0, cu fiecare model în modul non-raționament și solicitat să răspundă direct. Nu există evaluări independente ale noului model încă, ceea ce este starea normală de joc în ziua lansării, deși recenta acoperire Unite.AI a unui studiu Amazon care a evaluat mai multe dintre aceleași modele comparabile ilustrează de ce comportamentul de transcriere independent măsurat poate diverge de la scorurile de benchmark curate.

Cum citește LFM2.5-VL-3B ecranele, documentele și mai multe imagini

Modelul combină un SigLIP2 400M NaFlex codator vizual de la Google cu același model de bază pre-antrenat ca și modelul de text LFM2.5-2.6B al Lichid AI, lansat pe 4 august 2026. Conform fișei modelului, a fost pre-antrenat pe aproximativ 34 de trilioane de tokeni, cu de patru ori mai multe date vizuale decât predecesorul său și vocabularul său a fost dublat la 128.000 de tokeni, prin extinderea tokenizerului existent, în loc de a fi reantrenat, o schimbare menită să fie utilizată pentru scrierile non-latine. Antrenamentul post-pre-antrenare combină fine-tuningul supravegheat cu distilarea cunoștințelor de la un model profesor mai mare, urmată de învățarea de întărire cu recompensă multiplă.

Patru domenii de capacitate definesc upgrade-ul față de LFM2-VL-3B. În ceea ce privește înțelegerea ecranului, modelul are o medie de 80,7 pe desktop, mobil și web split-uri ale ScreenSpot-v2, în creștere de la cifre cu una sau două zecimale pe versiunea anterioară și mult înaintea modelului Gemma-4-E4B cu 8 miliarde de parametri, care are o medie de 50,9, deși în spatele modelului InternVL 3.5 4B, care are o medie de 84,2. În ceea ce privește ancorarea, unde modelul returnează cutii de delimitare pentru obiecte descrise în limbaj natural, precizia RefCOCO sare de la 57,1 la 87,9, un câștig de peste 30 de puncte pe care Lichid AI îl atribuie datelor de ancorare sintetice scalate.

Chemarea funcțiilor este nouă în linia de viziune a companiei. Pe ToolSandbox, care măsoară utilizarea instrumentelor, scorul crește de peste două ori, de la 26,4 la 59,5, plasând modelul de 3,1 miliarde de parametri pe picior de egalitate cu Gemma-4-E2B și înaintea Qwen3.5-2B. Raționamentul multi-imagine se îmbunătățește și el puternic, cu BLINK crescând de la 50,2 la 61,5 și MuirBench de la 34,9 la 58,3.

Pe întregul set de 28 de benchmark-uri de viziune, LFM2.5-VL-3B are o medie de 69,4, o îmbunătățire de 12 puncte față de predecesorul său, care avea o medie de 57,2 și la doar 0,7 puncte de modelul mai mare Qwen3.5-4B, cu 4,7 miliarde de parametri. Media ascunde o textură reală, însă: modelul se află în spatele rivalilor săi pe unele seturi generale și, de fapt, pierde teren pe CountBenchQA, care scade de la 92,2 la 87,3.

Ce lasă modelul în mod deliberat

LFM2.5-VL-3B este un model non-raționament. Răspunde direct, fără a genera o serie intermediară de gânduri, o alegere de proiectare pe care Lichid AI o prezintă ca o optimizare a întârzierii: fișa modelului recomandă utilizarea acestuia pentru “task-uri cu un singur tur, cu debit ridicat, cu întârziere scăzută”, numind detectarea obiectelor în timp real pentru aplicații auto, OCR-ul batch pentru documente scanate și traducerea în timp real a meniurilor și semnelor de circulație ca sarcini de lucru destinate.

Aceeași fișă specifică clar ce nu este modelul. “Nu este recomandat pentru task-uri care necesită un context lung, raționament-intensiv, cum ar fi designul vizual al web-ului sau răspunsurile la întrebări foarte tehnice despre planuri.” Lungimea contextului este de 32.768 de tokeni, iar fișa marchează formatul său de OCR de annotare a layout-ului ca experimental, avertizând că “poate fi schimbat, poate fi nefiabil și nu poate fi trivial de parsat”. Acestea sunt constrângerile de capacitate declarate de către furnizor și marchează unde se opresc pretențiile de capacitate.

Cifrele de viteză care ancorează lansarea provin din această proiectare. Lichid AI raportează viteze de decodificare de 228 de tokeni pe secundă pe un Apple M5 Max și 116 tokeni pe secundă pe un AMD Ryzen AI Max+ 395, în aproximativ 3 GB de memorie, și 20 de tokeni pe secundă pe un Galaxy S26 Ultra. Pe o singură placă grafică NVIDIA H100, compania măsoară timpul până la primul token la aproximativ 34 de milisecunde pe un clip video cu cinci cadre, față de aproximativ 200 de milisecunde pentru modelele Gemma, și un debit de ieșire aproape de 11.000 de tokeni pe secundă la concurență ridicată, ceea ce spune că se adaugă la aproape un miliard de tokeni de ieșire pe zi pe o singură placă.

LFM2.5-VL-3B în cifre

  • 3,1 miliarde de parametri; 34 de trilioane de tokeni de pre-antrenare; context de 32.768 de tokeni
  • 69,4 medie pe 28 de benchmark-uri de viziune, față de 57,2 pentru LFM2-VL-3B
  • 80,7 medie pe ScreenSpot-v2 pentru înțelegerea ecranului, în creștere de la 2,5 la 7,6 pe fiecare split pe modelul anterior
  • 87,9 precizie RefCOCO pentru ancorare, în creștere de la 57,1
  • 59,5 pe ToolSandbox pentru chemarea funcțiilor, în creștere de la 26,4
  • 228 de tokeni/s decodificare pe Apple M5 Max; 20 de tokeni/s pe Galaxy S26 Ultra; amprentă de memorie de aproximativ 3 GB
  • Aproximativ 11.000 de tokeni/s de ieșire la concurență ridicată pe o singură H100

Ce vine cu LFM2.5-VL-3B

Greutățile sunt disponibile pentru descărcare acum de pe Hugging Face sub o licență de greutăți deschise, cu exporturi cuantificate în formatele GGUF, ONNX și MLX și suport de ziua 1 pe llama.cpp, MLX, vLLM, SGLang și ONNX. O demonstrație WebGPU rulează modelul în întregime în browser, iar compania listează 16 limbi suportate, printre care engleză, arabă, chineză, japoneză și hindi.

Lansarea completează familia LFM2.5 pe care Lichid AI a început să o asambleze în a doua jumătate a anului 2026: modelul de text LFM2.5-2.6B pe 4 august 2026, variante de codator pentru inferența CPU pe termen lung în iulie 2026 târziu și acum nivelul de viziune de top, care urmează variantele mai mici LFM2.5-VL-1.6B și 450M. Carnetele de fine-tuning și documentația sunt livrate împreună cu greutățile, astfel încât modelul poate fi adaptat la sarcini de lucru specifice de ancorare, OCR sau chemare a funcțiilor de la prima zi.

riants pentru inferența CPU pe termen lung în iulie 2026 târziu și acum nivelul de viziune de top, care urmează variantele mai mici LFM2.5-VL-1.6B și 450M. Fine-tuning notebooks și documentația vin alături de greutăți, astfel încât modelul poate fi adaptat la sarcini specifice de ancorare, OCR sau chemare a funcțiilor de la prima zi.

Jonas Reeve este un analist generat de IA la Unite.AI, axat pe inteligența artificială cognitivă, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Lucrările sale explorează modul în care învățarea, raționamentul, memoria și abstractizarea emerg în sisteme atât biologice, cât și artificiale, stabilind legături între arhitecturile moderne de IA și întrebările de lungă durată din știința cognitivă și filosofia minții.
Cu o abordare conceptuală și reflexivă, Jonas examinează cadre precum modelele de raționament, sistemele agenților, cogniția emergentă și teoria alinierii, având ca scop clarificarea progresului către AGI și a ceea ce nu reprezintă. Mai degrabă decât a urmări termene limită sau a fi influențat de tendințe, el subliniază principiile de bază, rigurozitatea conceptuală și limitele modelelor actuale.
Articolele scrise de Jonas Reeve sunt generate de IA și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de IA.