Modelli e piattaforme di IA
Liquid AI rilascia LFM2.5-VL-3B per un’AI visione-linguaggio più veloce su Edge

Liquid AI ha rilasciato LFM2.5-VL-3B il 12 agosto 2026, un modello di visione-linguaggio open-weight da 3,1 miliardi di parametri progettato per funzionare su telefoni, laptop e singole GPU anziché in un data center. Il modello, annunciato sul blog dell’azienda e pubblicato su Hugging Face con pesi disponibili immediatamente, estende il LFM2-VL-3B dell’anno scorso con una comprensione dello schermo più forte, un ancoraggio degli oggetti, un ragionamento su più immagini e una chiamata di funzioni.
L’azienda posiziona il rilascio come il suo modello di visione più capace per hardware self-hosted. Nel post di rilascio, Liquid AI lo descrive come “il nostro modello di visione-linguaggio più capace”, uno che “fornisce prestazioni di visione competitive contro modelli due volte più grandi, mentre funziona più velocemente su una gamma di deploy di CPU e GPU anche rispetto a modelli con meno parametri”.
Tutti i dati di benchmark e velocità in questo rilascio sono riportati dal fornitore: Liquid AI ha eseguito le valutazioni stesso utilizzando vLLM 0.26.0, con ogni modello in modalità non di ragionamento e promosso per rispondere direttamente. Non esistono ancora valutazioni indipendenti del nuovo modello, che è lo stato atteso di gioco nel giorno del rilascio, anche se la recente copertura di Unite.AI di uno studio di Amazon che ha valutato alcuni degli stessi modelli comparator illustra perché il comportamento di trascrizione misurato in modo indipendente può discostarsi da punteggi di benchmark puliti.
Come LFM2.5-VL-3B legge schermi, documenti e più immagini
Il modello abbina un SigLIP2 400M NaFlex vision encoder da Google con lo stesso pre-addestrato backbone del modello di testo LFM2.5-2.6B di Liquid AI, rilasciato il 4 agosto 2026. Secondo la scheda del modello, è stato pre-addestrato su circa 34 trilioni di token con quattro volte più dati di visione rispetto al suo predecessore, e il suo vocabolario è stato raddoppiato a 128.000 token estendendo il tokenizer esistente anziché riaddestrare, un cambiamento volto a script non latini. La formazione post-addestramento combina una formazione fine-tuning supervisionata con la distillazione della conoscenza da un modello insegnante più grande, seguita da un apprendimento di rinforzo multi-ricompensa.
Quattro aree di capacità definiscono l’aggiornamento su LFM2-VL-3B. Nella comprensione dello schermo, il modello ha una media di 80,7 sui split desktop, mobile e web di ScreenSpot-v2, in aumento da singoli cifre sul rilascio precedente e ben oltre l’8 miliardi di parametri Gemma-4-E4B a 50,9, anche se dietro il più grande InternVL 3.5 4B a 84,2. Nell’ancoraggio, dove il modello restituisce bounding box per oggetti descritti in linguaggio naturale, la precisione RefCOCO salta da 57,1 a 87,9, un guadagno di oltre 30 punti che Liquid AI attribuisce ai dati di ancoraggio sintetico scalati.
La chiamata di funzioni è nuova nella linea di visione dell’azienda. Su ToolSandbox, che misura l’uso degli strumenti, il punteggio più che raddoppia da 26,4 a 59,5, mettendo il modello da 3,1 miliardi di parametri al pari con Gemma-4-E2B e davanti a Qwen3.5-2B. Il ragionamento su più immagini migliora anche in modo netto, con BLINK che sale da 50,2 a 61,5 e MuirBench da 34,9 a 58,3.
Across l’intero set di benchmark di visione da 28, LFM2.5-VL-3B ha una media di 69,4, un miglioramento di 12 punti rispetto ai 57,2 del suo predecessore e a soli 0,7 punti dal più grande modello da 4,7 miliardi di parametri Qwen3.5-4B. La media nasconde una vera texture, tuttavia: il modello perde terreno rispetto ai suoi rivali in alcuni set di benchmark generali e perde effettivamente terreno su CountBenchQA, che scende da 92,2 a 87,3.
Cosa il modello esclude deliberatamente
LFM2.5-VL-3B è un modello non di ragionamento. Risponde direttamente anziché generare una catena intermedia di pensiero, una scelta di progettazione che Liquid AI inquadra come ottimizzazione della latenza: la scheda del modello raccomanda di utilizzarlo per “compiti a singola rotazione, ad alto throughput, a bassa latenza”, nominando la rilevazione degli oggetti in tempo reale per applicazioni automotive, la scansione OCR di documenti in batch e la traduzione sul dispositivo di menu e segnali stradali come carichi di lavoro previsti.
La stessa scheda afferma chiaramente cosa il modello non è adatto a fare. “Non è raccomandato per compiti a contesto lungo, intensivi di ragionamento, come la progettazione web visiva o la risposta a domande tecniche altamente tecniche su progetti.” La lunghezza del contesto è di 32.768 token e la scheda segnala il formato OCR di annotazione del layout come sperimentale, avvertendo che “potrebbe cambiare, potrebbe essere poco affidabile e potrebbe non essere banale da analizzare”. Queste sono le limitazioni dichiarate dal fornitore e segnano dove si fermano le pretese di capacità.
I numeri di velocità che ancorano il rilascio derivano da quella progettazione. Liquid AI riporta velocità di decodifica di 228 token al secondo su un Apple M5 Max e 116 token al secondo su un AMD Ryzen AI Max+ 395, in circa 3 GB di memoria, e 20 token al secondo su un Galaxy S26 Ultra. Su una singola NVIDIA H100, l’azienda misura il tempo per il primo token a circa 34 millisecondi su un clip video da cinque fotogrammi, contro circa 200 millisecondi per i modelli Gemma, e una produzione di output vicina a 11.000 token al secondo ad alta concorrenza, che afferma aggiungersi a quasi un miliardo di token di output al giorno su una sola scheda.
LFM2.5-VL-3B per numeri
- 3,1 miliardi di parametri; 34 trilioni di token di pre-addestramento; contesto di 32.768 token
- 69,4 di media su 28 benchmark di visione, contro 57,2 per LFM2-VL-3B
- 80,7 di media su ScreenSpot-v2 per la comprensione dello schermo, in aumento da 2,5 a 7,6 per split sul modello precedente
- 87,9 di precisione RefCOCO, in aumento da 57,1
- 59,5 su ToolSandbox per la chiamata di funzioni, in aumento da 26,4
- 228 token/s di decodifica su Apple M5 Max; 20 token/s su Galaxy S26 Ultra; impronta di memoria di circa 3 GB
- Circa 11.000 token/s di output ad alta concorrenza su una singola H100
Cosa viene fornito con LFM2.5-VL-3B
I pesi sono scaricabili ora da Hugging Face con una licenza open-weight, con esportazioni quantizzate in formati GGUF, ONNX e MLX e supporto day-one su llama.cpp, MLX, vLLM, SGLang e runtimes ONNX. Una demo WebGPU esegue il modello interamente nel browser e l’azienda elenca 16 lingue supportate, tra cui inglese, arabo, cinese, giapponese e hindi.
Il rilascio completa la famiglia LFM2.5 che Liquid AI ha assemblato nella seconda metà del 2026: il modello di testo LFM2.5-2.6B il 4 agosto 2026, le varianti dell’encoder per l’inferenza CPU a contesto lungo a fine luglio 2026 e ora il livello di visione di punta, che segue le varianti più piccole LFM2.5-VL-1.6B e 450M. I taccuini di fine-tuning e la documentazione vengono forniti insieme ai pesi, in modo che il modello possa essere adattato a carichi di lavoro specifici di ancoraggio, OCR o chiamata di strumenti dal primo giorno.
riants per l’inferenza CPU a contesto lungo a fine luglio 2026, e ora il livello di visione di punta, che segue le varianti più piccole LFM2.5-VL-1.6B e 450M. Fine-tuning notebooks e documentazione ship alongside the weights, so the model can be adapted to specific grounding, OCR, or tool-calling workloads from the first day.












