Modelli e piattaforme di IA

Liquid AI rilascia LFM2.5-VL-3B per un’AI visione-linguaggio più veloce su Edge

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Liquid AI ha rilasciato LFM2.5-VL-3B il 12 agosto 2026, un modello di visione-linguaggio open-weight da 3,1 miliardi di parametri progettato per funzionare su telefoni, laptop e singole GPU anziché in un data center. Il modello, annunciato sul blog dell’azienda e pubblicato su Hugging Face con pesi disponibili immediatamente, estende il LFM2-VL-3B dell’anno scorso con una comprensione dello schermo più forte, un ancoraggio degli oggetti, un ragionamento su più immagini e una chiamata di funzioni.

L’azienda posiziona il rilascio come il suo modello di visione più capace per hardware self-hosted. Nel post di rilascio, Liquid AI lo descrive come “il nostro modello di visione-linguaggio più capace”, uno che “fornisce prestazioni di visione competitive contro modelli due volte più grandi, mentre funziona più velocemente su una gamma di deploy di CPU e GPU anche rispetto a modelli con meno parametri”.

Tutti i dati di benchmark e velocità in questo rilascio sono riportati dal fornitore: Liquid AI ha eseguito le valutazioni stesso utilizzando vLLM 0.26.0, con ogni modello in modalità non di ragionamento e promosso per rispondere direttamente. Non esistono ancora valutazioni indipendenti del nuovo modello, che è lo stato atteso di gioco nel giorno del rilascio, anche se la recente copertura di Unite.AI di uno studio di Amazon (AMZN ) che ha valutato alcuni degli stessi modelli comparator illustra perché il comportamento di trascrizione misurato in modo indipendente può discostarsi da punteggi di benchmark puliti.

Come LFM2.5-VL-3B legge schermi, documenti e più immagini

Il modello abbina un SigLIP2 400M NaFlex vision encoder da Google con lo stesso pre-addestrato backbone del modello di testo LFM2.5-2.6B di Liquid AI, rilasciato il 4 agosto 2026. Secondo la scheda del modello, è stato pre-addestrato su circa 34 trilioni di token con quattro volte più dati di visione rispetto al suo predecessore, e il suo vocabolario è stato raddoppiato a 128.000 token estendendo il tokenizer esistente anziché riaddestrare, un cambiamento volto a script non latini. La formazione post-addestramento combina una formazione fine-tuning supervisionata con la distillazione della conoscenza da un modello insegnante più grande, seguita da un apprendimento di rinforzo multi-ricompensa.

Quattro aree di capacità definiscono l’aggiornamento su LFM2-VL-3B. Nella comprensione dello schermo, il modello ha una media di 80,7 sui split desktop, mobile e web di ScreenSpot-v2, in aumento da singoli cifre sul rilascio precedente e ben oltre l’8 miliardi di parametri Gemma-4-E4B a 50,9, anche se dietro il più grande InternVL 3.5 4B a 84,2. Nell’ancoraggio, dove il modello restituisce bounding box per oggetti descritti in linguaggio naturale, la precisione RefCOCO salta da 57,1 a 87,9, un guadagno di oltre 30 punti che Liquid AI attribuisce ai dati di ancoraggio sintetico scalati.

La chiamata di funzioni è nuova nella linea di visione dell’azienda. Su ToolSandbox, che misura l’uso degli strumenti, il punteggio più che raddoppia da 26,4 a 59,5, mettendo il modello da 3,1 miliardi di parametri al pari con Gemma-4-E2B e davanti a Qwen3.5-2B. Il ragionamento su più immagini migliora anche in modo netto, con BLINK che sale da 50,2 a 61,5 e MuirBench da 34,9 a 58,3.

Across l’intero set di benchmark di visione da 28, LFM2.5-VL-3B ha una media di 69,4, un miglioramento di 12 punti rispetto ai 57,2 del suo predecessore e a soli 0,7 punti dal più grande modello da 4,7 miliardi di parametri Qwen3.5-4B. La media nasconde una vera texture, tuttavia: il modello perde terreno rispetto ai suoi rivali in alcuni set di benchmark generali e perde effettivamente terreno su CountBenchQA, che scende da 92,2 a 87,3.

Cosa il modello esclude deliberatamente

LFM2.5-VL-3B è un modello non di ragionamento. Risponde direttamente anziché generare una catena intermedia di pensiero, una scelta di progettazione che Liquid AI inquadra come ottimizzazione della latenza: la scheda del modello raccomanda di utilizzarlo per “compiti a singola rotazione, ad alto throughput, a bassa latenza”, nominando la rilevazione degli oggetti in tempo reale per applicazioni automotive, la scansione OCR di documenti in batch e la traduzione sul dispositivo di menu e segnali stradali come carichi di lavoro previsti.

La stessa scheda afferma chiaramente cosa il modello non è adatto a fare. “Non è raccomandato per compiti a contesto lungo, intensivi di ragionamento, come la progettazione web visiva o la risposta a domande tecniche altamente tecniche su progetti.” La lunghezza del contesto è di 32.768 token e la scheda segnala il formato OCR di annotazione del layout come sperimentale, avvertendo che “potrebbe cambiare, potrebbe essere poco affidabile e potrebbe non essere banale da analizzare”. Queste sono le limitazioni dichiarate dal fornitore e segnano dove si fermano le pretese di capacità.

I numeri di velocità che ancorano il rilascio derivano da quella progettazione. Liquid AI riporta velocità di decodifica di 228 token al secondo su un Apple M5 Max e 116 token al secondo su un AMD Ryzen AI Max+ 395, in circa 3 GB di memoria, e 20 token al secondo su un Galaxy S26 Ultra. Su una singola NVIDIA H100, l’azienda misura il tempo per il primo token a circa 34 millisecondi su un clip video da cinque fotogrammi, contro circa 200 millisecondi per i modelli Gemma, e una produzione di output vicina a 11.000 token al secondo ad alta concorrenza, che afferma aggiungersi a quasi un miliardo di token di output al giorno su una sola scheda.

LFM2.5-VL-3B per numeri

  • 3,1 miliardi di parametri; 34 trilioni di token di pre-addestramento; contesto di 32.768 token
  • 69,4 di media su 28 benchmark di visione, contro 57,2 per LFM2-VL-3B
  • 80,7 di media su ScreenSpot-v2 per la comprensione dello schermo, in aumento da 2,5 a 7,6 per split sul modello precedente
  • 87,9 di precisione RefCOCO, in aumento da 57,1
  • 59,5 su ToolSandbox per la chiamata di funzioni, in aumento da 26,4
  • 228 token/s di decodifica su Apple M5 Max; 20 token/s su Galaxy S26 Ultra; impronta di memoria di circa 3 GB
  • Circa 11.000 token/s di output ad alta concorrenza su una singola H100

Cosa viene fornito con LFM2.5-VL-3B

I pesi sono scaricabili ora da Hugging Face con una licenza open-weight, con esportazioni quantizzate in formati GGUF, ONNX e MLX e supporto day-one su llama.cpp, MLX, vLLM, SGLang e runtimes ONNX. Una demo WebGPU esegue il modello interamente nel browser e l’azienda elenca 16 lingue supportate, tra cui inglese, arabo, cinese, giapponese e hindi.

Il rilascio completa la famiglia LFM2.5 che Liquid AI ha assemblato nella seconda metà del 2026: il modello di testo LFM2.5-2.6B il 4 agosto 2026, le varianti dell’encoder per l’inferenza CPU a contesto lungo a fine luglio 2026 e ora il livello di visione di punta, che segue le varianti più piccole LFM2.5-VL-1.6B e 450M. I taccuini di fine-tuning e la documentazione vengono forniti insieme ai pesi, in modo che il modello possa essere adattato a carichi di lavoro specifici di ancoraggio, OCR o chiamata di strumenti dal primo giorno.

Jonas Reeve è un analista generato dall'IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.