Modelli e piattaforme di IA
Liquid AI lancia LFM2.5-DSpark per un’inferenza fino a 3,2X più veloce

Liquid AI ha rilasciato checkpoint di draft per la decodifica speculativa per tre modelli della sua famiglia LFM2.5 il 20 agosto 2026, segnalando aumenti di throughput fino a 3,18× su una singola GPU H100 e fino a 2,87× su un MacBook con Apple Silicon, senza modificare le uscite del modello. Il rilascio LFM2.5-DSpark comprende i draft per LFM2.5-1.2B-Instruct, LFM2.5-2.6B e il modello mixture-of-experts LFM2.5-8B-A1B, ciascuno aggiungendo circa 300 milioni di parametri di overhead di draft sul modello target.
I checkpoint sono distribuiti nei formati Safetensors e GGUF con supporto fin dal primo giorno in llama.cpp e SGLang, entrambe le integrazioni sono state contribute upstream ai repository ufficiali. Poiché la decodifica speculativa emette solo token verificati dal modello target, l’azienda afferma che il testo generato è identico a quello che il target produrrebbe da solo con decodifica greedy, quindi l’accuratezza dei benchmark rimane invariata.
Le misurazioni di Liquid AI, eseguite con batch size 1 e temperatura 0 su cinque dataset, mostrano una velocità media per LFM2.5-2.6B di 2,67× su una H100 (da 323 a 864 token al secondo) e 2,27× su un MacBook Pro M4 Max (da 61 a 139 token al secondo). Il risultato più alto è stato ottenuto da LFM2.5-8B-A1B su MATH500, dove il throughput sulla H100 è aumentato di 3,18×, da 428 a 1.362 token al secondo. L’azienda segnala inoltre che DSpark ha ridotto la latenza delle chiamate di funzione del 57% in media per LFM2.5-2.6B in scenari multi-tool, il risultato principale per i carichi di lavoro agentici on-device a cui è destinata la linea LFM2.5.
Come DSpark accelera la decodifica
La fase di decodifica dell’inferenza LLM è limitata dalla memoria: la maggior parte della latenza deriva dallo streaming dei pesi dalla DRAM alla memoria on-chip piuttosto che dal calcolo stesso, motivo per cui l’economia dell’inferenza è diventata il problema ingegneristico centrale del settore.
DSpark, introdotto in un articolo di luglio 2026 da ricercatori di DeepSeek e distribuito nel sistema di serving DeepSeek-V4 di quella azienda, combina tre componenti: uno scheletro parallelo che genera gli stati nascosti per tutti i token di draft in un unico passaggio, una testa sequenziale leggera che modella le dipendenze tra token vicini per mantenere alti i tassi di accettazione verso la fine del blocco, e un verificatore a programmazione di confidenza che elimina i suffissi a bassa confidenza quando verificarli costerebbe più di quanto si risparmia. Nella distribuzione di produzione di DeepSeek, l’articolo riporta accelerazioni di generazione per utente dal 60 all’85% rispetto al precedente baseline MTP-1 a pari throughput.
I draft di Liquid AI seguono quella ricetta con un design semplificato basato solo sull’attenzione: cinque layer, una dimensione di blocco di nove token di draft per passo e una testa Markov su un vocabolario di 128.000 token, secondo la scheda modello LFM2.5-2.6B-DSpark. Ogni draft è stato addestrato per 15 epoche su un mix di fine-tuning supervisionato, chat, codice e dati di chiamata di funzione, con il checkpoint selezionato in base al più alto tasso di accettazione anziché alla perdita minima. La garanzia di esattezza svolge il lavoro di qualità: “La decodifica speculativa è esatta: il target verifica ogni token proposto, quindi l’output greedy è uguale al target da solo”, afferma la scheda modello GGUF, con tempi per risposta che mostrano quanti token di draft sono stati proposti e accettati.
LFM2.5-DSpark in cifre
- 3,18x — miglior velocità GPU segnalata (LFM2.5-8B-A1B, MATH500, H100: 428 → 1.362 tok/s)
- 2,87x — miglior velocità on-device segnalata (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
- 2,67x / 2,27x — velocità medie H100 / M4 Max per LFM2.5-2.6B su cinque dataset
- 57%: riduzione media della latenza delle chiamate di funzione per LFM2.5-2.6B in scenari multi-tool
- 295,7M–327,7M (parametri del modello draft, rispetto a target da 1,2B a 8B)
- 4,81 of 10, media di token draft accettati per passo per LFM2.5-2.6B con blocco di 9
Dove le velocità segnalate si riducono
Le tabelle interne di Liquid AI mostrano che i guadagni sono irregolari, e l’azienda ne spiega le ragioni. Per LFM2.5-8B-A1B, il miglioramento on-device è in media solo 1,18× nonostante i più alti tassi di accettazione dei tre modelli, una discrepanza che l’azienda attribuisce all’attuale implementazione mixture-of-experts nel backend Metal di llama.cpp e al traffico aggiuntivo di pesi che la verifica di un blocco di token attiva tra gli esperti. Per LFM2.5-1.2B-Instruct, i tassi di accettazione variano tanto per dataset da far oscillare la velocità fino al 52% a seconda della distribuzione del testo, da 1,66× su MT-Bench fino a 2,56× su MATH500 sulla H100.
Tutte le cifre sono fornite dal venditore tramite il proprio harness di Liquid AI: SGLang su una H100 da 80 GB in BF16 per i dati GPU, llama.cpp con kernel Metal sperimentali su un M4 Max con pesi GGUF FP16 per i dati on-device, limitati a 256 token di output. Il percorso SGLang richiede una build con supporto DSpark per i target LFM2, e il percorso llama.cpp richiede la build corrispondente, quindi le velocità dipendono da queste integrazioni piuttosto che da una release stabile di uno dei due motori.
L’impegno on-device di Liquid AI finora
Il rilascio DSpark è il terzo aggiornamento della famiglia LFM2.5 in poco più di una settimana. Il 12 agosto 2026, l’azienda ha lanciato LFM2.5-VL-3B, un modello vision-language per il edge, e il 19 agosto 2026 ha pubblicato checkpoint distillati quantization-aware Q4_0 per la famiglia. Il filo conduttore è lo stesso: l’azienda afferma che l’accelerazione DSpark del modello da 2,6 B su un MacBook porta l’interattività oltre il throughput offerto dalla maggior parte dei modelli cloud proprietari, che stima intorno a 140 token al secondo.
Tutti e tre i draft sono ora disponibili su Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark e LFM2.5-8B-A1B-DSpark, con build GGUF accanto per le distribuzioni su llama.cpp.












