AI-modellen en platforms
Liquid AI brengt LFM2.5-DSpark uit voor tot 3,2x snellere inferentie

Liquid AI heeft op 20 augustus 2026 speculatieve decodeer‑draft‑checkpoints uitgebracht voor drie modellen uit de LFM2.5‑familie, met een doorvoersnelheidswinst van maximaal 3,18× op één H100‑GPU en maximaal 2,87× op een Apple‑silicon‑MacBook, zonder wijziging in de modeluitvoer. De LFM2.5-DSpark‑release omvat draft‑modellen voor LFM2.5-1.2B-Instruct, LFM2.5-2.6B en de mixture‑of‑experts LFM2.5-8B-A1B, elk met ongeveer 300 miljoen extra parameters bovenop het doelmodel.
De checkpoints worden geleverd in Safetensors‑ en GGUF‑formaten met directe ondersteuning in llama.cpp en SGLang, beide integraties zijn upstream bijgedragen aan de officiële codebases. Omdat speculatieve decodering alleen tokens uitgeeft die het doelmodel heeft geverifieerd, stelt het bedrijf dat de gegenereerde tekst identiek is aan wat het doelmodel alleen zou produceren onder greedy‑decodering, waardoor de benchmark‑nauwkeurigheid ongewijzigd blijft.
De metingen van Liquid AI, uitgevoerd met batch‑grootte 1 en temperatuur 0 over vijf datasets, tonen een gemiddelde versnelling van 2,67× voor LFM2.5-2.6B op een H100 (323 naar 864 tokens per seconde) en 2,27× op een M4 Max MacBook Pro (61 naar 139 tokens per seconde). Het grootste individuele resultaat kwam van LFM2.5-8B-A1B op MATH500, waarbij de doorvoer op de H100 steeg tot 3,18×, van 428 naar 1.362 tokens per seconde. Het bedrijf meldt bovendien dat DSpark de latentie van functieroepen gemiddeld met 57 % heeft verlaagd voor LFM2.5-2.6B in multi‑tool‑scenario’s, het kopresultaat voor de on‑device‑agentische workloads waarop de LFM2.5‑lijn zich richt.
Hoe DSpark het decoderen versnelt
De decode‑fase van LLM‑inference is geheugen‑gebonden: het grootste deel van de latentie ontstaat door het streamen van gewichten van DRAM naar on‑chip‑geheugen in plaats van door de berekening zelf, waardoor inference‑economics het centrale engineering‑probleem van het vakgebied is geworden.
Speculatieve decodering pakt dit aan door een klein draft‑model een blok kandidaat‑tokens te laten voorstellen, waarna het gehele blok in één forward‑pass van het doelmodel wordt geverifieerd, waardoor de kosten van het laden van de gewichten over elk gecontroleerd token worden verspreid.
DSpark, geïntroduceerd in een juli 2026‑paper door DeepSeek‑onderzoekers en ingezet in het DeepSeek‑V4‑servingsysteem van dat bedrijf, combineert drie componenten: een parallelle backbone die verborgen toestanden voor alle draft‑tokens in één pass produceert, een lichtgewicht sequentiële head die afhankelijkheden tussen naburige tokens modelleert om acceptatieratio’s tegen verval aan het einde van het blok te beschermen, en een op vertrouwen geplande verifier die lage‑vertrouwens‑suffixen weghaalt wanneer verificatie meer kost dan het bespaart. In DeepSeek’s productie‑deployment meldt de paper generatiesnelheidsverbeteringen per gebruiker van 60 % tot 85 % ten opzichte van de eerdere MTP‑1‑baseline bij gelijkmatige doorvoer.
De draft‑modellen van Liquid AI volgen dat recept met een vereenvoudigd attention‑only‑ontwerp: vijf lagen, een blokgrootte van negen draft‑tokens per stap, en een Markov‑head over een vocabulaire van 128.000 tokens, volgens de LFM2.5-2.6B-DSpark‑modelkaart. Elk draft‑model werd gedurende 15 epochs getraind op een mix van supervised fine‑tuning, chat, code en function‑calling‑data, waarbij de checkpoint werd gekozen op basis van de hoogste acceptatieratio in plaats van de laagste loss. De nauwkeurigheidsgarantie levert de kwaliteit: “Speculatieve decodering is exact: het doelmodel verifieert elk voorgesteld token, dus greedy‑output is gelijk aan het doelmodel alleen,” stelt de GGUF‑modelkaart, met per‑respons‑timings die onthullen hoeveel draft‑tokens werden voorgesteld en geaccepteerd.
LFM2.5-DSpark in cijfers
- 3.18x — best gerapporteerde GPU‑versnelling (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 tok/s)
- 2.87x — best gerapporteerde on‑device‑versnelling (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
- 2.67x / 2.27x — gemiddelde H100‑ / M4‑Max‑versnellingen voor LFM2.5-2.6B over vijf datasets
- 57%: gemiddelde vermindering van functieroep‑latentie voor LFM2.5-2.6B in multi‑tool‑scenario’s
- 295.7M–327.7M (draft model parameters, against targets of 1.2B to 8B)
- 4.81 of 10, mean accepted draft tokens per step for LFM2.5-2.6B at block size 9
Waar de gerapporteerde versnellingen afnemen
De eigen tabellen van Liquid AI tonen aan dat de winsten ongelijk verdeeld zijn, en het bedrijf geeft de redenen. Voor LFM2.5-8B-A1B bedraagt de on‑device‑verbetering gemiddeld slechts 1,18× ondanks de hoogste acceptatieratio’s van de drie modellen; dit gat schrijft het bedrijf toe aan de huidige mixture‑of‑experts‑implementatie in de Metal‑backend van llama.cpp en aan het extra gewichtverkeer dat het verifiëren van een token‑blok activeert over de experts. Voor LFM2.5-1.2B-Instruct variëren de acceptatieratio’s per dataset voldoende dat de versnelling kan schommelen tot wel 52 % afhankelijk van de tekstverdeling, van 1,66× op MT‑Bench tot 2,56× op MATH500 op de H100.
Alle cijfers zijn door de leverancier gerapporteerd vanuit de eigen testopstelling van Liquid AI: SGLang op één H100 80 GB in BF16 voor GPU‑cijfers, llama.cpp met experimentele Metal‑kernels op een M4 Max met FP16‑GGUF‑gewichten voor on‑device‑cijfers, begrensd tot 256 output‑tokens. Het SGLang-pad vereist een build met DSpark‑ondersteuning voor LFM2‑doelen, en het llama.cpp‑pad vereist de corresponderende build, waardoor de versnellingen afhankelijk zijn van die integraties in plaats van te worden meegeleverd in een stabiele release van een van beide engines.
Liquid AI’s on‑device‑push tot nu toe
De DSpark‑release is de derde update van de LFM2.5‑familie in iets meer dan een week. Op 12 augustus 2026 verzond het bedrijf LFM2.5-VL-3B, een vision‑language‑model voor de edge, en op 19 augustus 2026 publiceerde het quantization‑aware gedistilleerde Q4_0‑checkpoints voor de familie. De rode draad is dezelfde: het bedrijf stelt dat de DSpark‑versnelling van het 2,6 B‑model op een MacBook de interactiviteit duwt voorbij de doorvoer die de meeste propriëtaire cloud‑modellen bieden, die het op ongeveer 140 tokens per seconde schat.
Alle drie de draft‑modellen zijn nu beschikbaar op Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark en LFM2.5-8B-A1B-DSpark, met GGUF‑builds daarnaast voor llama.cpp‑deployments.












