AI-modeller og plattformer
Liquid AI lanserer LFM2.5-DSpark for opptil 3,2× raskere inferens

Liquid AI publiserte spekulativ‑dekodings‑utkast‑kontrollpunkter for tre modeller i sin LFM2.5‑familie 20. august 2026, og rapporterte gjennomstrømningsgevinster på opptil 3,18× på en enkelt H100‑GPU og opptil 2,87× på en Apple‑silicon‑MacBook, uten endring i modellens utdata. LFM2.5‑DSpark‑utgivelsen omfatter utkastgeneratorer for LFM2.5‑1.2B‑Instruct, LFM2.5‑2.6B og mixture‑of‑experts‑modellen LFM2.5‑8B‑A1B, som hver legger til omtrent 300 millioner parametere med utkast‑overhead på toppen av målmodellen.
Kontrollpunktene leveres i Safetensors‑ og GGUF‑formater med dag‑en‑støtte i llama.cpp og SGLang, og begge integrasjonene er bidratt oppstrøms til de offisielle kodebasene. Siden spekulativ dekoding kun sender ut tokenene som målmodellen har verifisert, oppgir selskapet at den genererte teksten er identisk med det målmodellen ville produsert alene under grådig dekoding, så benchmark‑nøyaktigheten forblir uendret.
Liquid AIs målinger, utført med batch‑størrelse 1 og temperatur 0 på fem datasett, viser at gjennomsnittlig hastighetsøkning for LFM2.5‑2.6B er 2,67× på en H100 (323 til 864 token per sekund) og 2,27× på en M4 Max MacBook Pro (61 til 139 token per sekund). Det største enkeltresultatet kom fra LFM2.5‑8B‑A1B på MATH500, hvor gjennomstrømningen på H100 økte med 3,18×, fra 428 til 1 362 token per sekund. Selskapet rapporterer også at DSpark reduserte funksjons‑kall‑latensen med i gjennomsnitt 57 % for LFM2.5‑2.6B i multi‑verktøy‑scenarioer, hovedresultatet for de på‑enheten‑agentbaserte arbeidsbelastningene LFM2.5‑serien retter seg mot.
Hvordan DSpark gjør dekoding raskere
Dekodingsfasen i LLM‑inferens er minne‑begrenset: mesteparten av latensen kommer fra å strømme vekter fra DRAM inn i on‑chip‑minne snarere enn fra selve beregningen, noe som gjør at økonomien rundt inferens har blitt feltets sentrale ingeniørproblem.
Spekulativ dekoding angriper dette ved å la en liten utkastmodell foreslå en blokk med kandidat‑token, og deretter verifisere hele blokken i ett fremoverpass av målmodellen, slik at kostnaden ved å laste vektene fordeles over hver token som sjekkes.
DSpark, introdusert i en juli‑2026‑artikkel av DeepSeek‑forskerne og distribuert i selskapets DeepSeek‑V4‑tjenestesystem, kombinerer tre komponenter: en parallell ryggrad som produserer skjulte tilstander for alle utkast‑token i ett enkelt pass, et lettvektig sekvensielt hode som modellerer avhengigheter mellom nabotoken for å hindre at aksept‑ratene faller mot slutten av blokken, og en tillits‑styrt verifikator som beskjærer lav‑tillits‑suffikser når verifisering av dem ville koste mer enn det sparer. I DeepSeeks produksjons‑distribusjon rapporterer artikkelen generasjons‑hastighetsøkninger per bruker på 60 til 85 % over den tidligere MTP‑1‑basen ved tilsvarende gjennomstrømning.
Liquid AIs utkastgeneratorer følger denne oppskriften med et forenklet kun‑oppmerksomhets‑design: fem lag, en blokkstørrelse på ni utkast‑token per steg, og et Markov‑hode over et vokabular på 128 000 token, i henhold til LFM2.5‑2.6B‑DSpark‑modellkortet. Hver utkastgenerator ble trent i 15 epoker på en blanding av veiledet fin‑justering, chat, kode og funksjons‑kall‑data, med kontrollpunktet valgt etter høyest aksept‑rate i stedet for lavest tap. Nøyaktighetsgarantien gjør kvaliteten klar: «Spekulativ dekoding er eksakt: målmodellen verifiserer hver foreslåtte token, så grådig utdata er lik målmodellen alene», heter det i GGUF‑modellkortet, med tidsmålinger per respons som viser hvor mange utkast‑token som ble foreslått og akseptert.
LFM2.5-DSpark i tall
- 3.18x — beste rapporterte GPU‑hastighetsøkning (LFM2.5-8B-A1B, MATH500, H100: 428 → 1 362 tok/s)
- 2.87x — beste rapporterte på‑enheten‑hastighetsøkning (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
- 2.67x / 2.27x — gjennomsnittlige H100‑ / M4 Max‑hastighetsøkninger for LFM2.5‑2.6B på tvers av fem datasett
- 57%: gjennomsnittlig reduksjon i funksjons‑kall‑latens for LFM2.5‑2.6B i multi‑verktøy‑scenarioer
- 295.7M–327.7M (parametere i utkast‑modellen, mot mål på 1,2 B til 8 B)
- 4.81 of 10, gjennomsnittlig aksepterte utkast‑token per steg for LFM2.5‑2.6B ved blokkstørrelse 9
Hvor de rapporterte hastighetsøkningene avtar
Liquid AIs egne tabeller viser at gevinstene er ujevne, og selskapet forklarer årsakene. For LFM2.5‑8B‑A1B er forbedringen på enheten i gjennomsnitt kun 1,18× til tross for de høyeste aksept‑ratene av de tre modellene, et gap selskapet tilskriver den nåværende mixture‑of‑experts‑implementasjonen i llama.cpps Metal‑backend og den ekstra vekt‑trafikken som verifisering av en token‑blokk aktiverer på tvers av eksperter. For LFM2.5‑1.2B‑Instruct varierer aksept‑ratene nok per datasett til at hastighetsøkningen svinger med opptil 52 % avhengig av tekstfordelingen, fra 1,66× på MT‑Bench opp til 2,56× på MATH500 på H100.
Alle tall er leverandør‑rapporterte fra Liquid AIs eget testoppsett: SGLang på én H100 80 GB i BF16 for GPU‑tall, llama.cpp med eksperimentelle Metal‑kjerner på en M4 Max med FP16‑GGUF‑vekter for på‑enheten‑tall, begrenset til 256 utdata‑token. SGLang‑veien krever en bygging med DSpark‑støtte for LFM2‑mål, og llama.cpp‑veien krever den tilsvarende byggingen, så hastighetsøkningene avhenger av disse integrasjonene i stedet for å bli levert i en stabil versjon av noen av motorene.
Liquid AIs på‑enheten‑push så langt
DSpark‑utgivelsen er den tredje oppdateringen i LFM2.5‑familien på litt over en uke. 12. august 2026 lanserte selskapet LFM2.5-VL-3B, en visjon‑språk‑modell for kanten, og 19. august 2026 publiserte det kvantisering‑bevisste destillerte Q4_0‑kontrollpunkter for familien. Den gjennomgående tråden er den samme: selskapet sier at 2,6B‑modellens DSpark‑hastighetsøkning på en MacBook gir interaktivitet utover gjennomstrømningen som de fleste proprietære sky‑modeller tilbyr, som de anslår til omtrent 140 token per sekund.
Alle tre utkastgeneratorene er nå tilgjengelige på Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark og LFM2.5-8B-A1B-DSpark, med GGUF‑bygg ved siden av for llama.cpp‑distribusjoner.












