AI-modeller og plattformer

Liquid AI lanserer LFM2.5-DSpark for opptil 3,2× raskere inferens

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Liquid AI publiserte spekulativ‑dekodings‑utkast‑kontrollpunkter for tre modeller i sin LFM2.5‑familie 20. august 2026, og rapporterte gjennomstrømningsgevinster på opptil 3,18× på en enkelt H100‑GPU og opptil 2,87× på en Apple‑silicon‑MacBook, uten endring i modellens utdata. LFM2.5‑DSpark‑utgivelsen omfatter utkastgeneratorer for LFM2.5‑1.2B‑Instruct, LFM2.5‑2.6B og mixture‑of‑experts‑modellen LFM2.5‑8B‑A1B, som hver legger til omtrent 300 millioner parametere med utkast‑overhead på toppen av målmodellen.

Kontrollpunktene leveres i Safetensors‑ og GGUF‑formater med dag‑en‑støtte i llama.cpp og SGLang, og begge integrasjonene er bidratt oppstrøms til de offisielle kodebasene. Siden spekulativ dekoding kun sender ut tokenene som målmodellen har verifisert, oppgir selskapet at den genererte teksten er identisk med det målmodellen ville produsert alene under grådig dekoding, så benchmark‑nøyaktigheten forblir uendret.

Liquid AIs målinger, utført med batch‑størrelse 1 og temperatur 0 på fem datasett, viser at gjennomsnittlig hastighetsøkning for LFM2.5‑2.6B er 2,67× på en H100 (323 til 864 token per sekund) og 2,27× på en M4 Max MacBook Pro (61 til 139 token per sekund). Det største enkeltresultatet kom fra LFM2.5‑8B‑A1B på MATH500, hvor gjennomstrømningen på H100 økte med 3,18×, fra 428 til 1 362 token per sekund. Selskapet rapporterer også at DSpark reduserte funksjons‑kall‑latensen med i gjennomsnitt 57 % for LFM2.5‑2.6B i multi‑verktøy‑scenarioer, hovedresultatet for de på‑enheten‑agentbaserte arbeidsbelastningene LFM2.5‑serien retter seg mot.

Hvordan DSpark gjør dekoding raskere

Dekodingsfasen i LLM‑inferens er minne‑begrenset: mesteparten av latensen kommer fra å strømme vekter fra DRAM inn i on‑chip‑minne snarere enn fra selve beregningen, noe som gjør at økonomien rundt inferens har blitt feltets sentrale ingeniørproblem.

Spekulativ dekoding angriper dette ved å la en liten utkastmodell foreslå en blokk med kandidat‑token, og deretter verifisere hele blokken i ett fremoverpass av målmodellen, slik at kostnaden ved å laste vektene fordeles over hver token som sjekkes.

DSpark, introdusert i en juli‑2026‑artikkel av DeepSeek‑forskerne og distribuert i selskapets DeepSeek‑V4‑tjenestesystem, kombinerer tre komponenter: en parallell ryggrad som produserer skjulte tilstander for alle utkast‑token i ett enkelt pass, et lettvektig sekvensielt hode som modellerer avhengigheter mellom nabotoken for å hindre at aksept‑ratene faller mot slutten av blokken, og en tillits‑styrt verifikator som beskjærer lav‑tillits‑suffikser når verifisering av dem ville koste mer enn det sparer. I DeepSeeks produksjons‑distribusjon rapporterer artikkelen generasjons‑hastighetsøkninger per bruker på 60 til 85 % over den tidligere MTP‑1‑basen ved tilsvarende gjennomstrømning.

Liquid AIs utkastgeneratorer følger denne oppskriften med et forenklet kun‑oppmerksomhets‑design: fem lag, en blokkstørrelse på ni utkast‑token per steg, og et Markov‑hode over et vokabular på 128 000 token, i henhold til LFM2.5‑2.6B‑DSpark‑modellkortet. Hver utkastgenerator ble trent i 15 epoker på en blanding av veiledet fin‑justering, chat, kode og funksjons‑kall‑data, med kontrollpunktet valgt etter høyest aksept‑rate i stedet for lavest tap. Nøyaktighetsgarantien gjør kvaliteten klar: «Spekulativ dekoding er eksakt: målmodellen verifiserer hver foreslåtte token, så grådig utdata er lik målmodellen alene», heter det i GGUF‑modellkortet, med tidsmålinger per respons som viser hvor mange utkast‑token som ble foreslått og akseptert.

LFM2.5-DSpark i tall

  • 3.18x — beste rapporterte GPU‑hastighetsøkning (LFM2.5-8B-A1B, MATH500, H100: 428 → 1 362 tok/s)
  • 2.87x — beste rapporterte på‑enheten‑hastighetsøkning (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
  • 2.67x / 2.27x — gjennomsnittlige H100‑ / M4 Max‑hastighetsøkninger for LFM2.5‑2.6B på tvers av fem datasett
  • 57%: gjennomsnittlig reduksjon i funksjons‑kall‑latens for LFM2.5‑2.6B i multi‑verktøy‑scenarioer
  • 295.7M–327.7M (parametere i utkast‑modellen, mot mål på 1,2 B til 8 B)
  • 4.81 of 10, gjennomsnittlig aksepterte utkast‑token per steg for LFM2.5‑2.6B ved blokkstørrelse 9

Hvor de rapporterte hastighetsøkningene avtar

Liquid AIs egne tabeller viser at gevinstene er ujevne, og selskapet forklarer årsakene. For LFM2.5‑8B‑A1B er forbedringen på enheten i gjennomsnitt kun 1,18× til tross for de høyeste aksept‑ratene av de tre modellene, et gap selskapet tilskriver den nåværende mixture‑of‑experts‑implementasjonen i llama.cpps Metal‑backend og den ekstra vekt‑trafikken som verifisering av en token‑blokk aktiverer på tvers av eksperter. For LFM2.5‑1.2B‑Instruct varierer aksept‑ratene nok per datasett til at hastighetsøkningen svinger med opptil 52 % avhengig av tekstfordelingen, fra 1,66× på MT‑Bench opp til 2,56× på MATH500 på H100.

Alle tall er leverandør‑rapporterte fra Liquid AIs eget testoppsett: SGLang på én H100 80 GB i BF16 for GPU‑tall, llama.cpp med eksperimentelle Metal‑kjerner på en M4 Max med FP16‑GGUF‑vekter for på‑enheten‑tall, begrenset til 256 utdata‑token. SGLang‑veien krever en bygging med DSpark‑støtte for LFM2‑mål, og llama.cpp‑veien krever den tilsvarende byggingen, så hastighetsøkningene avhenger av disse integrasjonene i stedet for å bli levert i en stabil versjon av noen av motorene.

Liquid AIs på‑enheten‑push så langt

DSpark‑utgivelsen er den tredje oppdateringen i LFM2.5‑familien på litt over en uke. 12. august 2026 lanserte selskapet LFM2.5-VL-3B, en visjon‑språk‑modell for kanten, og 19. august 2026 publiserte det kvantisering‑bevisste destillerte Q4_0‑kontrollpunkter for familien. Den gjennomgående tråden er den samme: selskapet sier at 2,6B‑modellens DSpark‑hastighetsøkning på en MacBook gir interaktivitet utover gjennomstrømningen som de fleste proprietære sky‑modeller tilbyr, som de anslår til omtrent 140 token per sekund.

Alle tre utkastgeneratorene er nå tilgjengelige på Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark og LFM2.5-8B-A1B-DSpark, med GGUF‑bygg ved siden av for llama.cpp‑distribusjoner.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.