AI-modeller och plattformar

Liquid AI lanserar LFM2.5-DSpark för upp till 3,2‑gång snabbare inferens

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Liquid AI släppte spekulativ‑dekodningsdraft‑kontrollpunkter för tre modeller i sin LFM2.5‑familj den 20 augusti 2026 och rapporterade genomströmningstillväxt på upp till 3,18× på ett enskilt H100‑GPU samt upp till 2,87× på en Apple‑silicon‑MacBook, utan förändring av modellens utdata. LFM2.5-DSpark‑utgåvan omfattar draft‑modeller för LFM2.5-1.2B-Instruct, LFM2.5-2.6B och mixture‑of‑experts‑modellen LFM2.5-8B-A1B, var och en lägger till ungefär 300 miljoner parametrar av draft‑overhead ovanpå målmodellen.

Kontrollpunkterna levereras i Safetensors‑ och GGUF‑format med stöd från dag ett i llama.cpp och SGLang, där båda integrationerna har bidragits uppströms till de officiella kodbaserna. Eftersom spekulativ dekodning endast avger token som målmodellen har verifierat, påstår företaget att den genererade texten är identisk med vad målmodellen skulle producera ensam under girig dekodning, så benchmark‑noggrannheten förblir oförändrad.

Liquid AIs mätningar, utförda med batch‑storlek 1 och temperatur 0 över fem dataset, visar att den genomsnittliga hastighetsökningen för LFM2.5-2.6B är 2,67× på ett H100 (323 till 864 token per sekund) och 2,27× på en M4 Max MacBook Pro (61 till 139 token per sekund). Det största enskilda resultatet kom från LFM2.5-8B-A1B på MATH500, där genomströmningen på H100 ökade med 3,18×, från 428 till 1 362 token per sekund. Företaget rapporterar också att DSpark minskade fördröjningen för funktionsanrop med i genomsnitt 57 % för LFM2.5-2.6B i multi‑tool‑scenarier, vilket är huvudresultatet för de on‑device‑agentiska arbetsbelastningarna som LFM2.5‑serien är inriktad på.

Hur DSpark påskyndar dekodning

Dekodningsfasen i LLM‑inferens är minnesbunden: största delen av fördröjningen kommer från att strömma vikter från DRAM till on‑chip‑minne snarare än från själva beräkningarna, vilket är anledningen till att inferensekonomin har blivit fältets centrala ingenjörsproblem. Spekulativ dekodning angriper detta genom att låta en liten draft‑modell föreslå ett block med kandidat‑token, för att sedan verifiera hela blocket i ett framåtpas av målmodellen, vilket sprider kostnaden för att ladda vikterna över varje token som kontrolleras.

DSpark, som introducerades i ett juli‑2026‑papper av DeepSeek‑forskare och distribueras i företagets DeepSeek‑V4‑servingsystem, kombinerar tre komponenter: en parallell ryggrad som producerar dolda tillstånd för alla draft‑token i ett enda pass, ett lättviktigt sekventiellt huvud som modellerar beroenden mellan närliggande token för att hålla accepteringsgraderna från att sjunka sent i blocket, samt en förtroendeschemalagd verifierare som beskär låg‑förtroendesuffix när verifiering skulle kosta mer än den sparar. I DeepSeeks produktionsdistribution rapporterar papperet per‑användargenereringshastighetsökningar på 60‑85 % över den tidigare MTP‑1‑baslinjen vid matchad genomströmning.

Liquid AIs draft‑modeller följer det receptet med en förenklad enbart‑uppmärksamhetsdesign: fem lager, en blockstorlek på nio draft‑token per steg och ett Markov‑huvud över ett vokabulär på 128 000 token, enligt LFM2.5-2.6B-DSpark‑modellkortet. Varje draft‑modell tränades i 15 epoker på en blandning av övervakad finjustering, chatt, kod och funktionsanrop‑data, där kontrollpunkten valdes efter högst accepteringsgrad snarare än lägst förlust. Exakthetsgarantin gör kvalitetsarbetet: “Spekulativ dekodning är exakt: målmodellen verifierar varje föreslagen token, så girig utdata är lika med målmodellen ensam”, enligt GGUF‑modellkortet, med per‑respons‑tidsmätningar som visar hur många draft‑token som föreslogs och accepterades.

LFM2.5-DSpark i siffror

  • 3.18x — bästa rapporterade GPU‑hastighetsökning (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 tok/s)
  • 2.87x — bästa rapporterade on‑device‑hastighetsökning (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
  • 2.67x / 2.27x — genomsnittliga H100‑ / M4 Max‑hastighetsökningar för LFM2.5-2.6B över fem dataset
  • 57%: genomsnittlig minskning av fördröjning för funktionsanrop för LFM2.5-2.6B i multi‑tool‑scenarier
  • 295.7M–327.7M (draft‑modellparametrar, mot mål på 1,2 B till 8 B)
  • 4.81 of 10, genomsnittligt accepterade draft‑token per steg för LFM2.5-2.6B vid blockstorlek 9

Där de rapporterade hastighetsökningarna avtar

Liquid AIs egna tabeller visar att vinsterna är ojämna, och företaget redogör för orsakerna. För LFM2.5-8B-A1B är on‑device‑förbättringen i genomsnitt endast 1,18× trots de högsta accepteringsgraderna av de tre modellerna, ett gap som företaget tillskriver den nuvarande mixture‑of‑experts‑implementeringen i llama.cpp:s Metal‑backend samt den extra vikttrafik som verifiering av ett token‑block aktiverar över experterna. För LFM2.5-1.2B-Instruct varierar accepteringsgraderna tillräckligt mycket per dataset att hastighetsökningen svänger med upp till 52 % beroende på textfördelningen, från 1,66× på MT‑Bench upp till 2,56× på MATH500 på H100.

Alla siffror är leverantörsrapporterade från Liquid AIs egen testbänk: SGLang på ett H100 80 GB i BF16 för GPU‑siffror, llama.cpp med experimentella Metal‑kärnor på en M4 Max med FP16‑GGUF‑vikter för on‑device‑siffror, begränsat till 256 utdata‑token. SGLang-vägen kräver en build med DSpark‑stöd för LFM2‑mål, och llama.cpp‑vägen kräver motsvarande build, så hastighetsökningarna beror på dessa integrationer snarare än att levereras i en stabil release av någon av motorerna.

Liquid AIs on‑device‑push hittills

DSpark‑utgåvan är den tredje uppdateringen av LFM2.5‑familjen på drygt en vecka. Den 12 augusti 2026 släppte företaget LFM2.5-VL-3B, en vision‑språkmodell för kanten, och den 19 augusti 2026 publicerade det kvantiserings‑medvetna destillerade Q4_0‑kontrollpunkter för familjen. Den röda tråden är densamma: företaget säger att 2,6B‑modellens DSpark‑hastighetsökning på en MacBook driver interaktiviteten bortom den genomströmning som de flesta proprietära molnmodeller erbjuder, vilket de uppskattar till ungefär 140 token per sekund.

Alla tre draft‑modeller finns nu på Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark och LFM2.5-8B-A1B-DSpark, med GGUF‑byggnader parallellt för llama.cpp‑distributioner.

Jonas Reeve är en AI-genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell allmän intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete utforskar hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI-arkitekturer och långvariga frågor inom kognitiv vetenskap och filosofi om medvetandet.
Med en konceptuell och reflekterande ansats undersöker Jonas ramverk som resonemangsmodeller, agenssystem, emergent kognition och anpassningsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder - och vad det inte betyder. Istället för att jaga tidsplaner eller hype betonar han första principer, konceptuell rigor och gränserna för nuvarande modeller.
Artiklar skrivna av Jonas Reeve är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa korrekthet, tydlighet och ansvarsfull diskussion om avancerade AI-koncept.