Modely a platformy AI
Liquid AI uvádí LFM2.5-DSpark pro až 3,2‑násobně rychlejší inferenci

Liquid AI vydala kontrolní body pro spekulativní dekódování draftů pro tři modely ze své řady LFM2.5 dne 20. srpna 2026 a uvádí nárůst propustnosti až 3,18× na jedné GPU H100 a až 2,87× na MacBooku s Apple‑silicon, aniž by se změnil výstup modelu. vydání LFM2.5-DSpark zahrnuje draftery pro LFM2.5-1.2B-Instruct, LFM2.5-2.6B a model typu mixture‑of‑experts LFM2.5-8B-A1B, přičemž každý přidává přibližně 300 milionů parametrů draftu nad cílový model.
Kontrolní body jsou distribuovány ve formátech Safetensors a GGUF s okamžitou podporou v llama.cpp a SGLang, přičemž obě integrace byly přispěny do oficiálních kódových základen. Protože spekulativní dekódování vydává pouze tokeny, které cílový model ověřil, společnost uvádí, že generovaný text je identický s tím, co by cílový model sám vyprodukoval při greedy dekódování, takže přesnost benchmarků zůstává nezměněna.
Měření společnosti Liquid AI, provedená s velikostí batchu 1 a teplotou 0 napříč pěti datovými sadami, ukazují průměrné zrychlení pro LFM2.5-2.6B na 2,67× na H100 (z 323 na 864 tokenů za sekundu) a 2,27× na MacBooku Pro M4 Max (z 61 na 139 tokenů za sekundu). Největší jednotlivý výsledek pochází z LFM2.5-8B-A1B na MATH500, kde propustnost na H100 vzrostla na 3,18×, z 428 na 1 362 tokenů za sekundu. Společnost také uvádí, že DSpark snížil latenci volání funkcí o 57 % v průměru pro LFM2.5-2.6B napříč scénáři s více nástroji, což je hlavní výsledek pro on‑device agentické úlohy, na které je řada LFM2.5 zaměřena.
Jak DSpark zrychluje dekódování
Fáze dekódování při inferenci LLM je omezena pamětí: většina latence pochází ze streamování vah z DRAM do paměti na čipu, nikoli z samotného výpočtu, což je důvod, proč se ekonomika inferencí se stala centrálním inženýrským problémem v oboru. Spekulativní dekódování tento problém řeší tím, že malý draftový model navrhne blok kandidátních tokenů a poté celý blok ověří jedním forward průchodem cílového modelu, čímž rozloží náklady na načítání vah na každý kontrolovaný token.
DSpark, představený v červencovém článku 2026 od výzkumníků DeepSeek a nasazený v jejich systému DeepSeek-V4, kombinuje tři komponenty: paralelní páteř, která v jediném průchodu vytváří skryté stavy pro všechny draftové tokeny, lehkou sekvenční hlavu modelující závislosti mezi sousedními tokeny, aby udržela míru přijetí v pozdějších částech bloku, a verifikátor řízený důvěrou, který ořezává sufixy s nízkou důvěrou, pokud by jejich ověření stálo více, než ušetří. Ve výrobním nasazení DeepSeek článek uvádí zrychlení generování na uživatele o 60 až 85 % oproti předchozímu baseline MTP‑1 při shodné propustnosti.
Draftery Liquid AI následují tento postup s jednodušším designem založeným pouze na pozornosti: pět vrstev, velikost bloku devíti draftových tokenů na krok a Markovova hlava nad slovníkem o 128 000 tokenů, podle karty modelu LFM2.5-2.6B-DSpark. Každý draft byl trénován po dobu 15 epoch na směsi dohledu, chatování, kódu a dat pro volání funkcí, přičemž kontrolní bod byl vybrán podle nejvyšší míry přijetí místo nejnižší ztráty. Záruka přesnosti vykonává kvalitu: „Spekulativní dekódování je přesné: cílový model ověří každý navržený token, takže greedy výstup se rovná samotnému cíli,“ uvádí karta modelu GGUF, s časovými údaji na odpověď ukazujícími, kolik draftových tokenů bylo navrženo a přijato.
LFM2.5-DSpark v číslech
- 3,18× — nejlepší zaznamenané zrychlení na GPU (LFM2.5-8B-A1B, MATH500, H100: 428 → 1 362 tok/s)
- 2,87× — nejlepší zaznamenané zrychlení na zařízení (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
- 2,67× / 2,27× — průměrná zrychlení H100 / M4 Max pro LFM2.5-2.6B napříč pěti datovými sadami
- 57 %: průměrné snížení latence volání funkcí pro LFM2.5-2.6B ve scénářích s více nástroji
- 295,7 M–327,7 M (parametry draftového modelu, oproti cílům 1,2 B až 8 B)
- 4,81 z 10, průměrný počet přijatých draftových tokenů na krok pro LFM2.5-2.6B při velikosti bloku 9
Kde se zaznamenaná zrychlení zužují
Vlastní tabulky Liquid AI ukazují, že zisky jsou nerovnoměrné, a společnost uvádí důvody. Pro LFM2.5-8B-A1B se průměrné zlepšení na zařízení pohybuje jen na 1,18× navzdory nejvyšším mírám přijetí ze tří modelů; mezeru společnost připisuje současné implementaci mixture‑of‑experts v Metal backendu llama.cpp a dodatečnému provozu vah, který aktivuje ověřování bloku tokenů napříč experty. Pro LFM2.5-1.2B-Instruct se míry přijetí natolik liší podle datové sady, že zrychlení kolísá až o 52 % v závislosti na rozložení textu, od 1,66× na MT‑Bench až po 2,56× na MATH500 na H100.
Všechny údaje jsou uváděny výrobcem z vlastního testovacího prostředí Liquid AI: SGLang na jednom H100 80 GB v BF16 pro GPU čísla, llama.cpp s experimentálními Metal jádry na M4 Max s FP16 GGUF vahami pro čísla na zařízení, omezené na 256 výstupních tokenů. Cesta SGLang vyžaduje sestavení s podporou DSpark pro cíle LFM2, a cesta llama.cpp vyžaduje odpovídající sestavení, takže zrychlení závisí na těchto integracích, nikoli na stabilním vydání některého z engineů.
On‑device posun Liquid AI zatím
Vydání DSpark je třetí aktualizací řady LFM2.5 během pouhého týdne. Dne 12. srpna 2026 společnost uvedla LFM2.5-VL-3B, vision‑language model pro okrajové zařízení, a 19. srpna 2026 publikovala kvantizačně‑vědomé destilované kontrolní body Q4_0 pro tuto řadu. Spojnicí je stejná: společnost uvádí, že zrychlení DSpark modelu 2,6B na MacBooku posouvá interaktivitu za propustnost, kterou nabízejí většina proprietárních cloudových modelů, a to přibližně 140 tokenů za sekundu.
Všechny tři draftery jsou nyní k dispozici na Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark a LFM2.5-8B-A1B-DSpark, s GGUF buildy vedle pro nasazení v llama.cpp.












