Modely a platformy AI

Liquid AI uvádí LFM2.5-DSpark pro až 3,2‑násobně rychlejší inferenci

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Liquid AI vydala kontrolní body pro spekulativní dekódování draftů pro tři modely ze své řady LFM2.5 dne 20. srpna 2026 a uvádí nárůst propustnosti až 3,18× na jedné GPU H100 a až 2,87× na MacBooku s Apple‑silicon, aniž by se změnil výstup modelu. vydání LFM2.5-DSpark zahrnuje draftery pro LFM2.5-1.2B-Instruct, LFM2.5-2.6B a model typu mixture‑of‑experts LFM2.5-8B-A1B, přičemž každý přidává přibližně 300 milionů parametrů draftu nad cílový model.

Kontrolní body jsou distribuovány ve formátech Safetensors a GGUF s okamžitou podporou v llama.cpp a SGLang, přičemž obě integrace byly přispěny do oficiálních kódových základen. Protože spekulativní dekódování vydává pouze tokeny, které cílový model ověřil, společnost uvádí, že generovaný text je identický s tím, co by cílový model sám vyprodukoval při greedy dekódování, takže přesnost benchmarků zůstává nezměněna.

Měření společnosti Liquid AI, provedená s velikostí batchu 1 a teplotou 0 napříč pěti datovými sadami, ukazují průměrné zrychlení pro LFM2.5-2.6B na 2,67× na H100 (z 323 na 864 tokenů za sekundu) a 2,27× na MacBooku Pro M4 Max (z 61 na 139 tokenů za sekundu). Největší jednotlivý výsledek pochází z LFM2.5-8B-A1B na MATH500, kde propustnost na H100 vzrostla na 3,18×, z 428 na 1 362 tokenů za sekundu. Společnost také uvádí, že DSpark snížil latenci volání funkcí o 57 % v průměru pro LFM2.5-2.6B napříč scénáři s více nástroji, což je hlavní výsledek pro on‑device agentické úlohy, na které je řada LFM2.5 zaměřena.

Jak DSpark zrychluje dekódování

Fáze dekódování při inferenci LLM je omezena pamětí: většina latence pochází ze streamování vah z DRAM do paměti na čipu, nikoli z samotného výpočtu, což je důvod, proč se ekonomika inferencí se stala centrálním inženýrským problémem v oboru. Spekulativní dekódování tento problém řeší tím, že malý draftový model navrhne blok kandidátních tokenů a poté celý blok ověří jedním forward průchodem cílového modelu, čímž rozloží náklady na načítání vah na každý kontrolovaný token.

DSpark, představený v červencovém článku 2026 od výzkumníků DeepSeek a nasazený v jejich systému DeepSeek-V4, kombinuje tři komponenty: paralelní páteř, která v jediném průchodu vytváří skryté stavy pro všechny draftové tokeny, lehkou sekvenční hlavu modelující závislosti mezi sousedními tokeny, aby udržela míru přijetí v pozdějších částech bloku, a verifikátor řízený důvěrou, který ořezává sufixy s nízkou důvěrou, pokud by jejich ověření stálo více, než ušetří. Ve výrobním nasazení DeepSeek článek uvádí zrychlení generování na uživatele o 60 až 85 % oproti předchozímu baseline MTP‑1 při shodné propustnosti.

Draftery Liquid AI následují tento postup s jednodušším designem založeným pouze na pozornosti: pět vrstev, velikost bloku devíti draftových tokenů na krok a Markovova hlava nad slovníkem o 128 000 tokenů, podle karty modelu LFM2.5-2.6B-DSpark. Každý draft byl trénován po dobu 15 epoch na směsi dohledu, chatování, kódu a dat pro volání funkcí, přičemž kontrolní bod byl vybrán podle nejvyšší míry přijetí místo nejnižší ztráty. Záruka přesnosti vykonává kvalitu: „Spekulativní dekódování je přesné: cílový model ověří každý navržený token, takže greedy výstup se rovná samotnému cíli,“ uvádí karta modelu GGUF, s časovými údaji na odpověď ukazujícími, kolik draftových tokenů bylo navrženo a přijato.

LFM2.5-DSpark v číslech

  • 3,18× — nejlepší zaznamenané zrychlení na GPU (LFM2.5-8B-A1B, MATH500, H100: 428 → 1 362 tok/s)
  • 2,87× — nejlepší zaznamenané zrychlení na zařízení (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
  • 2,67× / 2,27× — průměrná zrychlení H100 / M4 Max pro LFM2.5-2.6B napříč pěti datovými sadami
  • 57 %: průměrné snížení latence volání funkcí pro LFM2.5-2.6B ve scénářích s více nástroji
  • 295,7 M–327,7 M (parametry draftového modelu, oproti cílům 1,2 B až 8 B)
  • 4,81 z 10, průměrný počet přijatých draftových tokenů na krok pro LFM2.5-2.6B při velikosti bloku 9

Kde se zaznamenaná zrychlení zužují

Vlastní tabulky Liquid AI ukazují, že zisky jsou nerovnoměrné, a společnost uvádí důvody. Pro LFM2.5-8B-A1B se průměrné zlepšení na zařízení pohybuje jen na 1,18× navzdory nejvyšším mírám přijetí ze tří modelů; mezeru společnost připisuje současné implementaci mixture‑of‑experts v Metal backendu llama.cpp a dodatečnému provozu vah, který aktivuje ověřování bloku tokenů napříč experty. Pro LFM2.5-1.2B-Instruct se míry přijetí natolik liší podle datové sady, že zrychlení kolísá až o 52 % v závislosti na rozložení textu, od 1,66× na MT‑Bench až po 2,56× na MATH500 na H100.

Všechny údaje jsou uváděny výrobcem z vlastního testovacího prostředí Liquid AI: SGLang na jednom H100 80 GB v BF16 pro GPU čísla, llama.cpp s experimentálními Metal jádry na M4 Max s FP16 GGUF vahami pro čísla na zařízení, omezené na 256 výstupních tokenů. Cesta SGLang vyžaduje sestavení s podporou DSpark pro cíle LFM2, a cesta llama.cpp vyžaduje odpovídající sestavení, takže zrychlení závisí na těchto integracích, nikoli na stabilním vydání některého z engineů.

On‑device posun Liquid AI zatím

Vydání DSpark je třetí aktualizací řady LFM2.5 během pouhého týdne. Dne 12. srpna 2026 společnost uvedla LFM2.5-VL-3B, vision‑language model pro okrajové zařízení, a 19. srpna 2026 publikovala kvantizačně‑vědomé destilované kontrolní body Q4_0 pro tuto řadu. Spojnicí je stejná: společnost uvádí, že zrychlení DSpark modelu 2,6B na MacBooku posouvá interaktivitu za propustnost, kterou nabízejí většina proprietárních cloudových modelů, a to přibližně 140 tokenů za sekundu.

Všechny tři draftery jsou nyní k dispozici na Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark a LFM2.5-8B-A1B-DSpark, s GGUF buildy vedle pro nasazení v llama.cpp.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.