Modele și platforme AI
Liquid AI lansează LFM2.5-DSpark pentru inferență de până la 3,2X mai rapidă

Liquid AI a lansat puncte de control de tip draft pentru decodare speculativă pentru trei modele din familia LFM2.5 pe 20 august 2026, raportând creșteri ale debitului de până la 3.18x pe o singură placă grafică H100 și până la 2.87x pe un MacBook cu Apple‑silicon, fără modificări ale ieșirilor modelului. The LFM2.5-DSpark release acoperă draftere pentru LFM2.5-1.2B-Instruct, LFM2.5-2.6B și modelul mixture‑of‑experts LFM2.5-8B-A1B, fiecare adăugând aproximativ 300 de milioane de parametri de suprasarcină draft peste modelul țintă.
Punctele de control sunt furnizate în formatele Safetensors și GGUF, cu suport din prima zi în llama.cpp și SGLang, ambele integrări fiind aduse în sus în bazele de cod oficiale. Deoarece decodarea speculativă emite doar tokenii verificați de modelul țintă, compania afirmă că textul generat este identic cu cel pe care modelul țintă l-ar produce singur în decodare avaricioasă, astfel că acuratețea benchmark‑ului rămâne neschimbată.
Măsurătorile Liquid AI, efectuate cu dimensiunea lotului 1 și temperatura 0 pe cinci seturi de date, arată că viteza medie pentru LFM2.5-2.6B este de 2.67x pe un H100 (de la 323 la 864 de tokeni pe secundă) și de 2.27x pe un MacBook Pro M4 Max (de la 61 la 139 de tokeni pe secundă). Cel mai mare rezultat unic a venit de la LFM2.5-8B-A1B pe MATH500, unde debitul pe H100 a crescut cu 3.18x, de la 428 la 1.362 de tokeni pe secundă. Compania raportează, de asemenea, că DSpark a redus latența apelurilor de funcție cu 57 % în medie pentru LFM2.5-2.6B în scenarii multi‑instrument, rezultatul principal pentru sarcinile agentice pe dispozitiv pentru care este concepută familia LFM2.5.
Cum DSpark accelerează decodarea
Faza de decodare a inferenței LLM este limitată de memorie: majoritatea latenței provine din fluxul de greutăți de la DRAM către memoria de pe cip, nu din calcul în sine, motiv pentru care economia inferenței a devenit problema centrală de inginerie a domeniului. Decodarea speculativă abordează această problemă prin utilizarea unui model de tip draft mic care propune un bloc de tokeni candidați, apoi verifică întregul bloc într-un singur pas înainte al modelului țintă, distribuind costul încărcării greutăților la fiecare token verificat.
DSpark, introdus într-un articol din iulie 2026 de cercetătorii DeepSeek și implementat în sistemul de servire DeepSeek‑V4 al acelei companii, combină trei componente: un schelet paralel care generează stări ascunse pentru toți tokenii draft într-un singur pas, o cap de secvență ușoară care modelează dependențele dintre tokenii vecini pentru a menține ratele de acceptare fără a scădea spre sfârșitul blocului, și un verificator programat pe încredere care elimină sufixele cu încredere scăzută atunci când verificarea lor ar costa mai mult decât ar economisi. În implementarea de producție a DeepSeek, articolul raportează accelerări ale generării pe utilizator de la 60 la 85 % față de linia de bază MTP‑1 la debit egal.
Drafterele Liquid AI urmează această rețetă cu un design simplificat doar pe atenție: cinci straturi, o dimensiune de bloc de nouă tokeni draft per pas și o cap de tip Markov peste un vocabular de 128.000 de tokeni, conform LFM2.5-2.6B-DSpark model card. Fiecare draft a fost antrenat timp de 15 epoci pe un amestec de fine‑tuning supravegheat, chat, cod și date de apelare a funcțiilor, cu punctul de control selectat în funcție de cea mai mare rată de acceptare, nu de cea mai mică pierdere. Garanția de exactitate asigură calitatea: “Speculative decoding is exact: the target verifies every proposed token, so greedy output equals the target alone,” the GGUF model card states, with per-response timings exposing how many draft tokens were proposed and accepted.
LFM2.5-DSpark în cifre
- 3.18x — cea mai bună accelerare GPU raportată (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 tok/s)
- 2.87x — cea mai bună accelerare pe dispozitiv raportată (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
- 2.67x / 2.27x — accelerări medii H100 / M4 Max pentru LFM2.5-2.6B pe cinci seturi de date
- 57%: reducere medie a latenței apelurilor de funcție pentru LFM2.5-2.6B în scenarii multi‑instrument
- 295.7M–327.7M (parametri ai modelului draft, în raport cu țintele de la 1,2B la 8B)
- 4.81 din 10, tokeni draft acceptați în medie per pas pentru LFM2.5-2.6B la dimensiunea de bloc 9
Unde accelerările raportate se reduc
Tabelele proprii ale Liquid AI arată că câștigurile sunt inegale, iar compania explică motivele. Pentru LFM2.5-8B-A1B, îmbunătățirea pe dispozitiv medie este de doar 1.18x, în ciuda celor mai mari rate de acceptare dintre cele trei modele, o diferență pe care compania o atribuie implementării actuale mixture‑of‑exets în backend‑ul Metal al llama.cpp și traficului suplimentar de greutăți pe care verificarea unui bloc de tokeni îl activează între experți. Pentru LFM2.5-1.2B-Instruct, ratele de acceptare variază suficient pe seturi de date încât accelerarea oscilează cu până la 52 % în funcție de distribuția textului, de la 1.66x pe MT‑Bench până la 2.56x pe MATH500 pe H100.
Toate cifrele sunt raportate de furnizor din propriul set de testare al Liquid AI: SGLang pe un H100 de 80 GB în BF16 pentru valorile GPU, llama.cpp cu nuclee Metal experimentale pe un M4 Max cu greutăți GGUF FP16 pentru valorile pe dispozitiv, limitate la 256 de tokeni de ieșire. Traseul SGLang necesită o compilare cu suport DSpark pentru țintele LFM2, iar traseul llama.cpp necesită compilarea corespunzătoare, astfel că accelerările depind de aceste integrări, nu de o versiune stabilă a vreunui motor.
Efortul pe dispozitiv al Liquid AI până acum
Lansarea DSpark este a treia actualizare a familiei LFM2.5 în puțin peste o săptămână. Pe 12 august 2026, compania a lansat LFM2.5-VL-3B, un model vizual‑lingvistic pentru edge, iar pe 19 august 2026 a publicat puncte de control distilate, conștiente de cuantizare Q4_0 pentru familie. Ideea comună este aceeași: compania afirmă că accelerarea DSpark a modelului de 2,6B pe un MacBook extinde interactivitatea dincolo de debitul oferit de majoritatea modelelor cloud proprietare, pe care le situează la aproximativ 140 de tokeni pe secundă.
Toți cei trei draftere sunt disponibili acum pe Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark și LFM2.5-8B-A1B-DSpark, cu construcții GGUF alături pentru implementări llama.cpp.












