Modele i platformy AI
Liquid AI wypuszcza LFM2.5-DSpark z przyspieszeniem inferencji do 3,2‑krotnego

Liquid AI wydało punkty kontrolne draftu z dekodowaniem spekulacyjnym dla trzech modeli z rodziny LFM2.5 w dniu 20 sierpnia 2026 r., podając przyrost przepustowości aż do 3,18‑krotnego na pojedynczym GPU H100 i do 2,87‑krotnego na MacBooku z procesorem Apple‑silicon, bez zmian w wynikach modelu. wydanie LFM2.5-DSpark obejmuje drafty dla LFM2.5-1.2B-Instruct, LFM2.5-2.6B oraz modelu mieszanki ekspertów LFM2.5-8B-A1B, każdy dodający około 300 milionów parametrów dodatkowego draftu do modelu docelowego.
Punkty kontrolne są dostarczane w formatach Safetensors i GGUF z natychmiastowym wsparciem w llama.cpp i SGLang, przy czym obie integracje zostały wniesione upstream do oficjalnych baz kodu. Ponieważ dekodowanie spekulacyjne emituje jedynie tokeny zweryfikowane przez model docelowy, firma twierdzi, że wygenerowany tekst jest identyczny z tym, co model docelowy wyprodukowałby samodzielnie przy zachłannym dekodowaniu, więc dokładność benchmarków pozostaje niezmieniona.
Pomiary Liquid AI, przeprowadzone przy rozmiarze wsadu 1 i temperaturze 0 na pięciu zestawach danych, wykazały średnie przyspieszenie dla LFM2.5-2.6B na poziomie 2,67‑krotnego na H100 (z 323 do 864 tokenów na sekundę) oraz 2,27‑krotnego na MacBooku Pro M4 Max (z 61 do 139 tokenów na sekundę). Największy pojedynczy wynik uzyskano dla LFM2.5-8B-A1B w teście MATH500, gdzie przepustowość na H100 wzrosła 3,18‑krotnie, z 428 do 1 362 tokenów na sekundę. Firma informuje również, że DSpark skrócił opóźnienie wywołań funkcji o średnio 57 % dla LFM2.5-2.6B w scenariuszach wielonarzędziowych, co jest kluczowym wynikiem dla obciążeń agentowych działających na urządzeniu, do których skierowana jest linia LFM2.5.
Jak DSpark przyspiesza dekodowanie
Faza dekodowania w inferencji LLM jest ograniczona pamięcią: większość opóźnienia wynika z przesyłania wag z pamięci DRAM do pamięci na chipie, a nie z samego obliczenia, co tłumaczy, dlaczego ekonomia inferencji stała się centralnym problemem inżynieryjnym w tej dziedzinie. Dekodowanie spekulacyjne rozwiązuje to, wykorzystując mały model draftu, który proponuje blok kandydatów tokenów, a następnie weryfikuje cały blok w jednym przejściu w przód modelu docelowego, rozkładając koszt ładowania wag na każdy sprawdzany token.
DSpark, przedstawiony w artykule z lipca 2026 autorstwa badaczy DeepSeek i wdrożony w systemie serwisowym DeepSeek-V4 tej firmy, łączy trzy elementy: równoległe „backbone”, które w jednym przebiegu generuje ukryte stany dla wszystkich tokenów draftu, lekki sekwencyjny „head”, modelujący zależności między sąsiednimi tokenami, aby utrzymać wysokie wskaźniki akceptacji w późniejszych częściach bloku, oraz weryfikator planowany wg pewności, który odrzuca przyrostki o niskiej pewności, gdy ich weryfikacja kosztowałaby więcej niż przyniosła oszczędności. W produkcyjnym wdrożeniu DeepSeek, artykuł podaje przyspieszenia generacji na użytkownika w zakresie od 60 % do 85 % w porównaniu z poprzednią bazą MTP‑1 przy zachowanej przepustowości.
Drafty Liquid AI podążają za tym schematem, stosując uproszczoną architekturę opartą wyłącznie na uwadze: pięć warstw, rozmiar bloku wynoszący dziewięć tokenów draftu na krok oraz głowę Markowa obsługującą słownik liczący 128 000 tokenów, zgodnie z kartą modelu LFM2.5-2.6B-DSpark. Każdy draft został wytrenowany przez 15 epok na mieszance danych ze sterowanym dopasowaniem, czatu, kodu i wywołań funkcji, a wybrano punkt kontrolny o najwyższym wskaźniku akceptacji, a nie najniższej stracie. Gwarancja dokładności spełnia zadanie jakościowe: „Dekodowanie spekulacyjne jest dokładne: cel weryfikuje każdy proponowany token, więc zachłanne wyjście jest równe samemu celowi”, stwierdza karta modelu GGUF, wraz z pomiarami czasów odpowiedzi ukazującymi, ile tokenów draftu zostało zaproponowanych i zaakceptowanych.
LFM2.5-DSpark w liczbach
- 3,18x — najwyższe zgłoszone przyspieszenie GPU (LFM2.5-8B-A1B, MATH500, H100: 428 → 1 362 tok/s)
- 2,87x — najwyższe zgłoszone przyspieszenie na urządzeniu (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
- 2,67x / 2,27x — średnie przyspieszenia H100 / M4 Max dla LFM2.5-2.6B w pięciu zestawach danych
- 57%: średnie skrócenie opóźnienia wywołań funkcji dla LFM2.5-2.6B w scenariuszach wielonarzędziowych
- 295,7M–327,7M (parametry modelu draftu, w porównaniu z docelowymi od 1,2 mld do 8 mld)
- 4,81 z 10, średnia liczba zaakceptowanych tokenów draftu na krok dla LFM2.5-2.6B przy rozmiarze bloku 9
Gdzie zgłoszone przyspieszenia maleją
Własne tabele Liquid AI pokazują, że zyski są nierówne, a firma podaje przyczyny. Dla LFM2.5-8B-A1B poprawa na urządzeniu wynosi średnio tylko 1,18‑krotnego, mimo najwyższych wskaźników akceptacji spośród trzech modeli; luka ta jest, według firmy, spowodowana aktualną implementacją mixture-of-exets w backendzie Metal w llama.cpp oraz dodatkowym ruchem wag, który weryfikacja bloku tokenów wywołuje wśród ekspertów. Dla LFM2.5-1.2B-Instruct wskaźniki akceptacji różnią się wystarczająco w zależności od zestawu danych, że przyspieszenie waha się aż o 52 % w zależności od rozkładu tekstu, od 1,66‑krotnego na MT‑Bench do 2,56‑krotnego na MATH500 na H100.
Wszystkie liczby pochodzą od dostawcy, pochodząc z własnego środowiska Liquid AI: SGLang na jednym H100 80 GB w trybie BF16 dla wyników GPU, llama.cpp z eksperymentalnymi kernelami Metal na M4 Max z wagami GGUF w FP16 dla wyników na urządzeniu, ograniczone do 256 tokenów wyjściowych. Ścieżka SGLang wymaga kompilacji z obsługą DSpark dla celów LFM2, a ścieżka llama.cpp wymaga odpowiedniej kompilacji, więc przyspieszenia zależą od tych integracji, a nie od dostępności w stabilnym wydaniu któregoś z silników.
Dotychczasowe działania Liquid AI na urządzeniach
Wydanie DSpark jest trzecim aktualizacją rodziny LFM2.5 w nieco ponad tydzień. 12 sierpnia 2026 r. firma wydała LFM2.5-VL-3B, model wizji‑języka na krawędź, a 19 sierpnia 2026 r. opublikowała punkty kontrolne Q4_0 po destylacji z uwzględnieniem kwantyzacji dla rodziny. Wątek przewodni pozostaje ten sam: firma twierdzi, że przyspieszenie DSpark modelu 2,6B na MacBooku podnosi interaktywność ponad przepustowość oferowaną przez większość zamkniętych modeli chmurowych, którą szacuje na około 140 tokenów na sekundę.
Wszystkie trzy drafty są już dostępne na Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark oraz LFM2.5-8B-A1B-DSpark, z wersjami GGUF obok dla wdrożeń w llama.cpp.












