Моделі та платформи ШІ
Liquid AI випускає LFM2.5-DSpark з прискоренням інференції до 3,2‑х разу

Liquid AI випустила контрольні точки чернеток спекулятивного декодування для трьох моделей сімейства LFM2.5 20 серпня 2026 року, повідомивши про збільшення пропускної здатності до 3,18× на одному GPU H100 і до 2,87× на ноутбуці Apple‑silicon, без зміни вихідних даних моделі. Випуск LFM2.5-DSpark охоплює чернетки для LFM2.5-1.2B-Instruct, LFM2.5-2.6B та mixture‑of‑experts LFM2.5-8B-A1B, кожна з яких додає приблизно 300 мільйонів параметрів чернетки до цільової моделі.
Контрольні точки постачаються у форматах Safetensors і GGUF з підтримкою «день‑перший» в llama.cpp і SGLang, обидві інтеграції внесені в офіційні кодові бази. Оскільки спекулятивне декодування генерує лише ті токени, які підтверджені цільовою моделлю, компанія стверджує, що згенерований текст ідентичний тому, який би отримала цільова модель при жадібному декодуванні, тому точність бенчмарків не змінилася.
Вимірювання Liquid AI, проведені з розміром пакету 1 і температурою 0 на п’яти наборах даних, показали середнє прискорення для LFM2.5-2.6B у 2,67× на H100 (з 323 до 864 токенів за секунду) і 2,27× на MacBook Pro M4 Max (з 61 до 139 токенів за секунду). Найбільший окремий результат отримано для LFM2.5-8B-A1B на наборі MATH500, де пропускна здатність на H100 зросла до 3,18×, з 428 до 1 362 токенів за секунду. Компанія також повідомляє, що DSpark скоротив затримку виклику функцій у середньому на 57 % для LFM2.5-2.6B у багатозадачних сценаріях, що є головним результатом для агентних навантажень на пристрої, на які орієнтовано лінійку LFM2.5.
How DSpark Speeds Up Decoding
Фаза декодування під час інференції LLM обмежена пам’яттю: більша частина затримки виникає через потокове завантаження ваг з DRAM у пам’ять на чипі, а не через самі обчислення, саме тому економіка інференції стала центральною інженерною проблемою галузі. Спекулятивне декодування вирішує це, дозволяючи невеликій чернетковій моделі запропонувати блок кандидатських токенів, а потім перевіряючи весь блок одним прямим проходом цільової моделі, розподіляючи вартість завантаження ваг між усіма перевіреними токенами.
DSpark, представлений у статті липня 2026 року дослідників DeepSeek і впроваджений у їхній системі обслуговування DeepSeek-V4, об’єднує три компоненти: паралельний «спинний мозок», що генерує приховані стани для всіх чернеткових токенів за один прохід, легковаговий послідовний «головний» модуль, що моделює залежності між сусідніми токенами, щоб запобігти падінню рівня прийняття у кінці блоку, та верифікатор із плануванням довіри, який обрізає суфікси низької довіри, коли їх перевірка коштує більше, ніж економить. У виробничому розгортанні DeepSeek у статті зазначено, що швидкість генерації на користувача зросла на 60‑85 % порівняно з попередньою базовою моделлю MTP‑1 при однаковій пропускній здатності.
Чернеткові моделі Liquid AI слідують цьому рецепту, використовуючи спрощений дизайн лише з увагою: п’ять шарів, розмір блоку у дев’ять чернеткових токенів за крок, і Марковську «голову» над словником у 128 000 токенів, згідно з модельною картою LFM2.5-2.6B-DSpark. Кожна чернетка була навчена протягом 15 епох на суміші контрольованого донастройки, чат‑даних, коду та даних виклику функцій, причому контрольна точка обиралася за найвищим рівнем прийняття, а не за найнижчою втратою. Гарантія точності виконує роботу щодо якості: «Спекулятивне декодування є точним: цільова модель перевіряє кожен запропонований токен, тому жадібний вихід дорівнює виходу лише цільової моделі», зазначає модельна карта GGUF, з показниками часу відповіді, що розкривають, скільки чернеткових токенів було запропоновано та прийнято.
LFM2.5-DSpark by the Numbers
- 3.18x — найкраще задокументоване прискорення на GPU (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 ток/с)
- 2.87x — найкраще задокументоване прискорення на пристрої (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 ток/с)
- 2.67x / 2.27x — середнє прискорення H100 / M4 Max для LFM2.5-2.6B за п’ятьма наборами даних
- 57%: середнє скорочення затримки виклику функцій для LFM2.5-2.6B у багатозадачних сценаріях
- 295.7M–327.7M (параметри чернеткової моделі, проти цільових 1.2B‑8B)
- 4.81 of 10, середня кількість прийнятих чернеткових токенів за крок для LFM2.5-2.6B при розмірі блоку 9
Where the Reported Speedups Narrow
Власні таблиці Liquid AI показують, що приріст не є рівномірним, і компанія пояснює причини. Для LFM2.5-8B-A1B покращення на пристрої в середньому становить лише 1.18×, незважаючи на найвищі рівні прийняття серед трьох моделей; розрив компанія пояснює поточною реалізацією mixture‑of‑exets у Metal‑бекенді llama.cpp та додатковим трафіком ваг, який активується під час перевірки блоку токенів між експертами. Для LFM2.5-1.2B-Instruct рівні прийняття варіюються досить сильно за набором даних, тому прискорення коливається до 52 % залежно від розподілу тексту, від 1.66× на MT‑Bench до 2.56× на MATH500 на H100.
Усі цифри подані постачальником у власному тестуванні: SGLang на одному H100 80 GB у BF16 для показників GPU, llama.cpp з експериментальними Metal‑ядрами на M4 Max з FP16‑вагами GGUF для показників на пристрої, обмежено 256 вихідними токенами. Шлях SGLang вимагає збірки з підтримкою DSpark для цілей LFM2, а шлях llama.cpp потребує відповідної збірки, тому прискорення залежать від цих інтеграцій, а не від постачання у стабільному випуску будь‑якого з рушіїв.
Liquid AI’s On-Device Push So Far
Випуск DSpark є третім оновленням сімейства LFM2.5 за тиждень. 12 серпня 2026 року компанія випустила LFM2.5-VL-3B, модель візуально‑мовного AI для edge‑пристроїв, а 19 серпня 2026 року опублікувала квантовано‑усвідомлені дистильовані контрольні точки Q4_0 для сімейства. Спільна лінія залишається тією ж: компанія зазначає, що прискорення DSpark для моделі 2.6B на MacBook підвищує інтерактивність вище, ніж пропускна здатність більшості пропрієтарних хмарних моделей, яку вона оцінює приблизно у 140 токенів за секунду.
Усі три чернетки вже доступні на Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark і LFM2.5-8B-A1B-DSpark, з GGUF‑збірками поряд для розгортання в llama.cpp.












