Модели и платформы ИИ

Liquid AI выпускает LFM2.5-DSpark с ускорением вывода до 3,2‑кратного

mm
Добавьте Unite.AI в избранные источники в Google

Liquid AI выпустила контрольные точки черновиков со спекулятивным декодированием для трёх моделей семейства LFM2.5 20 августа 2026 года, сообщив о росте пропускной способности до 3,18× на одном GPU H100 и до 2,87× на ноутбуке с процессором Apple‑silicon, без изменения выходных данных модели. выпуск LFM2.5-DSpark включает черновики для LFM2.5-1.2B-Instruct, LFM2.5-2.6B и модели‑смешения экспертов LFM2.5-8B-A1B, каждый из которых добавляет примерно 300 млн параметров черновика к целевой модели.

Контрольные точки поставляются в форматах Safetensors и GGUF с поддержкой с первого дня в llama.cpp и SGLang, обе интеграции внесены в официальные репозитории. Поскольку спекулятивный декодинг генерирует только те токены, которые подтверждены целевой моделью, компания заявляет, что сгенерированный текст идентичен тому, что целевая модель выдала бы самостоятельно при жадном декодировании, поэтому точность бенчмарков не меняется.

Измерения Liquid AI, проведённые при размере пакета 1 и температуре 0 на пяти наборах данных, показали среднее ускорение для LFM2.5-2.6B в 2,67× на H100 (с 323 до 864 токенов в секунду) и 2,27× на MacBook Pro M4 Max (с 61 до 139 токенов в секунду). Наибольший отдельный результат был получен для LFM2.5-8B-A1B на наборе MATH500, где пропускная способность на H100 выросла до 3,18×, с 428 до 1 362 токенов в секунду. Компания также сообщает, что DSpark сократил задержку вызова функций в среднем на 57 % для LFM2.5-2.6B в сценариях с несколькими инструментами — главный результат для агентных нагрузок на устройстве, для которых предназначена линейка LFM2.5.

Как DSpark ускоряет декодирование

Фаза декодирования при выводе LLM ограничена памятью: большая часть задержки обусловлена передачей весов из DRAM в память чипа, а не вычислениями, поэтому экономика вывода стала центральной инженерной проблемой отрасли.

DSpark, представленный в статье июля 2026 года исследователями DeepSeek и внедрённый в их системе обслуживания DeepSeek‑V4, сочетает три компонента: параллельный основной модуль, генерирующий скрытые состояния для всех черновых токенов за один проход; лёгкую последовательную головку, моделирующую зависимости между соседними токенами, чтобы поддерживать высокий коэффициент принятия токенов в конце блока; и проверяющий модуль с планированием уверенности, отбрасывающий суффиксы с низкой уверенностью, когда их проверка обходится дороже, чем экономия. В производственной среде DeepSeek статья сообщает ускорение генерации на 60–85 % на пользователя по сравнению с предыдущей базой MTP‑1 при одинаковой пропускной способности.

Черновики Liquid AI следуют этой схеме с упрощённым дизайном, основанным только на внимании: пять слоёв, размер блока — девять черновых токенов за шаг, и Марковская головка над словарём из 128 000 токенов, согласно карточке модели LFM2.5-2.6B-DSpark. Каждый черновик обучался 15 эпох на смеси данных с контролируемой доработкой, чатами, кодом и вызовами функций, при этом контрольная точка выбиралась по наивысшему коэффициенту принятия, а не по наименьшей потере. Гарантия точности обеспечивает качество: «Спекулятивный декодинг точен: целевая модель проверяет каждый предложенный токен, поэтому жадный вывод равен выводу только целевой модели», говорится в карточке модели GGUF, с указанием времени отклика, показывающим, сколько черновых токенов было предложено и принято.

LFM2.5-DSpark в цифрах

  • 3.18x — лучший зафиксированный прирост скорости на GPU (LFM2.5-8B-A1B, MATH500, H100: 428 → 1 362 ток/с)
  • 2.87x — лучший зафиксированный прирост скорости на устройстве (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 ток/с)
  • 2.67x / 2.27x — средний прирост скорости на H100 / M4 Max для LFM2.5-2.6B по пяти наборам данных
  • 57%: среднее сокращение задержки вызова функций для LFM2.5-2.6B в сценариях с несколькими инструментами
  • 295.7M–327.7M (параметры черновой модели, против целевых от 1,2 млрд до 8 млрд)
  • 4.81 из 10, среднее количество принятых черновых токенов за шаг для LFM2.5-2.6B при размере блока 9

Где заявленные ускорения сужаются

Собственные таблицы Liquid AI показывают, что приросты неравномерны, и компания объясняет причины. Для LFM2.5-8B-A1B улучшение на устройстве в среднем составляет лишь 1,18×, несмотря на наивысший коэффициент принятия среди трёх моделей; компания связывает этот разрыв с текущей реализацией mixture-of-experts в бекенде Metal библиотеки llama.cpp и с дополнительным трафиком весов, который активируется при проверке блока токенов через экспертов. Для LFM2.5-1.2B-Instruct коэффициент принятия варьируется по наборам данных настолько, что ускорение колеблется до 52 % в зависимости от распределения текста, от 1,66× на MT‑Bench до 2,56× на MATH500 на H100.

Все цифры предоставлены поставщиком из собственного тестового стенда Liquid AI: SGLang на одном H100 80 ГБ в формате BF16 для GPU‑показателей, llama.cpp с экспериментальными ядрами Metal на M4 Max с весами GGUF в FP16 для показателей на устройстве, ограниченными 256 токенами вывода. Путь SGLang требует сборки с поддержкой DSpark для целей LFM2, а путь llama.cpp требует соответствующей сборки, поэтому ускорения зависят от этих интеграций, а не от поставки в стабильном релизе любого из движков.

Текущий прогресс Liquid AI в области вычислений на устройстве

Выпуск DSpark стал третьим обновлением семейства LFM2.5 за чуть более недели. 12 августа 2026 года компания выпустила LFM2.5-VL-3B, модель визуально‑языкового взаимодействия для периферийных устройств, а 19 августа 2026 года опубликовала квантизационно‑осознанные дистиллированные контрольные точки Q4_0 для этой семьи. Основная идея остаётся прежней: компания заявляет, что ускорение DSpark модели 2,6 B на MacBook повышает интерактивность выше пропускной способности большинства проприетарных облачных моделей, которую они оценивают примерно в 140 токенов в секунду.

Все три черновика уже доступны на Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark и LFM2.5-8B-A1B-DSpark, при этом рядом предоставляются сборки GGUF для развертываний с llama.cpp.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.