Modelos e plataformas de IA
Liquid AI lança LFM2.5-DSpark com até 3,2 vezes mais rapidez na inferência

Liquid AI lançou checkpoints de rascunho de decodificação especulativa para três modelos de sua família LFM2.5 em 20 de agosto de 2026, reportando ganhos de taxa de transferência de até 3,18x em uma única GPU H100 e até 2,87x em um MacBook com Apple Silicon, sem alteração nas saídas do modelo. O lançamento LFM2.5-DSpark inclui rascunhadores para LFM2.5-1.2B-Instruct, LFM2.5-2.6B e o modelo mixture-of-experts LFM2.5-8B-A1B, cada um adicionando aproximadamente 300 milhões de parâmetros de sobrecarga de rascunho ao modelo-alvo.
Os checkpoints são disponibilizados nos formatos Safetensors e GGUF com suporte imediato em llama.cpp e SGLang, ambas as integrações contribuídas upstream para os repositórios oficiais. Como a decodificação especulativa só emite tokens que o modelo-alvo verificou, a empresa afirma que o texto gerado é idêntico ao que o modelo-alvo produziria sozinho sob decodificação gananciosa, portanto a precisão dos benchmarks permanece inalterada.
As medições da Liquid AI, realizadas com batch size 1 e temperatura 0 em cinco conjuntos de dados, mostraram que o ganho médio de velocidade para LFM2.5-2.6B foi de 2,67x em uma H100 (de 323 para 864 tokens por segundo) e 2,27x em um MacBook Pro M4 Max (de 61 para 139 tokens por segundo). O maior resultado individual veio de LFM2.5-8B-A1B no MATH500, onde a taxa de transferência na H100 aumentou 3,18x, de 428 para 1.362 tokens por segundo. A empresa também relata que o DSpark reduziu a latência de chamadas de função em 57 % em média para LFM2.5-2.6B em cenários multi‑ferramenta, o resultado principal para as cargas de trabalho agenticas on‑device que a linha LFM2.5 visa.
Como o DSpark acelera a decodificação
A fase de decodificação da inferência de LLM é limitada pela memória: a maior parte da latência provém da transmissão de pesos da DRAM para a memória on‑chip, e não da computação em si, o que explica por que a economia da inferência se tornou o principal problema de engenharia do campo. A decodificação especulativa aborda isso fazendo com que um pequeno modelo de rascunho proponha um bloco de tokens candidatos e, em seguida, verifique todo o bloco em uma única passagem forward do modelo-alvo, distribuindo o custo de carregamento dos pesos entre todos os tokens verificados.
O DSpark, apresentado em um artigo de julho de 2026 por pesquisadores da DeepSeek e implantado no sistema de serviço DeepSeek-V4 da empresa, combina três componentes: um backbone paralelo que gera estados ocultos para todos os tokens de rascunho em uma única passagem, uma cabeça sequencial leve que modela dependências entre tokens vizinhos para impedir que as taxas de aceitação decaíam no final do bloco, e um verificador programado por confiança que elimina sufixos de baixa confiança quando verificá‑los custaria mais do que economiza. Na implantação de produção da DeepSeek, o artigo relata ganhos de geração por usuário de 60 a 85 % em relação à linha de base MTP‑1 anterior, mantendo a mesma taxa de transferência.
Os rascunhadores da Liquid AI seguem essa fórmula com um design simplificado apenas de atenção: cinco camadas, tamanho de bloco de nove tokens de rascunho por passo e uma cabeça de Markov sobre um vocabulário de 128 000 tokens, conforme o cartão de modelo LFM2.5-2.6B-DSpark. Cada rascunhador foi treinado por 15 épocas em uma mistura de fine‑tuning supervisionado, chat, código e dados de chamadas de função, com o checkpoint escolhido pela maior taxa de aceitação em vez da menor perda. A garantia de exatidão cumpre o trabalho de qualidade: “A decodificação especulativa é exata: o alvo verifica cada token proposto, portanto a saída gananciosa equivale ao alvo sozinho”, afirma o cartão de modelo GGUF, com tempos por resposta que revelam quantos tokens de rascunho foram propostos e aceitos.
LFM2.5-DSpark pelos Números
- 3.18x — melhor aceleração de GPU relatada (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 tok/s)
- 2.87x — melhor aceleração on‑device relatada (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
- 2.67x / 2.27x — acelerações médias H100 / M4 Max para LFM2.5-2.6B em cinco conjuntos de dados
- 57%: redução média da latência de chamadas de função para LFM2.5-2.6B em cenários multi‑ferramenta
- 295.7M–327.7M (parâmetros do modelo de rascunho, em comparação com alvos de 1,2B a 8B)
- 4.81 de 10, média de tokens de rascunho aceitos por passo para LFM2.5-2.6B com tamanho de bloco 9
Onde os Aceleramentos Relatados Diminuem
As próprias tabelas da Liquid AI mostram que os ganhos são irregulares, e a empresa explica os motivos. Para LFM2.5-8B-A1B, a melhoria on‑device tem média de apenas 1,18x apesar das maiores taxas de aceitação dos três modelos, uma lacuna que a empresa atribui à atual implementação mixture‑of‑experts no backend Metal do llama.cpp e ao tráfego extra de pesos que a verificação de um bloco de tokens gera entre os especialistas. Para LFM2.5-1.2B-Instruct, as taxas de aceitação variam tanto por conjunto de dados que o aceleração oscila em até 52 % dependendo da distribuição de texto, de 1,66x no MT‑Bench até 2,56x no MATH500 na H100.
Todos os valores são reportados pelo fornecedor a partir do próprio harness da Liquid AI: SGLang em uma H100 de 80 GB em BF16 para os números de GPU, llama.cpp com kernels Metal experimentais em um M4 Max com pesos GGUF FP16 para os números on‑device, limitados a 256 tokens de saída. O caminho SGLang requer uma compilação com suporte DSpark para alvos LFM2, e o caminho llama.cpp requer a compilação correspondente, portanto os ganhos dependem dessas integrações e não de um lançamento estável de nenhum dos motores.
O Empenho On‑Device da Liquid AI Até Agora
O lançamento do DSpark é a terceira atualização da família LFM2.5 em pouco mais de uma semana. Em 12 de agosto de 2026, a empresa lançou o LFM2.5-VL-3B, um modelo visão‑linguagem para edge, e em 19 de agosto de 2026 publicou checkpoints destilados com quantização consciente Q4_0 para a família. O fio condutor é o mesmo: a empresa afirma que o ganho de DSpark do modelo 2.6B em um MacBook eleva a interatividade além da taxa de transferência oferecida pela maioria dos modelos proprietários em nuvem, que ela estima em cerca de 140 tokens por segundo.
Todos os três rascunhadores já estão disponíveis no Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark e LFM2.5-8B-A1B-DSpark, com builds GGUF ao lado para implantações com llama.cpp.












