Modelos y plataformas de IA
Liquid AI lanza LFM2.5-DSpark con una inferencia hasta 3.2X más rápida

Liquid AI lanzó checkpoints de borrador de decodificación especulativa para tres modelos de su familia LFM2.5 el 20 de agosto de 2026, reportando aumentos de rendimiento de hasta 3.18x en una sola GPU H100 y hasta 2.87x en una MacBook con Apple‑silicon, sin cambiar las salidas del modelo. El lanzamiento LFM2.5-DSpark incluye borradores para LFM2.5-1.2B-Instruct, LFM2.5-2.6B y el modelo de mezcla de expertos LFM2.5-8B-A1B, cada uno añadiendo aproximadamente 300 millones de parámetros de sobrecarga de borrador sobre el modelo objetivo.
Los checkpoints se entregan en formatos Safetensors y GGUF con soporte desde el primer día en llama.cpp y SGLang, ambas integraciones aportadas upstream a los repositorios oficiales. Dado que la decodificación especulativa solo emite tokens que el modelo objetivo ha verificado, la empresa afirma que el texto generado es idéntico al que produciría el objetivo por sí solo bajo decodificación codiciosa, por lo que la precisión de los benchmarks no cambia.
Las mediciones de Liquid AI, realizadas con tamaño de lote 1 y temperatura 0 en cinco conjuntos de datos, sitúan la aceleración media para LFM2.5-2.6B en 2.67x en una H100 (de 323 a 864 tokens por segundo) y 2.27x en una MacBook Pro M4 Max (de 61 a 139 tokens por segundo). El mayor resultado individual provino de LFM2.5-8B-A1B en MATH500, donde el rendimiento en la H100 aumentó 3.18x, de 428 a 1,362 tokens por segundo. La empresa también informa que DSpark redujo la latencia de llamadas a funciones en un 57 % en promedio para LFM2.5-2.6B en escenarios de múltiples herramientas, el resultado destacado para las cargas de trabajo agente en el dispositivo a las que apunta la línea LFM2.5.
Cómo DSpark acelera la decodificación
La fase de decodificación de la inferencia de LLM está limitada por la memoria: la mayor parte de la latencia proviene de transmitir los pesos desde la DRAM a la memoria del chip en lugar de del cómputo en sí, por lo que la economía de la inferencia se ha convertido en el problema central de ingeniería del campo. La decodificación especulativa aborda esto haciendo que un pequeño modelo de borrador proponga un bloque de tokens candidatos, y luego verificando todo el bloque en una única pasada del modelo objetivo, distribuyendo el costo de cargar los pesos entre cada token comprobado.
DSpark, presentado en un artículo de julio de 2026 por investigadores de DeepSeek y desplegado en el sistema de servicio DeepSeek-V4 de esa compañía, combina tres componentes: una columna vertebral paralela que genera estados ocultos para todos los tokens de borrador en una sola pasada, una cabeza secuencial ligera que modela dependencias entre tokens vecinos para evitar que las tasas de aceptación decaigan al final del bloque, y un verificador programado por confianza que poda sufijos de baja confianza cuando verificarlos costaría más de lo que ahorra. En el despliegue de producción de DeepSeek, el artículo reporta aceleraciones de generación por usuario de entre 60 % y 85 % respecto a la línea base MTP-1 a rendimiento equivalente.
Los borradores de Liquid AI siguen esa receta con un diseño simplificado solo de atención: cinco capas, un tamaño de bloque de nueve tokens de borrador por paso, y una cabeza de Markov sobre un vocabulario de 128 000 tokens, según la tarjeta de modelo LFM2.5-2.6B-DSpark. Cada borrador se entrenó durante 15 épocas con una mezcla de ajuste fino supervisado, chat, código y datos de llamadas a funciones, seleccionando el checkpoint con la mayor tasa de aceptación en lugar del menor pérdida. La garantía de exactitud realiza el trabajo de calidad: “La decodificación especulativa es exacta: el objetivo verifica cada token propuesto, por lo que la salida codiciosa equivale al objetivo solo”, indica la tarjeta de modelo GGUF, con tiempos por respuesta que exponen cuántos tokens de borrador fueron propuestos y aceptados.
LFM2.5-DSpark en cifras
- 3.18x — mejor aceleración de GPU reportada (LFM2.5-8B-A1B, MATH500, H100: 428 → 1,362 tok/s)
- 2.87x — mejor aceleración en dispositivo reportada (LFM2.5-1.2B-Instruct, HumanEval, M4 Max: 136 → 389 tok/s)
- 2.67x / 2.27x — aceleraciones medias H100 / M4 Max para LFM2.5-2.6B en cinco conjuntos de datos
- 57%: reducción promedio de latencia de llamadas a funciones para LFM2.5-2.6B en escenarios multi‑herramienta
- 295.7M–327.7M (parámetros del modelo de borrador, frente a objetivos de 1.2B a 8B)
- 4.81 de 10, tokens de borrador aceptados en promedio por paso para LFM2.5-2.6B con tamaño de bloque 9
Dónde se reducen las aceleraciones reportadas
Las propias tablas de Liquid AI muestran que los beneficios son irregulares, y la empresa explica las razones. Para LFM2.5-8B-A1B, la mejora en dispositivo promedia solo 1.18x a pesar de las tasas de aceptación más altas de los tres modelos, una brecha que la compañía atribuye a la actual implementación de mezcla de expertos en el backend Metal de llama.cpp y al tráfico adicional de pesos que activa la verificación de un bloque de tokens entre los expertos. Para LFM2.5-1.2B-Instruct, las tasas de aceptación varían tanto por conjunto de datos que la aceleración oscila hasta un 52 % según la distribución del texto, de 1.66x en MT‑Bench hasta 2.56x en MATH500 en la H100.
Todas las cifras son reportadas por el proveedor a partir del propio harness de Liquid AI: SGLang en una H100 de 80 GB en BF16 para los números de GPU, llama.cpp con kernels Metal experimentales en una M4 Max con pesos GGUF FP16 para los números en dispositivo, limitados a 256 tokens de salida. La ruta SGLang requiere una compilación con soporte DSpark para objetivos LFM2, y la ruta llama.cpp requiere la compilación correspondiente, por lo que las aceleraciones dependen de esas integraciones y no de una versión estable de ninguno de los motores.
El impulso de Liquid AI en el dispositivo hasta ahora
El lanzamiento de DSpark es la tercera actualización de la familia LFM2.5 en poco más de una semana. El 12 de agosto de 2026, la compañía lanzó LFM2.5-VL-3B, un modelo visión‑lenguaje para el edge, y el 19 de agosto de 2026 publicó checkpoints destilados con cuantización consciente Q4_0 para la familia. La línea conductora es la misma: la empresa afirma que la aceleración DSpark del modelo de 2,6 B en una MacBook lleva la interactividad más allá del rendimiento que ofrecen la mayoría de los modelos propietarios en la nube, que sitúa en aproximadamente 140 tokens por segundo.
Los tres borradores están disponibles ahora en Hugging Face: LFM2.5-1.2B-Instruct-DSpark, LFM2.5-2.6B-DSpark y LFM2.5-8B-A1B-DSpark, con compilaciones GGUF paralelas para despliegues con llama.cpp.












