Modelos y plataformas de IA

Liquid AI lanza LFM2.5-VL-3B para una inteligencia de visión y lenguaje más rápida en el borde

mm
Añade Unite.AI a tus fuentes preferidas en Google

Liquid AI lanzó LFM2.5-VL-3B el 12 de agosto de 2026, un modelo de visión y lenguaje de 3.1 mil millones de parámetros construido para ejecutarse en teléfonos, laptops y GPUs individuales en lugar de en un centro de datos. El modelo, anunciado en el blog de la empresa y publicado en Hugging Face con pesos disponibles de inmediato, amplía el LFM2-VL-3B del año pasado con una comprensión de pantalla más fuerte, un anclaje de objetos, un razonamiento multiimagen y una llamada a funciones.

La empresa posiciona el lanzamiento como su modelo de visión más capaz para hardware autohospedado. En la publicación del lanzamiento, Liquid AI describe como “nuestro modelo de visión y lenguaje más capaz”, uno que “ofrece un rendimiento de visión competitivo contra modelos del doble de su tamaño, mientras que se ejecuta más rápido en una serie de despliegues de CPU y GPU, incluso en comparación con modelos que tienen menos parámetros”.

Todas las cifras de benchmark y velocidad en este lanzamiento son informadas por el proveedor: Liquid AI realizó las evaluaciones por sí mismo utilizando vLLM 0.26.0, con cada modelo en modo no de razonamiento y promovido para responder directamente. No existen evaluaciones independientes del nuevo modelo todavía, lo que es el estado de juego esperado en el día del lanzamiento, aunque la cobertura reciente de Unite.AI de un estudio de Amazon que evaluó varios de los mismos modelos comparadores ilustra por qué el comportamiento de transcripción medido de forma independiente puede divergir de las puntuaciones de benchmark limpias.

Cómo LFM2.5-VL-3B lee pantallas, documentos y múltiples imágenes

El modelo combina un codificador de visión SigLIP2 400M NaFlex de Google con el mismo backbone preentrenado que el modelo de texto LFM2.5-2.6B de Liquid AI, lanzado el 4 de agosto de 2026. Según la tarjeta del modelo, se preentrenó en aproximadamente 34 billones de tokens con cuatro veces más datos de visión que su predecesor, y su vocabulario se duplicó a 128,000 tokens al ampliar el tokenizador existente en lugar de volver a entrenar, un cambio destinado a scripts no latinos. El entrenamiento posterior combina un ajuste fino supervisado con una destilación de conocimiento de un modelo docente más grande, seguido de un aprendizaje de refuerzo multi-recompensa.

Cuatro áreas de capacidad definen la actualización sobre LFM2-VL-3B. En la comprensión de la pantalla, el modelo promedia 80.7 en las divisiones de escritorio, móvil y web de ScreenSpot-v2, hasta un solo dígito en la versión anterior y bien por delante del modelo Gemma-4-E4B de 8 mil millones de parámetros a 50.9, aunque detrás del modelo InternVL 3.5 4B más grande a 84.2. En la anclaje, donde el modelo devuelve cuadros delimitadores para objetos descritos en lenguaje natural, la precisión RefCOCO salta de 57.1 a 87.9, una ganancia de más de 30 puntos que Liquid AI atribuye a datos de anclaje sintéticos escalados.

La llamada a funciones es nueva en la línea de visión de la empresa. En ToolSandbox, que mide el uso de herramientas, la puntuación más que se duplica de 26.4 a 59.5, lo que sitúa al modelo de 3.1B en par con Gemma-4-E2B y por delante de Qwen3.5-2B. El razonamiento multiimagen también mejora notablemente, con BLINK subiendo de 50.2 a 61.5 y MuirBench de 34.9 a 58.3.

A lo largo de la suite de visión de 28 benchmarks, LFM2.5-VL-3B promedia 69.4, una mejora de 12 puntos sobre los 57.2 de su predecesor y dentro de 0.7 puntos del modelo Qwen3.5-4B más grande de 4.7 mil millones de parámetros. El promedio oculta textura real, aunque: el modelo se queda atrás de sus rivales en algunas suites generales, y en realidad pierde terreno en CountBenchQA, que cae de 92.2 a 87.3.

Qué omite deliberadamente el modelo

LFM2.5-VL-3B es un modelo no de razonamiento. Responde directamente en lugar de generar una cadena intermedia de pensamiento, una elección de diseño que Liquid AI enmarca como optimización de latencia: la tarjeta del modelo recomienda para “tareas de baja latencia, de alta velocidad y de un solo giro”, nombrando la detección de objetos en tiempo real para aplicaciones automotrices, la OCR por lotes de documentos escaneados y la traducción en dispositivo de menús y señales de tráfico como cargas de trabajo previstas.

La misma tarjeta establece claramente qué es lo que el modelo no es para. “No se recomienda para tareas intensivas en razonamiento, como el diseño web visual, o para responder a preguntas técnicas muy complejas sobre planos”. La longitud del contexto es de 32,768 tokens, y la tarjeta marca su formato OCR de anotación de diseño como experimental, advirtiendo que “puede cambiar, puede ser poco fiable y puede no ser trivial de analizar”. Estas son las propias limitaciones de capacidad declaradas por el proveedor, y marcan dónde se detienen las afirmaciones de capacidad.

Los números de velocidad que anclan el lanzamiento siguen a partir de ese diseño. Liquid AI informa velocidades de descodificación de 228 tokens por segundo en un Apple M5 Max y 116 tokens por segundo en un AMD Ryzen AI Max+ 395, en aproximadamente 3 GB de memoria, y 20 tokens por segundo en un Galaxy S26 Ultra. En una sola NVIDIA H100, la empresa mide el tiempo hasta el primer token en aproximadamente 34 milisegundos en un clip de video de cinco cuadros, frente a alrededor de 200 milisegundos para los modelos Gemma, y una salida de rendimiento cerca de 11,000 tokens por segundo a alta concurrencia, lo que dice que suma casi un mil millones de tokens de salida por día en una sola tarjeta.

LFM2.5-VL-3B en cifras

  • 3.1 mil millones de parámetros; 34 billones de tokens de preentrenamiento; contexto de 32,768 tokens
  • 69.4 de promedio en 28 benchmarks de visión, versus 57.2 para LFM2-VL-3B
  • 80.7 de promedio en ScreenSpot-v2 de comprensión de pantalla, hasta 2.5 a 7.6 por división en el modelo anterior
  • 87.9 de precisión RefCOCO de anclaje, hasta 57.1
  • 59.5 en ToolSandbox de llamada a funciones, hasta 26.4
  • 228 tokens/s de descodificación en Apple M5 Max; 20 tokens/s en Galaxy S26 Ultra; huella de memoria de aproximadamente 3 GB
  • Aproximadamente 11,000 tokens/s de salida a alta concurrencia en una sola H100

Qué se envía con LFM2.5-VL-3B

Los pesos son descargables ahora desde Hugging Face bajo una licencia de pesos abiertos, con exportaciones cuantificadas en formatos GGUF, ONNX y MLX y soporte del día uno en llama.cpp, MLX, vLLM, SGLang y ONNX. Una demostración de WebGPU ejecuta el modelo enteramente en el navegador, y la empresa enumera 16 idiomas admitidos, incluyendo inglés, árabe, chino, japonés e hindi.

El lanzamiento completa la familia LFM2.5 que Liquid AI ha estado ensamblando a lo largo de la segunda mitad de 2026: el modelo de texto LFM2.5-2.6B el 4 de agosto de 2026, variantes de codificador para inferencia de CPU de contexto largo a finales de julio de 2026, y ahora el nivel de visión insignia, que sigue a las variantes más pequeñas LFM2.5-VL-1.6B y 450M. Las libretas de ajuste fino y la documentación se envían junto con los pesos, para que el modelo pueda adaptarse a cargas de trabajo específicas de anclaje, OCR o llamada a herramientas desde el primer día.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.