Modelos e plataformas de IA
A Liquid AI Lança o LFM2.5-VL-3B para Inteligência de Visão e Linguagem Mais Rápida na Edge

A Liquid AI lançou o LFM2.5-VL-3B em 12 de agosto de 2026, um modelo de visão e linguagem de 3,1 bilhões de parâmetros construído para executar em telefones, laptops e GPUs únicas, em vez de em um centro de dados. O modelo, anunciado no blog da empresa e publicado no Hugging Face com pesos disponíveis imediatamente, estende o LFM2-VL-3B do ano passado com uma compreensão de tela mais forte, ancoragem de objetos, raciocínio de múltiplas imagens e chamada de funções.
A empresa posiciona o lançamento como seu modelo de visão mais capaz para hardware auto-hospedado. No post de lançamento, a Liquid AI descreve-o como “nosso modelo de visão e linguagem mais capaz”, um que “oferece desempenho de visão competitivo contra modelos duas vezes maiores, enquanto executa mais rápido em uma variedade de implantações de CPU e GPU, mesmo em comparação com modelos que têm menos parâmetros”.
Todos os números de benchmark e velocidade nesta versão são relatados pelo fornecedor: a Liquid AI executou as avaliações ela mesma usando vLLM 0.26.0, com cada modelo no modo não de raciocínio e solicitado a responder diretamente. Nenhuma avaliação independente do novo modelo existe ainda, o que é o estado de jogo esperado no dia do lançamento, embora a cobertura recente da Unite.AI de um estudo da Amazon que avaliou vários dos mesmos modelos comparadores ilustre por que o comportamento de transcrição medido independentemente pode divergir dos escores de benchmark limpos.
Como o LFM2.5-VL-3B Lê Telas, Documentos e Múltiplas Imagens
O modelo combina um codificador de visão SigLIP2 400M NaFlex da Google com o mesmo backbone pré-treinado da LFM2.5-2.6B do modelo de texto da Liquid AI, lançado em 4 de agosto de 2026. De acordo com o cartão do modelo, foi pré-treinado em aproximadamente 34 trilhões de tokens com quatro vezes mais dados de visão do que seu antecessor, e seu vocabulário foi dobrado para 128.000 tokens estendendo o tokenizer existente, em vez de retreinar, uma alteração visando scripts não latinos. O treinamento pós-pré-treinamento combina ajuste fino supervisionado com destilação de conhecimento de um modelo professor maior, seguido de aprendizado de reforço de múltiplos prêmios.
Quatro áreas de capacidade definem a atualização sobre o LFM2-VL-3B. Na compreensão de tela, o modelo médio é de 80,7 nos splits de desktop, móvel e web do ScreenSpot-v2, subindo de dígitos únicos no lançamento anterior e bem à frente do modelo Gemma-4-E4B de 8 bilhões de parâmetros com 50,9, embora atrás do modelo InternVL 3.5 4B com 84,2. Na ancoragem, onde o modelo retorna caixas delimitadoras para objetos descritos em linguagem natural, a precisão RefCOCO salta de 57,1 para 87,9, um ganho de mais de 30 pontos que a Liquid AI atribui a dados de ancoragem sintéticos escalonados.
A chamada de funções é nova na linha de visão da empresa. No ToolSandbox, que mede o uso de ferramentas, a pontuação mais do que dobra de 26,4 para 59,5, colocando o modelo de 3,1B em par com o Gemma-4-E2B e à frente do Qwen3.5-2B. O raciocínio de múltiplas imagens também melhora acentuadamente, com o BLINK subindo de 50,2 para 61,5 e o MuirBench de 34,9 para 58,3.
Em todo o conjunto de 28 benchmarks de visão, o LFM2.5-VL-3B médio é de 69,4, uma melhoria de 12 pontos sobre os 57,2 do seu antecessor e dentro de 0,7 pontos do modelo Qwen3.5-4B de 4,7 bilhões de parâmetros. A média esconde textura real, embora: o modelo perca terreno para seus rivais em alguns conjuntos gerais e, na verdade, perca terreno no CountBenchQA, que cai de 92,2 para 87,3.
O que o Modelo Deixa de Propósito
O LFM2.5-VL-3B é um modelo não de raciocínio. Ele responde diretamente em vez de gerar uma cadeia intermediária de pensamento, uma escolha de design que a Liquid AI enquadrada como otimização de latência: o cartão do modelo recomenda para “tarefas de baixa latência, de alta taxa e de único turno”, nomeando detecção de objetos em tempo real para aplicações automotivas, OCR de documentos digitalizados em lote e tradução de menus e placas de trânsito no dispositivo como cargas de trabalho pretendidas.
O mesmo cartão afirma claramente o que o modelo não é para. Ele “não é recomendado para tarefas intensivas de raciocínio, como design de web visual ou respostas a perguntas altamente técnicas sobre plantas”. O comprimento do contexto é de 32.768 tokens e o cartão sinaliza seu formato de OCR de anotação de layout como experimental, advertindo que “pode mudar, pode ser pouco confiável e pode não ser trivial de analisar”. Essas são as próprias restrições de capacidade do fornecedor e marcam onde as alegações de capacidade param.
Os números de velocidade que ancoram o lançamento seguem dessa escolha de design. A Liquid AI relata velocidades de decodificação de 228 tokens por segundo em um Apple M5 Max e 116 tokens por segundo em um AMD Ryzen AI Max+ 395, em cerca de 3 GB de memória, e 20 tokens por segundo em um Galaxy S26 Ultra. Em uma única NVIDIA H100, a empresa mede o tempo para o primeiro token em cerca de 34 milissegundos em um clipe de vídeo de cinco quadros, contra cerca de 200 milissegundos para os modelos Gemma, e taxa de saída perto de 11.000 tokens por segundo em alta concorrência, o que afirma ser quase um bilhão de tokens de saída por dia em um cartão.
LFM2.5-VL-3B em Números
- 3,1 bilhões de parâmetros; 34 trilhões de tokens de pré-treinamento; contexto de 32.768 tokens
- 69,4 médio em 28 benchmarks de visão, versus 57,2 para LFM2-VL-3B
- 80,7 médio no ScreenSpot-v2 de compreensão de tela, subindo de 2,5 a 7,6 por split no modelo anterior
- 87,9 precisão de ancoragem RefCOCO, subindo de 57,1
- 59,5 no ToolSandbox de chamada de funções, subindo de 26,4
- 228 tokens/s de decodificação no Apple M5 Max; 20 tokens/s no Galaxy S26 Ultra; cerca de 3 GB de pegada de memória
- Cerca de 11.000 tokens/s de saída em alta concorrência em uma única H100
O que Vem com o LFM2.5-VL-3B
Os pesos são baixáveis agora do Hugging Face sob uma licença de peso aberto, com exportações quantizadas em formatos GGUF, ONNX e MLX e suporte no primeiro dia em llama.cpp, MLX, vLLM, SGLang e ONNX. Um demo WebGPU executa o modelo inteiramente no navegador e a empresa lista 16 idiomas suportados, incluindo inglês, árabe, chinês, japonês e hindi.
O lançamento completa a família LFM2.5 que a Liquid AI tem reunido na segunda metade de 2026: o modelo de texto LFM2.5-2.6B em 4 de agosto de 2026, variantes de codificador para inferência de CPU de contexto longo em fins de julho de 2026, e agora o nível de visão de bandeira, que segue os menores variantes LFM2.5-VL-1.6B e 450M. Blocos de notas de ajuste fino e documentação são enviados junto com os pesos, para que o modelo possa ser adaptado a cargas de trabalho específicas de ancoragem, OCR ou chamada de ferramentas desde o primeiro dia.












