Modelos e plataformas de IA

A Liquid AI Lança o LFM2.5-VL-3B para Inteligência de Visão e Linguagem Mais Rápida na Edge

mm
Adicione Unite.AI às suas fontes preferidas no Google

A Liquid AI lançou o LFM2.5-VL-3B em 12 de agosto de 2026, um modelo de visão e linguagem de 3,1 bilhões de parâmetros construído para executar em telefones, laptops e GPUs únicas, em vez de em um centro de dados. O modelo, anunciado no blog da empresa e publicado no Hugging Face com pesos disponíveis imediatamente, estende o LFM2-VL-3B do ano passado com uma compreensão de tela mais forte, ancoragem de objetos, raciocínio de múltiplas imagens e chamada de funções.

A empresa posiciona o lançamento como seu modelo de visão mais capaz para hardware auto-hospedado. No post de lançamento, a Liquid AI descreve-o como “nosso modelo de visão e linguagem mais capaz”, um que “oferece desempenho de visão competitivo contra modelos duas vezes maiores, enquanto executa mais rápido em uma variedade de implantações de CPU e GPU, mesmo em comparação com modelos que têm menos parâmetros”.

Todos os números de benchmark e velocidade nesta versão são relatados pelo fornecedor: a Liquid AI executou as avaliações ela mesma usando vLLM 0.26.0, com cada modelo no modo não de raciocínio e solicitado a responder diretamente. Nenhuma avaliação independente do novo modelo existe ainda, o que é o estado de jogo esperado no dia do lançamento, embora a cobertura recente da Unite.AI de um estudo da Amazon que avaliou vários dos mesmos modelos comparadores ilustre por que o comportamento de transcrição medido independentemente pode divergir dos escores de benchmark limpos.

Como o LFM2.5-VL-3B Lê Telas, Documentos e Múltiplas Imagens

O modelo combina um codificador de visão SigLIP2 400M NaFlex da Google com o mesmo backbone pré-treinado da LFM2.5-2.6B do modelo de texto da Liquid AI, lançado em 4 de agosto de 2026. De acordo com o cartão do modelo, foi pré-treinado em aproximadamente 34 trilhões de tokens com quatro vezes mais dados de visão do que seu antecessor, e seu vocabulário foi dobrado para 128.000 tokens estendendo o tokenizer existente, em vez de retreinar, uma alteração visando scripts não latinos. O treinamento pós-pré-treinamento combina ajuste fino supervisionado com destilação de conhecimento de um modelo professor maior, seguido de aprendizado de reforço de múltiplos prêmios.

Quatro áreas de capacidade definem a atualização sobre o LFM2-VL-3B. Na compreensão de tela, o modelo médio é de 80,7 nos splits de desktop, móvel e web do ScreenSpot-v2, subindo de dígitos únicos no lançamento anterior e bem à frente do modelo Gemma-4-E4B de 8 bilhões de parâmetros com 50,9, embora atrás do modelo InternVL 3.5 4B com 84,2. Na ancoragem, onde o modelo retorna caixas delimitadoras para objetos descritos em linguagem natural, a precisão RefCOCO salta de 57,1 para 87,9, um ganho de mais de 30 pontos que a Liquid AI atribui a dados de ancoragem sintéticos escalonados.

A chamada de funções é nova na linha de visão da empresa. No ToolSandbox, que mede o uso de ferramentas, a pontuação mais do que dobra de 26,4 para 59,5, colocando o modelo de 3,1B em par com o Gemma-4-E2B e à frente do Qwen3.5-2B. O raciocínio de múltiplas imagens também melhora acentuadamente, com o BLINK subindo de 50,2 para 61,5 e o MuirBench de 34,9 para 58,3.

Em todo o conjunto de 28 benchmarks de visão, o LFM2.5-VL-3B médio é de 69,4, uma melhoria de 12 pontos sobre os 57,2 do seu antecessor e dentro de 0,7 pontos do modelo Qwen3.5-4B de 4,7 bilhões de parâmetros. A média esconde textura real, embora: o modelo perca terreno para seus rivais em alguns conjuntos gerais e, na verdade, perca terreno no CountBenchQA, que cai de 92,2 para 87,3.

O que o Modelo Deixa de Propósito

O LFM2.5-VL-3B é um modelo não de raciocínio. Ele responde diretamente em vez de gerar uma cadeia intermediária de pensamento, uma escolha de design que a Liquid AI enquadrada como otimização de latência: o cartão do modelo recomenda para “tarefas de baixa latência, de alta taxa e de único turno”, nomeando detecção de objetos em tempo real para aplicações automotivas, OCR de documentos digitalizados em lote e tradução de menus e placas de trânsito no dispositivo como cargas de trabalho pretendidas.

O mesmo cartão afirma claramente o que o modelo não é para. Ele “não é recomendado para tarefas intensivas de raciocínio, como design de web visual ou respostas a perguntas altamente técnicas sobre plantas”. O comprimento do contexto é de 32.768 tokens e o cartão sinaliza seu formato de OCR de anotação de layout como experimental, advertindo que “pode mudar, pode ser pouco confiável e pode não ser trivial de analisar”. Essas são as próprias restrições de capacidade do fornecedor e marcam onde as alegações de capacidade param.

Os números de velocidade que ancoram o lançamento seguem dessa escolha de design. A Liquid AI relata velocidades de decodificação de 228 tokens por segundo em um Apple M5 Max e 116 tokens por segundo em um AMD Ryzen AI Max+ 395, em cerca de 3 GB de memória, e 20 tokens por segundo em um Galaxy S26 Ultra. Em uma única NVIDIA H100, a empresa mede o tempo para o primeiro token em cerca de 34 milissegundos em um clipe de vídeo de cinco quadros, contra cerca de 200 milissegundos para os modelos Gemma, e taxa de saída perto de 11.000 tokens por segundo em alta concorrência, o que afirma ser quase um bilhão de tokens de saída por dia em um cartão.

LFM2.5-VL-3B em Números

  • 3,1 bilhões de parâmetros; 34 trilhões de tokens de pré-treinamento; contexto de 32.768 tokens
  • 69,4 médio em 28 benchmarks de visão, versus 57,2 para LFM2-VL-3B
  • 80,7 médio no ScreenSpot-v2 de compreensão de tela, subindo de 2,5 a 7,6 por split no modelo anterior
  • 87,9 precisão de ancoragem RefCOCO, subindo de 57,1
  • 59,5 no ToolSandbox de chamada de funções, subindo de 26,4
  • 228 tokens/s de decodificação no Apple M5 Max; 20 tokens/s no Galaxy S26 Ultra; cerca de 3 GB de pegada de memória
  • Cerca de 11.000 tokens/s de saída em alta concorrência em uma única H100

O que Vem com o LFM2.5-VL-3B

Os pesos são baixáveis agora do Hugging Face sob uma licença de peso aberto, com exportações quantizadas em formatos GGUF, ONNX e MLX e suporte no primeiro dia em llama.cpp, MLX, vLLM, SGLang e ONNX. Um demo WebGPU executa o modelo inteiramente no navegador e a empresa lista 16 idiomas suportados, incluindo inglês, árabe, chinês, japonês e hindi.

O lançamento completa a família LFM2.5 que a Liquid AI tem reunido na segunda metade de 2026: o modelo de texto LFM2.5-2.6B em 4 de agosto de 2026, variantes de codificador para inferência de CPU de contexto longo em fins de julho de 2026, e agora o nível de visão de bandeira, que segue os menores variantes LFM2.5-VL-1.6B e 450M. Blocos de notas de ajuste fino e documentação são enviados junto com os pesos, para que o modelo possa ser adaptado a cargas de trabalho específicas de ancoragem, OCR ou chamada de ferramentas desde o primeiro dia.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.