Modelos e plataformas de IA
LlamaIndex lança Extract V2.5 com ganhos de precisão e fundamentação

LlamaIndex introduziu o Extract v2.5 em 1 de outubro de 2026, uma nova geração de seus agentes de extração de documentos baseados em esquemas. Em uma postagem de blog assinada por Adrian Lyjak e Eli Stewart, a empresa relatou melhorias de precisão em todos os três níveis de extração e aprimorou a fundamentação para seus dois níveis mais altos, Agentic e Agentic Plus, e afirmou que os ganhos não acarretam aumento no preço por página.
Ganhos de Benchmark por Nível
LlamaIndex informou que, no ExtractBench, seu benchmark aberto de extração de documentos, o valor geral F1 subiu de 87.1 para 93.9 no nível Cost Effective, de 89.8 para 95.8 no nível Agentic e de 95.1 para 96.4 no nível Agentic Plus, seu nível de maior precisão. Segundo a empresa, o Cost Effective agora supera o nível Agentic anterior, e o Agentic supera o Agentic Plus anterior.
ExtractBench testa 370 documentos corporativos totalizando 4,869 páginas em 8 domínios de negócios e 67 tipos de documentos, cada tipo com seu próprio esquema. LlamaIndex publicou o benchmark com um conjunto de dados público, um harness de avaliação e metodologia, e avaliou VLMs de ponta, agentes de codificação e APIs especializadas de extração nele.
Novo Harness de Agente e Raciocínio Estrutural
A empresa afirmou que o v2.5 funciona em um novo harness de agente projetado especificamente para extração de documentos, inspirando-se nos agentes de codificação mais recentes e ajustado aos modelos para lidar com modos de falha em visão, raciocínio e verificação. LlamaIndex disse que o agente resultante pode referenciar cruzado o contexto de várias páginas e fundamentar os valores em fontes exatas.
Um recurso que o post chama de Raciocínio Estrutural opera sobre representações de documentos para adaptar a extração com base no tipo de documento, layout e densidade de informação: o agente dedica mais esforço a documentos complexos e processa os mais simples com menor latência. Para o v2.5, a equipe trouxe o harness do Agentic Plus para os níveis Cost Effective e Agentic, adaptando suas ferramentas e estratégias de extração às restrições de custo de cada nível após avaliar representações de documentos, ferramentas e configurações de modelo. A empresa também afirmou que trabalhou em como os agentes seguem esquemas e instruções de extração, incluindo tarefas com até 3,200 campos, e recomenda que usuários cujos IDs de registro são essenciais para combinar registros extraídos a um banco de dados os destaquem em seus prompts.
Listas Longas, Registros Entre Páginas e Formulários Digitalizados
Em tarefas de listas longas, a LlamaIndex informou que as pontuações subiram de 82.0 para 92.6 no nível Cost Effective, de 86.1 para 95.5 no nível Agentic e de 94.5 para 96.3 no nível Agentic Plus. A empresa afirmou que o v2.5 usa representações intermediárias para trabalhar com o conjunto de dados completo e valida sua saída contra o esquema do usuário. Em um exemplo, um registro de fundo de 17 páginas, o nível Cost Effective anterior retornou 87 de 238 participações; a empresa disse que o v2.5 retorna todas as 238, elevando a pontuação de extração desse documento de 52.8 para 98.7.
Em registros que se estendem por várias páginas, as pontuações relatadas aumentam de 80.3 para 92.0 no nível Cost Effective, de 85.5 para 96.5 no nível Agentic e de 93.6 para 96.7 no nível Agentic Plus. Em um cronograma de concessão Schedule I da United Way Worldwide, a empresa afirmou que o Agentic v2.0 interrompia na quebra de página, deixando o propósito e o endereço da concessão incompletos, enquanto o v2.5 inclui a continuação da página seguinte no mesmo registro.
Em formulários digitalizados, as pontuações relatadas aumentam de 89.6 para 93.9 no nível Cost Effective, de 90.9 para 95.7 no nível Agentic e de 94.4 para 96.1 no nível Agentic Plus. Em uma licença de descarte W-14 anotada, a empresa afirmou que o nível Agentic anteriormente combinava a data do revisor com o número da licença e adicionava uma nota do revisor à profundidade da água doce, enquanto o v2.5 separa os valores originais das anotações nos campos solicitados pelo esquema.
Citações Avançadas e Fundamentação
O lançamento apresenta Citações Avançadas para os níveis Agentic e Agentic Plus, que localizam caixas delimitadoras de evidências de suporte para campos difíceis, incluindo valores que não aparecem palavra por palavra no documento. Uma versão inicial estava previamente disponível no Agentic Plus; a LlamaIndex afirmou que aprimorou ainda mais a precisão de fundamentação do recurso e o estendeu ao Agentic. A empresa relatou que as pontuações de fundamentação do ExtractBench subiram de 46.8 para 80.6 no Agentic e de 46.4 para 82.2 no Agentic Plus. Seu gráfico comparativo lista pontuações de fundamentação de 63.2 para Sonnet 5.5, 77.6 para GPT-6 SOL, 77.5 para Opus 5.5, 50.8 para Reducto Deep Extract, 21.8 para Extend Max e 54.3 para seu próprio nível Cost Effective.
A empresa afirmou que as citações de caixa delimitadora se combinam com pontuações de confiança, o que ajuda as equipes a decidir quais valores extraídos podem prosseguir automaticamente e quais precisam de uma análise mais detalhada, permitindo que revisores verifiquem os valores sinalizados contra o documento original em fluxos de trabalho com intervenção humana.
Modo de Planilha e Disponibilidade
O v2.5 adiciona extração nativa de planilhas: no modo de planilha, os agentes trabalham diretamente com células da pasta de trabalho em vez de uma representação achatada, e os usuários podem habilitar o modo na configuração de extração.
O Extract v2.5 está disponível via LlamaCloud, uma ferramenta de linha de comando baseada em Go chamada llp, um servidor MCP para clientes de agente, incluindo Claude Code e Codex, e o SDK Python llama-cloud, onde os trabalhos de extração selecionam a versão 2.5 e podem habilitar opções de citarfontes e confiançapontuações. A LlamaIndex incentivou os usuários a executar o v2.5 em documentos representativos de seus fluxos de trabalho usando seus esquemas existentes, e afirmou que espera que a versão represente um avanço significativo na qualidade da extração, particularmente para documentos que antes precisavam de limpeza manual ou não eram suficientemente confiáveis para automatização.












