Modelos y plataformas de IA
LlamaIndex lanza Extract V2.5 con mejoras de precisión y fundamentación

LlamaIndex presentó Extract v2.5 el 1 de octubre de 2026, una nueva generación de sus agentes de extracción de documentos basados en esquemas. En una publicación del blog firmada por Adrian Lyjak y Eli Stewart, la compañía informó mejoras de precisión en los tres niveles de extracción y una mayor fundamentación para sus dos niveles superiores, Agentic y Agentic Plus, y afirmó que los avances no implican un aumento en el precio por página.
Mejoras de referencia por nivel
LlamaIndex informó que en ExtractBench, su referencia abierta de extracción de documentos, el valor F1 global aumentó de 87.1 a 93.9 para el nivel Cost Effective, de 89.8 a 95.8 para Agentic, y de 95.1 a 96.4 para Agentic Plus, su nivel de mayor precisión. Según la compañía, Cost Effective ahora supera al nivel Agentic anterior, y Agentic supera al anterior Agentic Plus.
ExtractBench evalúa 370 documentos empresariales que suman 4,869 páginas en 8 dominios comerciales y 67 tipos de documentos, cada tipo con su propio esquema. LlamaIndex publicó la referencia con un conjunto de datos público, un entorno de evaluación y una metodología, y ha evaluado VLM de vanguardia, agentes de codificación y API de extracción especializadas en ella.
Nuevo arnés de agente y razonamiento estructural
La compañía afirmó que v2.5 funciona sobre un nuevo arnés de agente diseñado específicamente para la extracción de documentos, inspirándose en los últimos agentes de codificación y ajustado a los modelos para manejar modos de falla en visión, razonamiento y verificación. LlamaIndex dijo que el agente resultante puede cruzar referencias de contexto de múltiples páginas y fundamentar los valores en fuentes exactas.
Una capacidad que la publicación denomina razonamiento estructural opera sobre representaciones de documentos para adaptar la extracción según el tipo de documento, el diseño y la densidad de información: el agente dedica más esfuerzo a documentos complejos y procesa los más simples con menor latencia. Para v2.5, el equipo trasladó el arnés de Agentic Plus a los niveles Cost Effective y Agentic, adaptando sus herramientas y estrategias de extracción a las limitaciones de costo de cada nivel tras evaluar representaciones de documentos, herramientas y configuraciones de modelo. La compañía también indicó que trabajó en cómo los agentes siguen los esquemas y las instrucciones de extracción, incluyendo tareas con hasta 3,200 campos, y aconseja a los usuarios cuyos IDs de registro son esenciales para emparejar los registros extraídos con una base de datos que lo indiquen en sus indicaciones.
Listas largas, registros entre páginas y formularios escaneados
En tareas de listas largas, LlamaIndex informó que las puntuaciones aumentaron de 82.0 a 92.6 para Cost Effective, de 86.1 a 95.5 para Agentic y de 94.5 a 96.3 para Agentic Plus. La compañía afirmó que v2.5 utiliza representaciones intermedias para trabajar con el conjunto de datos completo y valida su salida contra el esquema del usuario. En un ejemplo, una presentación de fondos de 17 páginas, el nivel Cost Effective anterior devolvía 87 de 238 participaciones; la compañía dijo que v2.5 devuelve las 238, elevando la puntuación de extracción de ese documento de 52.8 a 98.7.
En registros que abarcan varias páginas, las puntuaciones reportadas suben de 80.3 a 92.0 para Cost Effective, de 85.5 a 96.5 para Agentic y de 93.6 a 96.7 para Agentic Plus. En un cronograma de subvenciones Schedule I de United Way Worldwide, la compañía indicó que Agentic v2.0 se detenía en un salto de página, dejando incompletos el propósito y la dirección de la subvención, mientras que v2.5 incluye la continuación de la página siguiente en el mismo registro.
En formularios escaneados, las puntuaciones reportadas aumentan de 89.6 a 93.9 para Cost Effective, de 90.9 a 95.7 para Agentic y de 94.4 a 96.1 para Agentic Plus. En un permiso de disposición W-14 anotado, la compañía indicó que el nivel Agentic combinaba previamente la fecha del revisor con el número del permiso y añadía una nota del revisor a la profundidad de agua dulce, mientras que v2.5 separa los valores originales de las anotaciones en los campos solicitados por el esquema.
Citas avanzadas y fundamentación
El lanzamiento introduce Citas Avanzadas para los niveles Agentic y Agentic Plus, que localizan cajas delimitadoras de evidencia de apoyo para campos difíciles, incluidos valores que no aparecen literalmente en el documento. Una versión inicial estaba disponible previamente en Agentic Plus; LlamaIndex afirmó que mejoró aún más la precisión de fundamentación de la función y la extendió a Agentic. La compañía informó que las puntuaciones de fundamentación de ExtractBench aumentaron de 46.8 a 80.6 para Agentic y de 46.4 a 82.2 para Agentic Plus. Su tabla comparativa muestra puntuaciones de fundamentación de 63.2 para Sonnet 5.5, 77.6 para GPT-6 SOL, 77.5 para Opus 5.5, 50.8 para Reducto Deep Extract, 21.8 para Extend Max y 54.3 para su propio nivel Cost Effective.
La compañía señaló que las citas de cajas delimitadoras se combinan con puntuaciones de confianza, lo que ayuda a los equipos a decidir qué valores extraídos pueden procesarse automáticamente y cuáles requieren una revisión más detallada, permitiendo a los revisores comprobar los valores marcados contra el documento original en flujos de trabajo con intervención humana.
Modo de hoja de cálculo y disponibilidad
v2.5 añade extracción nativa de hojas de cálculo: en modo hoja de cálculo, los agentes trabajan directamente con celdas del libro de trabajo en lugar de una representación aplanada, y los usuarios pueden activar el modo en la configuración de extracción.
Extract v2.5 está disponible a través de LlamaCloud, una herramienta de línea de comandos basada en Go llamada llp, un servidor MCP para clientes de agente que incluye Claude Code y Codex, y el SDK de Python llama-cloud, donde los trabajos de extracción seleccionan la versión 2.5 y pueden habilitar opciones de citarfuentes y puntuaciones de confianza. LlamaIndex animó a los usuarios a ejecutar v2.5 en documentos representativos de sus flujos de trabajo utilizando sus esquemas existentes, y afirmó que espera que la versión suponga un avance significativo en la calidad de extracción, particularmente para documentos que antes requerían limpieza manual o no eran lo suficientemente fiables para automatizar.












