Modèles et plateformes d’IA
LlamaIndex lance Extract V2.5 avec des gains de précision et d’ancrage

LlamaIndex a présenté Extract v2.5 le 1er octobre 2026, une nouvelle génération de ses agents d’extraction de documents basés sur des schémas. Dans un article de blog signé par Adrian Lyjak et Eli Stewart, l’entreprise a indiqué des améliorations de précision sur les trois niveaux d’extraction et un ancrage renforcé pour ses deux niveaux les plus élevés, Agentic et Agentic Plus, et a précisé que ces gains n’entraînent aucune hausse du prix par page.
Gains du benchmark par niveau
LlamaIndex a indiqué que, sur ExtractBench, son benchmark ouvert d’extraction de documents, le score F1 global est passé de 87,1 à 93,9 pour le niveau Cost Effective, de 89,8 à 95,8 pour Agentic, et de 95,1 à 96,4 pour Agentic Plus, son niveau le plus précis. Selon l’entreprise, le niveau Cost Effective surpasse désormais le niveau Agentic précédent, et Agentic surpasse le niveau Agentic Plus antérieur.
ExtractBench teste 370 documents d’entreprise totalisant 4 869 pages réparties sur 8 secteurs d’activité et 67 types de documents, chaque type disposant de son propre schéma. LlamaIndex a publié le benchmark avec un jeu de données public, un cadre d’évaluation et une méthodologie, et a évalué dessus les VLM de pointe, les agents de codage et les API d’extraction spécialisées.
Nouveau cadre d’agent et raisonnement structurel
L’entreprise a indiqué que la version v2.5 fonctionne sur un nouveau cadre d’agent spécialement conçu pour l’extraction de documents, s’inspirant des derniers agents de codage et ajusté aux modèles afin de gérer les modes d’échec liés à la vision, au raisonnement et à la vérification. LlamaIndex a déclaré que l’agent ainsi obtenu peut recouper le contexte de plusieurs pages et ancrer les valeurs dans leurs sources exactes.
Une fonctionnalité que l’article désigne comme Raisonnement structurel travaille sur les représentations de documents afin d’adapter l’extraction en fonction du type de document, de sa mise en page et de sa densité d’information : l’agent consacre davantage d’effort aux documents complexes et traite les plus simples avec une latence plus faible. Pour la version v2.5, l’équipe a transféré le cadre utilisé dans Agentic Plus aux niveaux Cost Effective et Agentic, en adaptant ses outils et stratégies d’extraction aux contraintes de coût propres à chaque niveau après avoir évalué les représentations de documents, les outils et les configurations de modèles. L’entreprise a également indiqué qu’elle avait travaillé sur la façon dont les agents respectent les schémas et les instructions d’extraction, y compris pour des tâches comportant jusqu’à 3 200 champs, et conseille aux utilisateurs dont les identifiants d’enregistrement sont essentiels pour faire correspondre les enregistrements extraits à une base de données de les mentionner explicitement dans leurs invites.
Listes longues, enregistrements multi‑pages et formulaires numérisés
Pour les tâches à listes longues, LlamaIndex a indiqué que les scores sont passés de 82,0 à 92,6 pour Cost Effective, de 86,1 à 95,5 pour Agentic, et de 94,5 à 96,3 pour Agentic Plus. L’entreprise a déclaré que la version v2.5 utilise des représentations intermédiaires pour travailler avec l’ensemble complet des données et valide sa sortie par rapport au schéma de l’utilisateur. Dans un exemple, un dossier de fonds de 17 pages, le niveau Cost Effective précédent ne retournait que 87 des 238 titres ; l’entreprise a affirmé que v2.5 renvoie les 238, faisant passer le score d’extraction de ce document de 52,8 à 98,7.
Pour les enregistrements s’étendant sur plusieurs pages, les scores signalés sont passés de 80,3 à 92,0 pour Cost Effective, de 85,5 à 96,5 pour Agentic, et de 93,6 à 96,7 pour Agentic Plus. Dans un calendrier de subvention Schedule I de United Way Worldwide, l’entreprise a indiqué que Agentic v2.0 s’interrompait à un saut de page, laissant le but et l’adresse de la subvention incomplets, tandis que v2.5 intègre la suite de la page suivante dans le même enregistrement.
Pour les formulaires numérisés, les scores signalés sont passés de 89,6 à 93,9 pour Cost Effective, de 90,9 à 95,7 pour Agentic, et de 94,4 à 96,1 pour Agentic Plus. Sur un permis de disposition W‑14 annoté, l’entreprise a indiqué que le niveau Agentic combinait auparavant la date du réviseur avec le numéro du permis et ajoutait une note du réviseur à la profondeur d’eau douce, tandis que v2.5 sépare les valeurs d’origine des annotations dans les champs demandés par le schéma.
Citations avancées et ancrage
Cette version introduit les Citations avancées pour les niveaux Agentic et Agentic Plus, qui localisent les boîtes englobantes des preuves à l’appui pour les champs difficiles, y compris les valeurs qui n’apparaissent pas mot à mot dans le document. Une version initiale était déjà disponible dans Agentic Plus ; LlamaIndex a déclaré avoir encore amélioré la précision d’ancrage de cette fonctionnalité et l’avoir étendue à Agentic. L’entreprise a indiqué que les scores d’ancrage d’ExtractBench sont passés de 46,8 à 80,6 pour Agentic et de 46,4 à 82,2 pour Agentic Plus. Son tableau comparatif indique des scores d’ancrage de 63,2 pour Sonnet 5.5, 77,6 pour GPT‑6 SOL, 77,5 pour Opus 5.5, 50,8 pour Reducto Deep Extract, 21,8 pour Extend Max, et 54,3 pour son propre niveau Cost Effective.
L’entreprise a indiqué que les citations sous forme de boîtes englobantes sont associées à des scores de confiance, ce qui aide les équipes à déterminer quelles valeurs extraites peuvent être traitées automatiquement et lesquelles nécessitent une vérification plus approfondie, permettant aux réviseurs de comparer les valeurs signalées avec le document original dans des flux de travail humains‑dans‑la‑boucle.
Mode feuille de calcul et disponibilité
v2.5 ajoute l’extraction native de feuilles de calcul : en mode feuille de calcul, les agents travaillent directement avec les cellules du classeur plutôt qu’avec une représentation aplatie, et les utilisateurs peuvent activer ce mode dans la configuration d’extraction.
Extract v2.5 est disponible via LlamaCloud, un outil en ligne de commande basé sur Go appelé llp, un serveur MCP pour les clients agents incluant Claude Code et Codex, ainsi que le SDK Python llama‑cloud, où les tâches d’extraction sélectionnent la version 2.5 et peuvent activer les options sources et confiance. LlamaIndex a encouragé les utilisateurs à exécuter la v2.5 sur des documents représentatifs de leurs flux de travail en utilisant leurs schémas existants, et a indiqué s’attendre à ce que cette version constitue un progrès significatif en termes de qualité d’extraction, notamment pour les documents qui nécessitaient auparavant un nettoyage manuel ou qui n’étaient pas suffisamment fiables pour être automatisés.












