AI-modeller och plattformar
LlamaIndex lanserar Extract V2.5 med förbättringar i noggrannhet och förankring

LlamaIndex introducerade Extract v2.5 den 1 oktober 2026, en ny generation av sina schema‑baserade dokumentextraktionsagenter. I ett bloggpost med författare Adrian Lyjak och Eli Stewart rapporterade företaget förbättringar i noggrannhet över alla sina tre extraktionsnivåer samt förbättrad förankring för de två högsta nivåerna, Agentic och Agentic Plus, och sade att förbättringarna sker utan någon prisökning per sida.
Benchmark‑vinster per nivå
LlamaIndex rapporterade att på ExtractBench, deras öppna benchmark för dokumentextraktion, steg det totala F1‑värdet från 87.1 till 93.9 för Cost Effective‑nivån, från 89.8 till 95.8 för Agentic och från 95.1 till 96.4 för Agentic Plus, deras mest exakta nivå. Enligt företaget överträffar Cost Effective nu den tidigare Agentic‑nivån, och Agentic överträffar den tidigare Agentic Plus‑nivån.
ExtractBench testar 370 företagsdokument som totalt omfattar 4,869 sidor över 8 affärsområden och 67 dokumenttyper, där varje typ har sitt eget schema. LlamaIndex publicerade benchmarken med en offentlig dataset, utvärderingsramverk och metodik, och har utvärderat frontier‑VLM:er, kodningsagenter och specialiserade extraktions‑API:er på den.
Nytt agent‑ramverk och strukturellt resonemang
Företaget uppgav att v2.5 körs på ett nytt agent‑ramverk som är specifikt byggt för dokumentextraktion, inspirerat av de senaste kodningsagenterna och finjusterat kring modellerna för att hantera felmoder inom vision, resonemang och verifiering. LlamaIndex sade att den resulterande agenten kan korsreferera kontext från flera sidor och förankra värden i exakta källor.
Ett verktyg som inlägget kallar Strukturellt resonemang arbetar med dokumentrepresentationer för att anpassa extraktionen efter dokumenttyp, layout och informationsdensitet: agenten lägger mer arbete på komplexa dokument och behandlar enklare med lägre fördröjning. För v2.5 flyttade teamet ramverket bakom Agentic Plus till Cost Effective‑ och Agentic‑nivåerna, och anpassade dess verktyg och extraktionsstrategier till varje nivås kostnadsbegränsningar efter att ha utvärderat dokumentrepresentationer, verktyg och modellkonfigurationer. Företaget uppgav också att de har arbetat med hur agenter följer scheman och extraktionsinstruktioner, inklusive uppgifter med upp till 3,200 fält, och de rekommenderar användare vars post‑ID:n är avgörande för att matcha extraherade poster mot en databas att ange detta i sina prompts.
Långa listor, poster över flera sidor och skannade formulär
För uppgifter med långa listor rapporterade LlamaIndex att poängen steg från 82.0 till 92.6 för Cost Effective, från 86.1 till 95.5 för Agentic och från 94.5 till 96.3 för Agentic Plus. Företaget sade att v2.5 använder mellanhandsrepresentationer för att arbeta med hela datasetet och validerar sitt resultat mot användarens schema. I ett exempel, en 17‑sidig fondsökning, returnerade den tidigare Cost Effective‑nivån 87 av 238 innehav; företaget uppgav att v2.5 returnerar alla 238, vilket höjde dokumentets extraktionspoäng från 52.8 till 98.7.
För poster som sträcker sig över sidor steg poängen från 80.3 till 92.0 för Cost Effective, från 85.5 till 96.5 för Agentic och från 93.6 till 96.7 för Agentic Plus. I ett United Way Worldwide Schedule I‑bidragschema sade företaget att Agentic v2.0 stoppade vid ett sidbrytning, vilket lämnade bidragets syfte och adress ofullständiga, medan v2.5 inkluderar fortsättningen från nästa sida i samma post.
För skannade formulär steg poängen från 89.6 till 93.9 för Cost Effective, från 90.9 till 95.7 för Agentic och från 94.4 till 96.1 för Agentic Plus. På ett annoterat W-14‑avfallspermit sade företaget att Agentic‑nivån tidigare kombinerade en granskare‑datum med tillståndsnumret och lade till en granskarnotering till sötvattensdjupet, medan v2.5 separerar de ursprungliga värdena från annoteringarna i de fält som efterfrågas av schemat.
Avancerade citat och förankring
Utgåvan introducerar Avancerade citat för Agentic‑ och Agentic Plus‑nivåerna, som lokaliserar avgränsningsrutor för stödjande bevis för svåra fält, inklusive värden som inte förekommer ordagrant i dokumentet. En initial version fanns tidigare i Agentic Plus; LlamaIndex sade att de ytterligare förbättrade funktionens förankringsnoggrannhet och utökade den till Agentic. Företaget rapporterade att ExtractBench‑förankringspoäng steg från 46.8 till 80.6 för Agentic och från 46.4 till 82.2 för Agentic Plus. Dess jämförelsetabell listar förankringspoäng på 63.2 för Sonnet 5.5, 77.6 för GPT‑6 SOL, 77.5 för Opus 5.5, 50.8 för Reducto Deep Extract, 21.8 för Extend Max och 54.3 för deras egna Cost Effective‑nivå.
Företaget uppgav att avgränsningsruta‑citat kombineras med konfidenspoäng, vilket hjälper team att avgöra vilka extraherade värden som kan gå vidare automatiskt och vilka som kräver närmare granskning, så att granskare kan kontrollera flaggade värden mot originaldokumentet i mänsklig‑i‑loop‑arbetsflöden.
Kalkylbladsläge och tillgänglighet
v2.5 lägger till inbyggd kalkylblads‑extraktion: i kalkylbladsläge arbetar agenter direkt med arbetsbokens celler istället för en platt representation, och användare kan aktivera läget i extraktionskonfigurationen.
Extract v2.5 är tillgänglig via LlamaCloud, ett Go‑baserat kommandoradsverktyg som heter llp, en MCP‑server för agentklienter inklusive Claude Code och Codex, samt Python‑SDK:n llama‑cloud, där extraktionsjobb väljer version 2.5 och kan aktivera källor och förtroende‑poängsalternativ. LlamaIndex uppmanade användare att köra v2.5 på dokument som representerar deras arbetsflöden med deras befintliga scheman, och sade att de förväntar sig att versionen blir ett betydande steg framåt i extraktionskvaliteten, särskilt för dokument som tidigare krävde manuell rensning eller inte var tillräckligt pålitliga för automatisering.












