AI-modellen en platforms

LlamaIndex lanceert Extract V2.5 met nauwkeurigheid- en onderbouwingstoenames

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

LlamaIndex introduceerde Extract v2.5 op 1 oktober 2026, een nieuwe generatie van zijn schema‑gebaseerde document‑extractie‑agents. In een blogbericht ondertekend door Adrian Lyjak en Eli Stewart meldde het bedrijf nauwkeurigheidsverbeteringen over alle drie zijn extractietiers en een verbeterde onderbouwing voor zijn twee hoogste tiers, Agentic en Agentic Plus, en zei dat de winsten komen zonder een verhoging van de prijs per pagina.

Tier‑voor‑tier benchmarkwinsten

LlamaIndex meldde dat op ExtractBench, zijn open document‑extractie‑benchmark, de algehele waarde‑F1 steeg van 87,1 naar 93,9 voor de Cost Effective‑tier, van 89,8 naar 95,8 voor Agentic, en van 95,1 naar 96,4 voor Agentic Plus, zijn tier met de hoogste nauwkeurigheid. Volgens het bedrijf presteert Cost Effective nu beter dan de vorige Agentic‑tier, en presteert Agentic beter dan de eerdere Agentic Plus.

ExtractBench test 370 bedrijfsdocumenten met in totaal 4.869 pagina’s over 8 zakelijke domeinen en 67 documenttypen, elk type met een eigen schema. LlamaIndex publiceerde de benchmark met een openbare dataset, evaluatie‑harnas en methodologie, en heeft frontier‑VLM’s, code‑agents en gespecialiseerde extractie‑API’s daarop geëvalueerd.

Nieuw agent‑harnas en structureel redeneren

Het bedrijf zei dat v2.5 draait op een nieuw agent‑harnas dat speciaal is gebouwd voor document‑extractie, geïnspireerd op de nieuwste code‑agents en afgestemd op de modellen om foutmodi op het gebied van visie, redeneren en verificatie te behandelen. LlamaIndex stelde dat de resulterende agent context van meerdere pagina’s kan cross‑refereren en waarden kan onderbouwen met exacte bronnen.

Een mogelijkheid die in het bericht Structureel Redeneren wordt genoemd, werkt over documentrepresentaties om extractie af te stemmen op documenttype, lay-out en informatiedichtheid: de agent besteedt meer moeite aan complexe documenten en verwerkt eenvoudigere documenten met lagere latentie. Voor v2.5 heeft het team het harnas achter Agentic Plus naar de Cost Effective‑ en Agentic‑tiers gebracht, waarbij de tools en extractiestrategieën werden aangepast aan de kostenbeperkingen van elke tier na evaluatie van documentrepresentaties, tools en modelconfiguraties. Het bedrijf meldde bovendien dat het heeft gewerkt aan hoe agents schema’s en extractie‑instructies volgen, inclusief taken met tot 3.200 velden, en adviseert gebruikers waarvan de record‑ID’s essentieel zijn voor het koppelen van geëxtraheerde records aan een database om dit in hun prompts te vermelden.

Lange lijsten, records over meerdere pagina’s en gescande formulieren

Bij taken met lange lijsten meldde LlamaIndex dat de scores stegen van 82,0 naar 92,6 voor Cost Effective, van 86,1 naar 95,5 voor Agentic, en van 94,5 naar 96,3 voor Agentic Plus. Het bedrijf zei dat v2.5 intermediaire representaties gebruikt om met de volledige dataset te werken en de output valideert tegen het schema van de gebruiker. In één voorbeeld, een fondsaanvraag van 17 pagina’s, leverde de vorige Cost Effective‑tier 87 van 238 holdings; het bedrijf zei dat v2.5 alle 238 retourneert, waardoor de extractiescore van dat document steeg van 52,8 naar 98,7.

Voor records die zich over meerdere pagina’s uitstrekken, stegen de gerapporteerde scores van 80,3 naar 92,0 voor Cost Effective, van 85,5 naar 96,5 voor Agentic, en van 93,6 naar 96,7 voor Agentic Plus. In een United Way Worldwide Schedule I‑subsidieschema zei het bedrijf dat Agentic v2.0 stopte bij een pagina‑breuk, waardoor het doel en adres van een subsidie onvolledig bleven, terwijl v2.5 de voortzetting van de volgende pagina in hetzelfde record opneemt.

Voor gescande formulieren stegen de gerapporteerde scores van 89,6 naar 93,9 voor Cost Effective, van 90,9 naar 95,7 voor Agentic, en van 94,4 naar 96,1 voor Agentic Plus. Bij een geannoteerde W‑14‑verwijderingsvergunning zei het bedrijf dat de Agentic‑tier eerder de datum van de beoordelaar combineerde met het vergunningsnummer en een beoordelaarsopmerking toevoegde aan de zoetwaterdiepte, terwijl v2.5 de oorspronkelijke waarden scheidt van de annotaties in de velden die door het schema worden gevraagd.

Geavanceerde citaten en onderbouwing

De release introduceert Geavanceerde Citaten voor de Agentic‑ en Agentic Plus‑tiers, die begrenzende vakken van ondersteunend bewijs lokaliseren voor moeilijke velden, inclusief waarden die niet woord‑voor‑woord in het document voorkomen. Een eerste versie was eerder beschikbaar in Agentic Plus; LlamaIndex meldde dat het de onderbouwing‑nauwkeurigheid van de functie verder verbeterde en deze uitbreidde naar Agentic. Het bedrijf rapporteerde dat de ExtractBench‑onderbouwing‑scores stegen van 46,8 naar 80,6 voor Agentic en van 46,4 naar 82,2 voor Agentic Plus. Zijn vergelijkingsgrafiek vermeldt onderbouwing‑scores van 63,2 voor Sonnet 5.5, 77,6 voor GPT‑6 SOL, 77,5 voor Opus 5.5, 50,8 voor Reducto Deep Extract, 21,8 voor Extend Max, en 54,3 voor zijn eigen Cost Effective‑tier.

Het bedrijf zei dat begrenzende‑vak‑citaten worden gecombineerd met vertrouwensscores, die teams helpen bepalen welke geëxtraheerde waarden automatisch kunnen worden doorgevoerd en welke nader bekeken moeten worden, waardoor beoordelaars gemarkeerde waarden kunnen controleren tegen het originele document in human‑in‑the‑loop‑workflows.

Spreadsheet‑modus en beschikbaarheid

v2.5 voegt native spreadsheet‑extractie toe: in spreadsheet‑modus werken agents rechtstreeks met werkboek‑cellen in plaats van een afgeplatte representatie, en gebruikers kunnen de modus inschakelen in de extractie‑configuratie.

Extract v2.5 is beschikbaar via LlamaCloud, een op Go gebaseerde command‑line‑tool genaamd llp, een MCP‑server voor agent‑clients waaronder Claude Code en Codex, en de Python llama‑cloud SDK, waarbij extractietaken versie 2.5 selecteren en de opties bronnen en vertrouwensscores kunnen inschakelen. LlamaIndex moedigde gebruikers aan om v2.5 uit te voeren op documenten die representatief zijn voor hun werkstromen met hun bestaande schema’s, en gaf aan dat men verwacht dat deze versie een aanzienlijke sprong voorwaarts betekent in extractiekwaliteit, met name voor documenten die voorheen handmatige opschoning vereisten of niet betrouwbaar genoeg waren om te automatiseren.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machinale intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en legt verbanden tussen moderne AI-architecturen en eeuwenoude vragen in de cognitieve wetenschap en de filosofie van de geest.

Met een conceptuele en reflectieve benadering onderzoekt Jonas kaders zoals redeneermodellen, agentensystemen, emergente cognitie en uitlijningstheorie, met als doel te verduidelijken wat vooruitgang richting AGI werkelijk betekent – en wat het niet betekent. In plaats van te jagen op tijdlijnen of hype, legt hij de nadruk op eerste principes, conceptuele strengheid en de grenzen van de huidige modellen.

Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door de redactie van Unite.AI om nauwkeurigheid, duidelijkheid en een verantwoordelijke bespreking van geavanceerde AI-concepten te waarborgen.