KI-Modelle und Plattformen

LlamaIndex führt Extract V2.5 mit Genauigkeits‑ und Grundlagenerweiterungen ein

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

LlamaIndex stellte Extract v2.5 am 1. Oktober 2026 vor, eine neue Generation seiner schemabasierten Dokumentextraktions‑Agenten. In einem Blogbeitrag von Adrian Lyjak und Eli Stewart berichtete das Unternehmen über Genauigkeitsverbesserungen in allen drei Extraktionsstufen sowie über verbesserte Grundlagenermittlung für die beiden höchsten Stufen, Agentic und Agentic Plus, und erklärte, dass die Verbesserungen ohne Erhöhung der Preisgestaltung pro Seite auskommen.

Stufenweise Benchmark‑Gewinne

LlamaIndex berichtete, dass auf ExtractBench, seinem offenen Dokument‑Extraktions‑Benchmark, der gesamte F1‑Wert von 87,1 auf 93,9 für die Stufe Cost Effective, von 89,8 auf 95,8 für Agentic und von 95,1 auf 96,4 für Agentic Plus, die höchste‑Genauigkeits‑Stufe, gestiegen ist. Laut dem Unternehmen übertrifft Cost Effective nun die vorherige Agentic‑Stufe, und Agentic übertrifft das frühere Agentic Plus.

ExtractBench testet 370 Unternehmensdokumente mit insgesamt 4.869 Seiten über 8 Geschäftsbereiche und 67 Dokumenttypen, wobei jeder Typ ein eigenes Schema hat. LlamaIndex veröffentlichte den Benchmark mit einem öffentlichen Datensatz, einer Evaluations‑Umgebung und Methodik und hat darauf modernste VLMs, Coding‑Agenten und spezialisierte Extraktions‑APIs evaluiert.

Neues Agenten‑Framework und strukturelles Denken

Das Unternehmen erklärte, dass v2.5 auf einem neuen, speziell für die Dokumentextraktion entwickelten Agenten‑Framework läuft, das sich an den neuesten Coding‑Agenten orientiert und auf die Modelle abgestimmt ist, um Fehlermodi in den Bereichen Vision, Argumentation und Verifikation zu bewältigen. LlamaIndex sagte, dass der daraus resultierende Agent Kontext aus mehreren Seiten miteinander verknüpfen und Werte in genauen Quellen verankern kann.

Eine vom Beitrag als „Structural Reasoning“ bezeichnete Fähigkeit arbeitet mit Dokumentrepräsentationen, um die Extraktion anhand von Dokumenttyp, Layout und Informationsdichte anzupassen: Der Agent investiert mehr Aufwand bei komplexen Dokumenten und verarbeitet einfachere mit geringerer Latenz. Für v2.5 hat das Team das Framework, das hinter Agentic Plus steckt, auf die Stufen Cost Effective und Agentic übertragen und dessen Werkzeuge sowie Extraktionsstrategien an die jeweiligen Kostengrenzen angepasst, nachdem Dokumentrepräsentationen, Werkzeuge und Modellkonfigurationen evaluiert wurden. Das Unternehmen erklärte zudem, dass es an der Art und Weise gearbeitet habe, wie Agenten Schemas und Extraktionsanweisungen folgen, einschließlich Aufgaben mit bis zu 3.200 Feldern, und empfiehlt Nutzern, deren Datensatz‑IDs für die Zuordnung extrahierter Datensätze zu einer Datenbank entscheidend sind, diese in ihren Eingabeaufforderungen explizit zu erwähnen.

Lange Listen, über Seiten hinweg verbundene Datensätze und gescannte Formulare

Bei Aufgaben mit langen Listen berichtete LlamaIndex von einer Steigerung der Werte von 82,0 auf 92,6 für Cost Effective, von 86,1 auf 95,5 für Agentic und von 94,5 auf 96,3 für Agentic Plus. Das Unternehmen erklärte, dass v2.5 Zwischenrepräsentationen nutzt, um mit dem gesamten Datensatz zu arbeiten und die Ausgabe anhand des Schemas des Nutzers zu validieren. In einem Beispiel, einer 17‑seitigen Fondsanmeldung, lieferte die vorherige Cost‑Effective‑Stufe 87 von 238 Positionen; das Unternehmen sagte, v2.5 gebe alle 238 zurück und erhöhe die Extraktionsbewertung dieses Dokuments von 52,8 auf 98,7.

Bei über mehrere Seiten erstreckenden Datensätzen stiegen die gemeldeten Werte von 80,3 auf 92,0 für Cost Effective, von 85,5 auf 96,5 für Agentic und von 93,6 auf 96,7 für Agentic Plus. In einem United Way Worldwide Schedule‑I‑Zuschussplan sagte das Unternehmen, dass Agentic v2.0 an einem Seitenumbruch stoppte und dadurch Zweck und Adresse eines Zuschusses unvollständig blieben, während v2.5 die Fortsetzung von der nächsten Seite in denselben Datensatz einbezieht.

Bei gescannten Formularen stiegen die gemeldeten Werte von 89,6 auf 93,9 für Cost Effective, von 90,9 auf 95,7 für Agentic und von 94,4 auf 96,1 für Agentic Plus. Bei einer annotierten W‑14‑Entsorgungsgenehmigung erklärte das Unternehmen, dass die Agentic‑Stufe zuvor das Datum eines Prüfers mit der Genehmigungsnummer kombiniert und eine Prüfer‑Notiz zur Süßwassertiefe hinzugefügt habe, während v2.5 die ursprünglichen Werte von den Anmerkungen trennt und sie in die vom Schema geforderten Felder einordnet.

Erweiterte Zitate und Grundlagenermittlung

Die Veröffentlichung führt erweiterte Zitate für die Stufen Agentic und Agentic Plus ein, die Begrenzungsrahmen von unterstützenden Belegen für schwierige Felder ermitteln, einschließlich Werte, die nicht wortwörtlich im Dokument vorkommen. Eine erste Version war bereits in Agentic Plus verfügbar; LlamaIndex erklärte, dass die Grundlagengenauigkeit dieser Funktion weiter verbessert und auf Agentic ausgeweitet wurde. Das Unternehmen berichtete, dass die ExtractBench‑Grundlagenscores von 46,8 auf 80,6 für Agentic und von 46,4 auf 82,2 für Agentic Plus gestiegen sind. In seiner Vergleichstabelle werden Grundlagenscores von 63,2 für Sonnet 5.5, 77,6 für GPT‑6 SOL, 77,5 für Opus 5.5, 50,8 für Reducto Deep Extract, 21,8 für Extend Max und 54,3 für die eigene Cost‑Effective‑Stufe aufgeführt.

Das Unternehmen erklärte, dass Bounding‑Box‑Zitate mit Vertrauensscores kombiniert werden, was Teams dabei unterstützt zu entscheiden, welche extrahierten Werte automatisch weiterverarbeitet werden können und welche einer genaueren Prüfung bedürfen, sodass Prüfer markierte Werte im Originaldokument im Human‑in‑the‑Loop‑Workflow überprüfen können.

Tabellenmodus und Verfügbarkeit

v2.5 fügt eine native Tabellen‑Extraktion hinzu: Im Tabellenmodus arbeiten Agenten direkt mit den Zellen einer Arbeitsmappe statt mit einer abgeflachten Darstellung, und Nutzer können den Modus in der Extraktionskonfiguration aktivieren.

Extract v2.5 ist über LlamaCloud, ein auf Go basierendes Kommandozeilen-Tool namens llp, einen MCP-Server für Agenten-Clients einschließlich Claude Code und Codex sowie das Python llama-cloud SDK verfügbar, wobei Extraktionsaufträge Version 2.5 auswählen und die Option zum ZitierenQuellen und Konfidenzwerte aktivieren können. LlamaIndex ermutigte die Nutzer, v2.5 auf Dokumenten zu testen, die ihren Arbeitsabläufen entsprechen und ihre bestehenden Schemata verwenden, und sagte, dass die Version einen deutlichen Sprung in der Extraktionsqualität darstelle, insbesondere für Dokumente, die zuvor manuell bereinigt werden mussten oder nicht zuverlässig genug für die Automatisierung waren.

Jonas Reeve ist ein KI-generierter Analyst bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.