Modele i platformy AI
LlamaIndex wprowadza Extract V2.5 z poprawą dokładności i uzasadnienia

LlamaIndex wprowadził Extract v2.5 1 października 2026 r., nową generację swoich agentów ekstrakcji dokumentów opartych na schematach. W post na blogu autorstwa Adriana Lyjaka i Eli Stewarta firma poinformowała o poprawie dokładności we wszystkich trzech poziomach ekstrakcji oraz o zwiększonym uzasadnieniu dla dwóch najwyższych poziomów, Agentic i Agentic Plus, i zaznaczyła, że zyski nie wiążą się ze wzrostem ceny za stronę.
Zyski w benchmarku według poziomów
LlamaIndex poinformował, że w benchmarku ExtractBench, otwartym benchmarku ekstrakcji dokumentów, ogólna wartość F1 wzrosła z 87,1 do 93,9 dla poziomu Cost Effective, z 89,8 do 95,8 dla Agentic oraz z 95,1 do 96,4 dla Agentic Plus, jego najdokładniejszego poziomu. Według firmy, Cost Effective obecnie przewyższa poprzedni poziom Agentic, a Agentic przewyższa wcześniejszy Agentic Plus.
ExtractBench testuje 370 dokumentów korporacyjnych obejmujących 4 869 stron w 8 obszarach biznesowych i 67 typach dokumentów, przy czym każdy typ ma własny schemat. LlamaIndex opublikował benchmark wraz z publicznym zestawem danych, harnessem oceny i metodologią oraz ocenił na nim najnowocześniejsze VLM‑y, agenty kodujące i wyspecjalizowane API ekstrakcji.
Nowy harness agenta i rozumowanie strukturalne
Firma oświadczyła, że v2.5 działa na nowym harnessie agenta zaprojektowanym specjalnie do ekstrakcji dokumentów, czerpiąc inspirację z najnowszych agentów kodujących i dostosowany do modeli w celu obsługi trybów awaryjnych w zakresie widzenia, rozumowania i weryfikacji. LlamaIndex stwierdził, że powstały agent może odwoływać się do kontekstu z wielu stron i powiązywać wartości z dokładnymi źródłami.
Funkcja, którą post nazywa Rozumowaniem Strukturalnym, działa na reprezentacjach dokumentów, aby dostosować ekstrakcję w zależności od typu dokumentu, układu i gęstości informacji: agent poświęca więcej wysiłku na złożone dokumenty i przetwarza prostsze z niższą opóźnieniem. W wersji v2.5 zespół przeniósł harness używany w Agentic Plus do poziomów Cost Effective i Agentic, dostosowując jego narzędzia i strategie ekstrakcji do ograniczeń kosztowych każdego poziomu po ocenie reprezentacji dokumentów, narzędzi i konfiguracji modeli. Firma dodała również, że pracowała nad tym, jak agenci podążają za schematami i instrukcjami ekstrakcji, w tym nad zadaniami obejmującymi do 3 200 pól, i radzi użytkownikom, których identyfikatory rekordów są niezbędne do dopasowania wyekstrahowanych rekordów do bazy danych, aby uwzględnić to w swoich poleceniach.
Długie listy, rekordy rozciągające się na wiele stron i zeskanowane formularze
W zadaniach z długimi listami LlamaIndex odnotował wzrost wyników z 82,0 do 92,6 dla poziomu Cost Effective, z 86,1 do 95,5 dla Agentic oraz z 94,5 do 96,3 dla Agentic Plus. Firma poinformowała, że v2.5 wykorzystuje reprezentacje pośrednie do pracy z pełnym zestawem danych i weryfikuje swoje wyniki względem schematu użytkownika. W jednym przykładzie, 17‑stronicowym zgłoszeniu funduszu, poprzedni poziom Cost Effective zwrócił 87 z 238 pozycji; firma stwierdziła, że v2.5 zwraca wszystkie 238, podnosząc wynik ekstrakcji tego dokumentu z 52,8 do 98,7.
W przypadku rekordów rozciągających się na wiele stron odnotowano wzrost wyników z 80,3 do 92,0 dla Cost Effective, z 85,5 do 96,5 dla Agentic oraz z 93,6 do 96,7 dla Agentic Plus. W harmonogramie grantów United Way Worldwide Schedule I firma poinformowała, że Agentic v2.0 zatrzymał się na podziale strony, pozostawiając cel i adres grantu niekompletne, podczas gdy v2.5 uwzględnia kontynuację z kolejnej strony w tym samym rekordzie.
W przypadku zeskanowanych formularzy odnotowano wzrost wyników z 89,6 do 93,9 dla Cost Effective, z 90,9 do 95,7 dla Agentic oraz z 94,4 do 96,1 dla Agentic Plus. W przypadku oznaczonej pozwolenia na usuwanie W‑14 firma poinformowała, że poziom Agentic wcześniej łączył datę recenzenta z numerem pozwolenia i dopisywał notatkę recenzenta do głębokości wód słodkich, podczas gdy v2.5 oddziela oryginalne wartości od adnotacji do pól określonych w schemacie.
Zaawansowane cytowania i uzasadnienie
Wydanie wprowadza Zaawansowane Cytowania dla poziomów Agentic i Agentic Plus, które lokalizują ramki ograniczające dowody wspierające trudne pola, w tym wartości, które nie występują słowo w słowo w dokumencie. Wstępna wersja była wcześniej dostępna w Agentic Plus; LlamaIndex stwierdził, że dalej poprawił dokładność uzasadnienia tej funkcji i rozszerzył ją na poziom Agentic. Firma podała, że wyniki uzasadnienia w ExtractBench wzrosły z 46,8 do 80,6 dla Agentic oraz z 46,4 do 82,2 dla Agentic Plus. Jej wykres porównawczy wymienia wyniki uzasadnienia: 63,2 dla Sonnet 5.5, 77,6 dla GPT‑6 SOL, 77,5 dla Opus 5.5, 50,8 dla Reducto Deep Extract, 21,8 dla Extend Max oraz 54,3 dla własnego poziomu Cost Effective.
Firma poinformowała, że cytowania w postaci ramki ograniczającej łączą się z ocenami pewności, co pomaga zespołom decydować, które wyekstrahowane wartości mogą być przetwarzane automatycznie, a które wymagają dokładniejszej analizy, umożliwiając recenzentom sprawdzanie oznaczonych wartości w odniesieniu do oryginalnego dokumentu w procesach z udziałem człowieka.
Tryb arkusza kalkulacyjnego i dostępność
v2.5 dodaje natywną ekstrakcję arkuszy kalkulacyjnych: w trybie arkusza kalkulacyjnego agenci pracują bezpośrednio z komórkami skoroszytu, a nie ze spłaszczoną reprezentacją, i użytkownicy mogą włączyć ten tryb w konfiguracji ekstrakcji.
Extract v2.5 jest dostępny poprzez LlamaCloud, narzędzie wiersza poleceń oparte na Go o nazwie llp, serwer MCP dla klientów‑agentów, w tym Claude Code i Codex, oraz SDK Pythona llama‑cloud, gdzie zadania ekstrakcji wybierają wersję 2.5 i mogą włączyć opcję citeźródła i pewnośćscores. LlamaIndex zachęcał użytkowników do uruchamiania v2.5 na dokumentach reprezentatywnych dla ich przepływów pracy, używając istniejących schematów, i stwierdził, że spodziewa się, iż wersja będzie znaczącym postępem w jakości ekstrakcji, szczególnie dla dokumentów, które wcześniej wymagały ręcznego czyszczenia lub nie były wystarczająco wiarygodne, aby je zautomatyzować.












