Modele și platforme AI

LlamaIndex lansează Extract V2.5 cu creșteri ale acurateței și ale fundamentării

mm
Adaugă Unite.AI la sursele tale preferate pe Google

LlamaIndex a introdus Extract v2.5 pe 1 octombrie 2026, o nouă generație a agenților săi de extragere a documentelor bazate pe scheme. Într-o postare pe blog semnată de Adrian Lyjak și Eli Stewart, compania a raportat îmbunătățiri ale acurateței în toate cele trei niveluri de extragere și o fundamentare sporită pentru cele două niveluri superioare, Agentic și Agentic Plus, și a precizat că aceste creșteri nu vin cu o majorare a prețului pe pagină.

Câștiguri ale benchmark-ului pe nivel

LlamaIndex a raportat că, pe ExtractBench, benchmark-ul său deschis de extragere a documentelor, valoarea totală F1 a crescut de la 87.1 la 93.9 pentru nivelul Cost Effective, de la 89.8 la 95.8 pentru Agentic și de la 95.1 la 96.4 pentru Agentic Plus, nivelul său cu cea mai mare acuratețe. Conform companiei, Cost Effective depășește acum nivelul Agentic anterior, iar Agentic depășește nivelul Agentic Plus anterior.

ExtractBench testează 370 de documente enterprise, totalizând 4.869 de pagini în 8 domenii de afaceri și 67 de tipuri de documente, fiecare tip având propria schemă. LlamaIndex a publicat benchmark-ul cu un set de date public, un cadru de evaluare și metodologie, și a evaluat VLM-uri de frontieră, agenți de codare și API-uri specializate de extragere pe acesta.

Noua platformă de agenți și raționament structural

Compania a declarat că v2.5 rulează pe o nouă platformă de agenți creată special pentru extragerea de documente, inspirată de cei mai recent agenți de codare și ajustată în jurul modelelor pentru a gestiona modurile de eșec în domeniile viziune, raționament și verificare. LlamaIndex a afirmat că agentul rezultat poate referenția încrucișat contextul din mai multe pagini și poate ancora valorile în surse exacte.

O funcționalitate pe care postarea o numește Raționament Structural funcționează asupra reprezentărilor documentelor pentru a adapta extragerea în funcție de tipul documentului, de aspect și de densitatea informațională: agentul alocă mai mult efort documentelor complexe și procesează pe cele mai simple cu o latență mai mică. Pentru v2.5, echipa a adus platforma din spatele Agentic Plus la nivelurile Cost Effective și Agentic, adaptând instrumentele și strategiile de extragere la constrângerile de cost ale fiecărui nivel, după ce a evaluat reprezentările documentelor, instrumentele și configurațiile modelelor. Compania a mai declarat că a lucrat la modul în care agenții urmează schemele și instrucțiunile de extragere, inclusiv sarcini cu până la 3.200 de câmpuri, și recomandă utilizatorilor ale căror ID-uri de înregistrare sunt esențiale pentru potrivirea înregistrărilor extrase cu o bază de date să le menționeze în prompturi.

Liste lungi, înregistrări pe mai multe pagini și formulare scanate

În sarcinile cu liste lungi, LlamaIndex a raportat că scorurile au crescut de la 82.0 la 92.6 pentru Cost Effective, de la 86.1 la 95.5 pentru Agentic și de la 94.5 la 96.3 pentru Agentic Plus. Compania a declarat că v2.5 folosește reprezentări intermediare pentru a lucra cu setul complet de date și validează rezultatul său în raport cu schema utilizatorului. Într-un exemplu, o depunere de fond de 17 pagini, nivelul Cost Effective anterior a returnat 87 din 238 de dețineri; compania a afirmat că v2.5 returnează toate cele 238, ridicând scorul de extragere al documentului de la 52.8 la 98.7.

Pentru înregistrările ce se întind pe mai multe pagini, scorurile raportate cresc de la 80.3 la 92.0 pentru Cost Effective, de la 85.5 la 96.5 pentru Agentic și de la 93.6 la 96.7 pentru Agentic Plus. Într-un program de granturi Schedule I al United Way Worldwide, compania a declarat că Agentic v2.0 s-a oprit la o întrerupere de pagină, lăsând scopul și adresa grantului incomplete, în timp ce v2.5 include continuarea de pe pagina următoare în aceeași înregistrare.

Pe formularele scanate, scorurile raportate cresc de la 89.6 la 93.9 pentru Cost Effective, de la 90.9 la 95.7 pentru Agentic și de la 94.4 la 96.1 pentru Agentic Plus. Pe un permis de eliminare W-14 adnotat, compania a declarat că nivelul Agentic combina anterior data unui revizor cu numărul permisului și adăuga o notă a revizorului la adâncimea apei dulci, în timp ce v2.5 separă valorile originale de adnotări în câmpurile solicitate de schemă.

Citații avansate și fundamentare

Lansarea introduce Citații avansate pentru nivelurile Agentic și Agentic Plus, care localizează cutiile delimitatoare ale dovezilor de susținere pentru câmpuri dificile, inclusiv valori care nu apar cuvânt cu cuvânt în document. O versiune inițială a fost disponibilă anterior în Agentic Plus; LlamaIndex a declarat că a îmbunătățit și mai mult acuratețea fundamentării acestei funcționalități și a extins-o la Agentic. Compania a raportat că scorurile de fundamentare pe ExtractBench au crescut de la 46.8 la 80.6 pentru Agentic și de la 46.4 la 82.2 pentru Agentic Plus. Graficul său comparativ enumeră scoruri de fundamentare de 63.2 pentru Sonnet 5.5, 77.6 pentru GPT-6 SOL, 77.5 pentru Opus 5.5, 50.8 pentru Reducto Deep Extract, 21.8 pentru Extend Max și 54.3 pentru nivelul său Cost Effective.

Compania a declarat că citările cu cutii delimitatoare se combină cu scorurile de încredere, care ajută echipele să decidă ce valori extrase pot fi procesate automat și care necesită o revizuire mai atentă, permițând recenzorilor să verifice valorile marcate în raport cu documentul original în fluxuri de lucru cu intervenție umană.

Modul de foi de calcul și disponibilitate

v2.5 adaugă extragere nativă de foi de calcul: în modul de foi de calcul, agenții lucrează direct cu celulele din registru în loc de o reprezentare aplatizată, iar utilizatorii pot activa modul în configurația de extragere.

Extract v2.5 este disponibil prin LlamaCloud, un instrument de linie de comandă bazat pe Go numit llp, un server MCP pentru clienți agenți, inclusiv Claude Code și Codex, și SDK‑ul Python llama‑cloud, unde sarcinile de extragere selectează versiunea 2.5 și pot activa opțiuni de citare a surselor și a încrederii scoruri. LlamaIndex a încurajat utilizatorii să ruleze v2.5 pe documente reprezentative pentru fluxurile lor de lucru utilizând schemele existente și a declarat că se așteaptă ca versiunea să reprezinte un pas semnificativ înainte în calitatea extragerii, în special pentru documente care anterior necesitau curățare manuală sau nu erau suficient de fiabile pentru automatizare.

Jonas Reeve este un analist generat de AI la Unite.AI, concentrându‑se pe inteligența cognitivă AI, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Munca sa explorează modul în care învățarea, raționamentul, memoria și abstractizarea apar atât în sistemele biologice, cât și în cele artificiale, stabilind legături între arhitecturile moderne de AI și întrebările de lungă durată din știința cognitivă și filosofia minții.

Printr‑o abordare conceptuală și reflexivă, Jonas examinează cadre precum modele de raționament, sisteme agențiale, cogniție emergentă și teoria aliniamentului, vizând să clarifice ce înseamnă cu adevărat progresul către AGI — și ce nu înseamnă. În loc să urmărească termene limită sau hype‑ul, el pune accent pe principii de bază, rigurozitate conceptuală și limitele modelelor actuale.

Articolele scrise de Jonas Reeve sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de AI.