Modelli e piattaforme di IA

LlamaIndex lancia Extract V2.5 con miglioramenti di precisione e grounding

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

LlamaIndex ha introdotto Extract v2.5 il 1 ottobre 2026, una nuova generazione dei suoi agenti di estrazione documenti basati su schema. In un post del blog firmato Adrian Lyjak e Eli Stewart, l’azienda ha segnalato miglioramenti di accuratezza su tutti e tre i suoi livelli di estrazione e un grounding potenziato per i due livelli più alti, Agentic e Agentic Plus, e ha dichiarato che i miglioramenti non comportano alcun aumento del prezzo per pagina.

Miglioramenti dei benchmark per livello

LlamaIndex ha riferito che su ExtractBench, il suo benchmark aperto di estrazione documenti, il valore complessivo F1 è salito da 87,1 a 93,9 per il livello Cost Effective, da 89,8 a 95,8 per Agentic e da 95,1 a 96,4 per Agentic Plus, il suo livello di massima accuratezza. Secondo l’azienda, Cost Effective ora supera il precedente livello Agentic, e Agentic supera il precedente Agentic Plus.

ExtractBench testa 370 documenti aziendali per un totale di 4.869 pagine, distribuiti su 8 settori di business e 67 tipologie di documenti, ciascuna con il proprio schema. LlamaIndex ha pubblicato il benchmark con un dataset pubblico, un harness di valutazione e una metodologia, e ha valutato VLM all’avanguardia, agenti di codifica e API di estrazione specializzate su di esso.

Nuovo harness per agenti e ragionamento strutturale

L’azienda ha dichiarato che v2.5 funziona su un nuovo harness per agenti progettato appositamente per l’estrazione di documenti, ispirandosi agli ultimi agenti di codifica e ottimizzato attorno ai modelli per gestire i casi di errore in ambito visivo, di ragionamento e di verifica. LlamaIndex ha affermato che l’agente risultante può fare riferimento incrociato al contesto di più pagine e ancorare i valori alle fonti esatte.

Una funzionalità, definita nel post come Structural Reasoning, opera sulle rappresentazioni dei documenti per personalizzare l’estrazione in base al tipo di documento, al layout e alla densità informativa: l’agente dedica più risorse ai documenti complessi e elabora quelli più semplici con latenza ridotta. Per v2.5, il team ha trasferito il harness utilizzato in Agentic Plus ai livelli Cost Effective e Agentic, adattando i suoi strumenti e le strategie di estrazione ai vincoli di costo di ciascun livello dopo aver valutato le rappresentazioni dei documenti, gli strumenti e le configurazioni dei modelli. L’azienda ha inoltre dichiarato di aver lavorato su come gli agenti seguono gli schemi e le istruzioni di estrazione, includendo compiti con fino a 3.200 campi, e consiglia agli utenti i cui ID record sono essenziali per abbinare i record estratti a un database di evidenziarlo nei loro prompt.

Liste lunghe, record su più pagine e moduli scannerizzati

Per i compiti con liste lunghe, LlamaIndex ha riportato che i punteggi sono passati da 82,0 a 92,6 per Cost Effective, da 86,1 a 95,5 per Agentic e da 94,5 a 96,3 per Agentic Plus. L’azienda ha dichiarato che v2.5 utilizza rappresentazioni intermedie per lavorare con l’intero dataset e valida il risultato rispetto allo schema dell’utente. In un esempio, una presentazione di fondi di 17 pagine, il livello Cost Effective precedente restituiva 87 su 238 partecipazioni; l’azienda ha affermato che v2.5 restituisce tutte le 238, elevando il punteggio di estrazione di quel documento da 52,8 a 98,7.

Per i record che si estendono su più pagine, i punteggi segnalati sono aumentati da 80,3 a 92,0 per Cost Effective, da 85,5 a 96,5 per Agentic e da 93,6 a 96,7 per Agentic Plus. In un programma di sovvenzioni Schedule I di United Way Worldwide, l’azienda ha affermato che Agentic v2.0 si fermava a un’interruzione di pagina, lasciando incompleti lo scopo e l’indirizzo della sovvenzione, mentre v2.5 include la continuazione dalla pagina successiva nello stesso record.

Per i moduli scannerizzati, i punteggi segnalati sono aumentati da 89,6 a 93,9 per Cost Effective, da 90,9 a 95,7 per Agentic e da 94,4 a 96,1 per Agentic Plus. Su un permesso di smaltimento W-14 annotato, l’azienda ha dichiarato che il livello Agentic in precedenza combinava la data del revisore con il numero del permesso e aggiungeva una nota del revisore alla profondità dell’acqua dolce, mentre v2.5 separa i valori originali dalle annotazioni nei campi richiesti dallo schema.

Citazioni avanzate e grounding

Il rilascio introduce le Citazioni avanzate per i livelli Agentic e Agentic Plus, che individuano le bounding box delle prove di supporto per i campi difficili, includendo valori che non compaiono parola per parola nel documento. Una versione iniziale era già disponibile in Agentic Plus; LlamaIndex ha affermato di aver ulteriormente migliorato la precisione di grounding della funzionalità e di averla estesa a Agentic. L’azienda ha riportato che i punteggi di grounding di ExtractBench sono passati da 46,8 a 80,6 per Agentic e da 46,4 a 82,2 per Agentic Plus. Il suo grafico comparativo elenca i punteggi di grounding di 63,2 per Sonnet 5.5, 77,6 per GPT-6 SOL, 77,5 per Opus 5.5, 50,8 per Reducto Deep Extract, 21,8 per Extend Max e 54,3 per il proprio livello Cost Effective.

L’azienda ha dichiarato che le citazioni con bounding box si combinano con i punteggi di confidenza, i quali aiutano i team a decidere quali valori estratti possono procedere automaticamente e quali necessitano di un’analisi più approfondita, consentendo ai revisori di verificare i valori segnalati rispetto al documento originale nei flussi di lavoro con intervento umano.

Modalità foglio di calcolo e disponibilità

v2.5 aggiunge l’estrazione nativa di fogli di calcolo: in modalità foglio di calcolo, gli agenti lavorano direttamente con le celle della cartella di lavoro anziché con una rappresentazione appiattita, e gli utenti possono attivare la modalità nella configurazione di estrazione.

Extract v2.5 è disponibile tramite LlamaCloud, uno strumento da riga di comando basato su Go chiamato llp, un server MCP per client agente tra cui Claude Code e Codex, e l’SDK Python llama-cloud, dove i job di estrazione selezionano la versione 2.5 e possono abilitare l’opzione di citare fonti e punteggi di confidenza. LlamaIndex ha incoraggiato gli utenti a eseguire v2.5 su documenti rappresentativi dei loro flussi di lavoro usando gli schemi esistenti, e ha affermato di aspettarsi che la versione rappresenti un notevole passo avanti nella qualità dell’estrazione, in particolare per i documenti che in precedenza necessitavano di pulizia manuale o non erano sufficientemente affidabili per l’automazione.

Jonas Reeve è un analista generato dall'IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.