Model dan platform AI

LlamaIndex Meluncurkan Extract V2.5 dengan Peningkatan Akurasi dan Grounding

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

LlamaIndex memperkenalkan Extract v2.5 pada 1 Oktober 2026, generasi baru agen ekstraksi dokumen berbasis skema. Dalam sebuah posting blog yang ditulis oleh Adrian Lyjak dan Eli Stewart, perusahaan melaporkan peningkatan akurasi di ketiga tingkatan ekstraksi serta peningkatan grounding untuk dua tingkatan tertinggi, Agentic dan Agentic Plus, dan menyatakan bahwa peningkatan tersebut tidak meningkatkan harga per halaman.

Peningkatan Benchmark Tiap Tingkat

LlamaIndex melaporkan bahwa pada ExtractBench, benchmark ekstraksi dokumen terbuka mereka, nilai F1 keseluruhan naik dari 87.1 menjadi 93.9 untuk tingkatan Cost Effective, dari 89.8 menjadi 95.8 untuk Agentic, dan dari 95.1 menjadi 96.4 untuk Agentic Plus, tingkatan dengan akurasi tertinggi. Menurut perusahaan, Cost Effective kini mengungguli tingkatan Agentic sebelumnya, dan Agentic mengungguli Agentic Plus yang sebelumnya.

ExtractBench menguji 370 dokumen perusahaan dengan total 4.869 halaman meliputi 8 domain bisnis dan 67 tipe dokumen, masing‑masing dengan skema sendiri. LlamaIndex mempublikasikan benchmark tersebut dengan dataset publik, harness evaluasi, dan metodologi, serta telah mengevaluasi VLM frontier, agen pemrograman, dan API ekstraksi khusus di atasnya.

Kerangka Agen Baru dan Penalaran Struktural

Perusahaan menyatakan bahwa v2.5 berjalan pada kerangka agen baru yang dirancang khusus untuk ekstraksi dokumen, mengambil inspirasi dari agen pemrograman terbaru dan disesuaikan dengan model untuk menangani mode kegagalan pada visi, penalaran, dan verifikasi. LlamaIndex mengatakan bahwa agen yang dihasilkan dapat menyeberang‑referensi konteks dari beberapa halaman dan menempatkan nilai pada sumber yang tepat.

Fitur yang disebut dalam postingan sebagai Penalaran Struktural bekerja pada representasi dokumen untuk menyesuaikan ekstraksi berdasarkan tipe dokumen, tata letak, dan kepadatan informasi: agen menghabiskan lebih banyak usaha pada dokumen kompleks dan memproses yang lebih sederhana dengan latensi lebih rendah. Untuk v2.5, tim membawa kerangka di belakang Agentic Plus ke tingkatan Cost Effective dan Agentic, menyesuaikan alat dan strategi ekstraksi masing‑masing dengan batas biaya tiap tingkatan setelah mengevaluasi representasi dokumen, alat, dan konfigurasi model. Perusahaan juga menyatakan bahwa mereka bekerja pada cara agen mengikuti skema dan instruksi ekstraksi, termasuk tugas dengan hingga 3.200 bidang, dan menyarankan pengguna yang ID catatannya penting untuk mencocokkan catatan yang diekstrak dengan basis data agar menyorot hal tersebut dalam prompt mereka.

Daftar Panjang, Catatan Lintas Halaman, dan Formulir Pindai

Pada tugas daftar panjang, LlamaIndex melaporkan skor naik dari 82.0 menjadi 92.6 untuk Cost Effective, dari 86.1 menjadi 95.5 untuk Agentic, dan dari 94.5 menjadi 96.3 untuk Agentic Plus. Perusahaan menyatakan bahwa v2.5 menggunakan representasi menengah untuk bekerja dengan seluruh dataset dan memvalidasi outputnya terhadap skema pengguna. Dalam satu contoh, pengajuan dana sepanjang 17 halaman, tingkatan Cost Effective sebelumnya mengembalikan 87 dari 238 kepemilikan; perusahaan mengatakan v2.5 mengembalikan semua 238, meningkatkan skor ekstraksi dokumen tersebut dari 52.8 menjadi 98.7.

Pada catatan yang melintasi halaman, skor yang dilaporkan naik dari 80.3 menjadi 92.0 untuk Cost Effective, dari 85.5 menjadi 96.5 untuk Agentic, dan dari 93.6 menjadi 96.7 untuk Agentic Plus. Dalam jadwal hibah United Way Worldwide Schedule I, perusahaan mengatakan bahwa Agentic v2.0 berhenti pada pemisahan halaman, sehingga tujuan dan alamat hibah tidak lengkap, sementara v2.5 menyertakan kelanjutan dari halaman berikutnya dalam catatan yang sama.

Pada formulir pindai, skor yang dilaporkan naik dari 89.6 menjadi 93.9 untuk Cost Effective, dari 90.9 menjadi 95.7 untuk Agentic, dan dari 94.4 menjadi 96.1 untuk Agentic Plus. Pada izin pembuangan W-14 yang dianotasi, perusahaan mengatakan bahwa tingkatan Agentic sebelumnya menggabungkan tanggal peninjau dengan nomor izin dan menambahkan catatan peninjau ke kedalaman air tawar, sementara v2.5 memisahkan nilai asli dari anotasi ke dalam bidang yang diminta oleh skema.

Sitasi Lanjutan dan Grounding

Rilis ini memperkenalkan Sitasi Lanjutan untuk tingkatan Agentic dan Agentic Plus, yang menemukan kotak pembatas bukti pendukung untuk bidang yang sulit, termasuk nilai yang tidak muncul kata demi kata dalam dokumen. Versi awal sebelumnya tersedia di Agentic Plus; LlamaIndex mengatakan bahwa mereka lebih meningkatkan akurasi grounding fitur tersebut dan memperluasnya ke Agentic. Perusahaan melaporkan skor grounding ExtractBench naik dari 46.8 menjadi 80.6 untuk Agentic dan dari 46.4 menjadi 82.2 untuk Agentic Plus. Diagram perbandingannya menampilkan skor grounding 63.2 untuk Sonnet 5.5, 77.6 untuk GPT-6 SOL, 77.5 untuk Opus 5.5, 50.8 untuk Reducto Deep Extract, 21.8 untuk Extend Max, dan 54.3 untuk tingkatan Cost Effective milik mereka.

Perusahaan menyatakan bahwa sitasi kotak pembatas digabungkan dengan skor kepercayaan, yang membantu tim memutuskan nilai ekstraksi mana yang dapat diproses secara otomatis dan mana yang memerlukan pemeriksaan lebih lanjut, memungkinkan peninjau memeriksa nilai yang ditandai terhadap dokumen asli dalam alur kerja manusia‑in‑the‑loop.

Mode Spreadsheet dan Ketersediaan

v2.5 menambahkan ekstraksi spreadsheet asli: dalam mode spreadsheet, agen bekerja langsung dengan sel lembar kerja alih‑alih representasi datar, dan pengguna dapat mengaktifkan mode ini dalam konfigurasi ekstraksi.

Extract v2.5 tersedia melalui LlamaCloud, sebuah alat baris perintah berbasis Go bernama llp, server MCP untuk klien agen termasuk Claude Code dan Codex, serta SDK Python llama-cloud, di mana pekerjaan ekstraksi memilih versi 2.5 dan dapat mengaktifkan opsi cite sumber dan kepercayaan skor. LlamaIndex mendorong pengguna untuk menjalankan v2.5 pada dokumen yang mewakili alur kerja mereka menggunakan skema yang sudah ada, dan menyatakan bahwa versi ini diharapkan menjadi peningkatan signifikan dalam kualitas ekstraksi, terutama untuk dokumen yang sebelumnya memerlukan pembersihan manual atau tidak cukup dapat diandalkan untuk otomatisasi.

Jonas Reeve adalah analis yang dihasilkan AI di Unite.AI, yang berfokus pada AI kognitif, kecerdasan umum buatan (AGI), dan dasar teoretis kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul baik dalam sistem biologis maupun buatan, serta menghubungkan arsitektur AI modern dengan pertanyaan-pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.

Dengan pendekatan konseptual dan reflektif, Jonas meneliti kerangka kerja seperti model penalaran, sistem agen, kognisi emergen, dan teori penyelarasan, dengan tujuan memperjelas apa arti sebenarnya kemajuan menuju AGI—dan apa yang tidak. Alih-alih mengejar jadwal atau hype, ia menekankan prinsip pertama, ketelitian konseptual, dan batasan model saat ini.

Artikel yang ditulis oleh Jonas Reeve dihasilkan AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI tingkat lanjut.