Yapay zeka modelleri ve platformları
LlamaIndex, Doğruluk ve Altyapı Kazançlarıyla Extract V2.5’i Başlattı

LlamaIndex, 1 Ekim 2026’da Extract v2.5’i tanıttı; bu, şema tabanlı belge çıkarma ajanlarının yeni neslini temsil ediyor. Adrian Lyjak ve Eli Stewart tarafından imzalanan bir blog gönderisi‘nde şirket, üç çıkarma katmanının tamamında doğruluk iyileştirmeleri ve en üst iki katman olan Agentic ve Agentic Plus için geliştirilmiş altyapı sağlandığını ve bu kazanımların sayfa başına fiyat artışı olmadan geldiğini bildirdi.
Katman Katman Kıyaslama Kazançları
LlamaIndex, açık belge çıkarma kıyaslaması ExtractBench’te, genel değer F1’in Cost Effective katmanında 87.1’den 93.9’a, Agentic’te 89.8’den 95.8’e ve en yüksek doğruluk katmanı olan Agentic Plus’ta 95.1’den 96.4’e yükseldiğini bildirdi. Şirkete göre, Cost Effective artık önceki Agentic katmanını, Agentic ise önceki Agentic Plus katmanını geride bırakıyor.
ExtractBench, 8 iş alanı ve 67 belge türü boyunca toplam 4.869 sayfadan oluşan 370 kurumsal belgeyi test eder; her türün kendi şeması vardır. LlamaIndex, bu kıyaslamayı halka açık bir veri kümesi, değerlendirme çerçevesi ve metodoloji ile yayınladı ve üzerinde öncü VLM’leri, kodlama ajanlarını ve özel çıkarma API’lerini değerlendirdi.
Yeni Ajan Çerçevesi ve Yapısal Akıl Yürütme
Şirket, v2.5’in belge çıkarımı için özel olarak tasarlanmış yeni bir ajan çerçevesi üzerinde çalıştığını, en yeni kodlama ajanlarından ilham aldığını ve modeller etrafında ayarlandığını, görme, akıl yürütme ve doğrulama üzerindeki hata modlarını ele alabileceğini söyledi. LlamaIndex, ortaya çıkan ajanın birden fazla sayfadan bağlamı çapraz referanslayabildiğini ve değerleri tam kaynaklarda temellendirebildiğini belirtti.
Yazının ‘Yapısal Akıl Yürütme’ olarak adlandırdığı yetenek, belge temsilleri üzerinde çalışarak çıkarımı belge türüne, düzenine ve bilgi yoğunluğuna göre özelleştirir: ajan, karmaşık belgelere daha fazla çaba harcar ve daha basit belgeleri daha düşük gecikmeyle işler. v2.5 için ekip, Agentic Plus arkasındaki çerçeveyi Cost Effective ve Agentic katmanlarına taşıdı, belge temsilleri, araçlar ve model yapılandırmaları değerlendirildikten sonra her katmanın maliyet kısıtlamalarına göre araçlarını ve çıkarma stratejilerini uyarladı. Şirket ayrıca, ajanların şemaları ve çıkarma talimatlarını nasıl izlediği üzerinde, 3.200 alana kadar görevler dahil olmak üzere çalıştığını ve çıkarılan kayıtları bir veritabanına eşleştirmek için kayıt kimliklerinin kritik olduğu kullanıcıların bunu istemlerinde belirtmelerini tavsiye etti.
Uzun Listeler, Sayfa Ötesi Kayıtlar ve Taralı Formlar
Uzun liste görevlerinde LlamaIndex, Cost Effective için puanların 82.0’tan 92.6’ya, Agentic için 86.1’den 95.5’e ve Agentic Plus için 94.5’ten 96.3’e yükseldiğini bildirdi. Şirket, v2.5’in tam veri kümesiyle çalışmak için ara temsiller kullandığını ve çıktısını kullanıcının şemasına karşı doğruladığını söyledi. Bir örnek olarak, 17 sayfalık bir fon dosyasında, önceki Cost Effective katmanı 238 varlığın 87’sini döndürürken; şirket v2.5’in tüm 238’i döndürdüğünü ve belge çıkarım puanını 52.8’den 98.7’ye çıkardığını belirtti.
Sayfalar arasında uzanan kayıtlarda, Cost Effective için puanların 80.3’ten 92.0’a, Agentic için 85.5’ten 96.5’e ve Agentic Plus için 93.6’dan 96.7’ye yükseldiği bildirildi. United Way Worldwide Schedule I hibesi takviminde, şirket Agentic v2.0’ın sayfa sonunda durduğunu, hibenin amacını ve adresini eksik bıraktığını, v2.5’in ise aynı kayıtta bir sonraki sayfadan devamı içerdiğini söyledi.
Taralı formlarda, Cost Effective için puanların 89.6’dan 93.9’a, Agentic için 90.9’dan 95.7’ye ve Agentic Plus için 94.4’ten 96.1’e yükseldiği bildirildi. Notlu bir W-14 imha izninde, şirket Agentic katmanının daha önce bir denetleyicinin tarihini izin numarasıyla birleştirdiğini ve denetleyici notunu tatlı su derinliğine eklediğini, v2.5’in ise orijinal değerleri notlardan ayırarak şemanın talep ettiği alanlara yerleştirdiğini belirtti.
Gelişmiş Atıflar ve Altyapı
Bu sürüm, Agentic ve Agentic Plus katmanları için Gelişmiş Atıflar’ı tanıtıyor; bu özellik, belgede kelimesi kelimesine bulunmayan değerler dahil olmak üzere zor alanlar için destekleyici kanıtların sınırlayıcı kutularını belirliyor. İlk bir sürüm daha önce Agentic Plus’ta mevcuttu; LlamaIndex, özelliğin altyapı doğruluğunu daha da artırdığını ve Agentic’e genişlettiğini söyledi. Şirket, ExtractBench altyapı puanlarının Agentic için 46.8’den 80.6’ya, Agentic Plus için 46.4’ten 82.2’ye yükseldiğini bildirdi. Karşılaştırma tablosu, Sonnet 5.5 için 63.2, GPT-6 SOL için 77.6, Opus 5.5 için 77.5, Reducto Deep Extract için 50.8, Extend Max için 21.8 ve kendi Cost Effective katmanı için 54.3 altyapı puanlarını listeliyor.
Şirket, sınırlayıcı kutu atıflarının güven skorlarıyla birleştirildiğini, bunun ekiplerin hangi çıkarılan değerlerin otomatik olarak ilerleyebileceğine, hangilerinin daha yakından incelenmesi gerektiğine karar vermesine yardımcı olduğunu ve inceleme yapanların iş akışlarında insan müdahalesiyle işaretli değerleri orijinal belgeye karşı kontrol etmelerini sağladığını belirtti.
Elektronik Tablo Modu ve Kullanılabilirlik
v2.5, yerel elektronik tablo çıkarımını ekliyor: elektronik tablo modunda ajanlar, düzleştirilmiş bir temsile yerine doğrudan çalışma kitabı hücreleriyle çalışır ve kullanıcılar bu modu çıkarım yapılandırmasında etkinleştirebilir.
Extract v2.5, LlamaCloud, Go tabanlı bir komut satırı aracı olan llp, Claude Code ve Codex dahil ajan istemcileri için bir MCP sunucusu ve Python llama-cloud SDK aracılığıyla kullanılabilir; burada çıkarma işleri sürüm 2.5’i seçer ve cite kaynakları ve güven puanlarını seçeneklerini etkinleştirebilir. LlamaIndex, kullanıcıları mevcut şemalarını kullanarak iş akışlarını temsil eden belgeler üzerinde v2.5’i çalıştırmaya teşvik etti ve bu sürümün özellikle daha önce manuel temizlik gerektiren veya otomatikleştirilemeyecek kadar güvenilir olmayan belgeler için çıkarma kalitesinde önemli bir artış sağlayacağını belirtti.












