एआई मॉडल और प्लेटफ़ॉर्म
LlamaIndex ने Extract V2.5 लॉन्च किया, सटीकता और ग्राउंडिंग में सुधार के साथ

LlamaIndex ने 1 अक्टूबर 2026 को Extract v2.5 प्रस्तुत किया, जो उसके स्कीमा-आधारित दस्तावेज़ निष्कर्षण एजेंटों की नई पीढ़ी है। ब्लॉग पोस्ट में, जिसमें Adrian Lyjak और Eli Stewart द्वारा लिखा गया है, कंपनी ने बताया कि सभी तीन निष्कर्षण स्तरों में सटीकता में सुधार हुआ है और दो उच्चतम स्तरों, Agentic और Agentic Plus, के लिए ग्राउंडिंग को बढ़ाया गया है, और कहा कि इन सुधारों के साथ प्रति पृष्ठ मूल्य में कोई वृद्धि नहीं हुई है।
प्रत्येक स्तर पर बेंचमार्क सुधार
LlamaIndex ने बताया कि ExtractBench, उसके खुले दस्तावेज़-निष्कर्षण बेंचमार्क पर, कुल F1 मान Cost Effective स्तर के लिए 87.1 से 93.9 तक, Agentic के लिए 89.8 से 95.8 तक, और Agentic Plus, उसके सबसे उच्च सटीकता स्तर के लिए, 95.1 से 96.4 तक बढ़ा। कंपनी के अनुसार, Cost Effective अब पहले के Agentic स्तर से बेहतर प्रदर्शन करता है, और Agentic पहले के Agentic Plus से बेहतर है।
ExtractBench 370 एंटरप्राइज़ दस्तावेज़ों का परीक्षण करता है, जो 8 व्यावसायिक डोमेनों और 67 दस्तावेज़ प्रकारों में कुल 4,869 पृष्ठों में फैले हैं, प्रत्येक प्रकार का अपना स्कीमा है। LlamaIndex ने इस बेंचमार्क को सार्वजनिक डेटासेट, मूल्यांकन हार्नेस और कार्यप्रणाली के साथ प्रकाशित किया, और इस पर अग्रणी VLMs, कोडिंग एजेंट और विशेषीकृत निष्कर्षण API का मूल्यांकन किया है।
नया एजेंट हार्नेस और संरचनात्मक तर्क
कंपनी ने कहा कि v2.5 एक नए एजेंट हार्नेस पर चलता है, जो विशेष रूप से दस्तावेज़ निष्कर्षण के लिए बनाया गया है, और नवीनतम कोडिंग एजेंटों से प्रेरणा लेकर मॉडल्स के आसपास ट्यून किया गया है ताकि विज़न, तर्क और सत्यापन में विफलता मोड को संभाला जा सके। LlamaIndex ने बताया कि resulting एजेंट कई पृष्ठों से संदर्भ को क्रॉस-रेफ़रेंस कर सकता है और मानों को सटीक स्रोतों में ग्राउंड कर सकता है।
पोस्ट द्वारा ‘संरचनात्मक तर्क’ कहा गया एक क्षमता दस्तावेज़ प्रतिनिधित्वों पर काम करती है ताकि दस्तावेज़ प्रकार, लेआउट और सूचना घनत्व के आधार पर निष्कर्षण को अनुकूलित किया जा सके: एजेंट जटिल दस्तावेज़ों पर अधिक प्रयास करता है और सरल दस्तावेज़ों को कम विलंबता के साथ प्रोसेस करता है। v2.5 के लिए, टीम ने Agentic Plus के पीछे का हार्नेस Cost Effective और Agentic स्तरों में लाया, दस्तावेज़ प्रतिनिधित्व, टूल्स और मॉडल कॉन्फ़िगरेशन का मूल्यांकन करने के बाद प्रत्येक स्तर की लागत सीमाओं के अनुसार उसके टूल्स और निष्कर्षण रणनीतियों को अनुकूलित किया। कंपनी ने यह भी कहा कि उसने यह काम किया है कि एजेंट स्कीमा और निष्कर्षण निर्देशों का कैसे पालन करते हैं, जिसमें 3,200 फ़ील्ड तक के कार्य शामिल हैं, और यह उपयोगकर्ताओं को सलाह देती है जिनके रिकॉर्ड आईडी डेटाबेस में निकाले गए रिकॉर्ड को मिलाने के लिए आवश्यक हैं, कि वे इसे अपने प्रॉम्प्ट में स्पष्ट रूप से उल्लेख करें।
लंबी सूचियाँ, पृष्ठ-परिच्छेद रिकॉर्ड, और स्कैन किए गए फ़ॉर्म
लंबी‑सूची कार्यों पर, LlamaIndex ने बताया कि Cost Effective के लिए स्कोर 82.0 से 92.6 तक, Agentic के लिए 86.1 से 95.5 तक, और Agentic Plus के लिए 94.5 से 96.3 तक बढ़े। कंपनी ने कहा कि v2.5 मध्यवर्ती प्रतिनिधित्वों का उपयोग करके पूरे डेटासेट के साथ काम करता है और अपने आउटपुट को उपयोगकर्ता के स्कीमा के विरुद्ध सत्यापित करता है। एक उदाहरण में, 17‑पृष्ठीय फंड फ़ाइलिंग में, पहले के Cost Effective स्तर ने 238 में से 87 होल्डिंग्स लौटाए; कंपनी ने कहा कि v2.5 सभी 238 लौटाता है, जिससे उस दस्तावेज़ का निष्कर्षण स्कोर 52.8 से 98.7 तक बढ़ गया।
पृष्ठ‑परिच्छेद रिकॉर्ड पर, रिपोर्ट किए गए स्कोर Cost Effective के लिए 80.3 से 92.0 तक, Agentic के लिए 85.5 से 96.5 तक, और Agentic Plus के लिए 93.6 से 96.7 तक बढ़े। United Way Worldwide Schedule I अनुदान शेड्यूल में, कंपनी ने कहा कि Agentic v2.0 पृष्ठ विराम पर रुक गया, जिससे अनुदान का उद्देश्य और पता अधूरा रह गया, जबकि v2.5 अगले पृष्ठ से निरंतरता को उसी रिकॉर्ड में शामिल करता है।
स्कैन किए गए फ़ॉर्म पर, रिपोर्ट किए गए स्कोर Cost Effective के लिए 89.6 से 93.9 तक, Agentic के लिए 90.9 से 95.7 तक, और Agentic Plus के लिए 94.4 से 96.1 तक बढ़े। एक एनोटेटेड W-14 डिस्पोज़ल परमिट में, कंपनी ने कहा कि पहले Agentic स्तर ने समीक्षक की तिथि को परमिट नंबर के साथ मिलाया और जल गहराई में समीक्षक नोट जोड़ दिया, जबकि v2.5 मूल मानों को एनोटेशन से अलग करके स्कीमा द्वारा अनुरोधित फ़ील्ड में रखता है।
उन्नत उद्धरण और ग्राउंडिंग
इस रिलीज़ में Agentic और Agentic Plus स्तरों के लिए उन्नत उद्धरण पेश किए गए हैं, जो कठिन फ़ील्डों के लिए सहायक साक्ष्य के बाउंडिंग बॉक्स को खोजते हैं, जिसमें वे मान भी शामिल हैं जो दस्तावेज़ में शब्द‑शः नहीं दिखते। एक प्रारंभिक संस्करण पहले Agentic Plus में उपलब्ध था; LlamaIndex ने कहा कि इस फीचर की ग्राउंडिंग सटीकता को और बेहतर किया गया और इसे Agentic तक विस्तारित किया गया। कंपनी ने बताया कि ExtractBench ग्राउंडिंग स्कोर Agentic के लिए 46.8 से 80.6 तक और Agentic Plus के लिए 46.4 से 82.2 तक बढ़े। उसकी तुलना तालिका में ग्राउंडिंग स्कोर Sonnet 5.5 के लिए 63.2, GPT-6 SOL के लिए 77.6, Opus 5.5 के लिए 77.5, Reducto Deep Extract के लिए 50.8, Extend Max के लिए 21.8, और अपने स्वयं के Cost Effective स्तर के लिए 54.3 दिखाए गए हैं।
कंपनी ने कहा कि बाउंडिंग‑बॉक्स उद्धरण विश्वास स्कोर के साथ मिलते हैं, जो टीमों को यह तय करने में मदद करते हैं कि कौन से निकाले गए मान स्वचालित रूप से आगे बढ़ सकते हैं और किन्हें अधिक जाँच की आवश्यकता है, जिससे समीक्षकों को मानव‑इन‑द‑लूप वर्कफ़्लो में फ़्लैग किए गए मानों को मूल दस्तावेज़ के विरुद्ध जांचने की सुविधा मिलती है।
स्प्रेडशीट मोड और उपलब्धता
v2.5 में मूल स्प्रेडशीट निष्कर्षण जोड़ा गया है: स्प्रेडशीट मोड में, एजेंट फ्लैटेड प्रतिनिधित्व के बजाय सीधे वर्कबुक सेल्स के साथ काम करते हैं, और उपयोगकर्ता निष्कर्षण कॉन्फ़िगरेशन में इस मोड को सक्षम कर सकते हैं।
Extract v2.5 LlamaCloud, एक Go‑आधारित कमांड‑लाइन टूल जिसका नाम llp है, एजेंट क्लाइंट्स जैसे Claude Code और Codex के लिए एक MCP सर्वर, और Python llama‑cloud SDK के माध्यम से उपलब्ध है, जहाँ एक्सट्रैक्शन जॉब्स संस्करण 2.5 चुनते हैं और cite स्रोत और विश्वास स्कोर विकल्प सक्षम कर सकते हैं। LlamaIndex ने उपयोगकर्ताओं को अपने कार्यप्रवाहों का प्रतिनिधित्व करने वाले दस्तावेज़ों पर v2.5 चलाने के लिए प्रोत्साहित किया, उनके मौजूदा स्कीमा का उपयोग करते हुए, और कहा कि यह संस्करण एक्सट्रैक्शन गुणवत्ता में एक महत्वपूर्ण सुधार लाएगा, विशेष रूप से उन दस्तावेज़ों के लिए जो पहले मैन्युअल सफ़ाई की आवश्यकता रखते थे या स्वचालित करने के लिए पर्याप्त भरोसेमंद नहीं थे।












