Моделі та платформи ШІ

LlamaIndex запускає Extract V2.5 з підвищеною точністю та покращеним обґрунтуванням

mm
Додайте Unite.AI до бажаних джерел у Google

LlamaIndex представив Extract v2.5 1 жовтня 2026 року, нове покоління своїх агентів витягання документів на основі схеми. У блог‑пості підписаному Адріаном Лижаком та Елі Стюартом компанія повідомила про покращення точності у всіх трьох рівнях витягання та підвищене обґрунтування для двох найвищих рівнів — Agentic та Agentic Plus, і зазначила, що ці покращення не супроводжуються підвищенням вартості за сторінку.

Покращення бенчмарку за рівнями

LlamaIndex повідомив, що на ExtractBench, його відкритому бенчмарку витягання документів, загальне значення F1 зросло з 87,1 до 93,9 для рівня Cost Effective, з 89,8 до 95,8 для Agentic і з 95,1 до 96,4 для Agentic Plus, його найточнішого рівня. За словами компанії, Cost Effective тепер перевершує попередній рівень Agentic, а Agentic перевершує попередній Agentic Plus.

ExtractBench тестує 370 корпоративних документів, що охоплюють 4 869 сторінок у 8 бізнес‑доменах і 67 типах документів, кожен тип має власну схему. LlamaIndex опублікував бенчмарк з публічним набором даних, середовищем оцінювання та методологією, а також провів оцінку передових VLM, агентів кодування та спеціалізованих API витягання.

Новий каркас агентів і структурне розуміння

Компанія зазначила, що v2.5 працює на новому каркасі агентів, спеціально створеному для витягання документів, беручи натхнення від останніх агентів кодування та налаштовуючись під моделі для обробки режимів відмов у сфері зору, логічного мислення та верифікації. LlamaIndex повідомив, що отриманий агент може перехресно посилатися на контекст з кількох сторінок і прив’язувати значення до точних джерел.

Можливість, яку у дописі називають «Структурне розуміння», працює з представленнями документів, щоб налаштувати витягання відповідно до типу документа, його розмітки та щільності інформації: агент докладає більше зусиль до складних документів і обробляє простіші з меншою затримкою. Для v2.5 команда перенесла каркас, який стоїть за Agentic Plus, до рівнів Cost Effective та Agentic, адаптувавши його інструменти та стратегії витягання під фінансові обмеження кожного рівня після оцінки представлень документів, інструментів і конфігурацій моделей. Компанія також зазначила, що працювала над тим, як агенти дотримуються схем та інструкцій з витягання, включаючи завдання з до 3 200 полями, і радить користувачам, чиї ідентифікатори записів є критичними для зіставлення витягнутих записів з базою даних, явно вказувати це у своїх підказках.

Довгі списки, записи через кілька сторінок та скановані форми

У завданнях з довгими списками LlamaIndex повідомив про підвищення оцінок з 82,0 до 92,6 для Cost Effective, з 86,1 до 95,5 для Agentic і з 94,5 до 96,3 для Agentic Plus. Компанія зазначила, що v2.5 використовує проміжні представлення для роботи з повним набором даних і перевіряє свій результат проти схеми користувача. У одному прикладі, 17‑сторінковій подачі фонду, попередній рівень Cost Effective повернув 87 з 238 активів; компанія повідомила, що v2.5 повертає всі 238, підвищивши оцінку витягання цього документа з 52,8 до 98,7.

Для записів, що охоплюють кілька сторінок, повідомлені оцінки зросли з 80,3 до 92,0 для Cost Effective, з 85,5 до 96,5 для Agentic і з 93,6 до 96,7 для Agentic Plus. У графіку грантів United Way Worldwide Schedule I компанія зазначила, що Agentic v2.0 зупинявся на розриві сторінки, залишаючи мету гранту та адресу неповними, тоді як v2.5 включає продовження з наступної сторінки в той самий запис.

Для сканованих форм повідомлені оцінки зросли з 89,6 до 93,9 для Cost Effective, з 90,9 до 95,7 для Agentic і з 94,4 до 96,1 для Agentic Plus. У випадку анотованого дозволу на утилізацію W‑14 компанія зазначила, що раніше рівень Agentic поєднував дату рецензента з номером дозволу та додавав примітку рецензента до глибини прісної води, тоді як v2.5 розділяє початкові значення та анотації у поля, запитані схемою.

Розширені посилання та обґрунтування

У випуску представлено розширені посилання для рівнів Agentic та Agentic Plus, які визначають рамки підтверджуючих доказів для складних полів, включаючи значення, що не зустрічаються у документі дослівно. Початкова версія раніше була доступна лише в Agentic Plus; LlamaIndex зазначив, що ще більше підвищив точність обґрунтування функції та розширив її на Agentic. Компанія повідомила, що оцінки обґрунтування ExtractBench зросли з 46,8 до 80,6 для Agentic і з 46,4 до 82,2 для Agentic Plus. У їхній діаграмі порівняння вказані оцінки обґрунтування: 63,2 для Sonnet 5.5, 77,6 для GPT‑6 SOL, 77,5 для Opus 5.5, 50,8 для Reducto Deep Extract, 21,8 для Extend Max та 54,3 для власного рівня Cost Effective.

Компанія зазначила, що посилання з bounding‑box поєднуються з оцінками довіри, що допомагає командам вирішувати, які витягнуті значення можна автоматично передавати, а які потребують детальнішого перегляду, дозволяючи рецензентам перевіряти позначені значення проти оригінального документа в робочих процесах з участю людини.

Режим електронних таблиць та доступність

v2.5 додає нативне витягання електронних таблиць: у режимі електронних таблиць агенти працюють безпосередньо з клітинками робочих книг, а не зі спрощеним представленням, і користувачі можуть увімкнути цей режим у конфігурації витягання.

Extract v2.5 доступний через LlamaCloud, інструмент командного рядка на Go під назвою llp, сервер MCP для клієнтів‑агентів, включаючи Claude Code і Codex, та Python‑SDK llama‑cloud, де завдання вилучення вибирають версію 2.5 і можуть увімкнути параметри cite джерела та впевненістьscores. LlamaIndex закликав користувачів запускати v2.5 на документах, що представляють їхні робочі процеси, використовуючи існуючі схеми, і заявив, що очікує, що ця версія стане значним кроком уперед у якості вилучення, особливо для документів, які раніше потребували ручного очищення або не були достатньо надійними для автоматизації.

Jonas Reeve є аналітиком, створеним штучним інтелектом, у Unite.AI, зосередженим на когнітивному ШІ, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, міркування, пам’ять і абстракція виникають як у біологічних, так і в штучних системах, встановлюючи зв’язки між сучасними архітектурами ШІ та довготривалими питаннями когнітивної науки та філософії розуму.

З концептуальним та рефлексивним підходом Jonas досліджує такі рамки, як моделі міркування, агентні системи, емерджентна когніція та теорія вирівнювання, прагнучи уточнити, що насправді означає прогрес у напрямку AGI — і що це не означає. Замість того, щоб гонитись за терміновими датами чи гіпом, він наголошує на фундаментальних принципах, концептуальній суворості та межах поточних моделей.

Статті, написані Jonas Reeve, створені штучним інтелектом і перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій ШІ.