Модели и платформы ИИ

LlamaIndex запускает Extract V2.5 с повышением точности и обоснованности

mm
Добавьте Unite.AI в избранные источники в Google

LlamaIndex представила Extract v2.5 1 октября 2026 года, новое поколение своих агентов извлечения документов на основе схем. В записи в блоге, автором которой являются Adrian Lyjak и Eli Stewart, компания сообщила об улучшении точности во всех трех уровнях извлечения и о повышенной обоснованности для двух высших уровней — Agentic и Agentic Plus, добавив, что эти улучшения не сопровождаются повышением цены за страницу.

Рост показателей по уровням

LlamaIndex сообщила, что на ExtractBench, их открытом бенчмарке извлечения документов, общий показатель F1 вырос с 87,1 до 93,9 для уровня Cost Effective, с 89,8 до 95,8 для Agentic и с 95,1 до 96,4 для Agentic Plus, самого точного уровня. По данным компании, уровень Cost Effective теперь опережает предыдущий уровень Agentic, а Agentic опережает прежний Agentic Plus.

ExtractBench тестирует 370 корпоративных документов, охватывающих 4 869 страниц в 8 бизнес‑доменных областях и 67 типах документов, каждый тип имеет собственную схему. LlamaIndex опубликовала бенчмарк вместе с публичным набором данных, средой оценки и методологией, а также провела оценку передовых VLM, кодирующих агентов и специализированных API извлечения.

Новый каркас агента и структурное рассуждение

Компания заявила, что v2.5 работает на новом каркасе агента, специально разработанном для извлечения документов, черпая вдохновение из новейших кодирующих агентов и оптимизированном под модели для обработки сбоев в области зрения, рассуждения и верификации. LlamaIndex отметила, что полученный агент может перекрестно ссылаться на контекст из нескольких страниц и привязывать значения к точным источникам.

Возможность, которую в статье называют «Структурное рассуждение», работает с представлениями документов, адаптируя извлечение в зависимости от типа документа, его макета и плотности информации: агент уделяет больше усилий сложным документам и обрабатывает более простые быстрее, с меньшей задержкой. Для версии v2.5 команда перенесла каркас, использующийся в Agentic Plus, в уровни Cost Effective и Agentic, адаптируя инструменты и стратегии извлечения к ограничениям стоимости каждого уровня после оценки представлений документов, инструментов и конфигураций моделей. Компания также сообщила, что работала над тем, как агенты следуют схемам и инструкциям по извлечению, включая задачи с до 3 200 полями, и советует пользователям, для которых идентификаторы записей критичны при сопоставлении извлечённых записей с базой данных, явно указывать это в своих подсказках.

Длинные списки, записи, охватывающие несколько страниц, и сканированные формы

При работе с длинными списками LlamaIndex сообщила, что показатели выросли с 82,0 до 92,6 для уровня Cost Effective, с 86,1 до 95,5 для Agentic и с 94,5 до 96,3 для Agentic Plus. Компания заявила, что v2.5 использует промежуточные представления для работы с полным набором данных и проверяет выводы в соответствии со схемой пользователя. В одном примере, 17‑страничном заявлении фонда, предыдущий уровень Cost Effective вернул 87 из 238 активов; компания отметила, что v2.5 возвращает все 238, повышая оценку извлечения этого документа с 52,8 до 98,7.

Для записей, охватывающих несколько страниц, показатели выросли с 80,3 до 92,0 для уровня Cost Effective, с 85,5 до 96,5 для Agentic и с 93,6 до 96,7 для Agentic Plus. В графике грантов Schedule I организации United Way Worldwide компания сообщила, что Agentic v2.0 останавливался на разрыве страницы, оставляя цель гранта и адрес неполными, тогда как v2.5 включает продолжение со следующей страницы в той же записи.

Для сканированных форм показатели выросли с 89,6 до 93,9 для уровня Cost Effective, с 90,9 до 95,7 для Agentic и с 94,4 до 96,1 для Agentic Plus. На аннотированном разрешении на утилизацию W‑14 компания отметила, что ранее уровень Agentic объединял дату проверяющего с номером разрешения и добавлял примечание проверяющего к глубине пресной воды, тогда как v2.5 разделяет исходные значения и аннотации по полям, запрошенным схемой.

Продвинутые ссылки и обоснование

В выпуске представляются продвинутые ссылки для уровней Agentic и Agentic Plus, которые определяют ограничивающие рамки подтверждающих доказательств для сложных полей, включая значения, не встречающиеся в документе дословно. Первоначальная версия ранее была доступна в Agentic Plus; LlamaIndex заявила, что дальнейшее улучшение точности обоснования функции и её расширение на уровень Agentic. Компания сообщила, что показатели обоснования на ExtractBench выросли с 46,8 до 80,6 для Agentic и с 46,4 до 82,2 для Agentic Plus. В их сравнительной таблице указаны показатели обоснования: 63,2 для Sonnet 5.5, 77,6 для GPT‑6 SOL, 77,5 для Opus 5.5, 50,8 для Reducto Deep Extract, 21,8 для Extend Max и 54,3 для собственного уровня Cost Effective.

Компания отметила, что ссылки с ограничивающими рамками комбинируются с оценками уверенности, что помогает командам решать, какие извлечённые значения можно обрабатывать автоматически, а какие требуют более тщательной проверки, позволяя рецензентам сверять отмеченные значения с оригинальным документом в рабочих процессах с участием человека.

Режим таблиц и доступность

v2.5 добавляет нативное извлечение из таблиц: в режиме таблиц агенты работают непосредственно с ячейками книги, а не с плоским представлением, и пользователи могут включить этот режим в конфигурации извлечения.

Extract v2.5 доступен через LlamaCloud, инструмент командной строки на Go под названием llp, сервер MCP для клиентских агентов, включая Claude Code и Codex, а также Python‑SDK llama‑cloud, где задания извлечения выбирают версию 2.5 и могут включать опцию источники и уверенностьоценки. LlamaIndex призвал пользователей запускать v2.5 на документах, представляющих их рабочие процессы, используя существующие схемы, и заявил, что ожидает, что эта версия станет значительным шагом вперёд в качестве извлечения, особенно для документов, которые ранее требовали ручной очистки или были недостаточно надёжными для автоматизации.

Jonas Reeve является аналитиком, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, возникшее познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.