AI 모델 및 플랫폼
LlamaIndex, 정확도와 근거 향상으로 Extract V2.5 출시

LlamaIndex는 2026년 10월 1일에 스키마 기반 문서 추출 에이전트의 새로운 세대인 Extract v2.5를 소개했습니다. Adrian Lyjak과 Eli Stewart가 서명한 블로그 게시물에서, 회사는 세 가지 추출 티어 모두에서 정확도가 향상되었으며, 가장 높은 두 티어인 Agentic 및 Agentic Plus에서 근거가 강화되었고, 페이지당 가격이 증가하지 않았다고 밝혔습니다.
티어별 벤치마크 향상
LlamaIndex는 오픈 문서 추출 벤치마크인 ExtractBench에서 전체 가치 F1 점수가 Cost Effective 티어는 87.1에서 93.9로, Agentic은 89.8에서 95.8로, 최고 정확도 티어인 Agentic Plus는 95.1에서 96.4로 상승했다고 보고했습니다. 회사에 따르면 Cost Effective 티어가 이전 Agentic 티어를 앞서며, Agentic 티어가 이전 Agentic Plus 티어를 앞선다고 합니다.
ExtractBench는 8개 비즈니스 도메인과 67개 문서 유형에 걸쳐 총 4,869페이지, 370개의 기업 문서를 테스트합니다. 각 유형마다 고유한 스키마가 있습니다. LlamaIndex는 공개 데이터셋, 평가 하니스 및 방법론과 함께 벤치마크를 공개했으며, 최첨단 VLM, 코딩 에이전트 및 특화된 추출 API를 평가했습니다.
새로운 에이전트 하니스와 구조적 추론
회사는 v2.5가 문서 추출을 위해 특별히 설계된 새로운 에이전트 하니스를 기반으로 실행되며, 최신 코딩 에이전트에서 영감을 얻고 모델에 맞춰 비전, 추론 및 검증 전반의 실패 모드를 처리하도록 조정되었다고 밝혔습니다. LlamaIndex는 결과적인 에이전트가 여러 페이지의 컨텍스트를 교차 참조하고 정확한 출처에 값을 근거화할 수 있다고 말했습니다.
게시물이 ‘구조적 추론’이라고 부르는 기능은 문서 표현을 기반으로 문서 유형, 레이아웃 및 정보 밀도에 따라 추출을 맞춤화합니다: 에이전트는 복잡한 문서에 더 많은 노력을 들이고, 단순한 문서는 낮은 지연 시간으로 처리합니다. v2.5에서는 팀이 Agentic Plus 뒤에 있던 하니스를 Cost Effective와 Agentic 티어에 적용했으며, 각 티어의 비용 제약에 맞게 도구와 추출 전략을 조정했습니다. 또한 회사는 에이전트가 스키마와 추출 지침을 따르는 방식을 개선했으며, 최대 3,200개의 필드를 포함하는 작업도 지원하고, 추출된 레코드를 데이터베이스와 매칭하기 위해 레코드 ID가 필수적인 사용자는 프롬프트에 이를 명시하도록 권고했습니다.
긴 목록, 페이지 간 레코드 및 스캔된 양식
긴 목록 작업에서 LlamaIndex는 Cost Effective 티어의 점수가 82.0에서 92.6으로, Agentic은 86.1에서 95.5로, Agentic Plus는 94.5에서 96.3으로 상승했다고 보고했습니다. 회사는 v2.5가 중간 표현을 사용해 전체 데이터셋과 작업하고 출력물을 사용자의 스키마에 맞춰 검증한다고 밝혔습니다. 한 예로 17페이지 분량의 펀드 제출서에서 이전 Cost Effective 티어는 238개 보유 항목 중 87개만 반환했지만, v2.5는 전체 238개를 반환하여 해당 문서의 추출 점수를 52.8에서 98.7로 끌어올렸다고 합니다.
페이지에 걸친 레코드의 경우, Cost Effective는 80.3에서 92.0으로, Agentic은 85.5에서 96.5로, Agentic Plus는 93.6에서 96.7으로 점수가 상승했습니다. United Way Worldwide의 Schedule I 보조금 일정에서, 회사는 Agentic v2.0이 페이지 구분에서 멈춰 보조금 목적과 주소가 불완전하게 남았지만, v2.5는 다음 페이지의 연속 내용을 동일 레코드에 포함시킨다고 밝혔습니다.
스캔된 양식에서는 Cost Effective가 89.6에서 93.9로, Agentic은 90.9에서 95.7로, Agentic Plus는 94.4에서 96.1으로 점수가 상승했습니다. 주석이 달린 W-14 폐기 허가서에서, 회사는 이전 Agentic 티어가 검토자의 날짜를 허가 번호와 결합하고 검토자 메모를 담수 깊이 필드에 추가했지만, v2.5는 원래 값을 주석과 분리하여 스키마가 요구하는 필드에 각각 배치한다고 설명했습니다.
고급 인용 및 근거
이번 릴리스는 Agentic 및 Agentic Plus 티어에 고급 인용 기능을 도입합니다. 이 기능은 어려운 필드에 대해 문서에 정확히 단어 그대로 나타나지 않더라도 근거가 되는 증거의 경계 상자를 찾아냅니다. 초기 버전은 이전에 Agentic Plus에서만 제공되었으며, LlamaIndex는 기능의 근거 정확도를 더욱 향상시키고 이를 Agentic 티어에도 확장했다고 밝혔습니다. 회사는 ExtractBench 근거 점수가 Agentic에서 46.8에서 80.6으로, Agentic Plus에서 46.4에서 82.2로 상승했다고 보고했습니다. 비교 차트에는 Sonnet 5.5의 근거 점수 63.2, GPT-6 SOL 77.6, Opus 5.5 77.5, Reducto Deep Extract 50.8, Extend Max 21.8, 그리고 자체 Cost Effective 티어 54.3이 나열되어 있습니다.
회사는 경계 상자 인용이 신뢰도 점수와 결합되어 팀이 자동으로 처리할 수 있는 추출값과 더 면밀히 검토가 필요한 값을 판단하도록 돕고, 인간이 개입하는 워크플로우에서 검토자가 플래그된 값을 원본 문서와 대조할 수 있게 한다고 설명했습니다.
스프레드시트 모드 및 제공 여부
v2.5는 네이티브 스프레드시트 추출을 추가합니다: 스프레드시트 모드에서는 에이전트가 평탄화된 표현이 아니라 워크북 셀과 직접 작업하며, 사용자는 추출 구성에서 이 모드를 활성화할 수 있습니다.
Extract v2.5는 LlamaCloud, llp라는 Go 기반 명령줄 도구, Claude Code와 Codex를 포함한 에이전트 클라이언트를 위한 MCP 서버, 그리고 Python llama-cloud SDK를 통해 사용할 수 있으며, 추출 작업에서 버전 2.5를 선택하고 cite출처 및 신뢰도scores 옵션을 활성화할 수 있습니다. LlamaIndex는 사용자가 기존 스키마를 활용해 워크플로우를 대표하는 문서에 v2.5를 실행하도록 권장했으며, 이번 버전이 추출 품질에서 크게 향상될 것으로 기대한다고 밝혔습니다. 특히 이전에 수동 정리가 필요했거나 자동화하기에 충분히 신뢰할 수 없었던 문서에 특히 그렇습니다.












