AI 模型与平台
LlamaIndex 推出 Extract V2.5,准确性和依据性提升

LlamaIndex 于 2026 年 10 月 1 日推出了 Extract v2.5,这是一代基于模式的文档提取代理。在一篇博客文章(署名 Adrian Lyjak 和 Eli Stewart)中,公司报告称其所有三个提取层级的准确性均有所提升,并且对最高的两个层级 Agentic 和 Agentic Plus 的依据性也得到增强,并表示这些提升并未导致每页费用的增加。
各层级基准提升
LlamaIndex 报告称,在其开放文档提取基准 ExtractBench 上,整体价值 F1 分数在 Cost Effective 层级从 87.1 提升至 93.9,在 Agentic 层级从 89.8 提升至 95.8,在最高准确度的 Agentic Plus 层级从 95.1 提升至 96.4。公司表示,Cost Effective 现在已超越之前的 Agentic 层级,而 Agentic 则超越了之前的 Agentic Plus。
ExtractBench 测试了 370 份企业文档,总计 4,869 页,涵盖 8 个业务领域和 67 种文档类型,每种类型都有其对应的模式。LlamaIndex 发布了该基准,包括公开数据集、评估工具和方法论,并在其上评估了前沿的 VLM、编码代理和专用提取 API。
全新代理框架与结构化推理
公司表示,v2.5 运行在专为文档提取打造的新代理框架上,借鉴了最新的编码代理,并围绕模型进行调优,以处理视觉、推理和验证等方面的失效模式。LlamaIndex 称,生成的代理能够跨多页交叉引用上下文,并将数值精准定位到具体来源。
文章中称为结构化推理的功能基于文档表示,对提取进行针对性调整,依据文档类型、布局和信息密度:代理在复杂文档上投入更多精力,而在较简单的文档上以更低延迟处理。针对 v2.5,团队将 Agentic Plus 背后的框架引入 Cost Effective 和 Agentic 层级,在评估了文档表示、工具和模型配置后,针对每个层级的成本限制调整了其工具和提取策略。公司还表示,他们正在改进代理遵循模式和提取指令的方式,包括最多包含 3,200 个字段的任务,并建议那些记录 ID 对将提取记录匹配到数据库至关重要的用户在提示中明确指出。
长列表、跨页记录和扫描表单
在长列表任务中,LlamaIndex 报告称 Cost Effective 的分数从 82.0 上升至 92.6,Agentic 从 86.1 上升至 95.5,Agentic Plus 从 94.5 上升至 96.3。公司表示,v2.5 使用中间表示来处理完整数据集,并将输出与用户的模式进行校验。举例而言,在一份 17 页的基金文件中,之前的 Cost Effective 层级仅返回了 238 项持有中的 87 项;公司称 v2.5 能返回全部 238 项,使该文档的提取分数从 52.8 提升至 98.7。
在跨页记录的任务中,报告的分数分别从 80.3 提升至 92.0(Cost Effective),从 85.5 提升至 96.5(Agentic),以及从 93.6 提升至 96.7(Agentic Plus)。在 United Way Worldwide Schedule I 资助计划中,公司表示 Agentic v2.0 在页面换行处停止,导致资助目的和地址信息不完整,而 v2.5 能将下一页的续写内容纳入同一记录中。
在扫描表单的任务中,报告的分数从 89.6 提升至 93.9(Cost Effective),从 90.9 提升至 95.7(Agentic),以及从 94.4 提升至 96.1(Agentic Plus)。在一份带注释的 W-14 处置许可证上,公司称之前的 Agentic 层级会将审阅者的日期与许可证号合并,并将审阅者的备注附加到淡水深度字段,而 v2.5 将原始数值与注释分离,放入模式要求的相应字段中。
高级引用与依据性
此次发布为 Agentic 和 Agentic Plus 层级引入了高级引用功能,可定位困难字段的支持证据的边界框,包括文档中未逐字出现的数值。最初的版本曾在 Agentic Plus 中提供;LlamaIndex 表示已进一步提升该功能的依据准确性,并将其扩展至 Agentic。公司报告称 ExtractBench 的依据分数在 Agentic 上从 46.8 提升至 80.6,在 Agentic Plus 上从 46.4 提升至 82.2。其对比图列出了 Sonnet 5.5 的依据分数为 63.2,GPT-6 SOL 为 77.6,Opus 5.5 为 77.5,Reducto Deep Extract 为 50.8,Extend Max 为 21.8,以及其自有的 Cost Effective 层级为 54.3。
公司表示,边界框引用会与置信度分数结合,帮助团队判断哪些提取值可以自动处理,哪些需要进一步审查,从而在人机协同的工作流中让审阅者将标记值与原始文档进行核对。
电子表格模式与可用性
v2.5 新增了原生电子表格提取功能:在电子表格模式下,代理直接操作工作簿单元格,而非扁平化表示,用户可在提取配置中启用此模式。
Extract v2.5 可通过 LlamaCloud、一个名为 llp 的基于 Go 的命令行工具、一个为包括 Claude Code 和 Codex 在内的代理客户端提供的 MCP 服务器,以及 Python llama-cloud SDK 获取,其中提取作业可选择 2.5 版本并启用 cite来源和置信度scores 选项。LlamaIndex 鼓励用户在其工作流的代表性文档上运行 v2.5,使用其现有模式,并表示预计该版本在提取质量上将实现显著提升,尤其是针对以前需要手动清理或不够可靠以实现自动化的文档。












