AIモデルとプラットフォーム
LlamaIndex、精度と根拠の向上を実現した Extract V2.5 を発表

LlamaIndexは2026年10月1日に、スキーマベースの文書抽出エージェントの新世代であるExtract v2.5を導入しました。ブログ記事でAdrian Lyjak氏とEli Stewart氏が執筆し、同社は3つの抽出ティアすべてで精度が向上し、最高位のAgenticおよびAgentic Plusティアで根拠が強化されたと報告し、これらの向上はページ単位の価格増加を伴わないと述べました。
ティア別ベンチマークの向上
LlamaIndexは、オープンな文書抽出ベンチマークであるExtractBenchにおいて、Cost Effectiveティアの全体F1スコアが87.1から93.9へ、Agenticティアが89.8から95.8へ、最高精度ティアであるAgentic Plusが95.1から96.4へ上昇したと報告しました。同社によると、Cost Effectiveは現在、従来のAgenticティアを上回り、Agenticは以前のAgentic Plusを上回っているとのことです。
ExtractBenchは、8つのビジネス領域と67種類の文書タイプにわたる合計4,869ページ、370件のエンタープライズ文書をテストします。LlamaIndexは、公開データセット、評価ハーネス、手法と共にベンチマークを公開し、最先端のVLM、コーディングエージェント、専門的な抽出APIを評価しました。
新しいエージェントハーネスと構造的推論
同社は、v2.5が文書抽出専用に設計された新しいエージェントハーネス上で動作し、最新のコーディングエージェントから着想を得て、モデルに合わせて視覚、推論、検証における失敗モードに対応できるよう調整されたと述べました。LlamaIndexは、生成されたエージェントが複数ページのコンテキストを相互参照し、値を正確なソースに根拠付けできると語っています。
記事で「構造的推論」と呼ばれる機能は、文書表現を活用して文書タイプ、レイアウト、情報密度に基づき抽出を最適化します。エージェントは複雑な文書にはより多くの処理を割き、シンプルな文書は低レイテンシで処理します。v2.5では、チームがAgentic Plus向けに開発したハーネスをCost EffectiveおよびAgenticティアにも導入し、文書表現、ツール、モデル構成を評価した上で、各ティアのコスト制約に合わせてツールと抽出戦略を調整しました。同社はまた、エージェントがスキーマや抽出指示に従う方法、最大3,200フィールドに及ぶタスクへの対応についても取り組んでおり、抽出レコードをデータベースと照合する際にレコードIDが重要なユーザーは、プロンプトでそれを明示するよう助言しています。
長いリスト、ページ跨ぎレコード、スキャンフォーム
長いリストタスクにおいて、LlamaIndexはCost Effectiveでスコアが82.0から92.6へ、Agenticで86.1から95.5へ、Agentic Plusで94.5から96.3へ上昇したと報告しました。同社は、v2.5が中間表現を使用して全データセットで作業し、出力をユーザーのスキーマに照らし合わせて検証すると述べました。例として、17ページにわたるファンド提出書類では、従来のCost Effectiveティアが238件中87件しか返さなかったのに対し、v2.5は全238件を返し、文書の抽出スコアを52.8から98.7に向上させたとしています。
ページ跨ぎのレコードにおいて、Cost Effectiveでスコアが80.3から92.0へ、Agenticで85.5から96.5へ、Agentic Plusで93.6から96.7へ上昇したと報告されています。United Way WorldwideのSchedule I助成金スケジュールでは、Agentic v2.0がページ区切りで処理を停止し、助成金の目的と住所が不完全だったのに対し、v2.5は次ページの続きも同一レコードに含めると同社は述べています。
スキャンされたフォームに対しては、Cost Effectiveでスコアが89.6から93.9へ、Agenticで90.9から95.7へ、Agentic Plusで94.4から96.1へ上昇したと報告されています。注釈付きのW-14廃棄許可書では、従来のAgenticティアがレビュー担当者の日付と許可番号を結合し、淡水深さにレビュー担当者のメモを付加していたのに対し、v2.5は元の値と注釈をスキーマが要求するフィールドに分離すると同社は述べています。
高度な引用と根拠付け
本リリースでは、AgenticおよびAgentic Plusティア向けに高度な引用機能を導入し、文書に逐語的に記載されていない値を含む、難解なフィールドの裏付け証拠のバウンディングボックスを特定します。初期バージョンは以前Agentic Plusで利用可能でしたが、LlamaIndexはこの機能の根拠付け精度をさらに向上させ、Agenticにも拡張したと述べました。同社は、ExtractBenchにおける根拠付けスコアがAgenticで46.8から80.6へ、Agentic Plusで46.4から82.2へ上昇したと報告しています。比較チャートでは、Sonnet 5.5が63.2、GPT-6 SOLが77.6、Opus 5.5が77.5、Reducto Deep Extractが50.8、Extend Maxが21.8、そして自社のCost Effectiveティアが54.3の根拠付けスコアを示しています。
同社は、バウンディングボックス引用と信頼度スコアを組み合わせることで、チームが自動的に処理できる抽出値と詳細な確認が必要な値を判断できるようになり、ヒューマン・イン・ザ・ループのワークフローでレビュー担当者がフラグ付けされた値を原文と照合できると述べています。
スプレッドシートモードと利用可能性
v2.5はネイティブなスプレッドシート抽出を追加しました。スプレッドシートモードでは、エージェントがフラット化された表現ではなく、ワークブックのセルと直接やり取りします。ユーザーは抽出設定でこのモードを有効化できます。
Extract v2.5 は、Go 言語ベースのコマンドラインツール llp、Claude Code と Codex を含むエージェントクライアント用 MCP サーバー、そして Python の llama-cloud SDK を通じて LlamaCloud で利用可能です。抽出ジョブでバージョン 2.5 を選択し、ソースと信頼度スコアオプションを有効にすることができます。LlamaIndex は、既存のスキーマを使用してワークフローを代表するドキュメント上で v2.5 を実行し、特に以前は手動でのクリーンアップが必要だったり、自動化に十分な信頼性がなかったドキュメントに対して、抽出品質が大幅に向上すると期待していると述べました。












