AIモデルとプラットフォーム

AIエージェントのリアルな研究能力はどうなっているのか?Deep Research Benchレポートの内部

mm
Unite.AI を Google の優先ソースに追加

大規模言語モデル(LLM)は急速に進化しており、研究アシスタントとしての役割も進化しています。単純な事実質問に答えるだけでなく、「ディープリサーチ」タスクに取り組んでいます。これには、マルチステップの推論、矛盾する情報の評価、ウェブからのデータの取得、そしてそれをまとめることが含まれます。

この新しい機能は、さまざまなブランド名で販売されています。OpenAIは「ディープリサーチ」と呼んでいます。Anthropicは「拡張思考」と呼んでいます。GoogleのGeminiは「検索 + Pro」機能を提供しています。Perplexityは「Pro Search」または「ディープリサーチ」と呼んでいます。しかし、これらの提供は実際にはどのくらい有効ですか?FutureSearchによる新しいレポート「Deep Research Bench(DRB):ウェブ研究エージェントの評価」は、最も厳格な評価を提供しています。結果は、印象的な機能と重要な欠点を示しています。

Deep Research Benchとは何か

FutureSearchチームによって作成されたDeep Research Benchは、AIエージェントのウェブベースの研究タスクのパフォーマンスを評価するためのベンチマークです。これらのタスクは、単純な質問と答えではありません。現実世界の分析家、政策立案者、研究者が直面する、複雑でオープンエンドの課題を反映しています。

このベンチマークには、8つのカテゴリにわたる89の異なるタスクが含まれています。たとえば、

  • 数字を見つける:例えば、「FDAクラスII医療機器のリコールは何回ありましたか?」
  • 主張を検証する:例えば、「ChatGPTはGoogle検索よりも10倍エネルギー効率が悪いですか?」
  • データセットをコンパイルする:例えば、「2019年から2023年までの米国のソフトウェア開発者の雇用動向」

各タスクは、人間によって検証された答えとともに慎重に構成されており、凍結されたウェブページのデータセット(RetroSearchと呼ばれる)を使用して評価されます。これにより、モデル評価の整合性が保たれ、ライブウェブの変化する状態を避けることができます。

エージェントアーキテクチャ:ReActとRetroSearch

Deep Research Benchの中心にあるのは、ReActアーキテクチャです。これは、「Reason + Act」という名前です。この方法は、人間の研究者が問題に対処する方法を模倣しています。思考を通じて、ウェブ検索などのアクションを実行し、結果を観察し、繰り返しまたは結論を出すことを決定します。

以前のモデルはこのループを明示的に実行しますが、新しい「思考」モデルはプロセスをより流暢にします。評価の整合性を確保するために、DRBはRetroSearchを導入しました。これは、カスタマイズされた静的なウェブバージョンです。ライブインターネットに頼るのではなく、エージェントはスクラップされたウェブページのキュレーションアーカイブにアクセスします。ツール seperti SerperPlaywrightScraperAPIを使用してスクラップされます。スケールは印象的です。高複雑度のタスクの場合、RetroSearchは189,000ページ以上にアクセスできます。すべてが時間の中で凍結されており、公正で再現可能なテスト環境が保証されています。

どのAIエージェントが最も優れていますか

すべての候補者の中で、OpenAIのo3がトップパフォーマーとして浮上しました。Deep Research Benchでは0.51のスコアを獲得しました。0.8が可能な最大スコアから見ると、さほど印象的ではありません。しかし、このベンチマークの難しさを理解することが重要です。タスク定義とスコアリングの曖昧さにより、完璧なエージェントであっても、0.8を超えることは難しいでしょう。つまり、現代の最良のモデルでも、まだ人間の研究者に及ばないということです。

しかし、リーダーボードは興味深い洞察を提供しています。o3はパックをリードし、スピードと一貫性を示しました。ほぼすべてのタスクタイプで強力なパフォーマンスを示しました。AnthropicのClaude 3.7 Sonnetは、「思考」と「非思考」モードの両方で多才性を示しました。GoogleのGemini 2.5 Proは、構造化された計画とステップバイステップの推論を必要とするタスクで際立っていました。Open-weightのDeepSeek-R1は、GPT-4 Turboとパフォーマンスのギャップを縮小しながら、競争力を示しました。

全体的に、明確なパターンが見られました。「思考を可能にした」新しいモデルは、以前のモデルよりも一貫して優れています。クローズドソースモデルは、オープンウェイトの代替モデルよりも優れています。

エージェントはどこで苦労していますか

Deep Research Benchレポートで強調された失敗パターンを読むと、驚くほど身にしみるものがありました。私が特に直面したのは、AIエージェントが何をしていたかを忘れてしまうことです。コンテキストウィンドウが広がると、モデルはしばしばスレッドを失います。重要な詳細が薄れ、目標が曖昧になり、応答が断片的または無意味になることがあります。ある時点で、損失を切り捨てて最初からやり直す方がいいことがあります。そうすれば、生成されたすべてを捨てることになりますが。

そのような忘れっぽさは、個人的な経験だけではありません。Deep Research Benchの評価では、最も重要な失敗の予測因子であることがわかりました。しかし、それだけではありません。レポートでは、モデルが繰り返しツールを使用することが多いことも強調されています。同じ検索を繰り返し実行するかのように、ループに陥ることがあります。他のモデルは、批判的に検索するのではなく、キーワードをマッチングするだけです。さらに、エージェントは、技術的には正しい答えを提供しますが、深い洞察に欠けている、早期の結論に陥ることがあります。

トップモデルの違いは、明らかです。GPT-4 Turboは、前のステップを忘れる傾向がありました。一方、DeepSeek-R1は、妄想または誤った情報を生成する可能性がありました。全体的に、モデルは頻繁に情報源を相互参照したり、調査結果を検証したりすることができませんでした。誰でもAIに頼ったことがある人にとって、これらの問題は、人間のように真剣に考え、研究するエージェントを構築するにはまだ遠いということを思い出させるでしょう。

メモリベースのパフォーマンスについては

興味深いことに、Deep Research Benchは「ツールレス」エージェントも評価しました。これは、外部ツール(ウェブ検索やドキュメントの取得など)にアクセスできない言語モデルです。これらのエージェントは、内部のトレーニングデータとメモリにのみ依存し、学習したものに基づいて答えを生成します。実際的には、情報を検証することはできません。学習データに基づいて推測することになります。

驚くことに、これらのツールレスエージェントは、特定のタスクでフルリサーチエージェントとほぼ同等のパフォーマンスを示しました。たとえば、「主張の検証」タスクでは、0.61のスコアを獲得しました。ツールを使用したエージェントの平均スコア0.62に近いスコアでした。これは、o3やClaudeのようなモデルが内部の先入観が強く、一般的な主張の真実性を認識できることを示しています。

しかし、より厳しいタスクの場合、たとえば「数字を導出する」や「証拠を集める」などのタスクでは、これらのツールレスモデルは完全に崩壊しました。新しい情報やリアルタイムの検索機能がなければ、正確な答えや包括的な回答を生成する手段がありませんでした。

この対比は、重要なニュアンスを浮き彫りにします。今日のLLMは「知識」をシミュレートできますが、深い研究には、単に回想するだけでなく、最新の検証可能な情報で推論することが必要です。ツールを使用するエージェントだけがこれを実現できます。

最終的な考え

DRBレポートは、1つのことを明確に示しています。今日の最高のAIエージェントは、狭い範囲のタスクで平均的な人間を上回る可能性がありますが、熟練した総合研究者、特に戦略的計画、プロセス中の適応、ニュアンスの推論に関しては、まだ後れを取っています。

このギャップは、特に長いまたは複雑なセッション中に明らかになります。そこでは、エージェントがタスクの目的を失い、回答の連携と有用性が低下することがあります。

Deep Research Benchが貴重なのは、単に表面的な知識をテストするのではなく、ツールの使用、メモリ、推論、適応の交差点を探っているからです。MMLUやGSM8kなどのベンチマークよりも、現実世界の研究に近いアナログを提供します。

LLMが本格的な知識作業に統合されるにつれて、FutureSearchツールのようなDRBは、これらのシステムが何を知っているかだけでなく、どのくらいうまく機能するかを評価するために不可欠になります。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。