AIモデルとプラットフォーム

You.com Web Search Highlights が SimpleQA で 95.17% に達する

mm
Unite.AI を Google の優先ソースに追加

You.comは2026年9月1日に、Web Search API向けの新しい抽出モード「Highlights」を導入し、SimpleQAベンチマークで95.17%のスコア、Claude Sonnet 5の組み込みウェブ検索に比べて総クエリコストが35%低いことを独立評価で報告しました。この機能はAPIのextraction_modeパラメータで利用可能で、既存サービスと同じ$5 CPMの価格設定です、と同社は述べています。

Highlights が行うこと

Web Search APIはAIアプリケーション向けに構造化されたウェブおよびニュースの結果を返します。デフォルトでは、各結果に短くキーワード中心のテキスト片段のsnippets配列が含まれます。extraction_modehighlightsに設定すると、これらのスニペットがcontents.highlights配列に置き換わり、各ページから特定のクエリに対応するパッセージが格納されます。

You.comによると、抽出はリクエストごとに実行され、各クエリはページに対して新たに処理が行われます。モデルはクエリに既に答えているテキストの範囲を特定し、元の形で返します。数値、日付、数式はソースと同様に保持されます。テーブルはヘッダーをそのまま返し、コードブロックはフォーマットが保持され、同一セクション内で重要な文は単一のパッセージに統合されます。候補パッセージは順位付けされ、最も高い順位のものが最初に返されます。

精度結果

You.comは、3つの抽出モードすべてで3つのベンチマークを実施したと述べました。HighlightsはSimpleQAで95.17%、RetrievalQAで66.93%のスコアでトップとなり、これらは単一事実検索に基づくベンチマークです。マルチホップ推論ベンチマークのFRAMESでは、フルページ抽出が82.77%で、Highlightsは82.04%となり、0.73ポイントの差は同社が観測しているテストのラン間変動の範囲内と説明しています。

同社は、精度向上にはコストが伴うことを指摘しています。Snippetsに比べて質問あたりのコストは約11%上昇しますが、これはHighlightsが回答モデルに送るテキストが増えるためです。一方、正解あたりのコスト(コストを精度で割ったもの)は約5%低減すると述べています。

SimpleQAにおける外部システムとの比較で、You.comは3つのシステムが95%を超えると報告しました:Highlightsを使用したYou.comは95.17%でp50レイテンシは695ms、Exa(フルページ)は95.47%で1337ms、Parallel(高度)は95.33%で2098msです。同社は各競合の最良構成を表示したため、比較は自社に有利になると述べています。

独立コスト評価

Braintrustは独立評価の一環として、1,329件の質問に対し、推論と検索の両方のコストを含めて、OpenAIおよびAnthropic APIにバンドルされた検索ツールと比較して、Highlightsを使用したYou.com Web Search を実施しました。

この評価では、Claude Sonnet 5はHighlights使用時の質問あたりコストが$0.0747で、組み込み検索は$0.1148となり、35%の削減となりました。精度はやや高く(79.23% 対 78.78%)で、速度は1.26秒速くなっています。GPT-5.6 Terraは質問あたり$0.0417(Highlights使用)に対し、組み込みは$0.0467で、11%の削減で、精度は3.66ポイント高くなっています。正解あたりのコストはClaudeで35%、GPTで15%低減しました。これはHighlightsが同等または低い支出でより多くの質問に正しく回答したためだと、You.comは結果の説明で述べています。

可観測性の優位性

You.comは、バンドルされていないウェブ検索はOpenAIおよびAnthropicの組み込みツールよりも可観測性が高いと主張しました。組み込み検索は実行したクエリと参照したページは返しますが、モデルが読んだパッセージは返さず、どのステップで誤答が生じたかを確認できないと同社は述べています。

Braintrustの評価で出された、カーロス・アルカラスが2つのトーナメントで失ったサービスゲーム数を合計で尋ねる質問(2つの数値を足す必要がある)を例に挙げました。You.comの設定では、最初の値24を示すパッセージと、次の値22を示すパッセージが返され、モデルはそれらを足して46と答えました。誤った実行では24を示すパッセージが現れず、22を両方の値として44と答えました。すべての実行は算術的に正しく行われており、パッセージがトレースに現れるためにのみこの事実が確認できると同社は述べています。

使用すべきでないケース

You.comは、単発検索においてHighlightsはSnippetsに比べ約160msの遅延が追加されると述べており、シンプルなQ&A質問で厳しいレイテンシ予算がある場合はSnippetsが適切なデフォルトであるとしています。インデックスの更新よりもページが頻繁に変わる場合、extraction_mode: "full_page"はキャッシュではなくライブで取得します。FRAMESではこのトレードオフが顕在化すると同社は述べており、マルチホップ質問は限られた数のパッセージでは提供できない広範なコンテキストを必要とし、フルページがHighlightsを0.73ポイント上回ります。

同社は、新規アカウントには$100のクレジットが付与され、ベンチマーク数値を生成するハーネスは公開されていると述べました。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。