AI 模型与平台
You.com 网页搜索 Highlights 在 SimpleQA 上达到 95.17%

You.com 于2026年9月1日推出其网页搜索 API 的新提取模式,名为 Highlights,并报告在 SimpleQA 基准上取得 95.17% 的得分,在一次独立评估中,其总查询成本比 Claude Sonnet 5 的内置网页搜索低 35%。该功能通过 API 的 extraction_mode 参数上线,定价仍为每千次请求 5 美元,与现有服务相同,公司表示。
Highlights 的功能
网页搜索 API 为 AI 应用返回结构化的网页和新闻结果。默认情况下,每个结果包含一个 snippets 数组,内含简短、以关键词为中心的文本片段。将 extraction_mode 设置为 highlights 时,这些 snippets 将被 contents.highlights 数组取代,后者包含每个页面中针对特定查询的段落。
You.com 表示,提取在每次请求时执行,每个查询都会对页面进行一次全新的遍历。模型会识别出已经回答查询的文本片段,并原文返回,保留数字、日期和数值的原始形式。表格会保留标题,代码块保持格式,同一章节中相关的句子会合并为一个段落。候选段落会被排序,最高排名的先返回。
准确性结果
You.com 称其在所有三种提取模式下运行了三项基准测试。Highlights 在 SimpleQA 上以 95.17% 的得分领先,在 RetrievalQA 上以 66.93% 领先,这两项基准均围绕单一事实查询构建。在 FRAMES(多跳推理基准)上,全文提取得分为 82.77%,而 Highlights 为 82.04%,两者相差 0.73 分,公司表示该差距在该测试的运行间差异范围内。
公司指出,准确性提升并非免费: 与 Snippets 相比,每个问题的成本上升约 11%,因为 Highlights 向回答模型发送了更多文本。每正确答案的成本(即成本除以准确率)仍约低 5%,公司表示。
在 SimpleQA 上与外部系统对比时,You.com 报告了三套系统突破 95%: 使用 Highlights 的 You.com 达到 95.17% 且 p50 延迟 695ms,Exa(全文)为 95.47% 且 1337ms,Parallel(高级)为 95.33% 且 2098ms。公司称展示的是每个竞争对手的最佳配置,因此比较在设置上对它们更有利。
独立成本评估
Braintrust 作为一次 独立评估 的一部分,对 1,329 个问题使用 You.com 网页搜索的 Highlights 与 OpenAI 和 Anthropic API 中捆绑的搜索工具进行比较,成本包括推理和搜索两部分。
在该评估中,Claude Sonnet 5 使用 Highlights 的每题成本为 $0.0747,而其内置搜索为 $0.1148,降低了 35%,且准确率略高(79.23% 对比 78.78%),速度快了 1.26 秒。GPT-5.6 Terra 使用 Highlights 的每题成本为 $0.0417,而内置搜索为 $0.0467,降低了 11%,且准确率提升了 3.66 分。根据 You.com 对结果的说明,每正确答案的成本对 Claude 降低了 35%,对 GPT 降低了 15%,因为 Highlights 在相同或更低的支出下回答了更多正确问题。
可观测性优势
You.com 认为,未捆绑的网页搜索相比 OpenAI 和 Anthropic 的内置工具提供了更好的可观测性。公司表示,内置搜索会返回其执行的查询和引用的页面,但不会返回模型阅读的具体段落,导致无法判断是哪一步导致错误答案。
它举例说明了 Braintrust 评估中的一个问题:询问卡洛斯·阿尔卡拉斯在两次赛事中共失掉多少局比赛,需要将两个数字相加。You.com 的配置返回了一段确认首个数值为 24 的段落和另一段确认第二个数值为 22 的段落,模型将其相加得到 46。未命中的运行则未出现支持 24 的段落,两个数值都使用 22,得到 44。每一次运行的算术都正确,公司指出只有因为这些段落出现在追踪记录中才得以知晓此事实。
何时不适用
You.com 表示,在单次查询时,Highlights 相比 Snippets 会额外增加约 160 毫秒的延迟,并且在对简单问答设有严格延迟预算时,Snippets 仍是合适的默认选项。对于变化快于索引刷新速度的页面,extraction_mode: "full_page" 会实时获取而非从缓存提供。公司称,在 FRAMES 场景下这种权衡尤为明显,因为其多跳问题需要比少量紧密限定的段落更广泛的上下文,而全文提取在此以 0.73 分优势胜过 Highlights。
公司表示,新账户将获得 100 美元的额度,并且用于生成其基准数据的工具已公开提供。












