AI 模型与平台

You.com 网页搜索 Highlights 在 SimpleQA 上达到 95.17%

mm
将 Unite.AI 添加到您在 Google 上的首选来源

You.com 于2026年9月1日推出其网页搜索 API 的新提取模式,名为 Highlights,并报告在 SimpleQA 基准上取得 95.17% 的得分,在一次独立评估中,其总查询成本比 Claude Sonnet 5 的内置网页搜索低 35%。该功能通过 API 的 extraction_mode 参数上线,定价仍为每千次请求 5 美元,与现有服务相同,公司表示。

Highlights 的功能

网页搜索 API 为 AI 应用返回结构化的网页和新闻结果。默认情况下,每个结果包含一个 snippets 数组,内含简短、以关键词为中心的文本片段。将 extraction_mode 设置为 highlights 时,这些 snippets 将被 contents.highlights 数组取代,后者包含每个页面中针对特定查询的段落。

You.com 表示,提取在每次请求时执行,每个查询都会对页面进行一次全新的遍历。模型会识别出已经回答查询的文本片段,并原文返回,保留数字、日期和数值的原始形式。表格会保留标题,代码块保持格式,同一章节中相关的句子会合并为一个段落。候选段落会被排序,最高排名的先返回。

准确性结果

You.com 称其在所有三种提取模式下运行了三项基准测试。Highlights 在 SimpleQA 上以 95.17% 的得分领先,在 RetrievalQA 上以 66.93% 领先,这两项基准均围绕单一事实查询构建。在 FRAMES(多跳推理基准)上,全文提取得分为 82.77%,而 Highlights 为 82.04%,两者相差 0.73 分,公司表示该差距在该测试的运行间差异范围内。

公司指出,准确性提升并非免费: 与 Snippets 相比,每个问题的成本上升约 11%,因为 Highlights 向回答模型发送了更多文本。每正确答案的成本(即成本除以准确率)仍约低 5%,公司表示。

在 SimpleQA 上与外部系统对比时,You.com 报告了三套系统突破 95%: 使用 Highlights 的 You.com 达到 95.17% 且 p50 延迟 695ms,Exa(全文)为 95.47% 且 1337ms,Parallel(高级)为 95.33% 且 2098ms。公司称展示的是每个竞争对手的最佳配置,因此比较在设置上对它们更有利。

独立成本评估

Braintrust 作为一次 独立评估 的一部分,对 1,329 个问题使用 You.com 网页搜索的 Highlights 与 OpenAI 和 Anthropic API 中捆绑的搜索工具进行比较,成本包括推理和搜索两部分。

在该评估中,Claude Sonnet 5 使用 Highlights 的每题成本为 $0.0747,而其内置搜索为 $0.1148,降低了 35%,且准确率略高(79.23% 对比 78.78%),速度快了 1.26 秒。GPT-5.6 Terra 使用 Highlights 的每题成本为 $0.0417,而内置搜索为 $0.0467,降低了 11%,且准确率提升了 3.66 分。根据 You.com 对结果的说明,每正确答案的成本对 Claude 降低了 35%,对 GPT 降低了 15%,因为 Highlights 在相同或更低的支出下回答了更多正确问题。

可观测性优势

You.com 认为,未捆绑的网页搜索相比 OpenAI 和 Anthropic 的内置工具提供了更好的可观测性。公司表示,内置搜索会返回其执行的查询和引用的页面,但不会返回模型阅读的具体段落,导致无法判断是哪一步导致错误答案。

它举例说明了 Braintrust 评估中的一个问题:询问卡洛斯·阿尔卡拉斯在两次赛事中共失掉多少局比赛,需要将两个数字相加。You.com 的配置返回了一段确认首个数值为 24 的段落和另一段确认第二个数值为 22 的段落,模型将其相加得到 46。未命中的运行则未出现支持 24 的段落,两个数值都使用 22,得到 44。每一次运行的算术都正确,公司指出只有因为这些段落出现在追踪记录中才得以知晓此事实。

何时不适用

You.com 表示,在单次查询时,Highlights 相比 Snippets 会额外增加约 160 毫秒的延迟,并且在对简单问答设有严格延迟预算时,Snippets 仍是合适的默认选项。对于变化快于索引刷新速度的页面,extraction_mode: "full_page" 会实时获取而非从缓存提供。公司称,在 FRAMES 场景下这种权衡尤为明显,因为其多跳问题需要比少量紧密限定的段落更广泛的上下文,而全文提取在此以 0.73 分优势胜过 Highlights。

公司表示,新账户将获得 100 美元的额度,并且用于生成其基准数据的工具已公开提供。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。