AI 모델 및 플랫폼
You.com 웹 검색 Highlights, SimpleQA에서 95.17% 달성

You.com은 2026년 9월 1일, Highlights라는 새로운 추출 모드를 웹 검색 API에 도입했으며, SimpleQA 벤치마크에서 95.17% 점수를 기록하고 독립 평가에서 Claude Sonnet 5의 내장 웹 검색보다 전체 쿼리 비용이 35% 낮다고 보고했습니다. 이 기능은 API의 extraction_mode 매개변수를 통해 기존 서비스와 동일한 $5 CPM 가격으로 제공된다고 회사는 밝혔습니다.
Highlights가 하는 일
Web Search API는 AI 애플리케이션을 위해 구조화된 웹 및 뉴스 결과를 반환합니다. 기본적으로 각 결과에는 짧고 키워드 중심의 텍스트 조각 배열인 snippets가 포함됩니다. extraction_mode를 highlights로 설정하면 해당 스니펫이 각 페이지에서 특정 질의에 답하는 구절을 담은 contents.highlights 배열로 대체됩니다.
You.com에 따르면, 추출은 요청당 실행되며 각 질의는 페이지에 대한 새로운 패스를 트리거합니다. 모델은 이미 질의에 답하는 텍스트 구간을 식별하고 이를 그대로 반환하며, 숫자, 날짜, 수치는 원본 그대로 보존됩니다. 표는 헤더를 유지한 채 반환되고, 코드 블록은 형식을 유지하며, 동일 섹션에서 중요한 문장은 하나의 구절로 병합됩니다. 후보 구절은 순위가 매겨지며, 가장 높은 순위가 먼저 반환됩니다.
정확도 결과
You.com은 세 가지 추출 모드 모두에 대해 세 가지 벤치마크를 실행했다고 밝혔습니다. Highlights는 SimpleQA에서 95.17%, RetrievalQA에서 66.93%로 앞섰으며, 이 두 벤치마크는 단일 사실 조회에 기반합니다. 다중 홉 추론 벤치마크인 FRAMES에서는 전체 페이지 추출이 82.77%를 기록한 반면 Highlights는 82.04%로, 0.73점 차이는 회사가 해당 테스트에서 관찰한 실행 간 변동 범위 안에 있다고 설명했습니다.
회사 측은 정확도 향상이 무료가 아니라고 언급했습니다. Highlights는 답변 모델에 더 많은 텍스트를 전달하기 때문에 질문당 비용이 Snippets 대비 약 11% 상승합니다. 그러나 정확도로 나눈 비용인 정답당 비용은 여전히 약 5% 낮게 나타난다고 밝혔습니다.
SimpleQA에서 외부 시스템과 비교했을 때, You.com은 세 시스템이 95%를 초과했다고 보고했습니다: Highlights를 적용한 You.com은 95.17%와 p50 지연시간 695ms, Exa(전체 페이지)는 95.47%와 1337ms, Parallel(고급)은 95.33%와 2098ms를 기록했습니다. 회사는 각 경쟁사의 최고 성능 구성을 표시했으므로 비교가 설정 측면에서 자신들에게 유리하게 된다고 설명했습니다.
독립 비용 평가
Braintrust는 독립 평가의 일환으로 1,329개의 질문에 대해 OpenAI 및 Anthropic API에 포함된 검색 도구와 비교하여 Highlights가 적용된 You.com 웹 검색을 실행했으며, 비용에는 추론과 검색 모두가 포함되었습니다.
이 평가에서 Claude Sonnet 5는 질문당 $0.0747의 비용으로 Highlights를 사용했으며, 내장 검색은 $0.1148으로 35% 감소했으며 정확도는 약간 더 높아(79.23% 대 78.78%) 1.26초 더 빨랐습니다. GPT-5.6 Terra는 질문당 $0.0417의 비용으로 Highlights를 사용했으며, 내장 검색은 $0.0467으로 11% 감소했으며 정확도는 3.66점 더 높았습니다. You.com이 제공한 결과에 따르면, Highlights가 동일하거나 더 낮은 비용으로 더 많은 질문에 정확히 답변했기 때문에 Claude의 정답당 비용은 35% 감소하고 GPT는 15% 감소했습니다.
관측 가능성 장점
You.com은 분리된 웹 검색이 OpenAI와 Anthropic의 내장 도구보다 더 나은 관측 가능성을 제공한다고 주장했습니다. 내장 검색은 실행한 질의와 인용한 페이지는 반환하지만 모델이 읽은 구절은 반환하지 않아, 어느 단계에서 잘못된 답변이 생성됐는지 확인할 방법이 없다고 회사는 말했습니다.
Braintrust 평가의 질문 중 하나는 Carlos Alcaraz가 두 번의 토너먼트 진행 동안 잃은 서비스 게임 수를 묻는 것으로, 두 개의 별도 숫자를 더해야 했습니다. You.com 설정은 첫 번째 값 24를 제시하는 구절과 두 번째 값 22를 제시하는 구절을 각각 반환했으며, 모델은 이를 더해 46이라는 답을 도출했습니다. 반면 놓친 실행은 24를 뒷받침하는 구절을 표시하지 않고 22를 두 번 사용해 44라는 답을 제시했습니다. 모든 실행은 산술을 정확히 수행했으며, 이는 구절이 추적에 나타나기 때문에만 알 수 있는 사실이라고 회사는 밝혔습니다.
사용하면 안 되는 경우
You.com은 Highlights가 단일 조회에서 Snippets보다 약 160ms를 추가하며, 단순 Q&A 질문에 대한 엄격한 지연 시간 제한 하에서는 Snippets가 여전히 적절한 기본값이라고 말했습니다. 인덱스가 갱신되기보다 페이지가 더 빨리 변하는 경우, extraction_mode: "full_page"는 캐시가 아닌 실시간으로 가져옵니다. 회사에 따르면 FRAMES에서 이러한 트레이드오프가 나타나는데, 이는 다중 홉 질문이 소수의 제한된 구절이 제공하는 것보다 더 넓은 컨텍스트를 필요로 하고 전체 페이지가 Highlights보다 0.73점 앞서기 때문입니다.
회사에 따르면 신규 계정은 $100 크레딧을 받으며, 벤치마크 수치를 생성하는 하네스는 공개적으로 제공된다고 밝혔습니다.












