AI 모델 및 플랫폼

You.com 웹 검색 Highlights, SimpleQA에서 95.17% 달성

mm
Unite.AI를 Google의 선호 소스에 추가

You.com은 2026년 9월 1일, Highlights라는 새로운 추출 모드를 웹 검색 API에 도입했으며, SimpleQA 벤치마크에서 95.17% 점수를 기록하고 독립 평가에서 Claude Sonnet 5의 내장 웹 검색보다 전체 쿼리 비용이 35% 낮다고 보고했습니다. 이 기능은 API의 extraction_mode 매개변수를 통해 기존 서비스와 동일한 $5 CPM 가격으로 제공된다고 회사는 밝혔습니다.

Highlights가 하는 일

Web Search API는 AI 애플리케이션을 위해 구조화된 웹 및 뉴스 결과를 반환합니다. 기본적으로 각 결과에는 짧고 키워드 중심의 텍스트 조각 배열인 snippets가 포함됩니다. extraction_modehighlights로 설정하면 해당 스니펫이 각 페이지에서 특정 질의에 답하는 구절을 담은 contents.highlights 배열로 대체됩니다.

You.com에 따르면, 추출은 요청당 실행되며 각 질의는 페이지에 대한 새로운 패스를 트리거합니다. 모델은 이미 질의에 답하는 텍스트 구간을 식별하고 이를 그대로 반환하며, 숫자, 날짜, 수치는 원본 그대로 보존됩니다. 표는 헤더를 유지한 채 반환되고, 코드 블록은 형식을 유지하며, 동일 섹션에서 중요한 문장은 하나의 구절로 병합됩니다. 후보 구절은 순위가 매겨지며, 가장 높은 순위가 먼저 반환됩니다.

정확도 결과

You.com은 세 가지 추출 모드 모두에 대해 세 가지 벤치마크를 실행했다고 밝혔습니다. Highlights는 SimpleQA에서 95.17%, RetrievalQA에서 66.93%로 앞섰으며, 이 두 벤치마크는 단일 사실 조회에 기반합니다. 다중 홉 추론 벤치마크인 FRAMES에서는 전체 페이지 추출이 82.77%를 기록한 반면 Highlights는 82.04%로, 0.73점 차이는 회사가 해당 테스트에서 관찰한 실행 간 변동 범위 안에 있다고 설명했습니다.

회사 측은 정확도 향상이 무료가 아니라고 언급했습니다. Highlights는 답변 모델에 더 많은 텍스트를 전달하기 때문에 질문당 비용이 Snippets 대비 약 11% 상승합니다. 그러나 정확도로 나눈 비용인 정답당 비용은 여전히 약 5% 낮게 나타난다고 밝혔습니다.

SimpleQA에서 외부 시스템과 비교했을 때, You.com은 세 시스템이 95%를 초과했다고 보고했습니다: Highlights를 적용한 You.com은 95.17%와 p50 지연시간 695ms, Exa(전체 페이지)는 95.47%와 1337ms, Parallel(고급)은 95.33%와 2098ms를 기록했습니다. 회사는 각 경쟁사의 최고 성능 구성을 표시했으므로 비교가 설정 측면에서 자신들에게 유리하게 된다고 설명했습니다.

독립 비용 평가

Braintrust는 독립 평가의 일환으로 1,329개의 질문에 대해 OpenAI 및 Anthropic API에 포함된 검색 도구와 비교하여 Highlights가 적용된 You.com 웹 검색을 실행했으며, 비용에는 추론과 검색 모두가 포함되었습니다.

이 평가에서 Claude Sonnet 5는 질문당 $0.0747의 비용으로 Highlights를 사용했으며, 내장 검색은 $0.1148으로 35% 감소했으며 정확도는 약간 더 높아(79.23% 대 78.78%) 1.26초 더 빨랐습니다. GPT-5.6 Terra는 질문당 $0.0417의 비용으로 Highlights를 사용했으며, 내장 검색은 $0.0467으로 11% 감소했으며 정확도는 3.66점 더 높았습니다. You.com이 제공한 결과에 따르면, Highlights가 동일하거나 더 낮은 비용으로 더 많은 질문에 정확히 답변했기 때문에 Claude의 정답당 비용은 35% 감소하고 GPT는 15% 감소했습니다.

관측 가능성 장점

You.com은 분리된 웹 검색이 OpenAI와 Anthropic의 내장 도구보다 더 나은 관측 가능성을 제공한다고 주장했습니다. 내장 검색은 실행한 질의와 인용한 페이지는 반환하지만 모델이 읽은 구절은 반환하지 않아, 어느 단계에서 잘못된 답변이 생성됐는지 확인할 방법이 없다고 회사는 말했습니다.

Braintrust 평가의 질문 중 하나는 Carlos Alcaraz가 두 번의 토너먼트 진행 동안 잃은 서비스 게임 수를 묻는 것으로, 두 개의 별도 숫자를 더해야 했습니다. You.com 설정은 첫 번째 값 24를 제시하는 구절과 두 번째 값 22를 제시하는 구절을 각각 반환했으며, 모델은 이를 더해 46이라는 답을 도출했습니다. 반면 놓친 실행은 24를 뒷받침하는 구절을 표시하지 않고 22를 두 번 사용해 44라는 답을 제시했습니다. 모든 실행은 산술을 정확히 수행했으며, 이는 구절이 추적에 나타나기 때문에만 알 수 있는 사실이라고 회사는 밝혔습니다.

사용하면 안 되는 경우

You.com은 Highlights가 단일 조회에서 Snippets보다 약 160ms를 추가하며, 단순 Q&A 질문에 대한 엄격한 지연 시간 제한 하에서는 Snippets가 여전히 적절한 기본값이라고 말했습니다. 인덱스가 갱신되기보다 페이지가 더 빨리 변하는 경우, extraction_mode: "full_page"는 캐시가 아닌 실시간으로 가져옵니다. 회사에 따르면 FRAMES에서 이러한 트레이드오프가 나타나는데, 이는 다중 홉 질문이 소수의 제한된 구절이 제공하는 것보다 더 넓은 컨텍스트를 필요로 하고 전체 페이지가 Highlights보다 0.73점 앞서기 때문입니다.

회사에 따르면 신규 계정은 $100 크레딧을 받으며, 벤치마크 수치를 생성하는 하네스는 공개적으로 제공된다고 밝혔습니다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.