Modele i platformy AI
You.com Web Search Highlights osiąga 95,17% w benchmarku SimpleQA

You.com 1 września 2026 wprowadził nowy tryb ekstrakcji dla swojego interfejsu Web Search API o nazwie Highlights, z wynikiem 95,17 % w benchmarku SimpleQA oraz o 35 % niższym całkowitym kosztem zapytań w porównaniu do wbudowanego wyszukiwania w Claude Sonnet 5, według niezależnej oceny. Funkcja jest dostępna poprzez parametr extraction_mode API przy tej samej cenie $5 CPM co istniejąca usługa, podała firma.
Co robi Highlights
Interfejs Web Search API zwraca ustrukturyzowane wyniki z sieci i wiadomości dla aplikacji AI. Domyślnie każdy wynik zawiera tablicę snippets z krótkimi fragmentami tekstu skoncentrowanymi na słowach kluczowych. Ustawienie extraction_mode na highlights zastępuje te fragmenty tablicą contents.highlights zawierającą fragmenty z każdej strony, które odpowiadają na konkretne zapytanie.
Według You.com ekstrakcja odbywa się dla każdego żądania, przy czym każde zapytanie wywołuje nową analizę strony. Model identyfikuje fragmenty tekstu, które już odpowiadają na pytanie i zwraca je dosłownie, zachowując liczby, daty i dane tak, jak występują w źródle. Tabele są zwracane z niezmienionymi nagłówkami, bloki kodu zachowują formatowanie, a zdania z tej samej sekcji, które są istotne, są łączone w jeden fragment. Kandydaci fragmenty są klasyfikowane, przy czym najwyżej ocenione zwracane są jako pierwsze.
Wyniki dokładności
You.com poinformowało, że przeprowadziło trzy benchmarki we wszystkich trzech trybach ekstrakcji. Highlights uzyskało wynik 95,17 % w SimpleQA oraz 66,93 % w RetrievalQA, dwa benchmarki oparte na wyszukiwaniu pojedynczych faktów. W benchmarku FRAMES, testującym rozumowanie wieloetapowe, ekstrakcja pełnej strony uzyskała 82,77 % w porównaniu do 82,04 % dla Highlights, różnica 0,73 punktu, którą firma określiła jako mieszczącą się w obserwowanej zmienności pomiędzy uruchomieniami tego testu.
Firma zauważyła, że zysk w dokładności nie jest darmowy: koszt na pytanie rośnie o około 11 % w porównaniu do Snippets, ponieważ Highlights przesyła więcej tekstu do modelu odpowiadającego. Koszt na poprawną odpowiedź, obliczany jako koszt podzielony przez dokładność, nadal jest o około 5 % niższy, podała firma.
W porównaniu z zewnętrznymi systemami w benchmarku SimpleQA, You.com zgłosiło trzy systemy przekraczające 95 %: You.com z Highlights osiągnął 95,17 % przy opóźnieniu p50 695 ms, Exa (pełna strona) 95,47 % przy 1337 ms oraz Parallel (zaawansowany) 95,33 % przy 2098 ms. Firma zaznaczyła, że przedstawiła konfigurację o najlepszej wydajności każdego konkurenta, co sprawia, że porównanie faworyzuje ich pod względem ustawień.
Niezależna ocena kosztów
Braintrust, w ramach niezależnej oceny, przeprowadził test You.com Web Search z Highlights przeciwko narzędziom wyszukiwania wbudowanym w API OpenAI i Anthropic na 1 329 pytaniach, uwzględniając koszty zarówno inferencji, jak i wyszukiwania.
W tej ocenie koszt Claude Sonnet 5 wyniósł 0,0747 $ za pytanie przy użyciu Highlights w porównaniu do 0,1148 $ za wbudowane wyszukiwanie, co stanowi 35 % redukcję, przy nieco wyższej dokładności (79,23 % vs 78,78 %) i o 1,26 szybciej. GPT‑5.6 Terra kosztował 0,0417 $ za pytanie przy Highlights w porównaniu do 0,0467 $ wbudowanego, co daje 11 % redukcję, przy 3,66 punktu wyższej dokładności. Koszt na poprawną odpowiedź spadł o 35 % dla Claude i 15 % dla GPT, ponieważ Highlights udzielało poprawnych odpowiedzi przy tym samym lub niższym wydatku, według relacji You.com na temat wyników.
Zaleta obserwowalności
You.com twierdzi, że oddzielne wyszukiwanie w sieci zapewnia lepszą obserwowalność niż wbudowane narzędzia OpenAI i Anthropic. Wbudowane wyszukiwanie zwraca zapytania, które wykonało, oraz strony, które zacytowało, ale nie fragmenty, które model przeczytał, jak podkreśliła firma, co uniemożliwia zobaczenie, który krok spowodował błędną odpowiedź.
Cytowano pytanie z oceny Braintrust, które pytało, ile gemów serwisowych stracił Carlos Alcaraz w sumie w dwóch turniejach, co wymagało dodania dwóch oddzielnych liczb. Konfiguracja You.com zwróciła jeden fragment ustalający pierwszą wartość jako 24 oraz drugi ustalający drugą wartość jako 22, a model dodał je, uzyskując 46. Wersje, które nie znalazły fragmentu potwierdzającego 24, użyły 22 dla obu wartości i odpowiedziały 44. Każde uruchomienie wykonało arytmetykę poprawnie, fakt, który firma podkreśliła, jest znany tylko dzięki temu, że fragmenty pojawiają się w śladowaniu.
Kiedy nie warto go używać
You.com poinformowało, że Highlights dodaje około 160 ms w porównaniu do Snippets przy jednorazowych zapytaniach i że przy sztywnym limicie opóźnień w prostych pytaniach Q&A Snippets pozostają właściwym domyślnym wyborem. Dla stron, które zmieniają się szybciej niż odświeża się indeks, extraction_mode: "full_page" pobiera treść na żywo zamiast z pamięci podręcznej. FRAMES to obszar, w którym pojawia się ten kompromis, jak podkreśliła firma, ponieważ jej pytania wieloetapowe wymagają szerszego kontekstu niż kilka ściśle określonych fragmentów, a pełna strona przewyższa Highlights o 0,73 punktu.
Firma poinformowała, że nowe konta otrzymują kredyt w wysokości 100 $, a zestaw narzędzi generujący wyniki benchmarków jest dostępny publicznie.












