AI-modeller og platforme
You.com Web Search Highlights når 95,17% på SimpleQA

You.com den 1. september 2026 introducerede en ny udtræknings‑tilstand for sin Web Search‑API kaldet Highlights, og rapporterede en score på 95.17% på SimpleQA‑benchmarken samt en 35% lavere samlet forespørgselsomkostning end Claude Sonnet 5’s indbyggede websøgning i en uafhængig evaluering. Funktionen er tilgængelig via API’ens extraction_mode‑parameter til samme $5 CPM‑pris som den eksisterende tjeneste, siger virksomheden.
What Highlights Does
Web Search‑API’en returnerer strukturerede web‑ og nyhedsresultater til AI‑applikationer. Som standard indeholder hvert resultat et snippets‑array af korte, nøgleord‑centrerede tekstfragmenter. Når extraction_mode sættes til highlights, erstattes disse snippets med et contents.highlights‑array, der indeholder de afsnit fra hver side, som besvarer den specifikke forespørgsel.
Ifølge You.com kører udtrækningen pr. anmodning, hvor hver forespørgsel udløser et nyt gennemløb af siden. En model identificerer de tekstudsnit, der allerede besvarer forespørgslen, og returnerer dem ordret, idet tal, datoer og talværdier bevares som de fremgår af kilden. Tabeller returneres med overskrifter intakte, kodeblokke bevarer deres formatering, og sætninger fra samme afsnit, som begge er relevante, flettes sammen til et enkelt afsnit. Kandidatafsnit rangeres, så de højest rangerede returneres først.
Accuracy Results
You.com oplyste, at de gennemførte tre benchmark‑tests på tværs af alle tre udtræknings‑tilstande. Highlights førte på SimpleQA med 95.17% og på RetrievalQA med 66.93%, de to benchmark‑tests baseret på enkelt‑fakt‑opslag. På FRAMES, en multi‑hop‑reasoning‑benchmark, opnåede fuld‑side‑udtrækning 82.77% mod Highlights’ 82.04%, en forskel på 0.73 point, som virksomheden beskrev som inden for den løb‑til‑løb‑varians, de observerer i den test.
Virksomheden bemærkede, at nøjagtighedsgevinsten ikke er gratis: omkostningen pr. spørgsmål stiger med omkring 11% i forhold til Snippets, fordi Highlights sender mere tekst til den svarende model. Omkostningen pr. korrekt svar, som beregnes som omkostning divideret med nøjagtighed, er stadig omkring 5% lavere, oplyste de.
I sammenligning med eksterne systemer på SimpleQA rapporterede You.com tre systemer, der nåede 95%: You.com med Highlights på 95.17% og 695ms p50‑latens, Exa (fuld side) på 95.47% og 1337ms, samt Parallel (avanceret) på 95.33% og 2098ms. Virksomheden sagde, at de viste hver konkurrents bedst‑præsterende konfiguration, så sammenligningen favoriserer dem i opsætningen.
Independent Cost Evaluation
Braintrust, som en del af en uafhængig evaluering, kørte You.com Web Search med Highlights mod søgeværktøjerne, der er indlejret i OpenAI‑ og Anthropic‑API’erne, på 1,329 spørgsmål, hvor omkostningerne inkluderer både inferens og søgning.
I den evaluering kostede Claude Sonnet 5 $0.0747 pr. spørgsmål med Highlights mod $0.1148 for den indbyggede søgning, en reduktion på 35%, med en lidt højere nøjagtighed (79.23% versus 78.78%) og 1.26 sekunder hurtigere. GPT-5.6 Terra kostede $0.0417 pr. spørgsmål med Highlights mod $0.0467 indbygget, en reduktion på 11%, med 3.66 point højere nøjagtighed. Omkostningen pr. korrekt svar faldt med 35% for Claude og 15% for GPT, da Highlights besvarede flere spørgsmål korrekt ved samme eller lavere forbrug, ifølge You.com’s redegørelse for resultaterne.
Observability Advantage
You.com argumenterede for, at ubundlet websøgning giver bedre observabilitet end de indbyggede værktøjer fra OpenAI og Anthropic. Indbygget søgning returnerer de forespørgsler, den har udført, og de sider, den har citeret, men ikke de afsnit, modellen læser, siger virksomheden, hvilket efterlader ingen mulighed for at se, hvilket trin der producerede et forkert svar.
Den henviste til et spørgsmål fra Braintrust‑evalueringen, der spurgte, hvor mange service‑games Carlos Alcaraz mistede i to turneringsløb samlet, hvilket krævede at lægge to separate tal sammen. You.com‑konfigurationen returnerede et afsnit, der fastslog den første værdi til 24, og et andet, der fastslog den anden til 22, og modellen lagde dem sammen for at svare 46. De løb, der fejlede, frembragte aldrig et afsnit, der understøttede 24, brugte 22 for begge værdier og svarede 44. Hvert løb udførte aritmetikken korrekt, et faktum som virksomheden sagde kun er kendt, fordi afsnittene fremkommer i sporet.
When Not to Use It
You.com sagde, at Highlights tilføjer omkring 160ms i forhold til Snippets ved enkelt‑shot‑opslag, og at under et stramt latenstidsbudget på simple Q&A‑spørgsmål forbliver Snippets den rette standard. For sider, der ændrer sig hurtigere end et indeks opdateres, extraction_mode: "full_page" henter live i stedet for at levere fra cache. FRAMES er, hvor dette kompromis viser sig, siger virksomheden, fordi dens multi‑hop‑spørgsmål kræver et bredere kontekstudsnit end et håndfuld snævert afgrænsede afsnit kan levere, og fuld side slår Highlights der med 0.73 point.
Virksomheden oplyste, at nye konti modtager $100 i kredit, og at den ramme, der producerer deres benchmark‑tal, er offentligt tilgængelig.












