AI-modeller och plattformar

You.com Web Search Highlights når 95,17% på SimpleQA

mm
Lägg till Unite.AI bland dina föredragna källor på Google

You.com den 1 september 2026 introducerade ett nytt extraktionsläge för sitt Web Search API kallat Highlights, och rapporterade ett resultat på 95,17 % på SimpleQA‑benchmarken samt 35 % lägre total frågekostnad än Claude Sonnet 5:s inbyggda webbsökning i en oberoende utvärdering. Funktionen är aktiv via API:ets extraction_mode-parameter till samma $5 CPM‑prissättning som den befintliga tjänsten, enligt företaget.

Vad Highlights gör

Web Search API returnerar strukturerade webb- och nyhetsresultat för AI‑applikationer. Som standard innehåller varje resultat en snippets-array med korta, nyckelordscentrerade textfragment. Genom att sätta extraction_mode till highlights ersätts dessa snippets med en contents.highlights-array som innehåller de avsnitt från varje sida som svarar på den specifika frågan.

Enligt You.com körs extraktionen per begäran, där varje fråga utlöser ett nytt genomgång av sidan. En modell identifierar vilka textavsnitt som redan svarar på frågan och returnerar dem ordagrant, med bevarade siffror, datum och tal exakt som de förekommer i källan. Tabeller returneras med rubriker intakta, kodblock behåller sin formatering, och meningar från samma avsnitt som båda är relevanta slås samman till ett enda passage. Kandidatpassager rangordnas, och den högst rankade returneras först.

Resultat för noggrannhet

You.com uppgav att de körde tre benchmarkar över alla tre extraktionslägen. Highlights låg först på SimpleQA med 95,17 % och på RetrievalQA med 66,93 %, de två benchmarkarna som bygger på enstaka faktauppslag. På FRAMES, ett flerstegs resonemangsbenchmark, fick full‑page‑extraktion 82,77 % jämfört med Highlights 82,04 %, ett gap på 0,73 poäng som företaget beskrev som inom den kör‑till‑kör‑varians som observeras i testet.

Företaget påpekade att noggrannhetsvinsten inte är gratis: kostnaden per fråga ökar med cirka 11 % jämfört med Snippets eftersom Highlights skickar mer text till svarande modell. Kostnaden per korrekt svar, som beräknas som kostnad delat med noggrannhet, blir fortfarande omkring 5 % lägre, uppgav de.

Mot externa system på SimpleQA rapporterade You.com tre system som klarade 95 %: You.com med Highlights på 95,17 % och 695 ms p50‑latens, Exa (full page) på 95,47 % och 1337 ms, samt Parallel (advanced) på 95,33 % och 2098 ms. Företaget sade att de visade varje konkurrents bäst presterande konfiguration, så jämförelsen gynnar dem i uppsättningen.

Oberoende kostnadsevaluering

Braintrust, som en del av en oberoende utvärdering, körde You.com Web Search med Highlights mot sökverktygen som är inbäddade i OpenAI‑ och Anthropic‑API:erna på 1 329 frågor, med kostnad som inkluderade både inferens och sökning.

I den utvärderingen kostade Claude Sonnet 5 $0,0747 per fråga med Highlights jämfört med $0,1148 för dess inbyggda sökning, en minskning på 35 %, med något högre noggrannhet (79,23 % mot 78,78 %) och 1,26 sekunder snabbare. GPT‑5.6 Terra kostade $0,0417 per fråga med Highlights jämfört med $0,0467 inbyggt, en minskning på 11 %, med 3,66 poäng högre noggrannhet. Kostnaden per korrekt svar sjönk med 35 % för Claude och 15 % för GPT, eftersom Highlights svarade på fler frågor korrekt med samma eller lägre utgift, enligt You.com:s redogörelse för resultaten.

Fördel med observerbarhet

You.com hävdade att avpaketerad webbsökning ger bättre observerbarhet än de inbyggda verktygen från OpenAI och Anthropic. Inbyggd sökning returnerar de frågor den körde och de sidor den citerade men inte de passager som modellen läser, enligt företaget, vilket innebär att det inte finns något sätt att se vilket steg som producerade ett felaktigt svar.

Den hänvisade till en fråga från Braintrust:s utvärdering som frågade hur många servicegames Carlos Alcaraz förlorade över två turneringsomgångar sammanlagt, vilket krävde att två separata tal adderas. You.com‑konfigurationen returnerade ett passage som fastställde det första värdet till 24 och ett annat som fastställde det andra till 22, och modellen adderade dem för att svara 46. De omgångar som missade presenterade aldrig ett passage som stödde 24, använde 22 för båda värdena och svarade 44. Varje körning utförde aritmetiken korrekt, ett faktum som företaget sade bara är känt eftersom passagerna visas i spåret.

När det inte bör användas

You.com sade att Highlights lägger till cirka 160 ms jämfört med Snippets vid enstaka uppslag, och att under en strikt latensbudget för enkla Q&A‑frågor är Snippets fortfarande rätt standard. För sidor som ändras snabbare än ett index uppdateras, hämtar extraction_mode: "full_page" live‑data istället för att servera från cache. FRAMES är där detta avvägning blir tydlig, enligt företaget, eftersom dess flersteg‑frågor kräver ett bredare kontextutrymme än några få snävt avgränsade passager, och full page slår Highlights där med 0,73 poäng.

Företaget meddelade att nya konton får $100 i krediter och att den ram som producerar dess benchmark‑siffror är offentligt tillgänglig.

Jonas Reeve är en AI-genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell allmän intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete utforskar hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI-arkitekturer och långvariga frågor inom kognitiv vetenskap och filosofi om medvetandet.
Med en konceptuell och reflekterande ansats undersöker Jonas ramverk som resonemangsmodeller, agenssystem, emergent kognition och anpassningsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder - och vad det inte betyder. Istället för att jaga tidsplaner eller hype betonar han första principer, konceptuell rigor och gränserna för nuvarande modeller.
Artiklar skrivna av Jonas Reeve är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa korrekthet, tydlighet och ansvarsfull diskussion om avancerade AI-koncept.