Моделі та платформи ШІ

You.com Web Search Highlights досягає 95,17% у SimpleQA

mm
Додайте Unite.AI до бажаних джерел у Google

You.com 1 вересня 2026 року представила новий режим видобутку для свого API веб‑пошуку під назвою Highlights, повідомивши про результат 95,17 % у бенчмарку SimpleQA та про 35 % нижчі загальні витрати на запит порівняно зі вбудованим веб‑пошуком Claude Sonnet 5 у незалежній оцінці. Функція доступна через параметр extraction_mode API за тією ж ціною $5 CPM, що й існуючий сервіс, повідомляє компанія.

What Highlights Does

API веб‑пошуку повертає структуровані результати веб‑ та новинних запитів для AI‑застосунків. За замовчуванням кожен результат містить масив snippets з короткими, орієнтованими на ключові слова текстовими фрагментами. Встановлення extraction_mode у значення highlights замінює ці snippets на масив contents.highlights, що містить уривки з кожної сторінки, які відповідають конкретному запиту.

За даними You.com, видобуток виконується для кожного запиту, причому кожен запит ініціює новий прохід по сторінці. Модель визначає, які ділянки тексту вже відповідають запиту, і повертає їх дослівно, зберігаючи числа, дати та цифри у вигляді, у якому вони були в джерелі. Таблиці повертаються зі збереженими заголовками, блоки коду зберігають форматування, а речення з одного розділу, які обидва мають значення, об’єднуються в один уривок. Кандидатські уривки ранжуються, і спочатку повертаються найвищо оцінені.

Accuracy Results

You.com повідомила, що провела три бенчмарки за всіма трьома режимами видобутку. Highlights лідирував у SimpleQA зі 95,17 % і у RetrievalQA зі 66,93 %, два бенчмарки, засновані на пошуку одиничних фактів. У FRAMES, бенчмарку багатокрокового міркування, повний витяг сторінки отримав 82,77 % проти 82,04 % у Highlights, різниця у 0,73 пункту, яку компанія охарактеризувала як межу варіації між запусками тесту.

Компанія зазначила, що підвищення точності не безкоштовне: вартість за питання зростає приблизно на 11 % у порівнянні зі Snippets, оскільки Highlights надсилає більше тексту до моделі, що відповідає. Вартість за правильну відповідь, яку розраховують як вартість, поділену на точність, все ж приблизно на 5 % нижча, повідомляє компанія.

У порівнянні з зовнішніми системами у SimpleQA You.com повідомила про три системи, що перевищили 95 %: You.com з Highlights – 95,17 % і затримка p50 695 мс, Exa (повна сторінка) – 95,47 % і 1337 мс, та Parallel (розширений) – 95,33 % і 2098 мс. Компанія зазначила, що представила найкращі конфігурації кожного конкурента, тому порівняння схиляється на користь їхнього налаштування.

Independent Cost Evaluation

Braintrust у рамках незалежної оцінки протестував You.com Web Search з Highlights проти інструментів пошуку, включених у API OpenAI та Anthropic, на 1 329 питаннях, враховуючи витрати як на інференс, так і на пошук.

У цій оцінці Claude Sonnet 5 коштував $0,0747 за питання з Highlights проти $0,1148 за вбудований пошук, що становить зниження на 35 % при трохи вищій точності (79,23 % проти 78,78 %) і на 1,26 секунди швидше. GPT‑5.6 Terra коштував $0,0417 за питання з Highlights проти $0,0467 вбудованого, зниження на 11 % і підвищення точності на 3,66 пункту. Вартість за правильну відповідь впала на 35 % у випадку Claude і на 15 % у випадку GPT, оскільки Highlights відповідав на більше питань правильно при тих же або нижчих витратах, згідно з даними You.com.

Observability Advantage

You.com стверджує, що розв’язаний веб‑пошук забезпечує кращу спостережуваність, ніж вбудовані інструменти OpenAI та Anthropic. Вбудований пошук повертає лише запити, які він виконав, і сторінки, які він цитував, без показу уривків, які читає модель, залишаючи без можливості зрозуміти, який крок спричинив помилкову відповідь.

Компанія навела приклад питання з оцінки Braintrust, яке запитувало, скільки сервісних ігор Карлоса Алькараца він програв у двох турнірах разом, що вимагало скласти два окремих числа. Конфігурація You.com повернула один уривок, що встановлює перше значення 24, і інший, що встановлює друге значення 22, і модель їх склала, отримавши 46. У випадках, які не вдались, жоден уривок, що підтверджував 24, не з’явився, використано було 22 для обох значень, і відповідь склала 44. Кожен запуск виконав арифметику правильно, і це стало відомо лише завдяки тому, що уривки з’являються у трасуванні, повідомляє компанія.

When Not to Use It

You.com зазначає, що Highlights додає приблизно 160 мс до Snippets при одноразових пошуках, і що при жорсткому обмеженні затримки для простих питань‑відповідей Snippets залишаються кращим варіантом за замовчуванням. Для сторінок, які оновлюються швидше, ніж оновлюється індекс, extraction_mode: "full_page" отримує живі дані замість кешованих. FRAMES – це випадок, коли цей компроміс проявляється, оскільки його багатокрокові питання вимагають ширшого контексту, ніж кілька вузькозорих уривків, і повна сторінка перевершує Highlights там на 0,73 пункту.

Компанія повідомила, що нові облікові записи отримують $100 у вигляді кредитів, а засіб, що генерує її бенчмарк‑числа, є публічно доступним.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.