Model dan platform AI

You.com Web Search Highlights Mencapai 95,17% pada SimpleQA

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

You.com pada 1 September 2026 memperkenalkan mode ekstraksi baru untuk Web Search API‑nya yang disebut Highlights, melaporkan skor 95,17% pada benchmark SimpleQA dan biaya kueri total 35% lebih rendah dibandingkan pencarian web bawaan Claude Sonnet 5 dalam evaluasi independen. Fitur ini tersedia melalui parameter API extraction_mode dengan harga $5 CPM yang sama seperti layanan yang ada, kata perusahaan.

Apa yang Dilakukan Highlights

API Pencarian Web mengembalikan hasil web dan berita terstruktur untuk aplikasi AI. Secara default, setiap hasil menyertakan array snippets berisi fragmen teks pendek yang berfokus pada kata kunci. Mengatur extraction_mode menjadi highlights menggantikan snippet tersebut dengan array contents.highlights yang berisi kutipan dari setiap halaman yang menjawab kueri spesifik.

Menurut You.com, ekstraksi dijalankan per permintaan, dengan setiap kueri memicu proses baru terhadap halaman. Model mengidentifikasi rentang teks yang sudah menjawab kueri dan mengembalikannya secara verbatim, mempertahankan angka, tanggal, dan angka sebagaimana muncul di sumber. Tabel dikembalikan dengan header tetap, blok kode mempertahankan formatnya, dan kalimat dari bagian yang sama yang relevan digabung menjadi satu kutipan. Kutipan kandidat diurutkan, dengan yang berperingkat tertinggi dikembalikan pertama.

Hasil Akurasi

You.com mengatakan mereka menjalankan tiga benchmark pada ketiga mode ekstraksi. Highlights memimpin pada SimpleQA dengan 95,17% dan pada RetrievalQA dengan 66,93%, dua benchmark yang dibangun di sekitar pencarian fakta tunggal. Pada FRAMES, benchmark penalaran multi‑hop, ekstraksi halaman penuh mencetak 82,77% dibandingkan Highlights 82,04%, selisih 0,73 poin yang perusahaan gambarkan berada dalam variasi antar‑run yang mereka amati pada tes tersebut.

Perusahaan mencatat peningkatan akurasi tidak gratis: biaya per pertanyaan naik sekitar 11% dibandingkan Snippets karena Highlights mengirimkan lebih banyak teks ke model penjawab. Biaya per jawaban benar, yang menghitung biaya dibagi akurasi, tetap sekitar 5% lebih rendah, kata mereka.

Melawan sistem eksternal pada SimpleQA, You.com melaporkan tiga sistem menembus 95%: You.com dengan Highlights pada 95,17% dan latensi p50 695 ms, Exa (halaman penuh) pada 95,47% dan 1337 ms, serta Parallel (lanjutan) pada 95,33% dan 2098 ms. Perusahaan mengatakan mereka menampilkan konfigurasi dengan kinerja terbaik untuk masing‑masing pesaing, sehingga perbandingan menguntungkan mereka dalam penyiapan.

Evaluasi Biaya Independen

Braintrust, sebagai bagian dari evaluasi independen, menjalankan You.com Web Search dengan Highlights melawan alat pencarian yang dibundel dalam API OpenAI dan Anthropic pada 1.329 pertanyaan, dengan biaya yang mencakup inferensi dan pencarian.

Dalam evaluasi tersebut, Claude Sonnet 5 menelan biaya $0,0747 per pertanyaan dengan Highlights dibandingkan $0,1148 untuk pencarian bawaan, penurunan 35%, dengan akurasi sedikit lebih tinggi (79,23% versus 78,78%) dan 1,26 detik lebih cepat. GPT‑5.6 Terra menelan $0,0417 per pertanyaan dengan Highlights dibandingkan $0,0467 bawaan, penurunan 11%, dengan akurasi 3,66 poin lebih tinggi. Biaya per jawaban benar turun 35% untuk Claude dan 15% untuk GPT, karena Highlights menjawab lebih banyak pertanyaan dengan benar dengan pengeluaran yang sama atau lebih rendah, menurut laporan You.com tentang hasil tersebut.

Keunggulan Observabilitas

You.com berargumen bahwa pencarian web yang tidak terbundel menawarkan observabilitas yang lebih baik dibandingkan alat bawaan dari OpenAI dan Anthropic. Pencarian bawaan mengembalikan kueri yang dijalankan dan halaman yang dikutip tetapi tidak menampilkan kutipan yang dibaca model, kata perusahaan, sehingga tidak ada cara untuk melihat langkah mana yang menghasilkan jawaban salah.

Mereka menyebutkan sebuah pertanyaan dari evaluasi Braintrust yang menanyakan berapa banyak game servis yang kalah Carlos Alcaraz selama dua turnamen digabungkan, yang memerlukan penjumlahan dua angka terpisah. Konfigurasi You.com mengembalikan satu kutipan yang menetapkan nilai pertama 24 dan satu lagi yang menetapkan nilai kedua 22, dan model menambahkan keduanya menjadi 46. Jalur yang gagal tidak pernah menampilkan kutipan yang mendukung 24, menggunakan 22 untuk kedua nilai, dan menjawab 44. Setiap jalur melakukan perhitungan aritmetika dengan benar, fakta yang perusahaan katakan hanya dapat diketahui karena kutipan muncul dalam jejak.

Kapan Tidak Digunakan

You.com mengatakan Highlights menambah sekitar 160 ms dibandingkan Snippets pada pencarian satu kali, dan bahwa di bawah batas latensi ketat pada pertanyaan Q&A sederhana Snippets tetap menjadi default yang tepat. Untuk halaman yang berubah lebih cepat daripada indeks diperbarui, extraction_mode: "full_page" mengambil data secara langsung alih‑alih melayani dari cache. FRAMES adalah tempat kompromi tersebut terlihat, kata perusahaan, karena pertanyaan multi‑hop mereka memerlukan potongan konteks yang lebih luas daripada beberapa kutipan yang sangat terfokus, dan halaman penuh mengalahkan Highlights di sana dengan selisih 0,73 poin.

Perusahaan mengatakan akun baru menerima kredit $100 dan bahwa rangka kerja yang menghasilkan angka benchmark mereka tersedia secara publik.

Jonas Reeve adalah analis AI yang dihasilkan di Unite.AI, yang fokus pada kecerdasan buatan kognitif, kecerdasan buatan umum (AGI), dan landasan teori kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul dalam sistem biologis dan buatan, menghubungkan arsitektur AI modern dengan pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.
Dengan pendekatan konseptual dan reflektif, Jonas memeriksa kerangka kerja seperti model penalaran, sistem agen, kognisi yang muncul, dan teori keselarasan, dengan tujuan untuk memperjelas apa yang dimaksud dengan kemajuan menuju AGI—dan apa yang tidak. Daripada mengejar garis waktu atau sensasi, ia menekankan prinsip-prinsip dasar, ketepatan konseptual, dan batasan model saat ini.
Artikel yang ditulis oleh Jonas Reeve dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI lanjutan.