Mô hình và nền tảng AI

You.com Web Search Highlights đạt 95.17% trên SimpleQA

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

You.com vào ngày 1 tháng 9 năm 2026 đã giới thiệu chế độ trích xuất mới cho API Tìm kiếm Web của mình, gọi là Highlights, báo cáo điểm 95.17% trên tiêu chuẩn SimpleQA và chi phí truy vấn tổng cộng thấp hơn 35% so với tính năng tìm kiếm web tích hợp của Claude Sonnet 5 trong một đánh giá độc lập. Tính năng này đã có sẵn thông qua tham số extraction_mode của API với mức giá $5 CPM giống như dịch vụ hiện có, công ty cho biết.

Highlights làm gì

API Tìm kiếm Web trả về kết quả web và tin tức có cấu trúc cho các ứng dụng AI. Mặc định, mỗi kết quả chứa một mảng snippets gồm các đoạn văn bản ngắn, tập trung vào từ khóa. Khi đặt extraction_mode thành highlights, các đoạn snippet sẽ được thay thế bằng một mảng contents.highlights chứa các đoạn trích từ mỗi trang đáp ứng truy vấn cụ thể.

Theo You.com, quá trình trích xuất diễn ra cho mỗi yêu cầu, mỗi truy vấn sẽ kích hoạt một lần quét mới trên trang. Một mô hình xác định các đoạn văn bản đã trả lời truy vấn và trả về chúng nguyên văn, giữ nguyên số, ngày tháng và các con số như trong nguồn. Các bảng được trả về với tiêu đề nguyên vẹn, các khối mã giữ định dạng, và các câu trong cùng một phần mà đều có liên quan sẽ được hợp nhất thành một đoạn duy nhất. Các đoạn trích ứng cử được xếp hạng, và đoạn có thứ hạng cao nhất sẽ được trả về trước.

Kết quả độ chính xác

You.com cho biết đã thực hiện ba bài kiểm tra trên ba chế độ trích xuất. Highlights dẫn đầu trên SimpleQA với 95.17% và trên RetrievalQA với 66.93%, hai tiêu chuẩn dựa trên truy vấn một sự kiện duy nhất. Trên FRAMES, một tiêu chuẩn suy luận đa bước, việc trích xuất toàn trang đạt 82.77% so với Highlights 82.04%, chênh lệch 0.73 điểm mà công ty mô tả là nằm trong độ biến thiên giữa các lần chạy mà họ quan sát trên bài kiểm tra này.

Công ty lưu ý rằng lợi ích về độ chính xác không phải là miễn phí: chi phí cho mỗi câu hỏi tăng khoảng 11% so với Snippets vì Highlights gửi nhiều văn bản hơn tới mô hình trả lời. Chi phí cho mỗi câu trả lời đúng, được tính bằng cách chia chi phí cho độ chính xác, vẫn thấp hơn khoảng 5%, công ty cho biết.

So với các hệ thống bên ngoài trên SimpleQA, You.com báo cáo ba hệ thống vượt qua ngưỡng 95%: You.com với Highlights đạt 95.17% và độ trễ p50 695ms, Exa (toàn trang) đạt 95.47% và 1337ms, và Parallel (nâng cao) đạt 95.33% và 2098ms. Công ty cho biết họ đã hiển thị cấu hình hoạt động tốt nhất của mỗi đối thủ, vì vậy so sánh này có lợi cho họ về mặt thiết lập.

Đánh giá chi phí độc lập

Braintrust, trong khuôn khổ một đánh giá độc lập, đã chạy You.com Web Search với Highlights so sánh với các công cụ tìm kiếm được tích hợp trong API của OpenAI và Anthropic trên 1.329 câu hỏi, với chi phí bao gồm cả suy luận và tìm kiếm.

Trong đánh giá đó, Claude Sonnet 5 có chi phí $0.0747 cho mỗi câu hỏi khi sử dụng Highlights, so với $0.1148 cho tìm kiếm tích hợp của nó, giảm 35%, với độ chính xác hơi cao hơn (79.23% so với 78.78%) và nhanh hơn 1.26 giây. GPT-5.6 Terra có chi phí $0.0417 cho mỗi câu hỏi khi dùng Highlights, so với $0.0467 tích hợp, giảm 11%, với độ chính xác cao hơn 3.66 điểm. Chi phí cho mỗi câu trả lời đúng giảm 35% đối với Claude và 15% đối với GPT, vì Highlights trả lời đúng nhiều câu hơn với chi phí bằng hoặc thấp hơn, theo báo cáo của You.com về kết quả.

Lợi thế quan sát

You.com lập luận rằng tìm kiếm web không gói gọn cung cấp khả năng quan sát tốt hơn so với các công cụ tích hợp của OpenAI và Anthropic. Tìm kiếm tích hợp chỉ trả về các truy vấn đã thực hiện và các trang đã trích dẫn, nhưng không cung cấp các đoạn văn bản mà mô hình đã đọc, công ty cho biết, khiến không có cách nào để xác định bước nào đã tạo ra câu trả lời sai.

Họ trích dẫn một câu hỏi trong đánh giá của Braintrust hỏi Carlos Alcaraz đã thua bao nhiêu trận dịch vụ trong hai vòng đấu cộng lại, yêu cầu cộng hai số riêng biệt. Cấu hình của You.com trả về một đoạn xác định giá trị đầu tiên là 24 và một đoạn khác xác định giá trị thứ hai là 22, và mô hình cộng chúng lại để trả lời 46. Các lần chạy không đúng không bao giờ hiển thị đoạn hỗ trợ 24, dùng 22 cho cả hai giá trị và trả lời 44. Mỗi lần chạy đều thực hiện phép tính đúng, một thực tế mà công ty cho biết chỉ có thể biết được vì các đoạn xuất hiện trong bản ghi.

Khi nào không nên sử dụng

You.com cho biết Highlights làm tăng khoảng 160ms so với Snippets trong các truy vấn đơn lần, và khi có ngân sách độ trễ nghiêm ngặt cho các câu hỏi Q&A đơn giản, Snippets vẫn là mặc định phù hợp. Đối với các trang thay đổi nhanh hơn so với việc làm mới chỉ mục, extraction_mode: "full_page" sẽ lấy dữ liệu trực tiếp thay vì phục vụ từ bộ nhớ đệm. FRAMES là nơi sự đánh đổi này xuất hiện, công ty nói, vì các câu hỏi đa bước của nó yêu cầu một phạm vi ngữ cảnh rộng hơn so với một vài đoạn hẹp, và toàn trang vượt trội hơn Highlights ở mức 0.73 điểm.

Công ty cho biết các tài khoản mới nhận được $100 tín dụng và bộ công cụ tạo ra các số liệu chuẩn của họ được công khai.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.