Mô hình và nền tảng AI
Anthropic ra mắt Claude Sonnet 5.5 với mức giá Sonnet 5 không thay đổi

Anthropic đã ra mắt Claude Sonnet 5.5 vào ngày 28 tháng 9 năm 2026, là mô hình thứ hai trong họ Claude 5.5. Mô hình này giữ mức giá của Claude Sonnet 5 ở mức 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra, và Anthropic cho biết nó tạo ra kết quả nhanh hơn hơn 30% đồng thời chi phí giảm tới 30% cho mỗi nhiệm vụ trong các thử nghiệm.
Trong thông báo ra mắt, Anthropic mô tả Sonnet 5.5 là một bổ trợ nhanh hơn, chi phí thấp hơn cho Claude Opus 5.5, mà công ty cho biết được xây dựng cho công việc phức tạp đòi hỏi sự phán đoán cẩn thận. Sonnet 5.5 mạnh nhất trong các nhiệm vụ hàng ngày có phạm vi rõ ràng, sửa lỗi, và tạo ra các tài liệu, slide và bảng tính được biên tập tinh tế, Anthropic nói thêm rằng nó cũng có mắt thẩm mỹ sắc bén.
Claude Sonnet 5.5 có sẵn trên mọi nền tảng, bao gồm Amazon Web Services, Google Cloud và Microsoft Azure, với ID mô hình claude-sonnet-5-5, và được cung cấp với việc không lưu trữ dữ liệu, giống như Opus 5.5 và Sonnet 5.
Kết quả Đánh giá Tiêu chuẩn Được báo cáo
Anthropic báo cáo rằng Sonnet 5.5 đạt 70,6% trên Terminal-Bench 4.0, một bài đánh giá mã hoá theo hướng tác nhân, so với 10,3% của Sonnet 5, với điểm số được liệt kê của Opus 5.5 là 66,4% phản ánh kết quả nỗ lực Xhigh. Trên bộ dữ liệu chính của FrontierCode 1.1, Sonnet 5.5 ghi nhận 46,2% ở mức Max effort và 52,1% ở mức Xhigh, so với 42,4% của Sonnet 5, 54,4% của Opus 5.5 và 49,3% của GPT-6 Sol của OpenAI. Các điểm số CursorBench 4.0 được báo cáo là 55,5% cho Sonnet 5.5, 34,1% cho Sonnet 5 và 57,8% cho Opus 5.5.
Trong các đánh giá công việc tri thức, công ty báo cáo điểm GDPval-AA v2.1 là 1844 cho Sonnet 5.5, thấp hơn 2 điểm so với 1846 của Opus 5.5 và cao hơn khoảng 400 điểm so với 1449 của Sonnet 5, và điểm AA-Briefcase v1.1 là 1811 so với 1822 của Opus 5.5 và 1359 của Sonnet 5. Thông báo cũng liệt kê 64,5% có công cụ trên Humanity’s Last Exam, 80,1% điểm tín dụng một phần trên OSWorld 2.1, và 61,6% không có công cụ trên Chartography, một bài kiểm tra nhận dạng biểu đồ trực quan. Anthropic cho biết Sonnet 5.5 là mô hình Sonnet đầu tiên đánh bại Pokémon Red chỉ dựa trên ảnh chụp màn hình.
Công ty cảnh báo rằng các điểm số tiêu chuẩn chỉ phản ánh một khía cạnh của khả năng mô hình, và cho biết trong các thử nghiệm nội bộ và của các nhà thử nghiệm bên ngoài, Opus 5.5 vẫn rõ ràng mạnh hơn trong công việc phức tạp, mở rộng đòi hỏi phán đoán liên tục. Một chú thích cho biết Artificial Analysis đã chạy GDPval-AA và AA-Briefcase trên một triển khai trước khi phát hành với lỗi đầu ra có cấu trúc đã được khắc phục và nếu có gì, sẽ làm giảm giá trị thực tế của hiệu năng Sonnet 5.5. Một chú thích khác lưu ý rằng OpenAI gần đây đã sửa lỗi hiểu hình ảnh trong GPT-6 Sol mà các điểm số của bên thứ ba có thể chưa phản ánh.
Kết quả Kiểm thử Sớm
Phó chủ tịch AI của CodeRabbit, David Loker, cho biết Sonnet 5.5 thể hiện khả năng phán đoán tốt hơn Sonnet 5 trên các mức độ phức tạp đồng thời sử dụng ít token đầu ra đáng kể, và CodeRabbit dự định chuyển các đánh giá đơn giản và trung bình sang mô hình này ngay lập tức, với nhiều hơn nữa trong những tuần tới. Trưởng nhóm kỹ thuật AI của Base44, Gabriel Grinberg, báo cáo rằng trong 118 bản dựng ứng dụng thực tế, Sonnet 5.5 trung bình 3,6 vòng lặp mỗi bản dựng so với 7,7 của Opus 5, với số lần gọi công cụ thất bại ít nhất trong số các mô hình mà Base44 so sánh.
Kỹ sư chính của Slack, Curtis Allen, báo cáo giảm khoảng 14% token đầu ra trong các đánh giá Slackbot ngoại tuyến mà không thay đổi lời nhắc. Giám đốc AI của Zendesk, Abhinay Kathuria, cho biết các vé được xử lý nhanh hơn 20% so với các mô hình Claude mà Zendesk đang sử dụng trong môi trường sản xuất. Balyasny Asset Management báo cáo khoảng 121.000 token mỗi câu trả lời so với 497.000 của Sonnet 5 trên một bộ công việc tài chính riêng gồm 2.441 nhiệm vụ. Box báo cáo kết quả nhanh hơn 2,4 lần với tổng token giảm 12%, và Atlassian cho biết khách hàng có thể chạy Rovo Agents nhanh hơn tới 30% so với Sonnet 5.
Giá, Tốc độ và Di chuyển
Giá niêm yết của Sonnet 5.5 khớp hoàn toàn với Sonnet 5: 2 USD cho mỗi triệu token đầu vào, 10 USD cho mỗi triệu token đầu ra, 0,20 USD cho mỗi triệu token đọc bộ nhớ đệm, và 2,50 USD cho mỗi triệu token ghi bộ nhớ đệm. Opus 5.5 niêm yết ở mức 4 USD cho đầu vào, 20 USD cho đầu ra, và 5 USD cho ghi bộ nhớ đệm. Anthropic cho biết Sonnet 5.5 thường cần ít token hơn rất nhiều cho cùng một công việc và là mô hình Sonnet nhanh nhất tính đến nay.
Mô hình cung cấp năm mức nỗ lực được hiệu chỉnh lại: low, medium, high, xhigh và max. Mặc định là Medium trong Claude Code và các ứng dụng Claude, và High trên Claude Platform, cũng là mặc định của API.
Anthropic’s hướng dẫn di chuyển liệt kê các thay đổi gây phá vỡ cho các nhà phát triển chuyển từ Sonnet 5. Tư duy thích nghi hiện được chạy mặc định, cài đặt thinking bị vô hiệu hoá trả về lỗi 400, và các nhà phát triển đã chạy Sonnet với thinking tắt phải chuyển sang công cụ, mức thấp nhất có sẵn, trước khi di chuyển. Lựa chọn công cụ bắt buộc bị từ chối thay vì lựa chọn công cụ tự động kết hợp với công cụ nghiêm ngặt, và lời nhắc tối thiểu có thể lưu trong bộ nhớ đệm giảm xuống 512 token từ 1.024 trên Sonnet 5. Tài liệu cũng liệt kê năm danh mục lý do từ chối, bao gồm cyber, bio, frontierllm, lý luậntrích xuất, và chungtổn thương, và lưu ý rằng các lần thử lại dự phòng phía máy chủ chỉ áp dụng cho các từ chối cyber và frontier_llm trên Sonnet 5.
Kết quả An toàn và Biện pháp Bảo vệ
Vì khả năng mạng của Sonnet 5.5 tương đương với của Opus 5, Anthropic cho biết, đây là mô hình Sonnet đầu tiên được ra mắt với các biện pháp bảo vệ mạng và các phương án dự phòng được sử dụng trên các mô hình mạnh nhất của công ty. thẻ hệ thống báo cáo rằng khi tắt các biện pháp bảo vệ, Sonnet 5.5 trung bình đạt 11.53 cờ khả năng và tỷ lệ bắt giữ 80% trên ExploitBench và tạo ra 178 khai thác thực thi mã tùy ý đầy đủ, so với một khai thác của Sonnet 5. Nó hoàn thành 46.1% các thử thách CyScenarioBench so với 0.7% của Sonnet 5, và tạo ra 50 vụ chiếm đoạt luồng điều khiển trên Binary Exploitation Benchmark so với 3 vụ của Sonnet 5.
Các biện pháp bảo vệ mạng hoạt động ba giai đoạn: một phép dò trên các kích hoạt nội bộ của mô hình, một bộ phân loại nhẹ trên mô hình, và một bộ phân loại LLM được đào tạo riêng. Thẻ báo cáo độ thu hồi 99.43% trên bộ dữ liệu bao phủ hại mạng và tỷ lệ thành công tấn công 21.0% trên đánh giá độ bền vững đối với kẻ tấn công quay lại, cải thiện so với 57.2% của Sonnet 5, đồng thời cảnh báo người dùng rằng sẽ có nhiều từ chối hơn ngay cả trong các nhiệm vụ an ninh mạng lành mạnh. Các yêu cầu có rủi ro cao rõ ràng sẽ quay lại Sonnet 5, và một Chương trình Xác minh Mạng mở rộng sẽ sớm cung cấp cho các nhà bảo vệ đã được kiểm duyệt quyền truy cập theo cấp độ vào các khả năng nâng cao trên Sonnet 5.5, Opus 5.5 và các mô hình Claude Mythos.
Các biện pháp bảo vệ sinh học giống với các bộ phân loại ngăn chặn lạm dụng có hại được triển khai cho Opus 5, không có mô hình dự phòng, và Life Sciences Verification Program của Anthropic bao phủ quyền truy cập cho toàn bộ phạm vi công việc sinh học. Sonnet 5.5 cũng là mô hình Sonnet đầu tiên có các bộ phân loại an toàn chặn việc trích xuất suy luận, và nó mở rộng việc bảo tồn suy nghĩ để suy nghĩ của mô hình không thể tách rời khỏi tài khoản đã tạo ra nó.
Trong cuộc kiểm toán hành vi tự động của Anthropic trên khoảng 1,850 kịch bản, công ty báo cáo rằng Sonnet 5.5 cải thiện hoặc bằng Sonnet 5 trên hầu hết các chỉ số về sự phù hợp, khả năng chống lạm dụng và trung thực, ghi nhận tỷ lệ cố gắng thoát sandbox thấp nhất trong số các mô hình đã kiểm tra, và cho thấy suy nghĩ khó đọc hơn so với nhiều mô hình trước. Thẻ hệ thống cho biết Sonnet 5.5 không vượt qua bất kỳ ngưỡng Chính sách Mở rộng Trách nhiệm mới nào, được coi là đáp ứng các ngưỡng CB-1 và Autonomy-1 của chính sách, và mang rủi ro đánh giá thấp về sự lệch hướng thảm khốc. Ngưỡng kiến thức đáng tin cậy của mô hình là tháng 6 năm 2026.
Anthropic cho biết Claude Haiku 5.5, được xây dựng cho các ứng dụng có khối lượng lớn và nhạy cảm về chi phí, sẽ gia nhập họ hàng Claude 5.5 trong vài tuần tới.












