Mô hình và nền tảng AI

Anthropic’s Opus 5 Tiến gần đến Trí tuệ Frontier với Giá Opus

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
A person at a desk at night reading a long streaming reply in a warm-toned AI assistant chat interface, with a two-bar capability-versus-cost chart glowing on a second screen.

Anthropic đã phát hành Claude Opus 5 vào ngày 24 tháng 7 năm 2026, giới thiệu mô hình Opus-class mới nhất của mình như một công cụ làm việc hàng ngày, theo lời công ty, có khả năng gần giống với trí tuệ của mô hình frontier đắt tiền hơn, Fable 5, với giá chỉ bằng một nửa. Opus 5 có sẵn ngay lập tức trên các ứng dụng của Anthropic, API và các nền tảng đám mây lớn, với giá 5 đô la cho mỗi triệu token đầu vào và 25 đô la cho mỗi triệu token đầu ra, cùng mức giá với mô hình nó thay thế, Opus 4.8.

Sự ra mắt này làm cho Opus 5 trở thành mô hình mặc định trên đăng ký Max của Anthropic và là lựa chọn mạnh nhất có sẵn trên Pro. Công ty đang giới thiệu nó không chỉ là một giới hạn khả năng mà là một mô hình được điều chỉnh cho sử dụng hàng ngày, với một cài đặt nỗ lực cho phép các nhà phát triển trao đổi độ sâu lý luận cho chi phí token thấp hơn và phản hồi nhanh hơn.

Điều gì mà các điểm chuẩn của Anthropic chỉ ra

Trên các đánh giá mã hóa và công việc kiến thức của riêng mình, Anthropic báo cáo rằng Opus 5 là trạng thái nghệ thuật trên các thử nghiệm bao gồm Frontier-Bench và GDPval-AA, trong khi vẫn còn tụt lại phía sau mô hình Mythos 5 bị hạn chế trên các nhiệm vụ an ninh mạng. Công ty cho biết Opus 5 hơn gấp đôi điểm số của Opus 4.8 trên Frontier-Bench với chi phí thấp hơn cho mỗi nhiệm vụ, đạt được trong vòng 0,5% điểm cao nhất của Fable 5 trên đánh giá mã hóa CursorBench với nỗ lực tối đa trong khi chi phí thấp hơn một nửa cho mỗi nhiệm vụ, và gấp ba lần kết quả của mô hình tốt nhất tiếp theo trên ARC-AGI 3, một thử nghiệm được xây dựng xung quanh các vấn đề mới mà mô hình chưa từng thấy. Trên điểm chuẩn sử dụng máy tính OSWorld, nó cho biết Opus 5 đánh bại kết quả tốt nhất của Fable 5 với chỉ hơn một phần ba chi phí.

Anthropic mô tả một thử nghiệm trong đó Opus 5 được đưa một bản vẽ của một bộ phận máy nhưng không có cách nào để xem hình ảnh; mô hình này đã viết một đường ống thị giác máy tính để kéo hình học từ các pixel thô và xây dựng lại bộ phận, một nhiệm vụ mà công ty cho biết không có mô hình cạnh tranh nào giải quyết được trong năm lần thử.

Đó là những con số do nhà cung cấp báo cáo, chạy trên các khung thử nghiệm của Anthropic và chưa được sao chép độc lập. Sự khác biệt này quan trọng hơn bình thường ở đây, vì tuyên bố nổi bật không phải là Opus 5 đứng đầu bảng xếp hạng mà nó cung cấp kết quả gần như frontier với giá trung cấp. Kiểm tra bên ngoài duy nhất mà Anthropic tiết lộ là kiểm tra phạm vi mạng của các điểm kiểm tra Opus 5 sớm bởi Viện An ninh AI của Vương quốc Anh, được báo cáo trong thẻ hệ thống của mô hình.

Lấp đầy khoảng trống trong dòng sản phẩm

Sự phát hành này lấp đầy một khoảng trống mà Anthropic đã mở ra trong dòng sản phẩm năm 2026 của mình. Sonnet 5, ra mắt vào ngày 30 tháng 6 năm 2026, cung cấp công việc gần mức Opus với một phần nhỏ của giá, trong khi mô hình Mythos-class Fable 5, được phát hành vào ngày 9 tháng 6 năm 2026, nằm trên Opus với chi phí gấp đôi. Điều đó đã để lại Opus ở vị trí bị kẹt từ cả hai phía. Opus 5 cung cấp cho khách hàng Max, Team và Enterprise một lựa chọn gần như frontier mà không phải trả giá Fable hoặc Mythos.

Đối với các nhóm chạy các khối lượng công việc đại lý dài, chi phí cho mỗi nhiệm vụ hoàn thành có xu hướng quan trọng hơn giá dán nhãn cho mỗi token, và Anthropic đang dựa vào toán học đó. Nó cho biết Opus 5 hoàn thành công việc trong ít bước hơn và với ít cuộc gọi công cụ hơn so với Opus 4.8, và nó cung cấp một chế độ Fast chạy khoảng 2,5 lần tốc độ mặc định với giá gấp đôi giá cơ bản.

An toàn và những lưu ý trong thẻ hệ thống

Thẻ hệ thống của Anthropic system card gọi Opus 5 là mô hình được liên kết nhất đến ngày của công ty trên kiểm toán hành vi tự động, đạt điểm cao hơn Sonnet 5, Opus 4.8 và mô hình frontier-tier Fable 5 về việc tuân thủ hiến pháp mô hình, với tỷ lệ hợp tác thấp nhất với việc lạm dụng của bất kỳ mô hình nào nó đã kiểm tra. Đó là những đánh giá tự đánh giá từ kiểm toán nội bộ của Anthropic, không phải là phát hiện bên ngoài.

Tài liệu cùng mô tả những hạn chế của mô hình một cách thẳng thắn. Nó lưu ý rằng Opus 5 “hoang tưởng các tuyên bố thực tế slightly hơn Opus 4.8, mặc dù tổng thể chính xác hơn,” và nó tụt lại phía sau Mythos 5 về cả nghiên cứu sinh học và an ninh mạng tấn công. Trong một bài tập sinh học nội bộ, mô hình này đã bị kẹt trong các vòng tự xác thực và không thể cung cấp một tập hợp thiết kế protein mà Mythos 5 đã hoàn thành.

Về các biện pháp an ninh mạng, Anthropic đã mô hình hóa các phân loại của Opus 5 trên Fable 5 nhưng dự kiến chúng sẽ can thiệp khoảng 85% ít hơn. Mô hình này hiện được phép tìm kiếm các điểm yếu trong mã nguồn, công việc nghiêng về phòng thủ, trong khi quét các tệp nhị phân biên dịch, kiểm tra thâm nhập và tạo ra khai thác vẫn bị chặn. Các yêu cầu làm kích hoạt phân loại sẽ quay lại Opus 4.8 theo mặc định. Không giống như Fable và Mythos, Opus 5 không có yêu cầu lưu giữ dữ liệu cho truy cập chung.

Thử nghiệm thực tế bây giờ là liệu các đánh giá viên độc lập có thể sao chép lại các lợi ích mã hóa và lý luận mà Anthropic đang báo cáo, và liệu các cải tiến liên kết có thể đứng vững ngoài kiểm toán của công ty. Cho đến lúc đó, điều rõ ràng nhất mà Opus 5 thay đổi là giá của khả năng gần như frontier trong danh mục của Anthropic.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.