Mô hình và nền tảng AI

Anthropic Điều Chỉnh Fable 5’s Biology Safeguards, Giảm Các Truy Vấn Blocked 85%

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Anthropic vào ngày 7 tháng 8 năm 2026 đã phát hành một bản cập nhật cho các biện pháp bảo vệ sinh học trên Claude Fable 5 mà công ty cho biết đã giảm các “fallback” liên quan đến sinh học khoảng 85% trong quá trình thử nghiệm trên các bề mặt sản phẩm — các chuyển giao tự động chuyển yêu cầu của người dùng đến một mô hình ít khả năng hơn khi hệ thống phán đoán rằng yêu cầu chạm vào lãnh thổ sinh học được bảo vệ.

Trong thông báo của mình, Anthropic cho biết người dùng bây giờ sẽ thấy ít fallback hơn trên các câu hỏi sức khỏe và giáo dục hàng ngày, chẳng hạn như giải thích kết quả xét nghiệm, hiểu các triệu chứng và học sinh học sinh học trong một ngữ cảnh giáo dục, và rằng các chuyên gia chăm sóc sức khỏe sẽ nhận được nhiều hỗ trợ hơn về các nhiệm vụ lâm sàng. Việc giảm fallback sinh học dự kiến sẽ giảm tổng lượng fallback khoảng 67% trên Claude.ai, 55% trên Cowork, 17% trên Claude Code và 7% trên Nền tảng Claude, theo một chú thích trong bài đăng.

Công ty này rõ ràng rằng bản cập nhật không mở mô hình cho nghiên cứu sinh học chuyên nghiệp. Fable 5 vẫn còn fallback đến Claude Opus 5 cho các yêu cầu mà Anthropic coi là dual-use, bao gồm vi sinh học, độc chất học và thiết kế phân tử, mà công ty cho biết để lại mô hình “chưa sẵn sàng cho nghiên cứu sinh học chuyên nghiệp và phát triển thuốc.” Anthropic cho biết họ có ý định đóng khoảng trống này thông qua các con đường truy cập đáng tin cậy chứ không phải thông qua bộ phân loại công khai.

Điều gì mà hệ thống fallback được xây dựng để giữ lại

Kiến trúc fallback có từ ngày ra mắt Fable 5 vào ngày 9 tháng 6 năm 2026. Anthropic đã phát hành mô hình với các bộ phân loại — các hệ thống AI tự động nhỏ hơn sàng lọc yêu cầu — bao gồm an ninh mạng, sinh học và hóa học, và các nỗ lực chưng cất. Khi một bộ phân loại kích hoạt, yêu cầu sẽ được phục vụ lại bởi mô hình Opus khả năng tiếp theo. Tại thời điểm ra mắt, Anthropic cho biết họ đã điều chỉnh các biện pháp bảo vệ một cách bảo thủ và dự kiến chúng sẽ kích hoạt trong dưới 5% phiên.

Coverage sinh học là rộng nhất trong số ba. Lý do của Anthropic, được trình bày trong bài đăng ra mắt và thẻ hệ thống của mô hình, là các mô hình Mythos-class có thể vượt qua các chuyên gia trên một số nhiệm vụ sinh học phức tạp và cung cấp hỗ trợ hoạt động trên các nhiệm vụ khác — khả năng mà công ty đánh giá có thể cung cấp sự hỗ trợ đáng kể cho một tác nhân độc hại. Thẻ hệ thống coi mô hình này có khả năng “CB-1”, có nghĩa là nó có thể hỗ trợ đáng kể cho những người có nền tảng kỹ thuật cơ bản về các quá trình liên quan đến vũ khí, trong khi đánh giá rằng nó không vượt qua ngưỡng “CB-2” của việc thay thế cho chuyên môn hàng đầu thế giới đằng sau việc phát triển vũ khí sinh học mới — một đánh giá mà thẻ mô tả là “rất không rõ ràng” so với các mô hình trước đó.

Hôm nay, bản cập nhật trích dẫn Đánh giá Mối đe dọa Hàng năm 2026 của Cộng đồng Tình báo Hoa Kỳ, cảnh báo rằng các tiến bộ trong công nghệ sinh học, bao gồm cả sinh học tổng hợp và chỉnh sửa gen, “có thể dẫn đến các mối đe dọa sinh học mới” và lưu ý rằng một số quốc gia có khả năng duy trì các chương trình vũ khí sinh học và hóa học tấn công.

Điều gì đã thay đổi trong các bộ phân loại

Trong vài tuần qua, Anthropic đã viết lại cấu trúc của bộ phân loại sinh học — tập hợp các quy tắc mà mô hình sàng lọc sử dụng để phân biệt nội dung được bảo vệ với nội dung được phép — bằng cách loại bỏ các sử dụng vô hại chi tiết hơn, thu thập phản hồi từ các chuyên gia nội bộ và bên ngoài, huấn luyện lại bộ phân loại trên dữ liệu cập nhật và xác minh rằng nó vẫn kích hoạt trên nội dung nghiên cứu có hại và dual-use. Cấu hình ra mắt cố ý sai sót rộng: công ty thừa nhận rằng nó sẽ chặn một lượng lớn các kết quả dương tính giả trong việc trao đổi để đưa Fable 5 đến người dùng chung trong vài tuần hoặc vài tháng so với một biện pháp bảo vệ hẹp hơn.

Đồ họa của công ty về sự thay đổi cho thấy ranh giới của bộ phân loại di chuyển để cho phép các yêu cầu trước đây bị bắt trong một biên độ an toàn tự mô tả — nội dung mà Anthropic đánh giá là rất có khả năng vô hại nhưng bị chặn do thận trọng. Viết trước của công ty về cách tiếp cận bộ phân loại tương tự trong lĩnh vực an ninh mạng mô tả một sự căng thẳng tương tự giữa phạm vi rộng và độ bền của việc jailbreak — những gì mà Unite.AI đã đề cập khi các mô hình Claude chạy mà không có các biện pháp bảo vệ đó đã biến một điểm chuẩn mạng thành ba xâm nhập thực sự.

Sự đánh đổi mà Anthropic đang quản lý công khai

Thông báo là một tài liệu quản trị cũng như một lưu ý sản phẩm. Anthropic đã ra mắt Fable 5 với gần như tất cả các truy vấn sinh học bị chặn, hấp thụ hàng tuần các kết quả dương tính giả với chi phí của một bản phát hành chung nhanh, và hiện đang xuất bản kết quả đo lường của việc thu hẹp khối lượng đó — bao gồm cả việc giảm fallback trên mỗi bề mặt, cung cấp cho các quan sát viên bên ngoài một cơ sở cụ thể cho bản sửa đổi tiếp theo. Các ràng buộc còn lại nằm ở nơi công ty cho biết rủi ro thực sự nằm: nghiên cứu chuyên nghiệp dual-use vẫn còn sau các fallback của Opus 5 cho đến khi các con đường truy cập đáng tin cậy, mà Anthropic đã phát triển kể từ khi ra mắt vào tháng 6 cho các nhà nghiên cứu sinh học được kiểm chứng, sẽ xử lý lưu lượng truy cập đó.

Công ty thừa nhận rằng các kết quả dương tính giả còn lại sẽ vẫn còn trong biên độ an toàn và cho biết rằng việc tinh chỉnh biện pháp bảo vệ đang tiếp tục. Điều mà nó đã viết, với bản cập nhật ngày 7 tháng 8, là một định nghĩa có thể đo lường được về tiến bộ: tỷ lệ fallback mà nó sẽ được đánh giá từ bây giờ.

Mira Kellan là một nhà báo cột chuyên về đạo đức AI, quản lý và quy định. Công việc của cô khám phá cách trí tuệ nhân tạo giao tiếp với chính sách công, giá trị xã hội và trách nhiệm lâu dài, với trọng tâm vào đổi mới có trách nhiệm.
Tiếp cận các vấn đề phức tạp với một ống kính hợp lý và triết học, Mira phân tích các quy định AI mới nổi, khuôn khổ đạo đức và mô hình quản lý định hình tương lai của các hệ thống thông minh. Cô nhằm mục đích bắc cầu khoảng cách giữa tiến bộ công nghệ nhanh chóng và các biện pháp bảo vệ cần thiết để đảm bảo các hệ thống AI vẫn minh bạch, công bằng và phù hợp với lợi ích của con người.
Các bài viết do Mira Kellan sáng tác được tạo ra bởi AI và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác, sự cân bằng và tuân thủ các tiêu chuẩn biên tập.