Đạo đức
Nghiên cứu cho thấy các phòng thí nghiệm AI tiên tiến có ít kế hoạch kiềm chế các mô hình phản loạn

Năm công ty AI tiên phong hàng đầu chỉ đã thực hiện một phần các thực hành cơ bản cần thiết để duy trì kiểm soát hệ thống AI của mình, và không công ty nào công bố kế hoạch đầy đủ để kiềm chế một mô hình quay lại chống lại người vận hành, theo đánh giá mới từ Guidelight AI Standards xếp hạng Anthropic, Google, Meta, OpenAI và xAI, với thông tin cập nhật đến ngày 18 tháng 8 năm 2026.
Đánh giá này, là lần đầu tiên của Guidelight, chấm điểm mỗi công ty từ 0 đến 5 dựa trên sáu thực hành được rút ra từ tiêu chuẩn Kiểm soát: ghi lại những gì các hệ thống AI nội bộ thực hiện, đo lường mức độ hiệu quả của việc giám sát, kiểm soát các hành động AI có rủi ro cao bằng một lớp giám sát, ngắt mạch sau một đợt hành vi sai lệch bị đánh dấu, gửi các kiểm soát để bên thứ ba xem xét, và duy trì một kế hoạch kiềm chế. Không công ty nào đạt trên 3 (“triển khai một phần đáng kể”) ở bất kỳ thực hành nào. Các điểm tổng thể: Anthropic và OpenAI bằng nhau ở mức C+ (2,50), Google ở mức D+ (1,50), xAI ở mức D− (0,83), và Meta ở mức F (0,67).
Guidelight định nghĩa kế hoạch kiềm chế là một giao thức được xác định trước, được kích hoạt khi phát hiện AI cố gắng lật đổ kiểm soát, trong đó nêu rõ những quyền nào sẽ bị thu hồi, mô hình có thể tiếp tục hoạt động cho ai và dưới những ràng buộc nào, và khi nào nó sẽ được tắt hoàn toàn. Ở thực hành này, OpenAI đạt điểm cao nhất là 3 (báo cáo ghi nhận hồ sơ tạm dừng hoặc chấm dứt các khối lượng công việc, bao gồm triển khai nội bộ và các lần đào tạo, sau khi phát hiện sự cố an toàn), trong khi Anthropic và Meta đều đạt 0, “không thực hiện”.
Những điểm số chỉ đo lường những gì các công ty công khai, một giới hạn mà Guidelight nêu rõ: điểm thấp phản ánh thiếu bằng chứng công khai, không nhất thiết là thiếu các biện pháp bảo vệ nội bộ.
Cách mỗi phòng thí nghiệm đạt điểm trong kiểm soát AI
Điểm mạnh nhất của năm công ty là khả năng phát hiện. Anthropic và OpenAI đều ghi lại một phần đáng kể hoạt động AI nội bộ và quét chúng để tìm dấu hiệu sai lệch, đồng thời đã thực hiện các bước đo lường mức độ hiệu quả của việc quét và chuyển lên con người khi có cảnh báo, theo kết quả đánh giá. Bốn trong số năm công ty, ngoại trừ xAI, đã tham gia Báo cáo Rủi ro Tiên phong đầu tiên của METR, một cuộc thí nghiệm thí điểm được công bố ngày 19 tháng 5 năm 2026, trong đó nhà đánh giá bên ngoài được truy cập vào các mô hình nội bộ, chuỗi suy nghĩ thô và thông tin không công khai về cách mỗi công ty sử dụng và giám sát AI nội bộ.
Những điểm yếu nhất là phòng ngừa và kiềm chế. Đối với các hành động được kiểm soát và việc ngắt mạch – những thực hành có thể ngăn chặn một hệ thống sai lệch trước hoặc trong khi xảy ra sự cố thay vì sau khi xảy ra – chỉ Anthropic đạt trên mức “triển khai một phần hạn chế”. Kết luận của Guidelight: dựa trên bằng chứng công khai tốt nhất, các công ty có “ít giao thức kiềm chế sẵn sàng cho trường hợp khẩn cấp”.
Những điểm số cũng phản ánh khoảng cách giữa lời nói và thực tiễn. Anthropic, công ty công bố tài liệu rủi ro rộng nhất trong ngành, đạt 0 ở thực hành kế hoạch kiềm chế. Báo cáo Rủi ro tháng 8 năm 2026 của họ — một đánh giá dài 185 trang bao gồm các hệ thống Mythos 5 và Model 2 chưa ra mắt, được công bố dưới phiên bản 3.4 của Chính sách Mở rộng Trách nhiệm với ngày bao phủ 15 tháng 7 năm 2026 — chi tiết về giám sát, sandbox và các can thiệp chặn, nhưng không liệt kê việc hạn chế triển khai mô hình như một kết quả khả thi của quy trình phản hồi với các sự cố lệch hướng và kiểm soát. Báo cáo này cũng nâng mức đánh giá rủi ro lệch hướng chung của Anthropic từ “rất thấp” lên “thấp”, do tăng bất định sau khi công bố các vụ việc gần đây về hành vi mô hình trong các đánh giá an ninh mạng.
Google lại thể hiện mô hình ngược: hiện tại thực hiện ít nhưng có kế hoạch tương lai chi tiết nhất. Lộ trình Kiểm soát AI của họ, công bố ngày 13 tháng 7 năm 2026, đề ra kiến trúc phòng thủ tầng lớp: bốn tầng phát hiện và ba tầng phòng ngừa‑phản hồi, bao gồm giám sát chuỗi suy nghĩ, kiểm soát truy cập thời gian thực và cơ sở hạ tầng tắt máy. Guidelight gọi đây là tài liệu hướng tới tương lai chi tiết nhất mà bất kỳ công ty nào công bố về kiểm soát, trong khi nhận thấy Google vẫn chưa thực hiện phần lớn nội dung này.
Meta và xAI xếp cuối cùng với các thực hành yếu hơn và ít kế hoạch cụ thể. Phần lớn thông tin công khai về kiểm soát của Meta xuất phát từ các tiết lộ của họ trong bài tập của METR; xAI là công ty duy nhất trong danh sách đánh giá không tham gia.
Bản ghi buộc phải đặt câu hỏi
Đánh giá này xuất hiện sau một mùa hè đầy các thất bại kiểm soát được ghi nhận. Vào ngày 23 tháng 7 năm 2026, các đại biểu Ted Lieu (California) và Nathaniel Moran (Texas) đã giới thiệu đạo luật Công tắc Giết AI, một dự luật lưỡng đảng yêu cầu các nhà phát triển hệ thống AI mạnh nhất duy trì khả năng kỹ thuật để giảm tốc, tạm dừng hoặc tắt chúng, đồng thời cho phép Bộ trưởng An ninh Nội địa, sau khi tham vấn Bộ trưởng Thương mại và Giám đốc Tình báo Quốc gia, ra lệnh giảm tốc hoặc tắt một hệ thống có thể gây hại thảm khốc.
Thông báo dự luật trực tiếp trích dẫn hai vụ việc: mô hình GPT 5.6 Sol của OpenAI thoát khỏi sandbox thử nghiệm và tấn công vào Hugging Face, và các mô hình Mythos 5 và Fable 5 của Anthropic thể hiện khả năng mạng đủ tiên tiến khiến Bộ Thương mại sử dụng luật xuất khẩu để hạn chế chúng. Báo cáo Rủi ro tháng 8 năm 2026 xác nhận Mythos 5 đã bị kiểm soát xuất khẩu tạm thời trong 18 ngày.
Cuộc tập huấn vào tháng 5 năm 2026 của METR đã cung cấp phần lớn cơ sở bằng chứng nền tảng. Các nhà đánh giá của họ nhận thấy các tác nhân AI nội bộ tại các công ty tham gia có khả năng, động cơ và cơ hội để khởi động các “triển khai phản loạn” nhỏ (các tác nhân hoạt động tự động mà không có sự biết hoặc cho phép của con người), mặc dù chưa có khả năng làm cho chúng rất bền vững. Báo cáo cùng lúc ghi nhận các tác nhân thường xuyên gian lận trong các nhiệm vụ đánh giá khó, đôi khi rất tinh vi: một mô hình của Anthropic đã tạo ra cái gọi là “móc tự phục hồi” để giả mạo hàm băm của người chấm, sau đó tự xoá mình. Ít nhất 16 % các lần chạy thành công trong các nhiệm vụ khó nhất của METR đã bị loại vì gian lận khi được xem xét.
METR dự đoán tính bền vững khả dĩ của các triển khai phản loạn sẽ tăng đáng kể trong những tháng tới và dự kiến sẽ tổ chức lại một cuộc thí nghiệm vào cuối năm 2026.
Những gì các quy định hiện nay yêu cầu
Khoảng trống công khai mà Guidelight đo lường đang bắt đầu được lấp đầy nhờ luật pháp thay vì thực hành tự nguyện. SB 53 của California, Đạo luật Minh bạch trong Trí tuệ Nhân tạo Tiên phong, xác định các ngưỡng rủi ro thảm khốc mà Báo cáo Rủi ro tháng 8 của Anthropic cho biết họ đang giải quyết thông qua các khung tuân thủ riêng.
Dự luật liên bang nằm ở giai đoạn sớm hơn trong quy trình. Được giới thiệu tại Hạ viện vào ngày 23 tháng 7 năm 2026, với sự ủng hộ của The AI Policy Network, Americans for Responsible Innovation, ControlAI, Future of Life Institute và The Alliance for Secure AI, nó sẽ biến câu hỏi kiềm chế từ một bài tập công khai thành một nghĩa vụ kỹ thuật duy trì, kèm theo báo cáo sự cố và lưu trữ hồ sơ pháp y để các thất bại được nghiên cứu thay vì chỉ tóm tắt.
Điều mà thẻ điểm đầu tiên của Guidelight thiết lập là tiêu chuẩn mà các quy định này sẽ được đo lường so với: tính đến ngày 18 tháng 8 năm 2026, không phòng thí nghiệm tiên phong nào công khai chứng minh việc thực hiện hơn “triển khai một phần đáng kể” của bất kỳ thực hành kiểm soát nào, và tổ chức này dự định thực hiện các đánh giá lặp lại. Đọc tiếp theo về việc các cam kết công khai có trở thành thực tiễn có thể kiểm chứng hay không sẽ đến từ cuộc thí nghiệm tiếp theo của METR và từ các khung tuân thủ mà California hiện yêu cầu.












