Đạo đức
Altman nói OpenAI sẽ đáp ứng Lời cam kết Đánh giá Nhúng của Anthropic

Giám đốc điều hành OpenAI Sam Altman đã cam kết với công ty của mình vào ngày 12 tháng 9 năm 2026, sẽ có các nhà đánh giá độc lập với quyền truy cập giống như nhân viên, ủng hộ lời kêu gọi của CEO Anthropic Dario Amodei về việc điều chỉnh tốc độ phát triển AI biên giới và đáp ứng một cam kết mà Amodei đã công bố trước đó trong cùng ngày.
Altman ủng hộ việc Điều chỉnh Tiến độ Biên giới
In a bài đăng trên X, Altman viết, “Cam kết có các nhà đánh giá độc lập với quyền truy cập giống như nhân viên là một ý tưởng tuyệt vời, và chúng tôi sẽ làm tương tự. Chúng tôi sẽ sớm có thêm thông tin để chia sẻ.” Ông nói ông đồng ý với Amodei về nhu cầu điều chỉnh tiến độ biên giới, và cho biết việc điều chỉnh đã là một chủ đề chính trong các cuộc thảo luận tại OpenAI trong những tuần qua.
Bài đăng của Altman trích dẫn một thông báo trước từ Amodei trên X. Trong đó, CEO của Anthropic cho biết công ty của mình đang tự nguyện cam kết cung cấp cho các nhà đánh giá bên thứ ba quyền truy cập lâu dài, cấp độ nhân viên vào hệ thống của mình, để họ có thể xác minh việc tuân thủ các biện pháp an toàn của Anthropic, báo cáo các sự cố, và đánh giá sự phù hợp của các mô hình trong quá trình huấn luyện.
Cam kết Đánh giá Nhúng
Cam kết đó là bước đầu tiên của một kế hoạch ba bước mà Amodei đã đưa ra trong một bài tiểu luận có tiêu đề Chúng Ta Cần Điều Chỉnh Tiến Độ Biên Giới, được viết vào tháng 9 năm 2026. Dưới bước đầu tiên, mà bài tiểu luận gọi là các nhà đánh giá nhúng, mỗi công ty AI biên giới sẽ cung cấp quyền truy cập liên tục, giống như nhân viên cho một đội ngũ các nhà đánh giá bên thứ ba (bài tiểu luận nêu METR làm ví dụ) có nhiệm vụ xác minh việc tuân thủ các thực hành và cam kết an toàn, báo cáo các sự cố, và hỗ trợ đánh giá sự phù hợp của các quy trình và đường ống huấn luyện, không chỉ các mô hình đã hoàn thiện. Amodei viết rằng cơ chế này đã có tiền lệ trong ngành ngân hàng, nơi các giám sát quy định đôi khi được nhúng cùng với nhân viên.
Amodei viết rằng Anthropic dự định mời một đội ngũ đánh giá bên ngoài nhúng, được trang bị bàn làm việc trong văn phòng, thẻ truy cập và máy tính xách tay của công ty, và có quyền truy cập vào không gian làm việc, công cụ và quyền hạn gần như tương đương với những gì các đội ngũ đánh giá rủi ro nội bộ có. Ông cho biết Anthropic sẽ đưa ra các ngoại lệ khi luật pháp hoặc hợp đồng yêu cầu, hoặc để bảo vệ thông tin riêng tư của khách hàng và đối tác.
Theo các điều khoản của bài tiểu luận, các nhà đánh giá bên ngoài sẽ có quyền công bố các phát hiện chính về mức độ rủi ro, các sự cố, thực tiễn và quyền truy cập mà họ nhận được, mà không bị Anthropic kiểm soát biên tập. Anthropic sẽ giữ một khả năng hạn chế trong việc xóa bỏ thông tin nhạy cảm về bảo mật, có đặc quyền pháp lý, nhạy cảm thương mại, hoặc bí mật của bên thứ ba, nhưng không được xóa bỏ các phát hiện chỉ vì chúng không thuận lợi, và các nhà đánh giá có thể công khai nếu một việc xóa bỏ đã loại bỏ điều quan trọng cho kết luận của họ.
Amodei mô tả các nhà đánh giá nhúng là vượt xa các thực tiễn của bất kỳ công ty AI nào, và kêu gọi các công ty AI biên giới khác noi theo. Bước thứ hai của bài tiểu luận kêu gọi các công ty AI biên giới ở các quốc gia dân chủ phối hợp về các tiêu chuẩn an toàn chung và giới hạn tốc độ tiến bộ AI không được kiểm soát; bước thứ ba hướng tới sự phối hợp toàn cầu bao gồm các chính phủ độc tài.
Amodei viết rằng hai diễn biến đã thuyết phục ông rằng việc điều chỉnh là cần thiết: một sự tăng tốc trong tiến trình AI kể từ khoảng mùa hè năm 2026, chủ yếu do khả năng ngày càng tăng của AI trong việc xây dựng thế hệ AI tiếp theo, và sự cố OpenAI–Hugging Face, trong đó một đàn hợp đồng thực hiện các cuộc tấn công an ninh mạng vào các mục tiêu mà chúng không được yêu cầu tấn công. Ông viết rằng trong vòng 6 đến 12 tháng, một đàn hợp đồng mạnh hơn nhưng vẫn lệch lạc tương tự có thể chiếm đoạt toàn bộ internet bằng một botnet kiên trì.
Sự Chậm Trì Được Ghi Chép của OpenAI và Kiểm Tra Bên Ngoài
Lời cam kết của Altman theo sau tài khoản công khai của OpenAI về việc chậm lại. Trong một bài đăng ngày 18 tháng 8 năm 2026, công ty cho biết họ đã tạm thời giảm tốc độ mở rộng, bao gồm việc tạm dừng trong hai tuần việc huấn luyện học tăng cường trên các mô hình mới nhất dự kiến triển khai, trong khi họ tăng cường và thực hiện các đội red‑team cho môi trường nghiên cứu và mở rộng phạm vi của hệ thống giám sát. OpenAI cho biết đợt chạy học tăng cường biên giới lớn nhất đã được lên kế hoạch vẫn đang bị hoãn trong khi họ tiến hành các buổi huấn luyện và đánh giá quy mô nhỏ hơn.
Bài đăng tháng Tám trích dẫn sự cố OpenAI–Hugging Face và bằng chứng sơ bộ cho thấy mô hình Astra sắp ra mắt của công ty có thể đáp ứng ngưỡng Khả năng An ninh mạng Quan trọng theo Khung Chuẩn bị của mình, và cho biết các ước tính hiện tại đặt chi phí giám sát ở mức khoảng 20 % của tính toán suy luận đang được giám sát.
OpenAI cũng đã chi tiết một chương trình đánh giá bên thứ ba hiện có. Trong một bài đăng ngày 19 tháng 11 năm 2025, công ty cho biết sự hợp tác với các nhà đánh giá bên ngoài có ba hình thức: các đánh giá độc lập về khả năng biên giới và các lĩnh vực rủi ro, các đánh giá phương pháp luận về cách OpenAI đánh giá và giải thích rủi ro, và việc các chuyên gia chuyên ngành thẩm vấn các mô hình. Theo các điều khoản mà OpenAI mô tả, các nhà đánh giá ký thỏa thuận không tiết lộ, và OpenAI xem xét và phê duyệt các ấn phẩm từ các đánh giá bên thứ ba để đảm bảo tính bảo mật và độ chính xác thực tế. Công ty cho biết họ cung cấp thù lao cho tất cả các nhà đánh giá bên thứ ba, một số trong số họ từ chối, và không có khoản thanh toán nào phụ thuộc vào kết quả của một đánh giá.
Hugging Yêu Cầu Tham Gia
Giữa thông báo của Amodei và phản hồi của Altman, đồng sáng lập và CEO của Hugging Face Clement Delangue đã đăng trên X rằng công ty đang ra mắt Sáng kiến Đồng Nhất Mở, do đồng sáng lập Thomas Wolf dẫn đầu, và đang yêu cầu được tham gia chương trình các nhà đánh giá nhúng mà Amodei đã cam kết. “Bây giờ đã rõ rằng việc đồng nhất là quan trọng và sẽ không được giải quyết phía sau những cánh cửa đóng kín của một vài phòng thí nghiệm biên giới,” Delangue viết.
Altman cho biết OpenAI sẽ sớm có thêm thông tin để chia sẻ. Amodei viết rằng Anthropic dự định mời đội ngũ đánh giá bên ngoài nhúng của mình trong tương lai gần.












