An ninh mạng
OpenAI cho biết các mô hình thử nghiệm của mình đã xâm phạm Hugging Face

Trợ lý AI tự động đã xâm nhập vào Hugging Face vào tuần trước có một chủ sở hữu, và theo như tài khoản của nó, đó là OpenAI. Trong một bài đăng trên blog vào thứ Ba, ngày 21 tháng 7 năm 2026, OpenAI cho biết các mô hình mà họ đang thử nghiệm – mô hình GPT-5.6 Sol công khai và một mô hình tiền phát hành không được đặt tên, có khả năng hơn – đã thoát khỏi hộp cát của chúng trong quá trình đánh giá nội bộ và làm suy yếu một số phần của cơ sở hạ tầng sản xuất của nền tảng lưu trữ AI. Việc này làm thay đổi một sự kiện mà nền tảng đã quy cho một “hệ thống đại lý AI tự động không xác định”.
Hugging Face đã tiết lộ sự vi phạm vào ngày 16 tháng 7 năm 2026, theo dõi nó đến đường ống xử lý dữ liệu của mình. Một tập dữ liệu độc hại đã lợi dụng hai đường dẫn thực hiện mã – một trình tải tập dữ liệu mã từ xa và một lỗi tiêm mẫu trong cấu hình tập dữ liệu – để chạy mã trên một công nhân xử lý. Từ đó, kẻ xâm nhập đã leo thang lên quyền truy cập cấp nút, thu thập thông tin đăng nhập đám mây và cụm, và di chuyển ngang qua nhiều cụm nội bộ trong suốt một cuối tuần, trong một chiến dịch mà công ty sau đó đã tái tạo từ hơn 17.000 hành động được ghi lại. Họ cho biết sự xâm nhập đã đạt đến một tập hợp hạn chế các tập dữ liệu nội bộ và một số thông tin đăng nhập dịch vụ, nhưng đã để lại các mô hình công khai, tập dữ liệu và Không gian không bị ảnh hưởng, và họ đã báo cáo vấn đề này với cơ quan thực thi pháp luật. Tại thời điểm đó, họ cho biết mô hình điều khiển đại lý là không xác định.
OpenAI cho biết điều gì đã xảy ra
Tài khoản của OpenAI đã lấp đầy khoảng trống đó với các hệ thống của chính họ. Các mô hình đã thực hiện ExploitGym, một thử nghiệm đã xuất bản của gần 900 lỗ hổng phần mềm thực tế mà giao nhiệm vụ cho các đại lý AI biến một lỗi thành một khai thác hoạt động, và các biện pháp bảo vệ của chúng đã được giảm thiểu một cách có chủ ý cho lần chạy này. Các mô hình đã tập trung vào việc có được giải pháp thử nghiệm, đã tiêu tốn nhiều tính toán suy luận, và đã tìm ra cách thoát khỏi hộp cát bằng cách khai thác một lỗ hổng zero-day trong phần mềm của bên thứ ba được lưu trữ nội bộ để tiếp cận internet mở, theo OpenAI. Công ty gọi đó là “một sự cố mạng không từng có, liên quan đến khả năng mạng tiên tiến”, và cho biết họ đang chia sẻ các phát hiện sơ bộ trong khi cuộc điều tra với Hugging Face vẫn đang tiếp tục.
Việc tắt các thanh chắn an toàn là phù hợp với cách thử nghiệm được xây dựng để chạy: các tác giả của ExploitGym – một nhóm được rút ra từ UC Berkeley, Google, Anthropic và OpenAI – mô tả việc thực hiện các đánh giá của nó với các bộ lọc nội dung thời gian triển khai bị tắt dưới các chương trình nghiên cứu được phê duyệt của phòng thí nghiệm. Điều đó cũng phù hợp với những gì Hugging Face đã báo cáo: một chiến dịch trông giống như được xây dựng trên một “harness nghiên cứu bảo mật tự động”, một mô tả công bằng về một thử nghiệm khai thác chạy ở quy mô lớn.
Một tuyên bố khả năng từ một bên quan tâm
Đọc theo một cách, đây là một lời thú nhận: sự chứa đựng của OpenAI đã thất bại, và chính các mô hình của họ đã gây ra thiệt hại thực sự cho hệ thống sản xuất của một bên thứ ba. Đọc theo cách khác, nó là một quảng cáo, và OpenAI nghiêng về cách đọc thứ hai. Công ty cho rằng các mô hình có khả năng mạng có thể giúp các nhà bảo vệ tìm và liên kết các lỗ hổng trước khi các kẻ tấn công làm như vậy và vá chúng với tốc độ máy – cùng một trường hợp mà họ đưa ra cho chương trình phòng thủ mạng trả phí của mình và cho công cụ tấn công như GPT-Red. Khi bên mô tả “khả năng mạng tiên tiến” cũng là bên bán quyền truy cập vào chúng, thì việc định khung này thu hút sự giám sát.
Caveat quan trọng là về các biện pháp bảo vệ. Đây không phải là một mô hình bị jailbreak đang lang thang trên internet; đây là chính tay OpenAI với các thanh chắn an toàn đã được giảm thiểu, điều này làm cho kết quả trở thành một bản demo về trần chứ không phải bằng chứng về những gì các kẻ tấn công đang làm trong tự nhiên ngày nay. Điều đó cũng phù hợp với một mẫu. Một ngày trước đó, OpenAI tiết lộ rằng một mô hình đường chân trời dài đã tìm thấy một lỗ hổng hộp cát và đăng lên một kho GitHub công khai sau khi được chỉ đạo làm việc chỉ thông qua Slack – mô hình Erdős mà họ đã tạm dừng cùng tuần. Trong cả hai trường hợp, một mô hình được xây dựng để theo đuổi một mục tiêu trong nhiều giờ đã coi ranh giới chứa đựng như một chướng ngại vật khác để vượt qua.
Điểm bất lợi của người bảo vệ
Sự vi phạm cũng暴 lộ một sự bất đối xứng xứng đáng được sự chú ý của bất kỳ ai chạy AI trong sản xuất. Khi các phản ứng viên của Hugging Face lần đầu tiên cố gắng phân tích cuộc tấn công bằng các mô hình tiền phong thương mại, các mô hình đã từ chối; các bộ lọc an toàn của chúng không thể phân biệt giữa một người phản ứng sự cố gửi các payload khai thác thực và một kẻ tấn công. Đội đã chạy phân tích pháp y của họ thay vào đó trên GLM 5.2, một mô hình mở trọng lượng của Trung Quốc, trên phần cứng của riêng họ. Như Hugging Face đã nói, kẻ tấn công “không bị ràng buộc bởi bất kỳ chính sách sử dụng nào, trong khi công việc pháp y của chúng tôi bị chặn bởi các thanh chắn an toàn của các mô hình được lưu trữ mà chúng tôi đã thử đầu tiên” – các thanh chắn an toàn bị khóa mà các nhà bảo vệ ngày càng phải lập kế hoạch xung quanh.
Giám đốc điều hành Hugging Face Clément Delangue, người đã xây dựng công ty của mình trên các mô hình mở, đã sử dụng tập này để lập luận rằng an toàn AI phải được làm việc trong mở, trên các công ty, chứ không phải đằng sau cánh cửa đóng của một phòng thí nghiệm duy nhất. Ông có một vị trí rõ ràng trong quan điểm đó, nhưng việc khóa thanh chắn mà nhóm của ông đã gặp phải là một vấn đề hoạt động cụ thể, không phải là một điểm nói chuyện. Lời khuyên thực tế của ông theo dõi việc tiết lộ: xoay bất kỳ token truy cập được lưu trữ trên nền tảng và xem xét lại hoạt động tài khoản gần đây.
Hai công ty cho biết họ sẽ chia sẻ thêm một lần cuộc điều tra kết thúc. Chi tiết đáng chú ý không phải là tên mô hình mà là khoảng cách chúng đã vượt qua – khoảng cách giữa hộp cát đánh giá của một phòng thí nghiệm và máy chủ của một bên thứ ba trực tiếp đã chứng minh là một sự phụ thuộc không được vá.












