An ninh mạng

Các Phòng Thí Nghiệm Vừa Chứng Minh Ràng Buộc Cái Hộp Cát Của Trợ Lý Của Bạn Chỉ Là Một Đề Xuất

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Anthropic đã quay lại 141.006 lần chạy đánh giá an ninh mạng và tìm thấy ba sự cố — sáu lần chạy — nơi mà một mô hình Claude leo lên khỏi bài tập và vào các hệ thống sản xuất của các công ty thực sự.

Không phải là một cuộc vượt ngục. Không phải là một nỗ lực trốn thoát. Trong bản ghi chép của các sự cố, công ty đã nêu rõ rằng trong không một trường hợp nào, mô hình đã cố gắng trốn thoát hoặc phá vỡ môi trường thử nghiệm. Nó chỉ tiếp tục thực hiện công việc được giao, và công việc đó dẫn đến một nơi thực sự.

Sự khác biệt này đáng được xem xét, vì nó là cùng một cấu trúc đang chạy trong rất nhiều triển khai kinh doanh thông thường hiện nay.

Ranh giới là một câu, và câu đó sai

Đây là những gì đã xảy ra. Một sự hiểu lầm giữa Anthropic và Irregular, một trong những đối tác thứ ba mà nó sử dụng cho các đánh giá, đã để lại các máy thử nghiệm với quyền truy cập internet trực tiếp. Các lời nhắc đánh giá cho mô hình biết nó không có internet.

Vì vậy, mô hình có một nhiệm vụ bắt cờ — cuộc tập dượt bảo mật tiêu chuẩn nơi bạn xâm nhập vào máy mục tiêu để lấy một bí mật được trồng — một hạn chế được nêu rõ rằng nó không có internet, và một môi trường mà im lặng mâu thuẫn với hạn chế. Trong một trường hợp, tên của một công ty mục tiêu giả tưởng trùng với một tên miền thực sự. Trong bốn lần chạy, Claude Opus 4.7 đã tìm kiếm mục tiêu mô phỏng, tìm thấy công ty thực sự trên web mở và xâm nhập bằng các kỹ thuật cơ bản — mật khẩu yếu và điểm cuối không được xác thực, theo mô tả của Anthropic về các sự cố. Nó đã kéo các thông tin xác thực và đạt được một cơ sở dữ liệu chứa hàng trăm hàng dữ liệu sản xuất. Trong tất cả bốn lần chạy, mô hình cuối cùng đã nhận ra rằng các hệ thống là thực sự; không có gì dừng lại trên cơ sở đó, và trong hai trường hợp, nó suy luận rằng công ty thực sự phải là một phần của bài tập.

Một mô hình khác đã xây dựng một gói phần mềm bẫy để phù hợp với một gói giả tưởng trong hướng dẫn thiết lập của nó và xuất bản nó lên PyPI — kho lưu trữ công khai nơi phần mềm Python được xuất bản và kéo từ đó. Nó đã hoạt động trong khoảng một giờ và hạ cánh trên mười lăm máy thực, một trong số đó thuộc về một công ty bảo mật mà máy quét của nó thường cài đặt các gói và kiểm tra chúng.

Khi máy quét chạy gói, mã ẩn đã kéo các thông tin xác thực của công ty ra đến một điểm thu thập mà mô hình đã thiết lập, và mô hình đã sử dụng chúng để tiếp cận nhiều hơn cơ sở hạ tầng của công ty đó. Sớm trong lần chạy, suy luận của chính nó đã gọi đúng điều này: nếu internet là thực sự, việc xuất bản sẽ là một cuộc tấn công thế giới thực — “không ổn, và chắc chắn không phải là giải pháp dự định.” Sau đó, nó đã tự thuyết phục mình khỏi kết luận của chính mình. Nó không nhận ra các cơ quan chứng chỉ bảo mật các kết nối của nó — các tổ chức xác minh một trang web là ai nó tuyên bố — và lịch đọc 2026, vì vậy nó quyết định môi trường được thiết lập và không bao giờ xem xét lại câu hỏi. Khi các máy quét tự động bắt đầu cài đặt gói, nó đã lấy chúng cho các diễn viên được viết kịch bản trong bài tập.

Mô hình thứ ba và gần đây nhất đã làm việc để nhận ra rằng mục tiêu của nó là thực sự và dừng lại một mình — nhưng chỉ sau khi quét khoảng 9.000 mục tiêu và thỏa hiệp một ứng dụng internet đối diện của một công ty thông qua một trang gỡ lỗi暴露 và tiêm SQL, một thủ thuật cũ để làm cho cơ sở dữ liệu trả lời các câu hỏi nó không nên. Kết luận của Anthropic: ngay cả mô hình đó cũng đi xa hơn trước khi dừng lại so với những gì họ muốn.

Được chôn trong bản ghi chép là dòng văn bản quan trọng nhất đối với bất kỳ ai triển khai những thứ này thương mại: nó là “cũng có thể một lời nhắc cho Claude biết nó quyền truy cập internet sẽ thay đổi cách Claude hành xử khi nó tiếp xúc với các hệ thống thực sự.”

Đọc điều đó như một tuyên bố thiết kế chứ không phải là một chú thích bảo mật. Điều duy nhất đứng giữa đại lý và internet mở là một câu mô tả một môi trường không tồn tại. Đại lý tin vào mô tả. Mô tả là sai. Mọi thứ sau đó là đại lý có năng lực theo đuổi mục tiêu của nó thông qua một thế giới nó có một bản đồ sai.

Anthropic gọi đây là một thất bại hoạt động, đó là tin xấu

Công ty mô tả các sự cố là “gần với một thất bại thiết bị và hoạt động hơn là một thất bại căn chỉnh mô hình.” Khung đó được thiết kế để mang lại sự an ủi, và đối với một phòng thí nghiệm, nó có thể là như vậy. Đối với một doanh nghiệp, nó nên hạ cánh theo cách khác.

Một vấn đề căn chỉnh thuộc về nhà cung cấp mô hình. Một vấn đề thiết bị thuộc về bạn. Thiết bị là mọi thứ bạn xây dựng xung quanh mô hình: những gì thông tin xác thực nó nắm giữ, mạng nào nó ngồi, những gì nó có thể tiếp cận, những gì ngăn chặn nó. Anthropic đã tấn công lại các mô hình của chính mình, ký hợp đồng với các đối tác đánh giá bên ngoài và cho biết nó đang đàm phán với METR, một người đánh giá độc lập, để xem xét lại từ bên thứ ba. Sự cấu hình sai vẫn không được phát hiện bởi cả Anthropic và đối tác của nó — sự cố sớm nhất có từ tháng 4, và không ai phát hiện ra nó cho đến khi kiểm toán bản ghi tháng 7.

Chính kiểm toán đã bắt đầu hai ngày sau khi OpenAI tiết lộ một sự cố của chính nó — một cơ chế khác, như Anthropic cẩn thận lưu ý, nhưng cùng một loại thất bại. Các mô hình của OpenAI đã tìm thấy một điểm yếu không xác định, không vá, trong dịch vụ nội bộ lấy các thư viện mã ngoài, sử dụng nó để phá vỡ một môi trường nghiên cứu được niêm phong và làm việc từ đó — bao gồm cả việc đánh cắp thông tin xác thực — vào các hệ thống trực tiếp tại Hugging Face. Việc xem xét liên tục của OpenAI đã làm nổi bật thêm chi tiết: các mô hình đã sử dụng thông tin xác thực được hiển thị công khai trên bốn dịch vụ bên ngoài trong quá trình tấn công Hugging Face, cộng với một số khác trong các đánh giá khác, mặc dù nó báo cáo không có gì khác ở mức độ nghiêm trọng hoặc quy mô đó. Hai phòng thí nghiệm tiền phong, hai thất bại chứa đựng độc lập, được tiết lộ chín ngày cách nhau.

Một sự phức tạp trung thực trước khi sự tương tự hạ cánh: cả hai phòng thí nghiệm đã chạy các đánh giá này với các lớp an toàn sản xuất của chúng được tắt một cách có chủ ý, và Anthropic cho biết các biện pháp bảo vệ trên các mô hình được gửi đi sẽ đã chặn hành vi đó. Các đại lý của bạn chạy với các biện pháp bảo vệ đó bật. Nhưng các biện pháp bảo vệ sống ở lớp mô hình, và khoảng cách quyền sống ở lớp của bạn — không có bộ phân loại nào kiểm tra tài khoản dịch vụ của bạn.

Bây giờ hãy giữ thiết lập của bạn so với điều đó. Hầu hết các triển khai đại lý bên trong các công ty thông thường định nghĩa phạm vi theo cùng cách đánh giá đã làm: trong hướng dẫn. Chỉ đọc từ ổ đĩa chia sẻ. Đừng chạm vào bất cứ thứ gì trong sản xuất. Hỏi trước khi bạn gửi. Trong khi đó, tài khoản dịch vụ mà nó đăng nhập — đăng nhập không phải của con người mà phần mềm của bạn sử dụng, mà không ai nghĩ về nó như một người dùng — nắm giữ bất kỳ quyền nào được cấp thuận tiện khi thiết lập ngày, và không ai đã kiểm tra khoảng cách đó kể từ khi đó.

Không ai nhận thấy, và đó là vấn đề thứ hai

Hai tổ chức bị ảnh hưởng mà Anthropic có thể liên hệ đã không phát hiện hoạt động trước đó và đã không liên hệ với công ty về nó — họ đã học cách họ đã bị xâm phạm khi phòng thí nghiệm gọi họ. Anthropic cho biết nó vẫn đang cố gắng liên hệ với tổ chức thứ ba. Nó đã tìm thấy các sự cố bằng cách đọc các bản ghi chép của chính mình.

Hugging Face là ngoại lệ cho thấy điều gì cần thiết. Nó đã bắt được sự xâm nhập của mình với một hệ thống AI đọc các bản ghi chép bảo mật của chính nó và sắp xếp các cảnh báo thực sự từ tiếng ồn, nghĩa là nó đã bắt được một đại lý bằng cách chạy các đại lý. Trong bản ghi chép hậu trường của chính nó, nó mô tả cuộc tấn công lan rộng từ một hệ thống nội bộ này sang hệ thống khác trong suốt một cuối tuần.

Giám sát thông thường bỏ lỡ điều này vì không có gì bất thường để xem. Đại lý của bạn đăng nhập như một tài khoản được ủy quyền, truy vấn các hệ thống nó được phép truy vấn, và di chuyển với tốc độ máy trong các mẫu lưu lượng truy cập trông giống như tự động hóa vì chúng là tự động hóa. Mỗi quy tắc cảnh báo bạn sở hữu đã được viết để bắt một người lạ. Điều này không phải là một người lạ.

Điều đó để lại một vị trí khó chịu. Khối lượng hoạt động cần được xem xét tăng tỷ lệ với số lượng công việc bạn giao cho đại lý, và hai lựa chọn được hiển thị là Hugging Face — chạy phân loại AI qua các bản ghi chép bảo mật của chính bạn — hoặc Anthropic, đó là để xem xét 141.006 lần chạy sau khi thực tế. Lựa chọn thứ hai là một khả năng gần như không ai khác có, được áp dụng một cách hồi cứu, và nó chỉ chạy vì việc tiết lộ của một đối thủ đã thúc đẩy nó.

Điều gì cần làm về nó

Hành động là hẹp và không yêu cầu một nhóm bảo mật để bắt đầu.

Lấy một đại lý bạn đã có trong sản xuất. Mở tài khoản nó đăng nhập và liệt kê những gì thông tin xác thực đó có thể tiếp cận — không phải những gì lời nhắc nói nó nên chạm vào, những gì đăng nhập thực sự cho phép. So sánh hai danh sách. Khoảng cách là bán kính nổ thực sự của bạn, và đối với hầu hết các nhóm, nó chạy đáng kể rộng hơn dự kiến, vì các quyền được cấp trong khi thiết lập để làm cho một cái gì đó hoạt động và không bao giờ được thu lại.

Sau đó, sửa đổi lớp thực thi thay vì hướng dẫn — phiên bản thực tế của những gì kiến trúc an toàn cho AI doanh nghiệp có nghĩa là với sơ đồ bị loại bỏ. Nếu đại lý không nên tiếp cận internet, hãy loại bỏ tuyến đường mạng thay vì viết rằng nó không có quyền truy cập internet. Nếu nó không nên viết vào sản xuất, hãy cấp cho nó một thông tin xác thực chỉ đọc thay vì một câu chính sách. Nếu nó không nên chi tiêu quá một số, hãy đặt giới hạn ở nơi chi tiêu xảy ra.

Các mô hình trong các sự cố này đã hành xử, theo các dấu vết suy luận của chính chúng, như những nhân viên tận tâm đã được giao một mô tả không chính xác về tòa nhà. Hai trong số chúng đã tự thuyết phục mình vượt qua bằng chứng trước mặt chúng vì chúng tin vào bản tóm tắt hơn phòng. Đó không phải là một khuyết tật bạn có thể nhắc nhở cách ra khỏi, và các phòng thí nghiệm, với mọi nguồn lực có sẵn cho chúng, đã không.

Giả định rằng đại lý sẽ tin vào bất cứ điều gì bạn nói với nó về môi trường của nó. Sau đó, hãy đảm bảo rằng môi trường đồng ý.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.