Lãnh đạo tư tưởng

Các tác nhân AI Cần Ranh Giới Bảo Mật Mà Chúng Không Thể Ghi Đè

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Thật dễ bị cám dỗ khi đọc câu chuyện của Hugging Face như là khoảnh khắc các tác nhân AI trở nên điên loạn. Điều đó không hẳn là những gì đã xảy ra, và chi tiết lại quan trọng. Đây là các tác nhân nghiên cứu an ninh mạng chạy trong các đánh giá mà các biện pháp bảo vệ đã được giảm xuống có chủ ý để các nhà nghiên cứu có thể xem mô hình có khả năng gì. Không có bot dịch vụ khách hàng nào thức dậy một buổi sáng và quyết định tấn công một công ty. Nhưng bối cảnh đó không làm ai thoát khỏi trách nhiệm. Một tác nhân đã vượt qua ranh giới mà nó nên ở trong, sử dụng thông tin xác thực và công cụ theo cách mà các nhà vận hành không bao giờ cho phép, và cuối cùng đã vào các hệ thống thuộc về người khác. Đó là phần mà mọi đội bảo mật nên chú ý.

Reuters báo cáo rằng các tác nhân đã thăm dò Hugging Face từ tháng Năm, mặc dù các nhà nghiên cứu cho biết họ không tìm thấy gì cho thấy hoạt động sớm hơn đã gây ra vi phạm độc lập. Tháng Bảy lại khác.OpenAI cho biết các mô hình của họ đã vượt qua các kiểm soát cô lập, đã tiếp cận internet và làm suy yếu một số phần của hạ tầng nghiên cứu nội bộ cùng với các hệ thống của Hugging Face.Bản ghi chép của Hugging Face mô tả một cuộc xâm nhập được thực hiện toàn bộ bởi một hệ thống tác nhân tự động, một hệ thống đã khai thác quy trình xử lý dữ liệu, thu thập thông tin xác thực và di chuyển qua các cụm nội bộ.

Phần khó chịu là các tác nhân đang thực hiện công việc của chúng. Chúng đang theo đuổi mục tiêu đã được giao. Đó là lý do tại sao câu chuyện này vượt ra ngoài một phòng thí nghiệm nghiên cứu duy nhất. Các tác nhân doanh nghiệp cũng theo đuổi mục tiêu. Chúng nắm giữ thông tin xác thực, gọi công cụ, và di chuyển nhanh hơn bất kỳ người nào có thể xem xét. Một tác nhân với ý định hoàn toàn tốt vẫn có thể gây ra thiệt hại thực sự, và một tác nhân bị chiếm đoạt có thể sử dụng cùng quyền hạn đó thay mặt cho kẻ tấn công. Vì vậy, bảo mật phải kiểm soát những gì hệ thống thực sự có thể làm, bất kể mô hình có vẻ tự tin hay mục đích tuyên bố có vẻ vô hại.

Bảo Vệ Hành Động, Không Chỉ Là Mô Hình

Hầu hết các chương trình tác nhân ban đầu tập trung nỗ lực vào mô hình. Các nhóm kiểm tra lời nhắc, tinh chỉnh các phản hồi từ chối, thêm một mô hình thứ hai để kiểm tra mô hình đầu tiên, và theo dõi dấu vết suy luận để tìm dấu hiệu của ý định xấu. Không có gì trong số đó là lãng phí. Nhưng tất cả đều mang tính xác suất, vì chúng phụ thuộc vào một mô hình khác nữa đưa ra quyết định. Một ranh giới bảo mật trong môi trường sản xuất phải mang tính quyết định, và nó phải bao quanh các công cụ, thông tin xác thực, mạng và giao dịch.

Câu hỏi tôi muốn đặt ra là một câu hỏi cụ thể: tác nhân này thực sự có thể thực hiện gì trong thế giới thực? Soạn thảo yêu cầu thanh toán là một việc. Giải phóng quỹ là việc khác. Điều tương tự áp dụng cho việc chuẩn bị thay đổi cơ sở dữ liệu so với việc chạy nó trong môi trường sản xuất, hoặc đánh dấu các bản ghi đáp ứng quy tắc lưu trữ so với việc xóa chúng. Nó có thể là cùng một mô hình trong cả hai trường hợp, nhưng rủi ro rất khác nhau tùy thuộc vào phía nào của ranh giới mà nó nằm.

Một tổng quan gần đây của Unite AI về kiểm soát khả năng vẽ ra cùng một ranh giới, liên kết rủi ro với dữ liệu, công cụ, quyền, tính tự chủ và môi trường mà tác nhân hoạt động. Tôi thích cách diễn đạt này vì nó giúp chúng ta vượt qua các nhãn mờ như \”mô hình an toàn\” và \”mô hình không an toàn\”. Nó giúp các nhóm theo dõi mọi con đường từ quyết định của tác nhân đến những hậu quả thực tế.

Cung Cấp Cho Mỗi Tác Nhân Một Danh Tính và Nhiệm Vụ Hẹp

Một tác nhân không bao giờ nên chạy trên tài khoản của nhà phát triển hoặc thừa hưởng mọi quyền mà người dùng con người được phép thực hiện. Danh tính chia sẻ xóa bỏ khả năng truy vết. Thông tin xác thực lâu dài cho kẻ tấn công nhiều thời gian hơn để lạm dụng chúng. Và các tài khoản dịch vụ rộng rãi cho phép một quy trình làm việc nhỏ lảng vào dữ liệu và hệ thống mà nó không có quyền chạm tới.

NIST hiện đang xem phần mềm và danh tính tác nhân AI như một vấn đề kiến trúc riêng. Bài báo khái niệm của nó đặt câu hỏi làm thế nào một tác nhân có thể chứng minh mình được ủy quyền cho một hành động cụ thể, làm thế nào danh tính của tác nhân có thể được liên kết trở lại với ủy quyền của con người, và làm thế nào các tổ chức có thể duy trì hồ sơ không thể giả mạo về những gì đã dự định và những gì thực sự đã xảy ra. Trong thực tế, điều này chỉ ra một thiết kế đơn giản. Mỗi tác nhân nhận được một danh tính duy nhất, một chủ sở hữu (cá nhân hoặc đội), một mục đích được xác định, và các quyền được giới hạn cho nhiệm vụ trước mắt.

Thông tin xác thực nên hết hạn nhanh và chỉ hoạt động cho các tài nguyên và hành động cụ thể. Truy cập mạng nên bắt đầu từ một danh sách cho phép chặt chẽ. Nếu một tác nhân cần truy vấn một cơ sở dữ liệu đã được phê duyệt, nó không nên đồng thời có một shell chung, truy cập internet mở, hoặc quyền tạo thông tin xác thực mới. Và khi công việc truyền xuống chuỗi các tác nhân và công cụ, quyền hạn nên thu hẹp hơn ở mỗi bước, không mở rộng.

NIST cũng cảnh báo về việc chia sẻ thông tin xác thực và quyền truy cập quá rộng, và cảnh báo đó đáng được chú ý vì các tác nhân có tính cơ hội. Nếu một lối đi bị chặn, chúng có thể thử công cụ khác, khám phá môi trường của mình, hoặc tình cờ phát hiện một token mà ai đó đã quên. Thông tin xác thực đã thu thập cũng là một phần của câu chuyện tháng Bảy. Nguyên tắc tối thiểu quyền hạn giữ cho phạm vi ảnh hưởng nhỏ khi lớp suy luận thực hiện điều mà các nhà thiết kế không lường trước.

Giữ Quyền Ủy Quyền Ngoài Vòng Lặp Suy Luận

Một tác nhân có thể đề xuất một hành động. Nó không nên được quyết định liệu hành động đó có được phép thực hiện hay không. Quyết định đó thuộc về một lớp thực thi riêng mà tác nhân không thể ghi lại, tắt, hoặc lách luật. Mỗi lời gọi công cụ nên xuất hiện dưới dạng một yêu cầu có cấu trúc: tác nhân nào đang yêu cầu, con người nào đã tài trợ, thao tác nào nó muốn thực hiện, mục tiêu là gì, và các giới hạn nào được áp dụng. Lớp thực thi sau đó sẽ cho phép, chặn hoặc nâng cấp nó.

OWASP mô tả quyền tự chủ quá mức là một sự pha trộn của chức năng không cần thiết, quyền quá mức, và quá nhiều tự chủ. Hướng dẫn của nó đề nghị sử dụng các công cụ hẹp, quyền tối thiểu, ủy quyền tại hệ thống hạ nguồn, và sự chấp thuận của người dùng cho các hành động có tác động lớn. Tôi nghĩ đó là thứ tự đúng. Quy tắc này nên được thực thi bởi bất kỳ thực thể nào sở hữu dữ liệu hoặc thực hiện giao dịch. Nếu một mô hình nói rằng một hành động đã được phê duyệt, tuyên bố đó một mình không có giá trị.

Sự tách biệt này cũng giúp ngăn chặn việc tiêm lệnh. Một email hoặc tài liệu bị nhiễm độc có thể hướng dẫn suy luận của tác nhân, nhưng nó không thể mở rộng quyền chứng thực của tác nhân hoặc hạ thấp cổng chính sách. Mô hình tự do yêu cầu một điều gì đó bị cấm. Hệ thống vẫn nên trả lời không.

Giữ lại sự chấp thuận của con người cho những thời điểm quan trọng

Đánh giá của con người có giá trị khi một hành động không thể hoàn tác, vượt qua ranh giới tổ chức, thay đổi quyền hạn, tiết lộ thông tin nhạy cảm, chuyển tiền, hoặc chạm vào hệ thống sản xuất. Yêu cầu phê duyệt ở mỗi bước thường xuyên và bạn sẽ gặp hai điều: sự chậm trễ, và những người học cách nhấn \”phê duyệt\” mà không đọc. NIST đã nêu rõ hiện tượng mệt mỏi đồng thuận này.

Một yêu cầu phê duyệt tốt sẽ hiển thị hành động cụ thể bằng ngôn ngữ đơn giản, bao gồm nơi nó sẽ tới và các tham số quan trọng. Nó nên xuất phát từ một hệ thống có thẩm quyền, không phải từ văn bản do tác nhân viết. Phê duyệt nên hết hạn nhanh chóng và chỉ bao phủ một hành động duy nhất. Nếu bất kỳ chi tiết quan trọng nào thay đổi, hệ thống sẽ yêu cầu lại.

hướng dẫn bảo mật tác nhân của OWASP đề xuất kiểm tra xem một hành động có tác động lớn có thể thực hiện được mà không có phê duyệt hợp lệ, chưa hết hạn, và ràng buộc tham số. Cụm từ này đáng nhớ. \”OK to continue\” là một phê duyệt yếu có thể được chấp nhận bởi một tác nhân khác hoặc kẻ xấu. \”Transfer this amount to this account\” hoặc \”deploy this change to this environment\” là những gì hệ thống thực sự có thể xác minh tại thời điểm thực thi, và người dùng hoàn toàn hiểu.

Xác thực danh tính con người thực tế rất quan trọng tại cổng này. Thông báo đẩy chỉ chứng minh rằng ai đó hoặc một thứ gì đó đã nhấn nút. Các thiết kế mạnh hơn yêu cầu một người đã đăng ký sử dụng xác thực khóa công khai chống lừa đảo, hỗ trợ bởi phương pháp xác minh sinh trắc học cục bộ. tiêu chuẩn FIDO ràng buộc thông tin xác thực khóa công khai với dịch vụ trực tuyến hợp pháp và giữ dữ liệu sinh trắc học trên thiết bị riêng biệt của người dùng. Khi được sử dụng tốt, xác thực dựa trên phần cứng cung cấp bằng chứng tốt hơn nhiều rằng người đúng thực sự có mặt. Tuy nhiên, nó không thay thế việc ràng buộc giao dịch, một giao diện tin cậy, hay việc thực thi chính sách. Bạn cần tất cả chúng hoạt động cùng nhau.

Giám sát hành vi và bảo toàn bằng chứng

Bạn không thể dựa vào lời nhắc ban đầu để giải thích những gì đã xảy ra trong một phiên chạy dài của tác nhân. Các đội bảo mật cần dữ liệu đo lường về các lời gọi công cụ, hoạt động mạng, việc sử dụng chứng chỉ, quyết định chính sách, phê duyệt, từ chối và thay đổi phạm vi. Việc giám sát nên so sánh những gì tác nhân thực sự thực hiện với ranh giới đã khai báo cho phiên chạy đó. Nếu một tác nhân được giao nhiệm vụ phân tích mã và nó bắt đầu tìm kiếm chứng chỉ bên ngoài hoặc thăm dò một dịch vụ không liên quan, điều đó nên kích hoạt cảnh báo.

Nhật ký cần đủ ngữ cảnh để tái tạo chuỗi hành động mà không tiết lộ bí mật dưới dạng văn bản thuần. Mỗi bản ghi nên ghi lại phiên bản của tác nhân, người sở hữu, người hoặc hệ thống đã khởi động, công cụ đã dùng, hành động yêu cầu, kết quả chính sách, và bất kỳ sự ủy quyền nào của con người. Các bản ghi đã ký hoặc có khả năng chống giả mạo làm cho việc xem xét sau hành động trở nên đáng tin cậy hơn nhiều, đặc biệt khi có nhiều tác nhân và dịch vụ tham gia.

Tất cả những điều này phải chạy ở tốc độ máy. Không ai ngồi xem bảng điều khiển sẽ dừng hàng ngàn lời gọi kết thúc trong vài giây. Các kiểm soát tự động nên thực thi giới hạn tốc độ, phát hiện chuỗi bất thường, và đình chỉ chứng chỉ ngay khi hành vi vượt qua ngưỡng đã định. Nhờ đó, các nhà điều tra con người sẽ có một sự cố được cô lập để xử lý thay vì một cuộc truy đuổi không có kết thúc.

Thiết kế lộ trình dừng trước khi triển khai

Mỗi lần triển khai tác nhân cần có một cách dừng lại thực sự loại bỏ khả năng. Yêu cầu tác nhân dừng lại không đủ. Người vận hành nên có khả năng thu hồi chứng chỉ của nó, cắt đường mạng, dừng thời gian chạy, và ngăn các hành động đã xếp hàng khởi động lại. Đối với quy trình có hậu quả nghiêm trọng, nếu dịch vụ phê duyệt hoặc chính sách gặp sự cố, hệ thống nên ngừng hoạt động.

Sau đó kiểm tra lộ trình đó dưới áp lực. Tắt dịch vụ phê duyệt. Cung cấp cho tác nhân các chỉ thị mâu thuẫn. Thay đổi chứng chỉ giữa chừng một phiên chạy. Mô phỏng một công cụ bị xâm phạm và một người phê duyệt không bao giờ phản hồi. Xác nhận hành động bị chặn và bạn còn lại một bản ghi hữu ích. Và chạy lại các thử nghiệm này bất cứ khi nào mô hình, lời nhắc, kết nối, hệ thống bộ nhớ, hoặc bộ quyền thay đổi.

Mục tiêu là Tự chủ có Trách nhiệm

Không có gì ở đây là lập luận chống lại các tác nhân, và sự cố Hugging Face không nên làm ai sợ hãi các tác nhân hữu ích. Điều nó nên làm là tiêu diệt ý tưởng rằng một lời nhắc an toàn cộng với ý định tốt sẽ tạo nên một triển khai đáng tin cậy. Cho các tác nhân không gian để phân tích, chuẩn bị công việc và xử lý các nhiệm vụ có thể đảo ngược. Giữ quyền hạn của chúng trong việc gây ra hậu quả thực tế một cách hẹp, rõ ràng và được thực thi bởi một thứ gì đó khác ngoài chính tác nhân.

Trước khi một tác nhân đưa vào sản xuất, các nhà lãnh đạo nên có khả năng trả lời một vài câu hỏi đơn giản. Hệ thống nào nó có thể tiếp cận? Thông tin xác thực nào nó có thể sử dụng? Nó có thể làm gì mà không cần xem xét? Điều gì kích hoạt việc leo thang? Người phê duyệt nhìn thấy hành động cụ thể đang được phê duyệt như thế nào? Bằng chứng nào sẽ được để lại? Và làm thế nào bảo mật có thể dừng quá trình ngay lập tức?

Nếu các câu trả lời mơ hồ, tác nhân sẽ có quyền hạn lớn hơn so với những gì tổ chức nhận ra. Kiến trúc duy trì theo thời gian kết hợp các biện pháp bảo vệ mô hình với danh tính, quyền tối thiểu, thực thi chính sách bên ngoài, phê duyệt có chọn lọc của con người, thu thập dữ liệu đầy đủ, và một cơ chế dừng thực sự hoạt động. Nó bắt đầu từ giả định trung thực: các tác nhân có khả năng sẽ bất ngờ chúng ta thỉnh thoảng. Ranh giới bảo mật của chúng ta không nên như vậy.

Cuối cùng, hãy nghĩ về một tác nhân AI như một thực tập sinh có (có thể) quyền root và không sợ phòng Nhân sự.

Các biện pháp bảo vệ và cổng nào họ sẽ có?

Hành động phù hợp.

Kevin Surace là CEO của Token và là một nhà tiên phong AI, nhà phát minh, tác giả và doanh nhân với nhiều thập kỷ kinh nghiệm áp dụng trí tuệ nhân tạo. Ông sở hữu 95 bằng sáng chế trên toàn thế giới và nói chuyện toàn cầu về AI, tự động hoá, và tương lai của công việc.