Lãnh đạo tư tưởng
Công Cụ Bảo Mật AI Của Bạn Không Bảo Vệ Bạn – Nó Chỉ Làm Cho Bạn Cảm Thấy Tốt Hơn

Vào tháng 6 năm 2025, Microsoft đã vá CVE-2025-32711, còn được gọi là EchoLeak: một lỗ hổng zero-click trong Microsoft 365 Copilot, được đánh giá 9,3 trên CVSS. Một email được tạo ra, không bao giờ được mở bởi nạn nhân, có thể làm cho động cơ truy xuất của Copilot exfiltrate im lặng bất kỳ ngữ cảnh nhạy cảm nào nó có thể truy cập. Chi tiết mà bạn nên quan tâm: payload đi thẳng qua XPIA, trình phân loại prompt-injection của Microsoft, hiện diện, chạy và hoạt động chính xác như thiết kế.
Bruce Schneier đã đưa ra từ vựng cho điều này vào năm 2009. Security theater, ông viết, mô tả các biện pháp làm cho mọi người cảm thấy an toàn hơn mà không cải thiện thực sự an toàn của họ. Cảm giác và thực tế là hai điều khác nhau, và chúng phân kỳ.
Mười bảy năm sau, AI đã công nghiệp hóa sự phân kỳ, trên cả hai bên của phương trình. Các công cụ bảo mật AI được bán trên các khả năng mà chúng không thể chứng minh dưới đo lường, và các công cụ bảo mật cho AI được bán như giải pháp cho một vấn đề mà tài liệu của chính họ thừa nhận là không thể giải quyết. Chu kỳ hype của Gartner năm 2025 đã đặt quản lý rủi ro và bảo mật AI tại đỉnh của kỳ vọng bị thổi phồng. Các nhà phân tích đang nói với bạn nơi chúng ta đang đứng. Câu hỏi là làm gì về nó.
Khoảng cách giữa bảng dữ liệu và đo lường
Bắt đầu với những gì xảy ra khi ai đó kiểm tra các điều khiển được triển khai thay vì đọc tài liệu tiếp thị của chúng.
Báo cáo Blue 2025 của Picus đã phân tích hơn 160 triệu mô phỏng tấn công thực tế được chạy chống lại các môi trường sản xuất trong nửa đầu năm 2025. Picus bán nền tảng mô phỏng, vì vậy hãy cân nhắc nguồn này, nhưng các số liệu khó có thể bác bỏ. Hiệu quả phòng ngừa trung bình là 62%, giảm từ 69% một năm trước. Mặc dù phạm vi ghi nhật ký là 54%, chỉ 14% các cuộc tấn công mô phỏng tạo ra một cảnh báo. Các cuộc tấn công sử dụng thông tin đăng nhập hợp lệ thành công 98% thời gian. Và trong số các nỗ lực exfiltrate dữ liệu được mô phỏng, các điều khiển hiện tại đã chặn 3%.
3%. Đây là những môi trường có các ngăn xếp bảo mật hiện đại, thường được gắn nhãn AI, và thử nghiệm exfiltrate là thử nghiệm ánh xạ trực tiếp nhất đến những gì một kẻ tấn công muốn làm.
Các điểm số chuẩn mà xuất hiện trong các bộ tài liệu của nhà cung cấp xứng đáng được sự hoài nghi tương tự. Khi các nhà cung cấp bắt đầu tuyên bố điểm số hoàn hảo trên các đánh giá MITRE ATT&CK, nhà phân tích Allie Mellen của Forrester đã xuất bản một lời nhắc nhở sắc nét: các đánh giá không có người thắng hoặc người thua, và các tuyên bố 100% thường dựa trên các cấu hình không thực tế, các kết quả con được chọn, hoặc các thiết lập phát hiện sẽ chôn một SOC thực dưới tiếng ồn.
Không có gì mới mẻ ở đây, điều này thật đáng thất vọng. Vào năm 2019, các nhà nghiên cứu tại Skylight Cyber đã tháo rời phần mềm chống vi-rút “chỉ AI” của Cylance bằng cách thêm các chuỗi từ trò chơi video Rocket League vào mẫu malware, đảo ngược phán quyết của trình phân loại trên 100% trong số 10 gia đình malware hàng đầu vào thời điểm đó và 83% trong một tập hợp mẫu rộng hơn. Bài học, rằng các mô hình học máy tĩnh thất bại trước các đối thủ nghiên cứu chúng, đã được xuất bản 7 năm trước. Phản ứng của thị trường là xuất khẩu thêm các mô hình học máy tĩnh.
Vấn đề lan can bảo vệ còn tồi tệ hơn
Nếu phát hiện AI-powered bán quá mức, các công cụ được bán để bảo mật AI bản thân đang ở một vị trí lạ: cơ quan tiêu chuẩn định nghĩa mối đe dọa nói rằng mối đe dọa có thể không thể giải quyết được.
Đầu vào prompt ngồi ở vị trí số một trong OWASP Top 10 cho ứng dụng LLM, và hướng dẫn thực tế của OWASP là bất thường thẳng thắn: учитывая tính chất ngẫu nhiên của các mô hình, “không rõ liệu có phương pháp phòng ngừa chắc chắn nào cho đầu vào prompt.” Fine-tuning và RAG, nó thêm, không hoàn toàn giảm thiểu nó. Đó là vấn đề mà thị trường bảo vệ prompt tồn tại để giải quyết, được mô tả là có thể không thể giải quyết được bởi tổ chức đã lập danh mục nó.
Công việc thực nghiệm hỗ trợ sự bi quan. Các nhà nghiên cứu tại Đại học Lancaster và Mindgard đã kiểm tra sáu hệ thống bảo vệ sản xuất, bao gồm Azure Prompt Shield và Prompt Guard của Meta, và đạt được lên đến 100% thành công tránh bằng cách sử dụng kỹ thuật tiêm ký tự và nhiễu loạn đối thủ, trong khi giữ các cuộc tấn công cơ bản hoạt động. HiddenLayer đã đi xa hơn, xuất bản một mẫu prompt “Policy Puppetry” chuyển giao duy nhất mà nó cho rằng bypass mọi mô hình lớn trên thị trường. Đó là nghiên cứu của nhà cung cấp và không được xem xét lại, vì vậy hãy đối xử với “tất cả” một cách cẩn thận, nhưng các kênh độc lập đã tái tạo các yêu cầu cốt lõi.
Chứng nhân đáng tin cậy nhất không có sản phẩm để bán. Viện An toàn AI của Vương quốc Anh, đánh giá năm LLM hàng đầu, đã báo cáo rằng “tất cả các mô hình đều dễ bị tổn thương cao đối với các cuộc tấn công cơ bản của chúng tôi”, với mỗi mô hình tuân thủ ít nhất một lần trong năm lần cho hầu hết các câu hỏi có hại khi các cuộc tấn công trong nhà được áp dụng. Các cuộc tấn công cơ bản. Không phải thủ công của quốc gia. Một cơ quan đánh giá của chính phủ, lưu ý một cách lịch sự rằng bộ lọc đầu vào của hoàng đế không có quần áo.
Unite.AI đã lập danh mục các lớp dễ bị tổn thương và các kỹ thuật tiêm trong nhiều năm. Không có gì bí mật ở đây. Nó chỉ không xuất hiện trên bảng dữ liệu.
Phần nguy hiểm là cảm giác
Đây là nơi tiêu đề của bài viết này ngừng được mang tính chất hư cấu. Nếu những công cụ này chỉ không thực hiện, tổn thất sẽ là ngân sách. Nghiên cứu cho thấy điều gì đó tồi tệ hơn: sự tự tin mà chúng tạo ra thực sự làm suy giảm hành vi.
Những nhà nghiên cứu về an toàn gọi nó là bù rủi ro, hoặc hiệu ứng Peltzman: những người được bảo vệ thực hiện nhiều rủi ro hơn. Các tài xế có dây an toàn lái xe nhanh hơn. Và các tổ chức có bảng điều khiển bảo mật AI, hóa ra, ngừng làm những việc nhàm chán.
Các số liệu trùng khớp không thoải mái. Chỉ số sẵn sàng bảo mật mạng năm 2025 của Cisco, khảo sát 8.000 nhà lãnh đạo bảo mật, đã tìm thấy rằng 86% tổ chức đã trải qua một sự cố bảo mật liên quan đến AI trong 12 tháng trước, trong khi chỉ 10% coi AI là điều khó bảo vệ nhất, và 60% thừa nhận họ thiếu khả năng hiển thị về cách nhân viên sử dụng AI tạo sinh. Sự cố gần như phổ biến; mối quan tâm, một lỗi tròn.
Báo cáo Chi phí vi phạm dữ liệu năm 2025 của IBM đã hoàn thành bức tranh. Trong số các tổ chức đã bị vi phạm mô hình hoặc ứng dụng AI, 97% thiếu các kiểm soát truy cập AI phù hợp. Một trong năm vi phạm được truy ngược lại đến AI bóng tối, thêm khoảng 670.000 đô la vào chi phí vi phạm trung bình, và 63% tổ chức bị vi phạm không có chính sách quản lý AI nào. Đọc các số liệu này cùng nhau và một mẫu xuất hiện: các thất bại là nhàm chán. Vắng mặt các yếu tố cơ bản, trong các tổ chức cảm thấy được bảo vệ.
Bảng điều khiển không bị lỗi. Nó cung cấp sản phẩm thực tế của nó, đó là sự tự tin.
Phiên bản trung thực trông như thế nào
Không có gì ở đây cho rằng công cụ bảo mật AI là vô ích, và bằng chứng phản驳 tốt nhất xứng đáng được phát sóng. Các Phân loại器 Hiến pháp của Anthropic đã sống sót sau hơn 3.000 giờ kiểm tra đỏ bởi 183 nhà nghiên cứu mà không có một cuộc vượt ngục phổ quát, cắt giảm thành công vượt ngục từ 86% trên mô hình không được bảo vệ xuống 4,4%, với chi phí tăng 0,38 điểm trong số lần từ chối và khoảng 24% chi phí tính toán. Sau đó, Anthropic đã chạy một thách thức công khai, và trong số 339 người tham gia, bốn người đã vượt qua mọi cấp độ và một người đã tìm thấy một cuộc vượt ngục phổ quát hoạt động.
Đó là hình dạng trung thực của toàn bộ lĩnh vực trong một kết quả: một rào chắn được xây dựng tốt đã tăng chi phí của kẻ tấn công rất nhiều, mang một khoản thuế có thể đo lường được, và vẫn sụp đổ trước một con người đủ quyết tâm. Nếu tôi phải nén bài viết này thành một nguyên tắc mua hàng, đó là: một điều khiển được bán như một công cụ tăng chi phí với các chế độ thất bại được công bố là đáng được đánh giá; một điều khiển được bán như một vấn đề đã được giải quyết đang bán cho bạn cảm giác.
Điều khiển hoặc chăn an ủi: ba câu hỏi
Bạn có thể tách một cái khỏi cái kia mà không cần ngân sách nghiên cứu. Ba câu hỏi, được hỏi về mọi công cụ bảo mật AI bạn sở hữu hoặc sắp mua.
Nó có tỷ lệ vượt qua đo lường trong môi trường của tôi là bao nhiêu? Không phải điểm chuẩn của nhà cung cấp. Của bạn. Xác thực liên tục và các bài tập đội tím tồn tại chính xác vì, như dữ liệu Picus cho thấy, các điều khiển được triển khai trôi dạt về thất bại im lặng. Một số bạn chưa đo lường là một số bạn đang chấp nhận trên niềm tin.
Điều gì xảy ra khi nó thất bại? Không nếu. Hướng dẫn thực tế của OWASP chỉ theo cùng một hướng với mọi sự cố trên: truy cập đặc quyền tối thiểu cho các mô hình, cổng phê duyệt của con người trên các hành động nhạy cảm, và phân đoạn giả định rằng bộ lọc sẽ cuối cùng cho phép một số thứ đi qua. EchoLeak là có thể sống sót cho các tổ chức mà Copilot của họ chỉ không thể tiếp cận bất cứ thứ gì đáng giá.
Nếu tuyên bố của nhà cung cấp là một sự kiện hay một giả thuyết? Thậm chí các nhà cung cấp cũng thừa nhận nhiều hơn so với các bảng dữ liệu của họ. Một cuộc khảo sát của Vectra về 2.000 chuyên gia SOC, một lần nữa là nghiên cứu của nhà cung cấp, đã tìm thấy các đội chỉ có thể xử lý 38% số cảnh báo mà các công cụ của họ tạo ra, với 60% nói rằng các nhà cung cấp bán các công cụ tạo ra tiếng ồn thay vì sự rõ ràng, và một nửa gọi các công cụ của họ là một trở ngại hơn là giúp đỡ. Khi khách hàng của ngành báo cáo điều đó, “tin vào bảng dữ liệu” ngừng trở thành một chiến lược.
Mẫu sống sót sau bản vá
EchoLeak đã được sửa trong một Patch Tuesday. Mẫu mà nó chứng minh, một rào chắn sản xuất tự tin lọc cửa trước trong khi cuộc tấn công đến qua khe hở, không phải như vậy, và hồ sơ nghiên cứu trên cho biết nó sẽ không sớm xảy ra.
Quyết định của Schneier đã 17 tuổi và chưa bao giờ đắt để bỏ qua. Cảm giác an toàn là một sản phẩm, và kỷ nguyên AI bán nó trong các cấp độ đăng ký. Thực tế an toàn là một đo lường, và không ai có thể bán nó cho bạn, vì bạn phải đi và lấy nó.












