Báo cáo
Báo cáo EchoGram của HiddenLayer Cảnh báo về Một Lớp Mới của Các Cuộc Tấn công Đe dọa đến Hệ thống Bảo vệ AI

Báo cáo EchoGram vừa được công bố bởi HiddenLayer đưa ra một trong những cảnh báo rõ ràng nhất về việc các cơ chế an toàn AI hiện nay dễ bị tổn thương hơn chúng ta tưởng. Trong chín trang bằng chứng kỹ thuật và thí nghiệm, HiddenLayer chứng minh cách các kẻ tấn công có thể thao túng hệ thống bảo vệ – những lớp phân loại và thành phần LLM-as-a-judge thực thi các chính sách an toàn – bằng cách sử dụng các chuỗi token ngắn, dường như vô nghĩa, nhưng có thể đảo ngược quyết định của chúng. Một lời nhắc nhở độc hại mà lẽ ra phải được phát hiện là không an toàn có thể được đánh dấu là an toàn chỉ bằng cách thêm một token cụ thể. Ngược lại, một đầu vào hoàn toàn vô hại có thể bị phân loại sai là độc hại. Trong suốt báo cáo, HiddenLayer chỉ ra rằng những chuỗi này chỉ thay đổi cách hệ thống bảo vệ giải thích lời nhắc, không thay đổi các lệnh cơ bản được gửi đến mô hình hạ lưu.
Sự Dễ bị Tấn công của Hệ thống Bảo vệ Hiện đại
Hệ thống bảo vệ đã trở thành nền tảng trong cách các tổ chức triển khai mô hình ngôn ngữ lớn. Chúng đóng vai trò là hàng rào phòng thủ đầu tiên và thường là hàng rào duy nhất, nhằm phát hiện các cuộc tấn công jailbreak, các cuộc tấn công bằng lời nhắc, yêu cầu không được phép, hoặc các lệnh thao túng trước khi mô hình LLM xử lý chúng. Các phát hiện của HiddenLayer cho thấy rằng lớp bảo vệ này có điểm yếu hệ thống liên quan trực tiếp đến cách chúng được đào tạo. Vì nhiều hệ thống bảo vệ dựa trên cùng một tập dữ liệu, mẫu, hoặc phân loại an toàn, chúng dễ bị tổn thương bởi cùng loại thao túng token mà EchoGram phát hiện.
Cách EchoGram Xây dựng Các Chuỗi Tấn công của Nó
Quá trình của EchoGram bắt đầu bằng việc tạo ra một nhóm các token ứng viên có thể ảnh hưởng đến quyết định của mô hình. HiddenLayer giải thích rằng những token này có thể được xác định bằng cách phân tích các mẫu ngôn ngữ trong tập dữ liệu thường được sử dụng để đào tạo hệ thống bảo vệ hoặc bằng cách trực tiếp thăm dò từ vựng của mô hình khi có quyền truy cập trắng. Dữ liệu đào tạo chính nó trở thành một bản đồ của các thiên vị, tiết lộ những chuỗi nào nghiêng về phân loại “an toàn” hoặc “không an toàn”. Những sự mất cân bằng này tạo thành nguyên liệu thô của cuộc tấn công.
Khi nhóm token này được tập hợp, EchoGram đánh giá mỗi chuỗi bằng cách thêm nó vào một tập hợp các lời nhắc độc hại và đo lường tần suất token đảo ngược quyết định của hệ thống bảo vệ. Báo cáo bao gồm một ví dụ đáng chú ý nơi một chuỗi ngắn, vô nghĩa, chuyển đổi nhiều nỗ lực tấn công bằng lời nhắc từ “phát hiện” thành “an toàn” khi thử nghiệm trên một bộ phân loại thương mại. Các lời nhắc độc hại vẫn còn nguyên vẹn, nhưng chuỗi thêm vào thay đổi cách hệ thống bảo vệ giải thích chúng.
Tại sao Các Kết hợp Token Đặc biệt Nguy hiểm
Báo cáo EchoGram nhấn mạnh rằng ngay cả khi một token đơn lẻ chỉ đảo ngược quyết định một phần, việc kết hợp nhiều token yếu tạo ra một hiệu ứng mạnh mẽ hơn đáng kể. HiddenLayer chứng minh sự khuếch đại này bằng cách sử dụng Qwen3Guard, một mô hình điều tiết LLM-as-a-judge mã nguồn mở được sử dụng rộng rãi. Trên cả hai biến thể 0,6B và 4B, các chuỗi EchoGram liên kết gây ra hệ thống bảo vệ phân loại sai các lời nhắc độc hại – bao gồm các truy vấn về vũ khí, bỏ qua xác thực và tấn công mạng – thành “an toàn” hoặc chỉ hơi đáng lo ngại.
Hiệu ứng này tồn tại trên các kích thước mô hình khác nhau, củng cố kết luận của HiddenLayer rằng điểm yếu này nằm ở phương pháp đào tạo cơ bản chứ không phải ở quy mô hoặc độ phức tạp của mô hình.
Vectơ Phát hiện Sai: Một Rủi ro Ít.Visible nhưng Cũng Rất Nghiêm trọng
EchoGram không chỉ là một phương pháp để vượt qua hệ thống bảo vệ; HiddenLayer cũng chỉ ra rằng nó có thể được sử dụng để tạo ra các phát hiện sai ở quy mô lớn. Bằng cách kết hợp các chuỗi EchoGram vào các đầu vào vô hại, một kẻ tấn công có thể gây ra hệ thống bảo vệ phân loại sai các lời nhắc vô hại thành độc hại. Báo cáo cung cấp các ví dụ về cách các cụm từ hội thoại đơn giản được đánh dấu là tấn công khi một token EchoGram được thêm vào hoặc nhúng vào trong văn bản.
Điều này tạo ra một con đường để làm quá tải các đội an ninh hoặc đội an toàn với tiếng ồn. Khi số lượng cảnh báo tăng đột ngột, các tổ chức có thể bỏ lỡ các mối đe dọa thực sự bị chôn vùi trong dòng thông tin. Sự xói mòn niềm tin vào công cụ nội bộ trở nên gây hại như bất kỳ cuộc tấn công thành công nào.
Hậu quả đối với An ninh AI
Báo cáo EchoGram nhấn mạnh rằng các hệ thống bảo vệ được đào tạo trên cùng một nguồn dữ liệu, mẫu, hoặc phân loại có khả năng chia sẻ cùng một điểm yếu. Một kẻ tấn công có thể tái sử dụng một chuỗi EchoGram thành công trên nhiều nền tảng thương mại, triển khai doanh nghiệp và hệ thống chính phủ. HiddenLayer nhấn mạnh rằng kẻ tấn công không cần phải xâm phạm mô hình LLM hạ lưu; họ chỉ cần lừa dối người giám sát trước nó.
Thách thức này vượt ra ngoài rủi ro kỹ thuật. Các tổ chức có thể cho rằng việc triển khai hệ thống bảo vệ đảm bảo sự bảo vệ có ý nghĩa, nhưng EchoGram chứng minh rằng giả định này là mong manh. Nếu hệ thống bảo vệ có thể bị đảo ngược bằng một hoặc hai token, toàn bộ kiến trúc an toàn trở nên không đáng tin cậy.
Con đường Tiếp theo
HiddenLayer kết luận rằng EchoGram nên được coi là một điểm chuyển trong cách ngành công nghiệp tiếp cận an toàn AI. Các hệ thống bảo vệ không thể dựa vào dữ liệu tĩnh hoặc các chu kỳ đào tạo một lần. Chúng đòi hỏi phải thử nghiệm đối thủ liên tục, minh bạch về phương pháp đào tạo và xác thực nhiều lớp thay vì phán quyết của một mô hình duy nhất. Khi AI được tích hợp vào cơ sở hạ tầng quan trọng, tài chính, chăm sóc sức khỏe và an ninh quốc gia, những điểm yếu được EchoGram chỉ ra trở nên cấp thiết chứ không chỉ là lý thuyết.
Báo cáo này kết thúc với một lời kêu gọi đối xử với các hệ thống bảo vệ như các thành phần quan trọng về an ninh đòi hỏi sự nghiêm ngặt như bất kỳ hệ thống bảo vệ nào khác. Bằng cách暴 lộ những điểm yếu này ngay bây giờ, HiddenLayer thúc đẩy ngành công nghiệp xây dựng các biện pháp phòng thủ AI có khả năng chống lại thế hệ kỹ thuật đối thủ tiếp theo.












