Звіти
Звіт HiddenLayer’s EchoGram попереджає про новий клас атак, які підважують захист AI

Нещодавно опублікований звіт EchoGram компанії HiddenLayer містить одне з найясніших попереджень про те, що сучасні механізми безпеки AI більш хиткі, ніж здається. У звіті протягом дев’яти сторінок технічних доказів та експериментів HiddenLayer демонструє, як атакувальники можуть маніпулювати системами захисту — класифікаторами та компонентами LLM-as-a-judge, які забезпечують дотримання політики безпеки — за допомогою коротких, здавалося б, безсенсних послідовностей токенів, які надійно змінюють їхні висновки. Зловмисний запит, який повинен бути визнаний небезпечним, може бути позначений як безпечний просто шляхом додання певного токену. Навпаки, абсолютно безпечний вхід може бути неправильно класифікований як небезпечний. У звіті HiddenLayer показує, що ці послідовності змінюють лише інтерпретацію запиту системою захисту, а не самі підказки, які передаються до нижнього моделі.
Хиткість сучасних систем захисту
Системи захисту стали фундаментальними для того, як організації розгортають великі мовні моделі. Вони служать першою і часто єдиною лінією оборони, призначеної для виявлення вторгнень, вторгнень у підказки, заборонених запитів або маніпулятивних інструкцій до того, як LLM обробить їх. Результати дослідження HiddenLayer показують, що цей захисний шар має системні слабкості, пов’язані безпосередньо з тим, як ці системи захисту тренуються. Оскільки багато з них залежать від подібних наборів даних, шаблонів або таксономій безпеки, вони вразливі до тих самих видів маніпуляцій з токенами, які виявляє EchoGram.
Як EchoGram будує свої атакувальні послідовності
Процес EchoGram починається з генерації пула кандидатів у токени, які можуть вплинути на суд модель. HiddenLayer пояснює, що ці токени можна ідентифікувати шляхом аналізу лінгвістичних шаблонів у наборах даних, які зазвичай використовуються для тренування систем захисту, або шляхом прямого дослідження словарного запасу моделі, коли доступна біла скринька. Дані тренування самі стають картиєю упереджень, розкриваючи, які послідовності нахилі до «безпечних» або «небезпечних» класифікацій. Ці дисбаланси утворюють сировину для атаки.
Після збору цього пула EchoGram оцінює кожну послідовність шляхом додання її до набору небезпечних запитів та вимірювання того, як часто токен змінює класифікацію системи захисту. У звіті міститься вражаючий приклад, у якому коротка, безсенсна послідовність перетворює кілька відомих спроб вторгнення у підказки з «виявлених» на «безпечні», коли тестується на комерційному класифікаторі. Небезпечні запити залишаються цілими, проте додана послідовність змінює, як система захисту інтерпретує їх.
Чому комбінації токенів особливо небезпечні
Звіт EchoGram підкреслює, що навіть якщо один токен лише частково змінює висновки, комбінація кількох слабких токенів має драматично сильніший ефект. HiddenLayer демонструє цей посилення за допомогою Qwen3Guard, широко використовуваної відкритої моделі модерації LLM-as-a-judge. На обох варіантах 0,6B і 4B ланцюгові послідовності EchoGram спричиняли неправильну класифікацію системи захисту щодо високонебезпечних запитів — включаючи запити про зброю, обхід аутентифікації та кібератаки — як безпечних або лише помірно небезпечних.
Цей ефект зберігався через різні розміри моделей, підкріплюючи висновок HiddenLayer про те, що вразливість корениться в методології тренування, а не в масштабі чи складності моделі.
Вектор хибно-позитивних результатів: менш помітний, але рівнозначно серйозний ризик
EchoGram не лише метод для обходу систем захисту; HiddenLayer показує, що його можна використовувати для генерації хибно-позитивних результатів у великих масштабах. Додаванням послідовностей EchoGram до безпечних входів атакувальник може змусити систему захисту неправильно класифікувати безпечні запити як небезпечні. У звіті наводяться приклади, у яких прості розмовні фрази позначаються як атаки після додання токену EchoGram або його вплетення у текст.
Це створює шлях для перегрузки команд безпеки або довіри та безпеки великою кількістю хибних сповіщень. Коли сповіщення зростають неконтрольовано, організації можуть пропустити справжні загрози, заховані серед потоку. Ерозія довіри до внутрішніх інструментів стає такою ж шкідливою, як і будь-який успішний обхід.
Вплив на безпеку AI
Звіт EchoGram підкреслює, що системи захисту, треновані на подібних джерелах даних, шаблонах або таксономіях, ймовірно, мають спільні вразливості. Атакувальник, який відкриває одну успішну послідовність EchoGram, потенційно міг би повторно використовувати її на кількох комерційних платформах, корпоративних розгортаннях та урядових системах. HiddenLayer наголошує, що атакувальникам не потрібно компрометувати нижню LLM; їм потрібно лише обманути охоронця перед нею.
Ця проблема виходить за рамки технічного ризику. Організації можуть вважати, що розгортання системи захисту забезпечує суттєвий захист, але EchoGram демонструє, що це припущення хитке. Якщо систему захисту можна змінити одним або двома токенами, вся архітектура безпеки стає ненадійною.
Дорога вперед
HiddenLayer висновує, що EchoGram повинен служити поворотним моментом у підході промисловості до безпеки AI. Системи захисту не можуть покладатися на статичні набори даних або одиничні цикли тренування. їм потрібне безперервне тестування на атаки, прозорість щодо методів тренування та багаторівневе підтвердження, а не судження однієї моделі. Коли AI стає частиною критичної інфраструктури, фінансів, охорони здоров’я та національної безпеки, недоліки, висвітлені в EchoGram, стають терміновими, а не академічними.
Звіт закінчується закликом до того, щоб системи захисту розглядалися як критичні компоненти безпеки, яким потрібно така ж суворість, як і будь-якій іншій захисній системі. Виставляючи ці вразливості зараз, HiddenLayer спонукає галузь до будівництва захистів AI, які зможуть витримати наступне покоління технік атак.












