Отчёты
Отчет EchoGram от HiddenLayer предупреждает о новом классе атак, подрывающих защиту ИИ

Недавно опубликованный отчет EchoGram компании HiddenLayer дает одно из самых четких предупреждений о том, что современные механизмы безопасности ИИ более хрупкие, чем кажутся. На девяти страницах технических доказательств и экспериментов HiddenLayer демонстрирует, как атакующие могут манипулировать системами защиты, используя короткие, казалось бы, бессмысленные последовательности токенов, которые надежно меняют их вердикты. Злонамеренный запрос, который должен быть обнаружен как небезопасный, может быть помечен как безопасный просто путем добавления определенного токена. Напротив, совершенно безобидный ввод может быть неправильно классифицирован как вредоносный. На протяжении всего отчета HiddenLayer показывает, что эти последовательности изменяют только интерпретацию запроса защитой, а не основные инструкции, передаваемые модели.
Хрупкость современных систем защиты
Системы защиты стали фундаментальными для того, как организации развертывают большие языковые модели. Они служат первой и часто единственной линией защиты, предназначенной для обнаружения побегов, внедрения запросов, запрещенных запросов или манипулятивных инструкций до того, как модель ИИ их обработает. Результаты HiddenLayer показывают, что этот защитный слой имеет системные слабости, связанные напрямую с тем, как эти системы защиты обучены. Поскольку многие из них полагаются на похожие наборы данных, закономерности или таксономии безопасности, они уязвимы для одних и тех же видов манипуляций на уровне токенов, которые обнаруживает EchoGram.
Как EchoGram создает свои последовательности атак
Процесс EchoGram начинается с генерации пула кандидатов токенов, которые могут повлиять на суждение модели. HiddenLayer объясняет, что эти токены могут быть выявлены путем анализа лингвистических закономерностей в наборах данных, обычно используемых для обучения систем защиты, или путем прямого исследования словаря токенизатора модели, когда доступно белое ядро. Данные обучения сами по себе становятся картой предубеждений, раскрывая, какие последовательности склоняются к “безопасным” или “небезопасным” классификациям. Эти дисбалансы образуют сырье для атаки.
После того, как этот пул собран, EchoGram оценивает каждую последовательность, добавляя ее к набору злонамеренных запросов и измеряя, как часто токен меняет классификацию системы защиты. В отчете приведен поразительный пример, где небольшая, бессмысленная последовательность преобразует несколько известных попыток внедрения запросов из “обнаруженных” в “безопасные”, когда они тестируются против коммерческого классификатора. Злонамеренные запросы остаются целыми, но добавленная последовательность меняет, как система защиты интерпретирует их.
Почему комбинации токенов особенно опасны
Отчет EchoGram подчеркивает, что даже когда один токен только частично меняет вердикты, комбинация нескольких слабых токенов производит драматически более сильный эффект. HiddenLayer демонстрирует это усиление, используя Qwen3Guard, широко используемую открытую модель модерации LLM-as-a-judge. На вариантах 0,6B и 4B связанные последовательности EchoGram вызвали у системы защиты неправильную классификацию высокоопасных запросов, включая запросы оружия, обхода аутентификации и кибератак, как безопасных или только слегка тревожных.
Этот эффект сохранялся на всех размерах моделей, подкрепляя вывод HiddenLayer о том, что уязвимость коренится в методологии обучения, а не в масштабе или сложности модели.
Вектор ложных положительных результатов: менее заметный, но не менее серьезный риск
EchoGram не только метод обхода систем защиты; HiddenLayer показывает, что его также можно использовать для генерации ложных положительных результатов в больших масштабах. Включая последовательности EchoGram в безобидные входные данные, атакующий может вызвать у системы защиты неправильную классификацию безобидных запросов как вредоносных. В отчете приведены примеры, где простые разговорные фразы помечаются как атаки после добавления или встраивания токена EchoGram в текст.
Это создает возможность для перегрузки команд безопасности или доверия и безопасности шумом. Когда сигналы тревоги резко увеличиваются, организации могут пропустить реальные угрозы, скрытые в потоке. Эрозия доверия к внутренним инструментам становится столь же вредной, как и любой успешный обход.
Последствия для безопасности ИИ
Отчет EchoGram подчеркивает, что системы защиты, обученные на похожих источниках данных, закономерностях или таксономиях, вероятно, разделят одни и те же уязвимости. Атакующий, который обнаруживает одну успешную последовательность EchoGram, потенциально может повторно использовать ее на нескольких коммерческих платформах, корпоративных развертываниях и государственных системах. HiddenLayer подчеркивает, что атакующим не нужно компрометировать модель ИИ. Им нужно только ввести в заблуждение “ворота” перед ней.
Эта задача выходит за рамки технического риска. Организации могут предположить, что развертывание системы защиты обеспечивает значительную защиту, но EchoGram демонстрирует, что это предположение хрупкое. Если систему защиты можно изменить токеном или двумя, вся архитектура безопасности становится ненадежной.
Дорога вперед
HiddenLayer заключает, что EchoGram должен послужить поворотным моментом в том, как отрасль подходит к безопасности ИИ. Системы защиты не могут полагаться на статические наборы данных или одноразовые циклы обучения. Они требуют непрерывного тестирования на устойчивость, прозрачности в методах обучения и многослойной проверки, а не суждений одной модели. Поскольку ИИ становится неотъемлемой частью критической инфраструктуры, финансов, здравоохранения и национальной безопасности, недостатки, выявленные EchoGram, становятся срочными, а не академическими.
Отчет заканчивается призывом относиться к системам защиты как к критически важным компонентам безопасности, требующим того же уровня строгости, что и любая другая защитная система. Раскрывая эти уязвимости сейчас, HiddenLayer стимулирует отрасль к созданию защит ИИ, способных выдержать следующее поколение методов атаки.












