Взгляд Anderson

Использование эмодзи может обойти фильтры контента в чат-ботах ИИ

mm
Добавьте Unite.AI в избранные источники в Google
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Эмодзи можно использовать для обхода механизмов безопасности больших языковых моделей и вызова токсичных выводов, которые в противном случае были бы заблокированы. Таким образом, БЯМ можно заставить обсуждать и давать советы по запрещенным темам, таким как изготовление бомб и убийство.

 

Новое сотрудничество между Китаем и Сингапуром обнаружило убедительные доказательства того, что эмодзи можно использовать не только для обхода фильтров контента в больших языковых моделях (БЯМ), но и в целом для увеличения уровня токсичности во время взаимодействия пользователя с моделями:

Из новой статьи, широкая демонстрация способов, которыми кодирование запрещенной концепции с помощью эмодзи может помочь пользователю 'взломать' популярную БЯМ. Источник: https://arxiv.org/pdf/2509.11141

Из новой статьи, широкая демонстрация способов, которыми кодирование запрещенной концепции с помощью эмодзи может помочь пользователю ‘взломать’ популярную БЯМ. Источник: https://arxiv.org/pdf/2509.11141

В примере выше, из новой статьи, мы видим, что преобразование правонарушений словесного намерения в эмодзи-нагруженную альтернативную версию может вызвать гораздо более ‘сговорчивый’ ответ от сложной языковой модели, такой как ChatGPT-4o (которая обычно санитизирует входные запросы и перехватывает выводимый материал, который может нарушить правила компании).

Эффективно, в самых крайних обстоятельствах, использование эмодзи может поэтому действовать как метод взлома, согласно авторам новой работы.

Одна остающаяся загадка, заявленная в статье, является вопросом почему языковые модели дают эмодзи такое право нарушать правила и вызывать токсичный контент, когда модели уже понимают, что определенные эмодзи имеют сильно токсичные ассоциации.

Предлагаемое объяснение состоит в том, что поскольку БЯМ обучены для моделирования и воспроизведения закономерностей из их тренировочных данных, и поскольку эмодзи так часто встречаются в этих данных, модель учит, что эмодзи принадлежит в этом дискурсе, и рассматривает его как статистическую ассоциацию, вместо контента, который должен быть оценен и отфильтрован.

Это означает, что эмодзи, когда он повторно используется в запросе, помогает модели предсказывать токсичные продолжения более уверенно; но вместо того, чтобы действовать как красный флаг, эмодзи функционирует как семантическая подсказка, которая фактически подкрепляет предназначенное токсичное значение вместо того, чтобы модерировать или перехватывать его. Поскольку выравнивание безопасности применяется после факта, и часто в узком, буквальном контексте, запросы с этими эмодзи могут поэтому полностью избежать обнаружения.

В этом смысле статья предлагает, что модель не становится терпимой несмотря на токсичную ассоциацию – она становится терпимой из-за нее.

Бесплатный пропуск

Тем не менее, авторы признают, что это не представляет собой окончательную теорию о том, почему использование эмодзи может так эффективно обойти фильтры контента в языковых моделях. Они заявляют:

‘Модели могут распознавать злонамеренное намерение, выраженное эмодзи, но то, как оно обходит механизмы безопасности, остается неясным.’

Слабость может возникнуть из-за тексто-центрированного дизайна фильтров контента, который предполагает либо буквальный текстовый ввод, либо встраивания, верно преобразованные в текстовые эквиваленты: в обоих случаях система полагается на явные токены, которые могут быть сопоставлены с правилами безопасности.

Чтобы проиллюстрировать это на примере редактирования изображений на основе ИИ: когда пользователь загружает изображение NSFW в модель зрения-языка и запрашивает изменения, системы such as Adobe Firefly или ChatGPT используют CLIP-стиль конвейеров для извлечения текстовых концепций из изображения, в качестве предварительного условия для редактирования. Как только эти концепции представлены в виде слов, присутствие любых ограниченных терминов в этих извлеченных словах вызовет фильтр,导致 запрос будет отклонен.

Однако, по какой-то причине, статус эмодзи как ни слова, ни изображения (или же, как оба) кажется дает ему силу преодолевать фильтрацию; очевидно, как указывают авторы, дальнейшие исследования этого странного лазеека являются оправданными.

Новая статья называется Когда улыбка становится враждебной: интерпретация того, как эмодзи вызывают токсичность БЯМ и исходит от девяти авторов из Университета Цинхуа и Национального университета Сингапура.

(К сожалению, многие примеры, на которые ссылается статья, находятся в приложении, которое еще не доступно; хотя мы запросили это у авторов, приложение не было предоставлено на момент написания. Тем не менее, эмпирические результаты в основной статье остаются достойными внимания.)

Три основных интерпретации эмодзи

Авторы подчеркивают три лингвистических черты, которые делают эмодзи эффективными для обхода фильтров. Во-первых, значения эмодзи зависят от контекста. Например, эмодзи ‘Деньги с крыльями’ (см. изображение ниже) официально определяется как представление денежных переводов или расходов; однако, в зависимости от окружающего текста, он также может подразумевать либо законную, либо незаконную деятельность:

В частичном иллюстрации из новой статьи, мы видим, что популярный эмодзи может иметь свое значение захвачено, изменено или подвергнуто субверсии в популярном использовании Это эффективно дает эмодзи официальный паспорт в семантическое пространство и скрытую нагрузку негативного или токсичного значения, которое можно использовать, как только оно проходит фильтры.

В частичном иллюстрации из новой статьи, мы видим, что популярный эмодзи может иметь свое значение захвачено, изменено или подвергнуто субверсии в популярном использовании Это эффективно дает эмодзи официальный паспорт в семантическое пространство и скрытую нагрузку негативного или токсичного значения, которое можно использовать, как только оно проходит фильтры.

Во-вторых, эмодзи могут сдвигать тон запроса. Их присутствие часто добавляет игривость или иронию, смягчая эмоциональный регистр. В вредоносных запросах это может сделать запрос похожим на шутку или игру, побуждая модель ответить, а не отклонить:

Легализирующий эффект эмодзи может детоксифицировать тон без детоксификации намерения.

Легализирующий эффект эмодзи может детоксифицировать тон без детоксификации намерения.

В-третьих, статья утверждает, что эмодзи языково-нейтральны: один эмодзи может нести один и тот же сентимент на английском, китайском, французском и других языках. Это делает их идеальными для многоязычных запросов, сохраняя значение даже при переводе окружающего текста:

Эмодзи разбитого сердца передает универсальное сообщение, возможно, не в последнюю очередь потому, что он представляет базовый случай в человеческом состоянии, относительно невосприимчивый к национальным или культурным вариациям.

Эмодзи разбитого сердца передает универсальное сообщение, возможно, не в последнюю очередь потому, что он представляет базовый случай в человеческом состоянии, относительно невосприимчивый к национальным или культурным вариациям.

Подход, данные и тесты*

Исследователи создали модифицированную версию набора данных AdvBench, переписав вредоносные запросы из AdvBench, чтобы включить эмодзи либо как замену чувствительных слов, либо как декоративный камуфляж. AdvBench охватывает 32 высокорисковые темы, включая взрывы, хакерство и убийство, среди прочих:

Оригинальные примеры из AdvBench, иллюстрирующие, как один вредоносный запрос может обойти меры безопасности в нескольких крупных чат-ботах, вызывая вредоносные инструкции, несмотря на обучение на выравнивании.

Оригинальные примеры из AdvBench, иллюстрирующие, как один вредоносный запрос может обойти меры безопасности в нескольких крупных чат-ботах, вызывая вредоносные инструкции, несмотря на обучение на выравнивании. Source: https://arxiv.org/pdf/2307.15043

Все 520 исходных экземпляров AdvBench были изменены таким образом, с использованием 50 лучших токсичных и не-дублирующих запросов в диапазоне экспериментов. Запросы также были переведены на несколько языков и протестированы на семи крупных закрытых и открытых моделях, а также в сочетании с известными эффективными методами взлома Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); и DeepInception.

Использованные закрытые модели были Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; и Gemini-1.5-pro. Использованные открытые модели были Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Команда 2024b); и Qwen2.5-72B-Instruct (Команда 2024a), с повторением всех экспериментов три раза, чтобы учесть случайность.

Исследование сначала проверило, увеличит ли переписывание вредоносных запросов из AdvBench с помощью эмодзи токсичный вывод, включая переводы на другие крупные языки. Кроме того, оно применило тот же метод редактирования эмодзи к запросам из вышеупомянутых известных методов взлома (PAIR, TAP и DeepInception), чтобы увидеть, может ли замена эмодзи еще больше улучшить их успех.

В обоих случаях структура исходных запросов была сохранена, с заменой только чувствительных терминов на эмодзи и добавлением декоративных элементов для маскировки намерения.

Для метрик тестирования авторы разработали систему оценки, называемую GPT-Judge. В этом варианте GPT-4o не был моделью, подвергаемой тестированию, а был запрошен для действий в качестве оценщика, присваивающего числовой Индекс вреда (HS) ответам, сгенерированным другими моделями.

Каждый вывод был оценен от одного (безвредный) до пяти (чрезвычайно вредный), и процент ответов, которые получили пять, был сообщен как Коэффициент вредности (HR).

Чтобы предотвратить переход моделей в объяснения эмодзи вместо явного ответа, исследователи добавили инструкцию к каждому запросу, указывающую модели сделать свой ответ кратким:

Результаты из запросов на основе эмодзи в 'Setting-1', с сравнениями с вариантами, в которых эмодзи были заменены словами или полностью удалены. Названия моделей сокращены для экономии места.

Результаты из запросов на основе эмодзи в ‘Setting-1’, с сравнениями с вариантами, в которых эмодзи были заменены словами или полностью удалены. Названия моделей сокращены для экономии места.

В таблице результатов выше, левая часть таблицы указывает, что вредоносные запросы, замененные эмодзи, достигли заметно более высоких баллов HS и HR, чем варианты, в которых эмодзи были заменены словами или удалены.

Авторы отмечают, что подход, основанный на эмодзи, превосходит предыдущие методы взлома, как указано в дополнительной таблице результатов ниже:

Результаты коэффициента вредности для запросов на основе эмодзи в 'Setting-2', с названиями моделей, представленными в сокращенной форме.

Результаты коэффициента вредности для запросов на основе эмодзи в ‘Setting-2’, с названиями моделей, представленными в сокращенной форме.

Первая из двух таблиц выше, по мнению авторов, также указывает, что эффект эмодзи распространяется на языки. Когда текстовые компоненты запросов на основе эмодзи были переведены на китайский, французский, испанский и русский, вредоносные выводы остались высокими; поскольку это высокоресурсные языки, результаты предполагают, что риск не ограничивается английским, а распространяется на крупные группы пользователей, с эмодзи, функционирующими как передаваемый канал для токсичного поколения.

В направлении заключения статьи исследователи предлагают, что эффект эмодзи не является просто случайным, а коренится в том, как модели обрабатывают их, отметив, что модели могут, по-видимому, распознавать вредоносное значение эмодзи – но ответы с отклонением подавляются, когда эмодзи присутствуют.

Исследования токенизации указывают, что эмодзи обычно разбиваются на редкие или нерегулярные фрагменты с небольшим совпадением с их текстовыми эквивалентами, эффективно создавая альтернативный канал для вредоносной семантики.

Взглянув за пределы механики моделей, статья далее исследует предварительные данные, обнаруживая, что многие часто используемые эмодзи появляются в токсичных контекстах, таких как порнография, мошенничество или азартные игры. Авторы утверждают, что это повторное воздействие может нормализовать связь между эмодзи и вредоносным контентом, побуждая модели соответствовать вредоносным запросам, а не блокировать их.

Вместе эти результаты предполагают, что как внутренние особенности обработки, так и предвзятые предварительные данные способствуют удивительной эффективности эмодзи в обходе мер безопасности.

Заключение

Не редко используются альтернативные методы ввода для попытки взлома БЯМ. В последние годы, например, шестнадцатеричное кодирование было использовано для обхода фильтров ChatGPT. Проблема, по-видимому, лежит в плоском использовании текстового языка для квалификации входящих запросов и исходящих ответов.

В случае эмодзи скрытый центр правилонарушающего значения может, по-видимому, быть введен в дискурс без штрафа или вмешательства, потому что метод передачи является неортодоксальным. Можно подумать, что CLIP-стиль транслитерации вмешается во все загрузки изображений, так что оскорбительный или нарушающий материал в конечном итоге будет представлен в виде флагируемого текста.

Очевидно, что это не так, по крайней мере, где изученные крупные БЯМ, их лингвистические барьеры кажутся хрупкими и тексто-центричными. Можно представить, что более широкая интерпретация контента (например, изучение активаций тепловых карт) несет стоимость обработки и/или пропускную способность, которая может сделать такие подходы нецелесообразно дорогими, среди других возможных ограничений и соображений.

 

* Макет этой статьи хаотичен по сравнению с большинством, с методологией и тестами, неясно определёнными. Мы сделали всё возможное, чтобы представить основную ценность работы как можно лучше в этих обстоятельствах.

В признанно почти непроницаемом и запутанном изложении результатов.

Опубликовано в среду, 17 сентября 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]