Погляд Anderson
Використання Емоджі Може Обійти Фільтри Змісту в Чат-ботах AI

Емоджі можуть бути використані для обходу механізмів безпеки великих мовних моделей, і спричиняти токсичні виходи, які інакше були б заблоковані. За допомогою цього методу великі мовні моделі можуть бути змусені обговорювати і давати поради на заборонені теми, такі як виготовлення бомб і вбивство.
Нове співробітництво між Китаєм і Сінгапуром знаходить переконливі докази того, що емоджі можуть бути використані не тільки для обходу фільтрів змісту в великих мовних моделях (LLM), але і загалом збільшувати рівень токсичності під час взаємодії користувача з моделями:

З нової статті, широке демонстрування способів, за допомогою яких кодування забороненої концепції емоджі може допомогти користувачеві «викрасти» популярну LLM. Джерело: https://arxiv.org/pdf/2509.11141
У наведеному вище прикладі з нової статті ми бачимо, що перетворення порушень правил словесної інтентії в емоджі-навантажену альтернативну версію може викликати набагато більш «співпрацюючу» відповідь від складної мовної моделі, такої як ChatGPT-4o (яка звичайно санітізує вхідні запити і перехоплює вихідний матеріал, який може порушувати компанії-правила).
Ефектно, у найбільш крайніх обставинах, використання емоджі може діяти як обхідний метод, згідно з авторами нової роботи.
Одна з залишених загадок, зазначених у статті, полягає у питання про чому мовні моделі надають емоджі такий вільний прохід для порушення правил і виклику токсичного змісту, коли моделі вже розуміють, що певні емоджі мають сильно токсичні асоціації.
Представлена гіпотеза полягає в тому, що оскільки LLM навчені моделювати і відтворювати закономірності з їхніх навчальних даних, і оскільки емоджі дуже часто зустрічаються в тих даних, модель вчиться, що емоджі належить до того дискурсу, і відноситься до нього як до статистичної асоціації, а не до змісту, який потрібно оцінити і фільтрувати.
Це означає, що емоджі, коли вони повторно використовуються в запиті, допомагають моделі передбачати токсичні продовження з більшою впевненістю; але замість того, щоб діяти як червоний прапор, емоджі функціонує як семантична підказка, яка насправді посилює токсичний зміст замість модерації чи перехоплення його. Оскільки безпекова відповідність застосовується після факту, і часто у вузькому, буквальному кадрі, запити з цими емоджі можуть тим самим повністю уникнути виявлення.
У цьому спосіб, згідно з роботою, модель не стає толерантною навіть попри токсичну асоціацію – вона стає толерантною через неї.
Безкоштовний Пропуск
Тим не менш, автори визнають, що це не представляє собою остаточну теорію щодо того, чому використання емоджі може так ефективно обходити фільтри змісту в мовних моделях. Вони заявляють:
‘Моделі можуть розпізнавати зловмисну інтент, виражену емоджі, проте те, як це обходить безпекові механізми, залишається неясним.’
Слабкість може походити від орієнтованого на текст дизайну фільтрів змісту, які припускають або буквальний текстовий вхід, або ембеддинги, вірно перетворені на текстові еквіваленти: в обох випадках система покладається на явні токени, які можна зіставити з правилами безпеки.
Для ілюстрації з AI-орієнтованого редагування зображень: коли користувач завантажує зображення NSFW до моделі бачення-мови і запитує модифікації, системи, такі як Adobe Firefly або ChatGPT, використовують CLIP-стиль трубопроводів для витягування текстових концепцій із зображення, як попередню умову для редагування. Як тільки ці концепції відтворені у слова, наявність будь-яких обмежених термінів у тих витягнутих словах викличе фільтр, що призведе до відхилення запиту.
Однак, з якоїсь причини, статус емоджі як ні слова, ні зображення (або ж як обидва) здається наділяє його силою трансцендувати фільтрацію; ясно, як автори вказують, подальше дослідження цієї дивної лазейки є бажаним.
Нова робота під назвою When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ Toxicity походила від дев’яти авторів з Університету Цінхуа і Національного університету Сінгапуру.
(На жаль, багато з прикладів, на які посилається робота, знаходяться в додатку, який ще не був опублікований; хоча ми запитали це у авторів, додаток не був наданий на момент написання. Тим не менш, емпіричні результати в основній роботі залишаються гідними уваги.)
Три Основні Інтерпретації Емоджі
Автори виділяють три лінгвістичні особливості, які роблять емоджі ефективними для обходу фільтрів. По-перше, значення емоджі залежать від контексту. Наприклад, емоджі «Гроші з Крилами» офіційно визначається як представлення грошових переказів або витрат; однак залежно від оточуючого тексту, воно також може імплікувати як легальну, так і незаконну діяльність:

У частковому ілюстрації з нової роботи, ми бачимо, що популярний емоджі може мати своє значення захоплено змінено або підірвано у популярному використанні Це ефективно надає емоджі офіційний паспорт до семантичного простору, і приховану вантаж токсичного змісту, який можна використати, як тільки він проходить фільтри.
По-друге, емоджі можуть змінити тон запиту. Їхнє присутність часто додає легковажність або іронію, пом’якшуючи емоційний реєстр. У шкідливих запитах це може зробити запит схожим на жарт або гру, заохочуючи модель відповісти, а не відхилити:

Легковажний ефект емоджі може дезінтоксувати тон без дезінтоксикації інтенту.
По-третє, робота стверджує, емоджі є мово-агностичними: один емоджі може нести той же самий зміст через англійську, китайську, французьку та інші мови. Це робить їх ідеальними для багатомовних запитів, зберігаючи зміст навіть коли оточуючий текст перекладається:

Емоджі «Зламане Серце» передає універсальне повідомлення, можливо, не в останню чергу тому, що воно представляє базовий випадок у людській природі, відносно імунний до національних або культурних відмінностей.
Підхід, Дані та Тести*
Дослідники створили модифіковану версію набору даних AdvBench, переписав шкідливі запити, щоб включити емоджі або як заміну для чутливих слів, або як декоративний камуфляж. AdvBench охоплює 32 високоризикові теми, включаючи бомбардування, хакінг і вбивство, серед інших:

Оригінальні приклади з AdvBench, ілюструючи, як один шкідливий запит може обійти безпекові заходи в кількох великих чат-ботах, викликаючи шкідливі інструкції, незважаючи на навчання з вирівнюванням.
Всі 520 оригінальних екземплярів AdvBench були змінені таким чином, з використанням верхніх 50 токсичних і некопійованих запитів у всіх експериментах. Запити також перекладалися кількома мовами і тестувалися на семи великих закритих і відкритих моделях, а також у поєднанні з відомими ефективними методами обходу Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); і DeepInception.
Закриті моделі, які використовувалися, були Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; і Gemini-1.5-pro. Відкриті моделі, які використовувалися, були Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Команда 2024b); і Qwen2.5-72B-Instruct (Команда 2024a), з усіма експериментами, повтореними тричі, щоб врахувати випадковість.
Дослідження спочатку перевірило, чи збільшить переписування шкідливих запитів з AdvBench за допомогою емоджі токсичний вихід, включаючи переклади на інші великі мови. Крім того, воно застосувало той же метод редагування емоджі до запитів з відомих методів обходу (PAIR, TAP і DeepInception), щоб побачити, чи може заміщення емоджі ще більше покращити їхній успіх.
У обох випадках структура оригінальних запитів зберігалася, з заміною тільки чутливих термінів на емоджі і додаванням декоративних елементів для маскування інтенту.
Для тестових метрик автори створили систему оцінювання під назвою GPT-Judge. У цьому складі GPT-4o не був моделлю, яка тестувалася, а радше була запрошена діяти як оцінювач, призначуючи числовий Шкідливий Бал (HS) відповідям, згенерованим іншими моделями.
Кожен вихід був оцінений від одного (безшкідливий) до п’яти (екстремально шкідливий), і відсоток відповідей, які отримали п’ять, був повідомлений як Коефіцієнт Шкідливості (HR).
Щоб запобігти моделям переходу до пояснень емоджі замість явної відповіді, дослідники додали інструкцію до кожного запиту, наказуючи моделі зробити свою відповідь короткою:

Результати з емоджі-основаних запитів у «Налаштуванні-1», з порівняннями з варіантами видалення емоджі або їх заміни словами.
У таблиці вище автори відзначають† , що підхід з заміщенням емоджі перевершує попередні методи обходу, як описано в додатковій таблиці результатів нижче:

Результати Коефіцієнта Шкідливості для емоджі-авгментованих запитів обходу в «Налаштуванні-2», з іменами моделей у скороченій формі.
Перша з двох таблиць вище, автори стверджують, також вказує на те, що ефект емоджі поширюється на мови. Коли текстові компоненти емоджі-запитів перекладалися на китайську, французьку, іспанську та російську, шкідливі виходи залишилися високими; оскільки ці мови є мовах з високими ресурсами, результати свідчать про те, що ризик не обмежується англійською, а поширюється на основні групи користувачів, з емоджі, що функціонують як перехідний канал для токсичного генерування.
Наприкінці статті дослідники припускають, що ефект емоджі не є просто випадковим, а корениться в тому, як моделі обробляють їх, відзначаючи, що моделі можуть розпізнавати шкідливе значення емоджі – проте відповіді про відхилення придушуються, коли емоджі присутні.
Дослідження токенізації далі свідчать про те, що емоджі зазвичай розбиваються на рідкі або нерегулярні фрагменти з малим перекриттям з їхніми текстовими еквівалентами, ефективно створюючи альтернативний канал для шкідливої семантики.
Підглядаючи за межі механіки моделей, робота далі досліджує дані попереднього навчання, виявляючи, що багато часто вживаних емоджі з’являються в токсичних контекстах, таких як порнографія, шахрайство або азартні ігри. Автори стверджують, що це повторне виставлення може нормалізувати асоціацію між емоджі та шкідливим змістом, заохочуючи моделі відповідати на шкідливі запити, а не блокувати їх.
Разом ці висновки свідчать про те, що як внутрішні особливості обробки, так і упереджені дані попереднього навчання сприяють несподіваній ефективності емоджі в обході заходів безпеки.
Висновок
Не рідко використовуються альтернативні методи введення для спроби обходу LLM. Наприклад, у останні роки шістнадцятковий кодування було використано для обходу фільтрів ChatGPT. Проблема, здається, полягає у плоскому використанні текстової мови для кваліфікації вхідних запитів і вихідних відповідей.
У випадку з емоджі, прихований центр порушень правил може бути введений у дискурс без покарання чи втручання, оскільки метод передачі є неортодоксальним. Хто б міг подумати, що CLIP-стильне транслітерування буде втручатися у всі завантаження зображень, так що образливі або порушувальні матеріали будуть закінчуватися у флагованих текстах.
Очевидно, що це не так, принаймні, щодо великих LLM, які вивчалися; їхні лінгвістичні бар’єри здаються крихкими і орієнтованими на текст. Можна уявити, що більш широке тлумачення змісту (наприклад, вивчення активацій теплової карти) має обробний і/або пропускний витрат, який може зробити такий підхід недоцільно дорогим, серед інших можливих обмежень і розгляжень.
* Макет цієї статті є хаотичним порівняно з більшістю, з методологією і тестами, які не чітко розмежовані. Ми зробили все можливе, щоб представити основну цінність роботи якомога краще в цих обставинах.
† У визнаному майже непроникному і заплутаному трактуванні результатів.
Перша публікація середи, 17 вересня 2025 року












