Моделі та платформи ШІ
Що таке поетична атака? Новий метод обходу системи безпеки штучного інтелекту
Безпека штучного інтелекту (ШІ) перетворилася на постійну гру в кота і мишку. Коли розробники додають засоби безпеки для блокування шкідливих запитів, нападники продовжують шукати нові способи їх обходу. Одним із най дивніших поворотів є поетична атака. Ця тактика полягає у маскуванні запитів у вигляді вірша та використанні рими, метафори та незвичайної структури для того, щоб небезпечні інструкції виглядали менш небезпечними для систем безпеки.
На практиці сам контент майже не змінюється. Змінюється лише оболонка, яка може бути достатньо для того, щоб заплутати фільтри, засновані на визнанні закономірностей. Це нагадування про те, що у сучасних моделях спосіб формулювання запитів може бути майже таким же важливим, як і сам запит.
Що відбулося, коли дослідники використали вірші для обходу системи безпеки ШІ?
На початку 2025 року дослідники продемонстрували, що великі мовні моделі (ВММ) можуть бути спровоковані на відповідь на заборонені запити, якщо їх обернути у поетичну форму. Замість прямого формулювання інструкцій, які спрацьовують систему безпеки, дослідники вкладали ті самі запити у рими, метафори та оповідальні вірші.
На поверхні запити виглядали як творчі завдання, але під поверхнею вони несли ту саму інтентію, яку зазвичай блокують. Серед 25 моделей, які використовувались у дослідженні, команда повідомила, що поетичне оформлення досягло середнього успіху у 62% для рукописних віршів і близько 43% для масового «перетворення у вірші» за допомогою стандартизованого мета-запиту. Відповіді самих по собі не були новими видами провалів, а знайомими провалами, які відбувалися через несподіваний канал. Моделі були спровоковані на генерацію контенту, який вони зазвичай уникають — наприклад, пояснення, що торкаються незаконної або шкідливої діяльності — через те, що основний запит був фрагментований і маскований поетичною структурою.
Основний висновок дослідження полягає у тому, що стилістична варіація сама по собі може бути достатньо для обходу систем безпеки, налаштованих на більш буквальне формулювання. Це відкриває уразливість, яка є очевидною у всіх сімейств моделей і підходів до виравнювання.
Як працює поетична атака
Атаки, засновані на противостоянні, використовують просту реальність — системи машинного навчання не «розуміють» мову так, як люди. Вони визнають закономірності, передбачають ймовірні продовження і виконують інструкції на основі того, як їхнє тренування і шари безпеки інтерпретують інтент.
Коли запит формулюється прямим і буквальним чином, його легше розпізнати і заблокувати системам безпеки. Однак, коли та сама мета маскується — розділяється, пом’якшується або переформульовується — захисні шари можуть пропустити те, що насправді запитується.
Чому поезія може бути ефективним засобом
Поезія природно побудована на двозначності. Вона використовує метафору, абстракцію, незвичайну структуру і непряме формулювання. Це саме ті риси, які можуть розмитити межу між «безпечним творчим письмом» і «запитом, який слід відмовити».
У тому самому дослідженні 2025 року дослідники повідомили, що поетичні запити викликали небезпечні відповіді у 90% випадків серед широкого спектра моделей, вказуючи на те, що стиль сам по собі може суттєво змінити результати.
Як вірш маскує справжній запит
Розгляньте запит як повідомлення, а вірш — як упаковку. Системи безпеки часто шукають очевидні ознаки, такі як явні ключові слова, прямий крок-за-кроком формулярій або впізнаваний злий намір.
Поезія може маскувати цей намір через фігуральне мовлення або розкидати його по рядках, роблячи його важче виявити в ізоляції. Тим часом основна модель все одно реконструює значення досить добре, щоб відповісти, оскільки вона оптимізована для висновку наміру навіть тоді, коли мова є непрямою.
Виявлення і мінімізація обходів системи безпеки
Когда методи обходу стають все більш творчими, розмова повинна перейти від того, як вони працюють, до того, як їх виявляти і мінімізувати. Це особливо важливо зараз, коли ШІ є частиною щоденних рутин для багатьох людей, оскільки 27% повідомили про використання його кілька разів на день.
Когда все більше людей використовують великі мовні моделі (ВММ), додаткові засоби безпеки повинні бути протестовані та досліджені. Це завдання полягає у створенні шарових захистів, які можуть адаптуватися до нових стилів запитів і трюків обходу, коли вони з’являються.
Ділема розробника
Найважчою частиною обходів системи безпеки для команд безпеки ШІ є те, що вони не приходять у вигляді однієї відомої загрози. Вони безперервно змінюються з часом. Ця постійна зміна відбувається через те, що користувач може переформулювати запит, розділити його на фрагменти, обернути у рольову гру або маскувати його під творче письмо. Потім кожна нова упаковка може змінити, як система інтерпретує намір запиту.
Ця проблема швидко зростає, коли ШІ вже інтегрований у щоденні рутини, тому фактичне використання створює безліч можливостей для появи крайніх випадків.
Тому сьогодні система безпеки ШІ виглядає більше як управління ризиком у часі. Рамка управління ризиком ШІ NIST (AI RMF) явно розглядає управління ризиком як сукупність безперервних дій — організованих навколо керування, мапування, вимірювання і управління — а не як статичний чекліст. Метою є створення процесів, які полегшують виявлення нових режимів провалів, пріоритизацію виправлень і зміцнення засобів безпеки, коли з’являються нові стилі обходу.
Як моделі захищають себе
Система безпеки ШІ складається з декількох шарів. Більшість систем мають більше одного захисту, який працює разом, з кожним, який ловить різні види ризикової поведінки. На зовнішньому шарі фільтрація входу і виходу діє як охоронець.
Вхідні запити скануються на порушення політики перед тим, як вони досягнуть основної моделі, тоді як вихідні відповіді перевіряються, щоб нічого не прослизнуло на зворотному шляху до користувача. Ці системи добре працюють на виявлення прямих запитів або знайомих червоних прапорів, але вони також є найлегше обходними, тому часто обходять їх.
Наступний рівень захисту відбувається всередині самої моделі. Коли техніки обходу виявляються, вони часто перетворюються у тренувальні приклади. Саме тут вступають у гру тренування з супротивом і навчання з людською відгуком (RLHF).
Файно налаштовуючи моделі на приклади провальних або ризикових взаємодій, розробники ефективно вчать систему розпізнавати закономірності, які вона повинна відмовити, навіть коли вони обернуті у творчу або непряму мову. З часом цей процес допомагає інокулювати модель проти цілих класів атак.
Роль «червоних команд» ШІ
Натомість ніж чекати, коли обхід відбувається, компанії використовують «червоні команди» ШІ. Ці команди — це групи, завданням яких є спроба обходити моделі у контрольованих середовищах. Вони підходять до систем так, як це зробив би нападник, експериментуючи з незвичайним формулюванням, творчими форматами та крайніми випадками, щоб виявити, де засоби безпеки слабкі.
«Червоне командування» зараз стає важливою частиною життєвого циклу розробки у сучасних стратегіях кібербезпеки. Коли команда виявляє новий метод обходу, отримані дані безпосередньо повертаються у тренувальні та оціночні канали. Ці дані використовуються для визначення фільтрів,调整 політики та зміцнення тренування з супротивом, щоб подібні спроби були менш ймовірними у майбутньому. З часом це створює безперервний цикл — пошук провалів, навчання на них і поліпшення системи, потім повтор.
Коли поезія стає стрес-тестом для безпеки ШІ
Поетична атака нагадує про те, що засоби безпеки ШІ залежать не лише від того, що запитується, а й від того, як запитується. Коли моделі стають все більш доступними і широко використовуваними, дослідники продовжуватимуть шукати прогалини між творчою мовою і системами безпеки, призначеними для виявлення більш прямого наміру. Висновок полягає у тому, що безпечніший ШІ буде досягнутий за допомогою多ших захистів, які еволюціонують так само швидко, як і обходи.












