Погляд Anderson
‘Нісенітниця’ – мова, яка може обійти системи модерації синтезу зображень

Нові дослідження Колумбійського університету свідчать, що заходи безпеки, які запобігають моделям синтезу зображень, таким як DALL-E 2, Imagen і Parti, від генерації шкідливих або суперечливих зображень, вразливі до певного типу атак, що включають “вигадані” слова.
Автор розробив два підходи, які потенційно можуть обійти заходи модерації контенту в системі синтезу зображень, і виявилося, що вони досить стійкі навіть у різних архітектурах, що вказує на те, що слабкість не тільки системна, а й може бути пов’язана з деякими фундаментальними принципами текстово-зображеневого синтезу.
Перший, і найсильніший з них, називається макаронічним промптінгом. Термін “макаронічний” спочатку відносився до суміші декількох мов, як у есперанто або унвінезі. Можливо, найбільш культурно поширений приклад буде урду-англійська, тип “код-міксінгу”, поширений у Пакистані, який досить вільно змішує англійські іменники та урду-суфікси.
У деяких з вищезазначених прикладів частини значимих слів були склеєні разом, використовуючи англійську мову як “каркас”. Інші приклади в статті використовують декілька мов у одному промпті.
Система відповідає семантично значимим чином через відносну відсутність кураторства веб-джерел, на яких була навчена система. Такі джерела часто мають мультимовні мітки (тобто з наборів даних, не призначених конкретно для завдань синтезу зображень), і кожне слово, яке було поглинено, незалежно від мови, стає “токеном”; однак частини цих слів також стають “субсловами” або дробовими токенами. У обробці природної мови такий “стемінг” допомагає відрізнити етимологію довших похідних слів, які можуть виникнути в операціях перетворення, але також створює величезний лексичний “конструктор”, який можна використовувати для “креативного” промптінгу.
У другому підході, який називається евокаційним промптінгом, деякі з цих слів схожі на тон шкільної латини, продемонстрованої в “Монті Пайтонівському житті Брайана” (1979).
Автор стверджує, що очевидною проблемою з цим методом є обхід фільтрів контенту на основі чорних списків промптів. У принципі, макаронічний промптінг міг би надати легкий і, здавалося б, надійний спосіб обійти такі фільтри для генерації шкідливого, образливого, незаконного або іншого чутливого контенту, включаючи насильницькі, ненависні, расистські, сексистські або порнографічні зображення, і, можливо, зображення, які порушують права інтелектуальної власності або зображують реальних осіб.
Компанії, які пропонують генерацію зображень як послугу, доклали багато зусиль, щоб запобігти генерації такого контенту згідно зі своєю політикою контенту. Отже, макаронічний промптінг повинен бути систематично досліджений як загроза протоколам безпеки, використовуваним для комерційної генерації зображень.
Автор пропонує кілька засобів проти цієї вразливості, деякі з яких він вважає надмірно обмежувальними.
Перший можливий розв’язок – найдрагший: ретельніше кураторство джерел навчання зображень, з більшим людським і менше алгоритмічним наглядом. Однак стаття зазначає, що це не запобіжить системі синтезу зображень створювати образливий зв’язок між двома концепціями зображень, які самі по собі потенційно безневинні.
Другим можливим розв’язком є те, що системи синтезу зображень могли б проходити свій фактичний вивід через систему фільтрів, перехоплюючи будь-які проблемні асоціації, перш ніж вони будуть надані користувачеві. Можливо, DALL-E 2 вже використовує такий фільтр, хоча OpenAI не розкрила точно, як працює модерація контенту в DALL-E 2.
Нарешті, автор розглядає можливість “словникового білого списку”, який би дозволяв лише перевірені та затверджені слова для отримання та відтворення концепцій, але зазначає, що це міг би бути надмірно суворим обмеженням на корисність системи.
Хоча дослідник експериментував лише з п’ятьма мовами (англійською, німецькою, французькою, іспанською та італійською) при створенні промпт-асамблей, він вважає, що такий “адверсарний атак” міг би стати ще більш “криптичним” і важким для запобігання шляхом розширення кількості мов, оскільки гіпермасштабні моделі, такі як DALL-E 2, тренуються на декількох мовах (просто тому, що легше використовувати слабкофільтровані або “сирі” дані, ніж розглянути величезні витрати на їх кураторство, і тому, що додаткова розмірність, ймовірно, додасть корисності системі).
Стаття називається “Адверсарні атаки на генерацію зображень з вигаданими словами” і походить від Рафаеля Мілльєра з Колумбійського університету.
Криптична мова в DALL-E 2
Було запропоновано раніше, що безглуздість, яку DALL-E 2 виводить, коли намагається зобразити написану мову, могла б сама по собі бути “прихованим словником”. Однак попередні дослідження цієї таємничої мови не пропонували жодного способу розробити “nonce-строки”, які можуть викликати конкретні зображення.
З попередньої роботи стаття зазначає:
“[Це] не пропонує надійного методу для пошуку nonce-строк, які викликають конкретні зображення. Більшість безглуздого тексту, включеного в DALL-E 2 до зображень, не здається надійно пов’язаним із конкретними візуальними концепціями, коли транскрибується та використовується як промпт. Це обмежує життєздатність цього підходу як способу обійти модерацію шкідливого або образливого контенту; як такий, це не особливо небезпечний ризик для зловживання моделями текстово-зображеневого синтезу”.
Натомість два методи автора роз’яснюються як засоби, за допомогою яких безглуздість може викликати пов’язані та значимі зображення, обходячи звичайний етикет, який зараз розвивається у “інженерії промптів”.
Лінгва Франка
Стаття також спостерігає, що декілька таких прикладів працюють майже однаково, або принаймні дуже схоже, як у DALL-E 2, так і в DALL-E Mini (тепер Craiyon), і що це дивно, оскільки DALL-E 2 – це дифузійна модель, а DALL-E Mini – ні; дві системи тренуються на різних наборах даних; і DALL-E Mini використовує токенізацію BART замість токенізації CLIP, яку віддає перевагу DALL-E 2.
Як видно на першому з зображень вище, макаронічний промптінг також можна скласти у синтаксично правильні речення для генерації більш складних сцен. Однак це вимагає використання англійської мови як “каркаса” для збірки концепцій, що робить процедуру більш ймовірною для перехоплення стандартними системами цензурування у рамках синтезу зображень.
Стаття зазначає, що лексична гібридизація, “склеювання” слів для викликання пов’язаного контенту з системи синтезу зображень, також можна здійснити в одній мові за допомогою портоманто-слів.
Евокаційний промптінг
Підхід “евокаційного промптінгу”, представлений у статті, залежить від “евокування” ширшої реакції системи словами, які не строго засновані на субсловах, субтокенах або частково спільних мітках.
Один із типів евокаційного промптінгу – псевдолатина, який може, серед іншого, генерувати зображення вигаданих ліків, навіть без жодної вказівки на те, що DALL-E 2 повинна отримати концепцію “лікарства”:
Евокаційний промптінг також працює особливо добре з безглуздими промптами, які стосуються можливих географічних місць, і працює досить надійно у різних архітектурах DALL-E 2 і DALL-E Mini:
Здається, що існує деяка взаємозв’язок між макаронічним і евокаційним промптінгом. Стаття зазначає:
“Здається, що відмінності у тренувальних даних, розміру моделі та архітектури моделі можуть спричинити те, що різні моделі розбивають промпти типу voiscellpajaraux і eidelucertlagarzard або у “макаронічному”, або у “евокаційному” стилі, навіть якщо ці моделі доведено, що реагують на обидва методи промптінгу”.
Стаття завершується висновком:
“Хоча різні властивості цих моделей – включаючи розмір, архітектуру, процедуру токенізації та тренувальні дані – можуть впливати на їх уразливість до текстово-заснованих атак, попередні дані, обговорені в цій роботі, свідчать про те, що деякі з цих атак можуть працювати досить надійно у різних моделях”.
Аргументовано найбільшим перешкодою для справжніх експериментів щодо цих методів є ризик бути прапорцем і забаненим господарською системою. DALL-E 2 вимагає асоційованого номеру телефону для кожного користувача, обмежуючи кількість “бурних аккаунтів”, які, ймовірно, будуть потрібні для справжнього тестування меж цього типу лексичного хакінгу, щодо обходу існуючих методів модерації. Наразі основним засобом захисту DALL-E 2 залишається волатильність доступу.
Перше опубліковано 9 серпня 2022 року.












