Взгляд Anderson
“Бессмысленный язык”, который может обойти системы модерации синтеза изображений

Новые исследования Колумбийского университета показывают, что механизмы, которые предотвращают возможность генерации вредоносных или противоречивых изображений в моделях синтеза изображений, таких как DALL-E 2, Imagen и Parti, уязвимы для определенного типа атак, включающих “сделанные” слова.
Автор разработал два подхода, которые потенциально могут обойти меры модерации контента в системе синтеза изображений, и обнаружил, что они удивительно устойчивы даже в разных архитектурах, что указывает на то, что слабость не только системная, но и может быть связана с фундаментальными принципами текст-изображение синтеза.
Первый подход, называемый “макароническим промптингом”, включает в себя использование слов, которые представляют собой смесь нескольких языков, таких как Эсперанто или Унвинский язык. Например, можно использовать смесь английских и урду-суффиксов, что является распространенным явлением в Пакистане.
В некоторых примерах части осмысленных слов склеены вместе, используя английский как “скелет”. Другие примеры в статье используют несколько языков в одном промпте.
Система будет реагировать осмысленным образом из-за относительной неосмотрительности веб-источников, на которых была обучена система. Такие источники часто имеют многоязычные метки (т.е. из наборов данных, не предназначенных специально для задачи синтеза изображений), и каждое слово, проглоченное системой, становится “токеном”; но также части этих слов становятся “субсловами” или дробными токенами.
В обработке естественного языка (NLP) этот тип “стемминга” помогает различать этимологию более длинных производных слов, которые могут возникнуть в операциях преобразования, но также создает огромный лексический “набор Лего”, который “креативный” промптинг может использовать.

Монолингвальные портоменто-слова также эффективны в получении изображений через косвенный или не-прозаический язык, с очень похожими результатами, часто получаемыми в разных архитектурах, таких как DALL-E 2 и DALL-E Mini (Craiyon).
Во втором подходе, называемом “эвокативным промптингом”, некоторые из соединенных слов похожи по тону на более юношескую линию “школьного латинского” языка, продемонстрированного в “Жизни Брайана” (1979).
Автор заявляет:
“Очевидная проблема с этим методом заключается в обходе фильтров контента на основе черных списков. В принципе, макаронический промптинг может обеспечить легкий и, казалось бы, надежный способ обойти такие фильтры, чтобы сгенерировать вредоносный, оскорбительный, незаконный или иной чувствительный контент, включая насильственные, ненавистные, расистские, сексистские или порнографические изображения, и, возможно, изображения, нарушающие интеллектуальную собственность или изображающие реальных людей.
“Компании, которые предлагают генерацию изображений как услугу, много заботятся о предотвращении генерации таких выходных данных в соответствии со своей политикой контента. Следовательно, макаронический промптинг должен быть систематически расследован как угроза протоколам безопасности, используемым для коммерческой генерации изображений.”
Автор предлагает ряд мер против этой уязвимости, некоторые из которых он признает слишком ограничительными.
Первое возможное решение – самое дорогое: тщательно курировать исходные обучающие изображения, с большим человеческим и меньшим алгоритмическим надзором. Однако статья признает, что это не предотвратит возможность синтеза системы создать оскорбительное соединение между двумя понятиями изображений, которые сами по себе потенциально безобидны.
Вторым возможным решением является то, что системы синтеза изображений могут запускать свои фактические выходные данные через систему фильтров, перехватывая любые проблемные ассоциации до того, как они будут представлены пользователю. Возможно, что DALL-E 2 в настоящее время работает с таким фильтром, хотя OpenAI не раскрыла точно, как работает модерация контента DALL-E 2.
Наконец, автор рассматривает возможность “словарного белого списка”, который позволит только проверенным и одобренным словам извлекать и отображать понятия, но признает, что это может представлять собой чрезмерно суровое ограничение на полезность системы.
Хотя исследователь экспериментировал только с пятью языками (английским, немецким, французским, испанским и итальянским) при создании сборок промптинга, он считает, что этот тип “адверсарной атаки” может стать еще более “криптическим” и трудным для предотвращения путем расширения количества языков, учитывая, что гипермасштабные модели, такие как DALL-E 2, обучаются на нескольких языках.
Статья под названием “Адверсарные атаки на генерацию изображений с помощью придуманных слов” написана Raphaël Millièrem в Колумбийском университете.
Криптический язык в DALL-E 2
Было ранее предложено, что бессмысленный текст, который DALL-E 2 выводит всякий раз, когда он пытается изобразить письменный язык, может сам по себе быть “скрытым словарем”. Однако предыдущие исследования этого загадочного языка не предложили способ разработки “nonce-строк”, которые могут вызвать конкретные изображения.
Из предыдущих работ статьи говорится:
“[Это] не предлагает надежный метод найти nonce-строки, которые вызывают конкретные изображения. Большинство бессмысленного текста, включенного DALL-E 2 в изображениях, не кажется надежно связанным с конкретными визуальными понятиями, когда транскрибируется и используется как промпт. Это ограничивает жизнеспособность этого подхода как способ обхода модерации вредоносного или оскорбительного контента; как таковое, это не является особенно тревожным риском для злоупотребления текст-управляемыми моделями генерации изображений.”
Вместо этого два метода автора описаны как средства, с помощью которых бессмысленность может вызвать связанные и осмысленные изображения, обходя обычный этикет, который сейчас развивается в “инжиниринг промптинга”.
Например, автор рассматривает слово для “птиц” в пяти языках, которые находятся в области статьи: Vögel на немецком, uccelli на итальянском, oiseaux на французском, и pájaros на испанском.
С помощью байтовой парной кодировки (BPE) токенизации, используемой в реализации CLIP, интегрированной в DALL-E 2, слова токенизируются в неакцентированный английский и могут быть “креативно объединены”, чтобы образовать nonce-слова, которые кажутся бессмысленными для нас, но сохраняют свое склеенное значение для DALL-E 2, позволяя системе выражать воспринимаемый замысел:
В вышеприведенном примере два “иностранных” слова для птицы склеены в бессмысленную строку. Благодаря дробному весу субслов, значение сохраняется.
Автор подчеркивает, что осмысленные результаты также могут быть получены без соблюдения границ субсловной сегментации, вероятно, потому что DALL-E 2 (основная тема статьи) обобщил достаточно хорошо, чтобы позволить границам субслов размыться без разрушения их значения.
Чтобы дальше продемонстрировать разработанные подходы, статья предлагает примеры макаронического промптинга в разных областях, используя список токен-слов, проиллюстрированный ниже (с бессмысленными гибридными словами справа).
Автор заявляет, что следующие примеры из DALL-E 2 не “выбраны”:
Лингва франка
Статья также отмечает, что несколько таких примеров работают одинаково хорошо, или хотя бы очень похоже, как в DALL-E 2, так и в DALL-E Mini (теперь Craiyon), и что это удивительно, поскольку DALL-E 2 – это модель диффузии, а DALL-E Mini – нет; две системы обучены на разных наборах данных; и DALL-E Mini использует токенизатор BART вместо токенизатора CLIP, предпочитаемого DALL-E 2.

Замечательно похожие результаты из DALL-E Mini, по сравнению с предыдущим изображением, которое показывало результаты из того же ‘бессмысленного’ входа из DALL-E 2.
Как видно на первом из изображений выше, макаронический промптинг также может быть собран в синтаксически правильные предложения, чтобы сгенерировать более сложные сцены. Однако это требует использования английского как “скелета”, чтобы собрать понятия, что делает процедуру более вероятной для перехвата стандартными системами цензуры в рамках синтеза изображений.
Статья отмечает, что лексическая гибридизация, “склеивание” слов, чтобы вызвать связанный контент из системы синтеза изображений, также может быть выполнена в одном языке, используя портоменто-слова.
Эвокативный промптинг
Подход “эвокативного промптинга”, представленный в статье, зависит от “вызывания” более широкого ответа от системы словами, которые не строго основаны на субсловах или частично общих метках.
Один тип эвокативного промптинга – псевдолатынь, который может, среди прочего, генерировать изображения вымышленных лекарств, даже без указания на то, что DALL-E 2 должен извлечь понятие “лекарства”:
Эвокативный промптинг также работает особенно хорошо с бессмысленными промптами, которые относятся к возможным географическим местам, и работает довольно надежно в разных архитектурах DALL-E 2 и DALL-E Mini:

Слова, используемые для этих промптов к DALL-E 2 и DALL-E Mini, напоминают реальные названия, но сами по себе являются полным бессмыслом. Тем не менее, системы ‘восприняли атмосферу’ слов.
Кажется, что существует некоторое пересечение между макароническим и эвокативным промптингом. Статья заявляет:
“Похоже, что различия в наборах данных, размерах моделей и архитектурах моделей могут вызвать разную интерпретацию промптов, таких как voiscellpajaraux и eidelucertlagarzard, в ‘макароническом’ или ‘эвокативном’ стиле, даже когда эти модели доказали свою чувствительность к обоим методам промптинга.”
Статья заключает:
“Хотя различные свойства этих моделей – включая размер, архитектуру, процедуру токенизации и наборы данных – могут влиять на их уязвимость к текстовым адверсарным атакам, предварительные данные, обсуждаемые в этой работе, предполагают, что некоторые из этих атак могут работать достаточно надежно в разных моделях.”
Возможно, что самой большой проблемой для истинного экспериментирования вокруг этих методов является риск быть помеченным и заблокированным хост-системой. DALL-E 2 требует ассоциированного номера телефона для каждого учетной записи, ограничивая количество “сжигаемых” учетных записей, которые, вероятно, потребуются для истинного тестирования границ этого типа лексического хакинга, в плане обхода существующих методов модерации. В настоящее время основной механизм защиты DALL-E 2 остается волатильностью доступа.
Опубликовано впервые 9 августа 2022 года.


















