Взгляд Anderson

«Защищенные» изображения легче, а не труднее, украсть с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google
A shadowy man steals into an art gallery as the guard sleeps. Krita/Flux-1 Dev + Firefly

Новые исследования показывают, что инструменты водяных знаков, предназначенные для блокировки редактирования изображений ИИ, могут иметь обратный эффект. Вместо того, чтобы останавливать модели, такие как Stable Diffusion, от внесения изменений, некоторые защиты на самом деле помогают ИИ следовать редакторским подсказкам более точно, что делает нежелательные манипуляции еще более легкими.

 

Существует заметный и прочный раздел в литературе по компьютерному зрению, посвященный защите авторских изображений от обучения в модели ИИ или использования в прямых процессах ИИ для изображений. Системы этого типа в целом направлены на латентные модели диффузии (LDM), такие как Stable Diffusion и Flux, которые используют шумовые процедуры для кодирования и декодирования изображений.

Вставив враждебный шум в иначе нормальные изображения, можно заставить детекторы изображений неправильно угадать содержание изображения и помешать системам генерации изображений использовать авторские данные:

Из статьи MIT 'Raising the Cost of Malicious AI-Powered Image Editing', примеры исходного изображения, 'иммунизированного' против манипуляций (нижний ряд). Источник: https://arxiv.org/pdf/2302.06588

Из статьи MIT ‘Raising the Cost of Malicious AI-Powered Image Editing’, примеры исходного изображения, ‘иммунизированного’ против манипуляций (нижний ряд). Источник: https://arxiv.org/pdf/2302.06588

С тех пор, как в 2023 году произошел ответ художников на свободное использование Stable Diffusion веб-скрапированных изображений (включая авторские изображения), исследовательская сцена произвела множество вариаций на одну и ту же тему – идею о том, что изображения можно невидимо «отравить» против обучения в модели ИИ или использования в генеративных процессах ИИ, не ухудшая при этом качество изображения для среднего зрителя.

Во всех случаях существует прямая корреляция между интенсивностью наложенного вмешательства, степенью защиты изображения и степенью, в которой изображение не выглядит совсем так, как должно:

Хотя качество исследовательской статьи не полностью иллюстрирует проблему, большие количества враждебных вмешательств жертвуют качеством ради безопасности. Здесь показано разнообразие нарушений качества в проекте 'Fawkes' 2020 года под руководством Университета Чикаго. Источник: https://arxiv.org/pdf/2002.08327

Хотя качество исследовательской статьи не полностью иллюстрирует проблему, большие количества враждебных вмешательств жертвуют качеством ради безопасности. Здесь показано разнообразие нарушений качества в проекте ‘Fawkes’ 2020 года под руководством Университета Чикаго. Источник: https://arxiv.org/pdf/2002.08327

Особенно интересно для художников, стремящихся защитить свой стиль от несанкционированного использования, является способность таких систем не только замаскировать идентификатор и другую информацию, но и «убедить» процесс обучения ИИ, что он видит что-то другое, чем на самом деле видит, чтобы не образовались связи между семантическими и визуальными доменами для «защищенных» данных обучения (т.е. подсказка, такая как ‘В стиле Пауля Клее’).

Mist и Glaze – два популярных метода инъекции, способных предотвратить или, по крайней мере, сильно препятствовать попыткам использовать авторские стили в рабочих процессах и обучающих процедурах ИИ. Источник: https://arxiv.org/pdf/2506.04394

Mist и Glaze – два популярных метода инъекции, способных предотвратить или, по крайней мере, сильно препятствовать попыткам использовать авторские стили в рабочих процессах и обучающих процедурах ИИ. Источник: https://arxiv.org/pdf/2506.04394

Собственный гол

Теперь новые исследования в США показали, что не только вмешательства могут не защитить изображение, но и добавление вмешательства может фактически улучшить возможность эксплуатации изображения во всех процессах ИИ, против которых вмешательство должно было защищать.

В статье говорится:

‘В наших экспериментах с различными методами защиты на основе вмешательств через несколько доменов (изображения природных сцен и произведений искусства) и задач редактирования (генерация изображения из изображения и редактирование стиля), мы обнаружили, что такая защита не достигает этой цели полностью.

‘В большинстве сценариев редактирование диффузионных изображений защищенных изображений генерирует желаемое выходное изображение, которое точно соответствует руководящей подсказке.

‘Наши результаты показывают, что добавление шума к изображениям может парадоксально увеличить их связь с заданными текстовыми подсказками во время процесса генерации, что приводит к непредвиденным последствиям, таким как лучшие результаты редактирования.

‘Следовательно, мы утверждаем, что методы на основе вмешательств могут не обеспечить достаточного решения для надежной защиты изображений от редактирования на основе диффузии.’

В тестах защищенные изображения подвергались двум знакомым сценариям редактирования ИИ: прямой генерации изображения из изображения и переносу стиля. Эти процессы отражают обычные способы, которыми модели ИИ могут эксплуатировать защищенный контент, либо直接 изменяя изображение, либо заимствуя его стилистические черты для использования в другом месте.

Защищенные изображения, взятые из стандартных источников фотографий и произведений искусства, были обработаны через эти конвейеры, чтобы увидеть, могут ли добавленные вмешательства блокировать или ухудшать редактирование.

Вместо этого присутствие защиты часто казалось, что оно усиливает соответствие модели с подсказками, производя чистые, точные выходные данные, где ожидался какой-то сбой.

Авторы советуют, по сути, что этот очень популярный метод защиты может обеспечить ложное чувство безопасности, и что любой такой подход к защите на основе вмешательств должен быть тщательно протестирован против методов авторов.

Метод

Авторы провели эксперименты, используя три метода защиты, которые применяют тщательно разработанные враждебные вмешательства: PhotoGuard; Mist; и Glaze.

Glaze, одна из тестируемых авторами рамок. Примеры защиты Glaze для трех художников. Первые два столбца показывают исходные произведения искусства. Третий столбец показывает результаты имитации без защиты. Четвертый столбец показывает стилизованные версии, использованные для оптимизации плаща, вместе с именем целевого стиля. Пятый и шестой столбцы показывают результаты имитации с применением плаща при уровнях вмешательства p = 0,05 и p = 0,1. Все результаты используют модели Stable Diffusion. https://arxiv.org/pdf/2302.04222

Glaze, одна из тестируемых авторами рамок, показывающая примеры защиты Glaze для трех художников. Первые два столбца показывают исходные произведения искусства; третий столбец показывает результаты имитации без защиты; четвертый, стилизованные версии, использованные для оптимизации плаща, вместе с именем целевого стиля. Пятый и шестой столбцы показывают результаты имитации с применением плаща при уровнях вмешательства p = 0,05 и p = 0,1. Все результаты используют модели Stable Diffusion. https://arxiv.org/pdf/2302.04222

PhotoGuard был применен к изображениям природных сцен, а Mist и Glaze – к произведениям искусства (т.е. «художественным» доменам).

Тесты охватывали как природные, так и художественные изображения, чтобы отразить возможные реальные применения. Эффективность каждого метода оценивалась путем проверки того, может ли модель ИИ все еще производить реалистичные и релевантные выходные данные при редактировании защищенных изображений; если полученные изображения казались правдоподобными и соответствовали подсказкам, защита считалась неудавшейся.

Stable Diffusion v1.5 использовался в качестве предварительно обученного генератора изображений для редакторских задач исследователей. Были выбраны пять семян, чтобы обеспечить воспроизводимость: 9222, 999, 123, 66 и 42. Все остальные настройки генерации, такие как масштаб руководства, сила и общее количество шагов, соответствовали значениям по умолчанию, использованным в экспериментах PhotoGuard.

PhotoGuard был протестирован на изображениях природных сцен с использованием набора данных Flickr8k, содержащего более 8 000 изображений, сопряженных с до пяти подписей каждое.

Противоречивые мысли

Были созданы два набора измененных подписей из первой подписи каждого изображения с помощью Claude Sonnet 3.5. Один набор содержал подсказки, которые были контекстно близки к исходным подписям; другой набор содержал подсказки, которые были контекстно далеки.

Например, из исходной подписи ‘Молодая девушка в розовом платье входит в деревянный домик’ близкая подсказка будет ‘Молодой мальчик в синей рубашке входит в кирпичный дом’. Напротив, дальняя подсказка будет ‘Два кота, лежащих на диване’.

Близкие подсказки были построены путем замены существительных и прилагательных на семантически похожие термины; дальние подсказки были сгенерированы путем инструктирования модели создавать подписи, которые были контекстно очень khácными.

Все сгенерированные подписи были проверены вручную на качество и семантическую релевантность. Был использован Универсальный кодировщик предложений Google для расчета семантических сходств между исходными и измененными подписями:

Из дополнительного материала, распределения семантических сходств для измененных подписей, использованных в тестах Flickr8k. График слева показывает значения сходства для близко измененных подписей, в среднем около 0,6. График справа показывает обширно измененные подписи, в среднем около 0,1, отражая большее семантическое расстояние от исходных подписей. Значения были рассчитаны с помощью Универсального кодировщика предложений Google. Источник: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

Из дополнительного материала, распределения семантических сходств для измененных подписей, использованных в тестах Flickr8k. График слева показывает значения сходства для близко измененных подписей, в среднем около 0,6. График справа показывает обширно измененные подписи, в среднем около 0,1, отражая большее семантическое расстояние от исходных подписей. Источник: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

Каждое изображение, вместе с его защищенной версией, было отредактировано с помощью как близких, так и дальних подсказок. Был использован Блинд/Референсный оценщик качества изображения для оценки качества изображения:

Результаты генерации изображения из изображения на природных фотографиях, защищенных PhotoGuard. Несмотря на присутствие вмешательств, Stable Diffusion v1.5 успешно следовал как небольшим, так и большим семантическим изменениям в редакторских подсказках, производя реалистичные выходные данные, соответствующие новым инструкциям.

Результаты генерации изображения из изображения на природных фотографиях, защищенных PhotoGuard. Несмотря на присутствие вмешательств, Stable Diffusion v1.5 успешно следовал как небольшим, так и большим семантическим изменениям в редакторских подсказках, производя реалистичные выходные данные, соответствующие новым инструкциям.

Сгенерированные изображения получили оценку 17,88 по BRISQUE, с 17,82 для близких подсказок и 17,94 для дальних подсказок, в то время как исходные изображения получили оценку 22,27. Это показывает, что отредактированные изображения остались близкими по качеству к исходным.

Метрики

Чтобы оценить, насколько хорошо защиты мешали редактированию ИИ, исследователи измерили, насколько точно окончательные изображения соответствовали инструкциям, которые им были даны, используя системы оценки, которые сравнивали содержание изображения с текстовой подсказкой, чтобы увидеть, насколько хорошо они соответствуют:

Для этого используется метрика CLIP-S, которая использует модель, способную понимать как изображения, так и текст, чтобы проверить, насколько они похожи, в то время как PAC-S++ добавляет дополнительные образцы, созданные ИИ, чтобы выровнять свое сравнение более близко к человеческой оценке:

Эти оценки соответствия изображения и текста (ITA) указывают, насколько точно ИИ следовал инструкциям при изменении защищенного изображения: если защищенное изображение все еще привело к высоко выровненному выходному изображению, это означает, что защита была признана неудавшейся в блокировании редактирования.

Влияние защиты на наборе данных Flickr8k через пять семян, используя как близкие, так и дальние подсказки. Соответствие изображения и текста измерялось с помощью оценок CLIP-S и PAC-S++.

Влияние защиты на наборе данных Flickr8k через пять семян, используя как близкие, так и дальние подсказки. Соответствие изображения и текста измерялось с помощью оценок CLIP-S и PAC-S++.

Исследователи сравнили, насколько хорошо ИИ следовал подсказкам при редактировании защищенных изображений по сравнению с незащищенными. Они сначала посмотрели на разницу между ними, называемую Фактическое изменение. Затем разница была масштабирована, чтобы создать Изменение процента, что делало легче сравнивать результаты по многим тестам.

Этот процесс показал, делают ли защиты редактирование ИИ более трудным или более легким. Тесты были повторены пять раз с использованием разных случайных семян, охватывая как небольшие, так и большие изменения исходных подписей.

Искусственная атака

Для тестов на природных фотографиях использовался набор данных Flickr1024, содержащий более тысячи высококачественных изображений. Каждое изображение редактировалось с помощью подсказок, следующих шаблону: ‘Изменить стиль на [V]’, где [V] представлял один из семи знаменитых стилей искусства: Кубизм; Постимпрессионизм; Импрессионизм; Сюрреализм; Барокко; Фовизм; и Ренессанс.

Процесс включал применение PhotoGuard к исходным изображениям, генерацию защищенных версий и затем запуск как защищенных, так и незащищенных изображений через один и тот же набор стилевых изменений:

Исходное и защищенное изображения природной сцены, каждое отредактированное для применения стилей Кубизма, Сюрреализма и Фовизма.

Исходное и защищенное изображения природной сцены, каждое отредактированное для применения стилей Кубизма, Сюрреализма и Фовизма.

Чтобы протестировать методы защиты на произведениях искусства, был выполнен перенос стиля на изображениях из набора данных WikiArt, который курирует широкий спектр стилей искусства. Редакторские подсказки следовали тому же формату, что и раньше, инструктируя ИИ изменить стиль на случайно выбранный, не связанный стиль из меток WikiArt.

Методы защиты Glaze и Mist были применены к изображениям до редактирования, позволяя исследователям наблюдать, насколько хорошо каждая защита может блокировать или искажать результаты переноса стиля:

Примеры того, как методы защиты влияют на перенос стиля на произведениях искусства. Исходное изображение в стиле Барокко показано рядом с версиями, защищенными Mist и Glaze. После применения стиля Кубизма можно увидеть различия в том, как каждая защита изменяет окончательный выход.

Примеры того, как методы защиты влияют на перенос стиля на произведениях искусства. Исходное изображение в стиле Барокко показано рядом с версиями, защищенными Mist и Glaze. После применения стиля Кубизма можно увидеть различия в том, как каждая защита изменяет окончательный выход.

Исследователи также провели количественную оценку:

Изменения в оценках соответствия изображения и текста после редактирования стиля.

Изменения в оценках соответствия изображения и текста после редактирования стиля.

Из этих результатов авторы комментируют:

‘Результаты подчеркивают значительное ограничение враждебных вмешательств для защиты. Вместо того, чтобы препятствовать соответствию, враждебные вмешательства часто улучшают реакцию генеративной модели на подсказки, непреднамеренно позволяя эксплуататорам производить выходные данные, которые соответствуют их целям более точно. Такая защита не мешает процессу редактирования изображения и может не быть в состоянии предотвратить злонамеренные действия по копированию неавторизованного материала.

‘Непредвиденные последствия использования враждебных вмешательств выявляют уязвимости в существующих методах и подчеркивают необходимость более эффективных методов защиты.’

Авторы объясняют, что неожиданные результаты можно отнести к тому, как работают модели диффузии: LDM редактируют изображения, сначала преобразуя их в сжатую версию, называемую латентным; шум затем добавляется к этому латентному через многие шаги, пока данные не станут почти случайными.

Модель обращает этот процесс во время генерации, удаляя шум шаг за шагом. На каждом этапе этого обращения текстовая подсказка помогает направлять, как шум должен быть очищен, постепенно формируя изображение, чтобы оно соответствовало подсказке:

Сравнение между генерациями из незащищенного изображения и изображения, защищенного PhotoGuard, с промежуточными латентными состояниями, преобразованными обратно в изображения для визуализации.

Сравнение между генерациями из незащищенного изображения и изображения, защищенного PhotoGuard, с промежуточными латентными состояниями, преобразованными обратно в изображения для визуализации.

Методы защиты добавляют небольшие количества дополнительного шума к исходному изображению перед тем, как оно входит в этот процесс. Хотя эти вмешательства незначительны в начале, они накапливаются, когда модель применяет свои собственные слои шума.

Этот накопление оставляет больше частей изображения «неопределенными», когда модель начинает удалять шум. С большей неопределенностью модель больше полагается на текстовую подсказку, чтобы заполнить пропущенные детали, давая подсказке даже больше влияния, чем обычно.

По сути, защиты делают легче для ИИ изменить изображение, чтобы оно соответствовало подсказке, а не труднее.

Наконец, авторы провели тест, в котором подставили созданные вмешательства из статьи ‘Raising the Cost of Malicious AI-Powered Image Editing’ вместо чистого гауссовского шума.

Результаты следовали тому же шаблону, что и раньше: во всех тестах значения изменения процента оставались положительными. Даже этот случайный, неструктурированный шум привел к более сильному соответствию между сгенерированными изображениями и подсказками.

Влияние симулированной защиты с помощью гауссовского шума на наборе данных Flickr8k.

Влияние симулированной защиты с помощью гауссовского шума на наборе данных Flickr8k.

Это подтвердило основное объяснение, что любой добавленный шум, независимо от его конструкции, создает большую неопределенность для модели во время генерации, позволяя текстовой подсказке оказывать еще большее влияние на окончательное изображение.

Заключение

Исследовательская сцена уже давно продвигает враждебные вмешательства как решение проблемы авторских прав LDM; но не появилось никаких прочных решений из огромного количества опубликованных статей на эту тему.

Или наложенные нарушения чрезмерно снижают качество изображения, или закономерности не оказываются устойчивыми к манипуляциям и трансформационным процессам.

Однако это трудная мечта, которую трудно отказаться, поскольку альтернативой, кажется, являются сторонние мониторинговые и рамки доказательства, такие как схема C2PA, возглавляемая Adobe, которая стремится поддерживать цепочку хранения для изображений от датчика камеры, но не имеет никакой связи с содержанием.

В любом случае, если враждебные вмешательства на самом деле делают проблему хуже, как указывает новая статья, можно задаться вопросом, не является ли поиск защиты авторских прав такими средствами «алхимией».

 

Опубликовано в понедельник, 9 июня 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai