Взгляд Anderson

Давая “Секретные Идентичности” Персонажам Защищенных Анимаций

mm
Добавьте Unite.AI в избранные источники в Google
An image depicting a Marvel superhero 'anonymized' into a grey and unknown character, based on AI-generated/modified work from https://in.pinterest.com/pin/369928556910022951/ , and itself further modified with Z-Image. On the right, results from a new paper aiming to protect copyrighted animation characters by replacing them with generic substitutes. Source - https://arxiv.org/pdf/2608.12806

Новые исследования из Китая предлагают бесконтактный способ защиты персонажей защищенных анимаций, “внедряя” общие замены во время вывода. Но может ли этот метод победить изобретательность хакеров-пromptов?

 

Учитывая объем защищенного материала, присутствующего в гипермасштабных datasets (из-за огромной стоимости удаления таких нарушений), модели, обученные на них, имеют тенденцию воспроизводить защищенные персонажи.

Прямое редактирование обученной модели или использование фильтров для перехвата ключевых слов, когда модель доступна через API, может часто быть обойдено, описывая защищенный элемент эллиптически:

Защищенный персонаж, сгенерированный популярным чат-ботом AI без прямого вызова имени персонажа. Источник - https://archive.is/HDRKo

Защищенный персонаж, сгенерированный популярным чат-ботом AI, якобы без прямого вызова имени персонажа. Источник

В сильной и постоянной линии исследований, модификация модели техники пытались изменить параметры в обученной модели, с различными результатами:

Из статьи 2023 года Ablating Concepts in Text-to-Image Diffusion Models, фотографически реалистичные изображения актрисы Бри Ларсон в роли 'Капитана Марвел' – встроенные в популярную модель диффузии – превращаются в свободно связанные с ними карикатурные изображения, когда пользователь запрашивает их. Источник - https://arxiv.org/pdf/2303.13516

Из статьи 2023 года ‘Ablating Concepts in Text-to-Image Diffusion Models’, фотографически реалистичные изображения актрисы Бри Ларсон в роли ‘Капитана Марвел’ – встроенные в популярную модель диффузии – превращаются в свободно связанные с ними карикатурные изображения, когда пользователь запрашивает их. Источник

Однако, абляция обычно является вредным и неточным процессом, и тот, который может часто повлиять на другие характеристики обученной модели; кроме того, есть несколько способов обойти это.

Другой популярный подход – “отрицательная подсказка”, когда дополнительная “анти-подсказка” отправляется модели, предназначенная для ограничения вывода. Когда модели доступны через API (как все передовые модели, например), “секретная” отрицательная подсказка может быть отправлена вместе с известной пользовательской подсказкой, состоящей из рубрики, предназначенной для предотвращения того, чтобы модель предоставляла запрещенный материал пользователю. Этот подход, хотя популярный как вектор защиты авторских прав, не всегда работает.

Большая часть работы вокруг пост-факто цензуры вывода занята более широкой проблемой обеспечения того, чтобы модели не выводили CSAM или любой другой нецензурный материал, несмотря на то, что большое количество такого материала вероятно присутствовало в обучающих данных крупной модели. Такие инициативы могут повлиять на целые классы контента, а не на отдельные экземпляры, и обычно не имеют необходимой нюансы, чтобы решить проблемы правообладателей, стремящихся подавить конкретные идентичности.

Дубликаты

Учитывая это, новая статья из Китая предлагает замену защищенных анимационных персонажей во время генерации изображений на обученные общие замены – “дубликаты”, которые сохраняют достаточно формы и структуры персонажа, чтобы сохранить окружающую сцену, удаляя при этом любые характерные детали, связанные с защищенным персонажем:

'Анонимизированные' представления защищенного материала, присутствующего и доступного в обученной модели, достигнутые новым методом внедрения. Источник - https://arxiv.org/pdf/2608.12806

'Анонимизированные' представления защищенного материала, присутствующего и доступного в обученной модели, достигнутые новым методом внедрения. Источник

Критически, это вмешательство происходит во время генерации без изменения или настройки базовой модели диффузии и может быть скорректировано для определения того, насколько сильно оригинальный персонаж будет стерт.

Подход неявно признает, что модификация модели является плохим методом для этой цели, и вместо этого вводит созданные внедрения в процесс вывода – внедрения, предназначенные для “перестановки”, а не абляции (обнуления, удаления) защищенного актива. Процесс не直接 влияет на базовую модель и, таким образом, может быть повторно использован или адаптирован для различных моделей.

Хотя метод был протестирован авторами на более старой модели Stable Diffusion, он также был эффективно протестирован на более недавней архитектуре Z-Image, что предполагает, что концепция авторов применима к различным генеративным архитектурам.

Статья гласит:

‘[Мы] предлагаем контролируемый метод, работающий с непрерывным текстовым представлением модели, чтобы стереть целевые персонажи во время генерации. Мы [оптимизируем] якорное внедрение через структурные и детальные ограничения, чтобы служить заменой персонажа, затем [заменяем] связанные с персонажем внедрения на якорь через структуру, осведомленную стратегию.

‘Эксперименты показывают, что наш метод достигает лучшей эффективности стирания и сохранения изображения, сохраняя при этом контролируемую степень стирания, удаление нескольких целей и переносимость модели.

‘Кроме того, наши оптимизированные якоря являются готовыми к использованию с текущими базовыми методами модификации модели, чтобы улучшить их производительность стирания.’

Новый метод охватывает разные архитектуры и предлагает гранулярный контроль, согласно авторам.

Новый метод охватывает разные архитектуры и предлагает гранулярный контроль, согласно авторам.

Новая статья озаглавлена Стирать, но Сохранять: Контролируемое Удаление Защищенных Анимационных Персонажей через Оптимизированные Семантические Якоря и исходит от семи авторов из Института информационной инженерии Китайской академии наук и Университета Китайской академии наук в Пекине.

Метод

Центральная идея нового метода, как показано ниже, заключается в создании замены для каждого защищенного персонажа, сохраняющей его общую форму и структуру, в то время как удаляя характерные визуальные детали, которые делают персонажа узнаваемым – и затем использовать эту замену во время генерации изображений, когда защищенный персонаж запрошен.

Схема нового подхода.

Схема нового подхода.

Замена, которую авторы называют якорем, предназначена для сохранения достаточно формы и структуры оригинального персонажа, чтобы естественно вписаться в одну и ту же сцену, в то время как избавляясь от деталей, которые делают персонажа узнаваемым.

Для этого система сравнивает грубую структурную информацию, сгенерированную для оригинального персонажа, с той, которая сгенерирована для развивающегося якоря, толкая их к подобной общей форме. Ссылочное изображение защищенного персонажа затем используется для противоположной цели, толкая якорь от узнаваемых более мелких деталей:

Метод создания не нарушающей авторские права замены защищенного персонажа. Общая структура персонажа сохраняется, в то время как его характерные визуальные детали подавляются, производя оптимизированное 'якоро' для использования во время генерации.

Метод создания не нарушающей авторские права замены защищенного персонажа. Общая структура персонажа сохраняется, в то время как его характерные визуальные детали подавляются, производя оптимизированное 'якоро' для использования во время генерации.

Результирующий якорь, таким образом, занимает намеренно сконструированную среднюю позицию между сохранением запрошенной композиции и удалением защищенной идентичности.

Якорь Уходит

Как только эти свойства были установлены, якорю необходимо перевести в нечто, что модель диффузии может понять. Значение Якорь* [sic] поэтому получает свое собственное обучаемое представление внутри CLIP текстового кодировщика, эффективно создавая новое искусственное слово/сущность, чье значение может быть сформировано без изменения базовой модели генерации изображений.

Это новое представление повторно корректируется в соответствии со структурными и детальными целями, описанными выше, обучая Якорь* означать что-то, имеющее общую форму с защищенным персонажем, но лишенное его идентифицирующего вида.

Остальная часть текстового кодировщика остается замороженной во время этого процесса, в то время как обычные стартовые, конечные и заполненные токены, окружающие Якорь*, обеспечивают контекст, необходимый для превращения этого нового выученного псевдо-слова в окончательные внедрения, используемые во время генерации.

Адаптивная Замена

Во время генерации (вывода) алгоритм ищет закодированную подсказку для терминов, связанных с защищенным персонажем, и заменяет выученные якорные внедрения на их место, в то же время корректируя конечные и заполненные внедрения, которые несут контекстную информацию.

Чтобы подготовиться к этому, система сначала позволяет деноизингу установить общую композицию запрошенного изображения, отслеживая изменения в его грубой структуре, чтобы определить, когда эта композиция начинает стабилизироваться:

Представление того, когда происходит замена якоря во время генерации изображения. Изменения в грубой структуре изображения отслеживаются на протяжении всего деноизинга, с заменой, запущенной около точки, где общая композиция стабилизируется, и более мелкие детали начинают появляться.

Представление того, когда происходит замена якоря во время генерации изображения. Изменения в грубой структуре изображения отслеживаются на протяжении всего деноизинга, с заменой, запущенной около точки, где общая композиция стабилизируется, и более мелкие детали начинают появляться.

На изображении выше мы видим, что этот переход происходит примерно на временном шаге 720, где измеренное структурное изменение достигает своего пика, а затем начинает падать. В этот момент общая композиция изображения в основном сформировалась, позволяя якорю заменить защищенный персонаж, в то же время снижая риск нарушения установленной композиции.

Данные и Тесты

Авторы сравнили свой подход с пятью базовыми методами подсказок: Безопасная диффузионная модель (SLD); STG; SAFREE; TraSCE; и Отрицательная Подсказка (NP).

Оптимизированные якорные внедрения также были интегрированы в четыре существующих метода модификации модели: MACE; UCE; ESD-u; и AC. Это было сделано для проверки того, могут ли они улучшить предложенную модель в отношении удаления персонажа.

Для оценки был собран набор данных из 80 анимационных персонажей, состоящий из 36 антропоморфных персонажей; 23 персонажей в форме животных; и 21 из различных категорий – с всеми выбранными персонажами, выбранными потому, что они могли быть надежно воспроизведены моделями диффузии.

Затем были сгенерированы 100 изображений для каждого персонажа, используя подсказки, произведенные GPT-4o.

Stable Diffusion v1.4 была использована для основных экспериментов, с дополнительной проверкой переносимости на дальнейшие версии Stable Diffusion v1.5; V2; v2.1; XL base 1.0; и также более недавняя Z-Image. Не было выполнено никакой настройки модели, оставив параметры каждой предварительно обученной модели неизменными.

Для метрик LLaVA-1.5 и BLIP-3 измеряли, остается ли целевой персонаж узнаваемым, с более низкой точностью идентификации, указывающей на более полное удаление; Индекс структурного сходства (SSIM) измерял сохранение структуры; Обученные перцептивные метрики сходства (LPIPS) измеряли перцептивное различие; и Оценщик эстетики V2 оценивал визуальное качество измененного изображения.

Расстояние Фреде между распределениями (FID) и Оценка CLIP также были рассчитаны из несвязанных подсказок в COCO-30K, чтобы измерить, был ли затронут нормальный вывод изображения:

Результаты тестов, сравнивающие методы удаления персонажей на 80 анимационных персонажах. Первые два столбца измеряют, как часто якорный персонаж все еще может быть распознан, поэтому более низкие баллы указывают на лучшее удаление. Остальные столбцы измеряют, насколько хорошо была сохранена исходная изображение и несвязанный вывод. Стрелки показывают, является ли более высокий или более низкий балл предпочтительным; жирный шрифт указывает на лучший результат, а подчеркивание – на второй лучший.

Результаты тестов, сравнивающие методы удаления персонажей на 80 анимационных персонажах. Первые два столбца измеряют, как часто якорный персонаж все еще может быть распознан, поэтому более низкие баллы указывают на лучшее удаление. Остальные столбцы измеряют, насколько хорошо была сохранена исходная изображение и несвязанный вывод. Стрелки показывают, является ли более высокий или более низкий балл предпочтительным; жирный шрифт указывает на лучший результат, а подчеркивание – на второй лучший.

Из этих первоначальных результатов для количественного сравнения авторы заявляют:

‘По сравнению со всеми базовыми методами, изображения, стертые с помощью нашего метода, достигают наименьших точностей для успешной идентификации целевого персонажа как LLaVA-1.5 (6.0%), так и BLIP-3 (4.0%), с уменьшением на 3.5% и 1.7% по сравнению со вторым лучшим результатом соответственно.

‘Это демонстрирует эффективность нашего метода удаления, поскольку он эффективно [обманывает] много-модальные большие модели.’

Для сохранения изображения метод авторов произвел наивысший балл SSIM, равный 0,467, и наименьший балл LPIPS, равный 0,505 – указывающий на наиболее сильное сохранение несвязанного контента и фоновой структуры среди протестированных методов. Он также достиг наивысшего балла Оценщика эстетики V2 среди методов удаления персонажей, равного 5,18, что указывает на то, что это сохранение не происходит за счет общего визуального качества.

Качественный тест последовал:

Результаты тестов, сравнивающие удаление персонажей на пяти анимационных персонажах. Каждый ряд показывает результаты из разных методов, с исходными генерациями Stable Diffusion v1.4 вверху и предложенным методом внизу. Предложенный метод более последовательно заменяет целевой персонаж, сохраняя при этом окружающую сцену.

Результаты тестов, сравнивающие удаление персонажей на пяти анимационных персонажах. Каждый ряд показывает результаты из разных методов, с исходными генерациями Stable Diffusion v1.4 вверху и предложенным методом внизу. Предложенный метод более последовательно заменяет целевой персонаж, сохраняя при этом окружающую сцену. Пожалуйста, обратитесь к исходному источнику PDF или к сайту проекта для немного лучшего разрешения.

Согласно статье, примеры показывают особенно явные различия для персонажей с более сложными формами и атрибутами, с Дональдом Даком и Супер Марио, упомянутыми в качестве примеров:

‘[Наш] метод достигает бесшовного удаления анимационных персонажей через оптимизированные якоря, в то время как методы, основанные на подсказках, часто терпят неудачу – особенно для персонажей с сложными формами и атрибутами (например, Дональд Дак и Супер Марио).

‘Кроме того, наш метод достигает согласованности фона без артефактов размытия или искажения, поддерживая итеративные творческие рабочие процессы.’

Гранулярный Контроль

Пространство непрерывных внедрений также позволяет регулировать силу удаления персонажа, а не рассматривать стирание как все или ничего. Интерполируя между оптимизированным якорем и исходным целевым внедрением, метод может прогрессивно восстановить больше персонажа, сохраняя при этом окружающую структуру изображения:

Тестовые изображения, показывающие различные степени удаления персонажа. Первые три столбца показывают исходный персонаж, удаленную версию и удаленные визуальные особенности; остальные столбцы показывают промежуточные настройки при α=0,25, 0,5 и 0,75. Более высокие значения α сохраняют прогрессивно больше исходного персонажа.

Тестовые изображения, показывающие различные степени удаления персонажа. Первые три столбца показывают исходный персонаж, удаленную версию и удаленные визуальные особенности; остальные столбцы показывают промежуточные настройки при α=0,25, 0,5 и 0,75. Более высокие значения α сохраняют прогрессивно больше исходного персонажа. Пожалуйста, обратитесь к исходному источнику PDF или к сайту проекта для немного лучшего разрешения.

Как показано выше, авторы также протестировали этот контроль на персонажах Винни-Пух, Олаф, Минни Маус и Стич. Структурное сходство оставалось относительно стабильным, когда сила восстановления менялась, в то время как распознавание LLaVA-1.5 и BLIP-3 увеличивалось, когда больше персонажа было восстановлено.

Винни-Пух и Стич стали узнаваемыми в относительно узких диапазонах; Олаф и Минни Маус менялись более постепенно; и Минни Маус стала узнаваемой с относительно небольшим количеством восстановления, демонстрируя, что подходящая сила стирания зависит от персонажа, на который нацеливаются.

Дополнительные эксперименты по замене нескольких целей за один проход были успешно проведены, и мы отсылаем читателя к исходной статье для получения более подробной информации об этом и для дополнительных дополнительных результатов и материалов.

Вывод

Как всегда, этот последний поворот на авторских правах ограждениях эквивалентен закрыванию стабильной двери после того, как лошадь уже убежала.

В тех редких случаях, когда исследователи и компании стремились подавить способность модели производить наготу и/или порнографию, фактически отрезая внутренний доступ к “нецензурному” материалу в наборе данных (поскольку это все еще слишком дорого для его курирования), оказалось, что модель больше не может правильно понимать человеческую анатомию.

Новый подход, предложенный здесь, аргументированно эквивалентен удалению одной конкретной порнозвезды в случае, когда фильтр “нецензурного” материала строится для модели, обученной на неограниченно собранных веб-контентах. Для нового метода создание “общего двойника” для защищенного персонажа должно обязательно оставить супергеройский домен целостным в латентном пространстве модели; и чем важнее целевой защищенный персонаж, тем больше он определяет свой домен в обученном пространстве.

Следовательно, удаление его похоже на попытку удалить сахар из кофе, после того как он был перемешан.

Итак, хотя этот подход может наслаждаться некоторым ограниченным успехом, если он будет добавлен к передовым моделям, растущим API-ограждениям, взаимосвязанная природа модели GenAI предполагает, что защищенный материал, на который нацеливается этот метод, может остаться доступным через обычную изобретательность prompter’ов.

 

Опубликовано впервые в пятницу, 14 августа 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai