Погляд Anderson

Надання “таємних особистостей” персонажам анімації, захищеним авторським правом

mm
Додайте Unite.AI до бажаних джерел у Google
An image depicting a Marvel superhero 'anonymized' into a grey and unknown character, based on AI-generated/modified work from https://in.pinterest.com/pin/369928556910022951/ , and itself further modified with Z-Image. On the right, results from a new paper aiming to protect copyrighted animation characters by replacing them with generic substitutes. Source - https://arxiv.org/pdf/2608.12806

Нові дослідження з Китаю пропонують ненав’язливий спосіб захисту персонажів анімації, захищених авторським правом, шляхом “введення” загальних замінників під час генерації зображень. Але чи може цей метод перемогти винахідливість prompt-хакерів?

 

Враховуючи обсяг матеріалів, захищених авторським правом, присутніх у гіпермасштабних даних (через величезну вартість видалення таких порушень), моделі, навчені на них, схильні відтворювати персонажів, захищених авторським правом.

Пряме редагування навченої моделі або використання фільтрів для перехоплення ключових слів під час доступу до моделі через API часто може бути обійдено шляхом опису елемента, захищеного авторським правом, елліптично:

Персонаж, захищений авторським правом, створений популярним чат-ботом AI без прямого виклику імені персонажа. Джерело - https://archive.is/HDRKo

Персонаж, захищений авторським правом, створений популярним чат-ботом AI, як здається, без прямого виклику імені персонажа. Джерело

У потужній і постійній лінії досліджень техніки модифікації моделі намагалися змінити параметри у навченій моделі, з різними результатами:

З паперу 2023 року Ablating Concepts in Text-to-Image Diffusion Models, фотореалістичні зображення акторки Брі Ларсон у ролі Капітана Марвел - закладені у популярну дифузійну модель - перетворюються на вільно пов'язані карикатурні зображення, коли їх запитує користувач. Джерело - https://www.unite.ai/wp-content/uploads/2026/08/Ablating-Concepts-in-Text-to-Image-Diffusion-Models.jpg

З паперу 2023 року ‘Ablating Concepts in Text-to-Image Diffusion Models’, фотореалістичні зображення акторки Брі Ларсон у ролі Капітана Марвел – закладені у популярну дифузійну модель – перетворюються на вільно пов’язані карикатурні зображення, коли їх запитує користувач. Джерело

Однак абляція зазвичай є пошкоджувальним і неточним процесом, і такий, який може часто впливати на інші характеристики навченої моделі; крім того, існують багато способів обійти це.

Інший популярний підхід – “негативне промптинг”, при якому додатковий “анти-промпт” надсилається до моделі, призначений для обмеження виводу. Коли моделі доступні через API (як усі фронтові моделі, наприклад), “таємний” негативний промпт можна надіслати разом з відомим користувачем промптом, складаючи рубрику, призначену для запобігання наданню заборонених матеріалів користувачеві. Цей підхід, хоча популярний як вектор захисту авторського права, не завжди працює.

Більшість робіт щодо пост-факто цензури під час генерації зайнята більш широкою проблемою забезпечення того, щоб моделі не виводили CSAM або будь-який вид матеріалів, не придатних для сімейного перегляду, незважаючи на велику кількість таких матеріалів ймовірно присутніх у тренувальних даних великої моделі. Такі ініціативи можуть впливати на цілі класи контенту, а не на окремі випадки, і зазвичай не мають необхідної нюансированості для вирішення проблем власників авторських прав, які намагаються придушити конкретні ідентичності.

Дублікати тіла

З урахуванням цього, нова робота з Китаю пропонує заміну персонажів анімації, захищених авторським правом, під час генерації зображень на навчені загальні замінники – “дублікати”, які зберігають достатньо форми і структури персонажа, щоб зберегти навколишню сцену, одночасно видаляючи будь-які характерні деталі, пов’язані з захищеним персонажем:

'Анонімізовані' представлення матеріалів, захищених авторським правом, інакше присутніх і доступних у навченій моделі, досягнуті новим методом вкладення. Джерело - https://www.unite.ai/now-nsfw-and-celebrity-poses-are-fodder-for-ai-censorship/

'Анонімізовані' представлення матеріалів, захищених авторським правом, інакше присутніх і доступних у навченій моделі, досягнуті новим методом вкладення. Джерело

Вирішальною є те, що цей захід відбувається під час генерації без зміни або донастройки базової дифузійної моделі, і може бути налаштований для визначення того, наскільки повністю видаляється оригінальний персонаж.

Підхід неявно визнає, що модифікація моделі – поганий метод для цієї мети, і натомість вводить виконані вкладення у процес генерації – вкладення, призначені для “рефакторінгу”, а не абляції (обнулення, видалення) захищеного активу. Процес не впливає безпосередньо на базову модель і, таким чином, може бути повторно використаний або адаптований для різноманітних моделей.

Хоча метод був протестований авторами на старішньому Stable Diffusion ряду моделей, він також був успішно протестований на більш недавній Z-Image архітектурі, що свідчить про те, що концепція авторів застосовна до ряду генеративних архітектур.

Папера заявляє:

'[Ми] пропонуємо контрольований метод, що діє на безперервне текстове представлення моделі для видалення цільових персонажів під час генерації. Ми [оптимізуємо] якорне вкладення через структуральні та детальні обмеження, щоб служити персонажем-замінником, потім [замінюємо] цільові вкладення якорем через структуру-обізнану адаптивну стратегію.

'Експерименти показують, що наш метод досягає стану мистецтва ефективності видалення і збереження якості зображення, підтримуючи контрольований ступінь видалення, видалення кількох цілей і переносимість моделі.

'Крім того, наші оптимізовані якоря є плагінами з поточними базовими лініями модифікації моделі для покращення їхньої продуктивності видалення.'

Новий метод охоплює різноманітні архітектури і пропонує гранульований контроль, згідно з авторами.

Новий метод охоплює різноманітні архітектури і пропонує гранульований контроль, згідно з авторами.

Нова робота називається Видалити, але зберегти: Контрольоване видалення персонажів анімації, захищених авторським правом, через оптимізовані семантичні якоря, і походить від семи авторів з Інституту інженерії інформації Китайської академії наук і Університету Китайської академії наук у Пекіні.

Метод

Центральна ідея нового методу, як показано нижче, полягає у створенні заміни для кожного персонажа, захищеного авторським правом, який зберігає загальну форму і структуру, одночасно позбуваючись характерних візуальних деталей, які роблять персонажа впізнаваним – і потім використовувати цю заміну під час генерації зображень, коли захищений персонаж запитується.

Схема нового підходу.

Схема нового підходу.

Заміна, яку автори називають якорем, призначена для збереження достатньо форми і структури оригінального персонажа, щоб природно вписуватися у ту ж сцену, одночасно позбуваючись деталей, які роблять персонажа впізнаваним.

Для цього система порівнює грубу структуральну інформацію, згенеровану для оригінального персонажа, з тією, згенерованою для розроблюваного якоря, штовхаючи два до подібної загальної форми. Посилання на зображення персонажа, захищеного авторським правом, потім використовується для протилежної мети, штовхаючи якор від впізнаваних більш дрібних деталей:

Метод створення заміни для персонажа, захищеного авторським правом. Загальна структура персонажа зберігається, одночасно підпригаючись його характерні візуальні деталі, виробляючи оптимізований 'якорь' для використання під час генерації.

Метод створення заміни для персонажа, захищеного авторським правом. Загальна структура персонажа зберігається, одночасно підпригаючись його характерні візуальні деталі, виробляючи оптимізований 'якорь' для використання під час генерації.

Результируючий якор займає свідомо спроектовану середину між збереженням запитуємої композиції і видаленням захищеної ідентичності.

Якорь геть

Як тільки ці властивості були встановлені, якор потрібно перекласти на щось, що дифузійна модель може зрозуміти. Термін Якорь* [sic] надається власне навчуване представлення всередині CLIP текстового кодувальника, ефективно створюючи нове штучне слово/об’єкт, чиє значення можна формувати без зміни основної моделі генерації зображень.

Це нове представлення багаторазово регулюється згідно зі структуральними та детальними цілями, описаними вище, вчачи Якорь*, щоб означати щось загально сформоване, як захищений персонаж, але позбавлене його впізнаваного вигляду.

Решта текстового кодувальника залишається замороженою під час цього процесу, тоді як звичайні токени початку, кінця і заповнення навколо Якоря* забезпечують контекст, необхідний для перетворення цього нового псевдослова в кінцеве вкладення, використовуване під час генерації.

Адаптивна заміна

Під час генерації (висновування) алгоритм шукає у закодованому промпті терміни, пов’язані з персонажем, захищеним авторським правом, і замінює навчені якорні вкладення на їх місце, одночасно регулюючи кінцеві і заповнювальні вкладення, які несуть контекстну інформацію.

Для підготовки до цього система спочатку дозволяє деноїзингу встановити загальну композицію запитуємої картинки, відстежуючи зміни у її грубій структурі для визначення моменту, коли ця композиція починає стабілізуватися:

Представлення моменту заміни якоря під час генерації зображення. Зміни у грубій структурі зображення відстежуються під час деноїзингу, з заміною, спровокованою близько моменту, коли загальна композиція стабілізується, і більш дрібні деталі починають з'являтися.

Представлення моменту заміни якоря під час генерації зображення. Зміни у грубій структурі зображення відстежуються під час деноїзингу, з заміною, спровокованою близько моменту, коли загальна композиція стабілізується, і більш дрібні деталі починають з’являтися.

На зображенні вище ми бачимо цей перехід, що відбувається приблизно на 720-му таймстемпі, де виміряна структуральна зміна досягає свого піку, а потім починає знижуватися. На цьому етапі загальна композиція зображення в основному сформувалася, дозволяючи якорю замінити захищений персонаж, одночасно зменшуючи ризик порушення встановленої композиції.

Дані та тести

Автори порівняли свій підхід з п’ятьма промпт-орієнтованими базовими лініями: Безпечна дифузійна латентність (SLD); STG; SAFREE; TraSCE; і негативне промптинг (NP).

Оптимізовані якорні вкладення також були інтегровані до чотирьох існуючих методів модифікації моделі: MACE; UCE; ESD-u; і AC. Це було зроблено для того, щоб протестувати, чи можуть вони покращити запропонований метод щодо видалення персонажа.

Для оцінки був зібраний набір даних з 80 персонажів анімації, що складається з 36 антропоморфних персонажів; 23 персонажів у формі тварин; і 21 з інших категорій – з вибіркою персонажів, які могли бути надійно відтворені дифузійними моделями.

Потім було згенеровано 100 зображень для кожного персонажа, використовуючи промпти, створені GPT-4o.

Стабільна дифузія v1.4 була використана для основних експериментів, з додатковим тестуванням переносимості на подальших версіях Стабільної дифузії v1.5; V2; v2.1; XL base 1.0; і також більш недавню, засновану на DiT, Z-Image. Не було виконано жодної донастройки моделі, залишаючи параметри кожної попередньо навченої моделі незмінними.

Для метрик LLaVA-1.5 і BLIP-3 вимірювали, чи залишається цільовий персонаж впізнаваним, з нижчою точністю ідентифікації, вказуюючи на більш повне видалення; Структурний індекс схожості (SSIM) вимірював збереження структури; Навчені перцептивні метрики схожості (LPIPS) вимірювали перцептивну різницю; і Аестетічний передбачувач V2 Бал оцінював візуальну якість зміненого зображення.

Фречетівська відстань інцепшена (FID) і Бал CLIP були додатково розраховані з не пов’язаних промптів у COCO-30K, щоб виміряти, чи нормальна генерація зображень була порушена:

Результати тестів, порівняння методів видалення персонажів через 80 персонажів анімації. Перші дві колонки вимірюють, скільки разів видалений персонаж усе ще міг бути впізнаний, тому нижчі бали вказують на краще видалення. Решта колонок вимірюють, наскільки добре оригінальне зображення і не пов'язана генерація були збережені. Стрілки показують, чи вищі чи нижчі бали є бажаними; жирний шрифт вказує на найкращий результат, а підкреслення - на другий найкращий.

Результати тестів, порівняння методів видалення персонажів через 80 персонажів анімації. Перші дві колонки вимірюють, скільки разів видалений персонаж усе ще міг бути впізнаний, тому нижчі бали вказують на краще видалення. Решта колонок вимірюють, наскільки добре оригінальне зображення і не пов’язана генерація були збережені. Стрілки показують, чи вищі чи нижчі бали є бажаними; жирний шрифт вказує на найкращий результат, а підкреслення – на другий найкращий.

З цих початкових результатів для кількісного порівняння автори заявляють:

'У порівнянні з усіма базовими лініями, зображення, видалені нашим методом, досягають найнижчих точностей для успішної ідентифікації цільового персонажа як LLaVA-1.5 (6.0%), так і BLIP-3 (4.0%), з зниженням на 3.5% і 1.7% порівняно з другим найнижчим результатом відповідно.

'Це демонструє ефективність нашого методу видалення, оскільки він успішно [обманює] великі багатомодальні моделі.'

Для збереження якості зображення метод авторів виробив найвищий бал SSIM на рівні 0,467, і найнижчий бал LPIPS на рівні 0,505 – вказуючи на найсильніше збереження не пов’язаного контенту і структури фону серед протестованих методів. Він також досяг найвищого балу Аестетичного передбачувача V2 серед методів видалення персонажів, на рівні 5,18, вказуючи на те, що це збереження не відбувається за рахунок загальної візуальної якості.

Кваліфікаційний тест слідував:

Результати тестів, порівняння видалення персонажів через п'ять персонажів анімації. Кожен рядок показує результати від різних методів, з оригінальними генераціями Стабільної дифузії v1.4 у верхній частині і запропонованим методом у нижній частині. Запропонований метод більш послідовно замінює цільових персонажів, зберігаючи навколишню сцену.

Результати тестів, порівняння видалення персонажів через п’ять персонажів анімації. Кожен рядок показує результати від різних методів, з оригінальними генераціями Стабільної дифузії v1.4 у верхній частині і запропонованим методом у нижній частині. Запропонований метод більш послідовно замінює цільових персонажів, зберігаючи навколишню сцену. Будь ласка, зверніться до оригінального джерела PDF або проекту для трохи кращої роздільності.

Згідно з папером, приклади показують особливо явні відмінності для персонажів з більш складними формами і атрибутами, з Дональдом Даком і Супер Маріо як прикладами:

'[Наш] метод досягає безшовного видалення персонажів анімації через оптимізовані якоря, тоді як промпт-орієнтовані базові лінії часто не справляються – особливо для персонажів з складними формами і атрибутами (наприклад, Дональд Дак і Супер Маріо).

'Крім того, наш метод досягає збереження фону без розмиття або викривлення артефактів, підтримуючи ітеративні творчі робочі процеси.'

Гранульований контроль

Континуальний простір вкладень також дозволяє регулювати силу видалення персонажа, а не розглядати видалення як все-або-нічого пропозицію. Інтерполюючи між оптимізованим якорем і оригінальним цільовим вкладенням, метод може поступово відновлювати більше персонажа, зберігаючи при цьому структуру навколишнього зображення:

Тестові зображення, що показують різні ступені видалення персонажа. Перші три колонки показують оригінального персонажа, видалену версію і візуальні особливості, які були видалені; решта колонок показують проміжні налаштування при α=0,25, 0,5 і 0,75. Вищі значення α зберігають поступово більше оригінального персонажа.

Тестові зображення, що показують різні ступені видалення персонажа. Перші три колонки показують оригінального персонажа, видалену версію і візуальні особливості, які були видалені; решта колонок показують проміжні налаштування при α=0,25, 0,5 і 0,75. Вищі значення α зберігають поступово більше оригінального персонажа. Будь ласка, зверніться до оригінального джерела PDF або проекту для трохи кращої роздільності.

Як показано вище, автори також протестували цей контроль на персонажах Вінні-Пух, Олаф, Міні-Маус і Стіч. Структурна подібність залишалася відносно стабільною, коли ступінь відновлення змінювався, тоді як впізнаваність LLaVA-1.5 і BLIP-3 збільшувалася, коли більше персонажа відновлювалося.

Вінні-Пух і Стіч ставали впізнаваними протягом відносно вузького діапазону; Олаф і Міні-Маус змінювалися більш поступово; і Міні-Маус ставав впізнаваним з відносно невеликим ступенем відновлення, демонструючи, що відповідна сила видалення залежить від цільового персонажа.

Додаткові експерименти з заміни кількох цілей за один раз були успішно проведені, і ми звертаємося до джерельної праці для більшої кількості деталей щодо цього, а також додаткових результатів і матеріалів.

Висновок

Як завжди, цей останній розвиток у сфері охорони авторських прав еквівалентний закриттю стійлової двері після того, як кінь уже втечів.

У тих рідкісних випадках, коли дослідники та компанії намагалися придушити здатність моделі виробляти оголеність і/або порнографію, фактично відключивши внутрішній доступ до “не придатного для сімейного перегляду” матеріалу у наборі даних (через те, що все ще занадто дорого його кураторство), виявилося, що модель вже не могла правильно зрозуміти людську анатомію.

Новий підхід, запропонований тут, є, по суті, еквівалентним видаленню одної конкретної порнозірки у випадку, коли фільтр не придатного для сімейного перегляду будувався для моделі, навченої на безрозборному веб-контенті. Для нового методу створення “загального дубліката” для персонажа, захищеного авторським правом, необхідно залишити супергеройський домен цілий у латентному просторі моделі; і чим важливіший цільовий персонаж, захищений авторським правом, тим більше він визначає свій домен у навченому просторі.

Отже, видалення його подібне до спроби видалити цукор з кави, після того, як він уже був перемішаний.

Таким чином, хоча цей підхід може мати певний обмежений успіх, якщо додати його до зростаючих API-браньвух фронтових моделей, взаємозв’язана природа моделі Генеративного AI вказує, історично, що матеріали, захищені авторським правом, на які націлений цей метод, можуть залишатися доступними через звичайну винахідливість промптерів.

 

Перше опубліковано у п’ятницю, 14 серпня 2026

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai