Взгляд Anderson
Автоматизация защиты авторских прав в изображениях, сгенерированных ИИ

Как обсуждалось на прошлой неделе, даже основные модели, лежащие в основе популярных генеративных систем ИИ, могут производить контент, нарушающий авторские права, из-за неадекватной или неправильно выровненной курирования, а также наличия нескольких версий одного и того же изображения в обучающих данных, что приводит к переобучению и увеличивает вероятность узнаваемых репродукций.
Несмотря на усилия по доминированию в области генеративного ИИ и растущему давлению на предотвращение нарушений прав интеллектуальной собственности, крупные платформы, такие как MidJourney и DALL-E от OpenAI, продолжают сталкиваться с проблемами в предотвращении непреднамеренного воспроизведения контента, защищенного авторским правом:

Возможность генеративных систем воспроизводить контент, защищенный авторским правом, регулярно обсуждается в СМИ.
Когда появляются новые модели, и когда китайские модели приобретают доминирование, подавление контента, защищенного авторским правом, в основых моделях является сложной задачей; на самом деле, лидер рынка OpenAI заявил в прошлом году, что ‘невозможно’ создать эффективные и полезные модели без контента, защищенного авторским правом.
Предшествующий опыт
В отношении непреднамеренного генерирования контента, защищенного авторским правом, исследовательская сцена сталкивается с подобной задачей, как и включение контента для взрослых и других запрещенных материалов в исходные данные: хочется получить выгоду от знаний (т.е. правильную человеческую анатомию, которая исторически всегда основывалась на обнаженных этюдах) без возможности злоупотребления ею.
Аналогично, создатели моделей хотят получить выгоду от огромного объема контента, защищенного авторским правом, который попадает в гипермасштабные наборы, такие как LAION, без того, чтобы модель развивала способность фактически нарушать права интеллектуальной собственности.
Отбрасывая этические и юридические риски попыток скрыть использование контента, защищенного авторским правом, фильтрация для последнего случая значительно более сложна. Контент для взрослых часто содержит характерные низкоуровневые латентные признаки, которые позволяют все более эффективно фильтровать без необходимости прямых сравнений с реальными материалами. Напротив, латентные вложения, которые определяют миллионы произведений, защищенных авторским правом, не сводятся к набору легко идентифицируемых маркеров, что делает автоматическое обнаружение намного более сложным.
CopyJudge
Человеческая оценка является редкой и дорогой коммерцией, как в курировании наборов данных, так и в создании постобработочных фильтров и систем, основанных на “безопасности”, предназначенных для обеспечения того, чтобы материал, защищенный авторским правом, не был доставлен пользователям API-ориентированных порталов, таких как MidJourney и возможность генерации изображений ChatGPT.
Поэтому новое академическое сотрудничество между Швейцарией, Sony AI и Китаем предлагает CopyJudge – автоматический метод оркестровки последовательных групп сговорившихся “судей” на основе ChatGPT, которые могут проверять входные данные на наличие признаков вероятного нарушения авторских прав.

CopyJudge оценивает различные поколения ИИ, нарушающие права интеллектуальной собственности. Источник: https://arxiv.org/pdf/2502.15278
CopyJudge эффективно предлагает автоматический каркас, использующий большие модели зрения и языка (LVLMs), для определения существенной схожести между изображениями, защищенными авторским правом, и теми, которые производятся моделями диффузии текст-изображение.

Подход CopyJudge использует обучение с подкреплением и другие подходы для оптимизации подсказок, нарушающих авторские права, и затем использует информацию из этих подсказок для создания новых подсказок, которые менее вероятно вызовут изображения, нарушающие авторские права.
Хотя многие онлайн-генераторы изображений ИИ фильтруют подсказки пользователей для контента для взрослых, контента, защищенного авторским правом, рекреации реальных людей и других запрещенных доменов, CopyJudge вместо этого использует усовершенствованные “нарушающие” подсказки для создания “очищенных” подсказок, которые наименее вероятно вызовут запрещенные изображения, без намерения直接 блокировать ввод пользователя.
Хотя этот подход не является новым, он идет некоторым образом к освобождению API-ориентированных генеративных систем от простого отказа в пользовательском вводе (не говоря уже о том, что это позволяет пользователям разработать обходные пути к запрещенным поколениям через эксперименты).
Одно из недавних обходных путей (закрытое разработчиками) позволяло пользователям генерировать порнографический материал на платформе Kling просто включив в изображение, загруженное в рабочий процесс изображение-видео, заметный крест или крест.

В обходном пути, закрытом разработчиками Kling в конце 2024 года, пользователи могли заставить систему производить запрещенный контент для взрослых, просто включив крест или крест в изображение, загруженное в рабочий процесс изображение-видео. Не было объяснения, почему этот обходной путь был возможен. Источник: Discord
Такие случаи подчеркивают необходимость санитарной обработки подсказок в онлайн-генераторах. Кроме того, машинное забывание, при котором основная модель изменяется для удаления запрещенных концепций, может иметь нежелательные последствия для пригодности конечной модели.
Используя менее радикальные решения, система CopyJudge имитирует человеческие юридические оценки, используя ИИ для разбиения изображений на ключевые элементы, такие как композиция и цвет, для фильтрации не подлежащих авторским правам частей и сравнения того, что осталось. Она также включает в себя метод, управляемый ИИ, для корректировки подсказок и модификации генерации изображений, помогая избежать проблем с авторскими правами, сохраняя при этом творческий контент.
Экспериментальные результаты, по утверждению авторов, демонстрируют эквивалентность CopyJudge современным подходам в этой области и указывают на то, что система демонстрирует лучшую обобщаемость и интерпретируемость по сравнению с предыдущими работами.
Новая статья озаглавлена CopyJudge: Автоматическая идентификация и смягчение нарушений авторских прав в моделях диффузии текст-изображение и исходит от пяти исследователей из EPFL, Sony AI и Университета Уэстлейка в Китае.
Метод
Хотя CopyJudge использует GPT для создания сменяющихся трибуналов автоматических судей, авторы подчеркивают, что система не оптимизирована для продукта OpenAI, и что любая другая большая модель зрения и языка (LVLM) могла бы быть использована вместо этого.
В первую очередь авторы требуют рамочного каркаса абстракции-фильтрации-сравнения для разложения исходных изображений на составные части, как показано в левой части схемы ниже:

Концептуальная схема для начальной фазы рабочего процесса CopyJudge.
В нижнем левом углу мы видим фильтрующий агент, разбивающий секции изображения в попытке выявить характеристики, которые могут быть родными для произведения, защищенного авторским правом, в совокупности, но которые сами по себе были бы слишком общими, чтобы квалифицироваться как нарушение.
Множество LVLMs затем используется для оценки отфильтрованных элементов – подход, который был доказан эффективным в работах, таких как предложение CSAIL 2023 Улучшение фактических данных и рассуждений в языковых моделях посредством многопользовательских дебатов и ChatEval, среди других, признанных в новой статье.
Авторы заявляют:
‘[Мы] принимаем полностью связанный синхронный подход к коммуникации-дебатам, где каждый LVLM получает [ответы] от [других] LVLMs перед тем, как сделать следующий суд. Это создает динамический цикл обратной связи, который усиливает надежность и глубину анализа, поскольку модели корректируют свои оценки на основе новых прозрений, представленных их коллегами.
‘Каждый LVLM может скорректировать свой балл на основе ответов от других LVLMs или оставить его без изменений.’
Множество пар изображений, оцененных людьми, также включено в процесс посредством немногих выстрелов в контексте обучения’
Как только “трибуналы” в цикле приходят к консенсусному баллу, который находится в пределах допустимого диапазона, результаты передаются “мета-судье” LVLM, который синтезирует результаты в окончательный балл.
Смягчение
Далее авторы сосредоточились на процессе смягчения подсказок, описанном ранее.

Схема CopyJudge для смягчения нарушений авторских прав, уточняя подсказки и шум латентных переменных. Система уточняет подсказки итеративно, используя обучение с подкреплением для модификации латентных переменных, снижая риск нарушения.
Два метода, используемые для смягчения подсказок, были контроль подсказок на основе LVLM, когда эффективные не нарушающие подсказки итеративно разрабатываются в кластерах GPT – подход, который полностью “черный ящик”, не требующий внутреннего доступа к архитектуре модели; и подход, основанный на обучении с подкреплением (RL), где награда разработана для наказания выводов, нарушающих авторские права.
Данные и тесты
Для тестирования CopyJudge использовались различные наборы данных, включая D-Rep, который содержит реальные и фальшивые пары изображений, оцененные людьми по шкале от 0 до 5.

Изучение набора данных D-Rep на Hugging Face. Этот набор парно содержит реальные и сгенерированные изображения. Источник: https://huggingface.co/datasets/WenhaoWang/D-Rep/viewer/default/
Схема CopyJudge рассматривала изображения D-Rep, которые получили оценку 4 или выше как примеры нарушений, а остальные были отложены как не имеющие отношения к правам интеллектуальной собственности. 4000 официальных изображений в наборе данных были использованы в качестве тестовых изображений. Кроме того, исследователи выбрали и курировали изображения 10 известных персонажей мультфильмов из Википедии.
Три диффузионные архитектуры, использованные для генерации потенциально нарушающих изображений, были Stable Diffusion V2; Kandinsky2-2; и Stable Diffusion XL. Авторы вручную выбрали нарушающее изображение и не нарушающее изображение из каждой из моделей, в результате чего получилось 60 положительных и 60 отрицательных образцов.
Базовые методы, выбранные для сравнения, были: L2 норма; Изученная перцептивная подобие изображений (LPIPS); SSCD; RLCP; и PDF-Emb. Для метрик использовались точность и F1 балл в качестве критериев для нарушений.
GPT-4o был использован для заполнения внутренних дебатных команд CopyJudge, используя три агента для максимума пяти итераций на любое конкретное представленное изображение. Три случайных изображения из каждого рейтинга в D-Rep были использованы в качестве человеческих априорных знаний для агентов.

Результаты нарушений для CopyJudge в первом раунде.
Из этих результатов авторы комментируют:
‘[Это] очевидно, что традиционные методы обнаружения копий изображений демонстрируют ограничения в задаче выявления нарушений авторских прав. Наш подход значительно превосходит большинство методов. Для современного метода, PDF-Emb, который был обучен на 36 000 образцах из D-Rep, наша производительность на D-Rep немного хуже.
‘Однако его плохая производительность на наборе данных Cartoon IP и Artwork подчеркивает его отсутствие способности к обобщению, тогда как наш метод демонстрирует одинаково отличные результаты во всех наборах данных.’
Авторы также отмечают, что CopyJudge обеспечивает ‘относительно’ более четкую границу между допустимыми и нарушающими случаями:

Дополнительные примеры из раундов тестирования, в дополнительном материале новой статьи.
Исследователи сравнили свои методы с сотрудничеством Sony AI из 2024 года под названием Обнаружение, объяснение и смягчение запоминания в диффузионных моделях. Эта работа использовала донастроенную модель Stable Diffusion с 200 запомненными (т.е. переобученными) изображениями для получения контента, защищенного авторским правом, во время вывода.
Авторы новой работы обнаружили, что их собственный метод смягчения подсказок, по сравнению с подходом 2024 года, смог произвести изображения, которые менее вероятно вызовут нарушения.

Результаты смягчения запоминания с CopyJudge, противопоставленные работе 2024 года.
Авторы комментируют здесь:
‘[Наш] подход может генерировать изображения, которые менее вероятно вызовут нарушения, сохраняя при этом сопоставимую, слегка уменьшенную точность совпадения. Как показано [ниже], наш метод эффективно избегает недостатков [предыдущего] метода, включая неудачи в смягчении запоминания или генерации сильно отклоняющихся изображений.’

Сравнение сгенерированных изображений и подсказок до и после смягчения запоминания.
Авторы провели дальнейшие тесты в отношении смягчения нарушений, изучая явные и неявные нарушения.
Явные нарушения происходят, когда подсказки напрямую ссылаются на контент, защищенный авторским правом, такие как ‘Сгенерируйте изображение Микки Мауса’. Для тестирования этого исследователи использовали 20 образцов мультфильмов и произведений искусства, генерируя нарушающие изображения в Stable Diffusion v2 с подсказками, которые явно включали имена или авторские атрибуты.

Сравнение между методом авторов Latent Control (LC) и методом Prompt Control (PC) предыдущей работы, в различных вариациях, используя Stable Diffusion для создания изображений, изображающих явные нарушения.
Неявные нарушения происходят, когда подсказка не содержит явных ссылок на авторские права, но все равно приводит к нарушающему изображению из-за определенных описательных элементов – сценарий, который особенно актуален для коммерческих текст-изображение моделей, которые часто включают системы обнаружения контента для предотвращения нарушений.
Для изучения этого авторы использовали те же образцы, защищенные авторским правом, что и в тесте явных нарушений, но генерировали нарушающие изображения без прямых ссылок на авторские права, используя DALL-E 3 (хотя в статье отмечается, что встроенный модуль безопасности модели был наблюдаем для отклонения определенных подсказок, которые запускали его фильтры).

Неявные нарушения с использованием DALLE-3, с баллами нарушений и CLIP.
Авторы заявляют:
‘[Это] видно, что наш метод значительно снижает вероятность нарушения, как для явных, так и для неявных нарушений, с лишь незначительным снижением балла CLIP. Балл нарушения после только латентного контроля относительно выше, чем после контроля подсказок, потому что получение не нарушающих латентных переменных без изменения подсказки довольно сложно. Однако мы все еще можем эффективно снизить балл нарушения, сохраняя при этом более высокое качество соответствия изображения и текста.
‘[Ниже] показаны результаты визуализации, где видно, что мы избегаем нарушений авторских прав, сохраняя при этом требования пользователей.’

Сгенерированные изображения до и после смягчения нарушений авторских прав.
Вывод
Хотя это исследование представляет перспективный подход к защите авторских прав в изображениях, сгенерированных ИИ, зависимость от больших моделей зрения и языка (LVLMs) для обнаружения нарушений может вызвать опасения по поводу предвзятости и последовательности, поскольку суждения ИИ могут не всегда соответствовать юридическим стандартам.
Возможно, наиболее важно, что проект также предполагает, что защита авторских прав может быть автоматизирована, несмотря на реальные юридические решения, которые часто включают субъективные и контекстные факторы, которые ИИ может испытывать трудности с интерпретацией.
В реальном мире автоматизация юридического консенсуса, особенно вокруг вывода ИИ, кажется, вероятно, останется спорным вопросом далеко за пределами этого времени и далеко за пределами области, рассматриваемой в этой работе.
Опубликовано в первый раз в понедельник, 24 февраля 2025 года












