Взгляд Anderson
Извлечение данных обучения из тонко настроенных моделей стабильной диффузии

Новые исследования из США представляют метод извлечения значительных частей данных обучения из тонко настроенных моделей.
Это может потенциально предоставить юридические доказательства в случаях, когда стиль художника был скопирован, или когда защищенные авторским правом изображения были использованы для обучения генеративных моделей публичных фигур, персонажей, защищенных авторским правом, или другого контента.

Из новой статьи: оригинальные изображения обучения видны в верхней строке, а извлеченные изображения изображены в нижней строке. Источник: https://arxiv.org/pdf/2410.03039
Такие модели широко и свободно доступны в интернете, в основном через огромные архивы, созданные пользователями на платформе civit.ai, и, в меньшей степени, на платформе Hugging Face.
Новая модель, разработанная исследователями, называется FineXtract, и авторы утверждают, что она достигает лучших результатов в этой задаче.
Статья отмечает:
‘[Наша структура] эффективно решает задачу извлечения данных тонкой настройки из публично доступных контрольных точек DM. Используя переход от распределений pretrained DM к распределениям данных тонкой настройки, FineXtract точно направляет процесс генерации в области с высокой вероятностью распределения данных тонкой настройки, что позволяет успешно извлекать данные.’

В правом углу, оригинальное изображение, использованное в обучении. Второе справа, изображение, извлеченное с помощью FineXtract. Другие столбцы представляют собой альтернативные, предыдущие методы. Пожалуйста, обратитесь к исходной статье для лучшего разрешения.
Почему это важно
Оригинальные обученные модели для текстово-изображенных генеративных систем, такие как Стабильная диффузия и Flux, могут быть загружены и тонко настроены конечными пользователями, используя методы, такие как 2022 DreamBooth.
Более простым способом является создание гораздо меньшей LoRA модели, которая почти так же эффективна, как полностью тонко настроенная модель.

Пример обученной LORA, предлагаемой для бесплатной загрузки на популярном сайте Civitai. Такая модель может быть создана за несколько минут или несколько часов, энтузиастами, использующими локально установленное программное обеспечение с открытым исходным кодом – и онлайн, через некоторые более пермиссивные API-ориентированные системы обучения. Источник: civitai.com
С 2022 года стало тривиальным создание идентификационных тонко настроенных контрольных точек и LoRAs, предоставляя только небольшое (в среднем 5-50) количество подписанных изображений и обучая контрольную точку (или LoRA) локально, на открытом исходном коде, таком как Kohya ss, или используя онлайн-сервисы.
Этот простой метод глубокой подделки получил известность в СМИ за последние несколько лет. Многие художники также имели свою работу внедренной в генеративные модели, которые воспроизводят их стиль. Споры вокруг этих вопросов набрали обороты за последние 18 месяцев.

Легкость, с которой пользователи могут создавать системы ИИ, которые воспроизводят работу реальных художников, вызвала фурор и различные кампании за последние два года. Источник: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/
Трудно доказать, какие изображения были использованы в тонко настроенной контрольной точке или в LoRA, поскольку процесс обобщения ‘абстрагирует’ идентичность из небольших наборов данных обучения и вряд ли когда-либо воспроизведет примеры из наборов данных обучения (за исключением случаев переобучения, когда можно считать, что обучение не удалось).
Вот где FineXtract входит в картину. Сравнивая состояние ‘шаблонной’ модели диффузии, которую пользователь загрузил, с моделью, которую он впоследствии создал через тонкую настройку или через LoRA, исследователи смогли создать высокоточные реконструкции данных обучения.
Хотя FineXtract смог реконструировать только 20% данных из тонкой настройки*, это больше, чем обычно необходимо для предоставления доказательств того, что пользователь использовал защищенные авторским правом или иным образом защищенные или запрещенные материалы при производстве генеративной модели. В большинстве предоставленных примеров извлеченное изображение чрезвычайно близко к известному исходному материалу.
Хотя подписи необходимы для извлечения исходных изображений, это не является значительным барьером по двум причинам: а) загрузчик обычно хочет облегчить использование модели в сообществе и обычно предоставляет подходящие примеры подсказок; и б) не так сложно, как обнаружили исследователи, извлечь ключевые термины слепым методом из тонко настроенной модели:

Ключевые слова можно обычно извлечь слепым методом из тонко настроенной модели, используя атаку L2-PGD за 1000 итераций, из случайной подсказки.
Пользователи часто избегают предоставления своих наборов данных обучения вместе с ‘черным ящиком’-стилем обученной модели. Для исследования авторы сотрудничали с энтузиастами машинного обучения, которые действительно предоставили наборы данных.
Новая статья озаглавлена Раскрытие невидимого: руководство персонализированными моделями диффузии для раскрытия данных обучения и исходит от трех исследователей из университетов Carnegie Mellon и Purdue.
Метод
‘Атакующий’ (в данном случае, система FineXtract) сравнивает оцененные распределения данных по исходной и тонко настроенной модели, в процессе, который авторы называют ‘руководством модели’.

Через ‘руководство модели’, разработанное исследователями новой статьи, характеристики тонкой настройки можно сопоставить, что позволяет извлечь данные обучения.
Авторы объясняют:
‘Во время процесса тонкой настройки [модели диффузии] постепенно смещают свое распределение от распределения pretrained DM к распределению тонко настроенных данных.’
‘Таким образом, мы параметрически аппроксимируем распределение тонко настроенных [моделей диффузии].’
Таким образом, сумма разницы между основной и тонко настроенной моделью обеспечивает процесс руководства.
Авторы далее комментируют:
‘С помощью руководства модели мы можем эффективно симулировать ‘псевдо-‘[деноизер], который можно использовать для направления процесса выборки в область с высокой вероятностью внутри распределения тонко настроенных данных.’
Руководство опирается частично на процесс шумоподавления, подобный 2023 outing Erasing Concepts from Diffusion Models.
Предсказание денозинга также обеспечивает вероятную классификаторное руководство (CFG) масштаб. Это важно, поскольку CFG существенно влияет на качество изображения и верность текстовой подсказке пользователя.
Для улучшения точности извлеченных изображений FineXtract опирается на известное 2023 сотрудничество Извлечение данных обучения из моделей диффузии. Используемый метод заключается в вычислении сходства каждой пары сгенерированных изображений на основе порога, определенного самообученным дескриптором (SSCD) балла.
Таким образом, алгоритм кластеризации помогает FineXtract определить подмножество извлеченных изображений, соответствующих данным обучения.
В этом случае исследователи сотрудничали с пользователями, которые предоставили данные. Можно разумно сказать, что, в отсутствие таких данных, было бы невозможно доказать, что какое-либо конкретное сгенерированное изображение было фактически использовано в обучении в исходном. Однако теперь относительно просто сопоставить загруженные изображения либо с живыми изображениями в интернете, либо с изображениями, которые также находятся в известных и опубликованных наборах данных, основываясь только на содержании изображения.
Данные и тесты
Для тестирования FineXtract авторы провели эксперименты на моделях с небольшим количеством данных тонкой настройки в двух наиболее распространенных сценариях тонкой настройки, в рамках проекта: стили художников и объектно-ориентированная генерация (последняя эффективно охватывает генерацию на основе лица).
Они случайным образом выбрали 20 художников (каждый с 10 изображениями) из набора данных WikiArt и 30 объектов (каждый с 5-6 изображениями) из набора данных DreamBooth, чтобы решить эти соответствующие сценарии.
DreamBooth и LoRA были целевыми методами тонкой настройки, и Stable Diffusion V1/.4 использовалась для тестов.
Если алгоритм кластеризации не возвращает результатов после тридцати секунд, порог изменяется до тех пор, пока изображения не будут возвращены.
Два метрики, используемых для сгенерированных изображений, были средним сходством (AS) по SSCD и средним показателем успешного извлечения (A-ESR) – мерой, в целом соответствующей предыдущим работам, где балл 0,7 представляет минимальное значение для обозначения полного успешного извлечения данных обучения.
Поскольку предыдущие подходы использовали либо прямую генерацию текст-изображение, либо CFG, исследователи сравнили FineXtract с этими двумя методами.

Результаты сравнения FineXtract с двумя наиболее популярными предыдущими методами.
Авторы комментируют:
‘Результаты демонстрируют значительное преимущество FineXtract над предыдущими методами, с улучшением примерно 0,02 до 0,05 в AS и удвоением A-ESR в большинстве случаев.’
Для тестирования способности метода обобщаться на новые данные исследователи провели дополнительный тест, используя Stable Diffusion (V1.4), Stable Diffusion XL и AltDiffusion.

FineXtract, примененный к различным моделям диффузии. Для компонента WikiArt тест был сосредоточен на четырех классах WikiArt.
Как видно из результатов, FineXtract смог достичь улучшения над предыдущими методами и в этом более широком тесте.

Качественное сравнение извлеченных результатов из FineXtract и предыдущих подходов. Пожалуйста, обратитесь к исходной статье для лучшего разрешения.
Авторы отмечают, что когда увеличивается количество изображений, используемых в наборе данных для тонко настроенной модели, алгоритм кластеризации необходимо запускать в течение более длительного периода времени, чтобы остаться эффективным.
Они также отмечают, что были разработаны различные методы в последние годы, предназначенные для препятствования такому извлечению, под предлогом защиты конфиденциальности. Поэтому они протестировали FineXtract против данных, дополненных методами Cutout и RandAugment.

FineXtract’s производительность против изображений, защищенных Cutout и RandAugment.
Хотя авторы признают, что две системы защиты работают довольно хорошо в сокрытии источников данных обучения, они отмечают, что это происходит за счет снижения качества вывода, настолько серьезного, что делает защиту бессмысленной:

Изображения, произведенные под Stable Diffusion V1.4, тонко настроенные с защитными мерами – которые значительно снижают качество изображения. Пожалуйста, обратитесь к исходной статье для лучшего разрешения.
Статья заключает:
‘Наши эксперименты демонстрируют прочность метода в различных наборах данных и реальных контрольных точках, подчеркивая потенциальные риски утечки данных и предоставляя убедительные доказательства нарушений авторских прав.’
Вывод
2024 год стал годом, когда интерес корпораций к ‘чистым’ данным обучения значительно возрос, в связи с продолжающимся освещением в СМИ склонности ИИ заменять людей и перспективой юридической защиты генеративных моделей, которые они сами так стремятся использовать.
Легко заявить, что ваши данные обучения чисты, но становится все легче для подобных технологий доказать, что они не чисты – как обнаружили Runway ML, Stability.ai и MidJourney (среди других) в последние дни.
Проекты, такие как FineXtract, можно считать знаками абсолютного конца ‘дикого запада’ эпохи ИИ, где даже, казалось бы, оккультная природа обученной латентной области может быть привлечена к ответственности.
* Для удобства мы будем считать ‘тонкую настройку и LoRA’, где необходимо.
Опубликовано в понедельник, 7 октября 2024 года












