Взгляд Anderson

Форензический метод данных для нового поколения дипфейков

mm
Добавьте Unite.AI в избранные источники в Google
Variation on ' a 1792x1024 image of a lab technician examining a Guy Fawkes mask with forensic equipment.' - Adobe Firefly

Хотя создание дипфейков частных лиц стало растущей общественной проблемой и все чаще запрещается в различных регионах, фактическое доказательство того, что пользовательская модель – такая, как та, которая позволяет мстить за порнографию, – была специально обучена на изображениях конкретного человека, остается крайне сложным.

Чтобы поставить проблему в контекст: ключевым элементом атаки дипфейка является ложное заявление о том, что изображение или видео изображает конкретного человека. Просто заявление о том, что кто-то в видео является идентификатором #A, а не просто двойником, достаточно, чтобы причинить вред, и для этого не требуется никакой ИИ.

Однако, если нападавший генерирует изображения или видео ИИ с помощью моделей, обученных на реальных данных человека, системы распознавания лиц социальных сетей и поисковых систем автоматически связывают фальшивый контент с жертвой – без необходимости имен в постах или метаданных. Само ИИ-генерируемый визуальный контент обеспечивает ассоциацию.

Чем более отличается внешность человека, тем более неизбежным это становится, пока фабрикованный контент не появится в поиске изображений и, в конечном итоге, достигнет жертвы.

Лицом к лицу

Наиболее распространенным средством распространения моделей, ориентированных на идентификацию, в настоящее время является Low-Rank Adaptation (LoRA), при котором пользователь обучает небольшое количество изображений в течение нескольких часов против весов гораздо большей основной модели, такой как Stable Diffusion (для статических изображений, в основном) или Hunyuan Video для видео-дипфейков.

Наиболее распространенными целями LoRAs, включая новое поколение видео-LoRAs, являются знаменитые женщины, чья слава подвергает их такому обращению с меньшей общественной критикой, чем в случае с “неизвестными” жертвами, из-за предположения, что такие производные работы являются объектом “честного использования” (по крайней мере в США и Европе).

Женские знаменитости доминируют в списках LoRA и Dreambooth на портале civit.ai. Самый популярный LoRA в настоящее время имеет более 66 000 загрузок, что является значительным, учитывая, что такое использование ИИ все еще считается “маргинальной” деятельностью.

Не существует такого же публичного форума для не-знаменитых жертв дипфейков, которые появляются в СМИ только тогда, когда возникают дела о преследовании, или когда жертвы высказываются в популярных изданиях.

Однако, в обоих случаях, модели, используемые для фальсификации идентификации, “дистиллируют” свои данные обучения так полно в латентное пространство модели, что становится трудно определить исходные изображения, которые были использованы.

Если бы было возможно сделать это в пределах приемлемой погрешности, это позволило бы преследовать тех, кто делится LoRAs, поскольку это не только доказывает намерение создать дипфейк конкретной идентификации (т.е. конкретного “неизвестного” человека, даже если злоумышленник никогда не называет его во время процесса клеветы), но также подвергает загрузчика обвинениям в нарушении авторских прав, где применимо.

Последнее было бы полезно в юрисдикциях, где правовое регулирование технологий дипфейков отсутствует или отстает.

Переэкспозиция

Целью обучения основной модели, такой как многогигабайтная базовая модель, которую пользователь может скачать с Hugging Face, является то, что модель должна стать хорошо-генерализированной и пластичной. Это включает в себя обучение на достаточном количестве разнообразных изображений и с подходящими настройками, и завершение обучения до того, как модель “переобучится” на данных.

Переобученная модель увидела данные так много раз (чрезмерно) во время процесса обучения, что она будет склонна воспроизводить изображения, которые очень похожи, тем самым раскрывая источник данных обучения.

Идентификатор 'Ann Graham Lotz' можно почти идеально воспроизвести в модели Stable Diffusion V1.5. Реконструкция почти идентична данным обучения (слева на изображении выше). Источник: https://arxiv.org/pdf/2301.13188

Идентификатор ‘Ann Graham Lotz’ можно почти идеально воспроизвести в модели Stable Diffusion V1.5. Реконструкция почти идентична данным обучения (слева на изображении выше). Источник: https://arxiv.org/pdf/2301.13188

Однако переобученные модели обычно отбрасываются их создателями, а не распространяются, поскольку они в любом случае непригодны для использования. Поэтому это маловероятный форензический “везение”. В любом случае, принцип применяется более к дорогому и высокообъемному обучению основной модели, где множественные версии одного и того же изображения, которые проникли в огромный источник данных, могут сделать определенные данные обучения легко вызываемыми (см. изображение и пример выше).

Вещи немного отличаются в случае LoRA и Dreambooth моделей (хотя Dreambooth вышел из моды из-за своих больших размеров файлов). Здесь пользователь выбирает очень ограниченное количество разнообразных изображений объекта и использует их для обучения LoRA.

Слева, вывод из Hunyuan Video LoRA. Справа, данные, которые сделали сходство возможным (изображения использованы с разрешения человека, изображенного).

Слева, вывод из Hunyuan Video LoRA. Справа, данные, которые сделали сходство возможным (изображения использованы с разрешения человека, изображенного).

Часто LoRA имеет обученный встроенный триггер-слово, такое как [имя_знаменитости]. Однако очень часто конкретно обученный объект появляется в сгенерированном выводе даже без таких подсказок, потому что даже хорошо сбалансированная (т.е. не переобученная) LoRA немного “зависима” от материала, на котором она была обучена, и будет склонна включать его в любой вывод.

Эта предрасположенность, в сочетании с ограниченным количеством изображений, оптимальным для набора данных LoRA, подвергает модель форензическому анализу, как мы увидим.

Раскрытие данных

Эти вопросы решаются в новой статье из Дании, которая предлагает методологию для выявления исходных изображений (или групп исходных изображений) в черном ящике Мембершип Инференс Атаке (MIA). Техника, по крайней мере частично, включает в себя использование пользовательских обученных моделей, предназначенных для того, чтобы помочь раскрыть исходные данные, генерируя свои собственные “дипфейки”:

Примеры 'фальшивых' изображений, сгенерированных новым подходом, на все более высоких уровнях Classifier-Free Guidance (CFG), до точки разрушения. Источник: https://arxiv.org/pdf/2502.11619

Примеры ‘фальшивых’ изображений, сгенерированных новым подходом, на все более высоких уровнях Classifier-Free Guidance (CFG), до точки разрушения. Источник: https://arxiv.org/pdf/2502.11619

Хотя работа, озаглавленная Мембершип Инференс Атаки для изображений лиц против Fine-Tuned Latent Diffusion Моделей, является наиболее интересным вкладом в литературу по этой конкретной теме, она также является недоступной и кратко написанной статьей, которая требует значительного расшифровки. Поэтому мы рассмотрим хотя бы основные принципы, лежащие в основе этого проекта, и некоторые из результатов, полученных.

По сути, если кто-то дообучает модель ИИ на вашем лице, метод авторов может помочь доказать это, выявляя характерные признаки запоминания в сгенерированных изображениях модели.

Сначала целевая модель ИИ дообучается на наборе данных изображений лиц, что делает ее более вероятной для воспроизведения деталей из этих изображений в ее выводе. Затем режим атаки обучается с помощью наблюдаемого обучения и проверяется на новых изображениях, чтобы определить, были ли они частью исходного набора данных дообучения целевой модели. Чтобы оценить точность атаки, 15% тестовых данных откладываются для проверки.

Поскольку целевая модель дообучается на известном наборе данных, фактический статус членства каждого изображения уже установлен при создании обучающих данных для модели атаки. Этот контролируемый сетап позволяет четко оценить, насколько эффективно модель атаки может различать изображения, которые были частью набора данных дообучения, и те, которые не были.

Для этих тестов использовалась модель Stable Diffusion V1.5. Хотя эта довольно старая модель часто встречается в исследованиях из-за необходимости последовательного тестирования и обширного корпуса предыдущей работы, которая использует ее, это является подходящим случаем; V1.5 оставалась популярной для создания LoRA в сообществе хоббиистов Stable Diffusion в течение долгого времени, несмотря на множество последующих выпусков версий, и даже несмотря на появление Flux – потому что модель полностью нецензурирована.

Модель атаки исследователей была основана на Resnet-18, с сохраненными предварительно обученными весами модели. Последний слой ResNet-18 с 1000 нейронами был заменен на полностью связанный слой с двумя нейронами. Обучение потери было категориальной кросс-энтропией, и использовался оптимизатор Adam.

Для каждого теста модель атаки обучалась пять раз с помощью разных случайных семян, чтобы вычислить 95% доверительных интервалов для ключевых метрик. Zero-shot классификация с помощью модели CLIP использовалась в качестве базовой.

(Пожалуйста, обратите внимание, что исходная основная таблица результатов в статье кратка и необычно трудна для понимания. Поэтому я переформулировал ее ниже в более удобном формате. Пожалуйста, нажмите на изображение, чтобы увидеть его в лучшем разрешении)

Сводка результатов всех тестов. Нажмите на изображение, чтобы увидеть его в лучшем разрешении

Сводка результатов всех тестов. Нажмите на изображение, чтобы увидеть его в лучшем разрешении

Метод атаки исследователей оказался наиболее эффективным при нацеливании на дообученные модели, особенно те, которые были обучены на конкретном наборе изображений, таких как лицо человека. Однако, хотя атака может определить, был ли использован набор данных, она испытывает трудности в выявлении отдельных изображений внутри этого набора.

В практическом смысле последнее не обязательно является препятствием для использования такого подхода в форензической сфере; в то время как существует относительно мало ценности в установлении того, что известный набор данных, такой как ImageNet, был использован в модели, нападавший на частное лицо (не знаменитость) будет склонен иметь гораздо меньше выбора источников данных и будет должен полностью использовать доступные группы данных, такие как альбомы социальных сетей и другие онлайн-коллекции. Эти группы данных эффективно создают “хэш”, который может быть раскрыт методами, описанными выше.

Статья отмечает, что еще одним способом улучшить точность является использование ИИ-генерированных изображений в качестве “не-членов”, а не полагаться исключительно на реальные изображения. Это предотвращает искусственно высокие показатели успеха, которые могли бы в противном случае ввести в заблуждение результаты.

Дополнительным фактором, который существенно влияет на обнаружение, отмечают авторы, является водяной знак. Когда обучающие изображения содержат видимые водяные знаки, атака становится высокоэффективной, в то время как скрытые водяные знаки предлагают мало или никакого преимущества.

Правая фигура показывает фактический 'скрытый' водяной знак, использованный в тестах.

Правая фигура показывает фактический ‘скрытый’ водяной знак, использованный в тестах.

Наконец, уровень руководства в генерации текст-изображение также играет роль, с идеальным балансом, найденным на уровне руководства около 8. Даже когда не используется прямая подсказка, дообученная модель все равно склонна производить вывод, который напоминает ее данные обучения, подкрепляя эффективность атаки.

Метод/Данные

Несколько наборов данных из Технического университета Дании (DTU, принимающего учреждения для трех исследователей) были использованы в исследовании, для дообучения целевой модели и для обучения и тестирования режима атаки.

Наборы данных, использованные в исследовании, были получены из DTU Orbit:

DseenDTU Базовый набор изображений.

DDTU Изображения, полученные из DTU Orbit.

DseenDTU Раздел DDTU, использованный для дообучения целевой модели.

DunseenDTU Раздел DDTU, который не был использован для дообучения любой модели генерации изображений и вместо этого был использован для тестирования или обучения модели атаки.

wmDseenDTU Раздел DDTU с видимыми водяными знаками, использованный для дообучения целевой модели.

hwmDseenDTU Раздел DDTU со скрытыми водяными знаками, использованный для дообучения целевой модели.

DgenDTU Изображения, сгенерированные Latent Diffusion Моделью (LDM), которая была дообучена на наборе изображений DseenDTU.

Наборы данных, использованные для дообучения целевой модели, состоят из пар изображений и текста, подписанных BLIP моделью подписи (возможно, не случайно одной из самых популярных нецензурированных моделей в сообществе ИИ).

BLIP была установлена на добавление фразы ‘a dtu headshot of a’ к каждому описанию.

Кроме того, несколько наборов данных из Университета Ольборга (AAU) были использованы в тестах, все полученные из AU VBN корпуса:

DAAU Изображения, полученные из AAU vbn.

DseenAAU Раздел DAAU, использованный для дообучения целевой модели.

DunseenAAU Раздел DAAU, который не используется для дообучения любой модели генерации изображений, а вместо этого используется для тестирования или обучения модели атаки.

DgenAAU Изображения, сгенерированные LDM, дообученной на наборе изображений DseenAAU.

Эквивалентно предыдущим наборам, фраза ‘a aau headshot of a’ использовалась. Это обеспечило, что все метки в наборе данных DTU следовали формату ‘a dtu headshot of a (…)’, подкрепляя основные характеристики набора данных во время дообучения.

Тесты

Было проведено несколько экспериментов, чтобы оценить, насколько хорошо membership inference атаки выполняются против целевой модели. Каждый тест был направлен на определение того, возможно ли провести успешную атаку в рамках схемы, показанной ниже, где целевая модель дообучается на наборе данных изображений, полученном без разрешения.

Схема подхода.

Схема подхода.

С дообученной моделью, запрошенной для генерации вывода изображений, эти изображения затем используются в качестве положительных примеров для обучения модели атаки, в то время как дополнительные не связанные изображения включены в качестве отрицательных примеров.

Модель атаки обучается с помощью наблюдаемого обучения и затем проверяется на новых изображениях, чтобы определить, были ли они частью исходного набора данных дообучения целевой модели. Чтобы оценить точность атаки, 15% тестовых данных откладываются для проверки.

Поскольку целевая модель дообучается на известном наборе данных, фактический статус членства каждого изображения уже установлен при создании обучающих данных для модели атаки. Этот контролируемый сетап позволяет четко оценить, насколько эффективно модель атаки может различать изображения, которые были частью набора данных дообучения, и те, которые не были.

Метод атаки исследователей оказался наиболее эффективным при нацеливании на дообученные модели, особенно те, которые были обучены на конкретном наборе изображений, таких как лицо человека. Однако, хотя атака может определить, был ли использован набор данных, она испытывает трудности в выявлении отдельных изображений внутри этого набора.

В практическом смысле последнее не обязательно является препятствием для использования такого подхода в форензической сфере; в то время как существует относительно мало ценности в установлении того, что известный набор данных, такой как ImageNet, был использован в модели, нападавший на частное лицо (не знаменитость) будет склонен иметь гораздо меньше выбора источников данных и будет должен полностью использовать доступные группы данных, такие как альбомы социальных сетей и другие онлайн-коллекции. Эти группы данных эффективно создают “хэш”, который может быть раскрыт методами, описанными выше.

Статья отмечает, что еще одним способом улучшить точность является использование ИИ-генерированных изображений в качестве “не-членов”, а не полагаться исключительно на реальные изображения. Это предотвращает искусственно высокие показатели успеха, которые могли бы в противном случае ввести в заблуждение результаты.

Дополнительным фактором, который существенно влияет на обнаружение, отмечают авторы, является водяной знак. Когда обучающие изображения содержат видимые водяные знаки, атака становится высокоэффективной, в то время как скрытые водяные знаки предлагают мало или никакого преимущества.

Правая фигура показывает фактический 'скрытый' водяной знак, использованный в тестах.

Правая фигура показывает фактический ‘скрытый’ водяной знак, использованный в тестах.

Наконец, уровень руководства в генерации текст-изображение также играет роль, с идеальным балансом, найденным на уровне руководства около 8. Даже когда не используется прямая подсказка, дообученная модель все равно склонна производить вывод, который напоминает ее данные обучения, подкрепляя эффективность атаки.

Заключение

Это жаль, что эта интересная статья была написана таким образом, что она недоступна, поскольку она должна быть интересна как защитникам конфиденциальности, так и исследователям ИИ.

Хотя membership inference атаки могут оказаться интересным и плодотворным форензическим инструментом, возможно, более важно, чтобы эта ветвь исследований разработала применимые общие принципы, чтобы не оказаться в той же игре “кто первый” (whack-a-mole), которая произошла с обнаружением дипфейков в целом, когда выпуск новой модели отрицательно влияет на обнаружение и подобные форензические системы.

Поскольку существует некоторая证ательная база более высокого руководящего принципа, очищенного в этом новом исследовании, мы можем надеяться увидеть больше работы в этом направлении.

Опубликовано впервые в пятницу, 21 февраля 2025 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai