Взгляд Anderson
Меньшие глубокие подделки могут быть большей угрозой

Инструменты разговорного ИИ, такие как ChatGPT и Google Gemini, теперь используются для создания глубоких подделок, которые не меняют лица, а rather в более тонких способах переписывают всю историю внутри изображения. Изменяя жесты, реквизит и фон, эти правки обманывают как системы обнаружения ИИ, так и людей, повышая ставки для определения того, что реально в Интернете.
В текущей ситуации, особенно после принятия значимых законов, таких как TAKE IT DOWN акт, многие из нас ассоциируют глубокие подделки и синтез идентичности, управляемый ИИ, с неправомерным ИИ-порно и политической манипуляцией – в целом, грубые искажения правды.
Это привыкает нас ожидать, что ИИ-манипулированные изображения всегда будут стремиться к высоким ставкам контента, где качество рендеринга и манипуляция контекстом могут добиться успеха в достижении кредибилитета, по крайней мере в краткосрочной перспективе.
Исторически, однако, гораздо более тонкие изменения часто имели более зловещее и долгосрочное влияние – например, фотографические трюки, которые позволили Сталину удалить тех, кто вышел из благосклонности из фотографического документа, как это было сатирически изображено в романе Джорджа Оруэлла 1984, где протагонист Уинстон Смит проводит свои дни, переписывая историю и создавая, уничтожая и «исправляя» фотографии.
В следующем примере проблема со вторым изображением заключается в том, что мы «не знаем, чего не знаем» – что бывший глава секретной полиции Сталина, Николай Ежов, раньше занимал место, где теперь есть только барьер безопасности:

Теперь вы его видите, теперь он…исчез. Сталинская фотографическая манипуляция удаляет компрометированного члена партии из истории. Источник: общественное достояние, через https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html
Текущие такого рода, часто повторяющиеся, сохраняются во многих отношениях; не только культурно, но и в компьютерном зрении, которое выводит тенденции из статистически доминирующих тем и мотивов в обучающих наборах данных. Например, тот факт, что смартфоны снизили барьер для входа и значительно снизили стоимость фотографии, означает, что их иконография стала неотвратимо связанной с многими абстрактными понятиями, даже когда это неуместно.
Если обычная глубокая подделка может быть воспринята как акт «нападения», пернicious и постоянные незначительные изменения в аудиовизуальных средствах массовой информации более похожи на «газлайтинг». Кроме того, способность этого типа глубокой подделки остаться незамеченной делает ее трудной для выявления с помощью современных систем обнаружения глубоких подделок (которые ищут грубые изменения). Этот подход более похож на воду, изнашивающую скалу в течение длительного периода, чем на камень, брошенный в голову.
MultiFakeVerse
Исследователи из Австралии сделали шаг, чтобы устранить недостаток внимания к «тонким» глубоким подделкам в литературе, создав значительный новый набор данных из манипулированных изображений, которые изменяют контекст, эмоции и нарратив без изменения основной идентичности субъекта:

Выборка из нового собрания, реальные/фальшивые пары, с некоторыми изменениями более тонкими, чем другие. Обратите внимание, например, на потерю власти у азиатской женщины, в правом нижнем углу, когда ее стетоскоп врача удаляется ИИ. Источник: https://huggingface.co/datasets/parulgupta/MultiFakeVerse_preview
Названный MultiFakeVerse, коллекция состоит из 845 826 изображений, сгенерированных с помощью моделей зрения и языка (VLM), которые можно доступить онлайн и скачать, с разрешением.
Авторы заявляют:
‘Этот подход VLM позволяет сделать семантические, контекстно-осведомленные изменения, такие как изменение действий, сцен и взаимодействий человека и объекта, а не синтетические или низкоуровневые обмены идентичности и редактирование регионов, распространенные в существующих наборах данных.’
‘Наши эксперименты показывают, что текущие модели обнаружения глубоких подделок и человеческие наблюдатели испытывают трудности в обнаружении этих тонких, но значимых манипуляций.’
Исследователи протестировали как людей, так и ведущие системы обнаружения глубоких подделок на своем новом наборе данных, чтобы увидеть, насколько хорошо эти тонкие манипуляции можно было бы выявить. Человеческие участники испытывали трудности, правильно классифицируя изображения как реальные или фальшивые только примерно в 62% случаев, и имели еще больше трудностей с определением того, какие части изображения были изменены.
Существующие детекторы глубоких подделок, обученные в основном на более очевидных наборах данных с обменом лиц или инпейтингом, также показали плохие результаты, часто не замечая, что была проведена какая-либо манипуляция. Даже после тонкой настройки на MultiFakeVerse, показатели обнаружения оставались низкими, демонстрируя, насколько плохо текущие системы справляются с этими тонкими, нарративно-ориентированными редакциями.
Новая статья озаглавлена Multiverse Through Deepfakes: The MultiFakeVerse Dataset of Person-Centric Visual and Conceptual Manipulations и исходит от пяти исследователей из Университета Монаша в Мельбурне и Университета Кертин в Перте. Код и связанные данные были выпущены на GitHub, в дополнение к хостингу Hugging Face, упомянутому ранее.
Метод
Набор данных MultiFakeVerse был построен из четырех реальных наборов изображений, на которых изображены люди в различных ситуациях: EMOTIC; PISC, PIPA и PIC 2.0. Начиная с 86 952 исходных изображений, исследователи сгенерировали 758 041 манипулированную версию.
Фреймворки Gemini-2.0-Flash и ChatGPT-4o были использованы для предложения шести минимальных редакций для каждого изображения – редакций, предназначенных для тонкого изменения того, как самый заметный человек на изображении воспринимается зрителем.
Модели были проинструктированы сгенерировать изменения, которые сделали бы субъекта наивным, гордым, раскаивающимся, неопытным или беззаботным, или отрегулировать какой-либо фактический элемент сцены. Вместе с каждой редакцией модели также сгенерировали ссылочное выражение, чтобы четко определить цель изменения, обеспечивая, чтобы последующий процесс редактирования мог применить изменения к правильному человеку или объекту в каждом изображении.
Авторы уточняют:
‘Обратите внимание, что ссылочное выражение – это широко исследованная область в сообществе, которая означает фразу, которая может разъяснить цель в изображении, например, для изображения с двумя мужчинами, сидящими за столом, одним говорящим по телефону, а другим просматривающим документы, подходящее ссылочное выражение для последнего будет человек слева, держащий лист бумаги.’
Как только редакции были определены, фактическая манипуляция изображением была проведена путем предложения моделей зрения и языка применить указанные изменения, оставив остальную часть сцены нетронутой. Исследователи протестировали три системы для этой задачи: GPT-Image-1; Gemini-2.0-Flash-Image-Generation; и ICEdit.
После генерации двадцати двух тысяч образцов Gemini-2.0-Flash оказался наиболее последовательным методом, производящим редакции, которые естественно сливались с сценой без введения видимых артефактов; ICEdit часто производил более очевидные подделки, с заметными недостатками в измененных областях; и GPT-Image-1 иногда затрагивал не предназначенные части изображения, частично из-за его соответствия фиксированным соотношениям сторон выхода.
Анализ изображений
Каждое манипулированное изображение было сравнено с его оригиналом, чтобы определить, какая часть изображения была изменена. Различия на уровне пикселей между двумя версиями были рассчитаны, с небольшим случайным шумом, отфильтрованным для сосредоточения внимания на значимых редакциях. В некоторых изображениях только крошечные области были затронуты; в других до восьмидесяти процентов сцены было изменено.
Для оценки того, насколько смысл каждого изображения сместился в свете этих изменений, были сгенерированы подписи как для исходных, так и для манипулированных изображений с помощью модели зрения и языка ShareGPT-4V.
Эти подписи были затем преобразованы в вложения с помощью Long-CLIP, что позволило сравнить, насколько содержание отклонилось между версиями. Наиболее сильные семантические изменения были обнаружены в случаях, когда объекты, близкие к или直接 связанные с человеком, были изменены, поскольку эти небольшие изменения могли существенно изменить, как изображение интерпретируется.
Gemini-2.0-Flash был затем использован для классификации типа манипуляции, примененной к каждому изображению, на основе того, где и как были сделаны редакции. Манипуляции были сгруппированы в три категории: редакции на уровне человека включали изменения выражения лица субъекта, позы, взгляда, одежды или других личных особенностей; редакции на уровне объекта затрагивали объекты, связанные с человеком, такие как объекты, которые он держал или взаимодействовал с на переднем плане; и редакции на уровне сцены включали фоновые элементы или более широкие аспекты обстановки, которые не直接 включали человека.

Конвейер генерации набора данных MultiFakeVerse начинается с реальных изображений, где модели зрения и языка предлагают нарративные редакции, нацеленные на людей, объекты или сцены. Источник: https://arxiv.org/pdf/2506.00868
Поскольку отдельные изображения могли содержать несколько типов редакций одновременно, распределение этих категорий было отображено на протяжении всего набора данных. Приблизительно одна треть редакций была нацелена только на человека, около одной пятой затрагивали только сцену, и около одной шестой были ограничены объектами.
Оценка перцептивного воздействия
Gemini-2.0-Flash был использован для оценки того, как манипуляции могут изменить восприятие зрителем по шести областям: эмоция, личная идентичность, динамика власти, нарратив сцены, намерение манипуляции и этические проблемы.
Для эмоции редакции часто описывались терминами, такими как радостный, занимательный или доступный, что предполагает сдвиги в том, как субъекты были эмоционально представлены. В нарративных терминах слова, такие как профессиональный или различный, указывали на изменения в подразумеваемой истории или обстановке:

Gemini-2.0-Flash был проинструктирован оценить, как каждая манипуляция повлияла на шесть аспектов восприятия зрителем. Справа: облака слов, суммирующие сдвиги в эмоции, идентичности, нарративе сцены, намерении, динамике власти и этических проблемах на протяжении всего набора данных.
Описания сдвигов идентичности включали термины, такие как молодой, игривый и уязвимый, показывая, как незначительные изменения могли повлиять на то, как люди воспринимались. Намерение за многими редакциями было помечено как убедительный, обманчивый или эстетический. Хотя большинство редакций были признаны как вызывающие только легкие этические проблемы, небольшая доля была признана как несущая умеренные или серьезные этические последствия.

Примеры из MultiFakeVerse, показывающие, как небольшие редакции смещают восприятие зрителем. Желтые коробки выделяют измененные области, с сопровождающим анализом изменений в эмоции, идентичности, нарративе и этических проблемах.
Метрики
Визуальное качество коллекции MultiFakeVerse было оценено с помощью трех стандартных метрик: Пиковая отношение сигнала к шуму (PSNR); Индекс структурированного подобия (SSIM); и Расстояние Фреше-Инсепшена (FID):

Оценки качества изображения для MultiFakeVerse, измеренные PSNR, SSIM и FID.
Оценка SSIM в 0,5774 отражает умеренную степень подобия, соответствующую цели сохранения большей части изображения при применении нацеленных редакций; оценка FID в 3,30 предполагает, что сгенерированные изображения сохраняют высокое качество и разнообразие; и значение PSNR в 66,30 децибел указывает на то, что изображения сохраняют хорошую визуальную верность после манипуляции.
Исследование пользователей
Было проведено исследование пользователей, чтобы увидеть, насколько хорошо люди могут обнаружить тонкие подделки в MultiFakeVerse. Восемнадцать участников были показаны пятьдесят изображений, равномерно разделенных между реальными и манипулированными примерами, охватывающими диапазон типов редакций. Каждый человек был попросен классифицировать, является ли изображение реальным или фальшивым, и, если фальшивым, определить, какой тип манипуляции был применен.
Общая точность определения реального или фальшивого составила 61,67 процента, что означает, что участники неправильно классифицировали изображения более одной трети времени.
Авторы заявляют:
‘Анализируя прогнозы людей о уровнях манипуляций для фальшивых изображений, среднее пересечение между прогнозируемыми и фактическими уровнями манипуляций было обнаружено на уровне 24,96%. ‘
‘Это показывает, что для человеческих наблюдателей не тривиально определить области манипуляций в нашем наборе данных.’
Создание набора данных MultiFakeVerse потребовало обширных вычислительных ресурсов: для генерации инструкций редактирования было сделано более 845 000 вызовов API к моделям Gemini и GPT, с этими задачами предложения, стоившими около 1000 долларов; производство изображений на основе Gemini стоило примерно 2867 долларов; и генерация изображений с помощью GPT-Image-1 стоила примерно 200 долларов. Изображения ICEdit были созданы локально на GPU NVIDIA A6000, завершив задачу примерно за двадцать четыре часа.
Тесты
До тестов набор данных был разделен на обучающие, проверочные и тестовые наборы, сначала выбрав 70% реальных изображений для обучения; 10 процентов для проверки; и 20 процентов для тестирования. Манипулированные изображения, сгенерированные из каждого реального изображения, были назначены в тот же набор, что и соответствующее исходное.

Дополнительные примеры реального (слева) и измененного (справа) контента из набора данных.
Производительность по обнаружению фальшивок была измерена с помощью точности на уровне изображения (определяется ли система правильно классифицирует все изображение как реальное или фальшивое) и оценки F1. Для определения манипулированных областей оценка использовала Площадь под кривой (AUC), оценки F1 и пересечение по объединению (IoU).
Набор данных MultiFakeVerse был использован против ведущих систем обнаружения глубоких подделок на полном тестовом наборе, с конкурирующими фреймворками, являющимися CnnSpot; AntifakePrompt; TruFor; и основанной на языке и видении SIDA. Каждая модель была сначала оценена в нулевом режиме, используя ее исходные предварительно обученные веса без дальнейшего регулирования.
Две модели, CnnSpot и SIDA, были затем тонко настроены на обучающих данных MultiFakeVerse, чтобы оценить, улучшает ли повторная训ировка производительность.

Результаты обнаружения глубоких подделок на MultiFakeVerse в нулевом и тонко настроенном режимах. Числа в скобках показывают изменения после тонкой настройки.
Из этих результатов авторы заявляют:
‘[Модели] обученные на более ранних наборах данных с обменом лиц или инпейтингом испытывают трудности в выявлении наших VLM-редакций, особенно CNNSpot склонен классифицировать почти все изображения как реальные. AntifakePrompt имеет лучшую нулевую производительность с 66,87% средней точности класса и 55,55% оценки F1. ‘
‘После тонкой настройки на нашем обучающем наборе мы наблюдаем улучшение производительности как в CNNSpot, так и в SIDA-13B, с CNNSpot, превосходящим SIDA-13B как по средней точности класса (на 1,92%), так и по оценке F1 (на 1,97%).’
SIDA-13B был оценен на MultiFakeVerse, чтобы измерить, насколько точно он может определить манипулированные области внутри каждого изображения. Модель была протестирована как в нулевом режиме, так и после тонкой настройки на наборе данных.
В своем исходном состоянии он достиг пересечения по объединению в 13,10, оценки F1 в 19,92 и AUC в 14,06, отражая слабую производительность по локализации.
После тонкой настройки оценки улучшились до 24,74 для IoU, 39,40 для F1 и 37,53 для AUC. Однако даже с дополнительной тренировкой модель все еще испытывала трудности с определением точных мест, где были сделаны редакции, подчеркивая, насколько трудно обнаружить эти виды небольших, целевых изменений.
Заключение
Новое исследование выявляет слепое пятно как в человеческом, так и в машинном восприятии: хотя большая часть общественного обсуждения вокруг глубоких подделок сосредоточена на сенсационных обменах идентичности, эти более тихие «нарративные редакции» труднее обнаружить и потенциально более коррозивны в долгосрочной перспективе.
По мере того, как системы, такие как ChatGPT и Gemini, играют более активную роль в генерации этого типа контента, и по мере того, как мы сами увеличиваем участие в изменении реальности наших собственных потоков фотографий, модели обнаружения, которые полагаются на обнаружение грубых манипуляций, могут предложить недостаточную защиту.
MultiFakeVerse демонстрирует не то, что обнаружение не удалось, а то, что хотя бы часть проблемы может смещаться в более трудную, медленнее движущуюся форму: ту, где небольшие визуальные ложь накапливаются незамеченными.
Опубликовано впервые в четверг, 5 июня 2025 года












