Взгляд Anderson
Раскрытие небольших, но значимых правок AI в реальных видео

В 2019 году спикер Палаты представителей США Нэнси Пелоси стала объектом целевой и достаточно простой атаки в стиле глубоких фейков, когда реальное видео с ней было отредактировано так, чтобы она казалась пьяной – нереальное событие, которое было поделено несколько миллионов раз до того, как было раскрыто правду об этом (и, возможно, после некоторых упорных повреждений ее политического капитала, нанесенных теми, кто не следил за историей).
Хотя эта неправильная интерпретация требовала только некоторых простых аудиовизуальных редакторских правок, а не каких-либо возможностей AI, она остается ключевым примером того, как тонкие изменения реального аудиовизуального контента могут иметь разрушительное воздействие.
В то время сцена глубоких фейков доминировала в автоэнкодерах на основе систем замены лиц, которые дебютировали в конце 2017 года и которые не значительно улучшили качество с тех пор. Такие ранние системы были бы в трудном положении, чтобы создать этот вид небольших, но значимых изменений или реалистично преследовать современные исследовательские направления, такие как редактирование выражений:

Структура ‘Neural Emotion Director’ 2022 года меняет настроение знаменитого лица. Источник: https://www.youtube.com/watch?v=Li6W8pRDMJQ
Теперь все совсем по-другому. Кино- и телевизионная промышленность серьезно заинтересована в постпродакшене изменения реальных выступлений с помощью подходов машинного обучения, и облегчение AI постфактум перфекционизма даже подвергалось недавней критике.
Предвидя (или, возможно, создавая) этот спрос, сцена исследований синтеза изображений и видео выдвинула вперед широкий спектр проектов, которые предлагают ‘локальные правки’ захватов лиц, а не полные замены: проекты этого типа включают Diffusion Video Autoencoders; Stitch it in Time; ChatFace; MagicFace; и DISCO, среди прочих.

Редактирование выражений с помощью проекта MagicFace января 2025 года. Источник: https://arxiv.org/pdf/2501.02260
Новые лица, новые морщины
Однако технологии, облегчающие это, развиваются гораздо быстрее, чем методы их обнаружения. Почти все методы обнаружения глубоких фейков, которые появляются в литературе, преследуют вчерашние методы глубоких фейков с вчерашними наборами данных. До этой недели ни один из них не решал проблему потенциала систем AI создавать небольшие и локальные изменения в видео.
Теперь новая статья из Индии исправила это, представив систему, которая стремится выявить лица, которые были отредактированы (а не заменены) с помощью методов на основе AI:

Обнаружение тонких локальных правок в глубоких фейках: реальное видео изменено, чтобы произвести фейки с тонкими изменениями, такими как поднятые брови, измененные половые признаки и сдвиги выражения к отвращению (иллюстрировано здесь с помощью одного кадра). Источник: https://arxiv.org/pdf/2503.22121
Система авторов направлена на выявление глубоких фейков, которые включают тонкие, локализованные манипуляции с лицом – ранее забытый класс подделки. Вместо того, чтобы сосредотачиваться на глобальных несоответствиях или несоответствиях идентичности, подход нацелен на тонкие изменения, такие как небольшие сдвиги выражения или небольшие правки отдельных черт лица.
Метод использует разделитель действий (AUs) в Системе кодирования лица (FACS), которая определяет 64 возможных индивидуальных изменяемых области на лице, которые вместе образуют выражения.

Некоторые составные 64 части выражения в FACS. Источник: https://www.cs.cmu.edu/~face/facs.htm
Авторы оценили свой подход против различных недавних методов редактирования и сообщают о последовательных приростах производительности, как с более старыми наборами данных, так и с более свежими векторами атаки:
‘Используя функции на основе AU для руководства видеопредставлениями, изученными через Маскированные Автоэнкодеры [(MAE)], наш метод эффективно захватывает локализованные изменения, важные для обнаружения тонких редактирований лица.
‘Этот подход позволяет нам построить объединенное латентное представление, которое кодирует как локализованные правки, так и более широкие изменения в видео, центрированных на лице, обеспечивая комплексное и адаптируемое решение для обнаружения глубоких фейков.’
Новая статья называется Обнаружение локализованных манипуляций глубоких фейков с помощью представлений видео, руководимых действием, и исходит от трех авторов Индийского технологического института в Мадрасе.
Метод
В соответствии с подходом, принятым VideoMAE, новый метод начинается с применения обнаружения лица к видео и выборки равномерно расположенных кадров, центрированных на обнаруженных лицах. Эти кадры затем делятся на небольшие 3D-разделения (т.е. временно-активированные патчи), каждое из которых захватывает локальную пространственную и временную деталь.

Схема нового метода. Входное видео обрабатывается с помощью обнаружения лица для извлечения равномерно расположенных, центрированных на лице кадров, которые затем делятся на ‘трубчатые’ патчи и передаются через кодировщик, который объединяет латентные представления из двух предварительно обученных pretext-задач. Полученный вектор затем используется классификатором для определения того, является ли видео реальным или фейковым.
Каждый 3D-патч содержит фиксированное окно пикселей (т.е. 16×16) из небольшого количества последовательных кадров (т.е. 2). Это позволяет модели изучить короткосрочное движение и изменения выражения – не только то, как выглядит лицо, но как оно движется.
Патчи встраиваются и позиционно кодируются перед тем, как быть переданными в кодировщик, предназначенный для извлечения функций, которые могут различать реальное и фейковое.
Авторы признают, что это особенно сложно при работе с тонкими манипуляциями, и решают эту проблему, построив кодировщик, который объединяет два отдельных типа изученных представлений, используя механизм перекрестного внимания для объединения их. Это предназначено для создания более чувствительного и обобщаемого пространства функций для обнаружения локализованных правок.
Претекст-задачи
Первое из этих представлений – кодировщик, обученный с помощью задачи маскированного автоэнкодирования. С видео, разделенным на 3D-патчи (большинство из которых скрыто), кодировщик затем изучает восстановление пропущенных частей, заставляя его захватить важные пространственно-временные закономерности, такие как движение лица или последовательность во времени.

Обучение pretext-задач включает в себя маскирование частей видеовхода и использование кодировщика-декодировщика для восстановления либо исходных кадров, либо карт действий на основе кадров, в зависимости от задачи.
Однако статья отмечает, что это alone не обеспечивает достаточной чувствительности для обнаружения тонких правок, и авторы поэтому вводят второй кодировщик, обученный для обнаружения единиц действий лица (AUs). Для этой задачи модель изучает восстановление плотных карт AUs для каждого кадра, снова из частично маскированных входов. Это побуждает ее сосредоточиться на локализованной мышечной активности, где происходит большинство тонких правок глубоких фейков.

Дополнительные примеры единиц действий лица (FAUs, или AUs). Источник: https://www.eiagroup.com/the-facial-action-coding-system/
Как только оба кодировщика предварительно обучены, их выходы объединяются с помощью перекрестного внимания. Вместо простого объединения двух наборов функций модель использует функции на основе AU в качестве запросов, которые направляют внимание над пространственно-временными функциями, изученными из маскированного автоэнкодирования. По сути, кодировщик действий указывает модели, где смотреть.
Результатом является объединенное латентное представление, предназначенное для захвата как более широкого контекста движения, так и локализованной детали выражения. Это объединенное пространство функций затем используется для окончательной задачи классификации: предсказания того, является ли видео реальным или манипулированным.
Данные и тесты
Реализация
Авторы реализовали систему, предварительно обработав входные видео с помощью FaceXZoo фреймворка обнаружения лица на основе PyTorch, получив 16 кадров, центрированных на лице, из каждого клипа. Претекст-задачи, описанные выше, были обучены на наборе данных CelebV-HQ, состоящем из 35 000 высококачественных видео лиц.

Из исходной статьи, примеры из набора данных CelebV-HQ, использованного в новом проекте. Источник: https://arxiv.org/pdf/2207.12393
Половина примеров данных была маскирована, заставляя систему изучать общие принципы, а не переобучаться на исходных данных.
Для задачи восстановления маскированных кадров модель была обучена предсказывать пропущенные области видеокадров с помощью потери L1, минимизируя разницу между исходным и восстановленным контентом.
Для второй задачи модель была обучена генерировать карты для 16 единиц действий лица, каждая из которых представляет тонкие движения мышц в областях, включая брови, веки, нос и губы, снова под контролем потери L1.
После предварительного обучения два кодировщика были объединены и дообучены для обнаружения глубоких фейков с помощью набора данных FaceForensics++, который содержит как реальные, так и манипулированные видео.

Набор данных FaceForensics++ был центральным эталоном обнаружения глубоких фейков с 2017 года, хотя теперь он значительно устарел в отношении последних техник синтеза лица. Источник: https://www.youtube.com/watch?v=x2g48Q2I2ZQ
Чтобы учесть несбалансированность классов, авторы использовали Фокус-потерю (вариант потери перекрестной энтропии), которая подчеркивает более сложные примеры во время обучения.
Все обучение проводилось на одном GPU RTX 4090 с 24 Гб видеопамяти, с размером партии 8 за 600 эпох (полные обзоры данных), используя предварительно обученные контрольные точки из VideoMAE для инициализации весов для каждой из pretext-задач.
Тесты
Количественные и качественные оценки были проведены против различных методов обнаружения глубоких фейков: FTCN; RealForensics; Lip Forensics; EfficientNet+ViT; Face X-Ray; Alt-Freezing; CADMM; LAANet; и SBI от BlendFace. Во всех случаях исходный код был доступен для этих фреймворков.
Тесты были сосредоточены на локально-отредактированных глубоких фейках, где только часть исходного клипа была изменена. Используемые архитектуры включали Diffusion Video Autoencoders (DVA); Stitch It In Time (STIT); Disentangled Face Editing (DFE); Tokenflow; VideoP2P; Text2Live; и FateZero. Эти методы используют разнообразные подходы (диффузия для DVA и StyleGAN2 для STIT и DFE, например)
Авторы заявляют:
‘Чтобы обеспечить полное покрытие различных манипуляций с лицом, мы включили широкий спектр черт лица и атрибутов редактирования. Для редактирования черт лица мы изменили размер глаз, расстояние между глазами и бровями, соотношение носа и расстояние между носом и ртом, соотношение губ и соотношение щек. Для редактирования атрибутов лица мы варьировали выражения, такие как улыбка, гнев, отвращение и печаль.
‘Этот разнообразие необходимо для проверки прочности нашей модели на широком диапазоне локализованных правок. Всего мы сгенерировали 50 видео для каждого из вышеуказанных методов редактирования и проверили сильную обобщаемость нашего метода для обнаружения глубоких фейков.’
Старые наборы данных глубоких фейков также были включены в раунды, а именно Celeb-DFv2 (CDF2); DeepFake Detection (DFD); DeepFake Detection Challenge (DFDC); и WildDeepfake (DFW).
Метрики оценки были Площадь под кривой (AUC); Средняя точность; и Средний балансированный коэффициент F1.

Из статьи: сравнение на недавних локализованных глубоких фейках показывает, что предложенный метод превосходит все остальные, с приростом 15-20 процентов как в AUC, так и в средней точности по сравнению с лучшим подходом.
Авторы также предоставляют визуальное сравнение обнаружения для локализованных манипуляций (воспроизведено только частично ниже из-за нехватки места):

Реальное видео было изменено с помощью трех различных локализованных манипуляций для производства фейков, которые были визуально похожи на оригинал. Здесь показаны представительные кадры вместе со средними баллами обнаружения фейков для каждого метода. Хотя существующие детекторы испытывали трудности с этими тонкими правками, предложенная модель последовательно присваивала высокие вероятности фейков, указывая на большую чувствительность к локализованным изменениям.
Исследователи комментируют:
‘[Существующие] методы обнаружения глубоких фейков, [LAANet], [SBI], [AltFreezing] и [CADMM], испытывают значительный спад производительности на последних методах генерации глубоких фейков. Текущие методы SOTA демонстрируют AUC как низко, как 48-71%, демонстрируя их плохую обобщаемость для последних глубоких фейков.
‘С другой стороны, наш метод демонстрирует прочную обобщаемость, достигая AUC в диапазоне 87-93%. Аналогичная тенденция наблюдается в случае средней точности. Как показано [ниже], наш метод также последовательно достигает высокой производительности на стандартных наборах данных, превышая 90% AUC и конкурируя с недавними моделями обнаружения глубоких фейков.’

Производительность на традиционных наборах данных глубоких фейков показывает, что предложенный метод остается конкурентоспособным с ведущими подходами, указывая на сильную обобщаемость на широком диапазоне типов манипуляций.
Авторы отмечают, что эти последние тесты включают модели, которые можно разумно считать устаревшими, и которые были введены до 2020 года.
Чтобы обеспечить более полное визуальное представление производительности новой модели, авторы предоставляют обширную таблицу в конце, только часть которой мы имеем возможность воспроизвести здесь:

В этих примерах реальное видео было изменено с помощью трех локализованных правок для производства фейков, которые были визуально похожи на оригинал. Показаны средние баллы обнаружения фейков для этих манипуляций, которые, по заявлению авторов, показывают, что предложенная модель обнаружила фейки более надежно, чем другие ведущие подходы. Пожалуйста, обратитесь к последней странице исходного PDF для полных результатов.
Авторы утверждают, что их метод достигает баллов уверенности выше 90 процентов для обнаружения локализованных правок, в то время как существующие методы обнаружения остаются ниже 50 процентов на той же задаче. Они интерпретируют этот разрыв как доказательство как чувствительности, так и обобщаемости их подхода, и как указание на проблемы, с которыми сталкиваются текущие методы при работе с такими тонкими манипуляциями с лицом.
Чтобы оценить надежность модели в реальных условиях, и в соответствии с методом, установленным CADMM, авторы проверили ее производительность на видео, измененных с помощью общих искажений, включая изменения насыщенности и контраста, гауссовское размытие, пикселизацию и артефакты сжатия на основе блоков, а также аддитивный шум.
Результаты показали, что точность обнаружения в основном осталась стабильной на протяжении этих искажений. Единственным заметным спадом стала добавление гауссовского шума, которое вызвало умеренный спад производительности. Другие изменения оказали минимальное влияние.

Иллюстрация того, как точность обнаружения меняется под воздействием различных видео-искажений. Новый метод остался устойчивым в большинстве случаев, с только небольшим спадом AUC. Самый значительный спад произошел, когда был введен гауссовский шум.
Эти результаты, по мнению авторов, предполагают, что способность метода обнаруживать локализованные манипуляции не легко нарушается типичными ухудшениями качества видео, подтверждая его потенциальную прочность в практических условиях.
Заключение
Манипуляции AI существуют в общественном сознании в основном в традиционном понимании глубоких фейков, где личность человека накладывается на тело другого человека, который может выполнять действия, противоречащие принципам владельца личности. Это понимание медленно обновляется, чтобы признать более хитрые возможности генеративных видеосистем (в новом поколении видео-глубоких фейков), и возможности латентных моделей диффузии (LDM) в целом.
Таким образом, можно разумно ожидать, что тип локального редактирования, с которым связана новая статья, может не привлечь внимание общественности, пока не произойдет событие в стиле Пелоси, поскольку люди отвлечены от этой возможности более привлекательными темами, такими как мошенничество с видео-глубокими фейками.
Тем не менее, как актер Ник Кейдж выразил постоянную обеспокоенность по поводу возможности постпродакшн-процессов ‘пересмотра’ выступления актера, мы тоже должны, возможно, способствовать большему осознанию этого типа ‘тонкого’ видео-корректировки – не в последнюю очередь потому, что мы по природе невероятно чувствительны к очень небольшим вариациям выражения лица, и потому, что контекст может существенно изменить воздействие небольших движений лица (рассмотрите разрушительное воздействие даже ухмылка на похоронах, например).
Опубликовано впервые в среду, 2 апреля 2025 года












