Взгляд Anderson

Исследователи выявляют устойчивую черту глубоких фейков, которая может помочь в долгосрочном обнаружении

mm
Добавьте Unite.AI в избранные источники в Google

С тех пор, как в 2018 году начали появляться первые решения для обнаружения глубоких фейков, сектор исследований компьютерного зрения и безопасности стремится определить необходимую характеристику видеороликов глубоких фейков – сигналы, которые могут оказаться устойчивыми к улучшениям популярных технологий синтеза лиц (таких как пакеты глубоких фейков на основе автоэнкодеров, такие как DeepFaceLab и FaceSwap, и использование генеративных противостоящих сетей для воссоздания, симуляции или изменения человеческих лиц).

Многие из “признаков”, таких как отсутствие моргания, стали устаревшими из-за улучшений глубоких фейков, тогда как потенциальное использование цифровых методов проверки подлинности (таких как инициатива Content Authenticity Initiative, возглавляемая Adobe ) – включая подходы на основе блокчейна и цифровую водяную маркировку потенциальных источников фотографий – либо требуют значительных и дорогостоящих изменений в существующем массиве доступных источников изображений в интернете, либо же потребуют заметных кооперативных усилий среди стран и правительств для создания систем надзора и аутентификации.

Поэтому было бы очень полезно, если бы можно было выявить действительно фундаментальную и устойчивую черту в изображениях и видеоконтенте, в которых изменены, выдуманы или поменяны человеческие лица; характеристику, которую можно было бы вывести直接 из фальсифицированных видеороликов, без необходимости крупномасштабной верификации, хэширования криптографических активов, проверки контекста, оценки правдоподобия, процедур обнаружения артефактов или других трудоемких подходов к обнаружению глубоких фейков.

Глубокие фейки в кадре

Новое исследовательское сотрудничество между Китаем и Австралией считает, что оно нашло эту “священную корову”, в виде нарушения регулярности.

Авторы разработали метод сравнения пространственной целостности и временной непрерывности реальных видеороликов с теми, которые содержат контент глубоких фейков, и обнаружили, что любое вмешательство глубоких фейков нарушает регулярность изображения, хотя бы и незаметно.

Это частично связано с тем, что процесс создания глубоких фейков разбивает целевой видеоролик на кадры и применяет эффект обученной модели глубоких фейков к каждому (замененному) кадру. Популярные распространения глубоких фейков действуют подобным образом, как аниматоры, в этом отношении, уделяя больше внимания аутентичности каждого кадра, чем вкладу каждого кадра в общую пространственную целостность и временную непрерывность видеоролика.

Из статьи: А) Различия между типами данных. Здесь мы видим, что нарушения p-fake изменяют пространственно-временное качество изображения таким же образом, как и глубокий фейк, без замены идентичности. Б) Анализ шума трех типов данных, показывающий, как p-fake имитирует нарушение глубоких фейков. В) Временная визуализация трех типов данных, с реальными данными, демонстрирующими большую целостность колебаний. Г) Визуализация T-SNE извлеченных функций для реальных, фейковых и p-фейковых видеороликов. Источник: https://arxiv.org/pdf/2207.10402.pdf

Из статьи: А) Различия между типами данных. Здесь мы видим, что нарушения p-fake изменяют пространственно-временное качество изображения таким же образом, как и глубокий фейк, без замены идентичности. Б) Анализ шума трех типов данных, показывающий, как p-fake имитирует нарушение глубоких фейков. В) Временная визуализация трех типов данных, с реальными данными, демонстрирующими большую целостность колебаний. Г) Визуализация T-SNE извлеченных функций для реальных, фейковых и p-фейковых видеороликов. Источник: https://arxiv.org/pdf/2207.10402.pdf

Это не то, как видеокодек обрабатывает серию кадров, когда создается или обрабатывается оригинальная запись. Чтобы сэкономить на размере файла или сделать видеоролик подходящим для потоковой передачи, видеокодек отбрасывает огромное количество информации. Даже при настройках самого высокого качества кодек выделяет ключевые кадры (переменная, которую можно задать пользователем) – целые, практически не сжатые изображения, которые происходят на заданном интервале в видеоролике.

Межкадровые кадры между ключевыми кадрами, в некоторой степени, оцениваются как вариант кадров и будут повторно использовать как можно больше информации из соседних ключевых кадров, а не быть полными кадрами сами по себе.

Слева, полный ключевой кадр, или 'i-кадр', хранится в сжатом видеоролике, при некоторой стоимости размера файла; справа, межкадровый 'дельта-кадр' повторно использует любую применимую часть более информационного ключевого кадра. Источник: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/

Слева, полный ключевой кадр, или ‘i-кадр’, хранится в сжатом видеоролике, при некоторой стоимости размера файла; справа, межкадровый ‘дельта-кадр’ повторно использует любую применимую часть более информационного ключевого кадра. Источник: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/

Таким образом, блок (содержащий x количество кадров, в зависимости от настроек ключевых кадров) является, по сути, самой маленькой единицей, учитываемой в типичном сжатом видеоролике, а не любым отдельным кадром. Даже ключевой кадр, известный как i-кадр, является частью этой единицы.

В терминах традиционной карикатурной анимации кодек выполняет вид интерполяции, с ключевыми кадрами, действующими как опорные точки для межкадровых, полученных кадров, известных как дельта-кадры.

Напротив, наложение глубоких фейков уделяет огромное внимание и ресурсы каждому отдельному кадру, не учитывая более широкий контекст, и не делая никаких уступок тому, как сжатие и блоковое кодирование влияют на характеристики “аутентичного” видеоролика.

Более близкий взгляд на разрыв между временным качеством аутентичного видеоролика (слева) и тем же видеороликом, когда он нарушается глубокими фейками (справа).

Более близкий взгляд на разрыв между временным качеством аутентичного видеоролика (слева) и тем же видеороликом, когда он нарушается глубокими фейками (справа).

Хотя некоторые из лучших создателей глубоких фейков используют обширную постобработку, в пакетах, таких как After Effects, и хотя распределение DeepFaceLab имеет некоторую родную возможность применять процедуры “смешивания”, такие как размытие движения, такое хитрость не влияет на несоответствие пространственного и временного качества между аутентичными и глубокими фейками.

Новая статья называется Обнаружение глубоких фейков путем создания пространственно-временного нарушения регулярности и исходит от исследователей Университета Цинхуа, департамента технологии компьютерного зрения (VIS) в Baidu Inc. и Университета Мельбурна

‘Фейковые’ фейковые видеоролики

Исследователи, стоящие за статьей, включили функциональность исследования в модуль “плаг и играй” под названием Псевдо-фейковый генератор (P-фейковый генератор), который преобразует реальные видеоролики в фейковые фейковые видеоролики, нарушая их таким же образом, как и фактический процесс создания глубоких фейков, без фактического выполнения каких-либо операций глубоких фейков.

Тесты показывают, что модуль можно добавить ко всем существующим системам обнаружения глубоких фейков практически без каких-либо затрат ресурсов, и что он заметно улучшает их производительность.

Открытие может помочь решить одну из других проблем в исследованиях обнаружения глубоких фейков: нехватку аутентичных и актуальных наборов данных. Поскольку создание глубоких фейков является сложным и трудоемким процессом, сообщество разработало ряд наборов данных глубоких фейков за последние пять лет, многие из которых довольно устарели.

Выделив нарушение регулярности как сигнал глубоких фейков, не зависящий от видеороликов, измененных постфактум, новый метод делает возможным генерировать бесконечные образцы и наборы данных видеороликов, которые фокусируются на этом аспекте глубоких фейков.

Обзор блока STE, где канальное временное свертывание используется как стимул для генерации пространственно-временных улучшенных кодирований, в результате чего получается тот же сигнал, который даже очень убедительный глубокий фейк будет давать. Таким методом можно генерировать 'фейковые' фейковые видеоролики, которые имеют те же сигнальные характеристики, что и любой измененный, глубокий фейковый видеоролик, и которые не зависят от конкретных распределений или от волатильных аспектов, таких как поведение функций или алгоритмические артефакты.

Обзор блока STE, где канальное временное свертывание используется как стимул для генерации пространственно-временных улучшенных кодирований, в результате чего получается тот же сигнал, который даже очень убедительный глубокий фейк будет давать. Таким методом можно генерировать ‘фейковые’ фейковые видеоролики, которые имеют те же сигнальные характеристики, что и любой измененный, глубокий фейковый видеоролик, и которые не зависят от конкретных распределений или от волатильных аспектов, таких как поведение функций или алгоритмические артефакты.

Тесты

Исследователи провели эксперименты на шести известных наборах данных, используемых в исследованиях обнаружения глубоких фейков: FaceForensics++ (FF++); WildDeepFake; Превью соревнования по обнаружению глубоких фейков (DFDCP); Celeb-DF; Обнаружение глубоких фейков (DFD); и Face Shifter (FSh).

Для FF++ исследователи обучили свою модель на исходном наборе данных и протестировали каждый из четырех поднаборов отдельно. Без использования каких-либо материалов глубоких фейков в обучении новый метод смог превзойти результаты, полученные на текущий момент.

Метод также занял первое место, когда сравнивались с набором данных FF++ C23, который предоставляет примеры, содержащие артефакты сжатия, которые достоверны в реальных условиях просмотра глубоких фейков.

Авторы комментируют:

‘Результаты внутри FF++ подтверждают осуществимость нашей основной идеи, в то время как общность остается серьезной проблемой существующих методов обнаружения глубоких фейков, поскольку производительность не гарантируется при тестировании на глубоких фейках, сгенерированных незнакомыми методами.

‘Рассмотрим дальше реальность гонки вооружений между детекторами и создателями фейков, общность является важным критерием для оценки эффективности метода обнаружения в реальном мире.’

Хотя исследователи провели ряд под-тестов (см. статью для подробностей) по “робастности” и варьированию типов видеороликов (т.е. реальных, фейковых, p-фейковых и т. д.), наиболее интересные результаты получены из теста на производительность в разных наборах данных.

Для этого авторы обучили свою модель на вышеупомянутом “реальном” варианте C23 FF++ и протестировали ее против четырех наборов данных, получив, по заявлению авторов, лучшую производительность во всех из них.

Результаты из кросс-наборного вызова. Статья отмечает, что SBI использует аналогичный подход к подходу авторов, в то время как, по заявлению исследователей, p-fake показывает лучшую производительность для пространственно-временного нарушения регулярности.

Результаты из кросс-наборного вызова. Статья отмечает, что SBI использует аналогичный подход к подходу авторов, в то время как, по заявлению исследователей, p-fake показывает лучшую производительность для пространственно-временного нарушения регулярности.

Статья гласит:

‘На самом сложном Deepwild наш метод превосходит метод SOTA примерно на 10 процентных пунктов по показателю AUC%. Мы думаем, что это связано с большой разнообразностью глубоких фейков в Deepwild, что делает другие методы неспособными хорошо обобщать из увиденных глубоких фейков.’

Метрики, использованные для тестов, были Оценка точности (ACC), Площадь под кривой оперативной характеристики получателя (AUC) и Коэффициент равных ошибок (EER).

Контр-атаки?

Хотя средства массовой информации характеризуют напряженность между разработчиками глубоких фейков и исследователями обнаружения глубоких фейков в терминах технологической войны, можно утверждать, что первые просто пытаются сделать более убедительный вывод, и что возросшая сложность обнаружения глубоких фейков является побочным продуктом этих усилий.

Будут ли разработчики пытаться устранить это недавно выявленное слабое место, зависит, возможно, от того, считают ли они, что нарушение регулярности можно воспринимать в видеоролике глубокого фейка человеческим глазом как знак неаутентичности, и что, следовательно, этот показатель стоит устранить с чисто качественной точки зрения.

Хотя пять лет прошло с тех пор, как первые глубокие фейки появились в интернете, технология создания глубоких фейков все еще относительно нова, и сообщество, по-видимому, более увлечено деталями и разрешением, чем правильным контекстом или соответствием сигнатур сжатого видео, что требует определенного “деградации” вывода – именно то, против чего вся сообщество глубоких фейков сейчас борется.

Если общее мнение окажется таковым, что нарушение регулярности является новой сигнальной чертой, которая не влияет на качество, может не быть никаких усилий, чтобы компенсировать его – даже если его можно “отменить” некоторыми постобработками или процедурами в архитектуре, что далеко не ясно.

 

Опубликовано впервые 22 июля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai