Взгляд Anderson
Определение глубоких подделок знаменитостей из внешних областей лица

Новое сотрудничество между Microsoft и китайским университетом предложило новый способ определения глубоких подделок знаменитостей, используя ограничения текущих методов глубоких подделок для распознавания идентичностей, которые были «проектированы» на других людях.
Подход называется Преобразователь согласованности идентичности (ICT), и работает путем сравнения внешних частей лица (челюсти, скулы, линия волос и другие внешние линейные особенности) с внутренней частью лица. Система использует широко доступные публичные изображения знаменитых людей, что ограничивает ее эффективность популярными знаменитостями, чьи изображения доступны в большом количестве в широко доступных наборах данных компьютерного зрения и в интернете.

Область подделки лиц через семь методов: DeepFake в FF+; DeepFake в Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; и DF-VAE. Популярные пакеты, такие как DeepFaceLab и FaceSwap, обеспечивают аналогичную ограниченную область. Источник: https://arxiv.org/pdf/2203.01318.pdf
Как иллюстрирует изображение выше, текущие популярные методы глубоких подделок довольно ограничены и полагаются на подходящие «хост-лица» (изображение или видео человека, которому будет заменена идентичность глубокой подделкой), чтобы минимизировать доказательства замены лица.
Хотя различные методы могут охватывать всю лобную часть и большую часть подбородочной и скуловой области, все они более или менее ограничены внутри рамки хост-лица.

Карта салентности, подчеркивающая «внутреннюю» и «внешнюю» идентичность, рассчитанную ICT. Когда внутреннее совпадение лица установлено, но внешняя идентичность не соответствует, ICT оценивает изображение как ложное.
В тестах ICT смог обнаружить контент глубоких подделок в фальшивых средах, таких как видео низкого разрешения, где содержание всего видео ухудшается артефактами сжатия, что помогает скрыть остаточные доказательства процесса глубокой подделки – обстоятельство, которое сбивает с толку многие конкурирующие методы обнаружения глубоких подделок.

ICT превосходит конкурентов в распознавании контента глубоких подделок. Смотрите видео, встроенное в конце статьи, для более примеров и лучшего разрешения. Смотрите встроенное видео в конце статьи для дальнейших примеров. Источник: https://www.youtube.com/watch?v=zgF50dcymj8
Статья статья озаглавлена Защита знаменитостей с помощью Преобразователя согласованности идентичности, и исходит от девяти исследователей, связанных с Университетом науки и технологий Китая, Microsoft Research Asia и Microsoft Cloud + AI.
Провал достоверности
Существует хотя бы пара причин, почему популярные алгоритмы замены лиц, такие как DeepFaceLab и FaceSwap, игнорируют внешнюю область заменяемых лиц.
Во-первых, обучение моделей глубоких подделок занимает много времени и требует значительных ресурсов, и использование «совместимых» хост-лиц/тел освобождает циклы GPU и эпохи для концентрации на относительно неизменных внутренних областях лица, которые мы используем для различения идентичности (поскольку переменные, такие как колебания веса и старение, наименее вероятно изменят эти основные черты лица в краткосрочной перспективе).
Во-вторых, большинство методов глубоких подделок (и это определенно так для DeepFaceLab, программного обеспечения, используемого наиболее популярными или печально известными практиками) имеют ограниченную способность реплицировать «конечные» границы лица, такие как скулы и линия челюсти, и ограничены тем фактом, что их апстрим-код (2017) не обширно решал эту проблему.
В случаях, когда идентичности не совпадают хорошо, алгоритм глубокой подделки должен «закрасить» фоновые области вокруг лица, что он делает неуклюже, даже в руках лучших глубоких подделщиков, таких как Ctrl Shift Face, чей вывод использовался в исследованиях статьи.

Лучшее из лучшего: кадры из видео глубокой подделки от известного глубокого подделщика Ctrl-Shift-Face, заменяющего Джима Керри на Гэри Олдмана. Эта работа, вероятно, представляет собой один из лучших результатов, доступных в настоящее время через DeepFaceLab и методы пост-обработки. Тем не менее, замены остаются ограниченными относительно скудного внимания, которое DFL уделяет внешней части лица, требуя геркулесовских усилий по сбору и обучению данных для решения внешних линейных особенностей. Источник: https://www.youtube.com/watch?v=x8igrh1eyLk
Это «фокус-покус», или отвлечение внимания, в значительной степени ускользает от общественного внимания в текущей обеспокоенности по поводу растущей реалистичности глубоких подделок, потому что наши критические способности вокруг глубоких подделок еще развиваются после стадии «шок и удивление».
Разделенные идентичности
Новая статья отмечает, что большинство предыдущих методов обнаружения глубоких подделок полагаются на артефакты, которые выдают процесс замены, такие как несовместимые положения головы и моргание, среди многочисленных других методов. Только на этой неделе новая статья об обнаружении глубоких подделок предложила использовать «подпись» различных типов моделей в рамках FaceSwap для помощи в идентификации фальшивого видео, созданного с его помощью (см. изображение ниже).

Определение глубоких подделок путем характеризации подписей различных типов моделей в рамках FaceSwap. Источник: https://arxiv.org/pdf/2202.12951.pdf
Напротив, архитектура ICT создает две отдельные вложенные идентичности для человека, каждая из которых должна быть проверена перед тем, как вся идентичность будет заключена как «истинная» видео или изображение.

Архитектура фазы обучения и тестирования ICT.
Разделение идентичностей облегчается видением Преобразователем, который выполняет распознавание лиц перед разделением обследованных областей на токены, принадлежащие внутренним или внешним идентичностям.

Распределение патчей среди двух параллельных идентификаторов.
Статья гласит:
«К сожалению, существующие методы верификации лиц склонны характеризовать наиболее дискриминативный регион, т.е. внутреннюю часть лица для верификации, и не могут захватить информацию об идентичности во внешней части лица. С помощью Преобразователя согласованности идентичности мы обучаем модель для изучения пары векторов идентичности, один для внутренней части лица и другой для внешней части лица, проектируя Преобразователь таким образом, чтобы внутренние и внешние идентичности могли быть изучены одновременно в безшовно объединенной модели.»
Поскольку не существует существующей модели для этого протокола идентификации, авторы разработали новый вид потерь согласованности, который может служить метрикой аутентичности. «Внутренний токен» и «внешний токен», полученные из модели извлечения идентичности, добавляются к более традиционным патч-эмбеддингам, произведенным фреймворками распознавания лиц.
Данные и обучение
Сеть ICT была обучена на наборе данных Microsoft Research MS-Celeb-1M, который содержит 10 миллионов изображений знаменитых лиц, покрывающих один миллион идентичностей, включая актеров, политиков и многих других типов известных фигур. Согласно процедуре предыдущего метода Face X-ray (другой инициативы Microsoft Research), собственный режим генерации фальшивок ICT меняет внутренние и внешние области лиц, взятых из этого набора данных, чтобы создать материал для тестирования алгоритма.
Для выполнения этих внутренних замен ICT определяет два изображения в наборе данных, которые демонстрируют схожие положения головы и лицевые ориентиры, генерирует область маски центральных особенностей (в которую можно выполнить замену), и выполняет замену глубокой подделки с коррекцией цвета RGB.
Причина, по которой ICT ограничен идентификацией знаменитостей, заключается в том, что он полагается (в своей наиболее эффективной вариации) на новый набор ссылок, который включает в себя полученные векторы лиц из центрального корпуса (в данном случае MS-Celeb-1M, хотя ссылка может быть расширена до сетевых изображений, которые, вероятно, будут существовать только в достаточном качестве и количестве для хорошо известных публичных фигур).
Эти векторные пары действуют как токены аутентичности для проверки внутренних и внешних областей лица одновременно.
Авторы отмечают, что токены, полученные из этих методов, представляют собой «высокоуровневые» особенности, в результате чего процесс обнаружения глубоких подделок более вероятно переживет сложные среды, такие как видео низкого разрешения или ухудшенное видео.
Критически, ICT не ищет доказательства, основанные на артефактах, а скорее фокусируется на методах верификации идентичности, более соответствующих методам распознавания лиц – подход, который сложен при низком объеме данных, как в случае с расследованием инцидентов глубоких подделок мести порно против не знаменитых целей.
Тесты
Обученный на MS-Celeb-1M, ICT был затем разделен на версии с ссылкой и «слепые» алгоритма и протестирован против ряда конкурирующих наборов данных и методов. Эти включали FaceForensics++ (FF++), набор данных из 1000 аутентичных и глубоких подделок видео, созданных через четыре метода, включая Face2Face и FaceSwap; Google’s Deepfake Detection (DFD), также состоящий из тысяч видео глубоких подделок, сгенерированных Google; Celeb-DeepFake v1 (CD1), который включает 408 реальных и 795 синтезированных видео с низкими артефактами; Celeb-DeepFake v2, расширение V1, содержащее 590 реальных и 5 639 фальшивых видео; и китайский Deeper-Forensics (Deeper) 2020 года.
Это наборы данных; методы обнаружения в тестовых задачах были Мультизадачный, MesoInc4, Капсула, Xception-c0, c2 (метод, используемый в FF++), FWA/DSP-FW из Университета Олбани, Двухветвевой, PCL+I2G и метод контекстно-несоответствия Юваля Ниркина.
Вышеупомянутые методы обнаружения направлены на обнаружение определенных типов манипуляций с лицом. В дополнение к этим новая статья авторов протестировала более общие предложения по обнаружению глубоких подделок Face X-ray, FFD из Университета штата Мичиган, CNNDetection и Patch-Forensics из MIT CSAIL.
Наиболее очевидные результаты из теста заключаются в том, что конкурирующие методы резко снижают свою эффективность при снижении разрешения и качества видео. Поскольку некоторые из наиболее серьезных потенциальных последствий проникновения глубоких подделок в наши дискриминационные силы лежат (не в последнюю очередь в настоящее время) в видео низкого разрешения или ухудшенного видео, это, кажется, значительный результат.

На графике результатов выше синие и красные линии указывают на устойчивость методов ICT к ухудшению изображения во всех областях, кроме препятствия гауссовского шума (не вероятность в видео Zoom и веб-камеры), в то время как конкурирующие методы надежности резко снижаются.
В таблице результатов ниже мы видим эффективность различных методов обнаружения глубоких подделок на не виденных наборах данных. Серые и помеченные результаты указывают на сравнение с исходными результатами в закрытых проектах, которые не могут быть внешне проверены. По почти всем сравнимым фреймворкам ICT превосходит конкурирующие подходы к обнаружению глубоких подделок (показаны жирным шрифтом) на протестированных наборах данных.

В качестве дополнительного теста авторы запустили контент из канала YouTube известного глубокого подделщика Ctrl Shift Face и обнаружили, что конкурирующие методы достигли заметно худших баллов:

Заметно, что методы FF++ (Xception-c23) и FFD, которые достигают некоторых из самых высоких баллов на некоторых тестовых данных в общих тестах новой статьи, здесь достигают намного более низкого балла, чем ICT в «реальном мире» контексте высокоэффективного контента глубоких подделок.
Авторы заключают статью с надеждой, что ее результаты направят сообщество обнаружения глубоких подделок к аналогичным инициативам, которые сосредотачиваются на более легко обобщаемых высокоуровневых особенностях, и подальше от «холодной войны» обнаружения артефактов, где последние методы регулярно обходятся разработками в рамках глубоких подделок или другими факторами, которые делают такие методы менее устойчивыми.
Проверьте сопровождающее дополнительное видео ниже для более примеров ICT, определяющего контент глубоких подделок, который часто обманывает альтернативные методы.
Опубликовано впервые 4 марта 2022 года.












