Взгляд Anderson

Новый метод глубоких подделок решает проблему “хозяина лица”

mm
Добавьте Unite.AI в избранные источники в Google

Несмотря на несколько лет гиперболы в СМИ о потенциале глубоких подделок изображений для подрыва нашей давней веры в аутентичность видеозаписей, все目前 популярные методы полагаются на поиск “хозяев лица”, которые в целом похожи по форме на целевое лицо.

Когда в исходном видео лицо широкое, а лицо целевого субъекта узкое, результаты всегда были проблематичными, поскольку такой перенос включает удаление части исходного лица и реконструкцию теперь открытого фона. Текущие пакеты, такие как DeepFaceLab и FaceSwap, могут производить ограниченные результаты, когда конфигурация обратная (узкое > широкое), но не имеют возможности убедительно решить эту проблему.

Теперь сотрудничество между Tencent и Университетом Сямэнь в Китае разработало новый подход, озаглавленный HifiFace, предназначенный для устранения этого пробела.

Два глубоких подделка HifiFace, первый - Энн Хэтэуэй, где получается хорошее сходство, несмотря на несовместимую форму лица хозяина. HifiFace также хорошо работает с целями в очках, традиционно являющимися препятствием в глубоких подделках. Источник: https://arxiv.org/pdf/2106.09965.pdf

Два глубоких подделка HifiFace, первый – Энн Хэтэуэй, где получается хорошее сходство, несмотря на несовместимую форму лица хозяина. HifiFace также хорошо работает с целями в очках, традиционно являющимися препятствием в глубоких подделках. Источник: https://arxiv.org/pdf/2106.09965.pdf

Перестройка лица глубокой подделки

Предыдущие подходы, такие как Subject Agnostic Face Swapping and Reenactment (FSGAN), полагались на 3DMM fitting (3D Морфабельные модели) или другие методологии, основанные на распознавании лицевых ориентиров или преобразовании, где лицевые линии лица, которое необходимо “перезаписать”, в целом диктуют пределы обмена:

Источник: https://github.com/Yinghao-Li/3DMM-fitting

Обнаружение лицевых ориентиров 3DMM. Источник: https://github.com/Yinghao-Li/3DMM-fitting

Хотя конкурирующие методы опирались на функции, полученные из сетей распознавания лиц, они в основном направлены на реконструкцию текстуры, а не структуры, и также производят “маскообразный” эффект в случаях, когда лицо хозяина не полностью совместимо (т.е. пределы и форма линии волос, челюсти и скул).

Чтобы решить эти проблемы, китайские исследователи, базирующиеся в лаборатории медиа-аналитики и вычислений Университета Сямэнь, разработали конечный сетевой интерфейс, который регрессирует коэффициенты целевого и исходного лица, используя 3D модель реконструкции, которая затем объединяется как информация о форме, и объединяется с информацией вектора идентичности из сети распознавания лиц.

Эта геометрическая информация затем подается в модель кодирования-декодирования в качестве структурной информации, смешиваясь с выражением и расположением целевого лица, которые используются в качестве вспомогательных источников для точного переноса.

Семантическое слияние лица

Кроме того, HifiFace включает компонент Семантического слияния лица (SFF), который использует низкоуровневую функцию в кодировщике для сохранения пространственной и текстурной информации, не жертвуя идентичностью целевого изображения. Функции из кодировщика и декодировщика интегрируются в адаптивную маску, а информация фона смешивается с выходными данными посредством обученной маски лица.

HifiFace в действии. Источник: https://johann.wang/HifiFace/

HifiFace в действии. Источник: https://johann.wang/HifiFace/

Таким образом, HifiFace отклоняется от использования исходных границ лица как жесткого предела, используя расширенное сегментирование лица, при котором модель может выполнять лучшее адаптивное слияние на границах лица.

Два предыдущих подхода (вверху и внизу слева) и новая архитектура HifiFace, которая состоит из кодировщика, декодировщика, 3D-формо-осведомленного извлекателя идентичности и модуля SFF.

Два предыдущих подхода (вверху и внизу слева) и новая архитектура HifiFace, которая состоит из кодировщика, декодировщика, 3D-формо-осведомленного извлекателя идентичности и модуля SFF.

При сравнении с предыдущими методами FSGAN, SimSwap и FaceShifter, HifiFace демонстрирует превосходную реконструкцию формы лица, поскольку он не приближает “призрачные” элементы, где лицевые границы запутывают отображение идентичности > идентичности, а окончательно реконструирует их.

Тестирование

Исследователи реализовали систему, используя наборы данных VGGFace2 и DeepGlint Asian-Celeb. Лица были выровнены посредством 5 внешних ориентиров и обрезаны до 256×256 пикселей. Сеть улучшения портретов также использовалась для генерации версии 512×512 пикселей, для дополнительной модели высокого разрешения. Модель была обучена под Adam.

Хотя FaceShifter сохраняет идентичность хорошо, он не может решить проблемы, такие как выражение, цвет и окутывание, так эффективно, как HifiFace, и имеет более сложную структуру сети. FSGAN имеет проблемы с переносом освещения из источника в цель.

Исследователи используют FaceForensics++ для количественных сравнений, выборки по 10 кадров каждой в пакете преобразованных видео по конкурирующим методам, и обнаружили, что HifiFace достигла превосходного балла извлечения идентичности. При тестировании ряда других факторов, таких как качество изображения, исследователи также обнаружили, что их метод превосходит конкурирующие методологии.

Лицевые линии Бенедикта Камбербэтча воспроизводятся верно.

Лицевые линии Бенедикта Камбербэтча воспроизводятся верно.

Работа представляет собой дальнейший шаг к абстрагированию исходного материала, так что он становится лишь грубым шаблоном, в который можно перенести точные идентичности. Некоторые из текущих пакетов с открытым исходным кодом, включая DeepFaceLab, имеют функциональность для полной замены головы, но, как и HifiFace, они не учитывают волосы и более эффективны в “выстраивании” лица, чем в его вырезании, чтобы соответствовать желаемому целевому источнику.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai