Погляд Anderson
Новий метод глибоких підробок вирішує проблему “гостя обличчя”

Незважаючи на кілька років медійної гіперболізації щодо потенціалу глибоких підробок зображень для підваження нашої довіри до автентичності відеозаписів, всі сучасні методи залежать від пошуку “гостів обличчя”, які загалом схожі за формою на цільове обличчя.
Коли оригінальне відео містить широке обличчя, але цільова особа має вузьке обличчя, результати завжди були проблематичними, оскільки такий перехід涉ляє відрізання частини оригінального обличчя та реконструкцію тепер відкритого фону. Поточні пакети, такі як DeepFaceLab і FaceSwap, можуть продукувати обмежені результати, коли конфігурація перевернута (вузьке > широке), але не мають можливості переконливо вирішити цю ситуацію.
Тепер колаборація між Tencent і китайським університетом Сяменя розробила новий підхід, названий HifiFace, призначений для виправлення цього недоліку.

Два глибоких підробки HifiFace, перший з Енн Гетевей, де добрий вигляд отримується незважаючи на неузгодженість форми обличчя господаря. HifiFace також добре працює з цільовими обличчями з окулярами, традиційно проблемним моментом у глибоких підробках. Джерело: https://arxiv.org/pdf/2106.09965.pdf
Перепроектування обличчя глибокої підробки
Попередні підходи, такі як Subject Agnostic Face Swapping and Reenactment (FSGAN), залежали від 3DMM fitting (3D Морфабельні Моделі) або інших методологій, заснованих на розпізнаванні ознак обличчя або трансформації, де ознаки обличчя, які мають бути “переписані”, майже диктують межі заміни:

Виявлення ознак обличчя 3DMM. Джерело: https://github.com/Yinghao-Li/3DMM-fitting
Хоча конкуруючі методи використовували функції, отримані з мережі розпізнавання облич, ці функції в основному призначені для реконструкції текстури, а не структури, і подібним чином продукують “маскоподібний” ефект у випадках, коли обличчя господаря не повністю узгоджується (тобто межі і форма волосся, лінії щелепи і вилиць).
Щоб вирішити ці питання, китайські дослідники, які працюють у лабораторії Медіа-Аналітики та Обчислювальної Техніки університету, розробили мережу з кінцевим кодуванням, яка регресує коефіцієнти цільового і джерельного обличчя за допомогою 3D-моделі реконструкції, яка потім рекомбінується як інформація про форму, і конкатенуується з інформацією про ідентичність з мережі розпізнавання облич.
Ця геометрична інформація потім подається до моделі кодування-декодування як структурова інформація, змішуючи з виразом і диспозицією цільового обличчя, які використовуються як допоміжні джерела для точного переносу.
Семантичне Об’єднання Обличчя
Крім того, HifiFace включає компонент Семантичного Об’єднання Обличчя (SFF), який використовує низькорівневу функцію в кодувальнику для збереження просторової та текстурної інформації, не жертвуючи ідентичністю цільового зображення. Функції з кодувальника і декодувальника інтегруються у вивчену адаптивну маску, а інформація про фон змішується з виходом за допомогою вивченого маскування обличчя.

HifiFace в дії. Джерело: https://johann.wang/HifiFace/
Цим чином, HifiFace відрізняється від використання оригінальних меж обличчя як жорсткої межі, використовуючи розширення семантичного сегментування обличчя, де модель може виконувати краще адаптивне об’єднання на межах обличчя.

Два попередні підходи (ліворуч зверху і знизу), і нова архітектура HifiFace, яка складається з кодувальника, декодувальника, 3D-чутливого екстрактора ідентичності та модуля SFF.
У порівнянні з попередніми методами FSGAN, SimSwap і FaceShifter, HifiFace демонструє вищу реконструкцію форми обличчя, оскільки вона не наближається до “призрака” елементів, де межі обличчя переплутуються з ідентичністю > ідентичністю, а точно реконструює їх.
Тестування
Дослідники реалізували систему за допомогою наборів даних VGGFace2 і DeepGlint Asian-Celeb. Обличчя були вирівняні за допомогою 5 зовнішніх орієнтирів і обрізані до 256×256 пікселів. Також була використана мережа покращення портретів для генерації версії 512×512 пікселів, для додаткової високої роздільності моделі. Модель була навчена під керуванням Adam.
Хоча FaceShifter добре зберігає ідентичність, він не може так ефективно вирішувати питання виразу, кольору та окулювання, як HifiFace, і має більш складну структуру мережі. FSGAN має проблеми з перенесенням освітлення з джерела на ціль.
Дослідники використовують FaceForensics++ для кількісних порівнянь, вибірки десяти кадрів кожної в пакеті перетворених відео через конкуруючі методи, і виявили, що HifiFace досягла вищого результату пошуку ідентичності. При тестуванні ряду інших факторів, таких як якість зображення, дослідники також виявили, що їхній метод перевершив конкуруючі методології.
Ця робота представляє подальший крок до абстрагування джерельного матеріалу, щоб він став лише приблизним шаблоном, у який можуть бути перенесені точні ідентичності. Деякі з поточних пакетів програмного забезпечення з відкритим кодом, включаючи DeepFaceLab, мають зароджувальну функціональність для заміни всього голови, але, як і HifiFace, вони не враховують волосся, і вони більш ефективні у “будівництві” обличчя, ніж у видаленні його для відповідності бажаному цільовому джерелу.

















