Погляд Anderson
Нова та простіша методологія створення глибоких підробок, яка перевершує попередні підходи

У співпраці між китайською групою дослідників штучного інтелекту та американськими дослідниками була розроблена, можливо, перша справжня інновація у технології глибоких підробок з моменту її появи чотири роки тому.
Новий метод能够 виконувати заміну облич, яка перевершує всі інші існуючі.frameworkи на стандартних перцептивних тестах, без необхідності вичерпного збору та кураторства великих спеціалізованих наборів даних та їх навчання протягом тижня лише для однієї особи. Для прикладів, представлених у новій статті, моделі були навчені на усьому двох популярних наборів даних знаменитостей, на одному процесорі NVIDIA Tesla P40 протягом трьох днів.

Повне відео доступне в кінці цієї статті. У цьому зразку з відео у додаткових матеріалах, наданих одним із авторів нової статті, обличчя Скарлетт Йоханссон переноситься на джерельне відео. CihaNet усуває проблему маскування країв під час виконання заміни, утворюючи та виконуючи глибші відносини між джерельною та цільовою особами, що означає кінець «очевидним кордонам» та іншим суперпозиційним глюкам, які трапляються у традиційних підходах до глибоких підробок. Джерело: Джерело: https://mitchellx.github.io/#video
Новий підхід усуває необхідність «вставляти» трансплантовану особу грубо у цільове відео, що часто призводить до з’явлення характерних артефактів, які з’являються там, де фальшиве обличчя закінчується, а справжнє обличчя починається. Натомість «карти галюцинацій» використовуються для виконання глибшого змішування візуальних аспектів, оскільки система розділяє особу від контекstu набагато ефективніше, ніж сучасні методи, і тому може змішувати цільову особу на більш глибокому рівні.

З статті. Трансформації CihaNet здійснюються за допомогою карт галюцинацій (нижній ряд). Система використовує інформацію про контекст (тобто напрям обличчя, волосся, окуляри та інші закриття тощо) повністю зображення, у яке буде надрукована нова особа, та інформацію про особу повністю з особи, яка буде вставлена у зображення. Ця здатність розділяти обличчя від контекstu є критично важливою для успіху системи. Джерело: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
Ефективно нова карта галюцинацій забезпечує більш повний контекст для заміни, на відміну від жорстких масок, які часто вимагають обширного кураторства (а у випадку DeepFaceLab, окремого навчання) при обмеженій гнучкості щодо реальної інтеграції двох осіб.

З зразків, наданих у додаткових матеріалах, за допомогою наборів даних FFHQ і Celeb-A HQ, по VGGFace і Forensics++. Перші два стовпці показують випадково вибрані (справжні) зображення для заміни. Наступні чотири стовпці показують результати заміни за допомогою чотирьох найбільш ефективних методів, які зараз доступні, а останній стовпець показує результат з CihaNet. Було використано репозиторій FaceSwap, а не більш популярний DeepFaceLab, оскільки обидва проекти є форками оригінального коду Deepfakes 2017 року на GitHub. Хоча кожен проект пізніше додав моделі, техніки, різноманітні інтерфейси та додаткові інструменти, код, який робить глибокі підробки можливими, ніколи не змінювався і залишається спільним для обох. Джерело: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
Стаття стаття, озаглавлена Одностадійна мережа галюцинації контекstu та особи, написана дослідниками JD AI Research та університету Массачусетса в Амгерсті, і була підтримана Національною програмою розвитку та досліджень Китаю за номером 2020AAA0103800. Вона була представлена на 29-ій Міжнародній конференції з мультимедіа, 20-24 жовтня, у Ченду, Китай.
Немає потреби у «фейс-он» паритету
Обидва найпопулярніші програми глибоких підробок, DeepFaceLab і конкурентний форк FaceSwap, виконують складні та часто ручні робочі процеси для визначення напрямку обличчя, перешкод на шляху, які необхідно врахувати (знову ж таки, вручну), та багатьох інших дратівливих перешкод (включаючи освітлення), які роблять їх використання далеко не «point-and-click» досвідом, який неправильно описується у ЗМІ з моменту появи глибоких підробок.
Натомість CihaNet не вимагає, щоб дві зображення були звернені прямо до камери, щоб витягнути та використати корисну інформацію про особу з одного зображення.
<img class="size-full wp-image-178605" src="https://www.unite.ai/wp-content/uploads/2021/11/cihanet-angles.jpg" alt="У цих прикладах програмне забезпечення глибоких підробок викликає завдання заміни облич, які не тільки відрізняються за особою, але й не звернені в одному напрямку. Програмне забезпечення, отримане з оригінального репозиторію глибоких підробок (як дуже популярний DeepFaceLab і FaceSwap, зображений вище), не може обробляти розбіжності у кутах між двома зображеннями для заміни (див. третій стовпець). Тим часом CihaNet може правильно абстрагувати особу, оскільки «поза» обличчя не є частиною інформації про особу.Архітектура
Проект CihaNet, за словами авторів, був натхненний співпрацею 2019 року між дослідниками Microsoft та Пекінського університету, яка називається FaceShifter, хоча він робить деякі помітні та критичні зміни до основної архітектури старішого методу.
FaceShifter використовує дві мережі адаптивної нормалізації екземплярів (AdaIN) для обробки інформації про особу, яка потім транспонується у цільове зображення через маску, подібно до сучасного популярного програмного забезпечення глибоких підробок (і з усіма його обмеженнями), використовуючи додаткову HEAR-Net (яка включає окремо навчену підмережу, навчену на перешкодах закриття – додатковий шар складності).
Натомість нова архітектура безпосередньо використовує цю «контекстну» інформацію для трансформаційного процесу, через двоступеневу каскадну адаптивну нормалізацію екземплярів (C-AdaIN), яка забезпечує узгодженість контекstu (тобто шкіри обличчя та закриттів) областей, що містять інформацію про особу.
Друга підмережа, критично важлива для системи, називається Блоком заміни (SwapBlk), який генерує інтегровані функції з контекstu джерельного зображення та вбудованої інформації про особу з джерельного зображення, обходячи多ступеневі стадії, необхідні для виконання цього шляхом традиційних засобів.
Для допомоги у розрізненні контекstu та особи генерується карта галюцинацій для кожного рівня, яка замінює м’яку сегментаційну маску, діючи на ширший діапазон функцій для цієї критичної частини процесу глибоких підробок.

Якщо значення карти галюцинацій (зображено нижче праворуч) зростає, то з’являється чіткий шлях між особами.
У цьому спосіб увесь процес заміни здійснюється в одному етапі та без постобробки.
Дані та тестування
Для випробування системи дослідники навчали чотири моделі на двох дуже популярних та різноманітних відкритих наборах зображень – CelebA-HQ та наборі даних Flickr-Faces-HQ від NVIDIA (FFHQ), кожен з яких містить 30 000 та 70 000 зображень відповідно.
Не було виконано жодного обрізання чи фільтрації цих базових наборів даних. У кожному випадку дослідники навчали увесь кожен набір даних на одному процесорі Tesla GPU протягом трьох днів, з швидкістю навчання 0,0002 на оптимізації Adam.
Потім вони відтворили серію випадкових заміни серед тисяч осіб, представлених у наборах даних, без урахування того, чи були обличчя схожі чи навіть збігалися за статтю, та порівняли результати CihaNet з виходом чотирьох провідних фреймворків глибоких підробок: FaceSwap (який замінює більш популярний DeepFaceLab, оскільки вони мають спільну базу коду в оригінальному репозиторії 2017 року, який приніс глибокі підробки у світ); зазначений вище FaceShifter; FSGAN; та SimSwap.
При порівнянні результатів за допомогою VGG-Face, FFHQ, CelebA-HQ та FaceForensics++, автори виявили, що їхня нова модель перевершує всі попередні моделі, як вказано у таблиці нижче.

Три метрики, використані для оцінки результатів, були структурною подібністю (SSIM), помилкою оцінки пози та точністю пошуку особи, яка обчислюється на основі відсотка успішно знайдених пар.
Дослідники стверджують, що CihaNet представляє більш досконалий підхід щодо якісних результатів та помітний крок вперед у порівнянні з сучасним станом технологій глибоких підробок, усуваючи тягар обширних та трудомістких архітектур маскування та методологій, та досягши більш корисного та дієвого розділення особи від контекstu.
Подивіться нижче, щоб побачити додаткові відео приклади нової техніки. Ви можете знайти повне відео тут.
З додаткових матеріалів до нової статті, CihaNet виконує заміну облич на різних особах. Джерело: https://mitchellx.github.io/#video














