Погляд Anderson
Світанок глибоко підроблених емоцій

Дослідники розробили новий метод машинного навчання, щоб довільно накладати нові емоції на обличчя у відео, адаптуючи існуючі технології, які нещодавно з’явилися як рішення для синхронізації руху губ з іноземною мовою дублювання.
Дослідження є рівною співпрацею між Університетом Норте-Дам у Бостоні та Медіа-лабораторією Массачусетського технологічного інституту, і називається Інвертовані похмурі обличчя: переклад емоцій з відео у відео. Хоча дослідники погоджуються, що початкова якість результатів повинна бути розвинена через подальші дослідження, вони стверджують, що техніка, яку називають Wav2Lip-Emotion, є першою свого роду, яка безпосередньо займається модифікацією виразу обличчя у відео через техніки нейронних мереж.
Базовий код був опублікований на GitHub, хоча контрольні точки моделі будуть додані до відкритого репозиторію пізніше, обіцяють автори.

Зліва, ‘сумний’ кадр вихідного відео. Справа, ‘щасливий’ кадр. По центру – два нові підходи до синтезу альтернативних емоцій – верхній ряд: повністю масковане обличчя, де вся поверхня виразу була замінена; нижній ряд: більш традиційний метод Wav2Lip, який замінює тільки нижню частину обличчя. Джерело: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf
Один відеофайл як вихідні дані
У теорії, такі маніпуляції можна здійснити зараз через повну підготовку на традиційних репозиторіях глибоких підробок, таких як DeepFaceLab або FaceSwap. Однак стандартний робочий процес涉ував би використання альтернативної ідентичності до ‘цільової’ ідентичності, наприклад, актора, який імітує ціль, чий власний вираз буде перенесений на іншу особу, разом з рештою виконання. Крім того, техніки підробки голосу глибоких підробок зазвичай були б необхідні для завершення ілюзії.
Крім того, фактичне зміна виразу цілі1>цілі1 у одному вихідному відеофайлі під цією популярною рамкою涉увала б зміну векторів виравнювання обличчя таким чином, що ці архітектури зараз не забезпечують.

Wav2Lip-Emotion підтримує синхронізацію руху губ оригінального відео діалогу під час перетворення асоційованих виразів.
Натомість Wav2Lip-Emotion фактично намагається ‘скопіювати і вставити’ емоційно пов’язані вирази з однієї частини відео і замінити їх в інші пункти, з самозапропонованою економією вихідних даних, яка призначена в кінцевому підсумку запропонувати нижчий зусилля метод для маніпуляції виразом.
Офлайн-моделі могли б бути розроблені пізніше, які будуть навчені на альтернативних відео говорючої особи, усуваючи необхідність будь-якого одного відеофайлу містити ‘палітру’ станів виразу, з яким можна маніпулювати відеофайлом.
Потенційні цілі
Автори пропонують ряд застосувань для модифікації виразу, включаючи живий відеофільтр для компенсації впливу ПТСР і захворювання обличчя. У статті зазначається:
‘Особи з або без інгібованого виразу обличчя можуть виграти від налаштування своїх власних виразів, щоб краще відповідати їх соціальним обставинам. Одному може хотітися змінити вирази у відео, показаних їм. Оратори можуть кричати один на одного під час відеоконференції, але тим не менш хочуть отримати вміст у їхньому обміні без неприємних виразів. Або кінорежисер може хотіти збільшити або зменшити вирази актора.’
Оскільки вираз обличчя є ключовим і основним показником наміру, навіть якщо це може суперечити словам, які вимовляються, можливість змінити вираз також пропонує, до певної міри, можливість змінити, як спілкування сприймається.
Попередня робота
Інтерес до зміни виразу шляхом машинного навчання сходить до 2012 року, коли співпраця між Adobe, Facebook і Університетом Рутгерса запропонувала метод змінити вирази, використовуючи підхід 3D геометричної реконструкції на основі тензорів, який трудомістко накладав CGI-сітку на кожний кадр цільового відео, щоб здійснити зміну.

Дослідження Adobe/Facebook 2012 року маніпулювали виразами, накладаючи традиційні, CGI-драйвені зміни на відеозапис. Вирази могли бути збільшені або пригнічені. Джерело: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf
Хоча результати були перспективними, техніка була трудомісткою, а ресурси, необхідні для цього, були суттєвими. На цьому етапі CGI значно випереджав підходи комп’ютерного зору до прямої маніпуляції простором функцій і пікселями.
Більш тісно пов’язана з новою статтею є MEAD, набір даних і модель генерації виразу, випущені у 2020 році, здатні генерувати відео ‘говорячої голови’, хоча без рівня складності, який потенційно може бути досягнутий шляхом модифікації фактичного вихідного відео напряму.

Генерація виразу з MEAD 2020 року, співпрацею між SenseTime Research, Університетом Карнегі-Меллон і трьома китайськими університетами. Джерело: https://wywu.github.io/projects/MEAD/MEAD.html
У 2018 році інша стаття, озаглавлена GANimation: анатомічно-інформований фейс-анімація з одного зображення, з’явилася як співпраця між американськими і іспанськими академічними дослідженнями, і використовувала генеративні суперницькі мережі для збільшення або зміни виразів на статичних зображеннях тільки.

Зміна виразів на статичних зображеннях з GANimation. Джерело: https://arxiv.org/pdf/1807.09251.pdf
Wav2Lip-Emotion
Натомість новий проєкт заснований на Wav2Lip, який отримав публічність у 2020 році, пропонуючи потенційний метод для синхронізації руху губ з новим мовленням (або піснею), який ніколи не з’являвся у вихідному відео.
Оригінальна архітектура Wav2Lip була навчена на корпусі розмовних речень з архівів BBC. Для адаптації Wav2Lip до завдання зміни виразу дослідники ‘тонко налаштували’ архітектуру на вищезгаданому наборі даних MEAD.
MEAD складається з 40 годин відео, на яких 60 акторів читають одне і те саме речення, виконуючи різні вирази обличчя. Актори походять з 15 різних країн і пропонують ряд міжнародних характеристик, спрямованих на допомогу проєкту (і похідним проєктам) у створенні застосовних і добре узагальнених синтезів виразу.
На момент дослідження MEAD випустив тільки першу частину набору даних, що містить 47 осіб, які виконують вирази, такі як ‘гнів’, ‘відраза’, ‘страх’, ‘зневага’, ‘щастя’, ‘смуток’ і ‘подив’. У цьому першому виході в новий підхід дослідники обмежили сферу проєкту надкладанням або зміною сприйнятих емоцій ‘щастя’ і ‘смутку’, оскільки вони є найбільш легко розпізнаваними.
Метод і результати
Оригінальна архітектура Wav2Lip замінює тільки нижню частину обличчя, тоді як Wav2Lip-Emotion також експериментує з повною маскою заміни обличчя і синтезом виразу. Таким чином було необхідно для дослідників додатково змінити вбудовані методи оцінки, оскільки вони не були призначені для повної конфігурації обличчя.
Автори покращують оригінальний код, зберігаючи оригінальний аудіовхід, підтримуючи узгодженість руху губ.
Генератор містить кодувальник ідентичності, кодувальник мови і декодувальник обличчя, відповідно до попередньої роботи. Елемент мови кодується додатково як стекові 2D-конволюції, які потім конкатенуються з їхніми асоційованими кадрами.
Окрім генеративного елемента, модифікована архітектура містить три основні компоненти дискримінатора, спрямовані на якість синхронізації губ, елемент цілі емоції та візуально-качествену мету, треновану суперницьки.
Для повної реконструкції обличчя оригінальна робота Wav2Lip не містила жодного прецеденту, і тому модель була навчена з нуля. Для тренування нижньої частини обличчя (півмаски) дослідники вийшли з контрольних точок, включених до оригінального коду Wav2Lip.
Окрім автоматичної оцінки, дослідники використовували громадську думку, надану напівавтоматизованою сервісною платформою. Працівники загалом оцінили вихід високим за здатністю розпізнавати накладені емоції, тоді як тільки повідомляли про ‘помірну’ оцінку якості зображення.
Автори стверджують, що, окрім покращення якості згенерованого відео з подальшими вдосконаленнями, майбутні ітерації роботи могли б охопити ширший спектр емоцій, і що робота могла б бути застосована в майбутньому до позначених або автоматично витягнутих вихідних даних і наборів даних, що призведе, в кінцевому підсумку, до автентичної системи, в якій емоції могли б бути встановлені вгору або вниз за бажанням користувача, або, в кінцевому підсумку, замінені протилежними емоціями щодо оригінального вихідного відео.












