Погляд Anderson
Зміна емоцій у відеозаписах за допомогою штучного інтелекту

Дослідники з Греції та Великої Британії розробили новий підхід до зміни виразів обличчя та очевидних настроїв людей у відеозаписах, зберігаючи при цьому вірність рухам губ у відповідності з оригінальним аудіо, чого не вдавалося досягти попереднім спробам.

З відео, яке супроводжує статтю (в кінці цієї статті), короткий кліп актора Аль Пачіно, якому змінено вираз обличчя за допомогою NED, на основі високорівневих семантичних концепцій, які визначають індивідуальні вирази обличчя та їхні асоційовані емоції. Метод “Посилання- керований” праворуч бере інтерпретовані емоції джерельного відео та застосовує їх до всієї відео послідовності. Джерело: https://www.youtube.com/watch?v=Li6W8pRDMJQ
Ця галузь належить до категорії емуляції емоцій, де зберігається ідентичність оригінального мовця, але змінюються його вирази обличчя та мікровирази. Коли ця технологія штучного інтелекту дозріває, вона пропонує можливість для кіно- та телевізійних виробництв робити тонкі зміни у виразах обличчя акторів, але також відкриває досить нову категорію “емуляції емоцій” відео-дублів.
Зміна обличчя
Вирази обличчя публічних осіб, таких як політики, ретельно підібрані; у 2016 році вирази обличчя Гілларі Клінтон піддалися інтенсивній медійній критиці через їхній потенційний негативний вплив на її виборчі перспективи; вирази обличчя, як з’ясувалося, також є темою інтересу для ФБР; і вони є критичним індикатором на робочих інтерв’ю, роблячи (далекий) перспективу живого “фільтра контролю виразу” бажаною розробкою для тих, хто шукає роботу та намагається пройти попередній відбір на Zoom.
Дослідження 2005 року з Великої Британії стверджувало, що зовнішній вигляд впливає на виборчі рішення, тоді як у 2019 році публікація Washington Post розглянула використання відеокліпів “без контексту”, яке зараз є найближчою річчю, яку прихильники фейкових новин мають до того, щоб змінити, як публічна особа здається, поводиться, реагує чи відчуває.
До нейронної маніпуляції виразами
На даний момент стан мистецтва маніпуляції з виразами обличчя досить примітивний, оскільки він включає в себе відокремлення високорівневих концепцій (таких як сум, гнів, радість, усмішка) від фактичного відеоконтенту. Хоча традиційні архітектури дублів здаються досить добре досягли цього відокремлення, дзеркальне відображення емоцій через різні ідентичності все ще вимагає, щоб дві навчальні набори обличчя містили відповідні вирази для кожної ідентичності.

Типові приклади зображень обличчя в наборах даних, використаних для навчання дублів. На даний момент ви можете змінити вираз обличчя людини лише шляхом створення шляхів виразу-виразу, специфічних для ідентичності, у нейронній мережі дублів. Програмне забезпечення дублів 2017 року не має внутрішнього, семантичного розуміння “усмішки” – воно просто відображає та поєднує сприйняті зміни геометрії обличчя між двома об’єктами.
Що бажано, і ще не досягнуто досконало, це розпізнати, як суб’єкт Б (наприклад) усміхається, і просто створити ‘усмішку’ перемикач у архітектурі, без необхідності відображати його на еквівалентному зображенні суб’єкта А, який усміхається.
Нова стаття називається Нейронний режисер емоцій: керування виразами обличчя за допомогою семантичних міток у “дикій” відео, і походить від дослідників Школи електротехніки та комп’ютерних наук Національного технічного університету Афін, Інституту комп’ютерних наук Фонду досліджень та технологій Греції (FORTH), та Коледжу інженерії, математики та фізичних наук Університету Ексетера у Великій Британії.
Команда розробила рамку під назвою Нейронний режисер емоцій (NED), який включає 3D-емулятор емоцій, 3D-емулятор маніпуляції.
NED приймає отриману послідовність параметрів виразу та перекладає їх у цільову область. Його тренують на не паралельних даних, що означає, що не потрібно тренувати на наборах даних, де кожна ідентичність має відповідні вирази обличчя.

Відео, показане в кінці цієї статті, проходить через серію тестів, де NED накладає очевидний емоційний стан на кадри з набору даних YouTube.
Автори стверджують, що NED є першим відео-методом для “керування” акторами в випадкових та непередбачуваних ситуаціях, і зробили код доступним на сторінці проекту NED.
Метод і архітектура
Система тренується на двох великих відео наборах даних, які були анотовані мітками “емоції”.
Вихід забезпечується відео-рендерером обличчя, який відображає бажану емоцію у відео за допомогою традиційних технік синтезу зображення обличчя, включаючи сегментацію обличчя, вирівнювання орієнтації та змішування, де синтезується лише область обличчя, а потім накладається на оригінальне відео.
Спочатку система отримує 3D-відновлення обличчя та накладає вирівнювання орієнтації на вхідні кадри для визначення виразу. Після цього ці відновлені параметри виразу передаються до 3D-емулятора маніпуляції, а вектор стилю обчислюється за допомогою або семантичної мітки (наприклад, “радість”), або файлу посилання.
Файл посилання – це відео, яке зображує певний визнаний вираз/емоцію, яке потім накладається на всю цільову відео, заміняючи оригінальний вираз.
Остаточна згенерована 3D-форма обличчя потім конкатенується з нормалізованими координатами обличчя (NMFC) та зображеннями очей (червоні точки на зображенні вище), а потім передається нейронному рендереру, який здійснює остаточну маніпуляцію.
Результати
Дослідники провели широкомасштабні дослідження, включаючи дослідження користувачів та аналізи, для оцінки ефективності методу порівняно з попередньою роботою, і виявили, що в більшості категорій NED перевершує сучасний стан мистецтва в цій підгалузі нейронної маніпуляції обличчя.

Автори статті передбачають, що пізніші реалізації цієї роботи, а також інструменти подібного типу, будуть корисними в першу чергу в телевізійній та кінематографічній промисловості, заявивши:
‘Наш метод відкриває безліч нових можливостей для корисних застосувань технологій нейронного рендерингу, починаючи від постпродакшну фільмів і відеоігор до фотореалістичних афективних аватарів.’
Це рання робота в цій галузі, але одна з перших, яка намагається змінити обличчя у відео, а не у статичних зображеннях. Хоча відео по суті складається з багатьох статичних зображень, які швидко змінюють одне одного, існують тимчасові фактори, які роблять попередні застосування передачі емоцій менш ефективними. У супроводжувальному відео та прикладах у статті автори включили візуальні порівняння виводу NED з іншими порівнюваними недавніми методами.
Більш детальні порівняння, а також багато інших прикладів NED, можна знайти у повному відео нижче:
3 грудня 2021 року, 18:30 GMT+2 – За запитом одного з авторів статті були внесені виправлення щодо “файлу посилання”, який я помилково назвав статичним зображенням (хоча насправді це відеокліп). Також було внесено виправлення до назви Інституту комп’ютерних наук Фонду досліджень та технологій.
3 грудня 2021 року, 20:50 GMT+2 – Другий запит одного з авторів статті на подальше виправлення назви вищезгаданого інституту.















