Взгляд Anderson
Изменение эмоций в видеозаписях с помощью ИИ

Исследователи из Греции и Великобритании разработали новый подход к изменению выражений лица и эмоций людей в видеозаписях, сохраняя при этом точность движений губ в соответствии с исходным аудио, что не удавалось сделать в предыдущих попытках.

Из видео, сопровождающего статью (вложено в конце этой статьи), короткий клип актера Аль Пачино, у которого выражение лица было незаметно изменено с помощью NED, на основе высокоуровневых семантических концепций, определяющих индивидуальные выражения лица и связанные с ними эмоции. Метод “Reference-Driven” справа принимает интерпретированную эмоцию/эмоции из источника видео и применяет ее ко всему видеосеквенсу. Source: https://www.youtube.com/watch?v=Li6W8pRDMJQ
Эта конкретная область исследований входит в категорию deepfaked эмоций, где сохраняется идентичность исходного говорящего, но меняются его выражения и микровыражения. По мере совершенствования этой технологии ИИ появляется возможность для кинопроизводства и телевидения вносить незначительные изменения в выражения актеров – и открывается новая категория “эмоционально измененных” видео-Deepfakes.
Изменение лиц
Выражения лица для публичных деятелей, таких как политики, тщательно отбираются; в 2016 году выражения лица Хиллари Клинтон подверглись интенсивному медиа-сканированию за их потенциальное негативное влияние на ее избирательные перспективы; выражения лица, оказывается, также являются тема интереса для ФБР; и они являются критическим показателем на собеседованиях, что делает (далекий) перспективу живого фильтра “контроля выражения” желательным развитием для соискателей, пытающихся пройти предварительный отбор на Zoom.
Исследование 2005 года из Великобритании утверждало, что внешний вид лица влияет на решения при голосовании, в то время как статья 2019 года в Washington Post исследовала использование видеоклипов “вне контекста”, что сейчас является ближайшим к тому, что сторонники фейковых новостей имеют возможность изменить, как публичный деятель кажется ведущим, реагирующим или чувствующим.
К направлению манипуляции выражений лица с помощью нейронных сетей
На данный момент состояние искусства в манипулировании выражениями лица довольно примитивно, поскольку оно включает в себя распутывание высокоуровневых концепций (таких как грустный, злой, счастливый, улыбающийся) из фактического видеоконтента. Хотя традиционные архитектуры Deepfakes, кажется, достигают этого распутывания довольно хорошо, зеркалирование эмоций через разные идентичности все еще требует, чтобы два набора лиц для обучения содержали соответствующие выражения для каждой идентичности.

Типичные примеры изображений лиц в наборах данных, используемых для обучения Deepfakes. В настоящее время вы можете изменить выражение лица человека, создав пути выражения-выражения, специфичные для идентичности, в нейронной сети Deepfakes. Программное обеспечение Deepfakes 2017 года не имеет внутреннего, семантического понимания “улыбки” – оно просто сопоставляет и соответствует воспринимаемые изменения геометрии лица между двумя субъектами.
Что желательно, и еще не было идеально достигнуто, – это распознавание того, как субъект Б (например) улыбается, и просто создание ‘переключателя улыбки’ в архитектуре, без необходимости сопоставлять его с эквивалентным изображением субъекта А, улыбающегося.
Новая статья озаглавлена Нейронный директор эмоций: сохраняющий речь семантический контроль выражений лица в “дикой” видео и исходит от исследователей Школы электротехники и компьютерных наук Национального технического университета Афин, Института компьютерных наук Фонда исследований и технологий Hellas (FORTH) и Колледжа инженерии, математики и физических наук Университета Эксетера в Великобритании.
Команда разработала框架 под названием Нейронный директор эмоций (NED), включающий 3D-основанную сеть перевода эмоций, 3D-основанный манипулятор эмоций.
NED принимает полученную последовательность параметров выражения и переводит их в целевую область. Он обучен на не параллельных данных, что означает, что не обязательно обучать на наборах данных, где каждая идентичность имеет соответствующие выражения лица.

Видео, показанное в конце этой статьи, проходит через ряд тестов, где NED накладывает видимое эмоциональное состояние на кадры из набора данных YouTube.
Авторы утверждают, что NED является первым видео-основанным методом для “направления” актеров в случайных и непредсказуемых ситуациях, и сделали код доступным на странице проекта.
Метод и архитектура
Система обучена на двух больших видео-наборах данных, которые были аннотированы метками “эмоция”.
Выходные данные обеспечиваются видео-рендерером лица, который рендерит желаемую эмоцию в видео, используя традиционные методы синтеза лица, включая сегментацию лица, выравнивание ориентиров и смешивание, где синтезируется только область лица, и затем наложена на исходное видео.
Первоначально система получает 3D-восстановление лица и накладывает ориентиров на входные кадры, чтобы определить выражение. После этого эти восстановленные параметры выражения передаются в 3D-основанный манипулятор эмоций, и вектор стиля, вычисленный путем семантической метки (такой как “счастливый”) или ссылочного файла.
Ссылочный файл – это видео, изображающее определенное распознанное выражение/эмоцию, которое затем накладывается на всю целевую видеосеквенцию, заменяя исходное выражение.

Этапы конвейера перевода эмоций, на которых изображены различные актеры, отобранные из видео YouTube.
Обработанный 3D-формат лица затем объединяется с нормализованными координатами лица (NMFC) и изображениями глаз (красные точки на изображении выше) и передается нейронному рендереру, который выполняет окончательную манипуляцию.
Результаты
Исследователи провели обширные исследования, включая пользовательские и абляционные исследования, чтобы оценить эффективность метода по сравнению с предыдущими работами, и обнаружили, что в большинстве категорий NED превосходит текущее состояние искусства в этой подобласти нейронной манипуляции лица.

Авторы статьи предполагают, что более поздние реализации этой работы и инструменты подобного рода будут полезны в первую очередь в телевизионной и кинопроизводственной промышленности, заявив:
‘Наш метод открывает множество новых возможностей для полезных применений технологий нейронного рендеринга, от постпроизводства фильмов и видеоигр до фотореалистичных аффективных аватаров.’
Это ранняя работа в этой области, но одна из первых, которая попыталась сделать переосмысление лица с видео, а не с статичными изображениями. Хотя видео по сути является многими статичными изображениями, следующими друг за другом очень быстро, есть временные соображения, которые делают предыдущие применения передачи эмоций менее эффективными. В сопровождающем видео и примерах в статье авторы включают визуальные сравнения выходных данных NED с другими сравнимыми недавними методами.
Более подробные сравнения и многие другие примеры NED можно найти в полном видео ниже:
3 декабря 2021 года, 18:30 GMT+2 – По просьбе одного из авторов статьи были внесены исправления, касающиеся “ссылочного файла”, который я ошибочно назвал статическим изображением (на самом деле это видеоклип). Также было внесено исправление в название Института компьютерных наук Фонда исследований и технологий.
3 декабря 2021 года, 20:50 GMT+2 – Вторая просьба от одного из авторов статьи о дальнейшем исправлении названия вышеупомянутого учреждения.














