Взгляд Anderson

Рассвет глубоких эмоций

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи разработали новый метод машинного обучения, позволяющий произвольно навязывать новые эмоции лицам в видео, адаптируя существующие технологии, которые недавно появились в качестве решений для синхронизации движений губ с иностранным языком дубляжа.

Исследование является равным сотрудничеством между Северо-Восточным университетом в Бостоне и лабораторией Media Lab в MIT, и называется Инвертируемые хмурости: перевод эмоций лица с видео на видео. Хотя исследователи признают, что первоначальное качество результатов должно быть разработано через дальнейшие исследования, они утверждают, что метод, называемый Wav2Lip-Emotion, является первым в своем роде, который напрямую решает задачу модификации выражения лица на видео с помощью методов нейронных сетей.

Базовый код был опубликован на GitHub, хотя контрольные точки модели будут добавлены в репозиторий с открытым исходным кодом позже, обещают авторы.

Слева - 'грустный' кадр исходного видео. Справа - 'счастливый' кадр. В центре - два начальных подхода к синтезу альтернативных эмоций - верхний ряд: полностью замаскированное лицо, где вся поверхность выражения была заменена; нижний ряд: более традиционный метод Wav2Lip, который заменяет только нижнюю часть лица. Источник: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

Слева – ‘грустный’ кадр исходного видео. Справа – ‘счастливый’ кадр. В центре – два начальных подхода к синтезу альтернативных эмоций – верхний ряд: полностью замаскированное лицо, где вся поверхность выражения была заменена; нижний ряд: более традиционный метод Wav2Lip, который заменяет только нижнюю часть лица. Источник: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

Один видео в качестве исходных данных

В теории, такие манипуляции могут быть получены сейчас через полное обучение на традиционных репозиториях глубоких подделок, таких как DeepFaceLab или FaceSwap. Однако стандартный рабочий процесс потребует использования альтернативной идентичности для ‘целевой’ идентичности, такой как актер, имитирующий цель, чьи собственные выражения будут переданы другому индивиду, вместе с остальной частью выступления. Кроме того, обычно потребуются методы подделки голоса глубоких подделок, чтобы завершить иллюзию.

Дальше, фактическое изменение выражения цели1>цели1 в единственном видео под этими популярными фреймворками потребует изменения векторов выравнивания лица таким образом, что эти архитектуры в настоящее время не могут обеспечить.

Wav2Lip-Emotion сохраняет синхронизацию губ исходного видео-аудио диалога при трансформации связанных выражений.

Wav2Lip-Emotion сохраняет синхронизацию губ исходного видео-аудио диалога при трансформации связанных выражений.

Вместо этого Wav2Lip-Emotion эффективно стремится ‘скопировать и вставить’ эмоциональные выражения из одной части видео и заменить их в другие точки, с самоназначенной бережливостью исходных данных, которая в конечном итоге должна предложить более низко-усиливый метод для манипуляции выражением.

Офлайн-модели могли бы быть разработаны позже, которые обучаются на альтернативных видео говорящего, исключая необходимость наличия в одном видео ‘палитры’ состояний выражения, с помощью которых можно манипулировать видео.

Потенциальные цели

Авторы предлагают ряд применений для модификации выражения, включая живой видео-фильтр для компенсации эффектов ПТСР и фазы лица у страдающих. В статье наблюдается:

‘Люди с или без ингибированных выражений лица могут извлечь пользу из настройки своих выражений, чтобы лучше соответствовать их социальным обстоятельствам. Один может захотеть изменить выражения в видео, показанных им. Ораторы могут кричать друг на друга во время видеоконференции, но все равно хотят получить содержание в их обмене без неприятных выражений. Или кинорежиссер может захотеть усилить или уменьшить выражения актера.’

Поскольку выражение лица является ключевым и основным индикатором намерения, даже когда оно может противоречить словам, произнесенным, способность изменить выражение также предлагает, в некоторой степени, возможность изменить, как коммуникация принимается.

Предыдущая работа

Интерес к изменению выражения с помощью машинного обучения восходит как минимум к 2012 году, когда сотрудничество между Adobe, Facebook и Университетом Рутгерса предложило метод изменения выражения с помощью подхода реконструкции 3D-геометрии на основе тензоров, который трудоемко наложил сетку CGI на каждый кадр целевого видео, чтобы произвести изменение.

Исследование Adobe/Facebook 2012 года манипулировало выражениями, накладывая традиционные, CGI-обусловленные изменения на видео. Выражения можно было усилить или подавить. Источник: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

Исследование Adobe/Facebook 2012 года манипулировало выражениями, накладывая традиционные, CGI-обусловленные изменения на видео. Выражения можно было усилить или подавить. Источник: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

Хотя результаты были перспективными, метод был трудоемким, и необходимые ресурсы были значительными. На тот момент CGI был далеко впереди подходов компьютерного зрения к прямому манипулированию функциями и пикселями.

Более тесно связано с новой статьей является MEAD, набор данных и модель генерации выражений, выпущенная в 2020 году, способная генерировать видео ‘говорящих голов’, хотя и без уровня сложности, потенциально достижимого путем модификации фактического исходного видео напрямую.

Генерация выражений с помощью MEAD 2020 года, сотрудничество между SenseTime Research, Университетом Карнеги-Меллона и тремя китайскими университетами. Источник: https://wywu.github.io/projects/MEAD/MEAD.html

Генерация выражений с помощью MEAD 2020 года, сотрудничество между SenseTime Research, Университетом Карнеги-Меллона и тремя китайскими университетами. Источник: https://wywu.github.io/projects/MEAD/MEAD.html

В 2018 году другая статья, озаглавленная GANimation: анатомически-осведомленная анимация лица из одного изображения, появилась как сотрудничество между американскими и испанскими академическими исследователями, и использовала генеративные сети противников для изменения или изменения выражений на статических изображениях только.

Изменение выражений на статических изображениях с помощью GANimation. Источник: https://arxiv.org/pdf/1807.09251.pdf

Изменение выражений на статических изображениях с помощью GANimation. Источник: https://arxiv.org/pdf/1807.09251.pdf

Wav2Lip-Emotion

Вместо этого новый проект основан на Wav2Lip, который получил известность в 2020 году, предложив потенциальный метод для синхронизации движений губ с новым входным речью (или песней), который никогда не появлялся в исходном видео.

Оригинальная архитектура Wav2Lip была обучена на корпусе устных предложений из архивов BBC. Чтобы адаптировать Wav2Lip к задаче изменения выражения, исследователи ‘тонко настроили’ архитектуру на вышеупомянутом наборе данных MEAD.

MEAD состоит из 40 часов видео, в которых 60 актеров читают одно и то же предложение, выполняя различные выражения лица. Актеры происходят из 15 разных стран и предлагают ряд международных характеристик, направленных на то, чтобы помочь проекту (и полученным проектам) производить применимую и хорошо обобщенную синтез выражения.

В момент исследования MEAD выпустил только первую часть набора данных, в которой 47 человек выполняют выражения, такие как ‘злой’, ‘презрение’, ‘страх’, ‘презрение’, ‘счастливый’, ‘грустный’ и ‘удивление’. В этом первоначальном подходе к новому подходу исследователи ограничили объем проекта до наложения или изменения воспринимаемых эмоций ‘счастливых’ и ‘грустных’, поскольку они являются наиболее легко распознаваемыми.

Метод и результаты

Оригинальная архитектура Wav2Lip заменяет только нижнюю часть лица, тогда как Wav2Lip-Emotion также экспериментирует с полной маской замены лица и синтезом выражения. Таким образом, исследователям необходимо было изменить встроенные методы оценки, поскольку они не были разработаны для полно-лицевой конфигурации.

Авторы улучшают исходный код, сохраняя исходный аудио-вход, поддерживая последовательность движений губ.

Генераторный элемент включает в себя кодировщик идентичности, кодировщик речи и декодировщик лица, в соответствии с предыдущей работой. Элемент речи кодируется дополнительно как сложенные 2D-свёрточные операции, которые затем конкатенируются с их связанными кадрами.

Помимо генеративного элемента, измененная архитектура включает в себя три основных компонента дискриминатора, нацеленных на качество синхронизации губ, элемент цели эмоций и визуально-качественный элемент, обученный противником.

Для полной реконструкции лица исходная работа Wav2Lip не содержала прецедента, и поэтому модель была обучена с нуля. Для обучения нижней части лица (полумаски) исследователи начали с контрольных точек, включенных в исходный код Wav2Lip.

Помимо автоматической оценки, исследователи использовали общественное мнение, предоставленное полуавтоматической сервисной платформой. Работники в целом оценили вывод высоко по признанию наложенных эмоций, в то время как только сообщали ‘умеренные’ оценки качества изображения.

Авторы предлагают, что, кроме улучшения качества сгенерированного видео с дальнейшими усовершенствованиями, будущие итерации работы могли бы охватывать более широкий диапазон эмоций, и что работа могла бы быть применена в будущем к помеченным или автоматически выведенным исходным данным и наборам данных, что в конечном итоге приведет к аутентичной системе, в которой эмоции могли бы быть установлены вверх или вниз по желанию пользователя, или в конечном итоге заменены противоречивыми эмоциями по отношению к исходному видео.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai