Взгляд Anderson

Переструктуризация лиц в видео с помощью машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Исследовательское сотрудничество между Китаем и Великобританией разработало новый метод для изменения формы лица в видео. Этот метод позволяет добиться убедительного расширения и сужения структуры лица, с высокой последовательностью и отсутствием артефактов.

Из видео с YouTube, использованного в качестве исходного материала исследователями, актриса Дженнифер Лоуренс появляется как более хрупкая личность (справа). Смотрите сопровождающее видео, встроенное в нижней части статьи, для многих более примеров в лучшем качестве. Источник: https://www.youtube.com/watch?v=tA2BxvrKvjE

Из видео с YouTube, использованного в качестве исходного материала исследователями, актриса Дженнифер Лоуренс появляется как более хрупкая личность (справа). Смотрите сопровождающее видео, встроенное в нижней части статьи, для многих более примеров в лучшем качестве. Источник: https://www.youtube.com/watch?v=tA2BxvrKvjE

Такой тип трансформации обычно возможен только с помощью традиционных методов CGI, которые бы потребовали полностью воссоздать лицо с помощью подробных и дорогих процедур захвата движения, риггинга и текстурирования.

Вместо этого, CGI, используемый в этом методе, интегрирован в нейронную трубу как параметрическая 3D информация о лице, которая затем используется в качестве основы для рабочего процесса машинного обучения.

Традиционные параметрические лица все чаще используются в качестве руководства для трансформационных процессов, которые используют ИИ вместо CGI. Источник: https://arxiv.org/pdf/2205.02538.pdf

Традиционные параметрические лица все чаще используются в качестве руководства для трансформационных процессов, которые используют ИИ вместо CGI. Источник: https://arxiv.org/pdf/2205.02538.pdf

Авторы заявляют:

‘Наша цель – генерировать высококачественные видео с изменением формы лица, редактируя общую форму лица в соответствии с естественной деформацией лица в реальном мире. Это можно использовать для таких применений, как генерация красивых лиц для красоты и преувеличение лица для визуальных эффектов.’

Хотя 2D-искажение и искажение лица были доступны потребителям с момента появления Photoshop (и привели к странным и часто неприемлемым субкультурам вокруг искажения лица и дисморфии тела), это трудно реализовать в видео без использования CGI.

Марк Цукерберг с измененными размерами лица с помощью китайско-британского метода.

Марк Цукерберг с измененными размерами лица с помощью нового китайско-британского метода.

Изменение формы тела в настоящее время является областью интенсивного интереса в секторе компьютерного зрения, главным образом из-за его потенциала в электронной коммерции моды, хотя сделать кого-то более высоким или скелетно разнообразным в настоящее время является заметной проблемой.

Аналогично, изменение формы головы в видеозаписи последовательным и убедительным образом было предметом предыдущих исследований новых исследователей, хотя это реализация страдала от артефактов и других ограничений. Новый метод расширяет возможности этого предыдущего исследования с статического на видео-выход.

Новая система была обучена на настольном компьютере с процессором AMD Ryzen 9 3950X и 32 ГБ оперативной памяти и использует алгоритм оптического потока из OpenCV для карт движения, сглаженных с помощью StructureFlow фреймворка; сеть Facial Alignment Network (FAN) для оценки ориентиров, которая также используется в популярных пакетах deepfakes; и Ceres Solver для решения задач оптимизации.

Крайний пример изменения ширины лица с помощью новой системы.

Крайний пример изменения ширины лица с помощью новой системы.

Статья называется Параметрическая переструктуризация портретов в видео, и исходит от трех исследователей из Университета Чжэцзяна и одного из Университета Бата.

О Лице

Под новой системой видео извлекается в последовательность изображений, и сначала оценивается жесткая поза для каждого лица. Затем совместно оценивается представительное количество последующих кадров для построения последовательных параметров идентичности на протяжении всего хода изображений (т.е. кадров видео).

Архитектурный поток системы искажения лица.

Архитектурный поток системы искажения лица.

После этого оценивается выражение, в результате чего получается параметр переструктуризации, который реализуется с помощью линейной регрессии. Далее новый подход с функцией подписанного расстояния (SDF) строит плотную 2D-карту линейных элементов лица до и после переструктуризации.

Наконец, выполняется оптимизация искажения содержимого на выходном видео.

Параметрические Лица

Процесс использует 3D-модель лица (3DMM), которая все чаще используется в качестве дополнения к нейронным и генеративным системам синтеза лица, а также применима для обнаружения deepfakes.

Не из статьи, но пример 3D-модели лица (3DMM) - параметрической прототипной модели лица, используемой в новом проекте. Вверху слева, применение ориентиров на 3D-модели лица. Вверху справа, вершины 3D-меша изоморфного отображения. Внизу слева показано подгонка ориентиров; в центре внизу, изоморфное отображение извлеченной текстуры лица; и вправо внизу, результирующее подгонка и форма. Источник: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Не из новой статьи, но пример 3D-модели лица (3DMM) – параметрической прототипной модели лица, используемой в новом проекте. Вверху слева, применение ориентиров на 3D-модели лица. Вверху справа, вершины 3D-меша изоморфного отображения. Внизу слева показано подгонка ориентиров; в центре внизу, изоморфное отображение извлеченной текстуры лица; и вправо внизу, результирующее подгонка и форма. Источник: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Поток работы новой системы должен учитывать случаи заслонения, такие как случай, когда объект смотрит в сторону. Это одна из самых больших проблем в программном обеспечении deepfakes, поскольку ориентиры FAN имеют небольшую возможность учесть эти случаи и склонны ухудшаться в качестве при отклонении или заслонении лица.

Новая система может избежать этой ловушки, определяя энергию контура, способную совпадать с границей между 3D-лицом (3DMM) и 2D-лицом (определенным ориентирами FAN).

Оптимизация

Полезным развертыванием такой системы было бы реализовать реальное время деформации, например, в фильтрах видеочата. Текущий фреймворк не позволяет этого, и вычислительные ресурсы, необходимые для этого, сделали бы “живую” деформацию заметной проблемой.

Согласно статье, и предполагая цель видео 24 кадра в секунду, операции с кадрами в трубе представляют задержку 16,344 секунды на каждый секунду кадров, с дополнительными единовременными ударами для оценки идентичности и деформации лица 3D (321 мс и 160 мс соответственно).

Следовательно, оптимизация является ключом к прогрессу в снижении задержки. Поскольку совместная оптимизация по всем кадрам добавит значительную нагрузку на процесс, а оптимизация стиля init (предполагая последовательную идентичность говорящего с первого кадра) может привести к аномалиям, авторы приняли схему с разреженным расчетом коэффициентов кадров, отобранных на практических интервалах.

Совместная оптимизация затем выполняется на этом подмножестве кадров, что приводит к более экономному процессу реконструкции.

Искажение Лица

Техника искажения, используемая в проекте, является адаптацией работы авторов 2020 года Глубокие портреты (DSP).

Глубокие портреты, представленные на ACM Multimedia 2020. Статья возглавляется исследователями из ZJU-Tencent Game и Intelligent Graphics Innovation Technology Joint Lab. Источник: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Глубокие портреты, представленные на ACM Multimedia 2020. Статья возглавляется исследователями из ZJU-Tencent Game и Intelligent Graphics Innovation Technology Joint Lab. Источник: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Авторы отмечают ‘Мы расширяем этот метод от переструктуризации одного моноокулярного изображения до переструктуризации всей последовательности изображений.’

Тесты

В статье отмечается, что не было сравнимого предыдущего материала, с которым можно было бы оценить новый метод. Поэтому авторы сравнили кадры своего искаженного видео-выхода со статическим выходом DSP.

Тестирование новой системы против статических изображений из Глубоких портретов.

Тестирование новой системы против статических изображений из Глубоких портретов.

Авторы отмечают, что артефакты возникают из метода DSP, из-за использования разреженного отображения – проблемы, которую новый фреймворк решает с помощью плотного отображения. Кроме того, видео, произведенное DSP, по мнению статьи, демонстрирует отсутствие плавности и визуальной согласованности.

Авторы заявляют:

‘Результаты показывают, что наш подход может надежно производить согласованные видео с измененной формой лица, в то время как метод, основанный на изображении, может легко привести к заметным артефактам мигания.’

Посмотрите сопровождающее видео ниже, для более примеров:

 

Опубликовано впервые 9 мая 2022 года. Исправлено 18:00 EET, заменил ‘поле’ на ‘функцию’ для SDF.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai