Взгляд Anderson

Синхронизация губ Google’s LipSync3D предлагает улучшенную синхронизацию движения рта в ‘глубоких подделках’

mm
Добавьте Unite.AI в избранные источники в Google

Сотрудничество между исследователями Google AI и Индийским технологическим институтом в Кхарагпуре предлагает новую основу для синтеза говорящих голов из аудиоконтента. Проект направлен на создание оптимизированных и разумно ресурсоемких способов создания видеоконтента с говорящими головами из аудио, для целей синхронизации движений губ с дублированным или машинно-переведенным аудио, и для использования в аватарах, интерактивных приложениях и других реальных средах.

Источник: https://www.youtube.com/watch?v=L1StbX9OznY

Источник: https://www.youtube.com/watch?v=L1StbX9OznY

Модели машинного обучения, обученные в процессе – называемые LipSync3D – требуют только одного видео целевой идентичности лица в качестве входных данных. Pipeline подготовки данных отделяет извлечение геометрии лица от оценки освещения и других аспектов входного видео, что позволяет более экономично и сосредоточенно обучать.

Двухэтапный рабочий процесс LipSync3D. Сверху, генерация динамически текстурированного 3D лица из 'целевого' аудио; снизу, вставка сгенерированной сетки в целевое видео.

Двухэтапный рабочий процесс LipSync3D. Сверху, генерация динамически текстурированного 3D лица из ‘целевого’ аудио; снизу, вставка сгенерированной сетки в целевое видео.

Фактически, наиболее заметный вклад LipSync3D в тело исследовательских усилий в этой области может быть его алгоритмом нормализации освещения, который отделяет обучение и вывод освещения.

Отделение данных освещения от общей геометрии помогает LipSync3D производить более реалистичный выход движения губ в сложных условиях. Другие подходы recent лет ограничивались 'фиксированными' условиями освещения, которые не раскрывают их более ограниченную способность в этом отношении.

Отделение данных освещения от общей геометрии помогает LipSync3D производить более реалистичный выход движения губ в сложных условиях. Другие подходы recent лет ограничивались ‘фиксированными’ условиями освещения, которые не раскрывают их более ограниченную способность в этом отношении.

Во время предварительной обработки входных кадров система должна выявить и удалить зеркальные точки, поскольку они специфичны для условий освещения, при которых было снято видео, и в противном случае будут мешать процессу переосвещения.

LipSync3D, как его название предполагает, не выполняет простой анализ пикселей на лицах, которые он оценивает, но активно использует выявленные ориентиры лица для генерации подвижных сеток CGI-стиля, вместе с ‘развернутыми’ текстурами, которые оборачиваются вокруг них в традиционном CGI-пipeline.

Нормализация позы в LipSync3D. Слева, входные кадры и обнаруженные особенности; в середине, нормализованные вершины сгенерированной сетки оценки; и справа, соответствующая текстурная атлас, которая предоставляет основу для прогнозирования текстуры. Источник: https://arxiv.org/pdf/2106.04185.pdf

Нормализация позы в LipSync3D. Слева, входные кадры и обнаруженные особенности; в середине, нормализованные вершины сгенерированной сетки оценки; и справа, соответствующая текстурная атлас, которая предоставляет основу для прогнозирования текстуры. Источник: https://arxiv.org/pdf/2106.04185.pdf

Помимо нового метода переосвещения, исследователи утверждают, что LipSync3D предлагает три основных инновации по сравнению с предыдущей работой: разделение геометрии, освещения, позы и текстуры на отдельные потоки данных в нормализованном пространстве; легко обучаемую автoregressive модель прогнозирования текстуры, которая производит временно последовательную видеосинтез; и повышенную реалистичность, оцененную по человеческим рейтингам и объективным метрикам.

Разделение различных аспектов видеоизображения лица позволяет получить больший контроль над видеосинтезом.

Разделение различных аспектов видеоизображения лица позволяет получить больший контроль над видеосинтезом.

LipSync3D может получить подходящую геометрию движения губ直接 из аудио, анализируя фонемы и другие аспекты речи, и переводя их в известные соответствующие позы мышц вокруг рта.

Этот процесс использует конвейер совместного прогнозирования, где выведенная геометрия и текстура имеют выделенные кодировщики в автокодировщике, но делят аудиокодировщик с речью, которая должна быть наложена на модель:

Синтез подвижных движений LipSync3D также предназначен для питания стилизованных аватаров CGI, которые по сути являются только таким же типом сетки и текстурной информации, как и реальные изображения:

Стилизованный 3D-аватар имеет движения губ, питаемые в реальном времени видео источника. В таком сценарии лучшие результаты будут получены с помощью персонализированной предварительной подготовки.

Стилизованный 3D-аватар имеет движения губ, питаемые в реальном времени видео источника. В таком сценарии лучшие результаты будут получены с помощью персонализированной предварительной подготовки.

Исследователи также предвидят использование аватаров с немного более реалистичным ощущением:

Примерные времена обучения для видео составляют от 3 до 5 часов для видео продолжительностью 2-5 минут, в конвейере, который использует TensorFlow, Python и C++ на GeForce GTX 1080. Сессии обучения использовали размер пакета 128 кадров за 500-1000 эпох, с каждой эпохой, представляющей полную оценку видео.

К направлению динамической синхронизации движений губ

Область синхронизации губ для адаптации к новому аудиодорожку получила значительное внимание в исследованиях компьютерного зрения в последние годы (см. ниже), не в последнюю очередь потому, что это побочный продукт спорной технологии глубоких подделок.

В 2017 году Университет Вашингтона представил исследование, способное изучать синхронизацию губ из аудио, используя ее для изменения движений губ тогдашнего президента Обамы. В 2018 году; Институт информатики Макса Планка возглавил другую исследовательскую инициативу для ermögления передачи видео идентичности>идентичности, с синхронизацией губ в качестве побочного продукта процесса; и в мае 2021 года стартап AI FlawlessAI раскрыл свою проприетарную технологию синхронизации губ TrueSync, широко полученную в прессе как средство улучшения технологий дублирования для крупных кинорелизов на разных языках.

И, конечно, продолжающееся развитие открытых репозиториев глубоких подделок предоставляет еще одну ветвь активных исследований, вносимых пользователями, в этой области синтеза изображений лица.

nc технология TrueSync, широко полученная в прессе как средство улучшения технологий дублирования для крупных кинорелизов на разных языках. И, конечно, продолжающееся развитие открытых репозиториев глубоких подделок предоставляет еще одну ветвь активных исследований, вносимых пользователями, в этой области синтеза изображений лица.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai