Взгляд Anderson

Добавление диалога к реальному видео с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google
Montage of subjects from the demonstration video-clips for FacEDiT. Source: https://facedit.github.io/

Новая структура ИИ может переписать, удалить или добавить слова человека в видео без пересъёмки, в единой системе от начала до конца.

 

Три года назад интернет был бы поражён любой из 20-30 структур видео-изменения ИИ, которые публикуются в академических порталах каждую неделю; но поскольку эта популярная ветвь исследований теперь стала настолько плодотворной, что почти образует другой раздел “ИИ-помоя”, и я освещаю гораздо меньше таких выпусков, чем два или три года назад.

Однако один из текущих выпусков в этой линии привлёк моё внимание: интегрированная система, которая может вмешаться в реальные видеоклипы и вставить новый диалог в существующее видео (а не создавать целый генеративный клип из лица или кадра, что гораздо более распространено).

В примерах ниже, которые я собрал из множества образцов видео, доступных на сайте проекта project website, мы сначала видим реальный исходный клип, а затем, ниже, наложенный диалог ИИ в середине клипа, включая синтез голоса и синхронизацию губ:

Нажмите, чтобы воспроизвести. Местное редактирование со склеиванием – один из нескольких режимов, предлагаемых FacEDiT. Пожалуйста, обратитесь к исходному веб-сайту для лучшего разрешения. Источник – https://facedit.github.io/

Этот подход является одним из трёх, разработанных для нового метода, этот называется “местное редактирование со склеиванием”, и это тот, который наиболее интересует авторов (а также меня). По сути, клип расширяется за счёт использования одного из средних кадров в качестве начальной точки для нового интерпретации ИИ, и его последующего (реального) кадра в качестве цели, к которой должна стремиться сгенерированная вставка.

Авторы представляют этот подход к синтезу лица и голоса как первый полностью интегрированный метод ИИ для редактирования видео такого типа, отмечая потенциал полностью разработанной структуры такого типа для телевидения и кинопроизводства:

‘Кинематографисты и производители медиа часто需要 пересмотреть определённые части записанных видео – может быть, слово было неправильно произнесено или сценарий изменился после съёмки. Например, в иконической сцене из Титаника (1997), где Роуз говорит: “Я никогда не отпущу тебя, Джек,” режиссёр может позже решить, что это должно быть “Я никогда не забуду тебя, Джек”.

‘Традиционно, такие изменения требуют пересъёмки всей сцены, что дорого и耗ает время. Синтез говорящего лица предлагает практическую альтернативу, автоматически изменяя движение лица, чтобы оно соответствовало пересмотренному диалогу, исключая необходимость в пересъёмке.’

Хотя вставки ИИ такого типа могут столкнуться с культурными или отраслевыми препятствиями, они также могут составлять новый тип функциональности в системах и наборах инструментов VFX, возглавляемых человеком. В любом случае, на данный момент проблемы строго технические.

Помимо расширения клипа за счёт дополнительного диалога ИИ, новая система также может изменить существующий диалог:

Нажмите, чтобы воспроизвести. Пример изменения существующего диалога, а не вставки дополнительного диалога. Пожалуйста, обратитесь к исходному веб-сайту для лучшего разрешения.

Состояние дел

В настоящее время нет систем от начала до конца, которые предлагают такую возможность синтеза; хотя растущее число платформ ИИ, таких как серия Veo от Google, может генерировать аудио, и различные другие структуры могут создавать аудио-Deepfakes, сейчас необходимо создать довольно сложную цепочку различных архитектур и трюков, чтобы вмешаться в реальное видео таким образом, как может сделать новая система – озаглавленная FacEDiT.

Система использует Diffusion Transformers (DiT) в сочетании с Flow Matching, чтобы создать движения лица, обусловленные окружающими (контекстными) движениями и аудио-контентом речи. Система использует существующие популярные пакеты, которые занимаются реконструкцией лица, включая LivePortrait (недавно приобретённый Kling).

Помимо этого метода, учитывая, что их подход является первым, который интегрирует эти проблемы в единое решение, авторы создали новую базу данных, называемую FacEDiTBench, вместе с несколькими совершенно новыми метриками оценки, подходящими для этой конкретной задачи.

Новая работа называется FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling и исходит от четырёх исследователей из Университета науки и технологий Pohang (POSTECH), Корейского института передовых технологий (KAIST) и Университета Техаса в Остине.

Метод

FacEDiT обучается для реконструкции движения лица, изучая, как заполнить缺ующие части исходного выступления актёра, на основе окружающего движения и аудио-речи. Как показано в схеме ниже, этот процесс позволяет модели действовать как заполнителю пробелов во время обучения, предсказывая движения лица, соответствующие голосу, и сохраняя последовательность с исходным видео:

Обзор системы FacEDiT, показывающий, как движение лица изучается через самообучение во время обучения, руководствуется отредактированной речью во время вывода, и, наконец, отображается обратно в видео, повторно используя внешний вид исходного кадра, заменяя только целевое движение.

Обзор системы FacEDiT, показывающий, как движение лица изучается через самообучение во время обучения, руководствуется отредактированной речью во время вывода, и, наконец, отображается обратно в видео, повторно используя внешний вид исходного кадра, заменяя только целевое движение. Источник

Во время вывода одна и та же архитектура поддерживает два разных выхода, в зависимости от того, сколько видео маскируется: частичные редактирования, где только фраза изменяется, и остальное остаётся без изменений; или полносentence-генерация, где новое движение синтезируется полностью с нуля.

Модель обучается посредством Flow Matching, который рассматривает видео-редактирование как своего рода путь между двумя версиями движения лица.

Вместо того, чтобы учиться угадывать, как должен выглядеть отредактированное лицо, Flow Matching учится двигаться постепенно и гладко между шумным плейсхолдером и правильным движением. Для этого система представляет движение лица в виде компактного набора чисел, извлечённых из каждого кадра с помощью версии вышеупомянутой системы LivePortrait (см. схему выше).

Эти векторы движения предназначены для описания выражений и положения головы без запутывания идентичности, чтобы изменения речи можно было локализовать без влияния на общий вид человека.

Обучение FacEDiT

Для обучения FacEDiT каждый видеоклип был разбит на серию снимков движения лица, и каждый кадр был сопоставлен с соответствующим фрагментом аудио. Случайные части данных о движении затем скрывались, и модель просила угадать, какими должны быть эти пропущенные движения, используя для контекста как речь, так и окружающее незамаскированное движение.

Поскольку маскированные участки и их позиции варьируются от одного примера обучения к другому, модель постепенно учится обрабатывать как небольшие внутренние редактирования, так и более длинные пробелы, для полносentence-генерации, в зависимости от того, сколько информации она получает.

Вышеупомянутый трансформатор рассеивания учится восстанавливать маскированное движение, уточняя шумные входные данные со временем. Вместо того, чтобы подавать речь и движение в модель сразу, аудио вводится в каждый блок обработки через кросс-аттенцию, что помогает системе более точно соответствовать движения губ речи.

Чтобы сохранить реализм на протяжении всего редактирования, внимание смещается в сторону соседних кадров, а не всего временного ряда, заставляя модель сосредоточиться на локальной непрерывности и предотвращая мерцания или скачки движения на границах изменённых регионов. Позиционные вложения (которые сообщают модели, где каждый кадр появляется в последовательности)进一步 помогают модели поддерживать естественный временной поток и контекст.

Во время обучения система учится предсказывать пропущенное движение лица, реконструируя маскированные участки на основе речи и ближайшего незамаскированного движения. Во время вывода эта же настройка повторно используется, но с масками, теперь руководствующимися редактированием речи.

Когда слово или фраза вставляется, удаляется или изменяется, система локализует затронутый регион, маскирует его и регенерирует движение, соответствующее новой аудио.

Данные и тесты

Ось системы состоит из 22 слоёв для трансформатора рассеивания, каждый из которых имеет 16 головок внимания и размеры кормовых прямых 1024 и 2024 пикселя. Особенности движения и внешнего вида извлекаются с помощью замороженных компонентов LivePortrait, а речь кодируется с помощью WavLM и изменяется с помощью VoiceCraft.

Посвящённый слой проекции отображает 786-мерные особенности речи в латентное пространство DiT, при этом только DiT и модуль проекции обучаются с нуля.

Обучение проводилось под оптимизатором AdamW с целевой скоростью обучения 1e-4, в течение миллиона шагов, на двух GPU A6000 (каждый с 48 ГБ видеопамяти), при общем размере партии в восемь.

FacEDiTBench

Датасет FacEDiTBench содержит 250 примеров, каждый из которых имеет видеоклип исходной и отредактированной речи, а также транскрипты для обоих. Видео взяты из трёх источников, с 100 клипами из HDTF, 100 из Hallo3, и 50 из CelebV-Dub. Каждый был вручную проверен, чтобы подтвердить, что и аудио, и видео были достаточно чёткими для оценки.

GPT-4o был использован для пересмотра каждой транскрипции, чтобы создать грамматически правильные редактирования. Эти пересмотренные транскрипции, вместе с исходной речью, были переданы в VoiceCraft, чтобы произвести новый аудио; и на каждом этапе как транскрипция, так и сгенерированная речь были вручную проверены на качество.

Каждый образец был помечен типом редактирования, временем изменения и длиной изменённого участка, и редактирования были классифицированы как вставки, удаления или замены. Количество изменённых слов варьировалось от коротких редактирований в 1-3 слова, средних редактирований в 4-6 слов и более длинных редактирований в 7-10 слов.

Три пользовательских метрики были определены для оценки качества редактирования. Фотометрическая непрерывность, чтобы измерить, насколько хорошо освещение и цвет отредактированного участка смешиваются с окружающим видео, сравнивая различия на пиксельном уровне на границах; непрерывность движения, чтобы оценить последовательность движения лица, измеряя изменения оптического потока через отредактированные и неотредактированные кадры; и сохранение идентичности, чтобы оценить, остаётся ли внешний вид субъекта последовательным после редактирования, сравнивая вложения лица из исходной и сгенерированной последовательности с помощью модели распознавания лица ArcFace.

Тесты

Модель тестирования была обучена на материалах из трёх вышеупомянутых наборов данных, в общей сложности около 200 часов видеоконтента, включая видеоблоги и фильмы, а также видео высокого разрешения с YouTube.

Для оценки редактирования лица использовался FacEDiTBench, а также тестовый раздел HDTF, который стал стандартом для этой серии задач.

Поскольку не было直接 сравнимых систем, способных воспроизвести эту функциональность, авторы выбрали несколько структур, которые воспроизводили хотя бы часть целевой функциональности и могли служить базовыми системами; а именно, KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; и SadTalker.

Несколько установленных метрик также были использованы для оценки качества генерации и редактирования, с точностью синхронизации губ, оценённой через SyncNet, сообщающую как абсолютную ошибку между движениями губ и аудио (LSE-D), так и коэффициент уверенности (LSE-C); Fréchet Video Distance (FVD) количественно оценивает, насколько реалистично видео в целом; и метрики подобия, изученные (LPIPS), измеряющие подобие между сгенерированными и исходными кадрами.

Для редактирования все метрики, кроме LPIPS, применялись только к изменённому участку; для генерации вся видео оценивалась, при этом границы исключались.

Каждая модель была вынуждена синтезировать совпадающий видео-участок, который затем вставлялся в исходный клип (исследователи отмечают, что этот метод часто вводил видимые разрывы, где отредактированный участок встречался с окружающим видео). Был протестирован и второй подход, при котором весь видео регенерировался из изменённого аудио – но это неизбежно перезаписывало неотредактированные регионы и не сохраняло исходную производительность:

Сравнение производительности редактирования между системами, изначально разработанными для генерации говорящих лиц, с FacEDiT, превосходящим все базовые системы по каждой метрике, достигая более низкой ошибки синхронизации губ (LSE-D), более высокой уверенности синхронизации (LSE-C), более сильного сохранения идентичности (IDSIM), большей реалистичности восприятия (FVD) и более плавных переходов через границы редактирования (Pcontinuity, Mcontinuity). Серые столбцы подчеркивают ключевые критерии для оценки качества границ; жирные и подчёркнутые значения указывают на лучшие и вторые результаты соответственно.

Сравнение производительности редактирования между системами, изначально разработанными для генерации говорящих лиц, с FacEDiT, превосходящим все базовые системы по каждой метрике, достигая более низкой ошибки синхронизации губ (LSE-D), более высокой уверенности синхронизации (LSE-C), более сильного сохранения идентичности (IDSIM), большей реалистичности восприятия (FVD) и более плавных переходов через границы редактирования (Pcontinuity, Mcontinuity). Серые столбцы подчеркивают ключевые критерии для оценки качества границ; жирные и подчёркнутые значения указывают на лучшие и вторые результаты соответственно.

Что касается этих результатов, авторы комментируют:

‘[Наша] модель значительно превосходит существующие методы в задаче редактирования. Она достигает сильной непрерывности границ и высокой сохранности идентичности, демонстрируя свою способность поддерживать временную и визуальную последовательность во время редактирования. Кроме того, её превосходная точность синхронизации губ и низкий FVD отражают реализм сгенерированного видео.’

Нажмите, чтобы воспроизвести. Результаты, собранные этим автором из опубликованных видео на поддерживающем сайте проекта. Пожалуйста, обратитесь к исходному веб-сайту для лучшего разрешения.

Дальнейшее, человеческое исследование было проведено, чтобы оценить воспринимаемое качество как редактирования, так и генерации.

Для каждого сравнения участники просматривали шесть видео и ранжировали их по общему качеству, учитывая точность синхронизации губ, естественность и реализм движения головы. В испытаниях редактирования участники также оценивали гладкость переходов между отредактированными и неотредактированными участками:

Средние ранги, присвоенные человеческими оценщиками, где более низкий ранг означает лучшее качество. В испытаниях редактирования и генерации участники оценивали, насколько естественно и хорошо синхронизировано каждое видео выглядит. Для редактирования они также оценивали гладкость перехода между отредактированным и неотредактированным диалогом.

Средние ранги, присвоенные человеческими оценщиками, где более низкий ранг означает лучшее качество. В испытаниях редактирования и генерации участники оценивали, насколько естественно и хорошо синхронизировано каждое видео выглядит. Для редактирования они также оценивали гладкость перехода между отредактированным и неотредактированным диалогом.

В исследовании FacEDiT последовательно занимал первое место с существенным отрывом как в редактировании, так и в генерации, также получая высокие оценки в условиях генерации, что указывает на то, что его измеренные преимущества переводятся в предпочитаемые воспринимаемые выходы.

Из-за нехватки места мы направляем читателя к исходной статье для получения дополнительных деталей об исследовании и дополнительных тестах, проведённых в новой работе. В действительности, прототипические исследовательские предложения такого типа борются с созданием значимых разделов тестирования, поскольку само предложение является потенциальной базовой системой для последующей работы.

Заключение

Даже для вывода системы такого типа могут потребоваться значительные вычислительные ресурсы, что затрудняет для пользователей (здесь, предположительно, для студий визуальных эффектов) сохранение работы на месте. Поэтому подходы, которые могут быть адаптированы к реалистичным местным ресурсам, всегда будут предпочитаемы поставщиками, которые находятся под юридическим обязательством защищать клиентские кадры и общую интеллектуальную собственность.

Это не значит, что новое предложение не может работать идеально под квантовыми весами или другими оптимизациями, и это первое предложение такого типа, которое привлекло меня обратно к этому направлению исследований за相当 долгое время.

 

Опубликовано впервые в среду, 17 декабря 202. Отредактировано 20.10 EET, в тот же день, для дополнительного пространства в первом абзаце.

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]