Взгляд Anderson

Значительный прорыв в области видео, созданного с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google
Examples from the DreamActor project page.

Примечание: Страница проекта этой работы содержит 33 видео с автозапуском высокого разрешения, общим объемом половину гигабайта, что дестабилизировало мою систему при загрузке. По этой причине я не буду ссылаться на него напрямую. Читатели могут найти URL-адрес в аннотации или PDF-документе статьи, если они хотят.

Одной из основных целей в текущих исследованиях синтеза видео является генерация полного видеоперформанса, управляемого ИИ, из одного изображения. На этой неделе новая статья от Bytedance Intelligent Creation описала, возможно, наиболее полную систему этого типа, способную производить полные и полуторные анимации, которые сочетают выразительные детали лица с точными крупномасштабными движениями, а также достигают улучшенной согласованности идентичности – область, где даже ведущие коммерческие системы часто отстают.

В примере ниже мы видим выступление, управляемое актером (вверху слева), и полученное из одного изображения (вверху справа), которое обеспечивает замечательно гибкое и ловкое представление, без обычных проблем при создании крупных движений или “угадывании” о скрытых областях (т.е. частей одежды и углов лица, которые должны быть выведены или изобретены, потому что они не видны в единственном источнике-фото):

Аудиоконтент. Нажмите, чтобы воспроизвести. Выступление рождается из двух источников, включая синхронизацию губ, которая обычно является прерогативой специальных вспомогательных систем. Это уменьшенная версия с исходного сайта (см. примечание в начале статьи – применяется ко всем другим встроенным видео здесь).

Хотя мы можем видеть некоторые остаточные проблемы, связанные с сохранением идентичности при каждом клипе, это первая система, которую я видел, которая преуспевает в общем (хотя и не всегда) сохранении идентичности в течение длительного периода без использования LoRAs:

Аудиоконтент. Нажмите, чтобы воспроизвести. Дополнительные примеры из проекта DreamActor.

Новая система, озаглавленная DreamActor, использует трехчастную гибридную систему управления, которая уделяет особое внимание выражению лица, вращению головы и проектированию скелета, тем самым обеспечивая выступления, управляемые ИИ, где ни аспект лица, ни аспект тела не страдают за счет другого – редкая, возможно, неизвестная способность среди подобных систем.

Ниже мы видим одну из этих граней, вращение головы, в действии. Цветной шар в углу каждого миниатюрного изображения справа указывает на виртуальный гимбал, который определяет ориентацию головы независимо от движения и выражения лица, которое здесь управляется актером (внизу слева).

Нажмите, чтобы воспроизвести. Мультicolored шар, визуализированный здесь, представляет собой ось вращения головы аватара, а выражение управляется отдельным модулем и информируется выступлением актера (видно здесь внизу слева).

Одной из наиболее интересных функций проекта, которая даже не включена должным образом в тесты статьи, является его способность получать движение губ напрямую из аудио – способность, которая работает необычно хорошо даже без управляющего видео актера.

Исследователи приняли на себя лучших участников в этой области, включая широко признанные Runway Act-One и LivePortrait, и сообщают, что DreamActor смог достичь лучших количественных результатов.

Поскольку исследователи могут устанавливать свои собственные критерии, количественные результаты не обязательно являются объективным стандартом; но сопровождающие качественные тесты, кажется, подтверждают выводы авторов.

К сожалению, эта система не предназначена для публичного выпуска, и единственная ценность, которую сообщество может потенциально получить из этой работы, заключается в потенциальном воспроизведении методологий, изложенных в статье (как это было сделано с заметным эффектом для равно закрытой Google Dreambooth в 2022 году ).

Статья гласит*:

‘Анимация человеческого изображения имеет возможные социальные риски, такие как неправильное использование для создания фальшивых видео. Предлагаемая технология может быть использована для создания фальшивых видео людей, но существующие инструменты обнаружения [Demamba, Dormant] могут обнаружить эти фальшивки.

‘Чтобы уменьшить эти риски, необходимы четкие этические правила и ответственные рекомендации по использованию. Мы будем строго ограничивать доступ к нашим основным моделям и кодам, чтобы предотвратить неправильное использование.’

Естественно, что этические соображения этого типа удобны с коммерческой точки зрения, поскольку они предоставляют основание для доступа только через API к модели, который может быть затем монетизирован. ByteDance уже сделал это один раз в 2025 году, сделав многообещающий OmniHuman доступным для оплаченных кредитов на сайте Dreamina. Следовательно, поскольку DreamActor, возможно, является еще более сильным продуктом, это, кажется, вероятный исход. Что остается быть увиденным, это то, насколько его принципы, насколько они объяснены в статье, могут помочь открытому сообществу.

Новая статья называется DreamActor-M1: Гolistичная, выразительная и прочная анимация человеческого изображения с гибридным управлением, и исходит от шести исследователей Bytedance.

Метод

Система DreamActor, предложенная в статье, направлена на генерацию человеческой анимации из ссылочного изображения и управляющего видео, используя Diffusion Transformer (DiT) -фреймворк, адаптированный для латентного пространства (видимо, некоторый вкус Stable Diffusion, хотя статья ссылается только на выпуск 2022 года).

Вместо того, чтобы полагаться на внешние модули для обработки условий ссылки, авторы объединяют особенности внешнего вида и движения непосредственно внутри DiT-каркаса, позволяя взаимодействовать во времени и пространстве через внимание:

Схема новой системы: DreamActor кодирует позу, движение лица и внешний вид в отдельные латентные переменные, объединяя их с зашумленными видеолатентными переменными, произведенными 3D-VAE. Эти сигналы объединяются внутри Diffusion Transformer с помощью само- и перекрестного внимания, с общими весами на ветвях. Модель контролируется путем сравнения очищенных выходов с чистыми видеолатентными переменными. Источник: https://arxiv.org/pdf/2504.01724

Схема новой системы: DreamActor кодирует позу, движение лица и внешний вид в отдельные латентные переменные, объединяя их с зашумленными видеолатентными переменными, произведенными 3D-VAE. Эти сигналы объединяются внутри Diffusion Transformer с помощью само- и перекрестного внимания, с общими весами на ветвях. Модель контролируется путем сравнения очищенных выходов с чистыми видеолатентными переменными. Источник: https://arxiv.org/pdf/2504.01724

Для этого модель использует предварительно обученный 3D вариационный автокодировщик для кодирования как входного видео, так и ссылочного изображения. Эти латентные переменные патчифицируются, объединяются и подают в DiT, который обрабатывает их совместно.

Эта архитектура отклоняется от общей практики присоединения вторичной сети для инъекции ссылки, которая была подходом для влиятельных Animate Anyone и Animate Anyone 2 проектов.

Вместо этого DreamActor строит слияние в основную модель самой по себе, упрощая конструкцию, а также улучшая поток информации между сигналами внешнего вида и движения. Модель затем обучается с помощью сопоставления потоков вместо стандартной цели диффузии (Сопоставление потоков обучает модели диффузии путем прямого прогнозирования скоростных полей между данными и шумом, пропуская оценку счета).

Гибридное управление движением

Метод гибридного управления движением, который информирует нейронные отрисовки, сочетает токены позы, полученные из 3D-скелетов тела и сфер головы; неявные представления лица, извлеченные из предварительно обученного кодировщика лица; и токены внешнего вида, отобранные из исходного изображения.

Эти элементы интегрируются внутри Diffusion Transformer с помощью различных механизмов внимания, позволяя системе координировать глобальное движение, выражение лица и визуальную идентичность на протяжении всего процесса генерации.

Для первого из них, вместо того, чтобы полагаться на ориентиры лица, DreamActor использует неявные представления лица для управления выражением, видимо, позволяя более тонкий контроль над динамикой лица, а также разъединяя идентичность и позу головы от выражения.

Для создания этих представлений конвейер сначала обнаруживает и обрезает область лица в каждом кадре управляющего видео, изменяя его размер до 224×224. Обрезанные лица обрабатываются кодировщиком движения лица, предварительно обученным на PD-FGC наборе данных, который затем обусловлен слоем MLP.

PD-FGC, используемый в DreamActor, генерирует говорящую голову из ссылочного изображения с разъединенным контролем синхронизации губ (из аудио), позы головы, движения глаз и выражения (из отдельных видео), позволяя точную, независимую манипуляцию каждым. Источник: https://arxiv.org/pdf/2211.14506

PD-FGC, используемый в DreamActor, генерирует говорящую голову из ссылочного изображения с разъединенным контролем синхронизации губ (из аудио), позы головы, движения глаз и выражения (из отдельных видео), позволяя точную, независимую манипуляцию каждым. Источник: https://arxiv.org/pdf/2211.14506

Результатом является последовательность токенов движения лица, которые вводятся в Diffusion Transformer через слой перекрестного внимания.

Та же самая структура также поддерживает аудио-управляемую вариацию, в которой отдельный кодировщик обучается для сопоставления речевого входа напрямую с токенами движения лица. Это позволяет генерировать синхронизированную анимацию лица – включая движения губ – без управляющего видео.

Аудиоконтент. Нажмите, чтобы воспроизвести. Синхронизация губ, полученная напрямую из аудио, без управляющего видео актера. Единственный входной персонаж – статическое фото, видимое вверху справа.

Во-вторых, для управления позой головы независимо от выражения лица, система вводит 3D-представление сферы головы (см. видео, встроенное ранее в эту статью), которое разъединяет динамику лица от глобального движения головы, улучшая точность и гибкость во время анимации.

Сферы головы генерируются путем извлечения 3D-параметров лица – таких как вращение и поза камеры – из управляющего видео с помощью метода FaceVerse.

Схема проекта FaceVerse. Источник: https://www.liuyebin.com/faceverse/faceverse.html

Схема проекта FaceVerse. Источник: https://www.liuyebin.com/faceverse/faceverse.html

Эти параметры используются для рендеринга цветной сферы, проецируемой на 2D-изображение, пространственно выровненной с управляющей головой. Размер сферы соответствует размеру ссылочной головы, а ее цвет отражает ориентацию головы. Эта абстракция уменьшает сложность обучения 3D-движения головы, помогая сохранять стилизованные или преувеличенные формы головы в персонажах, нарисованных в анимации.

Визуализация сферы управления, влияющей на ориентацию головы.

Визуализация сферы управления, влияющей на ориентацию головы.

Наконец, для управления полным движением тела, система использует 3D-скелеты тела с адаптивной нормализацией длины костей. Параметры тела и рук оцениваются с помощью 4DHumans и HaMeR, которые работают на SMPL-X модели тела.

SMPL-X применяет параметрическую сетку к всему человеческому телу в изображении, выравнивая с оцененной позой и выражением для обеспечения позо-зависимой манипуляции с помощью сетки в качестве объемного руководства. Источник: https://arxiv.org/pdf/1904.05866

SMPL-X применяет параметрическую сетку к всему человеческому телу в изображении, выравнивая с оцененной позой и выражением для обеспечения позо-зависимой манипуляции с помощью сетки в качестве объемного руководства. Источник: https://arxiv.org/pdf/1904.05866

Из этих выходов выбираются ключевые суставы, проецируются в 2D и соединяются в линейные карты скелета. В отличие от методов, таких как Champ, которые рендерят полные сетки тела, этот подход избегает навязывания предварительно определенных приоритетов формы, и, полагаясь исключительно на структуру скелета, модель поощряется выводить форму и внешний вид тела напрямую из ссылочных изображений, уменьшая предвзятость к фиксированным типам тела и улучшая обобщаемость на широкий спектр поз и типов телосложения.

Во время обучения 3D-скелеты тела объединяются с сферами головы и проходят через кодировщик позы, который выдает особенности, которые затем объединяются с зашумленными видеолатентными переменными для производства шумовых токенов, используемых Diffusion Transformer.

В момент вывода система учитывает разницу в скелетных пропорциях между субъектами путем нормализации длины костей. Предварительно обученная модель SeedEdit преобразует как ссылочные, так и управляющие изображения в стандартную каноническую конфигурацию. RTMPose затем используется для извлечения пропорций скелета, которые используются для корректировки управляющего скелета для соответствия анатомии ссылочного субъекта.

Обзор конвейера вывода. Псевдоссылочные изображения могут быть сгенерированы для обогащения сигналов внешнего вида, а гибридные сигналы управления – неявное движение лица и явная поза из сфер головы и скелетов тела – извлекаются из управляющего видео. Эти сигналы затем вводятся в модель DiT для производства анимированного вывода, с движением лица, разъединенным от позы тела, что позволяет использовать аудио в качестве драйвера.

Обзор конвейера вывода. Псевдоссылочные изображения могут быть сгенерированы для обогащения сигналов внешнего вида, а гибридные сигналы управления – неявное движение лица и явная поза из сфер головы и скелетов тела – извлекаются из управляющего видео. Эти сигналы затем вводятся в модель DiT для производства анимированного вывода, с движением лица, разъединенным от позы тела, что позволяет использовать аудио в качестве драйвера.

Управление внешним видом

Для улучшения согласованности внешнего вида, особенно в скрытых или редко видимых областях, система дополняет основное ссылочное изображение псевдоссылочными изображениями, отобранными из входного видео.

Нажмите, чтобы воспроизвести. Система предвидит необходимость точного и последовательного рендеринга скрытых областей. Это, пожалуй, ближе всего к подходу CGI-стиля bitmap-текстуры, который я видел в проекте такого типа.

Эти дополнительные кадры выбираются для разнообразия поз с помощью RTMPose и фильтруются с помощью CLIP-основанного сходства, чтобы обеспечить их согласованность с идентичностью субъекта.

Все ссылочные кадры (основные и псевдоссылочные) кодируются одним и тем же визуальным кодировщиком и объединяются через механизм само-внимания, позволяя модели получить доступ к дополнительным сигналам внешнего вида. Эта установка улучшает покрытие деталей, таких как профильные виды или текстуры конечностей. Псевдоссылочные изображения всегда используются во время обучения и опционально во время вывода.

Обучение

DreamActor был обучен в три этапа, чтобы постепенно ввести сложность и улучшить стабильность.

На первом этапе использовались только 3D-скелеты тела и 3D-сферы головы в качестве сигналов управления, исключая представления лица. Это позволило базовой модели видеогенерации, инициализированной из MMDiT, адаптироваться к человеческой анимации без перегрузки тонкими контролями.

На втором этапе были добавлены неявные представления лица, но все остальные параметры заморожены. Только кодировщик движения лица и слои внимания лица обучались на этом этапе, позволяя модели научиться выразительным деталям в изоляции.

На третьем этапе все параметры размораживаются для совместной оптимизации по внешнему виду, позе и динамике лица.

Данные и тесты

Для фазы тестирования модель инициализируется из предварительно обученной точки проверки DiT и обучается в три этапа: 20 000 шагов для каждого из первых двух этапов и 30 000 шагов для третьего.

Для улучшения обобщаемости на различные продолжительности и разрешения, видеоклипы случайным образом отбирались с длиной от 25 до 121 кадра. Эти клипы затем изменялись в размере до 960x640px, сохраняя соотношение сторон.

Обучение выполнялось на восьми (ориентированных на Китай) NVIDIA H20 GPU, каждая с 96GB видеопамяти, с использованием оптимизатора AdamW с (терпимо высокой) скоростью обучения 5e−6.

В момент вывода каждый видеосегмент содержал 73 кадра. Для поддержания согласованности между сегментами, окончательная латентная переменная из одного сегмента повторно использовалась в качестве начальной латентной переменной для следующего, что контекстуализирует задачу как последовательную генерацию изображения в видео.

Классификаторное руководство применялось с весом 2,5 для как ссылочных изображений, так и сигналов движения управления.

Авторы построили набор данных для обучения (никаких источников не указано в статье), состоящий из 500 часов видео из различных областей, в которых представлены (среди прочего) танцы, спорт, фильмы и публичные выступления. Набор данных был разработан для захвата широкого спектра человеческого движения и выражения, с равномерным распределением между полными и полутелесными кадрами.

Для улучшения качества синтеза лица, Nersemble был включен в процесс подготовки данных.

Примеры из набора данных Nersemble, использованного для дополнения данных для DreamActor. Источник: https://www.youtube.com/watch?v=a-OAWqBzldU

Примеры из набора данных Nersemble, использованного для дополнения данных для DreamActor. Источник: https://www.youtube.com/watch?v=a-OAWqBzldU

Для оценки исследователи использовали свой набор данных также в качестве эталонного для оценки обобщаемости на различные сценарии.

Производительность модели измерялась с помощью стандартных метрик из предыдущих работ: Fréchet Inception Distance (FID); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); и Peak Signal-to-Noise Ratio (PSNR) для качества кадра. Fréchet Video Distance (FVD) использовался для оценки временной согласованности и общей верности видео.

Авторы провели эксперименты на задачах анимации тела и портрета, все из которых использовали одно (целевое) ссылочное изображение.

Для анимации тела DreamActor-M1 сравнивался с Animate Anyone; Champ; MimicMotion, и DisPose.

Количественные сравнения с соперничающими фреймворками.

Количественные сравнения с соперничающими фреймворками.

Хотя PDF предоставляет статическое изображение в качестве визуального сравнения, одно из видео с сайта проекта может более четко подчеркнуть различия:

Аудиоконтент. Нажмите, чтобы воспроизвести. Визуальное сравнение между соперничающими фреймворками. Управляющее видео видно вверху слева, и вывод авторов о том, что DreamActor производит лучшие результаты, кажется разумным.

Для тестов портретной анимации модель оценивалась против LivePortrait; X-Portrait; SkyReels-A1; и Act-One.

Количественные сравнения для портретной анимации.

Количественные сравнения для портретной анимации.

Авторы отмечают, что их метод выигрывает в количественных тестах, и утверждают, что он также превосходит качественно.

Аудиоконтент. Нажмите, чтобы воспроизвести. Примеры сравнения портретной анимации.

Спорно, что третий и последний из клипов, показанных в видео выше, демонстрирует менее убедительную синхронизацию губ по сравнению с некоторыми из соперничающих фреймворков, хотя общее качество замечательно высоко.

Вывод

Предвидя необходимость текстур, которые подразумеваются, но не фактически присутствуют в единственном целевом изображении, которое питает эти рекреации, Bytedance решает одну из самых больших проблем, с которыми сталкивается генерация видео на основе диффузии – последовательные, постоянные текстуры. Следующий логический шаг после совершенствования такого подхода будет заключаться в создании ссылочного атласа из первоначально сгенерированного клипа, который можно применить к последующим, различным генерациям, для поддержания внешнего вида без LoRAs.

Хотя такой подход будет по сути внешней ссылкой, это не отличается от текстур-маппинга в традиционных техниках CGI, и качество реализма и правдоподобия намного выше, чем то, которое могут достичь эти старые методы.

Тем не менее, наиболее впечатляющим аспектом DreamActor является объединенная трехчастная система управления, которая мостит традиционную пропасть между синтезом, ориентированным на лицо, и синтезом, ориентированным на тело, в изобретательной форме.

Остается только увидеть, смогут ли некоторые из этих основных принципов быть использованы в более доступных предложениях; поскольку DreamActor, кажется, предназначен для того, чтобы стать еще одним синтезом в качестве услуги, сильно ограниченным ограничениями на использование и непрактичностью экспериментирования в коммерческой архитектуре.

 

* Моя замена гиперссылок для авторов; внутренние цитаты

Как упоминалось ранее, неясно, какой вкус Stable Diffusion был использован в этом проекте.

Опубликовано впервые в пятницу, 4 апреля 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]