Модели и платформы ИИ
Новая система для временно последовательных стабильных диффузионных видеоперсонажей

Новая инициатива от Alibaba Group предлагает один из лучших методов, который я видел, для генерации полноэкранных человеческих аватаров на основе модели Stable Diffusion.
Называется MIMO (MIMicking с Object Interactions), система использует ряд популярных технологий и модулей, включая модели CGI человека и AnimateDiff, чтобы обеспечить временно последовательную замену персонажей в видео или управление персонажем с помощью пользовательской скелетной позы.
Здесь мы видим персонажей, интерполированных из одного источника изображения, и управляемых предварительно определенной движением:
[Нажмите видео ниже, чтобы воспроизвести]
Из одного источника изображения три разнообразных персонажа управляются 3D-позой (в крайнем левом углу) с помощью системы MIMO. Посмотрите проектный сайт и сопровождающее видео на YouTube (встроенное в конце этой статьи) для получения дополнительных примеров и лучшего разрешения. Источник: https://menyifang.github.io/projects/MIMO/index.html
Сгенерированные персонажи, которые также могут быть получены из кадров видео и различными другими способами, могут быть интегрированы в реальные кадры.
MIMO предлагает новую систему, которая генерирует три отдельных кодирования, каждое для персонажа, сцены и осложнения (т. е. матирования, когда какой-либо объект или человек проходит перед персонажем, который изображается). Эти кодирования объединяются во время вывода.
[Нажмите видео ниже, чтобы воспроизвести]
MIMO может заменить оригинальных персонажей фотореалистичными или стилизованными персонажами, которые следуют движению из целевого видео. Посмотрите проектный сайт и сопровождающее видео на YouTube (встроенное в конце этой статьи) для получения дополнительных примеров и лучшего разрешения.
Система обучена на модели Stable Diffusion V1.5, используя пользовательскую базу данных, отобранную исследователями, и состоящую равномерно из реальных и симулированных видео.
Большой недостаток диффузионного видео – это временная стабильность, когда содержание видео либо мигает, либо «эволюционирует» способами, которые не являются желательными для последовательного представления персонажа.
MIMO, вместо этого, эффективно использует одно изображение как карту для последовательного руководства, которое может быть оркестрировано и ограничено промежуточной SMPL моделью CGI.
Поскольку источник справки последовательный, и базовая модель, над которой обучена система, была улучшена с помощью адекватных представительных примеров движения, возможности системы для временно последовательного вывода намного выше общего стандарта для диффузионных аватаров.
[Нажмите видео ниже, чтобы воспроизвести]
Дополнительные примеры персонажей MIMO, управляемых позой. Посмотрите проектный сайт и сопровождающее видео на YouTube (встроенное в конце этой статьи) для получения дополнительных примеров и лучшего разрешения.
Становится все более распространенным использовать одно изображение как источник для эффективных нейронных представлений, либо самостоятельно, либо в многомодальном виде, объединенном с текстовыми подсказками. Например, популярная LivePortrait система переноса лица также может генерировать очень правдоподобные глубокие подделки из одного изображения лица.
Исследователи считают, что принципы, используемые в системе MIMO, могут быть расширены на другие и новые типы генеративных систем и рамок.
Новая статья называется MIMO: Контролируемый синтез видеоперсонажей с пространственно-разделенным моделированием и исходит от четырех исследователей в Институте умных вычислений Alibaba Group. Работа имеет видео-насыщенную проектную страницу и сопровождающее видео на YouTube, которое также встроено в конце этой статьи.
Метод
MIMO достигает автоматического и непосредственного разделения вышеупомянутых трех пространственных компонентов в конечной архитектуре (т. е. все подпроцессы интегрированы в систему, и пользователю нужно только предоставить входные материалы).

Концептуальная схема MIMO. Источник: https://arxiv.org/pdf/2409.16160
Объекты в исходных видео переводятся из 2D в 3D, изначально используя оценщик глубины Depth Anything. Человеческий элемент в любом кадре извлекается методами, адаптированными из проекта Tune-A-Video.
Эти функции затем переводятся в видео-объемные грани через архитектуру Segment Anything 2 от Facebook Research.
Сам слой сцены получается путем удаления обнаруженных объектов в двух других слоях, эффективно предоставляя маску в стиле ротоскопа автоматически.
Для движения набор извлеченных латентных кодов для человеческого элемента закрепляется к базовой модели CGI человека SMPL, чьи движения обеспечивают контекст для отображаемого человеческого контента.
2D-карта функций для человеческого контента получается с помощью дифференцируемого растеризатора, полученного из 2020 инициативы от NVIDIA (NVDA ). Объединив полученные 3D-данные из SMPL с 2D-данными, полученными методом NVIDIA, латентные коды, представляющие «нейронного человека», имеют прочную связь с их будущим контекстом.
В этот момент необходимо установить ссылку, обычно необходимую в архитектурах, использующих SMPL – каноническую позу. Это примерно похоже на «витрувианского человека» Леонардо да Винчи, поскольку представляет собой шаблон нулевой позы, который может принять контент и затем быть деформирован, принося (эффективно) текстурированный контент с ним.
Эти деформации или «отклонения от нормы» представляют человеческое движение, в то время как модель SMPL сохраняет латентные коды, составляющие человеческую идентичность, которая была извлечена, и таким образом правильно представляет полученный аватар в терминах позы и текстуры.

Пример канонической позы в фигуре SMPL. Источник: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
Что касается проблемы переплетения (степени, в которой обученные данные могут оказаться негибкими, когда вы растягиваете их за пределы их обучающих ограничений и ассоциаций), авторы заявляют*:
‘Чтобы полностью разъединить видимость от позированных кадров видео, идеальным решением является обучение динамического человеческого представления из монокулярного видео и преобразование его из позированного пространства в каноническое пространство.
‘Учитывая эффективность, мы используем упрощенный метод, который напрямую преобразует позированное человеческое изображение в канонический результат в стандартной позе А, используя предварительно обученную модель человеческой позы. Синтезированное каноническое изображение вида подается в кодировщики идентификатора, чтобы получить код идентификатора.
‘Этот простой дизайн позволяет полностью разъединить атрибуты идентификатора и движения. Следуя [Animate Anyone], кодировщики идентификатора включают кодировщик изображения CLIP и архитектуру reference-net, чтобы вложить глобальную и локальную функцию, [соответственно].’
Для аспектов сцены и осложнения используется общий и фиксированный автокодировщик (VAE – в данном случае полученный из публикации 2013 года) для вложения элементов сцены и осложнения в латентное пространство. Несоответствия обрабатываются методом закраски из проекта ProPainter 2023 года.
Как только они собраны и доработаны таким образом, и фон, и любые осложняющие объекты в видео будут обеспечивать мат для движущегося человеческого аватара.
Эти разложенные атрибуты затем подают в U-Net на основе архитектуры Stable Diffusion V1.5. Полный код сцены объединяется с родным шумом латентного кода системы. Человеческий компонент интегрируется через само-внимание и слои перекрестного внимания, соответственно.
Затем очищенный результат выводится через декодировщик VAE.
Данные и тесты
Для обучения исследователи создали набор данных видео человека под названием HUD-7K, который состоял из 5 000 реальных видео персонажей и 2 000 синтетических анимаций, созданных системой En3D. Реальные видео не требовали аннотации, из-за не-семантической природы процедур извлечения фигур в архитектуре MIMO. Синтетические данные были полностью аннотированы.
Модель была обучена на восьми GPU NVIDIA A100 (хотя статья не указывает, были ли это модели с 40 ГБ или 80 ГБ видеопамяти), за 50 итераций, используя 24 кадра видео и размер партии четыре, до сходимости.
Модуль движения для системы был обучен на весах AnimateDiff. Во время процесса обучения веса кодировщика/декодировщика VAE и кодировщика изображения CLIP были заморожены (в отличие от полного тонкого настройки, который будет иметь гораздо более широкий эффект на базовую модель).
Хотя MIMO не был протестирован на аналогичных системах, исследователи протестировали его на трудных последовательностях движения вне распределения, полученных из AMASS и Mixamo. Эти движения включали лазание, игру и танцы.
Они также протестировали систему на видео человека в дикой природе. В обоих случаях статья сообщает о «высокой устойчивости» для этих незнакомых 3D-движений с разных точек зрения.
Хотя статья предлагает несколько статических изображений, демонстрирующих эффективность системы, истинная производительность MIMO лучше всего оценить по обширным видео-результатам, предоставленным на проектной странице, и в видео на YouTube, встроенном ниже (из которого видео в начале этой статьи были получены).
Авторы заключают:
‘Экспериментальные результаты [демонстрируют], что наш метод обеспечивает не только гибкий контроль персонажа, движения и сцены, но также продвинутую масштабируемость для произвольных персонажей, общность для новых 3D-движений и применимость для интерактивных сцен.
‘Мы также [считаем], что наше решение, которое учитывает внутреннюю 3D-природу и автоматически кодирует 2D-видео в иерархические пространственные компоненты, может вдохновить будущие исследования в области 3D-осведомленного синтеза видео.
‘Кроме того, наша рамка не только хорошо подходит для генерации видео персонажей, но также может быть потенциально адаптирована для других задач синтеза видео с управлением.’
Вывод
Приятно видеть систему аватаров на основе Stable Diffusion, которая, кажется, способна обеспечить такую временную стабильность – не в последнюю очередь потому, что аватары Gaussian, кажется, занимают высокую позицию в этом конкретном исследовательском секторе.
Стилизованные аватары, представленные в результатах, эффективны, и хотя уровень фотореализма, который может производить MIMO, в настоящее время не равен тому, на что способен Gaussian Splatting, различные преимущества создания временно последовательных людей в семантически-основанной латентной диффузионной сети (LDM) значительны.
* Мое преобразование внутренних цитат авторов в ссылки и, при необходимости, внешние объяснительные ссылки.
Опубликовано в среду, 25 сентября 2024 года.












