Ángulo de Anderson

Un Nuevo Sistema para Personajes de Video de DifusiÃģn Estable Temporalmente Coherentes

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
A capture from the project page of MIMO (https://menyifang.github.io/projects/MIMO/index.html), depicting a motion-driven wolf creature.

Una nueva iniciativa del Grupo Alibaba ofrece uno de los mejores mÃĐtodos que he visto para generar avatares humanos completos a partir de un modelo de base de DifusiÃģn Estable.

Titulado MIMO (MIMicking con Object Interactions), el sistema utiliza una serie de tecnologías y mÃģdulos populares, incluidos modelos humanos basados en CGI y AnimateDiff, para permitir el reemplazo de personajes temporalmente coherentes en videos o para conducir a un personaje con una pose esquelÃĐtica definida por el usuario.

Aquí vemos personajes interpolados a partir de una sola fuente de imagen y conducidos por una mociÃģn predefinida:

[Haga clic en el video a continuaciÃģn para reproducir]

Desde imÃĄgenes de una sola fuente, tres personajes diversos son conducidos por una secuencia de pose 3D (lejos a la izquierda) utilizando el sistema MIMO. Consulte el sitio web del proyecto y el video de YouTube acompaÃąante (incrustado al final de este artículo) para mÃĄs ejemplos y una resoluciÃģn superior. Fuente: https://menyifang.github.io/projects/MIMO/index.html

Los personajes generados, que tambiÃĐn pueden ser obtenidos a partir de fotogramas de videos y de diversas otras maneras, se pueden integrar en metrajes del mundo real.

MIMO ofrece un sistema novedoso que genera tres codificaciones discretas, cada una para personaje, escena y occlusiÃģn (es decir, matting, cuando algÚn objeto o persona pasa delante del personaje que se estÃĄ representando). Estas codificaciones se integran en el momento de la inferencia.

[Haga clic en el video a continuaciÃģn para reproducir]

MIMO puede reemplazar a los personajes originales con personajes fotorealistas o estilizados que siguen la mociÃģn del video objetivo. Consulte el sitio web del proyecto y el video de YouTube acompaÃąante (incrustado al final de este artículo) para mÃĄs ejemplos y una resoluciÃģn superior.

El sistema se entrena sobre el modelo de DifusiÃģn Estable V1.5, utilizando un conjunto de datos personalizado curado por los investigadores, y compuesto igualmente de videos del mundo real y simulados.

El gran problema de la difusiÃģn de video es la estabilidad temporal, donde el contenido del video parpadea o “evoluciona” de maneras no deseadas para la representaciÃģn de personajes coherentes.

MIMO, en cambio, utiliza efectivamente una sola imagen como mapa para una guía coherente, que puede ser orquestada y restringida por el modelo de CGI de SMPL intersticial.

Dado que la referencia de origen es coherente, y el modelo base sobre el que se entrena el sistema ha sido mejorado con ejemplos de movimiento representativos adecuados, las capacidades del sistema para la salida temporalmente coherente estÃĄn muy por encima del estÃĄndar general para los avatares de difusiÃģn.

[Haga clic en el video a continuaciÃģn para reproducir]

MÃĄs ejemplos de personajes de MIMO conducidos por la pose. Consulte el sitio web del proyecto y el video de YouTube acompaÃąante (incrustado al final de este artículo) para mÃĄs ejemplos y una resoluciÃģn superior.

EstÃĄ volviÃĐndose mÃĄs comÚn que las imÃĄgenes individuales se utilicen como fuente para representaciones neuronales efectivas, ya sea por sí solas o de manera multimodal, combinadas con textos de prompts. Por ejemplo, el popular sistema de transferencia facial LivePortrait tambiÃĐn puede generar caras de deepfakes muy plausibles a partir de imÃĄgenes de caras individuales.

Los investigadores creen que los principios utilizados en el sistema MIMO se pueden extender a otros y nuevos tipos de sistemas y marcos generativos.

El nuevo artículo se titula MIMO: Síntesis de video de personajes controlable con modelado descompuesto espacial, y proviene de cuatro investigadores del Instituto de ComputaciÃģn Inteligente del Grupo Alibaba. El trabajo tiene una pÃĄgina del proyecto con videos y un video de YouTube acompaÃąante, que tambiÃĐn se incrusta al final de este artículo.

MÃĐtodo

MIMO logra la separaciÃģn automÃĄtica y no supervisada de los tres componentes espaciales mencionados, en una arquitectura de extremo a extremo (es decir, todos los subprocesos estÃĄn integrados en el sistema, y el usuario solo necesita proporcionar el material de entrada).

El esquema conceptual para MIMO. Fuente: https://arxiv.org/pdf/2409.16160

El esquema conceptual para MIMO. Fuente: https://arxiv.org/pdf/2409.16160

Los objetos en los videos de origen se traducen de 2D a 3D, inicialmente utilizando el estimador de profundidad monocular Depth Anything. El elemento humano en cualquier cuadro se extrae con mÃĐtodos adaptados del proyecto Tune-A-Video.

Estos características se traducen luego en facetas volumÃĐtricas de video a travÃĐs de la arquitectura Segment Anything 2 de Facebook Research.

La capa de la escena en sí se obtiene eliminando los objetos detectados en las otras dos capas, proporcionando efectivamente una mÃĄscara de rotoscopio automÃĄtica.

Para la mociÃģn, un conjunto de cÃģdigos latentes extraídos para el elemento humano se anclan a un modelo de CGI de SMPL humano por defecto, cuyos movimientos proporcionan el contexto para el contenido humano renderizado.

Un mapa de características 2D para el contenido humano se obtiene mediante un rasterizador diferenciable derivado de una iniciativa de 2020 de NVIDIA. Combinando los datos 3D obtenidos de SMPL con los datos 2D obtenidos por el mÃĐtodo de NVIDIA, los cÃģdigos latentes que representan la “persona neural” tienen una correspondencia sÃģlida con su contexto eventual.

En este punto, es necesario establecer una referencia comÚnmente necesaria en arquitecturas que utilizan SMPL: una pose canÃģnica. Esto es ampliamente similar al “hombre vitruviano” de Da Vinci, en el sentido de que representa una plantilla de pose cero que puede aceptar contenido y luego deformarse, trayendo el contenido (efectivamente) mapeado de texturas con ÃĐl.

Estas deformaciones, o “desviaciones de la norma”, representan el movimiento humano, mientras que el modelo de SMPL conserva los cÃģdigos latentes que constituyen la identidad humana que se ha extraído, y así representa al avatar resultante correctamente en tÃĐrminos de pose y textura.

Un ejemplo de una pose canÃģnica en una figura de SMPL. Fuente: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

Un ejemplo de una pose canÃģnica en una figura de SMPL. Fuente: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

En cuanto al problema de entrelazamiento (el grado en que los datos entrenados pueden resultar inflexibles cuando se estiran mÃĄs allÃĄ de sus confines y asociaciones entrenadas), los autores afirman*:

‘Para desvincular completamente la apariencia de los fotogramas de video con pose, una soluciÃģn ideal es aprender la representaciÃģn humana dinÃĄmica a partir del video monocular y transformarla desde el espacio con pose al espacio canÃģnico.

‘Considerando la eficiencia, empleamos un mÃĐtodo simplificado que transforma directamente la imagen humana con pose en el resultado canÃģnico en la pose estÃĄndar A utilizando un modelo de repose humano preentrenado. La imagen de apariencia canÃģnica sintetizada se alimenta a los codificadores de ID para obtener el cÃģdigo de identidad.

‘Este diseÃąo simple permite una desvinculaciÃģn completa de los atributos de identidad y movimiento. Siguiendo [Animate Anyone], los codificadores de ID incluyen un codificador de imagen CLIP y una arquitectura de red de referencia para incrustar las características globales y locales, [respectivamente].’

Para los aspectos de la escena y la occlusiÃģn, se utiliza un Autoencoder Variacional (VAE) compartido y fijo (en este caso derivado de una publicaciÃģn de 2013) para incrustar los elementos de la escena y la occlusiÃģn en el espacio latente. Las incongruencias se manejan mediante un mÃĐtodo de pintura del proyecto ProPainter de 2023.

Una vez ensamblado y retocado de esta manera, tanto el fondo como cualquier objeto que oculte en el video proporcionarÃĄn una mÃĄscara para el avatar humano en movimiento.

Estos atributos descompuestos se alimentan luego a una arquitectura de backbone U-Net basada en la arquitectura de DifusiÃģn Estable V1.5. El cÃģdigo de escena completo se concatena con el ruido latente nativo del sistema. El componente humano se integra a travÃĐs de capas de autoatenciÃģn y atenciÃģn cruzada, respectivamente.

Luego, el resultado desenoizado se produce a travÃĐs del decodificador VAE.

Datos y Pruebas

Para el entrenamiento, los investigadores crearon un conjunto de datos de video humano titulado HUD-7K, que consistía en 5.000 videos de personajes reales y 2.000 animaciones sintÃĐticas creadas por el sistema En3D. Los videos reales no requirieron anotaciÃģn, debido a la naturaleza no semÃĄntica de los procedimientos de extracciÃģn de figuras en la arquitectura de MIMO. Los datos sintÃĐticos estaban completamente anotados.

El modelo se entrenÃģ en ocho GPUs NVIDIA A100 (aunque el artículo no especifica si eran modelos de 40GB o 80GB de VRAM), durante 50 iteraciones, utilizando 24 fotogramas de video y un tamaÃąo de lote de cuatro, hasta convergencia.

El mÃģdulo de movimiento para el sistema se entrenÃģ sobre los pesos de AnimateDiff. Durante el proceso de entrenamiento, los pesos del codificador y decodificador VAE, y el codificador de imagen CLIP se congelaron (en contraste con el ajuste fino completo, que tendría un efecto mucho mÃĄs amplio en un modelo de base).

Aunque MIMO no se probÃģ contra sistemas anÃĄlogos, los investigadores lo probaron en secuencias de movimiento de distribuciÃģn difícil fuera del conjunto de datos, obtenidas de AMASS y Mixamo. Estos movimientos incluyeron trepar, jugar y bailar.

TambiÃĐn probaron el sistema en videos humanos del mundo real. En ambos casos, el artículo informa de “alta robustez” para estos movimientos 3D no vistos, desde diferentes puntos de vista.

Aunque el artículo ofrece mÚltiples resultados de imÃĄgenes estÃĄticas que demuestran la eficacia del sistema, el rendimiento real de MIMO se evalÚa mejor con los resultados de video extensos proporcionados en la pÃĄgina del proyecto y en el video de YouTube incrustado a continuaciÃģn (del que se derivan los videos al comienzo de este artículo).

Los autores concluyen:

‘Los resultados experimentales [demuestran] que nuestro mÃĐtodo permite no solo un control flexible de personajes, movimiento y escena, sino tambiÃĐn una escalabilidad avanzada a personajes arbitrarios, generalidad a movimientos 3D nuevos y aplicabilidad a escenas interactivas.

‘TambiÃĐn [creemos] que nuestra soluciÃģn, que considera la naturaleza 3D inherente y codifica automÃĄticamente el video 2D en componentes espaciales jerÃĄrquicos, podría inspirar investigaciones futuras sobre síntesis de video 3D consciente.

‘AdemÃĄs, nuestro marco no solo es adecuado para generar videos de personajes, sino que tambiÃĐn se puede adaptar potencialmente a otras tareas de síntesis de video controlable.’

ConclusiÃģn

Es refrescante ver un sistema de avatares basado en DifusiÃģn Estable que parece capaz de tal estabilidad temporal – no menos porque los Avatares Gaussianos parecen estar ganando terreno en este sector de investigaciÃģn en particular.

Los avatares estilizados representados en los resultados son efectivos, y aunque el nivel de realismo fotogrÃĄfico que MIMO puede producir no es actualmente igual al que es capaz de lograr el Gaussian Splatting, las ventajas diversas de crear humanos temporalmente coherentes en una Red de DifusiÃģn Latente semÃĄntica (LDM) son considerables.

 

* Mi conversiÃģn de las citas en línea de los autores a hipervínculos, y cuando es necesario, hipervínculos explicativos externos.

Publicado por primera vez el miÃĐrcoles 25 de septiembre de 2024

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]