Ãngulo de Anderson
Un Nuevo Sistema para Personajes de Video de DifusiÃģn Estable Temporalmente Coherentes

Una nueva iniciativa del Grupo Alibaba ofrece uno de los mejores mÃĐtodos que he visto para generar avatares humanos completos a partir de un modelo de base de DifusiÃģn Estable.
Titulado MIMO (MIMicking con Object Interactions), el sistema utiliza una serie de tecnologÃas y mÃģdulos populares, incluidos modelos humanos basados en CGI y AnimateDiff, para permitir el reemplazo de personajes temporalmente coherentes en videos o para conducir a un personaje con una pose esquelÃĐtica definida por el usuario.
Aquà vemos personajes interpolados a partir de una sola fuente de imagen y conducidos por una mociÃģn predefinida:
[Haga clic en el video a continuaciÃģn para reproducir]
Desde imÃĄgenes de una sola fuente, tres personajes diversos son conducidos por una secuencia de pose 3D (lejos a la izquierda) utilizando el sistema MIMO. Consulte el sitio web del proyecto y el video de YouTube acompaÃąante (incrustado al final de este artÃculo) para mÃĄs ejemplos y una resoluciÃģn superior. Fuente: https://menyifang.github.io/projects/MIMO/index.html
Los personajes generados, que tambiÃĐn pueden ser obtenidos a partir de fotogramas de videos y de diversas otras maneras, se pueden integrar en metrajes del mundo real.
MIMO ofrece un sistema novedoso que genera tres codificaciones discretas, cada una para personaje, escena y occlusiÃģn (es decir, matting, cuando algÚn objeto o persona pasa delante del personaje que se estÃĄ representando). Estas codificaciones se integran en el momento de la inferencia.
[Haga clic en el video a continuaciÃģn para reproducir]
MIMO puede reemplazar a los personajes originales con personajes fotorealistas o estilizados que siguen la mociÃģn del video objetivo. Consulte el sitio web del proyecto y el video de YouTube acompaÃąante (incrustado al final de este artÃculo) para mÃĄs ejemplos y una resoluciÃģn superior.
El sistema se entrena sobre el modelo de DifusiÃģn Estable V1.5, utilizando un conjunto de datos personalizado curado por los investigadores, y compuesto igualmente de videos del mundo real y simulados.
El gran problema de la difusiÃģn de video es la estabilidad temporal, donde el contenido del video parpadea o âevolucionaâ de maneras no deseadas para la representaciÃģn de personajes coherentes.
MIMO, en cambio, utiliza efectivamente una sola imagen como mapa para una guÃa coherente, que puede ser orquestada y restringida por el modelo de CGI de SMPL intersticial.
Dado que la referencia de origen es coherente, y el modelo base sobre el que se entrena el sistema ha sido mejorado con ejemplos de movimiento representativos adecuados, las capacidades del sistema para la salida temporalmente coherente estÃĄn muy por encima del estÃĄndar general para los avatares de difusiÃģn.
[Haga clic en el video a continuaciÃģn para reproducir]
MÃĄs ejemplos de personajes de MIMO conducidos por la pose. Consulte el sitio web del proyecto y el video de YouTube acompaÃąante (incrustado al final de este artÃculo) para mÃĄs ejemplos y una resoluciÃģn superior.
EstÃĄ volviÃĐndose mÃĄs comÚn que las imÃĄgenes individuales se utilicen como fuente para representaciones neuronales efectivas, ya sea por sà solas o de manera multimodal, combinadas con textos de prompts. Por ejemplo, el popular sistema de transferencia facial LivePortrait tambiÃĐn puede generar caras de deepfakes muy plausibles a partir de imÃĄgenes de caras individuales.
Los investigadores creen que los principios utilizados en el sistema MIMO se pueden extender a otros y nuevos tipos de sistemas y marcos generativos.
El nuevo artÃculo se titula MIMO: SÃntesis de video de personajes controlable con modelado descompuesto espacial, y proviene de cuatro investigadores del Instituto de ComputaciÃģn Inteligente del Grupo Alibaba. El trabajo tiene una pÃĄgina del proyecto con videos y un video de YouTube acompaÃąante, que tambiÃĐn se incrusta al final de este artÃculo.
MÃĐtodo
MIMO logra la separaciÃģn automÃĄtica y no supervisada de los tres componentes espaciales mencionados, en una arquitectura de extremo a extremo (es decir, todos los subprocesos estÃĄn integrados en el sistema, y el usuario solo necesita proporcionar el material de entrada).

El esquema conceptual para MIMO. Fuente: https://arxiv.org/pdf/2409.16160
Los objetos en los videos de origen se traducen de 2D a 3D, inicialmente utilizando el estimador de profundidad monocular Depth Anything. El elemento humano en cualquier cuadro se extrae con mÃĐtodos adaptados del proyecto Tune-A-Video.
Estos caracterÃsticas se traducen luego en facetas volumÃĐtricas de video a travÃĐs de la arquitectura Segment Anything 2 de Facebook Research.
La capa de la escena en sà se obtiene eliminando los objetos detectados en las otras dos capas, proporcionando efectivamente una mÃĄscara de rotoscopio automÃĄtica.
Para la mociÃģn, un conjunto de cÃģdigos latentes extraÃdos para el elemento humano se anclan a un modelo de CGI de SMPL humano por defecto, cuyos movimientos proporcionan el contexto para el contenido humano renderizado.
Un mapa de caracterÃsticas 2D para el contenido humano se obtiene mediante un rasterizador diferenciable derivado de una iniciativa de 2020 de NVIDIA. Combinando los datos 3D obtenidos de SMPL con los datos 2D obtenidos por el mÃĐtodo de NVIDIA, los cÃģdigos latentes que representan la âpersona neuralâ tienen una correspondencia sÃģlida con su contexto eventual.
En este punto, es necesario establecer una referencia comÚnmente necesaria en arquitecturas que utilizan SMPL: una pose canÃģnica. Esto es ampliamente similar al âhombre vitruvianoâ de Da Vinci, en el sentido de que representa una plantilla de pose cero que puede aceptar contenido y luego deformarse, trayendo el contenido (efectivamente) mapeado de texturas con ÃĐl.
Estas deformaciones, o âdesviaciones de la normaâ, representan el movimiento humano, mientras que el modelo de SMPL conserva los cÃģdigos latentes que constituyen la identidad humana que se ha extraÃdo, y asà representa al avatar resultante correctamente en tÃĐrminos de pose y textura.

Un ejemplo de una pose canÃģnica en una figura de SMPL. Fuente: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
En cuanto al problema de entrelazamiento (el grado en que los datos entrenados pueden resultar inflexibles cuando se estiran mÃĄs allÃĄ de sus confines y asociaciones entrenadas), los autores afirman*:
âPara desvincular completamente la apariencia de los fotogramas de video con pose, una soluciÃģn ideal es aprender la representaciÃģn humana dinÃĄmica a partir del video monocular y transformarla desde el espacio con pose al espacio canÃģnico.
âConsiderando la eficiencia, empleamos un mÃĐtodo simplificado que transforma directamente la imagen humana con pose en el resultado canÃģnico en la pose estÃĄndar A utilizando un modelo de repose humano preentrenado. La imagen de apariencia canÃģnica sintetizada se alimenta a los codificadores de ID para obtener el cÃģdigo de identidad.
âEste diseÃąo simple permite una desvinculaciÃģn completa de los atributos de identidad y movimiento. Siguiendo [Animate Anyone], los codificadores de ID incluyen un codificador de imagen CLIP y una arquitectura de red de referencia para incrustar las caracterÃsticas globales y locales, [respectivamente].â
Para los aspectos de la escena y la occlusiÃģn, se utiliza un Autoencoder Variacional (VAE) compartido y fijo (en este caso derivado de una publicaciÃģn de 2013) para incrustar los elementos de la escena y la occlusiÃģn en el espacio latente. Las incongruencias se manejan mediante un mÃĐtodo de pintura del proyecto ProPainter de 2023.
Una vez ensamblado y retocado de esta manera, tanto el fondo como cualquier objeto que oculte en el video proporcionarÃĄn una mÃĄscara para el avatar humano en movimiento.
Estos atributos descompuestos se alimentan luego a una arquitectura de backbone U-Net basada en la arquitectura de DifusiÃģn Estable V1.5. El cÃģdigo de escena completo se concatena con el ruido latente nativo del sistema. El componente humano se integra a travÃĐs de capas de autoatenciÃģn y atenciÃģn cruzada, respectivamente.
Luego, el resultado desenoizado se produce a travÃĐs del decodificador VAE.
Datos y Pruebas
Para el entrenamiento, los investigadores crearon un conjunto de datos de video humano titulado HUD-7K, que consistÃa en 5.000 videos de personajes reales y 2.000 animaciones sintÃĐticas creadas por el sistema En3D. Los videos reales no requirieron anotaciÃģn, debido a la naturaleza no semÃĄntica de los procedimientos de extracciÃģn de figuras en la arquitectura de MIMO. Los datos sintÃĐticos estaban completamente anotados.
El modelo se entrenÃģ en ocho GPUs NVIDIA A100 (aunque el artÃculo no especifica si eran modelos de 40GB o 80GB de VRAM), durante 50 iteraciones, utilizando 24 fotogramas de video y un tamaÃąo de lote de cuatro, hasta convergencia.
El mÃģdulo de movimiento para el sistema se entrenÃģ sobre los pesos de AnimateDiff. Durante el proceso de entrenamiento, los pesos del codificador y decodificador VAE, y el codificador de imagen CLIP se congelaron (en contraste con el ajuste fino completo, que tendrÃa un efecto mucho mÃĄs amplio en un modelo de base).
Aunque MIMO no se probÃģ contra sistemas anÃĄlogos, los investigadores lo probaron en secuencias de movimiento de distribuciÃģn difÃcil fuera del conjunto de datos, obtenidas de AMASS y Mixamo. Estos movimientos incluyeron trepar, jugar y bailar.
TambiÃĐn probaron el sistema en videos humanos del mundo real. En ambos casos, el artÃculo informa de âalta robustezâ para estos movimientos 3D no vistos, desde diferentes puntos de vista.
Aunque el artÃculo ofrece mÚltiples resultados de imÃĄgenes estÃĄticas que demuestran la eficacia del sistema, el rendimiento real de MIMO se evalÚa mejor con los resultados de video extensos proporcionados en la pÃĄgina del proyecto y en el video de YouTube incrustado a continuaciÃģn (del que se derivan los videos al comienzo de este artÃculo).
Los autores concluyen:
âLos resultados experimentales [demuestran] que nuestro mÃĐtodo permite no solo un control flexible de personajes, movimiento y escena, sino tambiÃĐn una escalabilidad avanzada a personajes arbitrarios, generalidad a movimientos 3D nuevos y aplicabilidad a escenas interactivas.
âTambiÃĐn [creemos] que nuestra soluciÃģn, que considera la naturaleza 3D inherente y codifica automÃĄticamente el video 2D en componentes espaciales jerÃĄrquicos, podrÃa inspirar investigaciones futuras sobre sÃntesis de video 3D consciente.
âAdemÃĄs, nuestro marco no solo es adecuado para generar videos de personajes, sino que tambiÃĐn se puede adaptar potencialmente a otras tareas de sÃntesis de video controlable.â
ConclusiÃģn
Es refrescante ver un sistema de avatares basado en DifusiÃģn Estable que parece capaz de tal estabilidad temporal â no menos porque los Avatares Gaussianos parecen estar ganando terreno en este sector de investigaciÃģn en particular.
Los avatares estilizados representados en los resultados son efectivos, y aunque el nivel de realismo fotogrÃĄfico que MIMO puede producir no es actualmente igual al que es capaz de lograr el Gaussian Splatting, las ventajas diversas de crear humanos temporalmente coherentes en una Red de DifusiÃģn Latente semÃĄntica (LDM) son considerables.
Â
* Mi conversiÃģn de las citas en lÃnea de los autores a hipervÃnculos, y cuando es necesario, hipervÃnculos explicativos externos.
Publicado por primera vez el miÃĐrcoles 25 de septiembre de 2024












