Ángulo de Anderson

Hacia la Generación de Vídeo de Deepfake de Cuerpo Completo Perpetuo

mm
Añade Unite.AI a tus fuentes preferidas en Google
An enlargement from a test video wherein the dance movements of a stick figure inform and drive the motion of a single identity. Source - https://liveanimate.github.io/

En un campo donde se requiere paciencia, un nuevo sistema nos acerca un poco más a la simulación humana en vivo sin rondas de renderizado frustrantes.

 

El estado del arte en la simulación humana de longitud completa ha avanzado mucho desde que apareció la posibilidad de deepfakes de cuerpo completo en 2022. Ahora estamos acostumbrados a la formidable y a menudo controvertida capacidad de los sistemas de código abierto como Wan-Animate, y los sistemas de código cerrado como Grok, para convertir una o múltiples imágenes en una actuación de video coherente y a menudo transformadora:

Haga clic para reproducir si es necesario. Ejemplos de reemplazo de persona con WanAnimate-2.2. Consulte la fuente para una mejor resolución.  Fuente 

Además, el antiguo marco de autoencoder de deepfakes faciales en tiempo real DeepFaceLive ha sido superado por marcos más sofisticados como Deep-Live-Cam, que aprovecha una orquestación de LivePortrait iteraciones, así como módulos legados GAN y InsightFace, para crear un sucesor efectivo en tiempo real del proyecto (abandonado) DFLive:

Haga clic para reproducir: Elon Musk con deepfake en una sesión de video en vivo a través de Deep-Live-Cam. Consulte la fuente para una mejor resolución. Fuente 

Sin embargo, mientras que los marcos como Deep-Live-Cam pueden ejecutarse para siempre y falsificar para siempre, y aunque son mejores para generar ángulos faciales difíciles de lo que solían ser, los resultados están limitados en términos de resolución y capacidad: puede obtener una cara/identidad particular, y puede hacer muchas cosas, como expresiones faciales convincentes y sincronización de labios – pero es esencialmente un truco de un solo pony.

BRB…

La mayoría de los sistemas actuales de imitación humana de IA están limitados y/o “especializados”. Una limitación particular y recurrente es que los mejores sistemas de simulación/imitación humana son offline – es decir, son demasiado intensivos en recursos para operar en tiempo real, y en su lugar necesitan irse, calcular la solución y presentar el resultado al usuario más tarde.

Obviamente, dichos sistemas no son adecuados para la transmutación de IA en vivo, como transformar todo un rango de movimiento corporal, como el baile, en una transmisión en vivo.

Un ejemplo de esto en años recientes es el Wan2.2. Animate de código abierto, que fue un éxito en la comunidad de aficionados y revendedores profesionales – pero una vez más, es un escenario de “generar y esperar”:

Haga clic para reproducir. De 2025, ejemplos de las impresionantes capacidades de Wan2.2-Animate – si puede tener un poco de paciencia. Consulte la fuente para una mejor resolución. Fuente 

Así que como están las cosas, puede tenerlo genial, puede tenerlo versátil o puede tenerlo ahora – elija dos.

LiveAnimate

En este punto de estancamiento llega una nueva oferta de China, que efectivamente transforma a Wan2.2 Animate en un marco de animación en vivo que opera, actualmente, a una respetable velocidad de casi 20 fps, con resultados impresionantes en una variedad de escenarios:

Haga clic para reproducir: LiveAnimate transfiere poses de conducción en escenarios de baile en el escenario, baile en plein air y retrato de cuerpo completo, reproduciendo el movimiento de todo el cuerpo, las manos y la cara. Consulte la fuente para una mejor resolución. Fuente 

El nuevo trabajo extiende el sistema original en una versión en vivo capaz de generar cada nuevo segmento a medida que la acción se desarrolla, utilizando solo unos pocos pasos, mientras mantiene poses seleccionadas anteriores para mantener la apariencia del sujeto consistente durante sesiones largas.

En efecto, el sistema mantiene los marcos anteriores como un método de memoria persistente para basarse en ellos a medida que se desarrolla el video, para que la identidad permanezca consistente – no muy diferente a la forma en que los sistemas de CGI antiguos se refieren a mapas de textura.

Aunque un LoRA está involucrado en la etapa de procesamiento, LiveAnimate no es solo otro sistema LoRA – su generación de transmisión, sistema de memoria/almacén de poses, inferencia de tres pasos y optimizaciones de GPU representan mecanismos adicionales, además de las diversas otras tecnologías (algunas sorprendentemente antiguas) en su repertorio.

El nuevo sistema puede hacer frente no solo a escenarios de conducción de cuerpo completo, como los de los ejemplos anteriores, sino también a movimientos de torso, como en escenarios de entrevista:

Haga clic para reproducir. ‘Movimiento sutil de la cabeza y la mano sobre un escenario de oficina estático’.

Para ser justos con respecto a sus limitaciones, el nuevo artículo admite que dos de los marcos rivales probados contra LiveAnimate pudieron preservar la identidad ligeramente mejor en ciertas circunstancias específicas; dicho esto, ninguno de los contendientes es un sistema en línea en lugar de offline, y los autores del nuevo trabajo están claramente empujando los límites en una dirección plausible y optimista.

Además, puede ser digno de mención que la inferencia requiere dos GPU H100 NVIDIA, para un total de 160 GB de VRAM*.

El artículo establece:

‘LiveAnimate mantiene una calidad perceptual y una identidad casi constantes desde los primeros 30 segundos hasta el final [minuto], mientras que los sistemas anteriores se degradan sustancialmente o requieren horas de cálculo offline para el mismo despliegue.

‘Estos resultados establecen un nuevo punto de operación en calidad, latencia y duración para la animación humana interactiva completa.’

El nuevo artículo se titula LiveAnimate: Animación humana en tiempo real de forma estable y a largo plazo, y proviene de nueve autores de la Universidad China de Hong Kong, el Grupo de Negocios de Aplicaciones Qwen de Alibaba y Liblib AI. Un sitio del proyecto, repleto de los videos también presentados en este artículo, está disponible, mientras que el código es ‘próximamente’, y los pesos… quién sabe!

Método

LiveAnimate constituye un proceso de entrenamiento de dos etapas diseñado para hacer que Wan2.2-Animate genere continuamente y con rapidez, seguido de un sistema de memoria que recupera poses útiles anteriores a medida que se produce cada nuevo bloque de video:

Una visión general de la canalización de LiveAnimate, que muestra su proceso de entrenamiento de dos etapas a la izquierda y la generación en vivo a la derecha, donde las poses entrantes se emparejan con poses almacenadas anteriormente y se combinan con los marcos recientes para generar cada nuevo bloque de video en tres pasos. Fuente - https://arxiv.org/pdf/2608.11745

Una visión general de la canalización de LiveAnimate, que muestra su proceso de entrenamiento de dos etapas a la izquierda y la generación en vivo a la derecha, donde las poses entrantes se emparejan con poses almacenadas anteriormente y se combinan con los marcos recientes para generar cada nuevo bloque de video en tres pasos. Fuente 

El Wan2.2-Animate original está diseñado para considerar una secuencia completa en lugar de generar un video que se extiende indefinidamente. Por lo tanto, para adaptarlo, los autores dividieron los videos de entrenamiento en bloques sucesivos, con cada uno generado utilizando bloques anteriores como contexto/verdad fundamental. Esto inicialmente enseña al modelo a continuar a partir de material previo confiable, antes de tener que lidiar con errores acumulados de su propia salida.

Olvidar no

A lo largo de este proceso, la imagen de referencia original se mantiene permanentemente disponible a través de un ‘Sumidero de referencia’, que proporciona un recordatorio fijo de la identidad y la apariencia de la persona. Una vez que se ha completado un bloque, una ‘Actualización de KV limpia’ convierte la información obtenida de él en contexto histórico para bloques posteriores (aunque esto no repara errores existentes).

Esta primera etapa de entrenamiento todavía requiere 50 pasos de desenoising por bloque, lo que hace que la operación en vivo sea impráctica. La segunda etapa, por lo tanto, destila el proceso a tres pasos, mientras expone el modelo a su propia historia generada, ya que la implementación requiere que cada nuevo segmento dependa de la salida imperfecta anterior:

Las dos etapas de entrenamiento† utilizadas para preparar LiveAnimate para la implementación, primero aprendiendo de bloques de video anteriores limpios - luego reduciendo la generación a tres pasos, mientras se entrena en la salida imperfecta del modelo.

Las dos etapas de entrenamiento† utilizadas para preparar LiveAnimate para la implementación, primero aprendiendo de bloques de video anteriores limpios – luego reduciendo la generación a tres pasos, mientras se entrena en la salida imperfecta del modelo.

Entrenar contra estas secuencias generadas por sí mismo presenta otro problema, ya que retener la historia computacional completa de un video sería prohibitivamente costoso. En su lugar, se realiza una carrera de práctica completa, luego se vuelve a visitar, un bloque a la vez, para el entrenamiento. Cada bloque puede recibir una actualización sin mantener toda la secuencia computacionalmente ‘viva’.

Combinado con LoRA adaptación, esto permite que el modelo de 14 mil millones de parámetros se destile en un solo nodo que contiene ocho GPU H100 de 80 GB (teniendo en cuenta que este clúster es para el entrenamiento, no la inferencia en tiempo de ejecución).

No te detengas ahora

Para la generación indefinida, LiveAnimate también debe decidir qué es digno de recordar. Mantener todo haría que los requisitos de procesamiento se salieran de control; pero retener solo los marcos recientes también podría descartar vistas anteriores útiles.

Por lo tanto, Pose-Retrieval Sink Attention (PR-Sink) aborda esto, manteniendo el primer bloque generado como un ‘Sumidero estático’ permanente – una pose anterior relevante, que opera como un ‘Sumidero dinámico’ reemplazable, y una ventana deslizante que contiene el bloque actual y los dos bloques anteriores. La imagen de referencia permanece disponible por separado a través del Sumidero de referencia, mientras que los tamaños de almacenamiento fijos evitan que los costos crezcan a medida que aumenta la duración del video.

Guerras de bloques

Para elegir poses anteriores para esta memoria limitada, ViTPose reduce las posiciones del cuerpo y las manos en tres marcos en una representación compacta. El banco de memoria mantiene cinco poses representativas, y se popula durante los primeros 20 bloques, favoreciendo poses variadas sobre near-duplicados.

During the generation, the incoming pose is compared with these representatives and the closest match retrieved, providing earlier evidence of how the person looked in a similar position. However, the immediately-preceding block is excluded, because it already exists in the rolling window, leaving the Dynamic Sink free to retrieve information from further back.

Finalmente, el tiempo de ejecución en sí se optimiza para la velocidad distribuyendo el procesamiento de atención en dos GPU H100, superponiendo la comunicación con el cálculo, y reutilizando la información en caché siempre que sea posible.

Datos y pruebas

LiveAnimate se entrenó en 40,000 videos de habla de AVSpeech, y 20,000 videos de movimiento humano de TikTok dataset y HumanVid, con entrenamiento e inferencia que admiten resoluciones de 480×480; 384×672; y 672×384 píxeles.

El entrenamiento comenzó a partir del punto de referencia base de Wan2.2-Animate-14B, utilizando LoRA con rango 128, y se llevó a cabo en ocho GPU NVIDIA H100 durante 10,000 pasos en la primera etapa, y 20,000 en la segunda.

El video se generó en bloques de tres marcos latentes (la representación interna comprimida del modelo), que corresponden a 12 marcos RGB, mientras que la inferencia se realizó en las dos H100.

La evaluación comparó LiveAnimate con métodos de animación humana impulsados por pose existentes en secuencias cortas y largas, utilizando imágenes de referencia y poses de conducción en configuraciones coherentes. Las pruebas de largo plazo extendieron la generación a tres minutos para examinar si la calidad y la identidad permanecían estables con el tiempo.

Los marcos probados fueron EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; y Wan2.2-Animate.

Las métricas utilizadas cubrieron la calidad visual, la consistencia de la identidad, la calidad de la distribución y el error de representación temporal. Aesthetic Score (ASE) y no-reference Image-Quality Assessment (IQA) midieron la calidad visual del marco; DINO, similitud (DINO-S), y consistencia de apariencia con la identidad de referencia; Fréchet Inception Distance (FID), calidad de la distribución; y VideoMAE feature distance (V-MAE), cómo bien el video generado preservaba el movimiento con el tiempo:

Resultados de las pruebas relacionados con la calidad y la identidad a lo largo de tres minutos de generación continua, con LiveAnimate que permanece relativamente estable en las cinco métricas a medida que avanza la secuencia. Varios métodos competidores muestran una mayor degradación con el tiempo. Las lecturas más altas son mejores para IQA, ASE y DINO-S, con lecturas más bajas mejores para FID y V-MAE.

Resultados de las pruebas relacionados con la calidad y la identidad a lo largo de tres minutos de generación continua, con LiveAnimate que permanece relativamente estable en las cinco métricas a medida que avanza la secuencia. Varios métodos competidores muestran una mayor degradación con el tiempo. Las lecturas más altas son mejores para IQA, ASE y DINO-S, con lecturas más bajas mejores para FID y V-MAE.

Como se muestra en el gráfico de resultados inicial anterior, LiveAnimate logró el ASE inicial más alto de 2,823 y un IQA de 4,047, en los primeros 30 segundos. Los autores sostienen que esto indica que la destilación de tres pasos conserva la calidad perceptual, a pesar del presupuesto de inferencia reducido.

Más significativamente, LiveAnimate mostró poca degradación durante tres minutos de generación continua, con sus puntajes de calidad visual e identidad que permanecieron casi sin cambios.

Por el contrario, One-to-All se deterioró sustancialmente con el tiempo, con una calidad visual y una consistencia de identidad más bajas y un error de distribución más alto; y el Wan2.2-Animate base también mostró algo de pérdida de consistencia de identidad.

Los autores afirman:

‘Estas tendencias respaldan nuestra afirmación central de que la gestión explícita del contexto a largo plazo es importante para la animación de transmisión.’

La eficiencia de escalado de LiveAnimate también se probó en varias GPU. Como se muestra a continuación, se lograron 12,41 FPS con una H100; 19,63 FPS con dos; y 22,13 FPS con cuatro, con las ganancias cada vez más limitadas por la sobrecarga de comunicación. Se seleccionaron dos H100 como la configuración preferida:

Eficiencia de escalado en una, dos y cuatro GPU H100 a resolución de 480×480, que muestra la latencia, la velocidad de los marcos, la aceleración y la eficiencia. Dos GPU lograron 19,63 FPS, mientras que una escalación adicional a cuatro produjo solo un aumento modesto a 22,13 FPS.

Eficiencia de escalado en una, dos y cuatro GPU H100 a resolución de 480×480, que muestra la latencia, la velocidad de los marcos, la aceleración y la eficiencia. Dos GPU lograron 19,63 FPS, mientras que una escalación adicional a cuatro produjo solo un aumento modesto a 22,13 FPS.

Con 19,63 FPS, cada bloque de 12 marcos se generó en 0,611 segundos. En comparación, aproximadamente 2-5 horas fueron necesarias por los sistemas competidores para generar la misma secuencia de tres minutos.

Las pruebas cualitativas mostraron diferencias similares: en la prueba de cuerpo completo que se muestra a continuación, se observó una degradación severa en One-to-All; se produjo parpadeo en UniAnimate-DiT y SCAIL; y más tarde se produjo un desplazamiento de color o fondo con Wan-Animate y EverAnimate.

Resultados de las pruebas que comparan la animación de cuerpo completo durante tres minutos. Los marcos se muestran cada 20 segundos, con anotaciones rojas que resaltan la degradación a largo plazo en los métodos competidores. Los puntos de referencia requirieron aproximadamente 2-5 horas para generar la secuencia, en comparación con aproximadamente cuatro minutos para LiveAnimate.

Resultados de las pruebas que comparan la animación de cuerpo completo durante tres minutos. Los marcos se muestran cada 20 segundos, con anotaciones rojas que resaltan la degradación a largo plazo en los métodos competidores. Los puntos de referencia requirieron aproximadamente 2-5 horas para generar la secuencia, en comparación con aproximadamente cuatro minutos para LiveAnimate. Consulte el papel de la fuente para una mejor resolución.

LiveAnimate mantuvo la apariencia del sujeto y la escena circundante en toda la secuencia de tres minutos. En la prueba de torso superior menos exigente que se muestra a continuación, se logró una estabilidad a largo plazo comparable por EverAnimate y LiveAnimate (aunque solo LiveAnimate proporcionó generación en tiempo real):

Resultados de las pruebas que comparan la animación de torso superior durante tres minutos. Los marcos se muestran cada 20 segundos y muestran que LiveAnimate mantiene la identidad, la ropa y el fondo oscuro del sujeto de manera más consistente que los métodos competidores.

Resultados de las pruebas que comparan la animación de torso superior durante tres minutos. Los marcos se muestran cada 20 segundos y muestran que LiveAnimate mantiene la identidad, la ropa y el fondo oscuro del sujeto de manera más consistente que los métodos competidores.

Los autores concluyen:

‘En la referencia de tres minutos, LiveAnimate mantiene una calidad perceptual y una identidad casi constantes a 19,63 FPS en dos GPU H100, con memoria y latencia independientes de la duración de la secuencia, mientras que los puntos de referencia offline se degradan visiblemente o requieren horas de cálculo.

‘Estos resultados llevan a los modelos de difusión de video a escala de miles de millones dentro del alcance de aplicaciones interactivas como la transmisión en vivo, la telepresencia y los avatares virtuales.’

Conclusión

Es alentador ver un marco de generación impulsado que tome un enfoque novedoso para los problemas persistentes de memoria y identidad que afectan a los videos generativos. Ya hay muchos marcos generativos que pueden hacer referencia a imágenes fijas proporcionadas por el usuario, sin la necesidad de ‘pegar’ la imagen de referencia en el contenido de imagen a video esencial.

Sin embargo, esto solo resuelve algunos de los problemas de generar un solo clip de video, como mantener la identidad (incluyendo ropa y peinado) de una persona que vuelve a entrar en el cuadro, o que se ha vuelto momentáneamente oscurecida, y luego se ve nuevamente. Hasta la fecha, solo el enfoque LoRA pesado y temporal ha hecho algún progreso con estos problemas, aunque limitado y provisional.

Para el video, y de hecho, para toda la revolución de IA actual, el desarrollo de memoria persistente efectiva es una cuestión crítica y existencial – una que probablemente definirá la diferencia entre el advenimiento de la IA general o un tercer invierno de IA.

 

* ¿Es esto un ‘gotcha’ más? El pensamiento actual es que los modelos especializados más pequeños pueden ejecutarse localmente, sin alquiler, mientras que las necesidades de alto nivel se atienden con un mercado de alquiler de GPU competitivo y, con suerte, fragmentado. Esto supone que las empresas fronterizas no EEE a la competencia, y que sigue habiendo cálculo de GPU sustancial disponible independientemente. En esa base, ya no considero que los requisitos de GPU excesivos sean un demérito, sino que espero que el acceso se vuelva cada vez más democrático y que las optimizaciones posteriores reduzcan las demandas iniciales de recursos.

Generado y verificado por mí.

†† Para pruebas de video largo, SCAIL y UniAnimate-DiT se extendieron con el mismo procedimiento de ventana deslizante sin entrenamiento porque ninguno de los dos admite generación de largo plazo de forma nativa. EverAnimate y One-to-All se evaluaron utilizando sus propios métodos de generación de video largo.

 

Publicado por primera vez el jueves 13 de agosto de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai