Ángulo de Anderson

Mejor generación de video con inteligencia artificial mediante el reordenamiento de fotogramas durante el entrenamiento

mm
Añade Unite.AI a tus fuentes preferidas en Google
Adobe Firefly, various prompts and edits.

Un nuevo artículo publicado esta semana en Arxiv aborda un problema que cualquier persona que haya adoptado el Hunyuan Video o Wan 2.1 generadores de video de inteligencia artificial habrá encontrado hasta ahora: aberraciones temporales, donde el proceso generativo tiende a acelerarse abruptamente, confundir, omitir o deteriorar momentos cruciales en un video generado:

Click para reproducir. Algunas de las fallas temporales que se están volviendo familiares para los usuarios de los nuevos sistemas de video generativos, resaltadas en el nuevo artículo. A la derecha, el efecto mejorador del nuevo enfoque de FluxFlow. Fuente: https://haroldchen19.github.io/FluxFlow/

El video anterior presenta extractos de videos de prueba en el sitio del proyecto (cuidado: bastante caótico) para el artículo. Podemos ver varios problemas cada vez más familiares que se remedian con el método de los autores (mostrado a la derecha en el video), que es básicamente una técnica de preprocesamiento de datos aplicable a cualquier arquitectura de video generativo.

En el primer ejemplo, que presenta a “dos niños jugando con una pelota”, generado por CogVideoX, vemos (a la izquierda en el video de compilación anterior y en el ejemplo específico a continuación) que la generación nativa salta rápidamente a través de varios micro-movimientos esenciales, acelerando la actividad de los niños a un “tono de caricatura”. Por el contrario, el mismo conjunto de datos y método producen mejores resultados con la nueva técnica de preprocesamiento, llamada FluxFlow (a la derecha de la imagen en el video inferior):

Click para reproducir.

En el segundo ejemplo (usando NOVA-0.6B) vemos que un movimiento central que involucra a un gato ha sido corrompido o submuestreado significativamente en la fase de entrenamiento, hasta el punto de que el sistema generativo se “paraliza” y no puede hacer que el sujeto se mueva:

Click para reproducir.

Este síndrome, donde el movimiento o sujeto se ” atasca”, es uno de los problemas más frecuentemente informados de HV y Wan, en los diversos grupos de síntesis de imágenes y video.

Algunos de estos problemas están relacionados con problemas de subtítulos de video en el conjunto de datos de origen, que examinamos esta semana; pero los autores del nuevo trabajo se centran en las cualidades temporales de los datos de entrenamiento en lugar de eso, y presentan un argumento convincente de que abordar los desafíos desde esa perspectiva puede producir resultados útiles.

Como se mencionó en el artículo anterior sobre subtítulos de video, ciertos deportes son particularmente difíciles de destilar en momentos clave, lo que significa que los eventos críticos (como un mate) no reciben la atención que necesitan en el momento del entrenamiento:

Click para reproducir.

En el ejemplo anterior, el sistema generativo no sabe cómo pasar a la siguiente etapa del movimiento, y transita ilógicamente de una pose a otra, cambiando la actitud y la geometría del jugador en el proceso.

Estos son grandes movimientos que se perdieron en el entrenamiento, pero también son vulnerables movimientos mucho más pequeños pero cruciales, como el aleteo de las alas de una mariposa:

Click para reproducir.

A diferencia del mate, el aleteo de las alas no es un evento “raro”, sino más bien un evento persistente y monótono. Sin embargo, su consistencia se pierde en el proceso de muestreo, ya que el movimiento es tan rápido que es muy difícil establecerlo temporalmente.

Estos no son problemas particularmente nuevos, pero están recibiendo mayor atención ahora que los poderosos modelos de video generativos están disponibles para entusiastas para instalación local y generación gratuita.

Las comunidades de Reddit y Discord han tratado inicialmente estos problemas como “relacionados con el usuario”. Esta es una suposición comprensible, ya que los sistemas en cuestión son muy nuevos y mínimamente documentados. Por lo tanto, varios expertos han sugerido diversas soluciones (y no siempre efectivas) para algunos de los errores documentados aquí, como alterar los ajustes en varios componentes de los flujos de trabajo de ComfyUI para Hunyuan Video (HV) y Wan 2.1.

En algunos casos, en lugar de producir movimiento rápido, tanto HV como Wan producen movimiento lento. Las sugerencias de Reddit y ChatGPT (que en su mayoría aprovechan Reddit) incluyen cambiar el número de fotogramas en la generación solicitada, o reducir drásticamente la tasa de fotogramas*.

Esto es todo un asunto desesperado; la verdad emergente es que todavía no sabemos la causa exacta o el remedio exacto para estos problemas; claramente, atormentar los ajustes de generación para trabajar alrededor de ellos (particularmente cuando esto degrada la calidad de la salida, por ejemplo, con una tasa de fotogramas demasiado baja) es solo una solución temporal, y es bueno ver que la escena de investigación está abordando estos problemas emergentes tan rápido.

Así que, además de nuestra mirada a cómo los subtítulos afectan el entrenamiento, veamos el nuevo artículo sobre regularización temporal y qué mejoras podría ofrecer a la escena actual de video generativo.

La idea central es bastante simple y sutil, y none peor por eso; sin embargo, el artículo está algo relleno para alcanzar las ocho páginas prescritas, y saltaremos sobre este relleno según sea necesario.

El pez en la generación nativa del marco de VideoCrafter es estático, mientras que la versión alterada por FluxFlow captura los cambios necesarios. Fuente: https://arxiv.org/pdf/2503.15417

El pez en la generación nativa del marco de VideoCrafter es estático, mientras que la versión alterada por FluxFlow captura los cambios necesarios. Fuente: https://arxiv.org/pdf/2503.15417

El nuevo trabajo se titula Regularización temporal hace que su generador de video sea más fuerte, y proviene de ocho investigadores de Everlyn AI, la Universidad de Ciencia y Tecnología de Hong Kong (HKUST), la Universidad de Central Florida (UCF) y la Universidad de Hong Kong (HKU).

(en el momento de escribir, hay algunos problemas con el sitio del proyecto que acompaña al artículo)

FluxFlow

La idea central detrás de FluxFlow, el nuevo esquema de pre-entrenamiento de los autores, es superar los problemas generalizados de parpadeo y inconsistencia temporal reordenando bloques y grupos de bloques en los órdenes de fotogramas temporales mientras se expone el conjunto de datos al proceso de entrenamiento:

La idea central detrás de FluxFlow es mover bloques y grupos de bloques a posiciones no temporales y no esperadas, como una forma de aumento de datos.

La idea central detrás de FluxFlow es mover bloques y grupos de bloques a posiciones no temporales y no esperadas, como una forma de aumento de datos.

El artículo explica:

‘[Los artefactos] provienen de una limitación fundamental: a pesar de aprovechar conjuntos de datos a gran escala, los modelos actuales a menudo se basan en patrones temporales simplificados en los datos de entrenamiento (por ejemplo, direcciones de caminata fijas o transiciones de fotogramas repetitivas) en lugar de aprender dinámicas temporales diversas y plausibles.

‘Este problema se ve exacerbado por la falta de aumento temporal explícito durante el entrenamiento, lo que deja a los modelos propensos a sobreajustarse a correlaciones temporales espurias (por ejemplo, “el fotograma #5 debe seguir al #4”) en lugar de generalizar a través de escenarios de movimiento diversos.’

La mayoría de los modelos de generación de video, explican los autores, todavía se basan demasiado en la síntesis de imágenes, centrándose en la fidelidad espacial mientras ignoran en gran medida el eje temporal. Aunque técnicas como el recorte, el volteo y la variación de color han ayudado a mejorar la calidad de las imágenes estáticas, no son soluciones adecuadas cuando se aplican a videos, donde la ilusión del movimiento depende de transiciones consistentes entre fotogramas.

Los problemas resultantes incluyen texturas que parpadean, cortes entre fotogramas desagradables y patrones de movimiento repetitivos o demasiado simples.

Click para reproducir.

El artículo argumenta que aunque algunos modelos, incluyendo Stable Video Diffusion y LlamaGen , compensan con arquitecturas cada vez más complejas o restricciones ingenieriles, estas vienen a un costo en términos de cálculo y flexibilidad.

Dado que el aumento de datos temporales ya ha demostrado ser útil en tareas de comprensión de video (en marcos como FineCliper, SeFAR y SVFormer) es sorprendente, afirman los autores, que esta táctica se aplique raramente en un contexto generativo.

Comportamiento disruptivo

Los investigadores sostienen que las interrupciones simples y estructuradas en el orden temporal durante el entrenamiento ayudan a los modelos a generalizar mejor a movimientos realistas y diversos:

‘Al entrenar en secuencias desordenadas, el generador aprende a recuperar trayectorias plausibles, regularizando efectivamente la entropía temporal. FLUXFLOW conecta la brecha entre la aumentación temporal discriminativa y generativa, ofreciendo una solución de mejora que se puede conectar y jugar para la generación de video temporalmente plausible, mejorando la calidad general.

‘A diferencia de los métodos existentes que introducen cambios arquitectónicos o dependen del procesamiento posterior, FLUXFLOW opera directamente en el nivel de datos, introduciendo perturbaciones temporales controladas durante el entrenamiento.’

Click para reproducir.

Las perturbaciones a nivel de fotograma, afirman los autores, introducen interrupciones finas dentro de una secuencia. Este tipo de interrupción no es disimilar al aumento de máscara, donde se bloquean aleatoriamente secciones de datos, para evitar que el sistema se sobreajuste en los puntos de datos, y fomentar una mejor generalización.

Pruebas

Aunque la idea central aquí no llega a un artículo de longitud completa, debido a su simplicidad, sin embargo, hay una sección de pruebas que podemos examinar.

Los autores probaron cuatro consultas relacionadas con la mejora de la calidad temporal mientras se mantiene la fidelidad espacial; la capacidad de aprender dinámicas de movimiento / flujo óptico; mantener la calidad temporal en la generación extraterm; y la sensibilidad a los hiperparámetros clave.

Los investigadores aplicaron FluxFlow a tres arquitecturas generativas: basadas en U-Net, en la forma de VideoCrafter2; basadas en DiT, en la forma de CogVideoX-2B; y basadas en AR, en la forma de NOVA-0.6B.

Para una comparación justa, afinaron los modelos base de las arquitecturas con FluxFlow como una fase de entrenamiento adicional, durante un epoch, en el conjunto de datos OpenVidHD-0.4M.

Los modelos se evaluaron contra dos benchmarks populares: UCF-101; y VBench.

Para UCF, se utilizaron las métricas Fréchet Video Distance (FVD) y Inception Score (IS). Para VBench, los investigadores se centraron en la calidad temporal, la calidad de los fotogramas y la calidad general.

Evaluación inicial cuantitativa de FluxFlow-Frame.

Evaluación inicial cuantitativa de FluxFlow-Frame. "+ Original" indica entrenamiento sin FLUXFLOW, mientras que "+ Num × 1" muestra diferentes configuraciones de FluxFlow-Frame. Los mejores resultados están sombreados; los segundos mejores están subrayados para cada modelo.

Comentando sobre estos resultados, los autores afirman:

‘Tanto FLUXFLOW-FRAME como FLUXFLOW-BLOCK mejoran significativamente la calidad temporal, como se evidencia en las métricas de las Tablas 1, 2 (es decir, FVD, Subject, Flicker, Motion y Dynamic) y los resultados cualitativos en [la imagen a continuación].

‘Por ejemplo, el movimiento del coche que se desliza en VC2, el gato que persigue su cola en NOVA y el surfista que monta una ola en CVX se vuelven notablemente más fluidos con FLUXFLOW. Es importante destacar que estas mejoras temporales se logran sin sacrificar la fidelidad espacial, como se evidencia en los detalles nítidos de las salpicaduras de agua, las estelas de humo y las texturas de las olas, junto con las métricas de fidelidad espacial y general.’

A continuación, vemos selecciones de los resultados cualitativos a los que se refieren los autores (por favor, consulte el artículo original para obtener los resultados completos y una mejor resolución):

Selecciones de los resultados cualitativos.

Selecciones de los resultados cualitativos.

El artículo sugiere que aunque tanto las perturbaciones a nivel de fotograma como las perturbaciones a nivel de bloque mejoran la calidad temporal, las perturbaciones a nivel de fotograma tienden a funcionar mejor. Esto se atribuye a su granularidad más fina, que permite ajustes temporales más precisos. Las perturbaciones a nivel de bloque, por otro lado, pueden introducir ruido debido a los patrones espaciales y temporales estrechamente acoplados dentro de los bloques, lo que reduce su eficacia.

Conclusión

Este artículo, junto con la colaboración de subtítulos de Bytedance-Tsinghua publicada esta semana, me ha hecho claro que las aparentes limitaciones en la nueva generación de modelos de video generativos pueden no resultar de errores de los usuarios, pasos en falso institucionales o limitaciones de financiación, sino más bien de un enfoque de investigación que ha priorizado desafíos más urgentes, como la coherencia y la consistencia temporales, sobre estas preocupaciones menores.

Hasta hace poco, los resultados de los sistemas de video generativos gratuitos y descargables estaban tan comprometidos que no surgió un gran esfuerzo de la comunidad de entusiastas para abordar los problemas (no menos porque los problemas eran fundamentales y no se podían solucionar trivialmente).

Ahora que estamos mucho más cerca de la largamente predicha era de salida de video fotorealista generada completamente por inteligencia artificial, está claro que tanto la comunidad de investigación como la comunidad casual están tomando un interés más profundo y productivo en resolver los problemas restantes; con suerte, estos no son obstáculos insuperables.

 

* La tasa de fotogramas nativa de Wan es de solo 16fps, y en respuesta a mis propios problemas, observo que los foros han sugerido reducir la tasa de fotogramas a solo 12fps, y luego utilizar FlowFrames u otros sistemas de reflujo basados en inteligencia artificial para interpolarse las brechas entre un número tan escaso de fotogramas.

Publicado por primera vez el viernes 21 de marzo de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai