Ãngulo de Anderson
Mejor generaciÃģn de video con inteligencia artificial mediante el reordenamiento de fotogramas durante el entrenamiento

Un nuevo artÃculo publicado esta semana en Arxiv aborda un problema que cualquier persona que haya adoptado el Hunyuan Video o Wan 2.1 generadores de video de inteligencia artificial habrÃĄ encontrado hasta ahora: aberraciones temporales, donde el proceso generativo tiende a acelerarse abruptamente, confundir, omitir o deteriorar momentos cruciales en un video generado:
Click para reproducir. Algunas de las fallas temporales que se estÃĄn volviendo familiares para los usuarios de los nuevos sistemas de video generativos, resaltadas en el nuevo artÃculo. A la derecha, el efecto mejorador del nuevo enfoque de FluxFlow. Fuente: https://haroldchen19.github.io/FluxFlow/
El video anterior presenta extractos de videos de prueba en el sitio del proyecto (cuidado: bastante caÃģtico) para el artÃculo. Podemos ver varios problemas cada vez mÃĄs familiares que se remedian con el mÃĐtodo de los autores (mostrado a la derecha en el video), que es bÃĄsicamente una tÃĐcnica de preprocesamiento de datos aplicable a cualquier arquitectura de video generativo.
En el primer ejemplo, que presenta a âdos niÃąos jugando con una pelotaâ, generado por CogVideoX, vemos (a la izquierda en el video de compilaciÃģn anterior y en el ejemplo especÃfico a continuaciÃģn) que la generaciÃģn nativa salta rÃĄpidamente a travÃĐs de varios micro-movimientos esenciales, acelerando la actividad de los niÃąos a un âtono de caricaturaâ. Por el contrario, el mismo conjunto de datos y mÃĐtodo producen mejores resultados con la nueva tÃĐcnica de preprocesamiento, llamada FluxFlow (a la derecha de la imagen en el video inferior):
Click para reproducir.
En el segundo ejemplo (usando NOVA-0.6B) vemos que un movimiento central que involucra a un gato ha sido corrompido o submuestreado significativamente en la fase de entrenamiento, hasta el punto de que el sistema generativo se âparalizaâ y no puede hacer que el sujeto se mueva:
Click para reproducir.
Este sÃndrome, donde el movimiento o sujeto se â atascaâ, es uno de los problemas mÃĄs frecuentemente informados de HV y Wan, en los diversos grupos de sÃntesis de imÃĄgenes y video.
Algunos de estos problemas estÃĄn relacionados con problemas de subtÃtulos de video en el conjunto de datos de origen, que examinamos esta semana; pero los autores del nuevo trabajo se centran en las cualidades temporales de los datos de entrenamiento en lugar de eso, y presentan un argumento convincente de que abordar los desafÃos desde esa perspectiva puede producir resultados Útiles.
Como se mencionÃģ en el artÃculo anterior sobre subtÃtulos de video, ciertos deportes son particularmente difÃciles de destilar en momentos clave, lo que significa que los eventos crÃticos (como un mate) no reciben la atenciÃģn que necesitan en el momento del entrenamiento:
Click para reproducir.
En el ejemplo anterior, el sistema generativo no sabe cÃģmo pasar a la siguiente etapa del movimiento, y transita ilÃģgicamente de una pose a otra, cambiando la actitud y la geometrÃa del jugador en el proceso.
Estos son grandes movimientos que se perdieron en el entrenamiento, pero tambiÃĐn son vulnerables movimientos mucho mÃĄs pequeÃąos pero cruciales, como el aleteo de las alas de una mariposa:
Click para reproducir.
A diferencia del mate, el aleteo de las alas no es un evento âraroâ, sino mÃĄs bien un evento persistente y monÃģtono. Sin embargo, su consistencia se pierde en el proceso de muestreo, ya que el movimiento es tan rÃĄpido que es muy difÃcil establecerlo temporalmente.
Estos no son problemas particularmente nuevos, pero estÃĄn recibiendo mayor atenciÃģn ahora que los poderosos modelos de video generativos estÃĄn disponibles para entusiastas para instalaciÃģn local y generaciÃģn gratuita.
Las comunidades de Reddit y Discord han tratado inicialmente estos problemas como ârelacionados con el usuarioâ. Esta es una suposiciÃģn comprensible, ya que los sistemas en cuestiÃģn son muy nuevos y mÃnimamente documentados. Por lo tanto, varios expertos han sugerido diversas soluciones (y no siempre efectivas) para algunos de los errores documentados aquÃ, como alterar los ajustes en varios componentes de los flujos de trabajo de ComfyUI para Hunyuan Video (HV) y Wan 2.1.
En algunos casos, en lugar de producir movimiento rÃĄpido, tanto HV como Wan producen movimiento lento. Las sugerencias de Reddit y ChatGPT (que en su mayorÃa aprovechan Reddit) incluyen cambiar el nÚmero de fotogramas en la generaciÃģn solicitada, o reducir drÃĄsticamente la tasa de fotogramas*.
Esto es todo un asunto desesperado; la verdad emergente es que todavÃa no sabemos la causa exacta o el remedio exacto para estos problemas; claramente, atormentar los ajustes de generaciÃģn para trabajar alrededor de ellos (particularmente cuando esto degrada la calidad de la salida, por ejemplo, con una tasa de fotogramas demasiado baja) es solo una soluciÃģn temporal, y es bueno ver que la escena de investigaciÃģn estÃĄ abordando estos problemas emergentes tan rÃĄpido.
Asà que, ademÃĄs de nuestra mirada a cÃģmo los subtÃtulos afectan el entrenamiento, veamos el nuevo artÃculo sobre regularizaciÃģn temporal y quÃĐ mejoras podrÃa ofrecer a la escena actual de video generativo.
La idea central es bastante simple y sutil, y none peor por eso; sin embargo, el artÃculo estÃĄ algo relleno para alcanzar las ocho pÃĄginas prescritas, y saltaremos sobre este relleno segÚn sea necesario.

El pez en la generaciÃģn nativa del marco de VideoCrafter es estÃĄtico, mientras que la versiÃģn alterada por FluxFlow captura los cambios necesarios. Fuente: https://arxiv.org/pdf/2503.15417
El nuevo trabajo se titula RegularizaciÃģn temporal hace que su generador de video sea mÃĄs fuerte, y proviene de ocho investigadores de Everlyn AI, la Universidad de Ciencia y TecnologÃa de Hong Kong (HKUST), la Universidad de Central Florida (UCF) y la Universidad de Hong Kong (HKU).
(en el momento de escribir, hay algunos problemas con el sitio del proyecto que acompaÃąa al artÃculo)
FluxFlow
La idea central detrÃĄs de FluxFlow, el nuevo esquema de pre-entrenamiento de los autores, es superar los problemas generalizados de parpadeo y inconsistencia temporal reordenando bloques y grupos de bloques en los Ãģrdenes de fotogramas temporales mientras se expone el conjunto de datos al proceso de entrenamiento:

La idea central detrÃĄs de FluxFlow es mover bloques y grupos de bloques a posiciones no temporales y no esperadas, como una forma de aumento de datos.
El artÃculo explica:
â[Los artefactos] provienen de una limitaciÃģn fundamental: a pesar de aprovechar conjuntos de datos a gran escala, los modelos actuales a menudo se basan en patrones temporales simplificados en los datos de entrenamiento (por ejemplo, direcciones de caminata fijas o transiciones de fotogramas repetitivas) en lugar de aprender dinÃĄmicas temporales diversas y plausibles.
âEste problema se ve exacerbado por la falta de aumento temporal explÃcito durante el entrenamiento, lo que deja a los modelos propensos a sobreajustarse a correlaciones temporales espurias (por ejemplo, âel fotograma #5 debe seguir al #4â) en lugar de generalizar a travÃĐs de escenarios de movimiento diversos.â
La mayorÃa de los modelos de generaciÃģn de video, explican los autores, todavÃa se basan demasiado en la sÃntesis de imÃĄgenes, centrÃĄndose en la fidelidad espacial mientras ignoran en gran medida el eje temporal. Aunque tÃĐcnicas como el recorte, el volteo y la variaciÃģn de color han ayudado a mejorar la calidad de las imÃĄgenes estÃĄticas, no son soluciones adecuadas cuando se aplican a videos, donde la ilusiÃģn del movimiento depende de transiciones consistentes entre fotogramas.
Los problemas resultantes incluyen texturas que parpadean, cortes entre fotogramas desagradables y patrones de movimiento repetitivos o demasiado simples.
Click para reproducir.
El artÃculo argumenta que aunque algunos modelos, incluyendo Stable Video Diffusion y LlamaGen , compensan con arquitecturas cada vez mÃĄs complejas o restricciones ingenieriles, estas vienen a un costo en tÃĐrminos de cÃĄlculo y flexibilidad.
Dado que el aumento de datos temporales ya ha demostrado ser Útil en tareas de comprensiÃģn de video (en marcos como FineCliper, SeFAR y SVFormer) es sorprendente, afirman los autores, que esta tÃĄctica se aplique raramente en un contexto generativo.
Comportamiento disruptivo
Los investigadores sostienen que las interrupciones simples y estructuradas en el orden temporal durante el entrenamiento ayudan a los modelos a generalizar mejor a movimientos realistas y diversos:
âAl entrenar en secuencias desordenadas, el generador aprende a recuperar trayectorias plausibles, regularizando efectivamente la entropÃa temporal. FLUXFLOW conecta la brecha entre la aumentaciÃģn temporal discriminativa y generativa, ofreciendo una soluciÃģn de mejora que se puede conectar y jugar para la generaciÃģn de video temporalmente plausible, mejorando la calidad general.
âA diferencia de los mÃĐtodos existentes que introducen cambios arquitectÃģnicos o dependen del procesamiento posterior, FLUXFLOW opera directamente en el nivel de datos, introduciendo perturbaciones temporales controladas durante el entrenamiento.â
Click para reproducir.
Las perturbaciones a nivel de fotograma, afirman los autores, introducen interrupciones finas dentro de una secuencia. Este tipo de interrupciÃģn no es disimilar al aumento de mÃĄscara, donde se bloquean aleatoriamente secciones de datos, para evitar que el sistema se sobreajuste en los puntos de datos, y fomentar una mejor generalizaciÃģn.
Pruebas
Aunque la idea central aquà no llega a un artÃculo de longitud completa, debido a su simplicidad, sin embargo, hay una secciÃģn de pruebas que podemos examinar.
Los autores probaron cuatro consultas relacionadas con la mejora de la calidad temporal mientras se mantiene la fidelidad espacial; la capacidad de aprender dinÃĄmicas de movimiento / flujo Ãģptico; mantener la calidad temporal en la generaciÃģn extraterm; y la sensibilidad a los hiperparÃĄmetros clave.
Los investigadores aplicaron FluxFlow a tres arquitecturas generativas: basadas en U-Net, en la forma de VideoCrafter2; basadas en DiT, en la forma de CogVideoX-2B; y basadas en AR, en la forma de NOVA-0.6B.
Para una comparaciÃģn justa, afinaron los modelos base de las arquitecturas con FluxFlow como una fase de entrenamiento adicional, durante un epoch, en el conjunto de datos OpenVidHD-0.4M.
Los modelos se evaluaron contra dos benchmarks populares: UCF-101; y VBench.
Para UCF, se utilizaron las mÃĐtricas FrÃĐchet Video Distance (FVD) y Inception Score (IS). Para VBench, los investigadores se centraron en la calidad temporal, la calidad de los fotogramas y la calidad general.

EvaluaciÃģn inicial cuantitativa de FluxFlow-Frame. "+ Original" indica entrenamiento sin FLUXFLOW, mientras que "+ Num à 1" muestra diferentes configuraciones de FluxFlow-Frame. Los mejores resultados estÃĄn sombreados; los segundos mejores estÃĄn subrayados para cada modelo.
Comentando sobre estos resultados, los autores afirman:
âTanto FLUXFLOW-FRAME como FLUXFLOW-BLOCK mejoran significativamente la calidad temporal, como se evidencia en las mÃĐtricas de las Tablas 1, 2 (es decir, FVD, Subject, Flicker, Motion y Dynamic) y los resultados cualitativos en [la imagen a continuaciÃģn].
âPor ejemplo, el movimiento del coche que se desliza en VC2, el gato que persigue su cola en NOVA y el surfista que monta una ola en CVX se vuelven notablemente mÃĄs fluidos con FLUXFLOW. Es importante destacar que estas mejoras temporales se logran sin sacrificar la fidelidad espacial, como se evidencia en los detalles nÃtidos de las salpicaduras de agua, las estelas de humo y las texturas de las olas, junto con las mÃĐtricas de fidelidad espacial y general.â
A continuaciÃģn, vemos selecciones de los resultados cualitativos a los que se refieren los autores (por favor, consulte el artÃculo original para obtener los resultados completos y una mejor resoluciÃģn):

Selecciones de los resultados cualitativos.
El artÃculo sugiere que aunque tanto las perturbaciones a nivel de fotograma como las perturbaciones a nivel de bloque mejoran la calidad temporal, las perturbaciones a nivel de fotograma tienden a funcionar mejor. Esto se atribuye a su granularidad mÃĄs fina, que permite ajustes temporales mÃĄs precisos. Las perturbaciones a nivel de bloque, por otro lado, pueden introducir ruido debido a los patrones espaciales y temporales estrechamente acoplados dentro de los bloques, lo que reduce su eficacia.
ConclusiÃģn
Este artÃculo, junto con la colaboraciÃģn de subtÃtulos de Bytedance-Tsinghua publicada esta semana, me ha hecho claro que las aparentes limitaciones en la nueva generaciÃģn de modelos de video generativos pueden no resultar de errores de los usuarios, pasos en falso institucionales o limitaciones de financiaciÃģn, sino mÃĄs bien de un enfoque de investigaciÃģn que ha priorizado desafÃos mÃĄs urgentes, como la coherencia y la consistencia temporales, sobre estas preocupaciones menores.
Hasta hace poco, los resultados de los sistemas de video generativos gratuitos y descargables estaban tan comprometidos que no surgiÃģ un gran esfuerzo de la comunidad de entusiastas para abordar los problemas (no menos porque los problemas eran fundamentales y no se podÃan solucionar trivialmente).
Ahora que estamos mucho mÃĄs cerca de la largamente predicha era de salida de video fotorealista generada completamente por inteligencia artificial, estÃĄ claro que tanto la comunidad de investigaciÃģn como la comunidad casual estÃĄn tomando un interÃĐs mÃĄs profundo y productivo en resolver los problemas restantes; con suerte, estos no son obstÃĄculos insuperables.
Â
* La tasa de fotogramas nativa de Wan es de solo 16fps, y en respuesta a mis propios problemas, observo que los foros han sugerido reducir la tasa de fotogramas a solo 12fps, y luego utilizar FlowFrames u otros sistemas de reflujo basados en inteligencia artificial para interpolarse las brechas entre un nÚmero tan escaso de fotogramas.
Publicado por primera vez el viernes 21 de marzo de 2025












