Ángulo de Anderson
El video de IA perfecciona el selfie del gato

Los generadores de video de IA a menudo dan resultados que están cerca, pero no exactamente lo que se busca, en términos de entregar lo que se solicitó en el texto. Pero una nueva solución de alto nivel hace toda la diferencia.
Los sistemas generativos de video a menudo tienen dificultades para crear videos que sean realmente creativos o salvajes, y a menudo no cumplen con las expectativas de los usuarios en cuanto a los textos que se les proporcionan.
Parte de la razón de esto es entanglement – el hecho de que los modelos de visión/lenguaje tienen que comprometerse en cuanto a la duración de su entrenamiento con los datos de origen. Un entrenamiento demasiado corto, y los conceptos son flexibles, pero no completamente formados – un entrenamiento demasiado largo, y los conceptos son precisos, pero ya no son lo suficientemente flexibles como para incorporar combinaciones novedosas.
Puedes obtener una idea de esto en el video incorporado a continuación. A la izquierda, se muestra el tipo de compromiso que muchos sistemas de IA entregan en respuesta a una solicitud exigente (la solicitud está en la parte superior del video en todos los ejemplos) que pide una yuxtaposición de elementos que es demasiado fantástica como para haber sido un ejemplo real de entrenamiento. A la derecha, se muestra una salida de IA que se ajusta mejor a la solicitud:
Haz clic para reproducir (sin audio). A la derecha, vemos ‘factorized’ WAN 2.2 realmente entregando lo que se solicitó en las solicitudes, en comparación con las interpretaciones vagas de ‘vanilla’ Wan 2.2., a la izquierda. Por favor, refiérete a los archivos de video de origen para una mejor resolución y muchos más ejemplos, aunque las versiones curadas que se muestran aquí no existen en el sitio del proyecto y se ensamblaron para este artículo. Origen
Bueno, aunque tenemos que perdonar las manos humanas del pato que aplaude (!), está claro que los ejemplos de la derecha se ajustan mucho mejor a la solicitud original que los de la izquierda.
Resulta interesante que ambas arquitecturas presentadas sean esencialmente la misma arquitectura – la popular y muy capaz Wan 2.2, una versión china que ha ganado terreno significativo en las comunidades de código abierto y aficionados este año.
La diferencia es que la segunda tubería generativa está factorizada, lo que en este caso significa que se ha utilizado un gran modelo de lenguaje (LLM) para reinterpretar el primer (semilla) cuadro del video, para que sea mucho más fácil para el sistema entregar lo que el usuario está pidiendo.
Este ‘anclaje visual’ implica inyectar una imagen elaborada a partir de esta LLM-mejorada en la tubería generativa como un ‘cuadro de inicio’, y utilizar un LoRA modelo interpretativo para ayudar a integrar el ‘cuadro intruso’ en el proceso de creación de video.
Los resultados, en términos de fidelidad de la solicitud, son bastante notables, particularmente para una solución que parece bastante elegante:
Haz clic para reproducir (sin audio). Más ejemplos de generaciones de video ‘factorizadas’ que realmente se ajustan al guión. Por favor, refiérete a los archivos de video de origen para una mejor resolución y muchos más ejemplos, aunque las versiones curadas que se muestran aquí no existen en el sitio del proyecto y se ensamblaron para este artículo.
Esta solución viene en la forma de un nuevo documento Generación de video factorizada: desacoplamiento de la construcción de escena y síntesis temporal en modelos de difusión de texto a video, y su sitio web del proyecto acompañante video-laden.
Mientras que muchos sistemas actuales intentan mejorar la precisión de la solicitud utilizando modelos de lenguaje para reescribir textos vagos o subespecificados, el nuevo trabajo argumenta que esta estrategia todavía conduce al fracaso cuando la representación interna de la escena del modelo es defectuosa.
Incluso con una solicitud reescrita detallada, los modelos de texto a video a menudo malcomponen elementos clave o generan estados iniciales incompatibles que rompen la lógica de la animación. Mientras que el primer cuadro no refleje lo que describe la solicitud, el video resultante no puede recuperarse, independientemente de lo bueno que sea el modelo de movimiento.
El documento establece*:
‘[Los modelos de texto a video] a menudo producen cuadros desplazados en la distribución y aún así logran [puntuaciones de evaluación] comparables a los modelos de imagen a video, lo que indica que su modelado de movimiento sigue siendo razonablemente natural incluso cuando la fidelidad de la escena es relativamente pobre.
‘[Los modelos de imagen a video] exhiben el comportamiento complementario, con puntuaciones de evaluación fuertes de escenas iniciales precisas y una coherencia temporal más débil, mientras que I2V+texto equilibra ambos aspectos.
‘Esta diferencia sugiere una discordancia estructural en los modelos de texto a video actuales: la anclaje de la escena y la síntesis temporal se benefician de sesgos inductivos distintos, sin embargo, las arquitecturas existentes intentan aprender ambos simultáneamente dentro de un solo modelo.’
Una comparación diagnóstica de los modos de generación encontró que los modelos sin anclaje de escena explícito obtuvieron buenos resultados en el movimiento, pero a menudo comprometieron el diseño de la escena, mientras que los enfoques condicionados por imagen mostraron el patrón opuesto:

Comparación de modos de generación de video en dos conjuntos de datos, que muestra que I2V+texto logra la mejor calidad de cuadro (FID) y coherencia temporal (FVD), destacando el beneficio de separar la construcción de la escena de la síntesis del movimiento. Origen
Estos hallazgos apuntan a un defecto estructural en el que los modelos actuales intentan aprender tanto el diseño de la escena como la animación en una sola pasada, aunque las dos tareas requieren diferentes tipos de sesgo inductivo, y se manejan mejor por separado.
Quizás lo más interesante es que esta ‘trampa’ puede potencialmente aplicarse a instalaciones locales de modelos como Wan 2.1 y 2.2, y modelos de difusión de video similares como Hunyuan Video. Anecdóticamente, comparando la calidad de la salida de los aficionados con los portales generativos comerciales como Kling y Runway, la mayoría de los proveedores de API importantes están mejorando las ofertas de código abierto como WAN con LoRAs, y -parece- con trucos del tipo visto en el nuevo documento. Por lo tanto, este enfoque particular podría representar una recuperación para el contingente de FOSS.
Las pruebas realizadas para el método indican que este enfoque simple y modular ofrece un nuevo estado de la técnica en la benchmark T2V-CompBench, mejorando significativamente todos los modelos probados. Los autores señalan en la conclusión que, si bien su sistema mejora radicalmente la fidelidad, no aborda (ni está diseñado para abordar) la deriva de identidad, actualmente el azote de la investigación de IA generativa.
El nuevo documento proviene de cuatro investigadores de la Escuela Politécnica Federal de Lausana (EPFL) en Suiza.
Método y datos
La proposición central de la nueva técnica es que los modelos de difusión de texto a video (T2V) necesitan ser ‘anclados’ a cuadros iniciales que realmente se ajusten a la solicitud de texto deseada.
Para asegurarse de que el modelo respete el cuadro inicial, el nuevo método interrumpe el proceso de difusión estándar inyectando un latente limpio desde la imagen de anclaje en el tiempo de paso cero, reemplazando una de las entradas ruidosas habituales. Esta entrada desconocida confunde al modelo al principio, pero con un mínimo de ajuste fino de LoRA, aprende a tratar el cuadro inyectado como un ancla visual fija en lugar de parte de la trayectoria de ruido:

Método de dos etapas para anclar la generación de video de texto con un ancla visual: a la izquierda, el modelo se ajusta con LoRA ligero para tratar un latente limpio inyectado como una restricción de escena fija. A la derecha, la solicitud se divide en una descripción del cuadro inicial, que se utiliza para generar la imagen de ancla que guía el video.
En la inferencia, el método reescribe la solicitud para describir solo el primer cuadro, utilizando un LLM para extraer un estado de escena inicial plausible centrado en el diseño y la apariencia.
Esta solicitud reescrita se pasa a un generador de imágenes para producir un cuadro de ancla candidato (que puede ser refinado opcionalmente por el usuario). El cuadro seleccionado se codifica en un latente y se inyecta en el proceso de difusión reemplazando el primer paso de tiempo, lo que permite al modelo generar el resto del video mientras permanece anclado en la escena inicial – un proceso que funciona sin requerir cambios en la arquitectura subyacente.
El proceso se probó creando LoRAs para Wan2.2-14B, Wan2.1-1B y CogVideo1.5-5B. El entrenamiento de LoRA se realizó en un rango de 256, en 5000 clips aleatoriamente muestreados de la colección UltraVideo.
El entrenamiento duró 6000 pasos y requirió 48 horas de GPU† para Wan-1B y CogVideo-5B, y 96 horas de GPU para Wan-14B. Los autores señalan que Wan-5B admite de forma nativa condicionamiento de texto solo y texto-imagen (que en este caso se están imponiendo a los marcos más antiguos), y por lo tanto no requirió ningún ajuste fino.
Pruebas
En las pruebas realizadas para el proceso, cada solicitud de texto se refinó inicialmente utilizando Qwen2.5-7B-Instruct, que utilizó el resultado para generar una descripción detallada del cuadro inicial que contenía una descripción de toda la escena. Esto se pasó a QwenImage, que se encargó de generar el ‘cuadro mágico’ para interponer en el proceso de difusión.
Las pruebas de referencia utilizadas para evaluar el sistema incluyeron la mencionada T2V-CompBench, para probar la comprensión composicional al puntuar cómo bien los modelos preservaban los objetos, los atributos y las acciones dentro de una escena coherente; y VBench 2.0, para evaluar la razón más amplia y la coherencia a través de 18 métricas, agrupadas en creatividad, razón común, controlabilidad, fidelidad humana y física:

En todas las siete categorías de evaluación de T2V-CompBench, el método de texto a video factorizado superó tanto las líneas base estándar como las sobremuestreadas para cada modelo probado, con ganancias que alcanzaron hasta el 53,25%. Las variantes con mayor puntuación frecuentemente igualaron o superaron la referencia de benchmark PixVerse-V3 propietaria.
En cuanto a esta primera ronda de pruebas, los autores señalan*:
‘[A través de] todos los modelos, agregar una imagen de ancla mejora consistentemente los rendimientos composicionales. Todos los modelos factorizados más pequeños (CogVideo 5B, Wan 5B y Wan 1B) superan al modelo T2V Wan 14B más grande.
‘Nuestro Wan 5B factorizado también supera la referencia de benchmark comercial PixVerse-V3, que es el mejor modelo informado en la referencia de benchmark. Esto demuestra que el anclaje visual mejora sustancialmente la comprensión de la escena y la acción, incluso en modelos de capacidad más pequeña.
‘Dentro de cada familia de modelos, la versión factorizada supera al modelo original. Notablemente, nuestro LoRA ligero anclado en WAN 14B alcanza un rendimiento comparable a su variante I2V preentrenada (0,661 vs. 0,666), a pesar de no requerir un entrenamiento completo.’
Luego vino la ronda de VBench2.0:

El enfoque de texto a video factorizado mejora consistentemente el rendimiento de VBench 2.0 en composición, razón común, controlabilidad y física, con algunas ganancias que superan el 60% – aunque la fidelidad humana permaneció por debajo de la referencia de benchmark Veo 3 propietaria.
A través de todas las arquitecturas, el enfoque factorizado mejoró las puntuaciones en cada categoría de VBench, excepto fidelidad humana, que disminuyó ligeramente incluso con el muestreo de la solicitud. WAN 5B superó al mayor WAN 14B, reforzando los resultados anteriores de T2V-CompBench que el anclaje visual contribuyó más que la escala.
Aunque las ganancias en VBench fueron consistentes, fueron más pequeñas que las vistas en T2V-CompBench, y los autores atribuyen esto al régimen de puntuación binaria más estricto de VBench.
Para las pruebas cualitativas, el documento proporciona imágenes estáticas, pero nos referimos al lector a los videos compuestos incorporados en este artículo, para una idea más clara, con la salvedad de que los videos de origen son más numerosos y diversos, así como poseen una mayor resolución y detalle. Encuéntralos aquí. En cuanto a los resultados cualitativos, el documento señala:
‘Los videos anclados exhiben consistentemente una composición de escena más precisa, una unión de objeto-atributo más fuerte y una progresión temporal más clara.’
El método factorizado permaneció estable incluso cuando se redujo el número de pasos de difusión de 50 a 15, mostrando casi ninguna pérdida de rendimiento en T2V-CompBench. Por el contrario, tanto las líneas base de texto solo como las sobremuestreadas se degradaron bruscamente bajo las mismas condiciones.
Aunque reducir los pasos podría teóricamente triplicar la velocidad, la tubería de generación completa solo se volvió 2,1 veces más rápida en la práctica, debido a los costos fijos de la generación de la imagen de ancla. Sin embargo, los resultados indicaron que el anclaje no solo mejoró la calidad de la muestra, sino que también ayudó a estabilizar el proceso de difusión, lo que permitió una generación más rápida y eficiente sin pérdida de precisión.
El sitio web del proyecto proporciona ejemplos de generaciones sobremuestreadas versus el nuevo método, de los cuales ofrecemos algunos (resolución más baja) ejemplos editados aquí:
Haz clic para reproducir (sin audio). Fuentes de inicio sobremuestreadas versus el enfoque factorizado de los autores.
Los autores concluyen:
‘Nuestros resultados sugieren que una mejor anclaje, en lugar de solo una mayor capacidad, puede ser igualmente importante. Los avances recientes en la difusión de texto a video han dependido en gran medida del aumento del tamaño del modelo y los datos de entrenamiento, sin embargo, incluso los modelos más grandes a menudo luchan por inferir una escena inicial coherente a partir de texto solo.
‘Esto contrasta con la difusión de imagen, donde la escalabilidad es relativamente sencilla; en los modelos de video, cada mejora arquitectónica debe operar sobre una dimensión temporal adicional, lo que hace que la escalabilidad sea sustancialmente más intensiva en recursos.
‘Nuestros hallazgos indican que una mejor anclaje puede complementar la escala abordando un cuello de botella diferente: establecer la escena correcta antes de que comience la síntesis del movimiento.
‘Al factorizar la generación de video en composición de escena y modelado temporal, mitigamos varios modos de fallo comunes sin requerir modelos sustancialmente más grandes. Consideramos esto como un principio de diseño complementario que puede guiar futuras arquitecturas hacia una síntesis de video más confiable y estructurada.’
Conclusión
Aunque los problemas de entanglement son muy reales y pueden requerir soluciones dedicadas (como una mejor curación y evaluación de distribución antes del entrenamiento), ha sido un ojo abierto ver cómo la factorización ‘desbloquea’ varias orquestaciones de conceptos obstinadas y ‘atascadas’ en representaciones mucho más precisas – con solo una capa moderada de acondicionamiento de LoRA y la intervención de una imagen de inicio/nota mejorada.
El abismo de recursos entre la inferencia de aficionados locales y las soluciones comerciales puede no ser tan enorme como se supone, dado que casi todos los proveedores están buscando racionalizar su considerable gasto de recursos de GPU a los consumidores.
Anecdóticamente, un gran número de los proveedores de video generativo actuales parecen estar utilizando versiones de marca y generalmente ‘potenciadas’ de modelos de código abierto chinos. El principal ‘foso’ que parecen tener estos sistemas de ‘hombre del medio’ es que se han tomado el trouble de entrenar LoRAs, o en su lugar – a un mayor costo y una mayor recompensa – han realizado un ajuste fino completo de los pesos del modelo††.
Conocimientos de este tipo podrían ayudar a cerrar aún más la brecha, en el contexto de una escena de lanzamiento donde los chinos parecen determinados (no necesariamente por razones altruistas o idealistas) a democratizar la IA generativa, mientras que los intereses comerciales occidentales podrían preferir que el aumento del tamaño del modelo y las regulaciones eventualmente encierren los modelos realmente buenos detrás de las API y múltiples capas de filtros de contenido.
* Énfasis de los autores, no mío.
† El documento no especifica qué GPU se eligió, o cuántas se utilizaron.
†† Aunque la ruta de LoRA es más probable, tanto por la facilidad de uso económica como porque los pesos completos, en lugar de los pesos cuantizados, no siempre están disponibles.
Publicado por primera vez el viernes 19 de diciembre de 2025












