Ãngulo de Anderson
El video de IA perfecciona el selfie del gato

Los generadores de video de IA a menudo dan resultados que estÃĄn cerca, pero no exactamente lo que se busca, en tÃĐrminos de entregar lo que se solicitÃģ en el texto. Pero una nueva soluciÃģn de alto nivel hace toda la diferencia.
Â
Los sistemas generativos de video a menudo tienen dificultades para crear videos que sean realmente creativos o salvajes, y a menudo no cumplen con las expectativas de los usuarios en cuanto a los textos que se les proporcionan.
Parte de la razÃģn de esto es entanglement â el hecho de que los modelos de visiÃģn/lenguaje tienen que comprometerse en cuanto a la duraciÃģn de su entrenamiento con los datos de origen. Un entrenamiento demasiado corto, y los conceptos son flexibles, pero no completamente formados â un entrenamiento demasiado largo, y los conceptos son precisos, pero ya no son lo suficientemente flexibles como para incorporar combinaciones novedosas.
Puedes obtener una idea de esto en el video incorporado a continuaciÃģn. A la izquierda, se muestra el tipo de compromiso que muchos sistemas de IA entregan en respuesta a una solicitud exigente (la solicitud estÃĄ en la parte superior del video en todos los ejemplos) que pide una yuxtaposiciÃģn de elementos que es demasiado fantÃĄstica como para haber sido un ejemplo real de entrenamiento. A la derecha, se muestra una salida de IA que se ajusta mejor a la solicitud:
Haz clic para reproducir (sin audio). A la derecha, vemos âfactorizedâ WAN 2.2 realmente entregando lo que se solicitÃģ en las solicitudes, en comparaciÃģn con las interpretaciones vagas de âvanillaâ Wan 2.2., a la izquierda. Por favor, refiÃĐrete a los archivos de video de origen para una mejor resoluciÃģn y muchos mÃĄs ejemplos, aunque las versiones curadas que se muestran aquà no existen en el sitio del proyecto y se ensamblaron para este artÃculo. Origen
Bueno, aunque tenemos que perdonar las manos humanas del pato que aplaude (!), estÃĄ claro que los ejemplos de la derecha se ajustan mucho mejor a la solicitud original que los de la izquierda.
Resulta interesante que ambas arquitecturas presentadas sean esencialmente la misma arquitectura â la popular y muy capaz Wan 2.2, una versiÃģn china que ha ganado terreno significativo en las comunidades de cÃģdigo abierto y aficionados este aÃąo.
La diferencia es que la segunda tuberÃa generativa estÃĄ factorizada, lo que en este caso significa que se ha utilizado un gran modelo de lenguaje (LLM) para reinterpretar el primer (semilla) cuadro del video, para que sea mucho mÃĄs fÃĄcil para el sistema entregar lo que el usuario estÃĄ pidiendo.
Este âanclaje visualâ implica inyectar una imagen elaborada a partir de esta LLM-mejorada en la tuberÃa generativa como un âcuadro de inicioâ, y utilizar un LoRA modelo interpretativo para ayudar a integrar el âcuadro intrusoâ en el proceso de creaciÃģn de video.
Los resultados, en tÃĐrminos de fidelidad de la solicitud, son bastante notables, particularmente para una soluciÃģn que parece bastante elegante:
Haz clic para reproducir (sin audio). MÃĄs ejemplos de generaciones de video âfactorizadasâ que realmente se ajustan al guiÃģn. Por favor, refiÃĐrete a los archivos de video de origen para una mejor resoluciÃģn y muchos mÃĄs ejemplos, aunque las versiones curadas que se muestran aquà no existen en el sitio del proyecto y se ensamblaron para este artÃculo.
Esta soluciÃģn viene en la forma de un nuevo documento GeneraciÃģn de video factorizada: desacoplamiento de la construcciÃģn de escena y sÃntesis temporal en modelos de difusiÃģn de texto a video, y su sitio web del proyecto acompaÃąante video-laden.
Mientras que muchos sistemas actuales intentan mejorar la precisiÃģn de la solicitud utilizando modelos de lenguaje para reescribir textos vagos o subespecificados, el nuevo trabajo argumenta que esta estrategia todavÃa conduce al fracaso cuando la representaciÃģn interna de la escena del modelo es defectuosa.
Incluso con una solicitud reescrita detallada, los modelos de texto a video a menudo malcomponen elementos clave o generan estados iniciales incompatibles que rompen la lÃģgica de la animaciÃģn. Mientras que el primer cuadro no refleje lo que describe la solicitud, el video resultante no puede recuperarse, independientemente de lo bueno que sea el modelo de movimiento.
El documento establece*:
â[Los modelos de texto a video] a menudo producen cuadros desplazados en la distribuciÃģn y aÚn asà logran [puntuaciones de evaluaciÃģn] comparables a los modelos de imagen a video, lo que indica que su modelado de movimiento sigue siendo razonablemente natural incluso cuando la fidelidad de la escena es relativamente pobre.
â[Los modelos de imagen a video] exhiben el comportamiento complementario, con puntuaciones de evaluaciÃģn fuertes de escenas iniciales precisas y una coherencia temporal mÃĄs dÃĐbil, mientras que I2V+texto equilibra ambos aspectos.
âEsta diferencia sugiere una discordancia estructural en los modelos de texto a video actuales: la anclaje de la escena y la sÃntesis temporal se benefician de sesgos inductivos distintos, sin embargo, las arquitecturas existentes intentan aprender ambos simultÃĄneamente dentro de un solo modelo.â
Una comparaciÃģn diagnÃģstica de los modos de generaciÃģn encontrÃģ que los modelos sin anclaje de escena explÃcito obtuvieron buenos resultados en el movimiento, pero a menudo comprometieron el diseÃąo de la escena, mientras que los enfoques condicionados por imagen mostraron el patrÃģn opuesto:

ComparaciÃģn de modos de generaciÃģn de video en dos conjuntos de datos, que muestra que I2V+texto logra la mejor calidad de cuadro (FID) y coherencia temporal (FVD), destacando el beneficio de separar la construcciÃģn de la escena de la sÃntesis del movimiento. Origen
Estos hallazgos apuntan a un defecto estructural en el que los modelos actuales intentan aprender tanto el diseÃąo de la escena como la animaciÃģn en una sola pasada, aunque las dos tareas requieren diferentes tipos de sesgo inductivo, y se manejan mejor por separado.
QuizÃĄs lo mÃĄs interesante es que esta âtrampaâ puede potencialmente aplicarse a instalaciones locales de modelos como Wan 2.1 y 2.2, y modelos de difusiÃģn de video similares como Hunyuan Video. AnecdÃģticamente, comparando la calidad de la salida de los aficionados con los portales generativos comerciales como Kling y Runway, la mayorÃa de los proveedores de API importantes estÃĄn mejorando las ofertas de cÃģdigo abierto como WAN con LoRAs, y -parece- con trucos del tipo visto en el nuevo documento. Por lo tanto, este enfoque particular podrÃa representar una recuperaciÃģn para el contingente de FOSS.
Las pruebas realizadas para el mÃĐtodo indican que este enfoque simple y modular ofrece un nuevo estado de la tÃĐcnica en la benchmark T2V-CompBench, mejorando significativamente todos los modelos probados. Los autores seÃąalan en la conclusiÃģn que, si bien su sistema mejora radicalmente la fidelidad, no aborda (ni estÃĄ diseÃąado para abordar) la deriva de identidad, actualmente el azote de la investigaciÃģn de IA generativa.
El nuevo documento proviene de cuatro investigadores de la Escuela PolitÃĐcnica Federal de Lausana (EPFL) en Suiza.
MÃĐtodo y datos
La proposiciÃģn central de la nueva tÃĐcnica es que los modelos de difusiÃģn de texto a video (T2V) necesitan ser âancladosâ a cuadros iniciales que realmente se ajusten a la solicitud de texto deseada.
Para asegurarse de que el modelo respete el cuadro inicial, el nuevo mÃĐtodo interrumpe el proceso de difusiÃģn estÃĄndar inyectando un latente limpio desde la imagen de anclaje en el tiempo de paso cero, reemplazando una de las entradas ruidosas habituales. Esta entrada desconocida confunde al modelo al principio, pero con un mÃnimo de ajuste fino de LoRA, aprende a tratar el cuadro inyectado como un ancla visual fija en lugar de parte de la trayectoria de ruido:

MÃĐtodo de dos etapas para anclar la generaciÃģn de video de texto con un ancla visual: a la izquierda, el modelo se ajusta con LoRA ligero para tratar un latente limpio inyectado como una restricciÃģn de escena fija. A la derecha, la solicitud se divide en una descripciÃģn del cuadro inicial, que se utiliza para generar la imagen de ancla que guÃa el video.
En la inferencia, el mÃĐtodo reescribe la solicitud para describir solo el primer cuadro, utilizando un LLM para extraer un estado de escena inicial plausible centrado en el diseÃąo y la apariencia.
Esta solicitud reescrita se pasa a un generador de imÃĄgenes para producir un cuadro de ancla candidato (que puede ser refinado opcionalmente por el usuario). El cuadro seleccionado se codifica en un latente y se inyecta en el proceso de difusiÃģn reemplazando el primer paso de tiempo, lo que permite al modelo generar el resto del video mientras permanece anclado en la escena inicial â un proceso que funciona sin requerir cambios en la arquitectura subyacente.
El proceso se probÃģ creando LoRAs para Wan2.2-14B, Wan2.1-1B y CogVideo1.5-5B. El entrenamiento de LoRA se realizÃģ en un rango de 256, en 5000 clips aleatoriamente muestreados de la colecciÃģn UltraVideo.
El entrenamiento durÃģ 6000 pasos y requiriÃģ 48 horas de GPUâ para Wan-1B y CogVideo-5B, y 96 horas de GPU para Wan-14B. Los autores seÃąalan que Wan-5B admite de forma nativa condicionamiento de texto solo y texto-imagen (que en este caso se estÃĄn imponiendo a los marcos mÃĄs antiguos), y por lo tanto no requiriÃģ ningÚn ajuste fino.
Pruebas
En las pruebas realizadas para el proceso, cada solicitud de texto se refinÃģ inicialmente utilizando Qwen2.5-7B-Instruct, que utilizÃģ el resultado para generar una descripciÃģn detallada del cuadro inicial que contenÃa una descripciÃģn de toda la escena. Esto se pasÃģ a QwenImage, que se encargÃģ de generar el âcuadro mÃĄgicoâ para interponer en el proceso de difusiÃģn.
Las pruebas de referencia utilizadas para evaluar el sistema incluyeron la mencionada T2V-CompBench, para probar la comprensiÃģn composicional al puntuar cÃģmo bien los modelos preservaban los objetos, los atributos y las acciones dentro de una escena coherente; y VBench 2.0, para evaluar la razÃģn mÃĄs amplia y la coherencia a travÃĐs de 18 mÃĐtricas, agrupadas en creatividad, razÃģn comÚn, controlabilidad, fidelidad humana y fÃsica:

En todas las siete categorÃas de evaluaciÃģn de T2V-CompBench, el mÃĐtodo de texto a video factorizado superÃģ tanto las lÃneas base estÃĄndar como las sobremuestreadas para cada modelo probado, con ganancias que alcanzaron hasta el 53,25%. Las variantes con mayor puntuaciÃģn frecuentemente igualaron o superaron la referencia de benchmark PixVerse-V3 propietaria.
En cuanto a esta primera ronda de pruebas, los autores seÃąalan*:
â[A travÃĐs de] todos los modelos, agregar una imagen de ancla mejora consistentemente los rendimientos composicionales. Todos los modelos factorizados mÃĄs pequeÃąos (CogVideo 5B, Wan 5B y Wan 1B) superan al modelo T2V Wan 14B mÃĄs grande.
âNuestro Wan 5B factorizado tambiÃĐn supera la referencia de benchmark comercial PixVerse-V3, que es el mejor modelo informado en la referencia de benchmark. Esto demuestra que el anclaje visual mejora sustancialmente la comprensiÃģn de la escena y la acciÃģn, incluso en modelos de capacidad mÃĄs pequeÃąa.
âDentro de cada familia de modelos, la versiÃģn factorizada supera al modelo original. Notablemente, nuestro LoRA ligero anclado en WAN 14B alcanza un rendimiento comparable a su variante I2V preentrenada (0,661 vs. 0,666), a pesar de no requerir un entrenamiento completo.â
Luego vino la ronda de VBench2.0:

El enfoque de texto a video factorizado mejora consistentemente el rendimiento de VBench 2.0 en composiciÃģn, razÃģn comÚn, controlabilidad y fÃsica, con algunas ganancias que superan el 60% â aunque la fidelidad humana permaneciÃģ por debajo de la referencia de benchmark Veo 3 propietaria.
A travÃĐs de todas las arquitecturas, el enfoque factorizado mejorÃģ las puntuaciones en cada categorÃa de VBench, excepto fidelidad humana, que disminuyÃģ ligeramente incluso con el muestreo de la solicitud. WAN 5B superÃģ al mayor WAN 14B, reforzando los resultados anteriores de T2V-CompBench que el anclaje visual contribuyÃģ mÃĄs que la escala.
Aunque las ganancias en VBench fueron consistentes, fueron mÃĄs pequeÃąas que las vistas en T2V-CompBench, y los autores atribuyen esto al rÃĐgimen de puntuaciÃģn binaria mÃĄs estricto de VBench.
Para las pruebas cualitativas, el documento proporciona imÃĄgenes estÃĄticas, pero nos referimos al lector a los videos compuestos incorporados en este artÃculo, para una idea mÃĄs clara, con la salvedad de que los videos de origen son mÃĄs numerosos y diversos, asà como poseen una mayor resoluciÃģn y detalle. EncuÃĐntralos aquÃ. En cuanto a los resultados cualitativos, el documento seÃąala:
âLos videos anclados exhiben consistentemente una composiciÃģn de escena mÃĄs precisa, una uniÃģn de objeto-atributo mÃĄs fuerte y una progresiÃģn temporal mÃĄs clara.â
El mÃĐtodo factorizado permaneciÃģ estable incluso cuando se redujo el nÚmero de pasos de difusiÃģn de 50 a 15, mostrando casi ninguna pÃĐrdida de rendimiento en T2V-CompBench. Por el contrario, tanto las lÃneas base de texto solo como las sobremuestreadas se degradaron bruscamente bajo las mismas condiciones.
Aunque reducir los pasos podrÃa teÃģricamente triplicar la velocidad, la tuberÃa de generaciÃģn completa solo se volviÃģ 2,1 veces mÃĄs rÃĄpida en la prÃĄctica, debido a los costos fijos de la generaciÃģn de la imagen de ancla. Sin embargo, los resultados indicaron que el anclaje no solo mejorÃģ la calidad de la muestra, sino que tambiÃĐn ayudÃģ a estabilizar el proceso de difusiÃģn, lo que permitiÃģ una generaciÃģn mÃĄs rÃĄpida y eficiente sin pÃĐrdida de precisiÃģn.
El sitio web del proyecto proporciona ejemplos de generaciones sobremuestreadas versus el nuevo mÃĐtodo, de los cuales ofrecemos algunos (resoluciÃģn mÃĄs baja) ejemplos editados aquÃ:
Haz clic para reproducir (sin audio). Fuentes de inicio sobremuestreadas versus el enfoque factorizado de los autores.
Los autores concluyen:
âNuestros resultados sugieren que una mejor anclaje, en lugar de solo una mayor capacidad, puede ser igualmente importante. Los avances recientes en la difusiÃģn de texto a video han dependido en gran medida del aumento del tamaÃąo del modelo y los datos de entrenamiento, sin embargo, incluso los modelos mÃĄs grandes a menudo luchan por inferir una escena inicial coherente a partir de texto solo.
âEsto contrasta con la difusiÃģn de imagen, donde la escalabilidad es relativamente sencilla; en los modelos de video, cada mejora arquitectÃģnica debe operar sobre una dimensiÃģn temporal adicional, lo que hace que la escalabilidad sea sustancialmente mÃĄs intensiva en recursos.
âNuestros hallazgos indican que una mejor anclaje puede complementar la escala abordando un cuello de botella diferente: establecer la escena correcta antes de que comience la sÃntesis del movimiento.
âAl factorizar la generaciÃģn de video en composiciÃģn de escena y modelado temporal, mitigamos varios modos de fallo comunes sin requerir modelos sustancialmente mÃĄs grandes. Consideramos esto como un principio de diseÃąo complementario que puede guiar futuras arquitecturas hacia una sÃntesis de video mÃĄs confiable y estructurada.â
ConclusiÃģn
Aunque los problemas de entanglement son muy reales y pueden requerir soluciones dedicadas (como una mejor curaciÃģn y evaluaciÃģn de distribuciÃģn antes del entrenamiento), ha sido un ojo abierto ver cÃģmo la factorizaciÃģn âdesbloqueaâ varias orquestaciones de conceptos obstinadas y âatascadasâ en representaciones mucho mÃĄs precisas â con solo una capa moderada de acondicionamiento de LoRA y la intervenciÃģn de una imagen de inicio/nota mejorada.
El abismo de recursos entre la inferencia de aficionados locales y las soluciones comerciales puede no ser tan enorme como se supone, dado que casi todos los proveedores estÃĄn buscando racionalizar su considerable gasto de recursos de GPU a los consumidores.
AnecdÃģticamente, un gran nÚmero de los proveedores de video generativo actuales parecen estar utilizando versiones de marca y generalmente âpotenciadasâ de modelos de cÃģdigo abierto chinos. El principal âfosoâ que parecen tener estos sistemas de âhombre del medioâ es que se han tomado el trouble de entrenar LoRAs, o en su lugar â a un mayor costo y una mayor recompensa â han realizado un ajuste fino completo de los pesos del modeloâ â .
Conocimientos de este tipo podrÃan ayudar a cerrar aÚn mÃĄs la brecha, en el contexto de una escena de lanzamiento donde los chinos parecen determinados (no necesariamente por razones altruistas o idealistas) a democratizar la IA generativa, mientras que los intereses comerciales occidentales podrÃan preferir que el aumento del tamaÃąo del modelo y las regulaciones eventualmente encierren los modelos realmente buenos detrÃĄs de las API y mÚltiples capas de filtros de contenido.
Â
* Ãnfasis de los autores, no mÃo.
â El documento no especifica quÃĐ GPU se eligiÃģ, o cuÃĄntas se utilizaron.
â â Aunque la ruta de LoRA es mÃĄs probable, tanto por la facilidad de uso econÃģmica como porque los pesos completos, en lugar de los pesos cuantizados, no siempre estÃĄn disponibles.
Publicado por primera vez el viernes 19 de diciembre de 2025












