Ángulo de Anderson

Por qué el video de IA a veces se sale hacia atrás

mm
Añade Unite.AI a tus fuentes preferidas en Google
ChatGPT/Firefly image depicting a jet-skier impossibly leaving a wake in front of himself.

Si 2022 fue el año en que la IA generativa capturó la imaginación del público en general, 2025 es el año en que la nueva generación de marcos de video generativos que provienen de China parece estar a punto de hacer lo mismo.

El Hunyuan Video de Tencent ha tenido un impacto significativo en la comunidad de entusiastas de la IA con su lanzamiento de código abierto de un modelo de difusión de video de mundo completo que los usuarios pueden personalizar según sus necesidades.

A continuación, está el reciente Wan 2.1 de Alibaba, una de las soluciones de imagen a video de código abierto más potentes de este período, que ahora admite la personalización a través de Wan LoRAs.

Además de la disponibilidad del reciente modelo de fundación humana SkyReels, en el momento de escribir este artículo, también esperamos el lanzamiento de la suite de creación y edición de video VACE de Alibaba:

Click para reproducir. El lanzamiento pendiente de la suite de edición de IA multifuncional de Alibaba VACE ha emocionado a la comunidad de usuarios. Fuente: https://ali-vilab.github.io/VACE-Page/

Impacto repentino

La escena de investigación de video de IA generativa en sí es igual de explosiva; todavía es la primera mitad de marzo, y las presentaciones del martes en la sección de Visión por Computadora de Arxiv (un centro para los papeles de IA generativa) llegaron a casi 350 entradas, una cifra más asociada con la temporada alta de conferencias.

Los dos años desde el lanzamiento de la Difusión Estable en el verano de 2022 (y el desarrollo posterior de Dreambooth y métodos de personalización de LoRA) han estado caracterizados por la falta de desarrollos importantes adicionales, hasta las últimas semanas, donde los nuevos lanzamientos y innovaciones han procedido a un ritmo tan frenético que es casi imposible mantenerse al tanto de todo, por no hablar de cubrirlo todo.

Los modelos de difusión de video como Hunyuan y Wan 2.1 han resuelto, al fin, y después de años de esfuerzos fallidos de cientos de iniciativas de investigación, el problema de consistencia temporal en relación con la generación de humanos, y en gran medida también a entornos y objetos.

Hay pocas dudas de que los estudios de efectos visuales están aplicando personal y recursos para adaptar los nuevos modelos de video chinos para resolver desafíos inmediatos como el intercambio de caras, a pesar de la falta actual de mecanismos auxiliares de estilo ControlNet para estos sistemas.

Debe ser un alivio que uno de esos obstáculos significativos haya sido superado potencialmente, aunque no a través de los caminos anticipados.

De los problemas que quedan, este no es insignificante:

Click para reproducir. Basado en la solicitud ‘Una pequeña roca rueda cuesta abajo por una ladera rocosa empinada, desplazando suelo y piedras pequeñas’, Wan 2.1, que logró las puntuaciones más altas en el nuevo papel, comete un simple error. Fuente: https://videophy2.github.io/

Hacia la cima hacia atrás

Todos los sistemas de video de texto a video y de imagen a video actualmente disponibles, incluidos los modelos de código cerrado comercial, tienen tendencia a producir errores de física como el que se muestra arriba, donde el video muestra una roca rodando hacia la cima, basado en la solicitud ‘Una pequeña roca rueda cuesta abajo por una ladera rocosa empinada, desplazando suelo y piedras pequeñas‘.

Una teoría sobre por qué sucede esto, recientemente propuesta en una colaboración académica entre Alibaba y los Emiratos Árabes Unidos, es que los modelos se entrenan siempre en imágenes individuales, en cierto sentido, incluso cuando se entrenan en videos (que se escriben en secuencias de un solo cuadro para fines de entrenamiento); y pueden no necesariamente aprender el orden temporal correcto de ‘antes’ y ‘después’ de las imágenes.

Sin embargo, la solución más probable es que los modelos en cuestión hayan utilizado rutinas de aumento de datos que involucran exponer un clip de entrenamiento de origen al modelo tanto hacia adelante y hacia atrás, efectivamente duplicando los datos de entrenamiento.

Ha sido sabido durante mucho tiempo que esto no debe hacerse arbitrariamente, porque algunos movimientos funcionan al revés, pero muchos no. Un estudio de 2019 del Reino Unido de la Universidad de Bristol buscó desarrollar un método que pudiera distinguir equivariantes, invariantes y irreversibles clips de video de datos de origen que coexisten en un conjunto de datos (ver imagen a continuación), con la noción de que los clips de origen no aptos podrían ser filtrados de las rutinas de aumento de datos.

Ejemplos de tres tipos de movimiento, de los cuales solo uno es libremente reversible mientras mantiene una dinámica física plausible. Fuente: https://arxiv.org/abs/1909.09422

Ejemplos de tres tipos de movimiento, de los cuales solo uno es libremente reversible mientras mantiene una dinámica física plausible. Fuente: https://arxiv.org/abs/1909.09422

Los autores de ese trabajo enmarcan el problema con claridad:

‘Encontramos que la realidad de los videos revertidos se traiciona por artefactos de reversión, aspectos de la escena que no serían posibles en un mundo natural. Algunos artefactos son sutiles, mientras que otros son fáciles de detectar, como una acción de ‘lanzamiento’ revertida donde el objeto lanzado surge espontáneamente del suelo.

‘Observamos dos tipos de artefactos de reversión, físicos, que exhiben violaciones de las leyes de la naturaleza, e improbables, que representan un escenario posible pero poco probable. Estos no son exclusivos, y muchas acciones revertidas sufren ambos tipos de artefactos, como cuando se desenrolla un papel.

‘Ejemplos de artefactos físicos incluyen: gravedad invertida (por ejemplo, ‘soltar algo’), impulsos espontáneos en objetos (por ejemplo, ‘girar un bolígrafo’), y cambios de estado irreversibles (por ejemplo, ‘quemar una vela’). Un ejemplo de un artefacto improbable: tomar un plato del armario, secarlo y colocarlo en el estante de secado.

‘Este tipo de reutilización de datos es muy común en el momento del entrenamiento, y puede ser beneficioso, por ejemplo, para asegurarse de que el modelo no aprenda solo una vista de una imagen u objeto que se puede girar o rotar sin perder su coherencia central y lógica.

‘Esto solo funciona para objetos que son verdaderamente simétricos, por supuesto; y aprender física de un video ‘revertido’ solo funciona si la versión revertida tiene tanto sentido como la versión hacia adelante.’

Reversión temporal

No tenemos evidencia de que sistemas como Hunyuan Video y Wan 2.1 permitieran clips ‘revertidos’ arbitrarios para ser expuestos al modelo durante el entrenamiento (ninguno de los grupos de investigadores ha sido específico con respecto a las rutinas de aumento de datos).

Aun así, la única posibilidad razonable alternativa, frente a tantos informes (y mi propia experiencia práctica), parecería ser que los conjuntos de datos de gran escala que alimentan estos modelos pueden contener clips que realmente presentan movimientos que ocurren en reversa.

La roca en el video de ejemplo incorporado arriba se generó utilizando Wan 2.1 y se presenta en un nuevo estudio que examina cómo manejan los modelos de difusión de video la física.

En las pruebas para este proyecto, Wan 2.1 logró una puntuación de solo el 22% en términos de su capacidad para adherirse consistentemente a las leyes físicas.

Sin embargo, esa es la mejor puntuación de cualquier sistema probado para el trabajo, lo que indica que podemos haber encontrado nuestro próximo obstáculo para la IA de video:

Puntuaciones obtenidas por sistemas de código abierto y cerrado líderes, con la salida de los marcos evaluados por annotadores humanos. Fuente: https://arxiv.org/pdf/2503.06800

Puntuaciones obtenidas por sistemas de código abierto y cerrado líderes, con la salida de los marcos evaluados por annotadores humanos. Fuente: https://arxiv.org/pdf/2503.06800

Los autores del nuevo trabajo han desarrollado un sistema de benchmarking, ahora en su segunda iteración, llamado VideoPhy, con el código disponible en GitHub.

Aunque el alcance del trabajo está más allá de lo que podemos cubrir aquí de manera integral, veamos su metodología y su potencial para establecer una métrica que podría ayudar a guiar el curso de las futuras sesiones de entrenamiento de modelos lejos de estos extraños casos de reversión.

El estudio, realizado por seis investigadores de la UCLA y Google Research, se llama VideoPhy-2: Una evaluación desafiante de sentido común físico centrada en la acción en la generación de video. Un sitio web del proyecto concurrido también está disponible, junto con el código y los conjuntos de datos en GitHub, y un visor de conjuntos de datos en Hugging Face.

Click para reproducir. Aquí, el modelo Sora de OpenAI no entiende las interacciones entre los remos y las reflexiones, y no puede proporcionar un flujo físico lógico para la persona en el bote o la forma en que el bote interactúa con ella.

Método

Los autores describen la última versión de su trabajo, VideoPhy-2, como una ‘evaluación desafiante de sentido común para acciones del mundo real’. La colección presenta 197 acciones en una variedad de actividades físicas diversas como hula-hula, gimnasia y tenis, así como interacciones de objetos, como doblar un objeto hasta que se rompa.

Un modelo de lenguaje grande (LLM) se utiliza para generar 3840 solicitudes desde estas acciones de semilla, y las solicitudes se utilizan para sintetizar videos a través de los varios marcos que se prueban.

En todo el proceso, los autores han desarrollado una lista de ‘candidatos’ de reglas y leyes físicas que los videos generados por IA deben satisfacer, utilizando modelos de visión-lenguaje para la evaluación.

Los autores declaran:

‘Por ejemplo, en un video de un deportista jugando tenis, una regla física sería que la pelota de tenis debe seguir una trayectoria parabólica bajo la gravedad. Para juicios de oro, pedimos a los annotadores humanos que califiquen cada video según la adherencia semántica general y el sentido común físico, y que marquen su cumplimiento con varias reglas físicas.’

Arriba: Una solicitud de texto se genera a partir de una acción utilizando un LLM y se utiliza para crear un video con un generador de video de texto a video. Un modelo de visión-lenguaje subtitula el video, identificando reglas físicas posibles en juego. Abajo: Los annotadores humanos evalúan la realismo del video, confirman violaciones de reglas, agregan reglas faltantes y verifican si el video coincide con la solicitud original.

Arriba: Una solicitud de texto se genera a partir de una acción utilizando un LLM y se utiliza para crear un video con un generador de video de texto a video. Un modelo de visión-lenguaje subtitula el video, identificando reglas físicas posibles en juego. Abajo: Los annotadores humanos evalúan la realismo del video, confirman violaciones de reglas, agregan reglas faltantes y verifican si el video coincide con la solicitud original.

Inicialmente, los investigadores curaron un conjunto de acciones para evaluar el sentido común físico en los videos generados por IA. Comenzaron con más de 600 acciones obtenidas de los conjuntos de datos Kinetics, UCF-101 y SSv2, centrándose en actividades que involucran deportes, interacciones de objetos y física del mundo real.

Dos grupos independientes de annotadores de estudiantes de ciencias con una calificación mínima de pregrado revisaron y filtraron la lista, seleccionando acciones que probaron principios como gravedad, momento y elasticidad, mientras eliminaban tareas de baja movilidad como teclear, acariciar a un gato o masticar.

Después de una mayor refinación con Gemini-2.0-Flash-Exp para eliminar duplicados, el conjunto de datos final incluyó 197 acciones, con 54 que involucran interacciones de objetos y 143 centradas en actividades físicas y deportivas:

Muestras de las acciones destiladas.

Muestras de las acciones destiladas.

En la segunda etapa, los investigadores utilizaron Gemini-2.0-Flash-Exp para generar 20 solicitudes para cada acción en el conjunto de datos, lo que resultó en un total de 3,940 solicitudes. El proceso de generación se centró en interacciones físicas visibles que podrían representarse claramente en un video generado. Esto excluyó elementos no visuales como emociones, detalles sensoriales y lenguaje abstracto, pero incorporó personajes y objetos diversos.

Por ejemplo, en lugar de una solicitud simple como ‘Un arquero libera la flecha’, el modelo fue guiado para producir una versión más detallada como ‘Un arquero dibuja la cuerda del arco hacia atrás hasta la tensión completa, luego libera la flecha, que vuela recta y golpea un blanco en un objetivo de papel’.

Como los modelos de video modernos pueden interpretar descripciones más largas, los investigadores refinaron aún más las leyendas utilizando el amplificador de solicitud de Mistral-NeMo-12B-Instruct, para agregar detalles visuales sin alterar el significado original.

Solicitudes de ejemplo de VideoPhy-2, categorizadas por actividades físicas o interacciones de objetos. Cada solicitud se empareja con su acción correspondiente y el principio físico relevante que prueba.

Solicitudes de ejemplo de VideoPhy-2, categorizadas por actividades físicas o interacciones de objetos. Cada solicitud se empareja con su acción correspondiente y el principio físico relevante que prueba.

Para la tercera etapa, las reglas físicas no se derivaron de las solicitudes de texto, sino de los videos generados, ya que los modelos generativos pueden luchar por adherirse a las solicitudes de texto condicionadas.

Los videos se crearon primero utilizando las solicitudes de VideoPhy-2, luego se ‘subtitularon’ con Gemini-2.0-Flash-Exp para extraer detalles clave. El modelo propuso tres reglas físicas esperadas por video, que los annotadores humanos revisaron y expandieron al identificar violaciones potenciales adicionales.

Ejemplos de las leyendas ampliadas.

Ejemplos de las leyendas ampliadas.

A continuación, para identificar las acciones más desafiantes, los investigadores generaron videos utilizando CogVideoX-5B con las solicitudes del conjunto de datos de VideoPhy-2. Luego seleccionaron 60 acciones de 197 donde el modelo falló consistentemente en seguir tanto las solicitudes como el sentido común físico básico.

Estas acciones involucraron interacciones físicas ricas como la transferencia de momento en el lanzamiento de disco, cambios de estado como doblar un objeto hasta que se rompa, tareas de equilibrio como caminar sobre una cuerda floja, y movimientos complejos que incluyeron saltos hacia atrás, salto con pértiga y lanzamiento de pizza, entre otros. En total, se eligieron 1,200 solicitudes para aumentar la dificultad del subconjunto.

El conjunto de datos resultante comprendió 3,940 leyendas, 5.72 veces más que la versión anterior de VideoPhy. La longitud promedio de las leyendas originales es de 16 tokens, mientras que las leyendas ampliadas alcanzan 138 tokens, 1.88 veces y 16.2 veces más largas, respectivamente.

El conjunto de datos también cuenta con 102,000 anotaciones humanas que cubren la adherencia semántica, el sentido común físico y las violaciones de reglas en varios modelos de generación de video.

Evaluación

Los investigadores definieron entonces criterios claros para evaluar los videos. El objetivo principal era evaluar cómo bien cada video coincidía con su solicitud de entrada y seguía principios físicos básicos.

En lugar de simplemente clasificar los videos por preferencia, utilizaron retroalimentación basada en calificaciones para capturar éxitos y fracasos específicos. Los annotadores humanos calificaron los videos en una escala de cinco puntos, lo que permitió juicios más detallados, mientras que la evaluación también verificó si los videos seguían varias reglas y leyes físicas.

Para la evaluación humana, se seleccionó un grupo de 12 annotadores de pruebas en Amazon Mechanical Turk (AMT) y se les proporcionaron calificaciones después de recibir instrucciones detalladas a distancia. Para la equidad, adherencia semántica y sense común físico se evaluaron por separado (en el estudio original de VideoPhy, se evaluaron conjuntamente).

Los annotadores calificaron primero cómo bien los videos coincidían con sus solicitudes de entrada, luego evaluaron por separado la plausibilidad física, calificando las violaciones de reglas y la realismo general en una escala de cinco puntos. Solo se mostraron las solicitudes originales para mantener una comparación justa en todos los modelos.

La interfaz presentada a los annotadores de AMT.

La interfaz presentada a los annotadores de AMT.

Aunque el juicio humano sigue siendo el estándar de oro, es costoso y viene con una serie de limitaciones. Por lo tanto, la evaluación automatizada es esencial para evaluaciones de modelo más rápidas y escalables.

Los autores del papel probaron varios modelos de video-lenguaje, incluyendo Gemini-2.0-Flash-Exp y VideoScore, en su capacidad para calificar videos para la precisión semántica y el ‘sentido común físico’.

Los modelos calificaron cada video en una escala de cinco puntos, mientras que una tarea de clasificación separada determinó si se seguían las reglas físicas, se violaban o estaban poco claras.

Los experimentos mostraron que los modelos de video-lenguaje existentes lucharon por coincidir con los juicios humanos, principalmente debido a la débil razonamiento físico y la complejidad de las solicitudes. Para mejorar la evaluación automatizada, los investigadores desarrollaron VideoPhy-2-Autoeval, un modelo de 7B-parámetros diseñado para proporcionar predicciones más precisas en tres categorías: adherencia semántica; sense común físico; y cumplimiento de reglas, afinado en el modelo VideoCon-Physics utilizando 50,000 anotaciones humanas*.

Datos y pruebas

Con estas herramientas en su lugar, los autores probaron varios sistemas de video generativo, tanto a través de instalaciones locales como, cuando fue necesario, a través de API comerciales: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; y Luma Ray.

Los modelos se solicitaron con leyendas ampliadas cuando fue posible, excepto que Hunyuan Video y VideoCrafter2 operan bajo limitaciones de 77 tokens CLIP y no pueden aceptar solicitudes por encima de una cierta longitud.

Los videos generados se mantuvieron en menos de 6 segundos, ya que la salida más corta es más fácil de evaluar.

Los datos de conducción provenían del conjunto de datos de VideoPhy-2, que se dividió en un conjunto de benchmark y un conjunto de entrenamiento. Se generaron 590 videos por modelo, excepto para Sora y Ray2; debido al factor de costo (se generaron números equivalentes más bajos de videos para estos).

(Por favor, consulte el papel de origen para más detalles de evaluación, que se registran exhaustivamente allí)

La evaluación inicial trató con actividades físicas/deportes (PA) y interacciones de objetos (OI), y probó tanto el conjunto de datos general como el subconjunto ‘más difícil’ mencionado anteriormente:

Resultados de la ronda inicial.

Resultados de la ronda inicial.

Aquí los autores comentan:

‘Incluso el modelo con mejor rendimiento, Wan2.1-14B, logra solo el 32.6% y el 21.9% en el conjunto de datos completo y la división difícil de nuestro conjunto de datos, respectivamente. Su rendimiento relativamente fuerte en comparación con otros modelos se puede atribuir a la diversidad de sus datos de entrenamiento multimodales, junto con un filtrado de movimiento robusto que preserva videos de alta calidad en una amplia gama de acciones.

‘Además, observamos que los modelos cerrados, como Ray2, tienen un rendimiento peor que los modelos abiertos como Wan2.1-14B y CogVideoX-5B. Esto sugiere que los modelos cerrados no son necesariamente superiores a los modelos abiertos en la captura del sentido común físico.

‘Es notable que Cosmos-Diffusion-7B logre la segunda mejor puntuación en la división difícil, incluso superando al modelo HunyuanVideo-13B mucho más grande. Esto puede deberse a la alta representación de acciones humanas en sus datos de entrenamiento, junto con simulaciones renderizadas sintéticamente.’

Los resultados mostraron que los modelos de video lucharon más con las actividades físicas como los deportes que con las interacciones de objetos más simples. Esto sugiere que mejorar los videos generados por IA en esta área requerirá mejores conjuntos de datos, particularmente metraje de alta calidad de deportes como el tenis, el disco, el béisbol y el críquet.

El estudio también examinó si la plausibilidad física de un modelo se correlacionaba con otras métricas de calidad de video, como la estética y la suavidad del movimiento. Los hallazgos revelaron que no había una correlación fuerte, lo que significa que un modelo no puede mejorar su rendimiento en VideoPhy-2 simplemente generando videos visualmente atractivos o con un movimiento fluido, necesita una comprensión más profunda del sentido común físico.

Aunque el papel proporciona muchos ejemplos cualitativos, pocos de los ejemplos estáticos proporcionados en el PDF parecen relacionarse con los ejemplos de video extensos que los autores proporcionan en el sitio del proyecto. Por lo tanto, veremos una pequeña selección de los ejemplos estáticos y algunos más de los videos del proyecto.

La fila superior muestra videos generados por Wan2.1. (a) En Ray2, el jet-ski de la izquierda se retrasa antes de moverse hacia atrás. (b) En Hunyuan-13B, el martillo de demolición se deforma en medio de un golpe, y una tabla de madera rota aparece inesperadamente. (c) En Cosmos-7B, la jabalina expulsa arena antes de hacer contacto con el suelo.

La fila superior muestra videos generados por Wan2.1. (a) En Ray2, el jet-ski de la izquierda se retrasa antes de moverse hacia atrás. (b) En Hunyuan-13B, el martillo de demolición se deforma en medio de un golpe, y una tabla de madera rota aparece inesperadamente. (c) En Cosmos-7B, la jabalina expulsa arena antes de hacer contacto con el suelo.

Con respecto a la prueba cualitativa anterior, los autores comentan:

‘[Observamos] violaciones del sentido común físico, como jetskis que se mueven de manera antinatural en reversa y la deformación de un martillo de demolición sólido, desafiando los principios de elasticidad. Sin embargo, incluso Wan sufre de la falta de sentido común físico, como se muestra en [el clip incorporado al comienzo de este artículo].

‘En este caso, resaltamos que una roca comienza a rodar y acelerar cuesta arriba, desafiando la ley física de la gravedad.’

Más ejemplos del sitio del proyecto:

Click para reproducir. Aquí, la leyenda fue ‘Una persona gira vigorosamente una toalla húmeda, agua que salpica hacia afuera en un arco visible’ – pero la fuente resultante de agua es más como una manguera que una toalla.

Click para reproducir. Aquí, la leyenda fue ‘Un químico vierte un líquido claro de un matraz en un tubo de ensayo, evitando cuidadosamente los derrames’, pero podemos ver que el volumen de agua que se agrega al matraz no es consistente con la cantidad que sale del jarrón.

Como mencioné al principio, el volumen de material asociado con este proyecto supera con creces lo que se puede cubrir aquí. Por lo tanto, por favor consulte el papel de origen, el sitio del proyecto y los sitios relacionados mencionados anteriormente, para una descripción exhaustiva de los procedimientos de los autores y muchos más ejemplos de pruebas y detalles procedimentales.

 

* En cuanto a la procedencia de las anotaciones, el papel solo especifica ‘adquiridas para estas tareas’ – parece mucho para haber sido generado por 12 trabajadores de AMT.

Publicado por primera vez el jueves 13 de marzo de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai