Modelos y plataformas de IA

Preparando la Receta para la Continuidad en la Generación de Vídeos Largos

mm
Añade Unite.AI a tus fuentes preferidas en Google
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

El reciente lanzamiento público del modelo de inteligencia artificial generativa Hunyuan Video ha intensificado las discusiones en curso sobre el potencial de los grandes modelos de visión-lenguaje multimodal para crear películas enteras algún día.

Sin embargo, como hemos observado, esto es un prospecto muy lejano en este momento, por varias razones. Una de ellas es la ventana de atención muy corta de la mayoría de los generadores de video de inteligencia artificial, que luchan por mantener la coherencia incluso en un solo disparo, y mucho menos en una serie de disparos.

Otra razón es que las referencias consistentes al contenido de video (como entornos explorables, que no deben cambiar aleatoriamente si se retrocede a través de ellos) solo pueden lograrse en modelos de difusión mediante técnicas de personalización como la adaptación de bajo rango (LoRA), lo que limita las capacidades fuera de la caja de los modelos base.

Por lo tanto, la evolución de la generación de video parece estar estancada a menos que se desarrollen nuevos enfoques para la continuidad narrativa.

Receta para la Continuidad

Con esto en mente, una nueva colaboración entre Estados Unidos y China ha propuesto el uso de videos de cocina instructivos como una posible plantilla para futuros sistemas de continuidad narrativa.

Haz clic para reproducir. El proyecto VideoAuteur sistematiza el análisis de partes de un proceso de cocción, para producir un nuevo conjunto de datos con subtítulos finos y un método de orquestación para la generación de videos de cocina. Consulte el sitio de origen para una mejor resolución. Fuente: https://videoauteur.github.io/

Titulado VideoAuteur, el trabajo propone una canalización de dos etapas para generar videos de cocina instructivos utilizando estados coherentes que combinan fotogramas clave y subtítulos, logrando resultados de vanguardia en -admitidamente- un espacio subinscrito.

La página del proyecto de VideoAuteur también incluye una serie de videos más llamativos que utilizan la misma técnica, como un tráiler propuesto para una película de crossover de Marvel/DC:

Haz clic para reproducir. Dos superhéroes de universos alternativos se enfrentan en un tráiler falso de VideoAuteur. Consulte el sitio de origen para una mejor resolución.

La página también presenta videos de promoción con un estilo similar para una serie de animales de Netflix y un anuncio de coche de Tesla (TSLA ).

Al desarrollar VideoAuteur, los autores experimentaron con diversas funciones de pérdida y enfoques novedosos. Para desarrollar una receta para la generación de tutoriales, también curaron CookGen, el conjunto de datos más grande centrado en el dominio de la cocción, que cuenta con 200.000 clips de video con una duración promedio de 9,5 segundos.

Con un promedio de 768,3 palabras por video, CookGen es cómodamente el conjunto de datos más extensamente anotado de su tipo. Se utilizaron diversos modelos de visión/lenguaje, entre otros enfoques, para garantizar que las descripciones fueran lo más detalladas, relevantes y precisas posible.

Los videos de cocina se eligieron porque las instrucciones de cocina tienen una narrativa estructurada y unívoca, lo que hace que la anotación y la evaluación sean una tarea más fácil. Excepto los videos pornográficos (que probablemente ingresen a este espacio particular pronto), es difícil pensar en cualquier otro género tan visual y narrativamente “fórmula”.

Los autores afirman:

‘Nuestra canalización de dos etapas auto-regresiva propuesta, que incluye un director de narrativa larga y generación de video condicionada visualmente, demuestra mejoras prometedoras en la coherencia semántica y la fidelidad visual en los videos narrativos largos generados.

‘A través de experimentos en nuestro conjunto de datos, observamos mejoras en la coherencia espacial y temporal a lo largo de las secuencias de video.’

‘Esperamos que nuestro trabajo pueda facilitar más investigaciones en la generación de videos narrativos largos.’

El nuevo trabajo se titula VideoAuteur: Hacia la Generación de Vídeos Narrativos Largos, y proviene de ocho autores de la Universidad Johns Hopkins, ByteDance y ByteDance Seed.

Curación de Conjunto de Datos

Para desarrollar CookGen, que alimenta un sistema generativo de dos etapas para producir videos de cocina de inteligencia artificial, los autores utilizaron material de las colecciones YouCook y HowTo100M. Los autores comparan la escala de CookGen con conjuntos de datos anteriores centrados en el desarrollo narrativo en la generación de video, como el conjunto de datos Flintstones, el conjunto de datos de la caricatura Pororo, StoryGen, el StoryStream de Tencent y VIST.

Comparación de imágenes y longitud de texto entre CookGen y los conjuntos de datos más poblados similares. Fuente: https://arxiv.org/pdf/2501.06173

Comparación de imágenes y longitud de texto entre CookGen y los conjuntos de datos más poblados similares. Fuente: https://arxiv.org/pdf/2501.06173

CookGen se centra en narrativas del mundo real, particularmente en actividades procedimentales como la cocción, que ofrecen historias más claras y fáciles de anotar en comparación con los conjuntos de datos de cómics basados en imágenes. Superó al conjunto de datos existente más grande, StoryStream, con 150 veces más fotogramas y descripciones textuales 5 veces más densas.

Los investigadores ajustaron un modelo de subtítulos utilizando la metodología de LLaVA-NeXT como base. Las etiquetas de reconocimiento de habla automático (ASR) obtenidas para HowTo100M se utilizaron como “acciones” para cada video, y luego se refinaron aún más mediante modelos de lenguaje grande (LLM).

Por ejemplo, ChatGPT-4o se utilizó para producir un conjunto de datos de subtítulos y se le pidió que se centrara en las interacciones entre sujeto-objeto (como las manos que manipulan utensilios y alimentos), los atributos del objeto y la dinámica temporal.

Dado que los guiones de ASR probablemente contengan inexactitudes y sean generalmente “ruidosos”, se utilizó la Intersección sobre la Unión (IoU) como métrica para medir lo cerca que los subtítulos se ajustaban a la sección del video que estaban abordando. Los autores señalan que esto fue crucial para la creación de la coherencia narrativa.

Los clips curados se evaluaron utilizando Fréchet Video Distance (FVD), que mide la disparidad entre ejemplos de verdad (mundo real) y ejemplos generados, tanto con como sin fotogramas clave de verdad, llegando a un resultado performático:

Usando FVD para evaluar la distancia entre los videos generados con los nuevos subtítulos, tanto con como sin el uso de fotogramas clave capturados de los videos de muestra.

Usando FVD para evaluar la distancia entre los videos generados con los nuevos subtítulos, tanto con como sin el uso de fotogramas clave capturados de los videos de muestra.

Además, los clips se calificaron tanto por GPT-4o como por seis anotadores humanos, siguiendo la definición de LLaVA-Hound de “alucinación” (es decir, la capacidad de un modelo para inventar contenido espurio).

Los investigadores compararon la calidad de los subtítulos con la colección Qwen2-VL-72B, obteniendo una puntuación ligeramente mejorada.

Comparación de las puntuaciones de FVD y la evaluación humana entre Qwen2-VL-72B y la colección de los autores.

Comparación de las puntuaciones de FVD y la evaluación humana entre Qwen2-VL-72B y la colección de los autores.

Método

La fase generativa de VideoAuteur se divide entre el Director de Narrativa Larga (LND) y el modelo de generación de video condicionado visualmente (VCVGM).

LND genera una secuencia de incrustaciones visuales o fotogramas clave que caracterizan el flujo narrativo, similares a “momentos destacados esenciales”. El VCVGM genera clips de video basados en estas elecciones.

Esquema para la canalización de procesamiento de VideoAuteur. El Director de Narrativa Larga hace selecciones apropiadas para alimentar al módulo generativo impulsado por Seed-X.

Esquema para la canalización de procesamiento de VideoAuteur. El Director de Narrativa Larga hace selecciones apropiadas para alimentar al módulo generativo impulsado por Seed-X.

Los autores discuten extensamente los diferentes méritos de un director de imagen-texto entrelazado y un director de fotogramas centrado en el lenguaje, y concluyen que el primero es el enfoque más efectivo.

El director de imagen-texto entrelazado genera una secuencia entrelazando tokens de texto y incrustaciones visuales, utilizando un modelo auto-regresivo para predecir el token siguiente, basándose en el contexto combinado de texto e imágenes. Esto garantiza una alineación ajustada entre lo visual y el texto.

Por el contrario, el director de fotogramas centrado en el lenguaje sintetiza fotogramas clave utilizando un modelo de difusión condicionado por texto basado únicamente en subtítulos, sin incorporar incrustaciones visuales en el proceso de generación.

Los investigadores encontraron que, si bien el método centrado en el lenguaje genera fotogramas clave visualmente atractivos, carece de coherencia a lo largo de los fotogramas, argumentando que el método entrelazado logra puntuaciones más altas en realismo y coherencia visual. También encontraron que este método era capaz de aprender un estilo visual realista a través del entrenamiento, aunque a veces con algunos elementos repetitivos o ruidosos.

Inusualmente, en una rama de investigación dominada por la adopción de Stable Diffusion y Flux en flujos de trabajo, los autores utilizaron el modelo de lenguaje multimodal de 7B parámetros de Tencent SEED-X para su canalización generativa (aunque este modelo aprovecha la versión SDXL de Stable Diffusion de Stability.ai para una parte limitada de su arquitectura).

Los autores afirman:

‘A diferencia de la canalización clásica de Imagen a Video (I2V) que utiliza una imagen como el fotograma inicial, nuestro enfoque aprovecha [latentes visuales regresados] como condiciones continuas a lo largo de la [secuencia]. ‘

‘Además, mejoramos la robustez y la calidad de los videos generados adaptando el modelo para manejar incrustaciones visuales ruidosas, ya que los latentes visuales regresados pueden no ser perfectos debido a errores de regresión.’

Aunque las canalizaciones generativas de video condicionadas visualmente de este tipo suelen utilizar fotogramas iniciales como punto de partida para la orientación del modelo, VideoAuteur amplía este paradigma generando estados visuales multi-partes en un espacio latente semánticamente coherente, evitando el sesgo potencial de basar la generación posterior únicamente en “fotogramas iniciales”.

Esquema para el uso de incrustaciones de estado visual como un método de acondicionamiento superior.

Esquema para el uso de incrustaciones de estado visual como un método de acondicionamiento superior.

Pruebas

En línea con los métodos de SeedStory, los investigadores utilizan SEED-X para aplicar un ajuste fino de LoRA en su conjunto de datos narrativos, describiendo enigmáticamente el resultado como un “modelo similar a Sora”, pre-entrenado en acoplamientos de video/texto a gran escala, y capaz de aceptar tanto condiciones visuales como de texto.

Se utilizaron 32.000 videos narrativos para el desarrollo del modelo, con 1.000 reservados como muestra de validación. Los videos se recortaron a 448 píxeles en el lado corto y luego se recortaron al centro a 448x448px.

Para el entrenamiento, la generación de narrativa se evaluó principalmente en el conjunto de validación de YouCook2. El conjunto Howto100M se utilizó para la evaluación de la calidad de los datos y también para la generación de imagen a video.

Para la pérdida de condicionamiento visual, los autores utilizaron la pérdida de difusión de DiT y un trabajo de 2024 basado en Stable Diffusion.

Para demostrar su afirmación de que el entrelazamiento es un enfoque superior, los autores enfrentaron a VideoAuteur contra varios métodos que dependen únicamente de la entrada basada en texto: EMU-2, SEED-X, SDXL y FLUX.1-schnell (FLUX.1-s).

Dado un prompt global, 'Guía paso a paso para cocinar tofu mapo', el director entrelazado genera acciones, subtítulos y incrustaciones de imagen secuencialmente para narrar el proceso. Las dos primeras filas muestran fotogramas clave decodificados desde los espacios latentes de EMU-2 y SEED-X. Estas imágenes son realistas y coherentes, pero menos pulidas que las de modelos avanzados como SDXL y FLUX.

Dado un prompt global, ‘Guía paso a paso para cocinar tofu mapo’, el director entrelazado genera acciones, subtítulos y incrustaciones de imagen secuencialmente para narrar el proceso. Las dos primeras filas muestran fotogramas clave decodificados desde los espacios latentes de EMU-2 y SEED-X. Estas imágenes son realistas y coherentes, pero menos pulidas que las de modelos avanzados como SDXL y FLUX.

Los autores afirman:

‘El enfoque centrado en el lenguaje que utiliza modelos de imagen a texto produce fotogramas clave visualmente atractivos pero sufre de una falta de coherencia a lo largo de los fotogramas debido a la información mutua limitada. En contraste, el método de generación entrelazada aprovecha latentes visuales alineados con el lenguaje, logrando un estilo visual realista a través del entrenamiento. ‘

‘Sin embargo, ocasionalmente genera imágenes con elementos repetitivos o ruidosos, ya que el modelo auto-regresivo lucha por crear incrustaciones precisas en un solo paso.’

La evaluación humana confirma aún más la afirmación de los autores sobre el rendimiento mejorado del enfoque entrelazado, con métodos entrelazados que logran las puntuaciones más altas en una encuesta.

Comparaciones de enfoques de un estudio humano realizado para el artículo.

Comparación de enfoques de un estudio humano realizado para el artículo.

Sin embargo, observamos que los enfoques centrados en el lenguaje logran las mejores puntuaciones estéticas. Los autores argumentan, sin embargo, que esto no es el tema central en la generación de videos narrativos largos.

Haz clic para reproducir. Segmentos generados para un video de construcción de pizza, por VideoAuteur.

Conclusión

La rama de investigación más popular en cuanto a este desafío, es decir, la coherencia narrativa en la generación de video de larga duración, se ocupa de imágenes individuales. Proyectos de este tipo incluyen DreamStory, StoryDiffusion, TheaterGen y ConsiStory de NVIDIA.

En cierto sentido, VideoAuteur también cae en esta categoría “estática”, ya que hace uso de imágenes iniciales a partir de las cuales se generan secciones de clip. Sin embargo, el entrelazamiento de contenido de video y semántico lleva el proceso un paso más cerca de una canalización práctica.

 

Publicado por primera vez el jueves 16 de enero de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai