Modelos y plataformas de IA
Difusión de Video Estable: Modelos de Difusión de Video Latente a Grandes Conjuntos de Datos
Inteligencia Artificial Generativa ha sido una fuerza impulsora en la comunidad de inteligencia artificial durante algún tiempo, y los avances logrados en el campo de la modelización de imágenes generativas, especialmente con el uso de modelos de difusión, han ayudado a los modelos de video generativos a progresar significativamente no solo en la investigación, sino también en términos de aplicaciones en el mundo real. Convencionalmente, los modelos de video generativos se entrenan desde cero o se ajustan parcial o completamente desde modelos de imágenes preentrenados con capas temporales adicionales, en una mezcla de conjuntos de datos de imágenes y videos.
Avanzando en los avances de los modelos de video generativos, en este artículo, hablaremos sobre el Modelo de Difusión de Video Estable, un modelo de difusión de video latente capaz de generar contenido de video de alta resolución, de estado del arte, de imagen a video y de texto a video. Hablaremos sobre cómo los modelos de difusión latente entrenados para sintetizar imágenes 2D han mejorado las capacidades y la eficiencia de los modelos de video generativos al agregar capas temporales y ajustar los modelos en conjuntos de datos pequeños que consisten en videos de alta calidad. Tendremos un análisis más profundo de la arquitectura y el funcionamiento del Modelo de Difusión de Video Estable, y evaluaremos su rendimiento en varias métricas y lo compararemos con los marcos actuales de estado del arte para la generación de video. Así que comencemos.
Modelo de Difusión de Video Estable y Modelos de Video Generativos: Una Introducción
Gracias a su potencial casi ilimitado, la Inteligencia Artificial Generativa ha sido el tema principal de investigación para los practicantes de inteligencia artificial y aprendizaje automático durante un tiempo, y los últimos años han visto avances rápidos tanto en términos de eficiencia como de rendimiento de los modelos de imágenes generativas. Los conocimientos obtenidos de los modelos de imágenes generativas han permitido a los investigadores y desarrolladores hacer progresos en los modelos de video generativos, lo que ha resultado en una mayor practicidad y aplicaciones en el mundo real. Sin embargo, la mayoría de las investigaciones que intentan mejorar las capacidades de los modelos de video generativos se centran principalmente en el arreglo exacto de capas temporales y espaciales, con poca atención a investigar la influencia de la selección de los datos en el resultado de estos modelos generativos.
Gracias al progreso realizado por los modelos de imágenes generativas, los investigadores han observado que el impacto de la distribución de los datos de entrenamiento en el rendimiento de los modelos generativos es significativo e indiscutible. Además, los investigadores también han observado que preentrenar un modelo de imagen generativa en un conjunto de datos grande y diverso, seguido de un ajuste fino en un conjunto de datos más pequeño con mejor calidad, a menudo resulta en una mejora significativa del rendimiento. Tradicionalmente, los modelos de video generativos implementan los conocimientos obtenidos de los modelos de imágenes generativas exitosos, y los investigadores aún no han estudiado el efecto de los datos y las estrategias de entrenamiento. El Modelo de Difusión de Video Estable es un intento de mejorar las capacidades de los modelos de video generativos al aventurarse en territorios no explorados anteriormente, con un enfoque especial en la selección de datos.

Los modelos de video generativos recientes dependen de los modelos de difusión y enfoques de acondicionamiento de texto o imagen para sintetizar múltiples marcos de video o imagen coherentes. Los modelos de difusión son conocidos por su capacidad para aprender a desenoizar gradualmente una muestra de una distribución normal mediante la implementación de un proceso de refinamiento iterativo, y han entregado resultados deseables en la síntesis de video de alta resolución y texto a imagen. Utilizando el mismo principio en su núcleo, el Modelo de Difusión de Video Estable entrena un modelo de difusión de video latente en su conjunto de datos de video, junto con el uso de Redes Generativas Adversarias o GAN, e incluso modelos autoregresivos en alguna medida.
El Modelo de Difusión de Video Estable sigue una estrategia única que nunca ha sido implementada por ningún modelo de video generativo, ya que depende de líneas base de difusión de video latente con una arquitectura fija y una estrategia de entrenamiento fija, seguida de la evaluación del efecto de la curación de los datos. El Modelo de Difusión de Video Estable tiene como objetivo hacer las siguientes contribuciones en el campo de la modelización de video generativa.
- Presentar un flujo de trabajo de curación de datos sistemático y efectivo para convertir una gran colección de muestras de video no curadas en un conjunto de datos de alta calidad que luego es utilizado por los modelos de video generativos.
- Entrenar modelos de imagen a video y texto a video de estado del arte que superen los marcos existentes.
- Realizar experimentos específicos del dominio para investigar la comprensión 3D y el fuerte prior de movimiento del modelo.
Ahora, el Modelo de Difusión de Video Estable implementa los conocimientos obtenidos de los Modelos de Difusión de Video Latente y las técnicas de Curación de Datos en el núcleo de su fundación.
Modelos de Difusión de Video Latente
Los Modelos de Difusión de Video Latente o Video-LDM siguen el enfoque de entrenar el modelo generativo principal en un espacio latente con complejidad computacional reducida, y la mayoría de los Video-LDM implementan un modelo de imagen a texto preentrenado acoplado con la adición de capas de mezcla temporal en la arquitectura de preentrenamiento. Como resultado, la mayoría de los Modelos de Difusión de Video Latente solo entrenan capas temporales o saltan el proceso de entrenamiento por completo, a diferencia del Modelo de Difusión de Video Estable que ajusta fino todo el marco. Además, para sintetizar datos de texto a video, el Modelo de Difusión de Video Estable se condiciona directamente en una llamada de texto, y los resultados indican que el marco resultante se puede ajustar fino en un modelo de síntesis multi- vista o un modelo de imagen a video fácilmente.
Curación de Datos
La Curación de Datos es un componente esencial no solo del Modelo de Difusión de Video Estable, sino de los modelos generativos en general, ya que es esencial preentrenar grandes modelos en conjuntos de datos a gran escala para mejorar el rendimiento en varias tareas, incluyendo la modelización de lenguaje, la generación de texto a imagen discriminatoria y mucho más. La Curación de Datos se ha implementado con éxito en modelos de imágenes generativas aprovechando las capacidades de representaciones de lenguaje-imagen eficientes, aunque tales discusiones nunca se han centrado en el desarrollo de modelos de video generativos. Hay varios obstáculos que los desarrolladores enfrentan al curar datos para los modelos de video generativos, y para abordar estos desafíos, el Modelo de Difusión de Video Estable implementa una estrategia de entrenamiento de tres etapas, lo que resulta en resultados mejorados y un aumento significativo en el rendimiento.
Curación de Datos para Síntesis de Video de Alta Calidad
Como se discutió en la sección anterior, el Modelo de Difusión de Video Estable implementa una estrategia de entrenamiento de tres etapas, lo que resulta en resultados mejorados y un aumento significativo en el rendimiento. La Etapa I es una etapa de preentrenamiento de imagen que utiliza un modelo de difusión de imagen a texto 2D. La Etapa II es para preentrenamiento de video en el que el marco se entrena en una gran cantidad de datos de video. Finalmente, tenemos la Etapa III para ajuste fino de video en el que el modelo se refina en un subconjunto pequeño de videos de alta calidad y alta resolución.
Sin embargo, antes de que el Modelo de Difusión de Video Estable implemente estas tres etapas, es vital procesar y anotar los datos, ya que sirven como base para la Etapa II o la etapa de preentrenamiento de video, y juegan un papel crucial en garantizar la salida óptima. Para garantizar la máxima eficiencia, el marco primero implementa una tubería de detección de cortes en cascada en 3 niveles de FPS o fotogramas por segundo variables, y la necesidad de esta tubería se demuestra en la siguiente imagen.

A continuación, el Modelo de Difusión de Video Estable anota cada clip de video utilizando tres métodos de generación de subtítulos sintéticos variables. La siguiente tabla compara los conjuntos de datos utilizados en el Marco de Difusión Estable antes y después del proceso de filtración.

Etapa I: Preentrenamiento de Imagen
La primera etapa en la tubería de tres etapas implementada en el Modelo de Difusión de Video Estable es el preentrenamiento de imagen, y para lograr esto, el marco inicial del Modelo de Difusión de Video Estable se basa en un modelo de difusión de imagen preentrenado, específicamente el modelo Stable Diffusion 2.1, que lo dota de representaciones visuales más fuertes.

Etapa II: Preentrenamiento de Video
La segunda etapa es la Etapa de Preentrenamiento de Video, y se basa en los hallazgos de que el uso de la curación de datos en modelos de imágenes generativas multimodales a menudo resulta en mejores resultados y mayor eficiencia, junto con una generación de imágenes discriminatoria poderosa. Sin embargo, debido a la falta de representaciones poderosas y listas para usar para filtrar muestras no deseadas para los modelos de video generativos, el Modelo de Difusión de Video Estable depende de las preferencias humanas como señales de entrada para la creación de un conjunto de datos adecuado utilizado para preentrenar el marco. La siguiente figura demuestra el efecto positivo de preentrenar el marco en un conjunto de datos curado que ayuda a mejorar el rendimiento general para el preentrenamiento de video en conjuntos de datos más pequeños.

Para ser más específicos, el marco utiliza diferentes métodos para curar subconjuntos de Difusión de Video Latente y considera el ranking de los modelos LVD entrenados en estos conjuntos de datos. Además, el marco del Modelo de Difusión de Video Estable también encuentra que el uso de conjuntos de datos curados para entrenar los marcos ayuda a mejorar el rendimiento del marco y los modelos de difusión en general. Además, la estrategia de curación de datos también funciona en conjuntos de datos más grandes, más relevantes y más prácticos. La siguiente figura demuestra el efecto positivo de preentrenar el marco en un conjunto de datos curado que ayuda a mejorar el rendimiento general para el preentrenamiento de video en conjuntos de datos más pequeños.

Etapa III: Ajuste Fino de Alta Calidad
Hasta la Etapa II, el marco del Modelo de Difusión de Video Estable se centra en mejorar el rendimiento antes del preentrenamiento de video, y en la tercera etapa, el marco se centra en optimizar o mejorar aún más el rendimiento del marco después del ajuste fino de video de alta calidad, y cómo se logra la transición de la Etapa II a la Etapa III en el marco. En la Etapa III, el marco se basa en técnicas de entrenamiento tomadas de los modelos de difusión de imagen latente y aumenta la resolución de los ejemplos de entrenamiento. Para analizar la efectividad de este enfoque, el marco compara los resultados con tres modelos idénticos que difieren solo en términos de su inicialización. El primer modelo idéntico tiene sus pesos inicializados y el proceso de entrenamiento de video se salta, mientras que los dos modelos idénticos restantes se inicializan con los pesos tomados de otros modelos de video latente.
Resultados y Hallazgos
Es hora de ver cómo se desempeña el marco del Modelo de Difusión de Video Estable en tareas del mundo real y cómo se compara con los marcos actuales de estado del arte. El marco del Modelo de Difusión de Video Estable primero utiliza el enfoque óptimo de datos para entrenar un modelo base y luego realiza un ajuste fino para generar varios modelos de estado del arte, donde cada modelo realiza una tarea específica.

La imagen anterior representa las muestras de video de imagen a video de alta resolución generadas por el marco, mientras que la siguiente figura demuestra la capacidad del marco para generar muestras de video de texto a video de alta calidad.

Modelo Base Preentrenado
Como se discutió anteriormente, el Modelo de Difusión de Video Estable se basa en el marco de Difusión Estable 2.1, y en base a los hallazgos recientes, fue crucial para los desarrolladores adoptar el calendario de ruido y aumentar el ruido para obtener imágenes con mejor resolución al entrenar modelos de difusión de imagen. Gracias a este enfoque, el Modelo de Difusión de Video Estable base aprende representaciones de movimiento poderosas y, en el proceso, supera los modelos base para la generación de video de texto a video en un entorno de disparo cero, y los resultados se muestran en la siguiente tabla.

Interpolación de Fotogramas y Generación Multi-Vista
El marco del Modelo de Difusión de Video Estable ajusta fino el modelo de imagen a video en conjuntos de datos multi-vista para obtener múltiples vistas novedosas de un objeto, y este modelo se conoce como SVD-MV o Modelo de Difusión de Video Estable – Multi-Vista. El modelo SVD original se ajusta fino con la ayuda de dos conjuntos de datos de una manera que el marco ingresa una sola imagen y devuelve una secuencia de imágenes multi-vista como salida.
Como se puede ver en las siguientes imágenes, el marco del Modelo de Difusión de Video Estable – Multi-Vista entrega un rendimiento alto comparable al marco de Multi-Vista desde cero de estado del arte, y los resultados son una clara demostración de la capacidad de SVD-MV para aprovechar los conocimientos obtenidos del marco SVD original para la generación de imágenes multi-vista. Además, los resultados también indican que ejecutar el modelo durante un número relativamente pequeño de iteraciones ayuda a entregar resultados óptimos, como es el caso con la mayoría de los modelos ajustados fino desde el marco SVD.


En la figura anterior, las métricas se indican en el lado izquierdo y, como se puede ver, el marco del Modelo de Difusión de Video Estable – Multi-Vista supera al marco Scratch-MV y al marco SD2.1 Multi-Vista por un margen decente. La segunda imagen demuestra el efecto del número de iteraciones de entrenamiento en el rendimiento general del marco en términos de puntuación de Clip, y los marcos SVD-MV entregan resultados sostenibles.
Pensamientos Finales
En este artículo, hemos hablado sobre el Modelo de Difusión de Video Estable, un modelo de difusión de video latente capaz de generar contenido de video de alta resolución, de estado del arte, de imagen a video y de texto a video. El Modelo de Difusión de Video Estable sigue una estrategia única que nunca ha sido implementada por ningún modelo de video generativo, ya que depende de líneas base de difusión de video latente con una arquitectura fija y una estrategia de entrenamiento fija, seguida de la evaluación del efecto de la curación de los datos.
Hemos hablado sobre cómo los modelos de difusión latente entrenados para sintetizar imágenes 2D han mejorado las capacidades y la eficiencia de los modelos de video generativos al agregar capas temporales y ajustar los modelos en conjuntos de datos pequeños que consisten en videos de alta calidad. Para recopilar los datos de preentrenamiento, el marco realiza un estudio de escalabilidad y sigue prácticas de recolección de datos sistemáticas, y en última instancia, propone un método para curar una gran cantidad de datos de video y convertir videos ruidosos en datos de entrada adecuados para los modelos de video generativos.
Además, el marco del Modelo de Difusión de Video Estable emplea tres etapas de entrenamiento de modelos de video distintas que se analizan de forma independiente para evaluar su impacto en el rendimiento del marco. El marco finalmente produce una representación de video lo suficientemente poderosa como para ajustar fino los modelos para la síntesis de video óptima, y los resultados son comparables a los modelos de generación de video de estado del arte ya en uso.












