Ángulo de Anderson

Hacia el Control Total en la Generación de Vídeo de IA

mm
Añade Unite.AI a tus fuentes preferidas en Google
ChatGPT-4o, Adobe Firefly: lower right, imagery from the paper FullDiT: Multi-Task Video Generative Foundation Model with Full Attention (https://arxiv.org/pdf/2503.19907)

Los modelos de vídeo fundamentales, como Hunyuan y Wan 2.1, aunque potentes, no ofrecen a los usuarios el tipo de control granular que demanda la producción de cine y televisión (en particular, la producción de efectos visuales).

En estudios de efectos visuales profesionales, los modelos de código abierto como estos, junto con modelos de imagen (en lugar de vídeo) como Stable Diffusion, Kandinsky y Flux, se utilizan generalmente junto con una variedad de herramientas de apoyo que adaptan la salida bruta para satisfacer necesidades creativas específicas. Cuando un director dice: “Esto se ve genial, pero ¿podemos hacerlo un poco más [n]?”, no puedes responder diciendo que el modelo no es lo suficientemente preciso como para manejar dichas solicitudes.

En su lugar, un equipo de efectos visuales de IA utilizará una variedad de técnicas tradicionales de CGI y composición, aliadas con procedimientos y flujos de trabajo personalizados desarrollados con el tiempo, para intentar empujar los límites de la síntesis de vídeo un poco más.

Por analogía, un modelo de vídeo fundamental es similar a una instalación predeterminada de un navegador web como Chrome; hace mucho fuera de la caja, pero si deseas que se adapte a tus necesidades, en lugar de viceversa, necesitarás algunos complementos.

Freaks de Control

En el mundo de la síntesis de imágenes basada en difusión, el sistema de terceros más importante es ControlNet.

ControlNet es una técnica para agregar control estructurado a modelos generativos basados en difusión, lo que permite a los usuarios guiar la generación de imágenes o vídeos con entradas adicionales como mapas de bordes, mapas de profundidad o información de pose.

Los métodos variados de ControlNet permiten profundidad>imagen (fila superior), segmentación semántica>imagen (abajo a la izquierda) y generación de imagen guiada por pose de humanos y animales (abajo a la izquierda).

Los métodos variados de ControlNet permiten profundidad>imagen (fila superior), segmentación semántica>imagen (abajo a la izquierda) y generación de imagen guiada por pose de humanos y animales (abajo a la izquierda).

En lugar de confiar únicamente en textos de introducción, ControlNet introduce ramas de red neuronal separadas, o adaptadores, que procesan estas señales de acondicionamiento mientras conservan las capacidades generativas del modelo base.

Esto permite salidas afinadas que se ajustan más estrechamente a las especificaciones del usuario, lo que lo hace particularmente útil en aplicaciones donde se requiere control de composición, estructura o movimiento preciso:

Con una pose guía, se pueden obtener varios tipos de salida precisos a través de ControlNet. Fuente: https://arxiv.org/pdf/2302.05543

Con una pose guía, se pueden obtener varios tipos de salida precisos a través de ControlNet. Fuente: https://arxiv.org/pdf/2302.05543

Sin embargo, los marcos de trabajo basados en adaptadores de este tipo operan externamente en un conjunto de procesos neuronales que son muy internamente enfocados. Estos enfoques tienen varias desventajas.

Primero, los adaptadores se entrenan de forma independiente, lo que conduce a conflictos de rama cuando se combinan varios adaptadores, lo que puede implicar una calidad de generación degradada.

En segundo lugar, introducen redundancia de parámetros, lo que requiere cálculo y memoria adicionales para cada adaptador, lo que hace que la escalabilidad sea ineficiente.

Tercero, a pesar de su flexibilidad, los adaptadores a menudo producen resultados subóptimos en comparación con los modelos que están completamente afinados para la generación multi-condición. Estos problemas hacen que los métodos basados en adaptadores sean menos efectivos para tareas que requieren una integración fluida de varias señales de control.

En ideales, las capacidades de ControlNet se entrenarían nativamente en el modelo, de una manera modular que podría acomodar innovaciones posteriores y muy anticipadas, como la generación simultánea de vídeo y audio, o capacidades de sincronización de labios nativas (para audio externo).

Como están las cosas, cada pieza adicional de funcionalidad representa una tarea de post-producción o un procedimiento no nativo que tiene que navegar los pesos estrechamente vinculados y sensibles de cualquier modelo base en el que se esté operando.

FullDiT

En este punto de estancamiento llega una nueva oferta de China, que postula un sistema donde las medidas de estilo ControlNet se hornean directamente en un modelo generativo de vídeo en el momento del entrenamiento, en lugar de ser relegadas a un después.

Del nuevo artículo: el enfoque FullDiT puede incorporar imposición de identidad, profundidad y movimiento de cámara en una generación nativa, y puede convocar cualquier combinación de estos al mismo tiempo. Fuente: https://arxiv.org/pdf/2503.19907

Del nuevo artículo: el enfoque FullDiT puede incorporar imposición de identidad, profundidad y movimiento de cámara en una generación nativa, y puede convocar cualquier combinación de estos al mismo tiempo. Fuente: https://arxiv.org/pdf/2503.19907

Titulado FullDiT, el nuevo enfoque fusiona condiciones multi-tarea como transferencia de identidad, mapeo de profundidad y movimiento de cámara en una parte integrada de un modelo generativo de vídeo entrenado, para el cual los autores han producido un modelo entrenado prototipo y clips de vídeo en un sitio del proyecto.

En el ejemplo a continuación, vemos generaciones que incorporan movimiento de cámara, información de identidad y texto (es decir, textos de introducción del usuario):

Click para reproducir. Ejemplos de imposición de control del usuario al estilo ControlNet con solo un modelo base entrenado de forma nativa. Fuente: https://fulldit.github.io/

Debería tenerse en cuenta que los autores no proponen su modelo entrenado experimental como un modelo base funcional, sino más bien como una prueba de concepto para modelos de vídeo a texto (T2V) y de imagen a vídeo (I2V) que ofrecen a los usuarios más control que solo una imagen de introducción o un texto de introducción.

Dado que no hay modelos similares de este tipo, los investigadores crearon un nuevo benchmark titulado FullBench, para la evaluación de vídeos multi-tarea, y afirman tener un rendimiento de estado del arte en las pruebas como para como se diseñaron contra enfoques anteriores. Sin embargo, dado que FullBench fue diseñado por los autores mismos, su objetividad no ha sido probada, y su conjunto de datos de 1.400 casos puede ser demasiado limitado para conclusiones más amplias.

Quizás el aspecto más interesante de la arquitectura que presenta el artículo es su potencial para incorporar nuevos tipos de control. Los autores afirman:

‘En este trabajo, solo exploramos condiciones de control de la cámara, identidades y información de profundidad. No investigamos más a fondo otras condiciones y modalidades, como audio, habla, nubes de puntos, cajas delimitadoras de objetos, flujo óptico, etc. Aunque el diseño de FullDiT puede integrar modalidades adicionales con una modificación mínima de la arquitectura, cómo adaptar rápidamente y de forma rentable modelos existentes a nuevas condiciones y modalidades es aún una pregunta importante que requiere más exploración.’

Aunque los investigadores presentan FullDiT como un paso adelante en la generación de vídeo multi-tarea, se debe considerar que este nuevo trabajo se basa en arquitecturas existentes en lugar de introducir un paradigma fundamentalmente nuevo.

No obstante, FullDiT se encuentra actualmente solo (hasta donde llega mi conocimiento) como un modelo base de vídeo con capacidades de estilo ControlNet “codificadas” – y es bueno ver que la arquitectura propuesta puede acomodar innovaciones posteriores también.

Click para reproducir. Ejemplos de movimientos de cámara controlados por el usuario, del sitio del proyecto.

El nuevo artículo se titula FullDiT: Modelo de Generación de Vídeo Multi-Tarea con Atención Completa, y proviene de nueve investigadores de Kuaishou Technology y la Universidad China de Hong Kong. La página del proyecto es aquí y los nuevos datos de benchmark están en Hugging Face.

Método

Los autores sostienen que el mecanismo de atención unificado de FullDiT permite un aprendizaje de representación cruzada de modalidad más fuerte al capturar tanto relaciones espaciales como temporales a través de condiciones:

Según el nuevo artículo, FullDiT integra múltiples condiciones de entrada a través de una atención completa, convirtiéndolas en una secuencia unificada. Por el contrario, los modelos basados en adaptadores (izquierda) utilizan módulos separados para cada entrada, lo que conduce a redundancia, conflictos y un rendimiento más débil.

Según el nuevo artículo, FullDiT integra múltiples condiciones de entrada a través de una atención completa, convirtiéndolas en una secuencia unificada. Por el contrario, los modelos basados en adaptadores (izquierda) utilizan módulos separados para cada entrada, lo que conduce a redundancia, conflictos y un rendimiento más débil.

Al contrario que los conjuntos basados en adaptadores que procesan cada flujo de entrada por separado, esta estructura de atención compartida evita conflictos de rama y reduce la sobrecarga de parámetros. También afirman que la arquitectura puede escalar a nuevos tipos de entrada sin un rediseño importante – y que el esquema del modelo muestra signos de generalización a combinaciones de condiciones que no se vieron durante el entrenamiento, como vincular el movimiento de la cámara con la identidad del personaje.

Click para reproducir. Ejemplos de generación de identidad del sitio del proyecto.

En la arquitectura de FullDiT, todas las entradas de acondicionamiento – como texto, movimiento de cámara, identidad y profundidad – se convierten primero en un formato de token unificado. Estos tokens se concatenan luego en una sola secuencia larga, que se procesa a través de una pila de transformadores utilizando una atención completa. Este enfoque sigue trabajos anteriores como Open-Sora Plan y Movie Gen.

Este diseño permite que el modelo aprenda relaciones temporales y espaciales de forma conjunta a través de todas las condiciones. Cada bloque de transformador opera sobre toda la secuencia, permitiendo interacciones dinámicas entre modalidades sin depender de módulos separados para cada entrada – y, como hemos señalado, la arquitectura está diseñada para ser extensible, lo que facilita la incorporación de señales de control adicionales en el futuro, sin cambios estructurales importantes.

El Poder de Tres

FullDiT convierte cada señal de control en un formato de token estandarizado para que todas las condiciones puedan procesarse juntas en un marco de atención unificado. Para el movimiento de cámara, el modelo codifica una secuencia de parámetros extrínsecos – como posición y orientación – para cada cuadro. Estos parámetros están fechados y proyectados en vectores de incrustación que reflejan la naturaleza temporal de la señal.

La información de identidad se trata de manera diferente, ya que es inherentemente espacial en lugar de temporal. El modelo utiliza mapas de identidad que indican qué personajes están presentes en qué partes de cada cuadro. Estos mapas se dividen en patches, con cada patch proyectado en una incrustación que captura pistas de identidad espacial, lo que permite al modelo asociar regiones específicas del cuadro con entidades específicas.

La profundidad es una señal de espacio-tiempo, y el modelo la maneja dividiendo los vídeos de profundidad en parches 3D que abarcan tanto el espacio como el tiempo. Estos parches se incrustan luego de una manera que preserva su estructura a lo largo de los cuadros.

Una vez incrustados, todos estos tokens de condición (cámara, identidad y profundidad) se concatenan en una sola secuencia larga, lo que permite a FullDiT procesarlos juntos utilizando una atención completa. Esta representación compartida hace posible que el modelo aprenda interacciones a través de modalidades y a través del tiempo sin depender de flujos de procesamiento aislados.

Datos y Pruebas

El enfoque de entrenamiento de FullDiT se basó en conjuntos de datos anotados selectivamente adaptados a cada tipo de acondicionamiento, en lugar de requerir que todas las condiciones estuvieran presentes simultáneamente.

Para condiciones textuales, la iniciativa sigue el enfoque de captionado estructurado descrito en el proyecto MiraData.

Pipeline de recopilación y anotación de vídeo del proyecto MiraData. Fuente: https://arxiv.org/pdf/2407.06358

Pipeline de recopilación y anotación de vídeo del proyecto MiraData. Fuente: https://arxiv.org/pdf/2407.06358

Para el movimiento de cámara, el conjunto de datos RealEstate10K fue la principal fuente de datos, debido a sus anotaciones de parámetros de cámara de alta calidad.

Sin embargo, los autores observaron que entrenar exclusivamente con conjuntos de datos de escenas estáticas como RealEstate10K tendía a reducir los movimientos de objetos y humanos dinámicos en los vídeos generados. Para contrarrestar esto, realizaron un ajuste fino adicional utilizando conjuntos de datos internos que incluían movimientos de cámara más dinámicos.

Las anotaciones de identidad se generaron utilizando la pipeline desarrollada para el proyecto ConceptMaster, que permitió un filtrado y extracción eficientes de información de identidad detallada.

El marco de ConceptMaster está diseñado para abordar problemas de desacoplamiento de identidad mientras preserva la fidelidad de concepto en vídeos personalizados. Fuente: https://arxiv.org/pdf/2501.04698

El marco de ConceptMaster está diseñado para abordar problemas de desacoplamiento de identidad mientras preserva la fidelidad de concepto en vídeos personalizados. Fuente: https://arxiv.org/pdf/2501.04698

Las anotaciones de profundidad se obtuvieron del conjunto de datos Panda-70M utilizando Depth Anything.

Optimización a través del Orden de los Datos

Los autores también implementaron un calendario de entrenamiento progresivo, introduciendo condiciones más desafiantes al comienzo del entrenamiento para asegurarse de que el modelo adquiriera representaciones robustas antes de que se agregaran tareas más simples. El orden de entrenamiento procedió desde texto a cámara, luego identidades, y finalmente profundidad, con tareas más fáciles generalmente introducidas más tarde y con menos ejemplos.

Los autores enfatizan el valor de ordenar la carga de trabajo de esta manera:

‘Durante la fase de pre-entrenamiento, notamos que las tareas más desafiantes requieren tiempo de entrenamiento extendido y deben introducirse al comienzo del proceso de aprendizaje. Estas tareas desafiantes involucran distribuciones de datos complejas que difieren significativamente de la salida del vídeo, lo que requiere que el modelo posea la capacidad suficiente para capturar y representarlas con precisión.

‘Por el contrario, introducir tareas fáciles demasiado pronto puede llevar al modelo a priorizar el aprendizaje de estas primero, ya que proporcionan retroalimentación de optimización más inmediata, lo que obstaculiza la convergencia de tareas más desafiantes.’

Ilustración del orden de entrenamiento de datos adoptado por los investigadores, con rojo que indica un mayor volumen de datos.

Ilustración del orden de entrenamiento de datos adoptado por los investigadores, con rojo que indica un mayor volumen de datos.

Después del pre-entrenamiento inicial, una etapa de ajuste fino final refinó aún más el modelo para mejorar la calidad visual y la dinámica del movimiento. Luego, el entrenamiento siguió el de un marco de difusión estándar*: se agregó ruido a los latentes del vídeo, y el modelo aprendió a predecir y eliminarlo, utilizando los tokens de condición incrustados como orientación.

Para evaluar eficazmente FullDiT y proporcionar una comparación justa con los métodos existentes, y en ausencia de la disponibilidad de cualquier otro benchmark apropiado, los autores introdujeron FullBench, un conjunto de benchmark curado que consiste en 1.400 casos de prueba distintos.

Instancia de explorador de datos para el nuevo benchmark FullBench. Fuente: https://huggingface.co/datasets/KwaiVGI/FullBench

Instancia de explorador de datos para el nuevo benchmark FullBench. Fuente: https://huggingface.co/datasets/KwaiVGI/FullBench

Cada punto de datos proporcionó anotaciones de verdad de referencia para varias señales de acondicionamiento, incluyendo movimiento de cámara, identidad y profundidad.

Métricas

Los autores evaluaron FullDiT utilizando diez métricas que cubren cinco aspectos principales del rendimiento: alineación de texto, control de cámara, similitud de identidad, precisión de profundidad y calidad general de vídeo.

La alineación de texto se midió utilizando similitud CLIP, mientras que el control de cámara se evaluó a través de error de rotación (RotErr), error de traducción (TransErr) y coherencia de movimiento de cámara (CamMC), siguiendo el enfoque de CamI2V (en el proyecto CameraCtrl).

La similitud de identidad se evaluó utilizando DINO-I y CLIP-I, y la precisión de control de profundidad se cuantificó utilizando Error Absoluto Medio (MAE).

La calidad del vídeo se juzgó con tres métricas de MiraData: similitud de cuadro de nivel CLIP para suavidad; distancia de movimiento de flujo óptico para dinámica; y puntuaciones estéticas LAION-Aesthetic para atractivo visual.

Entrenamiento

Los autores entrenaron FullDiT utilizando un modelo de difusión de texto a vídeo interno (no divulgado) que contiene aproximadamente mil millones de parámetros. Eligieron intencionalmente un tamaño de parámetro modesto para mantener la justicia en las comparaciones con métodos anteriores y garantizar la reproducibilidad.

Dado que los vídeos de entrenamiento diferían en longitud y resolución, los autores estandarizaron cada lote reescalando y rellenando los vídeos con una resolución común, muestreando 77 cuadros por secuencia, y utilizando atención aplicada y máscaras de pérdida para optimizar la eficacia del entrenamiento.

El optimizador Adam se utilizó con una tasa de aprendizaje de 1×10−5 a través de un clúster de 64 GPU NVIDIA H800, para un total combinado de 5.120 GB de VRAM (considerando que en las comunidades de síntesis de entusiastas, 24GB en una RTX 3090 todavía se considera un estándar de lujo).

El modelo se entrenó durante aproximadamente 32.000 pasos, incorporando hasta tres identidades por vídeo, junto con 20 cuadros de condiciones de cámara y 21 cuadros de condiciones de profundidad, ambos muestreados uniformemente de los 77 cuadros totales.

Para la inferencia, el modelo generó vídeos a una resolución de 384×672 píxeles (aproximadamente cinco segundos a 15 cuadros por segundo) con 50 pasos de inferencia de difusión y una escala de orientación de clasificador libre de cinco.

Métodos Anteriores

Para la evaluación de cámara a vídeo, los autores compararon FullDiT con MotionCtrl, CameraCtrl y CamI2V, con todos los modelos entrenados utilizando el conjunto de datos RealEstate10k para garantizar la coherencia y la justicia.

En la generación condicionada por identidad, dado que no había modelos multi-identidad comparables de código abierto disponibles, el modelo se benchmarkó contra el modelo ConceptMaster de 1.000 millones de parámetros, utilizando los mismos datos de entrenamiento y arquitectura.

Para las tareas de profundidad a vídeo, se realizaron comparaciones con Ctrl-Adapter y ControlVideo.

Resultados cuantitativos para la generación de vídeo de tarea única. FullDiT se comparó con MotionCtrl, CameraCtrl y CamI2V para la generación de cámara a vídeo; ConceptMaster (versión de 1.000 millones de parámetros) para la generación de identidad a vídeo; y Ctrl-Adapter y ControlVideo para la generación de profundidad a vídeo. Todos los modelos se evaluaron utilizando sus configuraciones predeterminadas. Para la coherencia, se muestrearon uniformemente 16 cuadros de cada método, lo que coincide con la longitud de salida de los modelos anteriores.

Resultados cuantitativos para la generación de vídeo de tarea única. FullDiT se comparó con MotionCtrl, CameraCtrl y CamI2V para la generación de cámara a vídeo; ConceptMaster (versión de 1.000 millones de parámetros) para la generación de identidad a vídeo; y Ctrl-Adapter y ControlVideo para la generación de profundidad a vídeo. Todos los modelos se evaluaron utilizando sus configuraciones predeterminadas. Para la coherencia, se muestrearon uniformemente 16 cuadros de cada método, lo que coincide con la longitud de salida de los modelos anteriores.

Los resultados indican que FullDiT, a pesar de manejar varias señales de acondicionamiento simultáneamente, logró un rendimiento de estado del arte en métricas relacionadas con el control de texto, movimiento de cámara, identidad y profundidad.

En las métricas generales de calidad, el sistema generalmente superó a otros métodos, aunque su suavidad fue ligeramente inferior a la de ConceptMaster. Aquí los autores comentan:

‘La suavidad de FullDiT es ligeramente inferior a la de ConceptMaster, ya que el cálculo de suavidad se basa en la similitud CLIP entre cuadros adyacentes. Dado que FullDiT exhibe una dinámica significativamente mayor en comparación con ConceptMaster, la métrica de suavidad se ve afectada por las grandes variaciones entre cuadros adyacentes.

‘Para la puntuación estética, dado que el modelo de calificación favorece las imágenes en estilo de pintura y ControlVideo generalmente genera vídeos en este estilo, logra una puntuación alta en estética.’

En cuanto a la comparación cualitativa, podría ser preferible referirse a los vídeos de ejemplo en el sitio del proyecto FullDiT, ya que los ejemplos en PDF son inevitablemente estáticos (y también demasiado grandes para reproducirlos aquí).

La primera sección de los resultados cualitativos reproducidos en el PDF. Por favor, refiérase al artículo original para los ejemplos adicionales, que son demasiado extensos para reproducir aquí.

La primera sección de los resultados cualitativos en el PDF. Por favor, refiérase al artículo original para los ejemplos adicionales, que son demasiado extensos para reproducir aquí.

Los autores comentan:

‘FullDiT demuestra una mejor preservación de identidad y genera vídeos con mejor dinámica y calidad visual en comparación con [ConceptMaster]. Dado que ConceptMaster y FullDiT se entrenaron en la misma arquitectura base, esto destaca la efectividad de la inyección de condiciones con atención completa.

‘… Los [otros] resultados demuestran la superioridad en controlabilidad y calidad de generación de FullDiT en comparación con los métodos existentes de profundidad a vídeo y cámara a vídeo.’

Una sección del PDF con ejemplos de la salida de FullDiT con múltiples señales. Por favor, refiérase al artículo original y al sitio del proyecto para ejemplos adicionales.

Una sección del PDF con ejemplos de la salida de FullDiT con múltiples señales. Por favor, refiérase al artículo original y al sitio del proyecto para ejemplos adicionales.

Conclusión

Aunque FullDiT es una incursión emocionante en un tipo más completo de modelo base de vídeo, uno se pregunta si la demanda de instrumentalidades de estilo ControlNet justificará implementar tales características a gran escala, al menos para proyectos de código abierto, que lucharían por obtener la enorme cantidad de potencia de procesamiento de GPU necesaria sin respaldo comercial.

El desafío principal es que utilizar sistemas como Depth y Pose generalmente requiere una familiaridad no trivial con interfaces de usuario relativamente complejas como ComfyUI. Por lo tanto, parece que un modelo funcional de código abierto de este tipo es más probable que sea desarrollado por un grupo de empresas de efectos visuales más pequeñas que carecen del dinero (o la voluntad, dado que tales sistemas se vuelven rápidamente obsoletos por actualizaciones de modelo) para curar y entrenar dicho modelo detrás de puertas cerradas.

Por otro lado, los sistemas de ‘alquiler de IA’ impulsados por API pueden estar bien motivados para desarrollar métodos interpretativos más simples y fáciles de usar para modelos en los que se han entrenado sistemas de control auxiliares.

Click para reproducir. Controles de profundidad y texto impuestos en una generación de vídeo utilizando FullDiT.

 

* Los autores no especifican ningún modelo base conocido (es decir, SDXL, etc.)

Publicado por primera vez el jueves 27 de marzo de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai