Ángulo de Anderson

El camino hacia una mejor edición de video basada en IA

mm
Añade Unite.AI a tus fuentes preferidas en Google
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

El sector de investigación de síntesis de video/imagen regularmente produce arquitecturas de edición de video, y en los últimos nueve meses, las salidas de este tipo han sido aún más frecuentes. Dicho esto, la mayoría de ellas representan solo avances incrementales en el estado del arte, ya que los desafíos fundamentales son sustanciales.

No obstante, una nueva colaboración entre China y Japón esta semana ha producido algunos ejemplos que merecen un examen más cercano del enfoque, aunque no necesariamente sea un trabajo fundamental.

En el video a continuación (del sitio web del proyecto asociado con el documento, que, advertimos, puede sobrecargar su navegador) vemos que, aunque las capacidades de deepfaking del sistema son inexistentes en la configuración actual, el sistema hace un buen trabajo al alterar de manera plausible y significativa la identidad de la joven en la imagen, basándose en una máscara de video (en la esquina inferior izquierda):

Haga clic para reproducir. Basándose en la máscara de segmentación semántica visualizada en la esquina inferior izquierda, la mujer original (en la esquina superior izquierda) se transforma en una identidad notablemente diferente, aunque este proceso no logra el intercambio de identidad indicado en la solicitud. Fuente: https://yxbian23.github.io/project/video-painter/ (Tenga en cuenta que, en el momento de la redacción, este sitio web con reproducción automática y lleno de videos tendía a bloquear mi navegador). Consulte los videos originales, si puede acceder a ellos, para obtener mejor resolución y detalle, o vea los ejemplos en el video de presentación del proyecto en https://www.youtube.com/watch?v=HYzNfsD3A0s

La edición de máscara de este tipo está bien establecida en modelos de difusión latente estáticos, utilizando herramientas como ControlNet. Sin embargo, mantener la coherencia de fondo en video es mucho más desafiante, incluso cuando las áreas enmascaradas proporcionan al modelo flexibilidad creativa, como se muestra a continuación:

Haga clic para reproducir. Un cambio de especie, con el nuevo método VideoPainter. Por favor, refiérate a los videos de origen, si puedes acceder a ellos, para obtener una mejor resolución y detalle, o consulta los ejemplos en el video de presentación del proyecto en https://www.youtube.com/watch?v=HYzNfsD3A0s

Los autores del nuevo trabajo consideran su método en relación con la arquitectura BrushNet de Tencent (que cubrimos el año pasado) y con ControlNet, ambas tratan de una arquitectura de doble rama capaz de aislar la generación de primer plano y fondo.

Sin embargo, aplicar este método directamente al enfoque de Transformadores de Difusión (DiT) propuesto por Sora de OpenAI, plantea desafíos particulares, como señalan los autores:

‘Aplicar directamente la arquitectura de BrushNet y ControlNet a los DiT de video presenta varios desafíos. En primer lugar, dada la sólida base generativa de los DiT de video y el gran tamaño del modelo, replicar toda o la mitad de su arquitectura principal como codificador de contexto sería innecesario y prohibitivamente costoso en términos computacionales.

‘En segundo lugar, a diferencia de la rama de control puramente convolucional de BrushNet, los tokens de DiT en las regiones enmascaradas contienen inherentemente información de fondo debido a la atención global, lo que complica la distinción entre regiones enmascaradas y no enmascaradas en las arquitecturas DiT.

‘Por último, ControlNet carece de inyección de características en todas las capas, lo que obstaculiza el control preciso del fondo en las tareas de inpainting.’

Por lo tanto, los investigadores han desarrollado un enfoque de plug-and-play en forma de un marco de doble rama titulado VideoPainter.

VideoPainter ofrece un marco de inpainting de video de doble rama que mejora los DiT preentrenados con un codificador de contexto ligero. Este codificador cuenta solo con el 6% de los parámetros de la arquitectura principal, lo que, según los autores, hace que el enfoque sea más eficiente que los métodos convencionales.

El modelo propone tres innovaciones clave: un codificador de contexto de dos capas optimizado para la orientación de fondo eficiente; un sistema de integración de características selectivo de máscara que separa tokens enmascarados y no enmascarados; y una técnica de muestreo de ID de región de inpainting que mantiene la coherencia de identidad a lo largo de secuencias de video largas.

Al congelar tanto el DiT preentrenado como el codificador de contexto mientras se introduce un ID-Adapter, VideoPainter garantiza que los tokens de región de inpainting de los clips anteriores persistan a lo largo de un video, reduciendo el parpadeo y las incoherencias.

El marco también está diseñado para ser compatible con plug-and-play, lo que permite a los usuarios integrarlo sin problemas en flujos de trabajo de generación y edición de video existentes.

Para respaldar el trabajo, que utiliza CogVideo-5B-I2V como su motor generativo, los autores curaron lo que afirman es el conjunto de datos de inpainting de video más grande hasta la fecha. Titulado VPData, la colección consta de más de 390,000 clips, para una duración total de video de más de 886 horas. También desarrollaron un marco de benchmarking relacionado titulado VPBench.

Haga clic para reproducir. Desde los ejemplos del sitio web del proyecto, vemos las capacidades de segmentación impulsadas por la colección VPData y el conjunto de pruebas VPBench. Por favor, refiérate a los videos de origen, si puedes acceder a ellos, para obtener una mejor resolución y detalle, o consulta los ejemplos en el video de presentación del proyecto en https://www.youtube.com/watch?v=HYzNfsD3A0s

El nuevo trabajo se titula VideoPainter: Inpainting y edición de video de cualquier longitud con control de contexto plug-and-play, y proviene de siete autores en el laboratorio ARC de Tencent, la Universidad China de Hong Kong, la Universidad de Tokio y la Universidad de Macao.

Además del sitio web del proyecto mencionado anteriormente, los autores también han lanzado una visión general en YouTube más accesible, así como una página en Hugging Face.

Método

La tubería de recopilación de datos para VPData consiste en recopilación, anotación, división, selección y subtítulos:

Esquema del proceso de construcción del conjunto de datos. Fuente: https://arxiv.org/pdf/2503.05639

Esquema del proceso de construcción del conjunto de datos. Fuente: https://arxiv.org/pdf/2503.05639

Las colecciones de origen utilizadas para esta compilación provinieron de Videvo y Pexels, con una captura inicial de alrededor de 450,000 videos.

Múltiples bibliotecas y métodos contribuyeron a la etapa de preprocesamiento: el marco Recognize Anything se utilizó para proporcionar etiquetado de video de conjunto abierto, encargado de identificar objetos principales; Grounding Dino se utilizó para la detección de cuadros delimitadores alrededor de los objetos identificados; y el marco Segment Anything Model 2 (SAM 2) se utilizó para refinar estas selecciones burdas en máscaras de segmentación de alta calidad.

Para gestionar las transiciones de escena y garantizar la coherencia en el inpainting de video, VideoPainter utiliza PySceneDetect para identificar y segmentar clips en puntos de interrupción naturales, evitando los cambios disruptivos a menudo causados por el seguimiento del mismo objeto desde múltiples ángulos. Los clips se dividieron en intervalos de 10 segundos, y cualquier cosa más corta que 6 segundos se descartó.

Para la selección de datos, se aplicaron tres criterios de filtrado: calidad estética, evaluada con el Predictor de puntuación estética Laion; fuerza de movimiento, medida a través de flujo óptico utilizando RAFT; y seguridad de contenido, verificada a través del verificador de seguridad de Stable Diffusion.

Una de las limitaciones principales en los conjuntos de datos de segmentación de video existentes es la falta de anotaciones textuales detalladas, que son cruciales para guiar los modelos generativos:

Los investigadores enfatizan la falta de subtitulación de video en colecciones comparables.

Los investigadores enfatizan la falta de subtitulación de video en colecciones comparables.

Por lo tanto, el proceso de curación de datos de VideoPainter incorpora modelos de visión-lenguaje líderes, incluidos CogVLM2 y Chat GPT-4o para generar subtítulos basados en fotogramas y descripciones detalladas de regiones enmascaradas.

VideoPainter mejora los DiT preentrenados al introducir un codificador de contexto ligero personalizado que separa la extracción de contexto de fondo de la generación de primer plano, visible en la esquina superior derecha del esquema ilustrativo a continuación:

Esquema conceptual para VideoPainter. El codificador de contexto de VideoPainter procesa latentes ruidosos, máscaras reducidas y latentes de video enmascarados a través de VAE, integrando solo tokens de fondo en el DiT preentrenado para evitar ambigüedad. El adaptador de muestreo de ID garantiza la coherencia de identidad al concatenar tokens de región enmascarada durante el entrenamiento y muestrearlos de clips anteriores durante la inferencia.

Esquema conceptual para VideoPainter. El codificador de contexto de VideoPainter procesa latentes ruidosos, máscaras reducidas y latentes de video enmascarados a través de VAE, integrando solo tokens de fondo en el DiT preentrenado para evitar ambigüedad. El adaptador de muestreo de ID garantiza la coherencia de identidad al concatenar tokens de región enmascarada durante el entrenamiento y muestrearlos de clips anteriores durante la inferencia.

En lugar de sobrecargar la arquitectura principal con procesamiento redundante, este codificador opera en una entrada optimizada: una combinación de latente ruidoso, latente de video enmascarado (extraído a través de un autoencoder variacional, o VAE) y máscaras reducidas.

El latente ruidoso proporciona contexto de generación, y el latente de video enmascarado se alinea con la distribución existente del DiT, con el objetivo de mejorar la compatibilidad.

En lugar de duplicar grandes secciones del modelo, lo que los autores afirman que ha ocurrido en trabajos anteriores, VideoPainter integra solo las dos primeras capas del DiT. Estas características extraídas se reintroducen en el DiT congelado de manera estructurada y en grupos: las características de las capas iniciales informan la primera mitad del modelo, mientras que las características posteriores refinan la segunda mitad.

Además, un mecanismo selectivo de tokens garantiza que solo se reintegren características relevantes para el fondo, evitando la confusión entre regiones enmascaradas y no enmascaradas. Este enfoque, según los autores, permite que VideoPainter mantenga una alta fidelidad en la preservación de fondo mientras mejora la eficiencia de inpainting de primer plano.

Los autores señalan que el método que proponen admite diversos métodos de estilización, incluido el más popular, Low Rank Adaptation (LoRA).

Datos y pruebas

VideoPainter se entrenó utilizando el modelo CogVideo-5B-I2V, junto con su equivalente de texto a video. El corpus VPData curado se utilizó a 480x720px, a una tasa de aprendizaje de 1×10-5.

El adaptador de muestreo de ID se entrenó durante 2,000 pasos, y el codificador de contexto durante 80,000 pasos, ambos utilizando el optimizador AdamW. El entrenamiento se llevó a cabo en dos etapas utilizando 64 GPU NVIDIA V100 formidables (aunque el documento no especifica si tenían 16GB o 32GB de VRAM).

Para la evaluación comparativa, se utilizó Davis para máscaras aleatorias, y el propio VPBench de los autores para máscaras de segmentación.

El conjunto de datos VPBench presenta objetos, animales, humanos, paisajes y diversas tareas, y cubre cuatro acciones: agregar, eliminar, cambiar y intercambiar. La colección cuenta con 45 videos de 6 segundos, y nueve videos que duran, en promedio, 30 segundos.

Se utilizaron ocho métricas para el proceso. Para la preservación de la región enmascarada, los autores utilizaron Proporción de señal a ruido pico (PSNR); Métricas de similitud perceptual aprendidas (LPIPS); Índice de similitud estructural (SSIM); y Error absoluto medio (MAE).

Para la alineación de texto, los investigadores utilizaron Similitud CLIP tanto para evaluar la distancia semántica entre el subtítulo del clip y su contenido percibido real, como para evaluar la precisión de las regiones enmascaradas.

Para evaluar la calidad general de los videos de salida, se utilizó Distancia de video Fréchet (FVD).

Para una comparación cuantitativa de inpainting de video, los autores configuraron su sistema contra enfoques anteriores ProPainter, COCOCO y Cog-Inp (CogVideoX). La prueba consistió en inpainting el primer fotograma de un clip utilizando modelos de inpainting de imagen, y luego utilizando un modelo de imagen a video (I2V) para propagar los resultados en una operación de mezcla latente, de acuerdo con un método propuesto por un documento de 2023 de Israel.

Dado que el sitio web del proyecto no es completamente funcional en el momento de la redacción, y dado que el video de YouTube asociado con el proyecto puede no presentar la totalidad de los ejemplos incluidos en el sitio web del proyecto, es bastante difícil localizar ejemplos de video muy específicos de los resultados descritos en el documento. Por lo tanto, mostraremos resultados estáticos parciales presentados en el documento, y cerraremos el artículo con algunos ejemplos de video adicionales que logramos extraer del sitio web del proyecto.

Comparación cuantitativa de VideoPainter vs. ProPainter, COCOCO y Cog-Inp en VPBench (máscaras de segmentación) y Davis (máscaras aleatorias). Las métricas cubren la preservación de la región enmascarada, la alineación de texto y la calidad del video. Rojo = mejor, Azul = segundo mejor.

Comparación cuantitativa de VideoPainter vs. ProPainter, COCOCO y Cog-Inp en VPBench (máscaras de segmentación) y Davis (máscaras aleatorias). Las métricas cubren la preservación de la región enmascarada, la alineación de texto y la calidad del video. Rojo = mejor, Azul = segundo mejor.

Sobre estos resultados cuantitativos, los autores comentan:

‘En el benchmark de segmentación VPBench, ProPainter y COCOCO exhiben el peor rendimiento en la mayoría de las métricas, principalmente debido a la incapacidad para inpainting objetos completamente enmascarados y la dificultad de la arquitectura de una sola red para equilibrar la preservación de fondo y la generación de primer plano, respectivamente.

‘En el benchmark de máscaras aleatorias Davis, ProPainter muestra una mejora al aprovechar la información de fondo parcial. Sin embargo, VideoPainter logra un rendimiento óptimo en segmentación (estándar y larga) y máscaras aleatorias a través de su arquitectura de doble rama que efectivamente desacopla la preservación de fondo y la generación de primer plano.’

Los autores presentan entonces ejemplos estáticos de pruebas cualitativas, de los cuales presentamos una selección a continuación. En todos los casos, nos referimos al lector para que consulte el sitio web del proyecto y el video de YouTube para una mejor resolución.

Una comparación con métodos de inpainting en marcos anteriores.

Una comparación con métodos de inpainting en marcos anteriores.

 

Haga clic para reproducir. Ejemplos concatenados por nosotros desde los videos de ‘resultados’ en el sitio web del proyecto.

En cuanto a esta ronda cualitativa para el inpainting de video, los autores comentan:

‘VideoPainter muestra consistentemente resultados excepcionales en la coherencia de video, calidad y alineación con el subtítulo de texto. Notablemente, ProPainter falla al generar objetos completamente enmascarados porque solo depende de la propagación de píxeles de fondo en lugar de generar.

‘Mientras que COCOCO demuestra funcionalidad básica, falla al mantener la coherencia de ID en regiones sometidas a inpainting (apariencias de barcos inconsistentes y cambios abruptos de terreno) debido a su arquitectura de una sola red que intenta equilibrar la preservación de fondo y la generación de primer plano.

‘Cog-Inp logra resultados básicos de inpainting; sin embargo, la incapacidad de la operación de mezcla para detectar límites de máscara conduce a artefactos significativos.

‘Además, VideoPainter puede generar videos coherentes que exceden un minuto mientras mantiene la coherencia de ID a través de nuestro muestreo de ID.’

Los investigadores también probaron la capacidad de VideoPainter para mejorar los subtítulos y obtener mejores resultados mediante este método, enfrentando el sistema a UniEdit, DiTCtrl y ReVideo.

Resultados de edición de video contra tres enfoques anteriores.

Resultados de edición de video contra tres enfoques anteriores.

Los autores comentan:

‘Para ambos videos estándar y largos en VPBench, VideoPainter logra un rendimiento superior, incluso superando el enfoque de extremo a extremo ReVideo. Este éxito se puede atribuir a su arquitectura de doble rama, que garantiza una excelente preservación de fondo y capacidades de generación de primer plano, manteniendo una alta fidelidad en regiones no editadas mientras garantiza que las regiones editadas se alineen estrechamente con las instrucciones de edición, complementadas por el muestreo de ID de región de inpainting que mantiene la coherencia de ID en videos largos.’

Aunque el documento presenta ejemplos estáticos cualitativos para esta métrica, son poco iluminadores, y nos referimos al lector para que consulte los diversos ejemplos dispersos en los varios videos publicados para este proyecto.

Finalmente, se realizó un estudio de usuario, donde se pidió a treinta usuarios que evaluaran 50 generaciones seleccionadas aleatoriamente del conjunto VPBench y de edición. Los ejemplos destacaron la preservación de fondo, la alineación con el subtítulo y la calidad general del video.

Resultados del estudio de usuario para VideoPainter.

Resultados del estudio de usuario para VideoPainter.

Los autores afirman:

‘VideoPainter superó significativamente las líneas de base existentes, logrando tasas de preferencia más altas en todos los criterios de evaluación en ambas tareas.’

Admiten, sin embargo, que la calidad de las generaciones de VideoPainter depende del modelo base, que puede tener dificultades con movimientos complejos y física; y observan que también se desempeña mal con máscaras de baja calidad o subtítulos mal alineados.

Conclusión

VideoPainter parece ser una adición valiosa a la literatura. Típico de soluciones recientes, sin embargo, tiene demandas computacionales considerables. Además, muchos de los ejemplos elegidos para su presentación en el sitio web del proyecto caen muy lejos de los mejores ejemplos; por lo tanto, sería interesante ver este marco enfrentado a futuras entradas y una gama más amplia de enfoques anteriores.

 

* Es digno de mención que ‘edición de video’ en este sentido no significa ‘ensamblar clips diversos en una secuencia’, que es el significado tradicional de este término; sino más bien cambiar o modificar de alguna manera el contenido interno de clips de video existentes, utilizando técnicas de aprendizaje automático

Publicado por primera vez el lunes 10 de marzo de 2025. Actualizado el sábado 25 de julio de 2026 para reemplazar el video.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai