Modelos y plataformas de IA
Puenteando el ‘Espacio entre’ en Video Generativo

Nueva investigación de China está ofreciendo un método mejorado para interpolación de la brecha entre dos fotogramas de video temporalmente distantes – uno de los desafíos más cruciales en la carrera actual hacia la realidad para video de inteligencia artificial generativa, así como para la compresión de codec de video.
En el video de ejemplo a continuación, vemos en la columna más a la izquierda un fotograma ‘inicial’ (arriba a la izquierda) y un fotograma ‘final’ (abajo a la izquierda). La tarea que deben realizar los sistemas en competencia es adivinar cómo el sujeto en las dos imágenes se movería del fotograma A al fotograma B. En animación, este proceso se llama tweening, y se remonta a la era del cine mudo.
Click para reproducir. En la primera columna, a la izquierda, vemos el fotograma inicial y final propuestos. En la columna del medio y en la parte superior de la tercera columna (a la derecha), vemos tres enfoques anteriores para este desafío. Abajo a la derecha, vemos que el nuevo método obtiene un resultado mucho más convincente al proporcionar los fotogramas intermedios. Fuente: https://fcvg-inbetween.github.io/
El nuevo método propuesto por los investigadores chinos se llama Generación de Video con Condiciones de Fotograma (FCVG), y sus resultados se pueden ver en la parte inferior derecha del video anterior, proporcionando una transición suave y lógica de un fotograma fijo a otro.
En contraste, podemos ver que uno de los marcos más celebrados para la interpolación de video, el proyecto Frame Interpolation for Large Motion (FILM) de Google, lucha, como muchos otros intentos similares luchan, para interpretar grandes y audaces movimientos.
Los otros dos marcos rivales visualizados en el video, Fusión de Reversión de Tiempo (TRF) y Interpolación Generativa (GI), proporcionan una interpretación menos sesgada, pero han creado movimientos de baile frenéticos y cómicos, ninguno de los cuales respeta la lógica implícita de los dos fotogramas suministrados.
Click para reproducir. Dos soluciones imperfectas al problema de tweening. Izquierda, FILM trata los dos fotogramas como simples objetivos de morfología. Derecha, TRF sabe que some forma de baile debe ser insertada, pero se encuentra con una solución impracticable que demuestra anomalías anatómicas.
Arriba a la izquierda, podemos observar más de cerca cómo FILM se acerca al problema. Aunque FILM fue diseñado para poder manejar grandes movimientos, en contraste con los enfoques anteriores basados en flujo óptico, todavía carece de una comprensión semántica de lo que debería estar sucediendo entre los dos fotogramas clave, y simplemente realiza una morfología de estilo de los años 80/90 entre los fotogramas. FILM no tiene una arquitectura semántica, como un Modelo de Difusión Latente como Difusión Estable, para ayudar a crear un puente apropiado entre los fotogramas.
En el lado derecho, en el video anterior, vemos el esfuerzo de TRF, donde Difusión de Video Estable (SVD) se utiliza para adivinar de manera más inteligente cómo podría ser un movimiento de baile apropiado para los dos fotogramas suministrados por el usuario – pero ha hecho una aproximación audaz e implausible.
FCVG, visto a continuación, hace un trabajo más creíble al adivinar el movimiento y el contenido entre los dos fotogramas:
Click para reproducir. FCVG mejora los enfoques anteriores, pero está lejos de ser perfecto.
Aún hay artefactos, como la morfología no deseada de manos y la identidad facial, pero esta versión es superficialmente la más plausible – y cualquier mejora en el estado actual del arte debe considerarse frente a la enorme dificultad que la tarea propone; y el gran obstáculo que el desafío presenta para el futuro del video generado por inteligencia artificial.
Por qué la Interpolación es Importante
Como hemos señalado anteriormente, la capacidad de llenar de manera plausible el contenido de video entre dos fotogramas suministrados por el usuario es una de las mejores formas de mantener la coherencia temporal en video generativo, ya que dos fotos reales y consecutivas de la misma persona contendrán naturalmente elementos coherentes como ropa, cabello y entorno.
Cuando solo se utiliza un fotograma inicial, la ventana de atención limitada de un sistema generativo, que a menudo solo tiene en cuenta los fotogramas cercanos, tenderá a ‘evolucionar’ facetas del tema, hasta que (por ejemplo) un hombre se convierte en otro hombre (o una mujer), o resulta tener ropa ‘morfante’ – entre muchas otras distracciones que se generan comúnmente en sistemas de video a texto abierto y en la mayoría de las soluciones pagas, como Kling:
Click para reproducir. Alimentando los dos fotogramas de fuente reales del nuevo documento en Kling, con el prompt ‘Un hombre bailando en un techo’, no resultó en una solución ideal. Aunque Kling 1.6 estaba disponible en el momento de la creación, V1.5 es la última que admite fotogramas de inicio y fin suministrados por el usuario. Fuente: https://klingai.com/
¿Ya se ha Resuelto el Problema?
En contraste, algunos sistemas comerciales, de código cerrado y propietarios parecen estar haciendo mejor con el problema – notablemente RunwayML, que pudo crear una interpolación muy plausible de los dos fotogramas de fuente:
Click para reproducir. La interpolación basada en difusión de RunwayML es muy efectiva. Fuente: https://app.runwayml.com/
Repitiendo el ejercicio, RunwayML produjo un segundo resultado igualmente creíble:
Click para reproducir. La segunda ejecución de la secuencia de RunwayML.
Un problema aquí es que no podemos aprender nada sobre los desafíos involucrados, ni avanzar en el estado actual de la técnica de código abierto, a partir de un sistema propietario. No podemos saber si esta representación superior se ha logrado mediante enfoques arquitectónicos únicos, datos (o métodos de curación de datos como filtrado y anotación), o cualquier combinación de estos y otras posibles innovaciones de investigación.
En segundo lugar, las empresas más pequeñas, como las de efectos visuales, no pueden depender en el largo plazo de servicios de API de negocio a negocio que podrían potencialmente socavar su planificación logística con un solo aumento de precio – particularmente si un servicio llega a dominar el mercado y, por lo tanto, esté más dispuesto a aumentar los precios.
Cuando los Derechos son Incorrectos
Mucho más importante, si un modelo comercial con buen rendimiento se entrena con datos no licenciados, como parece ser el caso con RunwayML, cualquier empresa que utilice dichos servicios podría arriesgarse a una exposición legal posterior.
Dado que las leyes (y algunos juicios) duran más que los presidentes, y dado que el mercado crucial de EE. UU. es entre los más litigiosos del mundo, la tendencia actual hacia una mayor supervisión legislativa para los datos de entrenamiento de inteligencia artificial parece probable que sobreviva el ‘toque ligero’ del próximo mandato presidencial de Donald Trump.
Por lo tanto, el sector de investigación de visión por computadora tendrá que abordar este problema de la manera difícil, para que cualquier solución emergente pueda perdurar en el largo plazo.
FCVG
El nuevo método de China se presenta en un documento titulado Generación de Video entre Fotogramas a través de Generación de Video con Condiciones de Fotograma, y proviene de cinco investigadores de los Institutos de Tecnología de Harbin y la Universidad de Tianjin.
FCVG resuelve el problema de ambigüedad en la tarea de interpolación al utilizar condiciones de fotograma, junto con un marco que delinea bordes en los fotogramas de inicio y fin suministrados por el usuario, lo que ayuda al proceso a mantener una pista más consistente de las transiciones entre fotogramas individuales, y también el efecto general.
La condición de fotograma implica dividir la creación de fotogramas intermedios en subtareas, en lugar de intentar llenar un vacío semántico muy grande entre dos fotogramas (y cuanto más larga sea la salida de video solicitada, mayor será la distancia semántica).
En el gráfico a continuación, del documento, los autores comparan el método de reversión de tiempo (TRF) con el suyo. TRF crea dos caminos de generación de video utilizando un modelo de imagen a video preentrenado (SVD). Uno es un camino ‘hacia adelante’ condicionado en el fotograma de inicio, y el otro un camino ‘hacia atrás’ condicionado en el fotograma de fin. Ambos caminos comienzan desde el mismo ruido aleatorio. Esto se ilustra en la parte izquierda de la imagen a continuación:

Comparación de enfoques anteriores a FCVG. Fuente: https://arxiv.org/pdf/2412.11755
Los autores afirman que FCVG es una mejora sobre los métodos de reversión de tiempo porque reduce la ambigüedad en la generación de video, al dar a cada fotograma su propia condición explícita, lo que conduce a una salida más estable y coherente.
Los métodos de reversión de tiempo como TRF, afirma el documento, pueden llevar a ambigüedad, porque los caminos de generación hacia adelante y hacia atrás pueden divergir, causando desalineación o incoherencias. FCVG aborda esto al utilizar condiciones de fotograma derivadas de líneas coincidentes entre los fotogramas de inicio y fin (en la parte inferior derecha de la imagen anterior), que guían el proceso de generación.
Click para reproducir. Otra comparación de la página del proyecto FCVG.
La reversión de tiempo permite el uso de modelos de generación de video preentrenados para interpolación, pero tiene algunas desventajas. El movimiento generado por los modelos de imagen a video es diverso en lugar de estable. Si bien esto es útil para tareas de imagen a video (I2V) puras, crea ambigüedad y conduce a caminos de video mal alineados o incoherentes.
La reversión de tiempo también requiere un ajuste laborioso de hiperparámetros, como la tasa de fotogramas para cada video generado. Además, algunas de las técnicas involucradas en la reversión de tiempo para reducir la ambigüedad ralentizan significativamente la inferencia, aumentando los tiempos de procesamiento.
Método
Los autores observan que si el primer problema (diversidad versus estabilidad) se puede resolver, es probable que todos los problemas posteriores se resuelvan por sí solos. Esto se ha intentado en ofertas anteriores como la mencionada GI, y también ViBiDSampler.
El documento establece:
‘Sin embargo, [aún] existe una estocasticidad considerable entre estos caminos, lo que limita la efectividad de estos métodos para manejar escenarios que involucran grandes movimientos, como cambios rápidos en las poses humanas. La ambigüedad en el camino de interpolación se debe principalmente a condiciones insuficientes para los fotogramas intermedios, ya que dos imágenes de entrada solo proporcionan condiciones para los fotogramas de inicio y fin.
‘Por lo tanto, [proponemos] ofrecer una condición explícita para cada fotograma, lo que alivia significativamente la ambigüedad del camino de interpolación.’
Podemos ver los conceptos básicos de FCVG en acción en el esquema a continuación. FCVG genera una secuencia de fotogramas de video que comienzan y terminan de manera coherente con dos fotogramas de entrada. Esto garantiza que los fotogramas sean temporalmente estables al proporcionar condiciones de fotograma específicas para el proceso de generación de video.

Esquema para la inferencia de FCVG.
En esta reevaluación del enfoque de reversión de tiempo, el método combina información de ambos sentidos, adelante y atrás, mezclándolos para crear transiciones suaves. A través de un proceso iterativo, el modelo refina gradualmente las entradas ruidosas hasta que se produzca el conjunto final de fotogramas intermedios.
La siguiente etapa implica el uso del modelo de coincidencia de líneas preentrenado GlueStick, que crea correspondencias entre los dos fotogramas de inicio y fin calculados, con el uso opcional de poses esqueléticas para guiar el modelo, a través del modelo de Difusión de Video Estable.

GlueStick deriva líneas de formas interpretadas. Estas líneas proporcionan anclajes coincidentes entre los fotogramas de inicio y fin en FCVG*.
Los autores señalan:
‘Empíricamente encontramos que la interpolación lineal es suficiente para la mayoría de los casos para garantizar la estabilidad temporal en los videos intermedios, y nuestro método permite a los usuarios especificar caminos de interpolación no lineales para generar videos deseables.’

Flujo de trabajo para establecer condiciones de fotograma hacia adelante y hacia atrás. Podemos ver los colores coincidentes que mantienen el contenido coherente a medida que se desarrolla la animación.
Para inyectar las condiciones de fotograma obtenidas en SVD, FCVG utiliza el método desarrollado para la iniciativa ControlNeXt de 2024. En este proceso, las condiciones de control se codifican inicialmente mediante múltiples bloques ResNet, antes de la normalización cruzada entre las ramas de control y SVD del flujo de trabajo.
Un pequeño conjunto de videos se utiliza para ajustar el modelo SVD, con la mayoría de los parámetros del modelo congelados.
‘Las [limitaciones anteriores] se han resuelto en gran medida en FCVG: (i) Al especificar explícitamente la condición para cada fotograma, la ambigüedad entre los caminos hacia adelante y hacia atrás se alivia significativamente; (ii) Solo se introduce un parámetro ajustable, mientras que se mantienen los hiperparámetros en SVD como predeterminados, lo que produce resultados favorables en la mayoría de los escenarios; (iii) Una fusión promedio simple, sin reinyección de ruido, es adecuada en FCVG, y los pasos de inferencia se pueden reducir sustancialmente en un 50% en comparación con [GI].’

Esquema general para inyectar condiciones de fotograma en Difusión de Video Estable para FCVG.
Datos y Pruebas
Para probar el sistema, los investigadores curaron un conjunto de datos que presentaba escenas diversas, incluyendo entornos al aire libre, poses humanas y ubicaciones interiores, incluyendo movimientos como el movimiento de la cámara, acciones de baile y expresiones faciales, entre otros. Los 524 clips seleccionados se tomaron de los conjuntos de datos DAVIS y RealEstate10k. Este conjunto se complementó con videos de alta tasa de fotogramas obtenidos de Pexels. El conjunto curado se dividió 4:1 entre ajuste fino y prueba.
Las métricas utilizadas fueron Métricas de Similitud Percibida Aprendidas (LPIPS); Distancia de Inception de Fréchet (FID); Distancia de Video de Fréchet (FVD); VBench; y Distancia de Movimiento de Video de Fréchet.
Los autores señalan que ninguna de estas métricas se adapta bien para estimar la estabilidad temporal, y nos remiten a los videos en la página del proyecto FCVG.
Además del uso de GlueStick para la coincidencia de líneas, DWPose se utilizó para estimar las poses humanas.
El ajuste fino se realizó durante 70,000 iteraciones bajo el optimizador AdamW en una GPU NVIDIA A800, con una tasa de aprendizaje de 1×10-6, con fotogramas recortados a parches de 512×320.
Los marcos rivales anteriores que se probaron fueron FILM, GI, TRF y DynamiCrafter.
Para la evaluación cuantitativa, las brechas de fotogramas abordadas variaron entre 12 y 23.

Resultados cuantitativos en comparación con marcos anteriores.
En cuanto a estos resultados, el documento observa:
‘[Nuestro] método logra el mejor rendimiento entre cuatro enfoques generativos en todas las métricas. En cuanto a la comparación de LPIPS con FILM, nuestro FCVG es ligeramente inferior, mientras que demuestra un rendimiento superior en otras métricas. Considerando la ausencia de información temporal en LPIPS, puede ser más apropiado priorizar otras métricas y la observación visual.
‘Además, al comparar los resultados bajo diferentes brechas de fotogramas, FILM puede funcionar bien cuando la brecha es pequeña, mientras que los métodos generativos son más adecuados para brechas grandes. Entre estos métodos generativos, nuestro FCVG exhibe una superioridad significativa debido a sus condiciones de fotograma explícitas.’
Para las pruebas cualitativas, los autores produjeron los videos vistos en la página del proyecto (algunos incrustados en este artículo), y resultados estáticos y animados† en el documento PDF,

Resultados estáticos de muestra del documento. Por favor, refiérase al PDF de fuente para una mejor resolución, y tenga en cuenta que el PDF contiene animaciones que se pueden reproducir en aplicaciones que admiten esta función.
Los autores comentan:
‘Mientras que FILM produce resultados de interpolación suaves para escenarios de movimiento pequeño, lucha con movimientos a gran escala debido a las limitaciones inherentes del flujo óptico, lo que resulta en artefactos notables como el movimiento de fondo y las manos (en el primer caso).
‘Los modelos generativos como TRF y GI sufren de ambigüedades en los caminos de fusión, lo que lleva a movimientos intermedios inestables, particularmente evidentes en escenas complejas que involucran movimiento humano y de objetos.
‘En contraste, nuestro método entrega consistentemente resultados satisfactorios en varios escenarios.’Incluso cuando hay una occlusión significativa (en el segundo caso y el sexto caso), nuestro método puede capturar un movimiento razonable. Además, nuestro enfoque exhibe robustez para acciones humanas complejas (en el último caso).’
Los autores también encontraron que FCVG se generaliza de manera inusual a videos de estilo de animación:
Click para reproducir. FCVG produce resultados muy convincentes para la animación de estilo de caricatura.
Conclusión
FCVG representa al menos una mejora incremental para el estado actual del arte en la interpolación de fotogramas en un contexto no propietario. Los autores han hecho que el código para el trabajo esté disponible en GitHub, aunque el conjunto de datos asociado no se ha lanzado en el momento de la redacción.
Si las soluciones comerciales propietarias superan a los esfuerzos de código abierto mediante el uso de datos no licenciados de la web, parece haber un futuro limitado en tal enfoque, al menos para uso comercial; los riesgos son simplemente demasiado grandes.
Por lo tanto, incluso si la escena de código abierto se queda atrás de la impresionante demostración de los líderes actuales del mercado, es, argumentablemente, la tortuga que puede superar a la liebre en la línea de meta.
* Fuente: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf
† Requiere Acrobat Reader, Okular, o cualquier otro lector de PDF que pueda reproducir animaciones incrustadas en PDF.
Publicado por primera vez el viernes 20 de diciembre de 2024












