Ángulo de Anderson
Generación de mejores videos de IA a partir de solo dos imágenes

La interpolación de cuadros de video (VFI) es un problema abierto en la investigación de video generativo. El desafío es generar cuadros intermedios entre dos cuadros existentes en una secuencia de video.
Haga clic para reproducir. El marco de trabajo FILM, una colaboración entre Google y la Universidad de Washington, propuso un método de interpolación de cuadros efectivo que sigue siendo popular en esferas aficionadas y profesionales. A la izquierda, podemos ver los dos cuadros separados y distintos superpuestos; en el medio, el ‘cuadro final’; y a la derecha, la síntesis final entre los cuadros. Fuentes: https://film-net.github.io/ y https://arxiv.org/pdf/2202.04901
En general, esta técnica se remonta a más de un siglo y ha sido utilizada en la animación tradicional desde entonces. En ese contexto, los ‘cuadros clave’ maestros serían generados por un artista de animación principal, mientras que el trabajo de ‘tweening’ de cuadros intermedios sería realizado por otros empleados, como una tarea más pedestre.
Antes del auge de la inteligencia artificial generativa, la interpolación de cuadros se utilizó en proyectos como Real-Time Intermediate Flow Estimation (RIFE), Depth-Aware Video Frame Interpolation (DAIN), y el Frame Interpolation for Large Motion (FILM – ver arriba) con el fin de aumentar la tasa de cuadros de un video existente o habilitar efectos de cámara lenta artificialmente generados. Esto se logra dividiendo los cuadros existentes de un clip y generando cuadros intermedios estimados.
La VFI también se utiliza en el desarrollo de mejores códecs de video y, en general, en sistemas basados en flujo óptico (incluidos sistemas generativos), que utilizan el conocimiento anticipado de los cuadros clave para optimizar y dar forma al contenido intersticial que los precede.
Cuadros finales en sistemas de video generativos
Los sistemas generativos modernos como Luma y Kling permiten a los usuarios especificar un cuadro de inicio y un cuadro final, y pueden realizar esta tarea analizando puntos clave en las dos imágenes y estimando una trayectoria entre las dos imágenes.
Como podemos ver en los ejemplos a continuación, proporcionar un ‘cuadro de cierre’ permite al sistema de video generativo (en este caso, Kling) mantener aspectos como la identidad, incluso si los resultados no son perfectos (particularmente con movimientos grandes).
Haga clic para reproducir. Kling es uno de los generadores de video en crecimiento que permiten al usuario especificar un cuadro final. En la mayoría de los casos, el movimiento mínimo conducirá a los resultados más realistas y menos defectuosos. Fuente: https://www.youtube.com/watch?v=8oylqODAaH8
En el ejemplo anterior, la identidad de la persona es consistente entre los dos cuadros clave proporcionados por el usuario, lo que lleva a una generación de video relativamente consistente.
Cuando solo se proporciona el cuadro de inicio, la ventana de atención del sistema generativo no suele ser lo suficientemente grande como para ‘recordar’ cómo se veía la persona al principio del video. Más bien, la identidad probablemente cambiará un poco con cada cuadro, hasta que se pierda toda semejanza. En el ejemplo a continuación, se cargó una imagen de inicio y el movimiento de la persona se guió mediante una llamada de texto:
Haga clic para reproducir. Con ningún cuadro final, Kling solo tiene un pequeño grupo de cuadros anteriores inmediatos para guiar la generación de los siguientes cuadros. En casos donde se necesite algún movimiento significativo, esta atrofia de identidad se vuelve grave.
Podemos ver que la semejanza del actor no es resistente a las instrucciones, ya que el sistema generativo no sabe cómo se vería si estuviera sonriendo, y no está sonriendo en la imagen de semilla (la única referencia disponible).
La mayoría de los clips generativos virales están cuidadosamente seleccionados para restar importancia a estas deficiencias. Sin embargo, el progreso de los sistemas de video generativos temporalmente consistentes puede depender de nuevos desarrollos del sector de investigación con respecto a la interpolación de cuadros, ya que la única alternativa posible es la dependencia de la CGI tradicional como video ‘guía’ (y incluso en este caso, la consistencia de textura y iluminación es actualmente difícil de lograr).
Además, la naturaleza lentamente iterativa de derivar un nuevo cuadro de un pequeño grupo de cuadros recientes hace que sea muy difícil lograr movimientos grandes y audaces. Esto se debe a que un objeto que se mueve rápidamente a través de un cuadro puede transitar de un lado a otro en el espacio de un solo cuadro, contrario a los movimientos más graduales en los que el sistema probablemente haya sido entrenado.
De manera similar, un cambio significativo y audaz de postura puede llevar no solo a un cambio de identidad, sino también a incongruencias vívidas:
Haga clic para reproducir. En este ejemplo de Luma, el movimiento solicitado no parece estar bien representado en los datos de entrenamiento.
Framer
Esto nos lleva a un artículo reciente y interesante de China, que afirma haber logrado un nuevo estado de la técnica en la interpolación de cuadros auténticos – y que es el primero de su tipo en ofrecer interacción de usuario basada en arrastre.
Framer permite al usuario dirigir el movimiento utilizando una interfaz intuitiva basada en arrastre, aunque también tiene un modo ‘automático’. Fuente: https://www.youtube.com/watch?v=4MPGKgn7jRc
Las aplicaciones centradas en arrastre se han vuelto frecuentes en la literatura últimamente, ya que el sector de investigación lucha por proporcionar instrumentalidades para sistemas generativos que no se basen en los resultados bastante crudos obtenidos por llamadas de texto.
El nuevo sistema, titulado Framer, no solo puede seguir el arrastre dirigido por el usuario, sino que también tiene un modo ‘piloto automático’ más convencional. Además de la interpolación convencional, el sistema es capaz de producir simulaciones de tiempo lapse, así como morfing y vistas novedosas de la imagen de entrada.

Cuadros intermedios generados para una simulación de tiempo lapse en Framer. Fuente: https://arxiv.org/pdf/2410.18978
En cuanto a la producción de vistas novedosas, Framer se cruza un poco en el territorio de los Campos de Radiación Neural (NeRF) – aunque requiere solo dos imágenes, mientras que NeRF generalmente requiere seis o más vistas de entrada de imagen.
En las pruebas, Framer, que se basa en el modelo de video generativo de difusión de video estable de Stability.ai, fue capaz de superar a los enfoques rivales aproximados en un estudio de usuario.
En el momento de la redacción, el código está programado para ser lanzado en GitHub. Las muestras de video (de las que se derivan las imágenes anteriores) están disponibles en el sitio del proyecto, y los investigadores también han lanzado un video de YouTube.
El nuevo artículo se titula Framer: Interpolación de cuadros interactiva, y proviene de nueve investigadores de la Universidad de Zhejiang y el Grupo Ant respaldado por Alibaba.
Método
Framer utiliza la interpolación basada en puntos clave en cualquiera de sus dos modalidades, donde la imagen de entrada se evalúa para la topología básica, y se asignan puntos ‘móviles’ según sea necesario. En efecto, estos puntos son equivalentes a los puntos de referencia faciales en los sistemas basados en ID, pero se generalizan a cualquier superficie.
Los investigadores ajustaron la Difusión de Video Estable (SVD) en el conjunto de datos OpenVid-1M, agregando una capacidad de síntesis de cuadro final adicional. Esto facilita un mecanismo de control de trayectoria (arriba a la derecha en la imagen de esquema a continuación) que puede evaluar una ruta hacia el cuadro final (o hacia atrás desde él).

Esquema para Framer.
Con respecto a la adición de la condición de cuadro final, los autores declaran:
‘Para preservar el conocimiento visual previo del SVD preentrenado tanto como sea posible, seguimos el paradigma de condicionamiento del SVD e inyectamos las condiciones del cuadro final en el espacio latente y el espacio semántico, respectivamente.
‘En particular, concatenamos la característica latente codificada por VAE del primer [cuadro] con la característica latente ruidosa del primer cuadro, como se hizo en SVD. Además, concatenamos la característica latente del cuadro final, zn, con la característica latente ruidosa del cuadro final, considerando que las condiciones y las características latentes ruidosas correspondientes están alineadas espacialmente.
‘Además, extraemos la incrustación de imagen de CLIP del primer y último cuadro por separado y las concatenamos para la inyección de características de atención cruzada.’
Para la funcionalidad basada en arrastre, el módulo de trayectoria aprovecha el marco CoTracker liderado por Meta Ai, que evalúa múltiples rutas posibles por delante. Estos se reducen a entre 1-10 trayectorias posibles.
Las coordenadas de puntos obtenidas se transforman a continuación a través de una metodología inspirada en las arquitecturas DragNUWA y DragAnything. Esto obtiene un mapa de calor gaussiano, que individúa las áreas objetivo para el movimiento.
Posteriormente, los datos se alimentan a los mecanismos de condicionamiento de ControlNet, un sistema de conformidad auxiliar originalmente diseñado para la Difusión Estable, y desde entonces adaptado a otras arquitecturas.
Para el modo de piloto automático, la coincidencia de características se logra inicialmente a través de SIFT, que interpreta una trayectoria que luego se puede pasar a un mecanismo de actualización automática inspirado en DragGAN y DragDiffusion.

Esquema para la estimación de la trayectoria de puntos en Framer.
Datos y pruebas
Para el ajuste fino de Framer, la atención espacial y los bloques residuales se congelaron, y solo se afectaron las capas de atención temporal y los bloques residuales.
El modelo se entrenó durante 10,000 iteraciones bajo AdamW, a una tasa de aprendizaje de 1e-4, y un tamaño de lote de 16. El entrenamiento se llevó a cabo en 16 GPU NVIDIA A100.
Como los enfoques anteriores para el problema no ofrecen edición basada en arrastre, los investigadores optaron por comparar el modo de piloto automático de Framer con la funcionalidad estándar de las ofertas anteriores.
Los marcos probados para la categoría de sistemas de generación de video de difusión actuales fueron LDMVFI; Dynamic Crafter; y SVDKFI. Para los sistemas de video ‘tradicionales’, los marcos rivales fueron AMT; RIFE; FLAVR; y el mencionado FILM.
Además del estudio de usuario, se realizaron pruebas sobre los conjuntos de datos DAVIS y UCF101.
Las pruebas cualitativas solo pueden evaluarse mediante las facultades objetivas del equipo de investigación y mediante estudios de usuario. Sin embargo, el artículo señala que las métricas cuantitativas tradicionales son en gran medida inadecuadas para la proposición en cuestión:
‘Las métricas de reconstrucción como PSNR, SSIM y LPIPS no capturan con precisión la calidad de los cuadros interpolados, ya que penalizan otros resultados de interpolación plausibles que no están alineados con el pixel con el video original.
‘Si bien las métricas de generación como FID ofrecen alguna mejora, todavía no alcanzan la suficiencia, ya que no tienen en cuenta la consistencia temporal y evalúan los cuadros en aislamiento.’
A pesar de esto, los investigadores realizaron pruebas cualitativas con varias métricas populares:

Resultados cuantitativos para Framer vs. sistemas rivales.
Los autores señalan que, a pesar de tener las probabilidades en su contra, Framer todavía logra la mejor puntuación FVD entre los métodos probados.
A continuación se presentan los resultados de muestra del artículo para una comparación cualitativa:

Comparación cualitativa con enfoques anteriores. Consulte el artículo para una mejor resolución, así como los resultados de video en https://www.youtube.com/watch?v=4MPGKgn7jRc.
Los autores comentan:
‘Nuestro método produce texturas significativamente más claras y un movimiento natural en comparación con las técnicas de interpolación existentes. Funciona especialmente bien en escenarios con diferencias sustanciales entre los cuadros de entrada, donde los métodos tradicionales a menudo fallan al interpolar el contenido con precisión.
‘En comparación con otros métodos de difusión, como LDMVFI y SVDKFI, Framer demuestra una mayor adaptabilidad a casos desafiantes y ofrece un mejor control.’
Para el estudio de usuario, los investigadores reunieron a 20 participantes, quienes evaluaron 100 resultados de video aleatorizados de los diversos métodos probados. Así, se obtuvieron 1000 calificaciones, evaluando las ofertas más ‘realistas’:

Resultados del estudio de usuario.
Como se puede ver en el gráfico anterior, los usuarios favorecieron abrumadoramente los resultados de Framer.
El video de YouTube acompañante del proyecto describe algunos de los otros usos potenciales para Framer, incluido el morfing y el entre cuadros de dibujos animados – donde comenzó todo el concepto.
Conclusión
Es difícil exagerar la importancia de este desafío en la actualidad para la tarea de generación de video basada en IA. Hasta la fecha, las soluciones más antiguas como FILM y EbSynth (no IA) han sido utilizadas por comunidades tanto aficionadas como profesionales para la interpolación entre cuadros; pero estas soluciones vienen con limitaciones notables.
Debido a la selección deshonesta de los videos de ejemplo oficiales para los nuevos marcos T2V, existe una gran concepción errónea pública de que los sistemas de aprendizaje automático pueden inferir con precisión la geometría en movimiento sin recurrir a mecanismos de orientación como los modelos morfables 3D (3DMM) o otros enfoques auxiliares como LoRAs.
Para ser honestos, la interpolación en sí, incluso si se pudiera ejecutar perfectamente, solo constituye un ‘hack’ o truco para este problema. Sin embargo, dado que a menudo es más fácil producir dos imágenes de cuadros bien alineadas que efectuar la orientación a través de llamadas de texto o la gama actual de alternativas, es bueno ver el progreso iterativo en una versión basada en IA de este método más antiguo.
Publicado por primera vez el martes 29 de octubre de 2024












