Ángulo de Anderson
Edición de contenido de video de IA coherente con entrada guiada por texto

Mientras que la comunidad profesional de VFX se siente intrigada, y ocasionalmente un poco amenazada, por las nuevas innovaciones en síntesis de imágenes y videos, la falta de continuidad temporal en la mayoría de los proyectos de edición de video basados en IA los relega a la esfera de lo “psicodélico”, con texturas y estructuras que brillan y cambian rápidamente, efectos inconsistentes y la clase de tecnología tosca que recuerda a la era fotoquímica de los efectos visuales.
Si deseas cambiar algo muy específico en un video que no cae en el ámbito de los deepfakes (es decir, imponer una nueva identidad a una persona en una película existente), la mayoría de las soluciones actuales operan bajo limitaciones bastante severas en términos de la precisión requerida para efectos visuales de producción de alta calidad.
Una excepción es el trabajo en curso de una asociación suelta de académicos del Instituto de Ciencia Weizmann. En 2021, tres de sus investigadores, en asociación con Adobe, anunciaron un método novedoso para descomponer videos y superponer un mapeo interno coherente, un atlas neural en capas, en una salida compuesta, completa con canales alfa y salida temporalmente coherente.

Del papel de 2021: una estimación de la travesía completa de la carretera en el clip de origen se edita a través de una red neuronal de una manera que tradicionalmente requeriría un rotoscopio y un movimiento de coincidencia extensivos. Dado que los elementos de fondo y primer plano se manejan con redes diferentes, las máscaras son verdaderamente ‘automáticas’. Fuente: https://layered-neural-atlases.github.io/
Aunque cae en algún lugar del ámbito cubierto por flujo óptico en las tuberías de VFX, el atlas en capas no tiene un equivalente directo en los flujos de trabajo tradicionales de CGI, ya que esencialmente constituye un ‘mapa de textura temporal’ que se puede producir y editar a través de métodos de software tradicionales. En la segunda imagen de la ilustración de arriba, el fondo de la superficie de la carretera se representa (figurativamente) en toda la duración del video. Alterar esa imagen base (tercera imagen de la izquierda en la ilustración de arriba) produce un cambio coherente en el fondo.
Las imágenes del ‘atlas desplegado’ de arriba solo representan marcos interpretados individualmente; los cambios coherentes en cualquier marco de video objetivo se mapean de regreso al marco original, manteniendo cualquier ocultación y efectos de escena necesarios, como sombras o reflejos.
La arquitectura central utiliza un perceptrón multicapa (MLP) para representar los atlas desplegados, canales alfa y asignaciones, todos los cuales se optimizan en concierto y enteramente en un espacio 2D, lo que elimina la necesidad de conocimiento previo de puntos de geometría 3D, mapas de profundidad y accesorios de CGI similares.
El atlas de referencia de objetos individuales también se puede alterar de manera fiable:

Cambio coherente a un objeto en movimiento bajo el marco de 2021. Fuente: https://www.youtube.com/watch?v=aQhakPFC4oQ
En esencia, el sistema de 2021 combina la alineación de geometría, el movimiento de coincidencia, el mapeo, la retexturización y el rotoscopio en un proceso neural discreto.
Text2Live
Los tres investigadores originales del papel de 2021, junto con la investigación de NVIDIA, son algunos de los contribuyentes a una nueva innovación en la técnica que combina el poder de los atlas en capas con la clase de tecnología CLIP guiada por texto que ha vuelto a ser prominente esta semana con el lanzamiento del marco DALL-E 2.
La nueva arquitectura, titulada Text2Live, permite a un usuario final crear ediciones localizadas al contenido de video real basado en instrucciones de texto:


Dos ejemplos de edición de primer plano. Para una mejor resolución y definición, consulte los videos originales en https://text2live.github.io/sm/pages/video_results_atlases.html
Text2Live ofrece edición semántica y altamente localizada sin el uso de un generador preentrenado, al aprovechar una base de datos interna específica del clip de video que se ve afectado.

Transformaciones de fondo y primer plano (objeto) bajo Text2Live. Fuente: https://text2live.github.io/sm/pages/video_results_atlases.html
La técnica no requiere máscaras proporcionadas por el usuario, como un flujo de trabajo de rotoscopio o pantalla verde típico, sino que estima mapas de relevancia a través de una técnica de arranque basada en investigación de 2021 de la Escuela de Ciencias de la Computación de la Universidad de Tel Aviv y Facebook AI Research (FAIR).

Mapas de salida generados a través de un modelo de atención genérico basado en transformadores.
El nuevo papel se titula Text2LIVE: Edición de imagen y video guiada por texto en capas. El equipo original de 2021 se une a Omer Bar-Tal de Weizmann y Yoni Kasten de NVIDIA Research.
Arquitectura
Text2Live comprende un generador entrenado en una sola imagen de entrada y instrucciones de texto de destino. Un modelo CLIP preentrenado en 400 millones de pares de texto/imagen proporciona material visual asociado a partir del cual se pueden interpretar las transformaciones de entrada del usuario.

El generador acepta una imagen de entrada (marco) y produce una capa RGBA de destino que contiene información de color y opacidad. Esta capa se compone en la filmación original con aumentos adicionales.

El canal alfa en la capa RGBA generada proporciona una función de composición interna sin recurrir a tuberías tradicionales que involucran software basado en píxeles como After Effects.
Al entrenar en imágenes internas relevantes para el video o imagen de destino, Text2Live evita la necesidad de invertir la imagen de entrada en el espacio latente de una Red Adversaria Generativa (GAN), una práctica que actualmente está lejos de ser lo suficientemente exacta para requisitos de edición de video de producción, o usar un modelo de difusión que es más preciso y configurable, pero no puede mantener la fidelidad al video de destino.

Ediciones de transformación basadas en instrucciones de varios textos de Text2Live.
Enfoques anteriores han utilizado métodos basados en propagación o enfoques basados en flujo óptico. Dado que estas técnicas son, en alguna medida, basadas en marcos, ninguna de ellas es capaz de crear una apariencia temporal coherente de los cambios en el video de salida. Un atlas neural en capas, en cambio, proporciona un solo espacio en el que se pueden abordar los cambios, que pueden permanecer fieles al cambio comprometido a medida que avanza el video.

No ‘chisporroteo’ o alucinaciones aleatorias: Text2Live obtiene una interpretación de la instrucción de texto ‘jeep oxidado’ y la aplica una vez al atlas neural en capas del coche en el video, en lugar de reiniciar la transformación para cada marco interpretado.
Text2Live está más cerca de un avance en la composición basada en IA, en lugar de en el espacio fértil de la imagen a texto, que ha atraído tanta atención esta semana con el lanzamiento de la segunda generación del marco DALL-E de OpenAI (que puede incorporar imágenes de destino como parte del proceso de transformación, pero sigue limitado en su capacidad para intervenir directamente en una foto, además de la censura de los datos de entrenamiento de origen y la imposición de filtros diseñados para prevenir el abuso de usuario).
En cambio, Text2Live permite al usuario final extraer un atlas y editararlo en una sola pasada en entornos de píxeles de alto control como Photoshop (y, argumentablemente, incluso en marcos de síntesis de imágenes más abstractos como NeRF), antes de volver a introducirlo en un entorno correctamente orientado que, sin embargo, no depende de la estimación 3D o enfoques CGI basados en la mirada hacia atrás.
Además, Text2Live, según afirman los autores, es el primer marco comparable que logra enmascarar y componer de manera completamente automática.
Publicado por primera vez el 7 de abril de 2022.













