Ángulo de Anderson

Recortado de imagen de IA que entiende escenas

mm
Añade Unite.AI a tus fuentes preferidas en Google

En el documental extra que acompaña al lanzamiento en DVD de 2003 de Alien3 (1992), el legendario efecto visual Richard Edlund recordó con horror la “lucha de sumo” de la extracción de mate fotoquímica que dominó el trabajo de efectos visuales entre finales de la década de 1930 y finales de la década de 1980. Edlund describió la naturaleza de prueba y error del proceso como “lucha de sumo”, en comparación con las técnicas digitales de pantalla azul/verde que tomaron el control a principios de la década de 1990 (y ha regresado al metáfora desde entonces).

Extraer un elemento de primer plano (como una persona o un modelo de nave espacial) de un fondo, para que la imagen recortada pueda componerse en una placa de fondo, originalmente se logró filmando el objeto de primer plano contra un fondo uniforme azul o verde.

Procesos de extracción fotoquímica laboriosos para un disparo de VFX de ILM para 'Return of the Jedi' (1983). Fuente: https://www.youtube.com/watch?v=qwMLOjqPmbQ

Procesos de extracción fotoquímica laboriosos para un disparo de VFX de ILM para ‘Return of the Jedi’ (1983). Fuente: https://www.youtube.com/watch?v=qwMLOjqPmbQ

En la filmación resultante, el color de fondo se aislaría posteriormente químicamente y se utilizaría como plantilla para reimprimir el objeto de primer plano (o persona) en una impresora óptica como un objeto “flotante” en una celda de película transparente.

El proceso se conocía como superposición de separación de color (CSO) – aunque este término eventualmente se asociaría más con los efectos de video crudos ‘Chromakey’ en la producción de televisión de bajo presupuesto de la década de 1970 y 1980, que se lograban con medios analógicos en lugar de químicos o digitales.

Una demostración de Color Separation Overlay en 1970 para el programa de televisión infantil británico 'Blue Peter'. Fuente: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

Una demostración de Color Separation Overlay en 1970 para el programa de televisión infantil británico ‘Blue Peter’. Fuente: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

En cualquier caso, ya sea para elementos de película o video, posteriormente la filmación extraída se podía insertar en cualquier otra filmación.

Aunque el proceso de sodio-vapor notablemente más caro y propietario de Disney (que se basaba en el amarillo específicamente y también se utilizó para el horror de Alfred Hitchcock de 1963 The Birds) dio una mejor definición y mates más nítidos, la extracción fotoquímica permaneció como un proceso laborioso y poco confiable.

El proceso de extracción de sodio-vapor propietario de Disney requirió fondos cerca del extremo amarillo del espectro. Aquí, Angela Lansbury está suspendida en cables durante la producción de una secuencia de VFX para 'Bedknobs and Broomsticks' (1971). Fuente

El proceso de extracción de sodio-vapor propietario de Disney requirió fondos cerca del extremo amarillo del espectro. Aquí, Angela Lansbury está suspendida en cables durante la producción de una secuencia de VFX para ‘Bedknobs and Broomsticks’ (1971). Fuente

Más allá del recortado digital

En la década de 1990, la revolución digital se deshizo de los productos químicos, pero no de la necesidad de pantallas verdes. Ahora era posible eliminar el fondo verde (o cualquier color) simplemente buscando píxeles dentro de un rango de tolerancia de ese color, en software de edición de píxeles como Photoshop, y una nueva generación de suites de composición de video que podían eliminar automáticamente los fondos coloreados. Casi de la noche a la mañana, sesenta años de la industria de la impresión óptica fueron relegados a la historia.

Los últimos diez años de investigación de visión por computadora acelerada por GPU están llevando la extracción de mates a una tercera era, encomendando a los investigadores el desarrollo de sistemas que puedan extraer mates de alta calidad sin la necesidad de pantallas verdes. En Arxiv solo, los artículos relacionados con innovaciones en extracción de primer plano basada en aprendizaje automático son una característica semanal.

Poniéndonos en la imagen

Este foco de interés académico y de la industria en la extracción de IA ya ha impactado el espacio de consumo: implementaciones crudas pero funcionales son familiares para todos en la forma de Zoom y Skype filtros que pueden reemplazar nuestros fondos de sala de estar con islas tropicales, etc., en llamadas de conferencia de video.

Sin embargo, los mejores mates aún requieren una pantalla verde, como Zoom señaló la semana pasada.

Izquierda, un hombre frente a una pantalla verde, con cabello bien extraído a través de la función de fondo virtual de Zoom. Derecha, una mujer frente a una escena doméstica normal, con cabello extraído algorítmicamente, menos precisamente, y con mayores requisitos de procesamiento. Fuente: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Izquierda, un hombre frente a una pantalla verde, con cabello bien extraído a través de la función de fondo virtual de Zoom. Derecha, una mujer frente a una escena doméstica normal, con cabello extraído algorítmicamente, menos precisamente, y con mayores requisitos de procesamiento. Fuente: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Un artículo posterior de la plataforma de soporte de Zoom advierte que la extracción sin pantalla verde también requiere mayor potencia de procesamiento en el dispositivo de captura.

La necesidad de recortar

Las mejoras en la calidad, portabilidad y economía de recursos para sistemas de recortado “en el salvaje” (es decir, aislar a las personas sin la necesidad de pantallas verdes) son relevantes para muchos sectores y actividades más allá de solo filtros de videoconferencia.

Para el desarrollo de conjuntos de datos, la mejora en el reconocimiento facial, de cabeza completa y de cuerpo completo ofrece la posibilidad de garantizar que los elementos de fondo extraneous no se entrenen en modelos de visión por computadora de sujetos humanos; una extracción más precisa mejoraría en gran medida técnicas de segmentación semántica diseñadas para distinguir y asimilar dominios (es decir, ‘gato’, ‘persona’, ‘barco’), y mejorar VAE y transformadores -basados en sistemas de síntesis de imágenes como el nuevo DALL-E 2 de OpenAI; y mejores algoritmos de extracción reducirían la necesidad de rotoscopia manual costosa en tuberías de VFX.

De hecho, la ascensión de metodologías multimodales (generalmente texto/imagen), donde un dominio como “gato” se codifica tanto como imagen como con referencias de texto asociadas, ya está haciendo incursiones en el procesamiento de imágenes. Un ejemplo reciente es la arquitectura Text2Live, que utiliza entrenamiento multimodal (texto/imagen) para crear videos de, entre muchas otras posibilidades, cisnes de cristal y jirafas de vidrio.

Recortado de IA que comprende la escena

Una gran cantidad de investigación sobre recortado automático basado en IA se ha centrado en el reconocimiento de límites y la evaluación de agrupaciones de píxeles dentro de una imagen o cuadro de video. Sin embargo, una nueva investigación de China ofrece una tubería de extracción que mejora la delineación y la calidad del mate al aprovechar descripciones basadas en texto de una escena (un enfoque multimodal que ha ganado tracción en el sector de investigación de visión por computadora en los últimos 3-4 años), afirmando haber mejorado los métodos anteriores de varias maneras.

Un ejemplo de extracción SPG-IM (última imagen, abajo a la derecha), en comparación con métodos anteriores. Fuente: https://arxiv.org/pdf/2204.09276.pdf

Un ejemplo de extracción SPG-IM (última imagen, abajo a la derecha), en comparación con métodos anteriores. Fuente: https://arxiv.org/pdf/2204.09276.pdf

El desafío planteado para el subsector de investigación de extracción es producir flujos de trabajo que requieran un mínimo de anotación manual y intervención humana – idealmente, ninguno. Además de las implicaciones de costo, los investigadores del nuevo artículo observan que las anotaciones y segmentaciones manuales realizadas por trabajadores de multitud en diferentes culturas pueden causar que las imágenes se etiqueten o incluso se segmenten de diferentes maneras, lo que conduce a algoritmos inconsistentes y poco satisfactorios.

Un ejemplo de esto es la interpretación subjetiva de lo que define un “objeto de primer plano”:

De la nueva investigación: los métodos anteriores LFM y MODNet ('GT' significa Verdad Terrestre, un resultado 'ideal' a menudo logrado manualmente o por métodos no algorítmicos), tienen diferentes y variadamente efectivas tomas sobre la definición de contenido de primer plano, mientras que el nuevo método SPG-IM define más efectivamente 'contenido cercano' a través del contexto de la escena.

De la nueva investigación: los métodos anteriores LFM y MODNet (‘GT’ significa Verdad Terrestre, un resultado ‘ideal’ a menudo logrado manualmente o por métodos no algorítmicos), tienen diferentes y variadamente efectivas tomas sobre la definición de contenido de primer plano, mientras que el nuevo método SPG-IM define más efectivamente ‘contenido cercano’ a través del contexto de la escena.

Para abordar esto, los investigadores han desarrollado una tubería de dos etapas titulada Matting de imagen guiado por percepción situacional (SPG-IM). La arquitectura de codificador/decodificador de dos etapas comprende Destilación de Percepción Situacional (SPD) y Matting guiado por Percepción Situacional (SPGM).

La arquitectura SPG-IM.

La arquitectura SPG-IM.

Primero, SPD preentrena transformaciones de características visuales-textuales, generando subtítulos apropiados para sus imágenes asociadas. Después de esto, la predicción de la máscara de primer plano está habilitada conectando la tubería a una técnica de predicción de saliencia novedosa.

Luego, SPGM produce una máscara alfa estimada basada en la imagen de entrada RGB cruda y la máscara generada obtenida en el primer módulo.

El objetivo es la orientación de la percepción situacional, donde el sistema tiene una comprensión contextual de lo que consiste la imagen, lo que le permite enmarcar – por ejemplo – el desafío de extraer cabello complejo de un fondo contra características conocidas de una tarea específica.

A continuación, SPG-IM entiende que los cables son intrínsecos a un 'paracaídas', donde MODNet no logra retener y definir estos detalles. De manera similar, arriba, la estructura completa del aparato de juegos es arbitrariamente perdida en MODNet.

A continuación, SPG-IM entiende que los cables son intrínsecos a un ‘paracaídas’, donde MODNet no logra retener y definir estos detalles. De manera similar, arriba, la estructura completa del aparato de juegos es arbitrariamente perdida en MODNet.

El nuevo artículo se titula Matting de imagen guiado por percepción situacional, y proviene de investigadores del Instituto de Investigación OPPO, PicUp.ai y Xmotors.

Mates automatizados inteligentes

SPG-IM también ofrece una Red de Refinamiento de Transformación Focal Adaptativa (AFT) que puede procesar detalles locales y contexto global por separado, facilitando ‘mates inteligentes’.

Entender el contexto de la escena, en este caso 'niña con caballo', puede potencialmente hacer que la extracción de primer plano sea más fácil que los métodos anteriores.

Entender el contexto de la escena, en este caso ‘niña con caballo’, puede potencialmente hacer que la extracción de primer plano sea más fácil que los métodos anteriores.

El artículo establece:

‘Creemos que las representaciones visuales de la tarea visual-textual, por ejemplo, subtítulos de imagen, se centran en señales semánticamente más completas entre a) objeto a objeto y b) objeto al entorno para generar descripciones que pueden cubrir tanto la información global como los detalles locales. Además, en comparación con la anotación de píxeles costosa de la extracción de mates, las etiquetas textuales se pueden recopilar en masa a un costo muy bajo.’

La rama SPD de la arquitectura se entrena conjuntamente con el decodificador de texto basado en transformadores de la Universidad de Michigan VirTex, que aprende representaciones visuales a partir de subtítulos semánticamente densos.

VirTex entrena conjuntamente una red convolucional y transformadores a través de pares de imagen-subtítulo, y transfiere los conocimientos obtenidos a tareas de visión descendente como la detección de objetos. Fuente: https://arxiv.org/pdf/2006.06666.pdf

VirTex entrena conjuntamente una red convolucional y transformadores a través de pares de imagen-subtítulo, y transfiere los conocimientos obtenidos a tareas de visión descendente como la detección de objetos. Fuente: https://arxiv.org/pdf/2006.06666.pdf

Entre otras pruebas y estudios de ablación, los investigadores probaron SPG-IM contra métodos basados en trimap de última generación trimap, Matting de imagen profunda (DIM), IndexNet, Matting de imagen con conciencia de contexto (CAM), Atención contextual guiada (GCA), FBA, y Mapeo de imagen semántica (SIM).

Otros marcos anteriores probados incluyeron enfoques libres de trimap LFM, HAttMatting, y MODNet. Para una comparación justa, los métodos de prueba se adaptaron en función de las metodologías diferentes; donde no estaba disponible el código, las técnicas del artículo se reprodujeron a partir de la arquitectura descrita.

El nuevo artículo establece:

‘Nuestro SPG-IM supera a todos los métodos libres de trimap en competencia ([LFM], [HAttMatting] y [MODNet]) por un amplio margen. Mientras tanto, nuestro modelo también muestra una superioridad notable sobre los métodos basados en trimap y con guía de máscara de última generación en términos de las cuatro métricas en los conjuntos de datos públicos (es decir, Composition-1K, Distinction-646 y Human-2K), y nuestra referencia Multi-Object-1K.’

Y continúa:

‘Puede observarse claramente que nuestro método conserva detalles finos (por ejemplo, sitios de punta de cabello, texturas transparentes y límites) sin la guía de trimap. Además, en comparación con otros modelos libres de trimap en competencia, nuestro SPG-IM puede conservar una mejor completitud semántica global.’

 

Publicado por primera vez el 24 de abril de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai