Ángulo de Anderson

Mejorando la Generación de Pantalla Verde para Difusión Estable

mm
Añade Unite.AI a tus fuentes preferidas en Google
Diverse Stable Diffusion green screen-based prompts, https://stablediffusionweb.com/

A pesar del entusiasmo de la comunidad y los inversores en torno a la inteligencia artificial visual generativa, la salida de estos sistemas no siempre está lista para su uso en el mundo real; un ejemplo es que los sistemas de inteligencia artificial generativa tienden a producir imágenes enteras (o una serie de imágenes, en el caso de video), en lugar de los elementos individuales y aislados que normalmente se requieren para diversas aplicaciones en multimedia y para profesionales de efectos visuales.

Un ejemplo simple de esto es el arte de clip diseñado para ‘flotar’ sobre cualquier fondo de destino que el usuario haya seleccionado:

El fondo de cuadros grises claros, quizás más familiar para los usuarios de Photoshop, ha llegado a representar el canal alfa, o canal de transparencia, incluso en artículos de consumo simples como imágenes de stock.

El fondo de cuadros grises claros, quizás más familiar para los usuarios de Photoshop, ha llegado a representar el canal alfa, o canal de transparencia, incluso en artículos de consumo simples como imágenes de stock.

La transparencia de este tipo ha estado disponible comúnmente durante más de treinta años; desde la revolución digital de los primeros años 90, los usuarios han podido extraer elementos de video e imágenes a través de una serie cada vez más sofisticada de conjuntos de herramientas y técnicas.

Por ejemplo, el desafío de ‘eliminar’ fondos de pantalla azul y verde en metraje de video, que una vez fue el dominio de procesos químicos costosos y impresoras ópticas (así como mascaras hechas a mano), se convirtió en el trabajo de minutos en sistemas como Adobe’s After Effects y aplicaciones de Photoshop (entre muchos otros programas y sistemas gratuitos y propietarios).

Una vez que se ha aislado un elemento, un canal alfa (efectivamente una máscara que oculta cualquier contenido no relevante) permite que cualquier elemento en el video se superponga fácilmente sobre nuevos fondos, o se componga con otros elementos aislados.

Ejemplos de canales alfa, con sus efectos representados en la fila inferior. Fuente: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Ejemplos de canales alfa, con sus efectos representados en la fila inferior. Fuente: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Eliminando

En visión por computadora, la creación de canales alfa cae dentro del ámbito de segmentación semántica, con proyectos de código abierto como el Segment Anything de Meta, que proporciona un método de texto para aislar/extraer objetos de destino, a través del reconocimiento de objetos mejorado semánticamente.

El marco de trabajo Segment Anything se ha utilizado en una amplia gama de flujos de trabajo de extracción y aislamiento de efectos visuales, como el proyecto Alpha-CLIP.

Ejemplos de extracciones utilizando Segment Anything, en el marco de trabajo Alpha-CLIP: Fuente: https://arxiv.org/pdf/2312.03818

Ejemplos de extracciones utilizando Segment Anything, en el marco de trabajo Alpha-CLIP: Fuente: https://arxiv.org/pdf/2312.03818

Hay muchos métodos alternativos de segmentación semántica que se pueden adaptar a la tarea de asignar canales alfa.

Sin embargo, la segmentación semántica depende de datos entrenados que pueden no contener todas las categorías de objeto que se requieren para ser extraídas. Aunque los modelos entrenados con muy grandes volúmenes de datos pueden permitir un rango más amplio de objetos que se pueden reconocer (efectivamente convirtiéndose en modelos fundamentales o modelos del mundo), sin embargo, están limitados por las clases que están entrenados para reconocer más efectivamente.

Los sistemas de segmentación semántica como Segment Anything pueden luchar para identificar ciertos objetos, o partes de objetos, como se ejemplifica aquí en la salida de prompts ambiguos. Fuente: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Los sistemas de segmentación semántica como Segment Anything pueden luchar para identificar ciertos objetos, o partes de objetos, como se ejemplifica aquí en la salida de prompts ambiguos. Fuente: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

En cualquier caso, la segmentación semántica es tan post facto como un procedimiento de pantalla verde, y debe aislar elementos sin la ventaja de una sola franja de color de fondo que pueda ser reconocida y eliminada efectivamente.

Por esta razón, ha ocurrido ocasionalmente a la comunidad de usuarios que las imágenes y los videos podrían generarse que realmente contienen fondos de pantalla verde que podrían eliminarse instantáneamente a través de métodos convencionales.

Desafortunadamente, los modelos de difusión latente populares como Stable Diffusion a menudo tienen algunas dificultades para renderizar una pantalla verde realmente vívida. Esto se debe a que los datos de entrenamiento de los modelos no suelen contener muchos ejemplos de este escenario bastante especializado. Incluso cuando el sistema tiene éxito, la idea de ‘verde’ tiende a extenderse de manera no deseada al sujeto del primer plano, debido a la entrelazamiento de conceptos:

Arriba, vemos que Stable Diffusion ha priorizado la autenticidad de la imagen sobre la necesidad de crear una sola intensidad de verde, efectivamente replicando problemas del mundo real que ocurren en escenarios de pantalla verde tradicionales. Abajo, vemos que el concepto de 'verde' ha contaminado la imagen del primer plano. Cuanto más se enfoca el prompt en el concepto de 'verde', peor será este problema. Fuente: https://stablediffusionweb.com/

Arriba, vemos que Stable Diffusion ha priorizado la autenticidad de la imagen sobre la necesidad de crear una sola intensidad de verde, efectivamente replicando problemas del mundo real que ocurren en escenarios de pantalla verde tradicionales. Abajo, vemos que el concepto de ‘verde’ ha contaminado la imagen del primer plano. Cuanto más se enfoca el prompt en el concepto de ‘verde’, peor será este problema. Fuente: https://stablediffusionweb.com/

A pesar de los métodos avanzados en uso, tanto el vestido de la mujer como la corbata del hombre (en las imágenes inferiores que se ven arriba) tenderían a ‘desaparecer’ junto con el fondo verde – un problema que se remonta a los días de la eliminación de tinte de emulsión fotoquímica en los años 70 y 80.

Como siempre, las limitaciones de un modelo pueden superarse lanzando datos específicos a un problema y dedicando considerables recursos de entrenamiento. Sistemas como LayerDiffuse de Stanford crean un modelo ajustado capaz de generar imágenes con canales alfa:

El proyecto LayerDiffuse de Stanford se entrenó con un millón de imágenes apropiadas capaces de infundir al modelo con capacidades de transparencia. Fuente: https://arxiv.org/pdf/2402.17113

El proyecto LayerDiffuse de Stanford se entrenó con un millón de imágenes apropiadas capaces de infundir al modelo con capacidades de transparencia. Fuente: https://arxiv.org/pdf/2402.17113

Desafortunadamente, además de los considerables recursos de curación y entrenamiento requeridos para este enfoque, el conjunto de datos utilizado para LayerDiffuse no está disponible públicamente, lo que restringe el uso de modelos entrenados con él. Incluso si este impedimento no existiera, este enfoque es difícil de personalizar o desarrollar para casos de uso específicos.

Poco después, en 2024, Adobe Research colaboró con la Universidad de Stonybrook para producir MAGICK, un enfoque de extracción de inteligencia artificial entrenado en imágenes de difusión personalizadas.

Del papel de 2024, un ejemplo de extracción de canal alfa de grano fino en MAGICK. Fuente: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

Del papel de 2024, un ejemplo de extracción de canal alfa de grano fino en MAGICK. Fuente: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

Se utilizaron 150,000 objetos extraídos y generados por inteligencia artificial para entrenar a MAGICK, para que el sistema desarrollara una comprensión intuitiva de la extracción:

Muestras del conjunto de datos de entrenamiento de MAGICK.

Muestras del conjunto de datos de entrenamiento de MAGICK.

Este conjunto de datos, como establece el papel de origen, fue muy difícil de generar por la razón mencionada anteriormente – que los métodos de difusión tienen dificultades para crear franjas sólidas de color. Por lo tanto, fue necesaria la selección manual de las máscaras generadas.

Esta barrera logística conduce una vez más a un sistema que no se puede desarrollar o personalizar fácilmente, sino que debe usarse dentro de su rango de capacidad inicialmente entrenada.

TKG-DM – ‘Extracción de Croma Nativa’ para un Modelo de Difusión Latente

Una nueva colaboración entre investigadores alemanes y japoneses ha propuesto una alternativa a estos métodos entrenados, capaz – según el papel – de obtener mejores resultados que los métodos mencionados anteriormente, sin la necesidad de entrenar en conjuntos de datos especialmente curados.

TKG-DM altera el ruido aleatorio que siembra una imagen generativa para que sea más capaz de producir un fondo sólido y claveable – en cualquier color. Fuente: https://arxiv.org/pdf/2411.15580

TKG-DM altera el ruido aleatorio que siembra una imagen generativa para que sea más capaz de producir un fondo sólido y claveable – en cualquier color. Fuente: https://arxiv.org/pdf/2411.15580

El nuevo método se acerca al problema en el nivel de generación, optimizando el ruido aleatorio a partir del cual se genera una imagen en un modelo de difusión latente (LDM) como Stable Diffusion.

El enfoque se basa en una investigación previa sobre el esquema de color de una distribución de Stable Diffusion, y es capaz de producir color de fondo de cualquier tipo, con menos (o ningún) entrelazamiento del color de fondo clave en el contenido del primer plano, en comparación con otros métodos.

El ruido inicial se condiciona mediante un desplazamiento de media de canal que puede influir en aspectos del proceso de desenoising, sin entrelazar la señal de color en el contenido del primer plano.

El ruido inicial se condiciona mediante un desplazamiento de media de canal que puede influir en aspectos del proceso de desenoising, sin entrelazar la señal de color en el contenido del primer plano.

El papel establece:

‘Nuestros extensos experimentos demuestran que TKG-DM mejora las puntuaciones FID y mask-FID en un 33,7% y 35,9%, respectivamente.

‘Así, nuestro modelo de entrenamiento gratuito rivaliza con modelos ajustados, ofreciendo una solución eficiente y versátil para diversas tareas de creación de contenido visual que requieren un control preciso del primer plano y el fondo. ‘

El nuevo papel se titula TKG-DM: Modelo de Difusión de Contenido de Clave de Croma sin Entrenamiento, y proviene de siete investigadores de la Universidad de Hosei en Tokio y RPTU Kaiserslautern-Landau & DFKI GmbH, en Kaiserslautern.

Método

El nuevo enfoque extiende la arquitectura de Stable Diffusion condicionando el ruido aleatorio inicial a través de un desplazamiento de media de canal (CMS), que produce patrones de ruido diseñados para fomentar la separación deseada entre el fondo y el primer plano en el resultado generado.

Esquema para el flujo de trabajo del sistema propuesto.

Esquema para el sistema propuesto.

CMS ajusta la media de cada canal de color mientras mantiene el desarrollo general del proceso de desenoising.

Los autores explican:

‘Para generar el objeto del primer plano en el fondo de clave de croma, aplicamos una estrategia de selección de ruido inicial que combina selectivamente el ruido inicial y el ruido de color inicial utilizando una máscara gaussiana bidimensional.

‘Esta máscara crea una transición gradual al preservar el ruido original en la región del primer plano y aplicar el ruido desplazado de color a la región del fondo.’

El canal de color deseado para el color de croma del fondo se instancia con un prompt de texto nulo, mientras que el contenido real del primer plano se crea semánticamente a partir de la instrucción de texto del usuario.

El canal de color deseado para el color de croma del fondo se instancia con un prompt de texto nulo, mientras que el contenido real del primer plano se crea semánticamente a partir de la instrucción de texto del usuario.

Atención propia y atención cruzada se utilizan para separar los dos aspectos de la imagen (el fondo de croma y el contenido del primer plano). La atención propia ayuda con la coherencia interna del objeto del primer plano, mientras que la atención cruzada mantiene la fidelidad al prompt de texto. El papel señala que, dado que la imagen de fondo suele ser menos detallada y enfatizada en las generaciones, su influencia más débil es relativamente fácil de superar y reemplazar con una franja de color puro.

Visualización de la influencia de la atención cruzada y la atención propia en el proceso de generación de estilo de croma.

Visualización de la influencia de la atención cruzada y la atención propia en el proceso de generación de estilo de croma.

Datos y Pruebas

TKG-DM se probó utilizando Stable Diffusion V1.5 y Stable Diffusion SDXL. Las imágenes se generaron a 512x512px y 1024x1024px, respectivamente.

Las imágenes se crearon utilizando el programador DDIM nativo de Stable Diffusion, con una escala de orientación de 7,5, con 50 pasos de desenoising. El color de fondo objetivo fue verde, ahora el método de eliminación dominante.

El nuevo enfoque se comparó con DeepFloyd, bajo los ajustes utilizados para MAGICK; con el modelo de difusión de rango bajo ajustado GreenBack LoRA; y también con el mencionado LayerDiffuse.

Para los datos, se utilizaron 3000 imágenes del conjunto de datos MAGICK.

Ejemplos del conjunto de datos MAGICK, de los cuales se curaron 3000 imágenes en las pruebas para el nuevo sistema. Fuente: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Ejemplos del conjunto de datos MAGICK, de los cuales se curaron 3000 imágenes en las pruebas para el nuevo sistema. Fuente: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Para las métricas, los autores utilizaron Fréchet Inception Distance (FID) para evaluar la calidad del primer plano. También desarrollaron una métrica específica del proyecto llamada m-FID, que utiliza el sistema BiRefNet para evaluar la calidad de la máscara resultante.

Comparaciones visuales del sistema BiRefNet con métodos anteriores. Fuente: https://arxiv.org/pdf/2401.03407

Comparaciones visuales del sistema BiRefNet con métodos anteriores. Fuente: https://arxiv.org/pdf/2401.03407

Para probar la alineación semántica con los prompts de entrada, se utilizaron los métodos CLIP-Sentence (CLIP-S) y CLIP-Image (CLIP-I). CLIP-S evalúa la fidelidad del prompt, y CLIP-I la similitud visual con la verdad de referencia.

Primer conjunto de resultados cualitativos para el nuevo método, esta vez para Stable Diffusion V1.5. Por favor, consulte el PDF de origen para una mejor resolución.

Primer conjunto de resultados cualitativos para el nuevo método, esta vez para Stable Diffusion V1.5. Por favor, consulte el PDF de origen para una mejor resolución.

Los autores afirman que los resultados (visualizados arriba y abajo, SD1.5 y SDXL, respectivamente) demuestran que TKG-DM obtiene resultados superiores sin ingeniería de prompts o la necesidad de entrenar o ajustar un modelo.

Resultados cualitativos de SDXL. Por favor, consulte el PDF de origen para una mejor resolución.

Resultados cualitativos de SDXL. Por favor, consulte el PDF de origen para una mejor resolución.

Observan que con un prompt para incitar un fondo verde en los resultados generados, Stable Diffusion 1.5 tiene dificultades para generar un fondo limpio, mientras que SDXL (aunque funciona un poco mejor) produce tintes verdes inestables que pueden interferir con la separación en un proceso de croma.

Además, observan que aunque LayerDiffuse genera fondos bien separados, ocasionalmente pierde detalles, como números o letras precisas, y los autores atribuyen esto a limitaciones en el conjunto de datos. Agregan que la generación de máscaras también ocasionalmente falla, lo que lleva a imágenes ‘no cortadas’.

En las pruebas cuantitativas, aunque LayerDiffuse aparentemente tiene la ventaja en SDXL para FID, los autores enfatizan que esto es el resultado de un conjunto de datos especializado que efectivamente constituye un producto ‘preparado’ y no flexible. Como se mencionó anteriormente, cualquier objeto o clase no cubierto en ese conjunto de datos, o cubierto de manera inadecuada, puede no funcionar tan bien, mientras que un ajuste adicional para acomodar clases nuevas presenta al usuario con una carga de curación y entrenamiento.

Resultados cuantitativos de las comparaciones. La ventaja aparente de LayerDiffuse, según el papel, se produce a expensas de la flexibilidad, y la carga de curación y entrenamiento de datos.

Resultados cuantitativos de las comparaciones. La ventaja aparente de LayerDiffuse, según el papel, se produce a expensas de la flexibilidad, y la carga de curación y entrenamiento de datos.

El papel establece:

‘Las altas puntuaciones FID, m-FID y CLIP-I de DeepFloyd reflejan su similitud con la verdad de referencia basada en las salidas de DeepFloyd. Sin embargo, esta alineación le da una ventaja inherente, lo que la hace inadecuada como una referencia justa para la calidad de la imagen. Su puntuación CLIP-S más baja también indica una alineación de texto más débil en comparación con otros modelos.

En general, estos resultados subrayan la capacidad de nuestro modelo para generar primeros planos de alta calidad y alineados con el texto sin ajuste, ofreciendo una solución eficiente para la generación de contenido de clave de croma.’

Finalmente, los investigadores realizaron un estudio de usuario para evaluar la adherencia a los prompts en los diferentes métodos. Se les pidió a cien participantes que juzgaran 30 pares de imágenes de cada método, con sujetos extraídos utilizando BiRefNet y refinamientos manuales en todos los ejemplos. El enfoque de entrenamiento gratuito de los autores fue preferido en este estudio.

Resultados del estudio de usuario.

Resultados del estudio de usuario.

TKG-DM es compatible con el sistema de terceros popular ControlNet para Stable Diffusion, y los autores afirman que produce resultados superiores a la capacidad nativa de ControlNet para lograr este tipo de separación.

Conclusión

Quizás el resultado más notable de este nuevo papel es el grado en que los modelos de difusión latente están entrelazados, en contraste con la percepción pública popular de que pueden separar fácilmente los aspectos de las imágenes y los videos al generar nuevo contenido.

El estudio también enfatiza el grado en que la comunidad de investigación y aficionados ha recurrido al ajuste como una solución post facto para las limitaciones de los modelos – una solución que siempre abordará clases y tipos de objetos específicos. En tal escenario, un modelo ajustado funcionará muy bien en un número limitado de clases, o funcionará tolerablemente bien en un volumen mucho mayor de clases y objetos posibles, según la cantidad de datos en los conjuntos de entrenamiento.

Por lo tanto, es refrescante ver al menos una solución que no depende de soluciones tan laboriosas y argüiblemente deshonestas.

 

* Al rodar la película de 1978 Superman, al actor Christopher Reeve se le requirió que usara un traje de Superman de color turquesa para las tomas de proceso de pantalla azul, para evitar que el traje azul icónico fuera borrado. El color azul del traje se restauró más tarde a través de la gradación de color.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]