Ángulo de Anderson

El modelo de difusión eDiffi de NVIDIA permite ‘pintar con palabras’ y más

mm
Añade Unite.AI a tus fuentes preferidas en Google

Intentar hacer composiciones precisas con modelos de imágenes generativas de difusión latente como Stable Diffusion puede ser como intentar herdar gatos; la misma imaginación y capacidad interpretativa que permite al sistema crear detalles extraordinarios y generar imágenes extraordinarias a partir de textos simples también es difícil de apagar cuando se busca un control similar al de Photoshop sobre la generación de imágenes.

Ahora, un nuevo enfoque de la investigación de NVIDIA, titulado ensemble diffusion for images (eDiffi), utiliza una mezcla de métodos de incrustación y interpretación múltiples (en lugar de utilizar el mismo método en toda la canalización) para permitir un nivel mucho mayor de control sobre el contenido generado. En el ejemplo a continuación, vemos a un usuario “pintando” elementos donde cada color representa una palabra del texto de la solicitud:

'Pintar con palabras' es una de las dos capacidades novedosas en el modelo de difusión eDiffi de NVIDIA. Cada color aplicado representa una palabra de la solicitud (ver cómo aparecen en la izquierda durante la generación), y el área del color aplicado consistirá solo en ese elemento. Ver el video oficial al final del artículo para más ejemplos y mejor resolución. Fuente: https://www.youtube.com/watch?v=k6cOx9YjHJc

‘Pintar con palabras’ es una de las dos capacidades novedosas en el modelo de difusión eDiffi de NVIDIA. Cada color aplicado representa una palabra de la solicitud (ver cómo aparecen en la izquierda durante la generación), y el área del color aplicado consistirá solo en ese elemento. Ver el video oficial para más ejemplos y mejor resolución en https://www.youtube.com/watch?v=k6cOx9YjHJc

En esencia, esto es “pintar con máscaras”, y revierte el paradigma de pintura en Stable Diffusion, que se basa en reparar imágenes rotas o insatisfactorias, o ampliar imágenes que podrían haber sido del tamaño deseado desde el principio.

Aquí, en cambio, los márgenes de la “pintura” representan los límites aproximados permitidos de un solo elemento único de un concepto, lo que permite al usuario establecer el tamaño final del lienzo desde el principio y agregar elementos de forma discreta.

Ejemplos del nuevo artículo. Fuente: https://arxiv.org/pdf/2211.01324.pdf

Ejemplos del nuevo artículo. Fuente: https://arxiv.org/pdf/2211.01324.pdf

Los métodos variados empleados en eDiffi también significan que el sistema hace un trabajo mucho mejor al incluir todos los elementos en textos largos y detallados, mientras que Stable Diffusion y DALL-E 2 tienden a priorizar ciertas partes del texto, dependiendo de cómo aparecen en el texto o de otros factores, como la posible dificultad para desentrañar los elementos necesarios para una composición completa y comprensiva con respecto al texto:

Del artículo: eDiffi es capaz de iterar más a fondo a través del texto hasta que se hayan representado el máximo número posible de elementos. Aunque los resultados mejorados para eDiffi (columna derecha) son seleccionados, también lo son las imágenes de comparación de Stable Diffusion y DALL-E 2.

Del artículo: eDiffi es capaz de iterar más a fondo a través del texto hasta que se hayan representado el máximo número posible de elementos. Aunque los resultados mejorados para eDiffi (columna derecha) son seleccionados, también lo son las imágenes de comparación de Stable Diffusion y DALL-E 2.

Además, el uso de un codificador de texto a texto T5 dedicado significa que eDiffi es capaz de renderizar texto en inglés comprensible, ya sea solicitado abstractamente desde una solicitud (es decir, la imagen contiene algún texto de [x]) o solicitado explícitamente (es decir, la camiseta dice ‘Nvidia Rocks’):

El procesamiento de texto a texto dedicado en eDiffi significa que el texto se puede representar tal como está en las imágenes, en lugar de pasar solo por una capa interpretativa de texto a imagen que distorsiona la salida.

El procesamiento de texto a texto dedicado en eDiffi significa que el texto se puede representar tal como está en las imágenes, en lugar de pasar solo por una capa interpretativa de texto a imagen que distorsiona la salida.

Un impulso adicional al nuevo marco de trabajo es que también es posible proporcionar una sola imagen como una solicitud de estilo, en lugar de necesitar entrenar un modelo DreamBooth o una incrustación textual en múltiples ejemplos de un género o estilo.

La transferencia de estilo se puede aplicar desde una imagen de referencia a una solicitud de texto a imagen, o incluso una solicitud de imagen a imagen.

La transferencia de estilo se puede aplicar desde una imagen de referencia a una solicitud de texto a imagen, o incluso una solicitud de imagen a imagen.

El nuevo artículo se titula eDiffi: Modelos de difusión de texto a imagen con un conjunto de expertos denoisers, y

El codificador de texto T5

El uso del codificador de texto a texto de Google (T5) es el elemento clave en los resultados mejorados demostrados en eDiffi. La canalización de difusión latente promedio se centra en la asociación entre imágenes entrenadas y las leyendas que las acompañaban cuando se extrajeron de Internet (o se ajustaron manualmente más tarde, aunque esto es una intervención costosa y por lo tanto rara).

Del artículo de julio de 2020 para T5 - transformaciones basadas en texto, que pueden ayudar en el flujo de trabajo de imagen generativa en eDiffi (y, potencialmente, otros modelos de difusión latente). Fuente: https://arxiv.org/pdf/1910.10683.pdf

Del artículo de julio de 2020 para T5 – transformaciones basadas en texto, que pueden ayudar en el flujo de trabajo de imagen generativa en eDiffi (y, potencialmente, otros modelos de difusión latente). Fuente: https://arxiv.org/pdf/1910.10683.pdf

Al reexpresar el texto de origen y ejecutar el módulo T5, se pueden obtener asociaciones y representaciones más exactas de las que se entrenaron originalmente en el modelo, casi como una etiqueta manual post facto, con mayor especificidad y aplicabilidad a las estipulaciones de la solicitud de texto.

Los autores explican:

‘En la mayoría de los trabajos existentes sobre modelos de difusión, el modelo de desenoise se comparte en todos los niveles de ruido, y la dinámica temporal se representa utilizando una incrustación de tiempo simple que se alimenta al modelo de desenoise a través de una red MLP. Argumentamos que la dinámica temporal compleja de la difusión de desenoise puede no aprenderse de los datos de manera efectiva utilizando un modelo compartido con una capacidad limitada.

‘En cambio, proponemos ampliar la capacidad del modelo de desenoise introduciendo un conjunto de expertos denoisers; cada experto denoiser es un modelo de desenoise especializado para un rango particular de niveles de ruido. De esta manera, podemos aumentar la capacidad del modelo sin ralentizar la muestra, ya que la complejidad computacional de evaluar [el elemento procesado] en cada nivel de ruido sigue siendo la misma.’

Arquitectura conceptual para eDiffi.

Arquitectura conceptual para eDiffi.

Los módulos de codificación CLIP existentes incluidos en DALL-E 2 y Stable Diffusion también son capaces de encontrar interpretaciones de imagen alternativas para el texto relacionado con la entrada del usuario. Sin embargo, se entrenan en información similar a la del modelo original y no se utilizan como una capa interpretativa separada de la manera en que T5 se utiliza en eDiffi.

Los autores afirman que eDiffi es la primera vez que se han incorporado tanto un codificador T5 como un codificador CLIP en una sola canalización:

‘Como estos dos codificadores se entrenan con objetivos diferentes, sus incrustaciones favorecen la formación de imágenes diferentes con el mismo texto de entrada. Mientras que las incrustaciones de texto CLIP ayudan a determinar el aspecto global de las imágenes generadas, las salidas tienden a perder los detalles finos en el texto.

‘En cambio, las imágenes generadas con incrustaciones de texto T5 solas reflejan mejor los objetos individuales descritos en el texto, pero su aspecto global es menos preciso. Utilizarlos conjuntamente produce los mejores resultados de generación de imágenes en nuestro modelo.’

Interrumpir y aumentar el proceso de difusión

El artículo señala que un modelo de difusión latente típico comenzará el viaje desde el ruido puro hasta una imagen confiando únicamente en el texto en las primeras etapas de la generación.

Cuando el ruido se resuelve en algún tipo de disposición que representa la descripción en el texto de la solicitud, el aspecto guiado por texto del proceso esencialmente desaparece, y el resto del proceso se desplaza hacia la ampliación de las características visuales.

Esto significa que cualquier elemento que no se resolvió en la etapa inicial de interpretación de ruido guiada por texto es difícil de inyectar en la imagen más tarde, porque los dos procesos (texto a disposición y disposición a imagen) tienen relativamente poca superposición, y la disposición básica está bastante enmarañada para cuando llega al proceso de ampliación de la imagen.

Del artículo: los mapas de atención de varias partes de la canalización a medida que el proceso de ruido a imagen madura. Podemos ver la caída brusca en la influencia de CLIP en la imagen en la fila inferior, mientras que T5 sigue influyendo en la imagen mucho más en el proceso de renderizado.

Del artículo: los mapas de atención de varias partes de la canalización a medida que el proceso de ruido a imagen madura. Podemos ver la caída brusca en la influencia de CLIP en la imagen en la fila inferior, mientras que T5 sigue influyendo en la imagen mucho más en el proceso de renderizado.

Potencial profesional

Los ejemplos en la página del proyecto y el video de YouTube se centran en la generación de imágenes divertidas y “meméticas”. Como de costumbre, la investigación de NVIDIA está minimizando el potencial de su última innovación para mejorar los flujos de trabajo de imágenes fotorealistas o VFX, así como su potencial para mejorar la imagen y el video de deepfake.

En los ejemplos, un usuario novato o aficionado dibuja líneas generales de colocación para el elemento específico, mientras que en un flujo de trabajo de VFX más sistemático, podría ser posible utilizar eDiffi para interpretar múltiples cuadros de un elemento de video utilizando texto a imagen, donde las líneas son muy precisas y se basan, por ejemplo, en figuras donde el fondo se ha eliminado mediante pantalla verde o métodos algorítmicos.

Runway ML ya proporciona rotoscopía basada en IA. En este ejemplo, la 'pantalla verde' alrededor del sujeto representa la capa alfa, mientras que la extracción se ha realizado mediante aprendizaje automático en lugar de la eliminación algorítmica de un fondo de pantalla verde real. Fuente: https://twitter.com/runwayml/status/1330978385028374529

Runway ML ya proporciona rotoscopía basada en IA. En este ejemplo, la ‘pantalla verde’ alrededor del sujeto representa la capa alfa, mientras que la extracción se ha realizado mediante aprendizaje automático en lugar de la eliminación algorítmica de un fondo de pantalla verde real. Fuente: https://twitter.com/runwayml/status/1330978385028374529

Usando un personaje de DreamBooth entrenado y una canalización de imagen a imagen con eDiffi, es posible comenzar a abordar uno de los problemas de cualquier modelo de difusión latente: la estabilidad temporal. En tal caso, tanto los márgenes de la imagen impuesta como el contenido de la imagen se “flotarían” contra el lienzo del usuario, con continuidad temporal del contenido renderizado (es decir, convertir a un practicante de Tai Chi real en un robot) proporcionada por el uso de un modelo DreamBooth bloqueado que ha “memorizado” sus datos de entrenamiento – malo para la interpretación, excelente para la reproducibilidad, la fidelidad y la continuidad.

Método, datos y pruebas

El artículo establece que el modelo eDiffi se entrenó en “una colección de conjuntos de datos públicos y privados”, filtrados pesadamente por un modelo CLIP preentrenado, para eliminar imágenes que probablemente disminuyan la puntuación estética general de la salida. El conjunto de imágenes final filtrado comprende “alrededor de mil millones” de pares de texto e imagen. El tamaño de las imágenes entrenadas se describe como con “el lado más corto mayor que 64 píxeles”.

Se entrenaron varios modelos para el proceso, con ambos modelos base y de resolución superior entrenados en el optimizador AdamW con una tasa de aprendizaje de 0,0001, con una decadencia de peso de 0,01 y con un tamaño de lote de 2048.

El modelo base se entrenó en 256 GPU A100 de NVIDIA, y los dos modelos de resolución superior en 128 GPU A100 de NVIDIA para cada modelo.

El sistema se basó en la biblioteca Imaginaire de PyTorch de NVIDIA. Los conjuntos de datos COCO y Visual Genome se utilizaron para la evaluación, aunque no se incluyeron en los modelos finales, con MS-COCO la variante específica utilizada para las pruebas. Los sistemas rivales probados fueron GLIDE, Make-A-Scene, DALL-E 2, Stable Diffusion, y los dos sistemas de síntesis de imágenes de Google, Imagen y Parti.

De acuerdo con trabajos anterior similar, se utilizó FID-30K de disparo cero como métrica de evaluación. Bajo FID-30K, se extrajeron 30.000 leyendas al azar del conjunto de validación de COCO (es decir, no las imágenes o texto utilizados en el entrenamiento), que se utilizaron como textos de solicitud para sintetizar imágenes.

La distancia de Frechet Inception (FID) entre las imágenes generadas y las imágenes de verdad se calculó, además de registrar la puntuación CLIP para las imágenes generadas.

Resultados de las pruebas FID de disparo cero contra enfoques actuales del estado del arte en el conjunto de datos de validación de COCO 2014, con resultados más bajos mejor.

Resultados de las pruebas FID de disparo cero contra enfoques actuales del estado del arte en el conjunto de datos de validación de COCO 2014, con resultados más bajos mejor.

En los resultados, eDiffi pudo obtener la puntuación más baja (mejor) en FID de disparo cero, incluso contra sistemas con un número mucho mayor de parámetros, como los 20 mil millones de parámetros de Parti, en comparación con los 9,1 mil millones de parámetros en el modelo eDiffi de mayor especificación entrenado para las pruebas.

Conclusión

El modelo de difusión eDiffi de NVIDIA representa una alternativa bienvenida a simplemente agregar más y más datos y complejidad a los sistemas existentes, en lugar de utilizar un enfoque más inteligente y en capas para algunos de los obstáculos más espinosos relacionados con la confusión y la no editabilidad en los sistemas de imagen generativa de difusión latente.

Ya hay discusiones en los subreddits y Discord de Stable Diffusion sobre la incorporación directa de cualquier código que pueda estar disponible para eDiffi, o la reetapa de los principios detrás de él en una implementación separada. La nueva canalización, sin embargo, es tan radicalmente diferente que constituiría un cambio de número de versión completo para SD, abandonando alguna compatibilidad hacia atrás, aunque ofreciendo la posibilidad de niveles de control mucho mejorados sobre las imágenes sintetizadas finales, sin sacrificar los poderes imaginativos cautivadores de la difusión latente.

 

Publicado por primera vez el 3 de noviembre de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai