Ángulo de Anderson
Aprovechar la Atención Humana Puede Mejorar las Imágenes Generadas por IA

Una nueva investigación de China ha propuesto un método para mejorar la calidad de las imágenes generadas por Modelos de Difusión Latente (LDM) como Stable Diffusion.
El método se centra en optimizar las regiones salientes de una imagen, es decir, las áreas más propensas a atraer la atención humana.

La nueva investigación ha encontrado que las mapas de saliencia (cuarta columna desde la izquierda) se pueden utilizar como un filtro o ‘máscara’ para dirigir el foco de atención en los procesos de desenoising hacia las áreas de la imagen que los humanos son más propensos a prestar atención. Fuente: https://arxiv.org/pdf/2410.10257
Los métodos tradicionales optimizan la imagen completa de manera uniforme, mientras que el nuevo enfoque aprovecha un detector de saliencia para identificar y priorizar regiones más “importantes”, como lo hacen los humanos.
En pruebas cuantitativas y cualitativas, el método de los investigadores fue capaz de superar a los modelos de difusión basados en anteriores, tanto en términos de calidad de la imagen como de fidelidad a las instrucciones de texto.
El nuevo enfoque también obtuvo la mejor puntuación en una prueba de percepción humana con 100 participantes.
Selección Natural
La saliencia, la capacidad de priorizar la información en el mundo real y en las imágenes, es una parte esencial de la visión humana.
Un ejemplo simple de esto es el aumento de la atención al detalle que el arte clásico asigna a áreas importantes de una pintura, como la cara en un retrato o los mástiles de un barco en un tema marino; en estos ejemplos, la atención del artista se centra en el tema central, lo que significa que los detalles generales como el fondo de un retrato o las olas distantes de una tormenta son más esquemáticos y representativos que detallados.
Informados por estudios humanos, han surgido métodos de aprendizaje automático en la última década que pueden replicar o al menos aproximar este foco de interés humano en cualquier imagen.

La segmentación de objetos (segmentación semántica) puede ser una ayuda para individuar facetas de una imagen y desarrollar mapas de saliencia correspondientes. Fuente: https://arxiv.org/pdf/1312.6034
En la literatura de investigación, el detector de mapa de saliencia más popular en los últimos cinco años ha sido la iniciativa de 2016 Gradient-weighted Class Activation Mapping (Grad-CAM), que más tarde evolucionó en el sistema mejorado Grad-CAM++, entre otras variantes y refinamientos.
Grad-CAM utiliza la activación de gradiente de un token semántico (como “perro” o “gato”) para producir un mapa visual de dónde el concepto o anotación parece representado en la imagen.

Ejemplos del papel original de Grad-CAM. En la segunda columna, la propagación hacia atrás guiada individúa todas las características contribuyentes. En la tercera columna, se dibujan los mapas semánticos para los dos conceptos ‘perro’ y ‘gato’. La cuarta columna representa la concatenación de las dos inferencias anteriores. La quinta, el mapa de occlusión (enmascaramiento) que corresponde a la inferencia; y finalmente, en la sexta columna, Grad-CAM visualiza una capa ResNet-18. Fuente: https://arxiv.org/pdf/1610.02391
Las encuestas humanas sobre los resultados obtenidos por estos métodos han revelado una correspondencia entre estas individuaciones matemáticas de puntos de interés clave en una imagen y la atención humana (al escanear la imagen).
SGOOL
El nuevo papel considera qué puede aportar la saliencia a los sistemas de texto a imagen (y, potencialmente, texto a video) como Stable Diffusion y Flux.
Cuando se interpreta una instrucción de texto del usuario, los Modelos de Difusión Latente exploran su espacio latente entrenado para conceptos visuales aprendidos que corresponden con las palabras o frases utilizadas. Luego, parsean estos puntos de datos encontrados a través de un proceso de desenoising, donde el ruido aleatorio se evoluciona gradualmente en una interpretación creativa de la instrucción de texto del usuario.
En este punto, sin embargo, el modelo da igual atención a cada parte de la imagen. Desde la popularización de los modelos de difusión en 2022, con el lanzamiento de los generadores de imágenes Dall-E de OpenAI y la posterior publicación del marco de Stable Diffusion, los usuarios han encontrado que las secciones “esenciales” de una imagen a menudo están subatendidas.
Considerando que en una representación típica de un ser humano, la cara de la persona (que es de máxima importancia para el espectador) probablemente ocupe no más del 10-35% de la imagen total, este método democrático de dispersión de la atención funciona en contra de la naturaleza de la percepción humana y la historia del arte y la fotografía.
Cuando los botones de los pantalones de una persona reciben la misma carga de cálculo que sus ojos, la asignación de recursos podría decirse que no es óptima.
Por lo tanto, el nuevo método propuesto por los autores, titulado Optimización de Difusión Latente Guiada por Saliencia (SGOOL), utiliza un mapeador de saliencia para aumentar la atención en áreas descuidadas de una imagen, dedicando menos recursos a secciones que probablemente permanezcan en la periferia de la atención del espectador.
Método
La tubería SGOOL incluye la generación de imágenes, el mapeo de saliencia y la optimización, con la imagen general y la imagen refinada por saliencia procesadas conjuntamente.

Esquema conceptual para SGOOL.
Los incrustaciones latentes del modelo de difusión se optimizan directamente con ajuste fino, eliminando la necesidad de entrenar un modelo específico. El método de muestreo Denoising Diffusion Implicit Model (DDIM) de la Universidad de Stanford, familiar para los usuarios de Stable Diffusion, se adapta para incorporar la información secundaria proporcionada por los mapas de saliencia.
El papel establece:
‘Empleamos primero un detector de saliencia para imitar el sistema de atención visual humano y marcar las regiones salientes. Para evitar entrenar un modelo adicional, nuestro método optimiza directamente los latentes de difusión.
‘Además, SGOOL utiliza un proceso de difusión invertible y lo dota de los méritos de la implementación de memoria constante. Por lo tanto, nuestro método se convierte en un método de ajuste fino eficiente en parámetros y plug-and-play. Se han realizado experimentos extensivos con varios métricas y evaluación humana.’
Dado que este método requiere múltiples iteraciones del proceso de desenoising, los autores adoptaron el marco Direct Optimization Of Diffusion Latents (DOODL), que proporciona un proceso de difusión invertible – aunque todavía aplica atención a toda la imagen.
Para definir áreas de interés humano, los investigadores emplearon el marco TransalNet de la Universidad de Dundee de 2022.

Ejemplos de detección de saliencia del proyecto TransalNet de 2022. Fuente: https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf
Las regiones salientes procesadas por TransalNet se recortaron para generar secciones de saliencia concluyentes que probablemente sean de mayor interés para las personas reales.
La diferencia entre el texto del usuario y la imagen debe considerarse, en términos de definir una función de pérdida que pueda determinar si el proceso está funcionando. Para esto, se utilizó una versión del Contrastive Language–Image Pre-training (CLIP) de OpenAI – por ahora una base del sector de investigación de síntesis de imágenes – junto con la consideración de la distancia semántica estimada entre el texto de la instrucción y la salida de la imagen global (no saliencia).
Los autores afirman:
‘[La] función de pérdida final considera las relaciones entre las partes de saliencia y la imagen global simultáneamente, lo que ayuda a equilibrar los detalles locales y la coherencia global en el proceso de generación.
‘Esta pérdida consciente de la saliencia se utiliza para optimizar el latente de la imagen. Los gradientes se calculan en el ruido [latente] y se utilizan para mejorar el efecto de acondicionamiento de la instrucción de entrada en ambos aspectos salientes y globales de la imagen generada original.’
Datos y Pruebas
Para probar SGOOL, los autores utilizaron una distribución “vanilla” de Stable Diffusion V1.4 (denotada como “SD” en los resultados de las pruebas) y Stable Diffusion con orientación CLIP (denotada como “baseline” en los resultados).
El sistema se evaluó contra tres conjuntos de datos públicos: CommonSyntacticProcesses (CSP), DrawBench y DailyDallE*.
El último contiene 99 instrucciones elaboradas de un artista presentado en una de las publicaciones del blog de OpenAI, mientras que DrawBench ofrece 200 instrucciones en 11 categorías. CSP está compuesto por 52 instrucciones basadas en ocho casos gramaticales diversos.
Para SD, baseline y SGOOL, en las pruebas, se utilizó el modelo CLIP sobre ViT/B-32 para generar las incrustaciones de imagen y texto. Se utilizó la misma instrucción y semilla aleatoria. El tamaño de la salida fue 256×256 y se utilizaron los pesos y ajustes predeterminados de TransalNet.
Además de la métrica de puntuación CLIP, se utilizó una puntuación de preferencia humana (HPS) estimada, además de un estudio en el mundo real con 100 participantes.

Resultados cuantitativos que comparan SGOOL con configuraciones anteriores.
En cuanto a los resultados cuantitativos que se muestran en la tabla anterior, el papel establece:
‘Nuestro modelo supera significativamente a SD y Baseline en todos los conjuntos de datos bajo ambas métricas de puntuación CLIP y HPS. Los resultados promedio de nuestro modelo en la puntuación CLIP y HPS son 3,05 y 0,0029 superiores al segundo lugar, respectivamente.’
Los autores estimaron aún más los gráficos de caja de las puntuaciones HPS y CLIP con respecto a los enfoques anteriores:

Gráficos de caja para las puntuaciones HPS y CLIP obtenidas en las pruebas.
Comentan:
‘Se puede ver que nuestro modelo supera a los otros modelos, lo que indica que nuestro modelo es más capaz de generar imágenes que son coherentes con las instrucciones.
‘Sin embargo, en el gráfico de caja, no es fácil visualizar la comparación debido al tamaño de esta métrica de evaluación en [0, 1]. Por lo tanto, procedemos a trazar los gráficos de barras correspondientes.
‘Se puede ver que SGOOL supera a SD y Baseline en todos los conjuntos de datos bajo ambas métricas de puntuación CLIP y HPS. Los resultados cuantitativos demuestran que nuestro modelo puede generar imágenes más coherentes con las instrucciones y preferidas por los humanos.’
Los investigadores señalan que, aunque el modelo de referencia es capaz de mejorar la calidad de la salida de la imagen, no considera las áreas salientes de la imagen. Sostienen que SGOOL, al llegar a un compromiso entre la evaluación de la imagen global y saliente, obtiene mejores imágenes.
En comparaciones cualitativas (automatizadas), se estableció el número de optimizaciones en 50 para SGOOL y DOODL.


Resultados cualitativos para las pruebas. Por favor, consulte el papel de origen para una mejor definición.
Aquí los autores observan:
‘En la [primera fila], los sujetos de la instrucción son “un gato cantando” y “un cuarteto de barberos”. Hay cuatro gatos en la imagen generada por SD, y el contenido de la imagen no está bien alineado con la instrucción.
‘El gato es ignorado en la imagen generada por Baseline, y hay una falta de detalles en la representación de la cara y los detalles en la imagen. DOODL intenta generar una imagen que sea coherente con la instrucción.
‘Sin embargo, como DOODL optimiza la imagen global directamente, las personas en la imagen se optimizan hacia el gato.’
Señalan además que SGOOL, por el contrario, genera imágenes que son más coherentes con la instrucción original.
En la prueba de percepción humana, 100 voluntarios evaluaron imágenes de prueba para calidad y coherencia semántica (es decir, cuán estrechamente se ajustaban a sus instrucciones de texto de origen). Los participantes tuvieron tiempo ilimitado para hacer sus elecciones.

Resultados para la prueba de percepción humana.
Como señala el papel, el método de los autores es notablemente preferido sobre los enfoques anteriores.
Conclusión
No mucho después de que se hicieron evidentes las limitaciones abordadas en este papel en instalaciones locales de Stable Diffusion, surgieron varios métodos personalizados (como After Detailer) para obligar al sistema a aplicar atención extra a áreas que eran de mayor interés humano.
Sin embargo, este tipo de enfoque requiere que el sistema de difusión inicialmente pase por su proceso normal de aplicar atención igual a cada parte de la imagen, con el trabajo adicional realizado como una etapa extra.
La evidencia de SGOOL sugiere que aplicar la psicología humana básica a la priorización de secciones de imagen podría mejorar enormemente la inferencia inicial, sin pasos de post-procesamiento.
* El papel proporciona el mismo enlace para esto que para CommonSyntacticProcesses.
Publicado por primera vez el miércoles 16 de octubre de 2024












