Ángulo de Anderson

Cambiar género y raza en los resultados de búsqueda de imágenes con aprendizaje automático

mm
Añade Unite.AI a tus fuentes preferidas en Google

Una colaboración de investigación entre la Universidad de California en San Diego y Adobe (ADBE ) Research ha propuesto una solución innovadora y proactiva para la falta de diversidad racial y de género en los resultados de búsqueda de imágenes para ocupaciones tradicionalmente dominadas por personas blancas: el uso de Redes Adversarias Generativas (GAN) para crear imágenes no reales de profesiones “sesgadas”, donde el género y/o la raza del sujeto se alteran.

En este ejemplo del nuevo artículo, los investigadores han introducido características para una foto deseada que no está representada en un corpus típico de material de imagen disponible, o que está representada de manera inapropiada (es decir, sexualizada o de otra manera inapropiada). Fuente

En este ejemplo del nuevo artículo, los investigadores han introducido características para una foto deseada que no está representada en un corpus típico de material de imagen disponible, o que está representada de manera inapropiada (es decir, sexualizada o de otra manera inapropiada). Fuente

En un nuevo artículo titulado Generando y controlando la diversidad en la búsqueda de imágenes, los autores sugieren que hay un límite en la medida en que el reordenamiento puede solucionar el desequilibrio de clases de imágenes/sesgos como fontanero, operador de máquina, ingeniero de software, y muchos otros – y que aumentar la diversidad racial y de género con datos sintéticos puede ser el camino a seguir para este desafío.

‘La búsqueda de un mundo utópico exige brindar a los usuarios de contenido la oportunidad de presentar cualquier profesión con características raciales y de género diversas. La elección limitada de contenido existente para ciertas combinaciones de profesión, raza y género presenta un desafío para los proveedores de contenido. La investigación actual que trata sobre el sesgo en la búsqueda se centra principalmente en algoritmos de reordenamiento.

‘Sin embargo, estos métodos no pueden crear nuevo contenido ni cambiar la distribución general de atributos protegidos en las fotos. Para solucionar estos problemas, proponemos una nueva tarea de generación de imágenes de alta fidelidad condicionada en múltiples atributos de conjuntos de datos desequilibrados. ‘

Con este fin, los autores han experimentado con una variedad de sistemas de síntesis de imágenes basados en GAN, finalmente decantándose por una arquitectura basada en StyleGan2.

De los materiales suplementarios del artículo, dos ejemplos de 'igualización' de representaciones de imágenes de profesiones sesgadas, en estos casos, 'carpintero' y 'operador de máquina'. Fuente

De los materiales suplementarios del artículo, dos ejemplos de ‘igualización’ de representaciones de imágenes de profesiones sesgadas, en estos casos, ‘carpintero’ y ‘operador de máquina’. Fuente

Insuficientemente o inapropiadamente representados

Los investigadores plantean el desafío en términos de un resultado de búsqueda real en búsqueda de ‘fontanero’* en Google Image search, observando que los resultados de imagen están dominados por hombres jóvenes blancos.

De el artículo, resultados selectos para 'fontanero' en Google Image search, enero de 2021.

De el artículo, resultados selectos para ‘fontanero’ en Google Image search, enero de 2021.

Los autores señalan que indicaciones similares de sesgo ocurren para una serie de profesiones, como ‘asistente administrativo’, ‘limpiador’ y ‘operador de máquina’, con sesgos correspondientes para la edad, el género y la raza.

‘No sorprende que, debido a tal sesgo social, algunas combinaciones de raza y género puedan tener pocas o ninguna imagen en un repositorio de contenido. Por ejemplo, cuando buscamos ‘operadora de máquina negra (o afroamericana)’ o ‘asistente administrativo asiático’, no encontramos imágenes relevantes en [Google Image search].

‘Además, en casos raros, combinaciones particulares de género y raza pueden llevar a que los individuos sean representados de manera inapropiada. Observamos este comportamiento para consultas de búsqueda como ‘fontanera asiática’ o ‘guardia de seguridad negra (o afroamericana)’.

El artículo cita otra colaboración académica de 2014, donde los investigadores recopilaron los 400 resultados de búsqueda de imágenes para 96 ocupaciones. Ese trabajo encontró que las mujeres representaban solo el 37% de los resultados, y las imágenes antiestereotípicas solo el 22%. Un estudio de 2019 de Yale encontró que cinco años habían aumentado estos porcentajes a solo 45% y 30% respectivamente.

Además, el estudio de 2014 clasificó la sexualización de individuos en ciertas ocupaciones en los resultados de búsqueda de imágenes como el problema del carpintero sexy, con tales clasificaciones inapropiadas potencialmente sesgando los resultados para el reconocimiento de ocupaciones.

La gran imagen

El desafío principal para los autores fue producir un sistema de síntesis de imágenes basado en GAN capaz de producir una resolución de 1024×1024, ya que, en el estado actual del arte en GAN y sistemas de síntesis de imágenes basados en codificador/decodificador, 512×512 es bastante lujoso. Cualquier cosa más alta tendería a obtenerse mediante la escalada de la salida final, a costa de tiempo y recursos de procesamiento, y a riesgo de la autenticidad de las imágenes generadas.

Sin embargo, los autores afirman que las resoluciones más bajas no podrían esperar ganar tracción en la búsqueda de imágenes, y experimentaron con una variedad de marcos de GAN que podrían ser capaces de producir imágenes de alta resolución a demanda, a un nivel de autenticidad aceptable.

Cuando se tomó la decisión de adoptar StyleGan2, se hizo evidente que el proyecto necesitaría un mayor control sobre las subcaracterísticas de la salida generada (como la raza, la ocupación y el género), que un despliegue predeterminado permite. Por lo tanto, los autores utilizaron condicionamiento multiclase para aumentar el proceso de generación.

La arquitectura del generador de imágenes especificador, que los autores afirman no es específica de StyleGAN2, sino que podría aplicarse en una variedad de marcos de generadores.

La arquitectura del generador de imágenes especificador, que los autores afirman no es específica de StyleGAN2, sino que podría aplicarse en una variedad de marcos de generadores.

Para controlar los factores de raza, género y ocupación, la arquitectura inyecta una codificación de un solo disparo de estas características concatenadas en el vector y. Después de esto, se utiliza una red de alimentación directa para incrustar estas características, para que no sean descartadas en el momento de la generación.

Los autores observan que hay límites duros en la medida en que StyleGAN2 puede ser manipulado de esta manera, y que intentos más finos de alterar los resultados dieron lugar a una peor calidad de imagen, e incluso colapso de modo.

Estos remedios, sin embargo, no solucionan los problemas de sesgo implícito en la arquitectura, que los investigadores tuvieron que abordar mediante la sobremuestreo de entidades subrepresentadas en el conjunto de datos, pero sin arriesgarse a sobreajustar, lo que afectaría la flexibilidad de las secuencias de imágenes generadas.

Por lo tanto, los autores adaptaron StyleGAN2-ADA, que utiliza la Augmentación Adaptativa del Discriminador (ADA), para evitar que el discriminador se sobreajuste.

Generación y evaluación de datos

Dado que el objetivo del proyecto es generar nuevos datos sintéticos, los investigadores adoptaron la metodología del proyecto de 2014, eligiendo un número de profesiones objetivo que demuestran un alto sesgo racial y de género. Las profesiones elegidas fueron ‘gerente ejecutivo’, ‘asistente administrativo’, ‘enfermera’, ‘agricultor’, ‘miembro del ejército’, ‘guardia de seguridad’, ‘conductor de camión’, ‘limpiador’, ‘carpintero’, ‘fontanero’, ‘operador de máquina’, ‘persona de soporte técnico’, ‘ingeniero de software’ y ‘escritor’.

Los autores seleccionaron estas profesiones no solo en función de la medida en que se percibe el sesgo en los resultados de búsqueda de imágenes, sino porque la mayoría de ellas contienen algún tipo de componente visual codificado en la profesión, como un uniforme, o la presencia de equipos o entornos específicos.

El conjunto de datos se alimentó con 10,000 imágenes de la biblioteca Adobe Stock, obteniendo típicamente una puntuación del 95% o superior al intentar clasificar una profesión.

Dado que muchas de las imágenes no eran útiles para la tarea objetivo (es decir, no contenían personas), se necesitó un filtrado manual. Después de esto, se utilizó un clasificador basado en ResNet32 preentrenado en FairFace para etiquetar las imágenes para el género y la raza, obteniendo una precisión promedio del 95,7% para el género y del 81,5% para la raza. Así, los investigadores obtuvieron etiquetas de imagen para los atributos Sexo: Masculino, Femenino, Raza: Blanca, Negra, Asiática y otras razas.

Los modelos se construyeron en TensorFlow utilizando StyleGAN2 y StyleGAN2-ADA como redes núcleo. El preentrenamiento se realizó con los pesos preentrenados de StyleGAN2 en el conjunto de datos NVIDIA’s Flickr-Faces-HQ (FFHQ) conjunto de datos, aumentado con 34,000 imágenes específicas de ocupación que los autores recopilaron en un conjunto de datos separado que llamaron Uncurated Stock-Occupation HQ (U-SOHQ).

Un ejemplo de HIT de la evaluación humana de Amazon Mechanical Turk.

Un ejemplo de HIT de la evaluación humana de Amazon Mechanical Turk.

Las imágenes se generaron bajo cuatro configuraciones de arquitectura, con Uniform+ finalmente obteniendo las mejores puntuaciones tanto en FID (evaluación automatizada) como en la evaluación posterior por los trabajadores de Amazon Mechanical Turk. Combinado con la precisión de clasificación, los autores utilizaron esto como una métrica central para su propia métrica, titulada Puntuación de coincidencia de atributos.

Evaluación humana de las imágenes generadas por varios métodos, con el método Uniform+ resultando el más convincente, y posteriormente la base para un nuevo conjunto de datos.

Evaluación humana de las imágenes generadas por varios métodos, con el método Uniform+ resultando el más convincente, y posteriormente la base para un nuevo conjunto de datos.

El artículo no establece si Stock-Occupation-HQ, el conjunto de datos completo derivado de Uniform+, estará disponible públicamente, pero establece que contiene 8,113 imágenes HQ (1024×1024).

Difusión

El nuevo artículo no aborda explícitamente la forma en que las imágenes sintéticas “rebalanceadas” podrían introducirse en circulación. Presumiblemente, sembrar nuevos conjuntos de datos de visión computacional con imágenes readaptadas del tipo que los autores han creado solucionaría el problema del sesgo, pero también podría presentar obstáculos para otros tipos de investigación que buscan evaluar la inclusión de género y raza en escenarios “del mundo real”, en una circunstancia en la que las imágenes sintéticas se mezclan con imágenes del mundo real.

Las bases de datos sintéticas como la producida por los investigadores podrían presumiblemente estar disponibles sin costo como imágenes de stock de alta resolución, utilizando este incentivo de ahorro de costos como un motor de difusión.

El proyecto no aborda el sesgo basado en la edad, presumiblemente un tema de interés en investigaciones futuras.

 

* La búsqueda capturada se realizó el 5 de enero de 2022, la búsqueda citada por los autores en el artículo se realizó en enero de 2021.

 

Publicado por primera vez el 5 de enero de 2022.

Redactor de aprendizaje automático, especialista en síntesis de imágenes humanas. Anterior jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en Brahma.ai de DNEG.
Sitio web: martinanderson.ai
Contacto: martin@martinanderson.ai