Ángulo de Anderson
El desafío de la ‘categorización racial’ para los sistemas de síntesis de imágenes basados en CLIP

Una nueva investigación en EE. UU. ha descubierto que uno de los modelos de visión por computadora más populares detrás de la serie DALL-E, así como muchos otros modelos de generación y clasificación de imágenes, exhibe una tendencia demostrable hacia la hipodescendencia – la regla de categorización racial (también conocida como la regla de “una gota”) que categoriza a una persona con incluso una pequeña cantidad de linaje genético “mixto” (es decir, no caucásico) enteramente en una clasificación racial “minoritaria”.
Dado que la hipodescendencia ha caracterizado algunos de los capítulos más feos de la historia humana, los autores del nuevo artículo sugieren que tales tendencias en la investigación y la implementación de la visión por computadora deberían recibir mayor atención, no menos porque el marco de apoyo en cuestión, descargado casi un millón de veces al mes, podría diseminar y promulgar aún más el sesgo racial en los marcos posteriores.
La arquitectura que se estudia en el nuevo trabajo es Contrastive Language Image Pretraining (CLIP), un modelo de aprendizaje automático multimodal que aprende asociaciones semánticas mediante el entrenamiento en pares de imagen/título extraídos de Internet – un enfoque semisupervisado que reduce el costo significativo de etiquetado, pero que probablemente refleje el sesgo de las personas que crearon los títulos.
Del artículo:
‘Nuestros resultados proporcionan evidencia de hipodescendencia en el espacio de incrustación de CLIP, un sesgo aplicado más fuertemente a las imágenes de mujeres. Los resultados indican además que CLIP asocia imágenes con etiquetas raciales o étnicas en función de la desviación de lo blanco, con lo blanco como el valor predeterminado.
El artículo también encuentra que la asociación de valencia de una imagen (su tendencia a asociarse con cosas “buenas” o “malas”) es notablemente más alta para las etiquetas raciales “minoritarias” que para las etiquetas caucásicas, y sugiere que los sesgos de CLIP reflejan el corpus de literatura centrado en EE. UU. (Wikipedia en inglés) en el que se entrenó el marco.
Al comentar sobre las implicaciones del aparente apoyo de CLIP a la hipodescendencia, los autores declaran*:
‘[Entre] los primeros usos de CLIP fue entrenar el modelo de generación de imágenes de disparo cero DALL-E. Una versión más grande y no pública de la arquitectura de CLIP se utilizó en el entrenamiento de DALL-E 2. En consonancia con los hallazgos de la presente investigación, la sección de Riesgos y Limitaciones de la tarjeta del modelo DALL-E 2 nota que “produce imágenes que tienden a sobrerepresentar a personas que son blancas”.
‘Dichos usos demuestran el potencial para que los sesgos aprendidos por CLIP se extiendan más allá del espacio de incrustación del modelo, ya que sus características se utilizan para guiar la formación de la semántica en otros modelos de inteligencia artificial de vanguardia.
‘Además, debido en parte a los avances realizados por CLIP y modelos similares para asociar imágenes y texto en el entorno de disparo cero, las arquitecturas multimodales se han descrito como la base para el futuro de las aplicaciones de Internet de uso generalizado, incluidos los motores de búsqueda.
‘Nuestros resultados indican que se requiere una mayor atención a lo que dichos modelos aprenden de la supervisión del lenguaje natural.’
El artículo se titula Evidencia de hipodescendencia en la inteligencia artificial visual semántica, y proviene de tres investigadores de la Universidad de Washington y la Universidad de Harvard.
CLIP y malas influencias
Aunque los investigadores afirman que su trabajo es el primer análisis de hipodescendencia en CLIP, trabajos anteriores han demostrado que el flujo de trabajo de CLIP, dependiente como lo es del entrenamiento en gran medida no supervisado a partir de datos derivados de la web, subrepresenta a las mujeres, puede producir contenido ofensivo, y puede demostrar sesgo semántico (como el sentimiento anti-musulmán) en su codificador de imágenes.
El artículo original que presentó CLIP admitió que en un entorno de disparo cero, CLIP solo asocia el 58,3% de las personas con la etiqueta racial blanca en el conjunto de datos FairFace. Observando que FairFace fue etiquetado con posible sesgo por trabajadores de Amazon Mechanical Turk, los autores del nuevo artículo declaran que ‘una minoría sustancial de personas que son percibidas por otros humanos como blancas son asociadas con una raza diferente a la blanca por CLIP.’
Continúan:
‘La inversa no parece ser cierta, ya que las personas que son percibidas como pertenecientes a otras etiquetas raciales o étnicas en el conjunto de datos FairFace son asociadas con esas etiquetas por CLIP. Este resultado sugiere la posibilidad de que CLIP haya aprendido la regla de “hipodescendencia”, como la describen los científicos sociales: los individuos con ascendencia multirracial son más propensos a ser percibidos y categorizados como pertenecientes al grupo parental minoritario o menos aventajado que al grupo parental mayoritario o aventajado.
‘En otras palabras, el hijo de un padre negro y un padre blanco es percibido como más negro que blanco; y el hijo de un padre asiático y un padre blanco es percibido como más asiático que blanco.’
El artículo tiene tres hallazgos centrales: que CLIP muestra hipodescendencia, al ‘reunir’ a las personas con identidades multirraciales en la categoría racial minoritaria que se aplica a ellas; que ‘lo blanco es la raza predeterminada en CLIP’, y que las razas competidoras están definidas por su ‘desviación’ de una categoría blanca; y que el sesgo de valencia (una asociación con conceptos “malos”) se correlaciona con la medida en que el individuo es categorizado en una minoría racial.
Método y datos
Con el fin de determinar la forma en que CLIP trata a los sujetos multirraciales, los investigadores utilizaron una técnica de morfismo previamente adoptada para alterar la raza de las imágenes de los individuos. Las fotos se tomaron de la Base de datos de caras de Chicago, un conjunto desarrollado para estudios psicológicos que involucran raza.

Ejemplos de las imágenes CFD morfadas presentadas en el material suplementario del nuevo artículo. Fuente: https://arxiv.org/pdf/2205.10764.pdf
Los investigadores eligieron solo imágenes con ‘expresión neutral’ del conjunto de datos, para mantener la consistencia con el trabajo previo. Utilizaron la Red Generativa Adversaria StyleGAN2-ADA (entrenada en FFHQ) para lograr el cambio de raza de las imágenes faciales, y crearon imágenes intermedias que demuestran la progresión de una raza a otra (ver imágenes de ejemplo arriba).
Consistentes con el trabajo previo, los investigadores morfaron las caras de las personas que se identificaban como negras, asiáticas y latinas en el conjunto de datos en caras de personas que se identificaban como blancas. Se produjeron 19 etapas intermedias en el proceso. En total, se crearon 21.000 imágenes de 1024×1024 píxeles para el proyecto mediante este método.
Los investigadores luego obtuvieron una incrustación de imagen proyectada para CLIP para cada una de las 21 imágenes en cada conjunto de morfismo racial. Después de esto, solicitaron una etiqueta para cada imagen de CLIP: ‘multirracial’, ‘birracial’, ‘raza mixta’ y ‘persona’ (la etiqueta final omite la raza).
La versión de CLIP utilizada fue la implementación CLIP-ViT-Base-Patch32. Los autores señalan que este modelo se descargó más de un millón de veces en el mes anterior a la redacción de su investigación, y representa el 98% de las descargas de cualquier modelo CLIP de la biblioteca de Transformadores.
Pruebas
Para probar la posible tendencia de CLIP hacia la hipodescendencia, los investigadores observaron la etiqueta racial asignada por CLIP a cada imagen en el gradiente de imágenes morfadas para cada individuo.
Según los hallazgos, CLIP tiende a agrupar a las personas en las categorías “minoritarias” alrededor del 50% de la marca de transición.

En una proporción de mezcla del 50%, donde el sujeto es igualmente de origen/raza objetivo, CLIP asocia un número mayor de 1000 imágenes morfadas femeninas con etiquetas asiáticas (89,1%), latinas (75,8%) y negras (69,7%) que con una etiqueta blanca equivalente.
Los resultados muestran que los sujetos femeninos son más propensos a la hipodescendencia bajo CLIP que los hombres, aunque los autores hipotetizan que esto puede deberse a que las etiquetas web-derivadas y no curadas que caracterizan las imágenes femeninas tienden a enfatizar la apariencia del sujeto más que en el caso de los hombres, y que esto puede tener un efecto sesgado.
La hipodescendencia en una transición racial del 50% no se observó en la serie de morfismo asiático-blanco masculino ni en la serie de morfismo latino-blanco masculino, mientras que CLIP asignó una mayor similitud coseno a la etiqueta negra en el 67,5% de los casos en una proporción de mezcla del 55%.

La similitud coseno media de las etiquetas Multirracial, Birracial y Raza Mixta. Los resultados indican que CLIP opera una especie de categorización de “punto de inflexión” en diferentes porcentajes de mezcla racial, asignando con menos frecuencia una mezcla racial a la etiqueta blanca (“persona”, en la lógica de los experimentos) que a la etnia percibida en la imagen.
El objetivo ideal, según el artículo, es que CLIP categorice las mezclas raciales intermedias con precisión como “raza mixta”, en lugar de definir un “punto de inflexión” en el que el sujeto sea con frecuencia asignado enteramente a la etiqueta no blanca.
Hasta cierto punto, CLIP asigna las etapas morfadas intermedias con la etiqueta Raza Mixta (ver gráfico anterior), pero eventualmente demuestra una preferencia a medio rango para categorizar a los sujetos como su raza contribuyente minoritaria.
En términos de valencia, los autores señalan el juicio sesgado de CLIP:
‘[La] asociación de valencia media (asociación con lo desagradable o malo en comparación con lo agradable o bueno) varía con la proporción de mezcla en la serie de morfismo negro-blanco masculino, de tal manera que CLIP codifica asociaciones con desagradabilidad para las caras más similares a las de los voluntarios de la CFD que se identifican como negros.’

Los resultados de valencia – las pruebas muestran que los grupos minoritarios están más asociados con conceptos negativos en la arquitectura de imagen/pair que los sujetos con etiquetas blancas. Los autores afirman que la asociación de desagradabilidad de una imagen aumenta con la probabilidad de que el modelo asocie la imagen con la etiqueta negra.
El artículo establece:
‘La evidencia indica que la valencia de una imagen se correlaciona con la asociación racial. Más concretamente, nuestros resultados indican que cuanto más seguro está el modelo de que una imagen refleja a un individuo negro, más se asocia la imagen con el espacio de incrustación desagradable.’
Sin embargo, los resultados también indican una correlación negativa en el caso de las caras asiáticas. Los autores sugieren que esto puede deberse a la transmisión (a través de los datos web-derivados) de percepciones culturales positivas de los asiáticos y las comunidades asiáticas en EE. UU. Los autores declaran*:
‘Observar una correlación entre agradabilidad y probabilidad de la etiqueta de texto asiática puede corresponder al estereotipo de la “minoría modelo”, en el que las personas de ascendencia asiática son elogiadas por su movilidad ascendente y asimilación en la cultura estadounidense, e incluso asociadas con “buen comportamiento”.’
En cuanto al objetivo final, para examinar si lo blanco es la ‘identidad predeterminada’ desde el punto de vista de CLIP, los resultados indican una polaridad incrustada, lo que sugiere que bajo esta arquitectura, es bastante difícil ser ‘un poco blanco’.

Similitud coseno a través de 21.000 imágenes creadas para las pruebas.
Los autores comentan:
‘La evidencia indica que CLIP codifica lo blanco como raza predeterminada. Esto está respaldado por las correlaciones más fuertes entre las similitudes coseno blancas y las similitudes coseno de persona que para cualquier otro grupo racial o étnico.’
*Mi conversión de las citas en línea de los autores a enlaces.
Publicado por primera vez el 24 de mayo de 2022.












