Angle d’Anderson

Changer de genre et de race dans les résultats de recherche d’images avec l’apprentissage automatique

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une collaboration de recherche entre l’UC San Diego et Adobe (ADBE ) Research a proposé une solution innovante et proactive pour remédier au manque de diversité raciale et de genre dans les résultats de recherche d’images pour les professions traditionnellement dominées par les WASP: l’utilisation de réseaux antagonistes génératifs (GAN) pour créer des images non réelles de « professions biaisées », où le genre et/ou la race du sujet sont modifiés.

Dans cet exemple du nouveau document, les chercheurs ont saisi les caractéristiques d'une photo souhaitée qui n'est pas représentée dans un corpus typique de matériel d'image disponible, ou qui est représentée de manière inappropriée (par exemple, sexualisée ou dans une représentation autrement inappropriée). Source

Dans cet exemple du nouveau document, les chercheurs ont saisi les caractéristiques d’une photo souhaitée qui n’est pas représentée dans un corpus typique de matériel d’image disponible, ou qui est représentée de manière inappropriée (par exemple, sexualisée ou dans une représentation autrement inappropriée). Source

Dans un nouveau document intitulé Générer et contrôler la diversité dans les résultats de recherche d’images, les auteurs suggèrent qu’il existe une limite à la mesure dans laquelle le reclassement peut corriger le déséquilibre des classes d’images/fonctions biaisées telles que plombier, opérateur de machine, ingénieur logiciel, et bien d’autres – et que l’augmentation de la diversité raciale et de genre avec des données synthétiques peut être la voie à suivre pour relever ce défi.

‘La poursuite d’un monde utopique exige que les utilisateurs de contenu aient la possibilité de présenter n’importe quelle profession avec des caractéristiques raciales et de genre diverses. Le choix limité de contenu existant pour certaines combinaisons de profession, de race et de genre présente un défi pour les fournisseurs de contenu. Les recherches actuelles sur les biais dans les résultats de recherche se concentrent principalement sur les algorithmes de reclassement.

‘Cependant, ces méthodes ne peuvent pas créer de nouveau contenu ou modifier la distribution globale des attributs protégés dans les photos. Pour remédier à ces problèmes, nous proposons une nouvelle tâche de génération d’images de haute fidélité conditionnée à plusieurs attributs à partir de jeux de données déséquilibrés. ‘

Pour cela, les auteurs ont expérimenté avec divers systèmes de synthèse d’images basés sur GAN, finissant par s’arrêter sur une architecture basée sur StyleGan2.

À partir des matériaux supplémentaires du document, deux exemples de « mise à niveau » des représentations d'images de professions biaisées, dans ce cas, « charpentier » et « opérateur de machine ». Source

À partir des matériaux supplémentaires du document, deux exemples de « mise à niveau » des représentations d’images de professions biaisées, dans ce cas, « charpentier » et « opérateur de machine ». Source

Insuffisamment ou inappropriément représentés

Les chercheurs présentent le défi en termes de résultats de recherche réels pour « plombier »* sur Google Image Search, observant que les résultats d’images sont dominés par de jeunes hommes blancs.

À partir du document, résultats sélectionnés pour « plombier » dans Google Image Search, janvier 2021.

À partir du document, résultats sélectionnés pour « plombier » dans Google Image Search, janvier 2021.

Les auteurs notent que des indications similaires de biais se produisent pour une gamme de professions, telles que « assistant administratif », « nettoyeur » et « opérateur de machine », avec des biais correspondants pour l’âge, le genre et la race.

‘Il n’est pas surprenant, en raison de tels biais sociétaux, que certaines combinaisons de race et de genre puissent avoir peu ou pas d’images dans un référentiel de contenu. Par exemple, lorsque nous avons recherché « opératrice de machine noire (ou afro-américaine) » ou « assistant administratif masculin asiatique », nous n’avons pas trouvé d’images pertinentes sur [Google Image Search].

‘En outre, dans de rares cas, certaines combinaisons de genre et de race peuvent conduire à ce que les individus soient représentés de manière inappropriée. Nous avons observé ce comportement pour des requêtes de recherche telles que « plombier asiatique féminin » ou « gardien de sécurité noir (ou afro-américain) ».

Le document cite une autre collaboration universitaire de 2014, où les chercheurs ont collecté les 400 premiers résultats de recherche d’images pour 96 professions. Cette étude a constaté que les femmes ne représentaient que 37 % des résultats, et les images anti-stéréotypées seulement 22 %. Une étude de 2019 de Yale a constaté que cinq ans avaient porté ces pourcentages à seulement 45 % et 30 % respectivement.

De plus, l’étude de 2014 a classé la sexualisation des individus dans certaines professions dans les résultats de recherche d’images comme le problème du charpentier sexy, avec de telles classifications inappropriées pouvant potentiellement fausser les résultats de la reconnaissance de profession.

L’image d’ensemble

Le défi principal pour les auteurs était de produire un système de synthèse d’images basé sur GAN capable de sortir des images en résolution 1024×1024, puisque, à l’état actuel de l’art dans les systèmes de synthèse d’images basés sur GAN et encodeur/décodeur, 512×512 est déjà un luxe. Tout ce qui est supérieur tendrait à être obtenu en mettant à l’échelle la sortie finale, au prix d’un temps et de ressources de traitement, et au risque de l’authenticité des images générées.

Cependant, les auteurs déclarent que des résolutions inférieures ne pourraient pas espérer gagner en traction dans les résultats de recherche d’images, et ont expérimenté avec divers cadres de GAN qui pourraient être capables de sortir des images haute résolution à la demande, à un niveau d’authenticité acceptable.

Lorsque la décision a été prise d’adopter StyleGan2, il est devenu apparent que le projet aurait besoin d’un contrôle plus grand sur les sous-fonctions de la sortie générée (telles que la race, la profession et le genre), que ce que permet une déploiement par défaut. Par conséquent, les auteurs ont utilisé un conditionnement multi-classe pour augmenter le processus de génération.

L'architecture du générateur d'images spécifiant, que les auteurs déclarent ne pas être spécifique à StyleGAN2, mais qui pourrait être appliquée à travers une gamme de cadres de générateurs.

L’architecture du générateur d’images spécifiant, que les auteurs déclarent ne pas être spécifique à StyleGAN2, mais qui pourrait être appliquée à travers une gamme de cadres de générateurs.

Pour contrôler les facteurs de race, de genre et de profession, l’architecture injecte un code unique de ces caractéristiques concaténées dans le y vector. Après cela, un réseau feedforward est utilisé pour intégrer ces fonctionnalités, afin qu’elles ne soient pas ignorées au moment de la génération.

Les auteurs observent qu’il existe des limites difficiles à la mesure dans laquelle StyleGAN2 peut être manipulé de cette manière, et que des tentatives plus fines pour modifier les résultats ont abouti à une qualité d’image plus faible, et même à une effondrement de mode.

Ces remèdes, cependant, ne résolvent pas les problèmes de biais implicite dans l’architecture, que les chercheurs ont dû aborder en sur-échantillonnant les entités sous-représentées dans le jeu de données, mais sans risquer de sur-ajuster, ce qui affecterait la flexibilité des flux d’images générées.

Par conséquent, les auteurs ont adapté StyleGAN2-ADA, qui utilise une augmentation discriminative adaptative (ADA), pour empêcher le discriminant de sur-ajuster.

Génération et évaluation des données

Puisque l’objectif du projet est de générer de nouvelles données synthétiques, les chercheurs ont adopté la méthodologie du projet de 2014, en choisissant un certain nombre de professions cibles qui démontrent un biais racial et de genre élevé. Les professions choisies étaient « gestionnaire exécutif », « assistant administratif », « infirmière », « agriculteur », « personne militaire », « gardien de sécurité », « chauffeur de camion », « nettoyeur », « charpentier », « plombier », « opérateur de machine », « technicien de support », « ingénieur logiciel » et « écrivain ».

Les auteurs ont sélectionné ces professions non seulement en fonction de l’étendue du biais perçu dans les résultats de recherche d’images, mais également parce que la plupart d’entre elles contiennent une sorte de composant visuel codifié pour la profession, tel qu’un uniforme, ou la présence d’équipements ou d’environnements spécifiques.

Le jeu de données a été alimenté par 10 000 images de la bibliothèque Adobe Stock, obtenant généralement un score de 95 % ou mieux lors de la tentative de classification d’une profession.

Puisque de nombreuses images n’étaient pas utiles pour la tâche cible (c’est-à-dire qu’elles ne contenaient pas de personnes), un filtrage manuel a été nécessaire. Après cela, un classificateur ResNet32 pré-entraîné sur FairFace a été utilisé pour étiqueter les images pour le genre et la race, obtenant une précision moyenne de 95,7 % pour le genre et 81,5 % pour la race. Ainsi, les chercheurs ont obtenu des étiquettes d’images pour les attributs Sexe: Masculin, Féminin, Race: Blanc, Noir, Asiatique et autres races.

Les modèles ont été construits dans TensorFlow en utilisant StyleGAN2 et StyleGAN2-ADA comme réseaux principaux. L’entraînement préalable a été effectué avec les poids pré-entraînés de StyleGAN2 sur le jeu de données Flickr-Faces-HQ (FFHQ) de NVIDIA, augmenté de 34 000 images spécifiques à la profession que les auteurs ont rassemblées dans un jeu de données distinct qu’ils ont appelé Uncurated Stock-Occupation HQ (U-SOHQ).

Un exemple de tâche HIT de l'évaluation humaine d'Amazon Mechanical Turk.

Un exemple de tâche HIT de l’évaluation humaine d’Amazon Mechanical Turk.

Les images ont été générées sous quatre configurations d’architecture, avec Uniform+ obtenant finalement les meilleurs scores à la fois en FID (évaluation automatisée) et dans l’évaluation ultérieure par les travailleurs d’Amazon Mechanical Turk. Combiné avec la précision de classification, les auteurs ont utilisé cela comme métrique principale pour leur propre métrique, intitulée Score de correspondance d’attributs.

Évaluation humaine des images générées par diverses méthodes, avec la méthode Uniform+ se révélant la plus convaincante, et par la suite la base d'un nouveau jeu de données.

Évaluation humaine des images générées par diverses méthodes, avec la méthode Uniform+ se révélant la plus convaincante, et par la suite la base d’un nouveau jeu de données.

Le document ne précise pas si Stock-Occupation-HQ, le jeu de données complet dérivé de Uniform+, sera rendu public, mais indique qu’il contient 8 113 images HQ (1024×1024).

Diffusion

Le nouveau document ne traite pas explicitement de la manière dont les images synthétisées « rééquilibrées » pourraient être introduites dans la circulation. Présomptivement, alimenter de nouvelles bases de données d’apprentissage automatique (gratuites) avec des images rééquilibrées de ce type que les auteurs ont créées résoudrait le problème de biais, mais pourrait également présenter des obstacles à d’autres types de recherches qui cherchent à évaluer l’inclusion de genre et de race dans des scénarios « mondiaux réels », dans une circonstance où des images synthétiques sont mélangées avec des images du monde réel.

Des bases de données synthétiques telles que celles produites par les chercheurs pourraient présumablement être mises à disposition à titre gracieux en tant qu’images de stock à résolution raisonnablement élevée, en utilisant cet incitant d’économie de coûts comme moteur de diffusion.

Le projet ne traite pas du biais basé sur l’âge, qui est présumé être un sujet d’intérêt potentiel pour les recherches futures.

 

* Recherche capturée le 5 janvier 2022, la recherche des auteurs citée dans le document a été menée en janvier 2021.

 

Publié pour la première fois le 5 janvier 2022.

Rédacteur spécialisé en apprentissage automatique, expert du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Site Web: martinanderson.ai
Contact: martin@martinanderson.ai