Andersons hoek
Geslacht en ras in afbeeldingszoekresultaten veranderen met machine learning

Een onderzoeksproject van UC San Diego en Adobe (ADBE ) Research heeft een innovatieve en proactieve oplossing voorgesteld voor het gebrek aan raciale en geslachtsdiversiteit in afbeeldingszoekresultaten voor traditioneel WASP-gedominieerde beroepen: het gebruik van Generative Adversarial Networks (GAN’s) om niet-reële afbeeldingen van ‘bevooroordeelde’ beroepen te creëren, waarbij het geslacht en/of ras van het onderwerp wordt gewijzigd.

In dit voorbeeld uit het nieuwe artikel hebben de onderzoekers invoerkenmerken voor een gewenste foto die niet vertegenwoordigd is in een typische verzameling van beschikbare afbeeldingsmateriaal, of anderszins op een ongepaste manier wordt weergegeven (bijv. geseksualiseerd of op een andere ongepaste manier). Bron
In een nieuw artikel getiteld Generating and Controlling Diversity in Image Search, stellen de auteurs voor dat er een limiet is aan de mate waarin herordenen de onevenwichtigheid van bevooroordeelde afbeeldings-/kenmerkclasses zoals loodgieter, machineoperator, software-engineer en vele anderen kan verhelpen – en dat het verhogen van raciale en geslachtsdiversiteit met synthetische gegevens mogelijk de weg vooruit is voor deze uitdaging.
‘De verwezenlijking van een utopische wereld vereist dat gebruikers van inhoud de mogelijkheid krijgen om elk beroep met diverse raciale en geslachtskenmerken weer te geven. De beperkte keuze aan bestaande inhoud voor bepaalde combinaties van beroep, ras en geslacht vormt een uitdaging voor inhoudsleveranciers. Huidig onderzoek naar vooroordelen in zoekopdrachten richt zich voornamelijk op herordeningsalgoritmen.
‘Echter, deze methoden kunnen geen nieuwe inhoud creëren of de algehele verdeling van beschermde kenmerken in foto’s veranderen. Om deze problemen te verhelpen, stellen we een nieuwe taak voor van het genereren van hoge-kwaliteit afbeeldingen op basis van meerdere kenmerken uit onevenwichtige datasets. ‘
Daartoe hebben de auteurs geëxperimenteerd met een reeks GAN-gebaseerde beeldsynthesesystemen, waarbij ze uiteindelijk zijn uitgekomen op een architectuur gebaseerd op StyleGan2.

Uit de aanvullende materialen voor het artikel, twee voorbeelden van ‘gelijktrekken’ van beeldgebaseerde voorstellingen van bevooroordeelde beroepen, in dit geval ‘timmerman’ en ‘machineoperator’. Bron
Onvoldoende of ongepast vertegenwoordigd
De onderzoekers formuleren de uitdaging in termen van een reële zoekresultaat voor ‘loodgieter’* op Google Afbeeldingen, waarbij ze opmerken dat de afbeeldingsresultaten gedomineerd worden door jonge blanke mannen.

Uit het artikel, selectie van resultaten voor ‘loodgieter’ in Google Afbeeldingen, januari 2021.
De auteurs merken op dat soortgelijke indicaties van vooroordelen optreden voor een reeks beroepen, zoals ‘administratief medewerker’, ‘schoonmaker’ en ‘machineoperator’, met overeenkomstige vooroordelen voor leeftijd, geslacht en ras.
‘Het is niet verwonderlijk dat, vanwege dergelijke sociaal vooroordeel, sommige combinaties van ras en geslacht weinig of geen afbeeldingen in een inhoudsrepository kunnen hebben. Bijvoorbeeld, toen we zochten naar ‘vrouwelijke zwarte (of Afrikaans-Amerikaanse) machineoperator’ of ‘mannelijke Aziatische administratief medewerker’, vonden we geen relevante afbeeldingen op [Google Afbeeldingen].
‘Bovendien kan in zeldzame gevallen een bepaalde combinatie van geslacht en ras ertoe leiden dat personen op een ongepaste manier worden afgebeeld. We hebben dit gedrag waargenomen bij zoekopdrachten zoals ‘vrouwelijke Aziatische loodgieter’ of ‘vrouwelijke zwarte (of Afrikaans-Amerikaanse) beveiligingsbeambte.’
Het artikel citeert een andere academische samenwerking uit 2014, waarin onderzoekers de top 400 afbeeldingszoekresultaten voor 96 beroepen verzamelden. Dat onderzoek toonde aan dat vrouwen slechts 37% van de resultaten vertegenwoordigden, en anti-stereotypische afbeeldingen slechts 22%. Een onderzoek uit 2019 van Yale toonde aan dat vijf jaar deze percentages had verhoogd tot respectievelijk 45% en 30%.
Het grotere plaatje
De primaire uitdaging voor de auteurs was het produceren van een GAN-gebaseerd beeldsynthesesysteem dat in staat is om afbeeldingen met een resolutie van 1024×1024 te produceren, aangezien, op het huidige niveau van de staat van de kunst in GAN- en encoder/decoder-gebaseerde beeldsynthesesystemen, 512×512 vrij luxueus is. Iets hoger zou tendensen hebben om te worden verkregen door het uiteindelijke resultaat op te schalen, tegen een bepaalde kosten van tijd en verwerkingsbronnen, en tegen een bepaald risico voor de authenticiteit van de gegenereerde afbeeldingen.
De auteurs verklaren echter dat lagere resoluties niet kunnen verwachten om tractie te krijgen in afbeeldingszoekresultaten, en hebben geëxperimenteerd met een reeks GAN-kaders die in staat zouden zijn om hoge-resolutie-afbeeldingen op aanvraag te produceren, op een aanvaardbaar niveau van authenticiteit.
Toen de beslissing werd genomen om StyleGan2 te adopteren, werd het duidelijk dat het project meer controle nodig had over subfuncties van de gegenereerde uitvoer (zoals ras, beroep en geslacht), dan een standaardimplementatie toestaat. Daarom hebben de auteurs multi-class-conditioning gebruikt om het generatieproces te versterken.

De architectuur van de specificerende beeldgenerator, die de auteurs verklaren niet specifiek is voor StyleGAN2, maar kan worden toegepast op een reeks generator-kaders.
Om de factoren van ras, geslacht en beroep te controleren, injecteert de architectuur een one-shot-encode van deze geconjugeerde kenmerken in de y-vector. Vervolgens wordt een feedforward-netwerk gebruikt om deze kenmerken te embedden, zodat ze niet worden genegeerd bij de generatie.
De auteurs merken op dat er harde limieten zijn aan de mate waarin StyleGAN2 op deze manier kan worden gemanipuleerd, en dat meer fijngewerkte pogingen om de resultaten te veranderen hebben geresulteerd in slechtere beeldkwaliteit, en zelfs mode collapse.
Deze remedies lossen echter de impliciete vooroordeelproblemen in de architectuur niet op, die de onderzoekers moesten aanpakken door ondervertegenwoordigde entiteiten uit de dataset te oversamplen, zonder het risico te lopen om over te fit, wat de flexibiliteit van de gegenereerde beeldstromen zou beïnvloeden.
Daarom hebben de auteurs StyleGAN2-ADA aangepast, dat Adaptive Discriminator Augmentation (ADA) gebruikt, om te voorkomen dat de discriminator overpast.
Gegevensgeneratie en evaluatie
Aangezien het doel van het project is om nieuwe, gesynthetiseerde gegevens te genereren, hebben de onderzoekers de methodologie van het project uit 2014 geadopteerd, waarbij een aantal doelberoepen is geselecteerd die een hoge raciale en geslachtsvooroordeel vertonen. De geselecteerde beroepen waren ‘uitvoerend manager’, ‘administratief medewerker’, ‘verpleegster’, ‘boer’, ‘militair’, ‘beveiligingsbeambte’, ‘truckchauffeur’, ‘schoonmaker’, ‘timmerman’, ‘loodgieter’, ‘machineoperator’, ‘technisch ondersteuningspersoon’, ‘software-engineer’ en ‘schrijver.’
De auteurs hebben deze beroepen geselecteerd niet alleen op basis van de mate van waargenomen vooroordeel in afbeeldingszoekresultaten, maar omdat de meeste van hen een soort visueel component bevatten dat is gecodeerd voor het beroep, zoals een uniform, of de aanwezigheid van specifiek gereedschap of omgevingen.
De dataset werd gevoed door 10.000 afbeeldingen uit de Adobe Stock-bibliotheek, die doorgaans een score van 95% of beter behaalden bij het classificeren van een beroep.
Aangezien veel van de afbeeldingen niet nuttig waren voor de doeltaak (d.w.z. ze bevatten geen personen), was handmatig filteren noodzakelijk. Vervolgens werd een ResNet32-gebaseerde classificator getraind op FairFace gebruikt om de afbeeldingen te labelen voor geslacht en ras, met een gemiddelde nauwkeurigheid van 95,7% voor geslacht en 81,5% voor ras. Zo kregen de onderzoekers afbeeldingslabels voor de kenmerken Geslacht: Man, Vrouw, Ras: Wit, Zwart, Aziatisch en andere rassen.
Modellen werden gebouwd in TensorFlow met StyleGAN2 en StyleGAN2-ADA als core-netwerken. Pre-training werd gedaan met StyleGAN2’s pre-getrainde gewichten op de NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ) dataset, aangevuld met 34.000 beroepspecifieke afbeeldingen die de auteurs verzamelden in een aparte dataset die ze Uncurated Stock-Occupation HQ (U-SOHQ) noemden.

Een voorbeeld van een HIT uit de Amazon Mechanical Turk-menselijke evaluatie.
Afbeeldingen werden gegenereerd onder vier configuraties van architectuur, waarbij Uniform+ uiteindelijk de beste scores behaalde, zowel in FID (geautomatiseerde evaluatie) als in de daaropvolgende evaluatie door Amazon Mechanical Turk-werkers. In combinatie met Classificatie-nauwkeurigheid gebruikten de auteurs dit als een core-metric voor hun eigen metric, getiteld Kenmerk-overeenkomst-score.

Menselijke evaluatie van afbeeldingen gegenereerd door verschillende methoden, met de Uniform+-methode als meest overtuigend, en vervolgens als basis voor een nieuwe dataset.
Het artikel vermeldt niet of Stock-Occupation-HQ, de volledige dataset afgeleid van Uniform+, openbaar beschikbaar zal worden gemaakt, maar vermeldt dat het 8.113 HQ-afbeeldingen (1024×1024) bevat.
Diffusie
Het nieuwe artikel behandelt niet expliciet de manier waarop gesynthetiseerde, ‘herbalanceerde’ afbeeldingen in omloop kunnen worden gebracht. Vermoedelijk zou het opnemen van nieuwe (kosteloze) computer-visie-datasets met herbalanceerde afbeeldingen van het type dat de auteurs hebben gemaakt, het probleem van vooroordeel oplossen, maar zou ook obstakels kunnen creëren voor andere soorten onderzoek die de inclusie van geslacht en ras in ‘reële wereld’-scenario’s willen evalueren, in een situatie waarin synthetische afbeeldingen worden gemengd met reële wereld-afbeeldingen.
Synthetische databases zoals die gegenereerd door de onderzoekers, kunnen vermoedelijk kosteloos beschikbaar worden gesteld als redelijk hoge-resolutie-stock-afbeeldingen, met behulp van deze kostenbesparende stimulans als een motor van diffusie.
Het project behandelt geen leeftijdsgebonden vooroordeel, vermoedelijk een potentieel onderwerp van interesse in toekomstig onderzoek.
* Gezochte zoekopdracht uitgevoerd op 5 januari 2022, de zoekopdracht van de auteurs vermeld in het artikel werd uitgevoerd in januari 2021.
Voor het eerst gepubliceerd op 5 januari 2022.












