Andersons vinkel
Endring av kjønn og rase i bilde søke resultater med maskinlæring

Et forsknings samarbeid mellom UC San Diego og Adobe (ADBE ) Research har foreslått en innovativ og proaktiv løsning på mangelen på rasemessig og kjønnsdiversitet i bilde søke resultater for tradisjonelt WASP-dominerte yrker: bruken av Generative Adversarial Networks (GANs) for å lage ikke-ekte bilder av ‘forvrengte’ yrker, hvor kjønn og/eller rase til subjektet endres.

I dette eksemplet fra den nye artikkelen, har forskerne input karakteristika for et ønsket bilde som enten ikke er representert i en typisk korpus av tilgjengelig bilde materiale, eller som er representert på en upassende måte (dvs. seksualisert eller på en annen måte upassende representasjon). Kilde
I en ny artikkel med tittelen Generating and Controlling Diversity in Image Search, foreslår forfatterne at det finnes en grense for hvor mye re-ranking kan fikse ubalansen av forvrengte bilde/egenskaps klasser som installatør, maskin operatør, programvare utvikler, og mange andre – og at økning av rasemessig og kjønnsdiversitet med syntetisk data kan være veien fremover for denne utfordringen.
‘Jakten på en utopisk verden krever å gi innhold brukerne mulighet til å presentere noen yrker med diverse rasemessige og kjønnskarakteristika. Det begrensede valget av eksisterende innhold for visse kombinasjoner av yrke, rase og kjønn presenterer en utfordring for innhold leverandører. Nåværende forskning som omhandler bias i søk fokuserer hovedsakelig på re-ranking algoritmer.
‘Men disse metodene kan ikke lage nytt innhold eller endre den overordnede fordelingen av beskyttede attributter i bilder. For å løse disse problemene, foreslår vi en ny oppgave med høytroppig bilde generering som betingelse av flere attributter fra ubalanserte datasett. ‘
For dette formålet har forfatterne eksperimentert med en rekke GAN-baserte bilde syntese systemer, og endte med en arkitektur basert på StyleGan2.

Fra de supplering materiale for artikkelen, to eksempler på ‘utjevning’ av bilde-baserte representasjoner av forvrengte yrker, i disse tilfellene ‘tømrer’ og ‘maskin operatør’. Kilde
Utilstrekkelig eller upassende representert
Forskerne rammer utfordringen i form av en virkelig verden søke resultater for ‘installatør’* på Google Bildeforsøk, observerer at bilde resultater er dominert av unge hvite menn.

Fra artikkelen, utvalgte resultater for ‘installatør’ i Google Bildeforsøk, januar 2021.
Forfatterne bemerker at lignende indikasjoner på bias forekommer for en rekke yrker, som ‘administrativ assistent’, ‘rengjører’ og ‘maskin operatør’, med korresponderende bias for alder, kjønn og rase.
‘Uventet, på grunn av slik samfunnsbias, kan noen kombinasjoner av rase og kjønn ha få eller ingen bilder i et innhold repository. For eksempel, når vi søkte ‘kvinnelig svart (eller afrikansk-amerikansk) maskin operatør’ eller ‘mannlig asiatisk administrativ assistent’, fant vi ikke relevante bilder på [Google Bildeforsøk].
‘I tillegg, i sjeldne tilfeller, kan bestemte kombinasjoner av kjønn og rase føre til at individer blir portrettert upassende. Vi observerte dette mønsteret for søkeforespørsler som ‘kvinnelig asiatisk installatør’ eller ‘kvinnelig svart (eller afrikansk-amerikansk) sikkerhetsvakt.’
Artikkelen henviser til en annen akademisk samarbeid fra 2014, hvor forskerne samlet de øverste 400 bilde søke resultater for 96 yrker. Denne studien fant at kvinner representerte bare 37% av resultater, og anti-stereotypiske bilder bare 22%. En 2019 studie fra Yale fant at fem år hadde ført disse prosentene opp til bare 45% og 30% henholdsvis.
I tillegg klassifiserte 2014-studien seksualiseringen av individer i visse yrker i bilde søke resultater som Sexy Carpenter Problem, med slike upassende klassifiseringer potensielt skjev resultater for yrke gjenkjenning.
Det store bildet
Den primære utfordringen for forfatterne var å produsere et GAN-basert bilde syntese system i stand til å produsere 1024×1024 oppløsning, siden, på den nåværende tilstanden av kunstig intelligens og encoder/decoder-basert bilde syntese systemer, 512×512 er ganske luksuriøst. Noe høyere ville tende til å bli oppnådd ved å oppskale den endelige utdata, på noen kostnad av tid og prosessering ressurser, og på noen risiko for autentisiteten av de genererte bildene.
Men forfatterne statte at lavere oppløsninger ikke kunne forvente å få grep i bilde søk, og eksperimenterte med en rekke GAN-rammer som kunne være i stand til å produsere hi-res bilder på forespørsel, på et akseptabelt nivå av autentisitet.
Når beslutningen ble tatt om å adoptere StyleGan2, ble det tydelig at prosjektet ville trenge større kontroll over under-egenskaper av den genererte utdata (slik som rase, yrke og kjønn), enn en standard deploy tillater. Derfor brukte forfatterne multi-klasse betingelse for å supplere genereringsprosessen.

Arkitekturen til den spesifiserende bilde generatoren, som forfatterne statte ikke er spesifik for StyleGAN2, men kunne bli brukt over en rekke genererings rammer.
For å kontrollere faktorene rase, kjønn og yrke, injiserer arkitekturen en enkelt-skudd encode av disse konkatenerede egenskapene inn i y vektoren. Etter dette, brukes en feedforward nettverk for å innkapsle disse egenskapene, så de ikke blir forkastet på genereringstid.
Forfatterne observerer at det finnes harde begrensninger for hvor mye StyleGAN2 kan manipuleres på denne måten, og at mer finmasket forsøk på å endre resultater resulterte i dårligere bilde kvalitet, og sogar mode collapse.
Disse midlene, imidlertid, løser ikke implisitte bias problemer i arkitekturen, som forskerne måtte adresse ved å oversample under-representerte enheter fra datasettet, men uten å risikere å overfit, som ville påvirke fleksibiliteten av de genererte bilde strømmene.
Derfor tilpasset forfatterne StyleGAN2-ADA, som bruker Adaptive Discriminator Augmentation (ADA), for å forhindre diskriminatoren fra å overfit.
Data generering og evaluering
Ettersom målet med prosjektet er å generere nytt, syntetisk data, adopterte forskerne metodologien til 2014-prosjektet, og valgte en rekke mål yrker som demonstrerer en høy rasemessig og kjønnsbias i bilde søke resultater. Yrker valgt var ‘leder’, ‘administrativ assistent’, ‘sykepleier’, ‘bonde’, ‘militær person’, ‘sikkerhetsvakt’, ‘lastebilsjåfør’, ‘rengjører’, ‘tømrer’, ‘installatør’, ‘maskin operatør’, ‘teknisk støtte person’, ‘programvare utvikler’ og ‘forfatter’.
Forskerne valgte disse yrker ikke bare basert på omfanget av oppfattet bias i bilde søke resultater, men fordi de fleste av dem inneholder en slags visuell komponent som er kodifisert til yrket, som en uniform, eller tilstedeværelsen av spesifikke utstyr eller miljøer.
Datasettet ble fôret med 10 000 bilder fra Adobe Stock biblioteket, vanligvis oppnådde en 95% score eller bedre når de forsøkte å klassifisere et yrke.
Ettersom mange av bildene ikke var nyttige for målet (dvs. de inneholdt ikke mennesker), var manuell filtrering nødvendig. Etter dette, ble en ResNet32-basert klassifisator forhånds trenet på FairFace brukt for å merke bildene for kjønn og rase, og oppnådde en gjennomsnittlig nøyaktighet på 95,7% for kjønn og 81,5% for rase. Dermed fikk forskerne bilde merker for attributtene Kjønn: Mann, Kvinne, Rase: Hvit, Svart, Asiatisk og Andre Raser.
Modeller ble bygget i TensorFlow med StyleGAN2 og StyleGAN2-ADA som kjerne nettverk. Forhåndstrenning ble gjort med StyleGAN2’s forhåndstrente vekter på NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ) dataset, supplert med 34 000 yrkes-spesifikke bilder som forfatterne samlet inn i en separat datasett som de kalte Uncurated Stock-Occupation HQ (U-SOHQ).

Et eksempel på en HIT fra Amazon Mechanical Turk menneskelig evaluering.
Bilder ble generert under fire konfigurasjoner av arkitektur, med Uniform+ som til slutt oppnådde de beste scorene både i FID (automatisert evaluering), og i påfølgende evaluering av Amazon Mechanical Turk arbeidere. Kombinert med Klassifiserings Nøyaktighet, brukte forfatterne dette som en kjerne metrikk for deres egen metrikk, tittet Attributt Sammenstillings Score.

Menneskelig evaluering av bilder generert av ulike metoder, med Uniform+ metoden som viste seg å være mest overbevisende, og deretter grunnlaget for en ny datasett.
Artikkelen nevner ikke om Stock-Occupation-HQ, den fullstendige datasett avledet fra Uniform+, vil bli gjort offentlig tilgjengelig, men nevner at den inneholder 8 113 HQ (1024×1024) bilder.
Diffusjon
Den nye artikkelen behandler ikke eksplisitt hvordan syntetiske, ‘gjenbalanserte’ bilder kan bli introdusert i sirkulasjon. Antageligvis ville å så nye (kostnadsfrie) datamaskin syns datasett med gjenbalanserte bilder av typen forfatterne har skapt, løse problemet med bias, men kunne også presenterer hindringer for andre typer forskning som søker å evaluere kjønn og rase inklusjon i ‘virkelig verden’ scenarier, i en omstendighet hvor syntetiske bilder er blandet med virkelige verden bilder.
Syntetiske databaser som den produsert av forskerne kunne antageligvis bli gjort tilgjengelig uten kostnad som rimelig høyoppløste lager bilder, ved å bruke denne kostnadsbesparende incitamentet som en motor for diffusjon.
Prosjektet behandler ikke aldersbasert bias, antageligvis et potensielt tema av interesse i fremtidig forskning.
* Captured search conducted 5th januar 2022, the authors’ search cited in the paper was conducted in January of 2021.
First published 5th januar 2022.












