Andersons vinkel
Ændring af køn og race i billedsøgeresultater med maskinlæring

Et forskningssamarbejde mellem UC San Diego og Adobe (ADBE ) Research har foreslået en innovativ og proaktiv løsning til manglen på racemæssig og kønsdiversitet i billedsøgeresultater for traditionelt WASP-dominerede erhverv: brugen af Generative Adversarial Networks (GANs) til at skabe ikke-eksisterende billeder af ‘fordommede’ erhverv, hvor køn og/eller race af subjektet ændres.

I dette eksempel fra den nye artikel, har forskerne indtastet karakteristika for et ønsket billede, der enten ikke er repræsenteret i en typisk samling af tilgængeligt billedmateriale, eller også er repræsenteret på en upassende måde (f.eks. seksualiseret eller på en anden måde upassende repræsentation). Kilde
I en ny artikel med titlen Generating and Controlling Diversity in Image Search, foreslår forfatterne, at der er en grænse for, hvor langt re-rangering kan løse ubalancen af fordommede billed-/funktionsklasser som f.eks. vedligeholdelsesarbejder, maskinoperatør, softwareingeniør og mange andre – og at øgning af racemæssig og kønsdiversitet med syntetisk data måske er vejen fremad for denne udfordring.
‘Forfølgelsen af en utopisk verden kræver, at man giver brugerne af indhold mulighed for at præsentere enhver erhverv med diverse racemæssige og kønskarakteristika. Det begrænsede valg af eksisterende indhold for visse kombinationer af erhverv, race og køn præsenterer en udfordring for indholdsudbydere. Nuværende forskning, der beskæftiger sig med fordomme i søgning, fokuserer hovedsagelig på re-rangeringsalgoritmer.
‘Men disse metoder kan ikke skabe nyt indhold eller ændre den overordnede fordeling af beskyttede attributter i billeder. For at løse disse problemer foreslår vi en ny opgave med højtroppet billedgenerering under betingelse af multiple attributter fra ubalancerede datasæt. ‘
Til dette formål har forfatterne eksperimenteret med en række GAN-baserede billedsynthesesystemer, og endte med en arkitektur baseret på StyleGan2.

Fra supplerende materiale til artiklen, to eksempler på ‘ligevægning’ af billedbaserede repræsentationer af fordommede erhverv, i disse tilfælde ‘tømrer’ og ‘maskinoperatør’. Kilde
Utilstrækkeligt eller upassende repræsenteret
Forskerne rammer udfordringen i form af en reel søgeresultat for ‘vedligeholdelsesarbejder’* på Google Billedsøgning, og observerer, at billedresultaterne er domineret af unge hvide mænd.

Fra artiklen, udvalgte resultater for ‘vedligeholdelsesarbejder’ i Google Billedsøgning, januar 2021.
Forfatterne bemærker, at lignende tegn på fordomme optræder for en række erhverv, såsom ‘administrativ assistent’, ‘rengøringsassistent’ og ‘maskinoperatør’, med korresponderende fordomme for alder, køn og race.
‘Utilstrækkeligt, på grund af sådanne samfundsforbud, kan visse kombinationer af race og køn have få eller ingen billeder i en indholdssamling. For eksempel, da vi søgte efter ‘kvindelig sort (eller afrikansk-amerikansk) maskinoperatør’ eller ‘mandlig asiatisk administrativ assistent’, fandt vi ikke relevante billeder på [Google Billedsøgning].
‘Derudover kan visse kombinationer af køn og race i sjældne tilfælde føre til, at personer bliver portrætteret upassende. Vi observerede dette adfærdsmønster for søgeforespørgsler som ‘kvindelig asiatisk vedligeholdelsesarbejder’ eller ‘kvindelig sort (eller afrikansk-amerikansk) sikkerhedsvagt.’
Artiklen citerer en anden akademisk samarbejdsartikel fra 2014, hvor forskerne samlede de øverste 400 billedsøgeresultater for 96 erhverv. Denne artikel fandt, at kvinder repræsenterede kun 37% af resultaterne, og anti-stereotypiske billeder kun 22%. En 2019-undersøgelse fra Yale fandt, at fem år havde ført disse procenttal op til kun 45% og 30% henholdsvis.
Derudover klassificerede 2014-undersøgelsen seksualiseringen af personer i visse erhverv i billedsøgeresultater som Sexy Carpenter Problem, med sådanne upassende klassificeringer potentielt skævvridende resultater for erhvervs-genkendelse.
Det store billede
Den primære udfordring for forfatterne var at producere et GAN-baseret billedsynthesesystem i stand til at producere 1024×1024 opløsning, da, i den nuværende tilstand af kunstig intelligens og encoder/decoder-baseret billedsynthese, 512×512 er ret luksuriøst. Noget højere ville tende til at opnås ved at opskalere den endelige output, på bekostning af tid og procesressourcer, og på bekostning af billedernes ægthed.
Forfatterne mener, at lavere opløsninger ikke kan forventes at få fodfæste i billedsøgning, og eksperimenterede med en række GAN-rammer, der kunne være i stand til at producere hi-res billeder på krav, på et acceptabelt niveau af ægthed.
Da beslutningen blev taget om at adoptere StyleGan2, blev det tydeligt, at projektet ville have brug for større kontrol over underfunktioner af den genererede output (såsom race, erhverv og køn), end en standardudgave tillader. Derfor brugte forfatterne multi-klasse-betingelse til at supplere genereringsprocessen.

Arkitekturen af den specifikke billedgenerator, som forfatterne mener ikke er specifik for StyleGAN2, men kan anvendes på en række generator-rammer.
For at kontrollere faktorerne for race, køn og erhverv, injicerer arkitekturen en enkelt-udgave-encoding af disse sammensatte karakteristika i y-vektoren. Efter dette bruges en feedforward-netværk til at indlejre disse funktioner, så de ikke bliver ignoreret under genereringstid.
Forfatterne observerer, at der er hårde begrænsninger for, hvor langt StyleGAN2 kan manipuleres på denne måde, og at mere finmasket forsøg på at ændre resultaterne resulterede i dårligere billedkvalitet, og endda mode collapse.
Disse foranstaltninger løser dog ikke implicit bias-problemer i arkitekturen, som forskerne havde brug for at tackle ved at oversample underrepræsenterede enheder fra datasættet, uden at risikere at overfit, hvilket ville påvirke fleksibiliteten af de genererede billedstrømme.
Derfor tilpassede forfatterne StyleGAN2-ADA, som bruger Adaptive Discriminator Augmentation (ADA), til at forhindre, at diskriminatoren overfittede.
Data generering og evaluering
Da projektets formål er at generere nyt, syntetisk data, adopterede forskerne metoden fra 2014-projektet, og valgte en række mål-erhverv, der viser en høj racemæssig og kønsforudindtagelse. Erhvervene, der blev valgt, var ‘leder’, ‘administrativ assistent’, ‘sygeplejerske’, ‘landmand’, ‘militærperson’, ‘sikkerhedsvagt’, ‘lastvognschauffør’, ‘rengøringsassistent’, ‘tømrer’, ‘vedligeholdelsesarbejder’, ‘maskinoperatør’, ‘teknisk supportperson’, ‘softwareingeniør’ og ‘forfatter.’
Forfatterne valgte disse erhverv ikke kun på grund af omfanget af den opfattede fordom i billedsøgeresultater, men også fordi de fleste af dem indeholder en vis visuel komponent, der er kodificeret til erhvervet, såsom en uniform eller tilstedeværelsen af specifik udstyr eller miljøer.
Datasættet blev fødet med 10.000 billeder fra Adobe Stock-biblioteket, typisk med en score på 95% eller bedre, når de forsøgte at klassificere et erhverv.
Da mange af billederne ikke var nyttige for det målrettede formål (dvs. de indeholdt ikke mennesker), var manuel filtrering nødvendig. Efter dette blev en ResNet32-baseret klassificator, der var forudtrænet på FairFace, brugt til at mærke billederne for køn og race, med en gennemsnitlig nøjagtighed på 95,7% for køn og 81,5% for race. Derfor fik forskerne billedmærker for attributterne Køn: Mand, Kvinde, Race: Hvid, Sort, Asiatisk og Andre Racer.
Modellerne blev bygget i TensorFlow med StyleGAN2 og StyleGAN2-ADA som kerne-netværk. Forudtræning blev gjort med StyleGAN2’s forudtrænede vægte på NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ) datasæt, suppleret med 34.000 erhvervsspecifikke billeder, som forfatterne samlede i et separat datasæt, som de kaldte Uncurated Stock-Occupation HQ (U-SOHQ).

Et eksempel på en HIT fra Amazon Mechanical Turk-menneskeevaluering.
Billeder blev genereret under fire konfigurationer af arkitekturen, med Uniform+ som endte med at få de bedste score både i FID (automatisk evaluering) og i efterfølgende evaluering af Amazon Mechanical Turk-arbejdere. Kombineret med klassificeringsnøjagtighed brugte forfatterne dette som en kerne-metrik for deres egen metrik, kaldet Attribute Matching Score.

Menneskeevaluering af billeder genereret af forskellige metoder, med Uniform+-metoden som den mest overbevisende, og derefter grundlag for et nyt datasæt.
Artiklen nævner ikke, om Stock-Occupation-HQ, det fulde datasæt afledt fra Uniform+, vil blive gjort offentligt tilgængeligt, men nævner, at det indeholder 8.113 HQ (1024×1024) billeder.
Diffusion
Den nye artikel behandler ikke eksplitt den måde, hvorpå syntetiske, ‘genbalancerede’ billeder kan introduceres i cirkulation. Formentlig ville seeding nye (omkostningsfrie) computer-vision datasæt med genbalancerede billeder af den type, forfatterne har skabt, løse problemet med fordom, men kunne også præsentere hindringer for andre typer af forskning, der søger at evaluere køns- og racemæssig inklusion i ‘virkelige’ scenarier, i en situation, hvor syntetiske billeder er blandet med virkelige billeder.
Syntetiske databaser som den, der er produceret af forskerne, kunne formentlig blive gjort tilgængelige uden omkostninger som rimeligt højopløst lager-billedmateriale, ved at bruge denne omkostningsreducerende incitament som en motor for diffusion.
Projektet behandler ikke aldersbaseret fordom, formentlig et potentiale emne af interesse i fremtidig forskning.
* Captured search udført 5. januar 2022, forfatternes søgning citeret i artiklen blev udført i januar 2021.
Først udgivet 5. januar 2022.












