Andersons vinkel

Ändra kön och ras i bildsökresultat med maskinlärande

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En forskningssamarbete mellan UC San Diego och Adobe (ADBE ) Research har föreslagit en innovativ och proaktiv lösning för bristen på ras- och könsdiversitet i bildsökresultat för traditionellt WASP-dominerade yrken: användningen av Generative Adversarial Networks (GANs) för att skapa icke-verkliga bilder av “fördomsfulla” yrken, där kön och/eller ras hos ämnet ändras.

I detta exempel från den nya artikeln har forskarna angett egenskaper för en önskad bild som antingen inte finns representerad i en typisk samling av tillgängligt bildmaterial eller som representeras på ett olämpligt sätt (t.ex. sexualiserat eller på annat sätt olämpligt). Källa

I detta exempel från den nya artikeln har forskarna angett egenskaper för en önskad bild som antingen inte finns representerad i en typisk samling av tillgängligt bildmaterial eller som representeras på ett olämpligt sätt (t.ex. sexualiserat eller på annat sätt olämpligt). Källa

I en ny artikel med titeln Generating and Controlling Diversity in Image Search föreslår författarna att det finns en gräns för hur mycket omrankning kan åtgärda obalansen av fördomsfulla bild-/funktionsklasser som t.ex. rörmokare, maskinoperatör, programvaruutvecklare och många andra – och att ökad ras- och könsdiversitet med syntetisk data kan vara vägen framåt för denna utmaning.

‘Jakten på en utopisk värld kräver att man ger innehållsanvändare möjlighet att presentera alla yrken med olika ras- och könskarakteristika. Det begränsade urvalet av befintligt innehåll för vissa kombinationer av yrke, ras och kön presenterar en utmaning för innehållsleverantörer. Nuvarande forskning som hanterar fördomar i sökning fokuserar främst på omrankningsalgoritmer.

‘Men dessa metoder kan inte skapa nytt innehåll eller ändra den övergripande fördelningen av skyddade attribut i bilder. För att lösa dessa problem föreslår vi en ny uppgift för högkvalitativ bildgenerering som villkorsstyrs av flera attribut från obalanserade datamängder. ‘

För detta ändamål har författarna experimenterat med olika GAN-baserade bildsyntesystem, och slutligen fastnat för en arkitektur baserad på StyleGan2.

Från den nya artikeln, två exempel på 'jämnställda' bildbaserade representationer av fördomsfulla yrken, i detta fall 'snickare' och 'maskinoperatör'. Källa

Från den nya artikeln, två exempel på ‘jämnställda’ bildbaserade representationer av fördomsfulla yrken, i detta fall ‘snickare’ och ‘maskinoperatör’. Källa

Undermåligt eller olämpligt representerade

Forskarna beskriver utmaningen i termer av ett verkligt sökresultat för ‘rörmokare’ på Google Bildsök, och observerar att bildresultaten domineras av unga vita män.

Från artikeln, utvalda resultat för 'rörmokare' på Google Bildsök, januari 2021.

Från artikeln, utvalda resultat för ‘rörmokare’ på Google Bildsök, januari 2021.

Författarna noterar att liknande tecken på fördomar förekommer för en rad yrken, som ‘administrativ assistent’, ‘städare’ och ‘maskinoperatör’, med motsvarande fördomar för ålder, kön och ras.

‘Förväntat, på grund av sådan samhällelig fördom, kan vissa kombinationer av ras och kön ha få eller inga bilder i en innehållsrepository. Till exempel, när vi sökte efter ‘svart (eller afroamerikansk) kvinnlig maskinoperatör’ eller ‘manlig asiatisk administrativ assistent’, hittade vi inga relevanta bilder på [Google Bildsök].

‘Dessutom, i sällsynta fall, kan vissa kombinationer av kön och ras leda till att individer porträtteras olämpligt. Vi observerade detta beteende för sökfrågor som ‘asiatisk kvinnlig rörmokare’ eller ‘svart (eller afroamerikansk) kvinnlig säkerhetsvakt.’

Artikeln citerar ett annat akademiskt samarbete från 2014, där forskare samlade in de 400 bästa bildsökresultaten för 96 yrken. Den studien fann att kvinnor representerade endast 37% av resultaten, och anti-stereotypa bilder endast 22%. En studie från Yale 2019 fann att fem år hade ökat dessa procentsatser till endast 45% respektive 30%.

Den stora bilden

Den primära utmaningen för författarna var att producera ett GAN-baserat bildsyntesystem som kunde generera bilder med en upplösning på 1024×1024, eftersom den nuvarande tillståndet för GAN och encoder/decoder-baserade bildsyntesystem är 512×512.

Men författarna påpekar att lägre upplösningar inte kan förväntas vinna gehör i bildsökning, och experimenterade med olika GAN-ramverk som kunde generera högupplösta bilder på begäran, på ett acceptabelt autenticitetsnivå.

När beslutet togs att anta StyleGan2, blev det uppenbart att projektet skulle behöva större kontroll över underfunktioner i den genererade utmatningen (såsom ras, yrke och kön), än vad en standarddistribution tillåter. Därför använde författarna multi-klass villkorsstyrd för att förbättra generationsprocessen.

Arkitekturen för den specifika bildgenereringen, som författarna påpekar inte är specifik för StyleGAN2, men kan tillämpas på en rad genereringsramverk.

Arkitekturen för den specifika bildgenereringen, som författarna påpekar inte är specifik för StyleGAN2, men kan tillämpas på en rad genereringsramverk.

För att kontrollera faktorerna ras, kön och yrke injicerar arkitekturen en engångskodning av dessa sammanfogade egenskaper i y-vektorn. Efter detta används ett feedforward-nätverk för att infoga dessa funktioner, så att de inte försummas vid genereringstiden.

Författarna observerar att det finns hårda begränsningar för hur mycket StyleGAN2 kan manipuleras på detta sätt, och att mer finmaskiga försök att ändra resultaten resulterade i sämre bildkvalitet, och till och med mode collapse.

Dessa lösningar löser dock inte implicit fördomsproblem i arkitekturen, som forskarna var tvungna att hantera genom att översample underrepresenterade entiteter från datamängden, men utan att riskera att överanpassa, vilket skulle påverka flexibiliteten i de genererade bildströmmarna.

Därför anpassade författarna StyleGAN2-ADA, som använder Adaptiv Diskrimineringsförstärkning (ADA), för att förhindra att diskriminatoren överanpassar.

Data generering och utvärdering

Eftersom målet med projektet är att generera ny, syntetisk data, antog forskarna metodiken från 2014 års projekt, och valde ett antal målyrken som visar en hög ras- och könsfördom. Yrkena som valdes var ‘verkställande chef’, ‘administrativ assistent’, ‘sjuksköterska’, ‘bonde’, ‘militär’, ‘säkerhetsvakt’, ‘lastbilsförare’, ‘städare’, ‘snickare’, ‘rörmokare’, ‘maskinoperatör’, ‘teknisk supportperson’, ‘programvaruutvecklare’ och ‘författare’.

Författarna valde dessa yrken inte bara baserat på omfattningen av upplevd fördom i bildsökresultat, utan också för att de flesta av dem innehåller någon form av visuell komponent som är kodad till yrket, såsom en uniform eller närvaron av specifik utrustning eller miljö.

Datasetet matades med 10 000 bilder från Adobe Stock-biblioteket, vanligtvis med en poäng på 95% eller bättre när de försökte klassificera ett yrke.

Eftersom många av bilderna inte var användbara för måluppgiften (dvs. de innehöll inte människor) var manuell filtrering nödvändig. Efter detta användes en ResNet32-baserad klassificerare förutbildad på FairFace för att märka bilderna för kön och ras, med en genomsnittlig noggrannhet på 95,7% för kön och 81,5% för ras. På så sätt fick forskarna bildmärken för attributen Kön: Man, Kvinna, Ras: Vit, Svart, Asiat, och andra raser.

Modeller byggdes i TensorFlow med StyleGAN2 och StyleGAN2-ADA som kärnnätverk. Förutbildning gjordes med StyleGAN2:s förutbildade vikter på NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ) dataset, utökad med 34 000 yrkespecifika bilder som författarna samlade in i en separat dataset som de kallade Uncurated Stock-Occupation HQ (U-SOHQ).

Ett exempel på en uppgift från Amazon Mechanical Turk-mänsklig utvärdering.

Ett exempel på en uppgift från Amazon Mechanical Turk-mänsklig utvärdering.

Bilder genererades under fyra konfigurationer av arkitekturen, med Uniform+ som slutligen fick de bästa poängen både i FID (automatiserad utvärdering) och i efterföljande utvärdering av Amazon Mechanical Turk-arbetare. I kombination med klassificeringsnoggrannhet använde författarna detta som en kärnmetrik för sin egen metric, som de kallade Attributmatchningspoäng.

Mänsklig utvärdering av bilder genererade av olika metoder, med Uniform+-metoden som visade sig vara den mest övertygande, och därmed grunden för en ny dataset.

Mänsklig utvärdering av bilder genererade av olika metoder, med Uniform+-metoden som visade sig vara den mest övertygande, och därmed grunden för en ny dataset.

Artikeln anger inte om Stock-Occupation-HQ, den fullständiga dataset som härrör från Uniform+, kommer att göras offentligt tillgänglig, men anger att den innehåller 8 113 HQ-bilder (1024×1024).

Diffusion

Den nya artikeln hanterar inte explicit hur syntetiserade, “återbalanserade” bilder kan introduceras i cirkulation. Förmodligen skulle att mata nya (kostnadsfria) datorseende-dataset med återbalanserade bilder av den typ som författarna har skapat lösa problemet med fördomar, men kunde också presentera hinder för andra typer av forskning som syftar till att utvärdera kön och rasinklusion i “verklighetsbaserade” scenarier, i en situation där syntetiska bilder blandas med verkliga världsbilder.

Syntetiska databaser som den som producerats av forskarna kunde förmodligen göras tillgängliga utan kostnad som rimligt högupplösta stockbilder, med hjälp av denna kostnadsbesparande incitament som en motor för diffusion.

Projektet hanterar inte åldersbaserad fördom, förmodligen ett potentiellt ämne för framtida forskning.

 

* Sökning genomförd den 5 januari 2022, författarnas sökning som citeras i artikeln genomfördes i januari 2021.

 

Publicerad första gången den 5 januari 2022.

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai