Andersonův úhel

Změna pohlaví a rasy ve výsledcích vyhledávání obrázků pomocí strojového učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumná spolupráce mezi UC San Diego a Adobe (ADBE ) Research navrhla inovativní a proaktivní řešení nedostatku rasové a pohlavní rozmanitosti ve výsledcích vyhledávání obrázků pro tradičně WASP-dominované profese: použití Generativních Adversativních Sítí (GAN) pro vytváření nereálných obrázků “zaujatých” profesí, kde je změněno pohlaví a/nebo rasa subjektu.

V tomto příkladu z nové studie autoři zadali charakteristiky požadovaného snímku, který buď není zastoupen v typické sbírce dostupného obrazového materiálu, nebo je zastoupen nevhodným způsobem (tj. sexualizovaným nebo jinak nevhodným způsobem). Zdroj

V tomto příkladu z nové studie autoři zadali charakteristiky požadovaného snímku, který buď není zastoupen v typické sbírce dostupného obrazového materiálu, nebo je zastoupen nevhodným způsobem (tj. sexualizovaným nebo jinak nevhodným způsobem). Zdroj

V nové studii s názvem Generování a řízení rozmanitosti ve vyhledávání obrázků autoři navrhují, že existuje limit pro rozsah, v jakém lze přeřazování opravit nerovnováhu zaujatých tříd obrázků/vlastností, jako je instalatér, strojový operátor, softwarový inženýr a mnoho dalších – a že zvýšení rasové a pohlavní rozmanitosti pomocí syntetických dat může být způsobem vpřed pro tuto výzvu.

‘Hledání utopického světa vyžaduje poskytnout uživatelům obsahu možnost prezentovat jakoukoli profesi s rozmanitými rasovými a pohlavními charakteristikami. Omezená volba stávajícího obsahu pro určité kombinace profese, rasy a pohlaví představuje výzvu pro poskytovatele obsahu. Současný výzkum zabývající se zaujatostí ve vyhledávání se většinou zaměřuje na algoritmy pro přeřazování.

‘Nicméně tyto metody nemohou vytvořit nový obsah nebo změnit celkovou distribuci chráněných atributů ve fotografiích. Abychom tyto problémy vyřešili, navrhujeme novou úlohu generování vysoce kvalitních obrázků podmíněných několika atributy z nevyvážených datových sad. ‘

Za tímto účelem autoři experimentovali s různými systémy syntézy obrázků založenými na GAN, nakonec se rozhodli pro architekturu založenou na StyleGan2.

Z doplňkových materiálů ke studii, dva příklady 'vyrovnávání' obrazových reprezentací zaujatých profesí, v tomto případě 'tesař' a 'strojový operátor'. Zdroj

Z doplňkových materiálů ke studii, dva příklady ‘vyrovnávání’ obrazových reprezentací zaujatých profesí, v tomto případě ‘tesař’ a ‘strojový operátor’. Zdroj

Nedostatečně nebo nevhodně zastoupené

Autoři studie formulují výzvu v termínech reálného výsledku vyhledávání pro ‘instalatéra’* na Google Image search, pozorují, že výsledky vyhledávání jsou dominovány mladými bílými muži.

Z studie, vybrané výsledky pro 'instalatéra' na Google Image search, leden 2021.

Z studie, vybrané výsledky pro ‘instalatéra’ na Google Image search, leden 2021.

Autoři poznamenávají, že podobné indikace zaujatosti se vyskytují u řady profesí, jako je ‘administrativní asistent’, ‘úklidový pracovník’ a ‘strojový operátor’, s odpovídajícími zaujatostmi pro věk, pohlaví a rasu.

‘Nečekaně, kvůli takovéto společenské zaujatosti, některé kombinace rasy a pohlaví mohou mít málo nebo žádné obrázky v repozitáři obsahu. Například, když jsme vyhledali ‘ženu černou (nebo afroamerickou) strojovou operátorku’ nebo ‘muže asijského administrativního asistenta’, nenašli jsme relevantní obrázky na [Google Image search].

‘Kromě toho, ve vzácných případech, konkrétní kombinace pohlaví a rasy mohou vést k tomu, že jedinci jsou zobrazováni nevhodně. Pozorovali jsme toto chování pro vyhledávací dotazy, jako ‘žena asijská instalatérka’ nebo ‘žena černá (nebo afroamerická) bezpečnostní hlídka.’

Studie cituje další akademickou spolupráci z roku 2014, kde výzkumníci shromáždili horních 400 výsledků vyhledávání obrázků pro 96 profesí. Ta práce zjistila, že ženy představovaly pouze 37% výsledků a anti-stereotypní obrázky pouze 22%. Studie z roku 2019 z Yale zjistila, že pět let zvýšilo tyto procenta pouze na 45% a 30% respectively.

Kromě toho studie z roku 2014 klasifikovala sexualizaci jedinců v určitých profesích ve výsledcích vyhledávání obrázků jako Sexy Carpenter Problem, s takovými nevhodnými klasifikacemi, které mohou zkreslit výsledky pro rozpoznání profese.

Celkový pohled

Hlavní výzvou pro autory byla produkce GAN-založeného systému syntézy obrázků schopného výstupu 1024×1024 rozlišení, protože, v současném stavu umění v GAN a encoder/decoder-založených systémech syntézy obrázků, 512×512 je poměrně luxusní. Cokoliv vyšší by tendovalo k získání konečného výstupu pomocí upsamplingu, při některých nákladech na čas a procesní zdroje, a při některých rizicích pro autenticitu generovaných obrázků.

Autoři však uvádějí, že nižší rozlišení by nemohlo očekávat, že získá trakci ve vyhledávání obrázků, a experimentovali s různými rámcemi GAN, které by mohly být schopny výstupu hi-res obrázků na vyžádání, na přijatelné úrovni autenticity.

Když bylo rozhodnuto o přijetí StyleGan2, stalo se zřejmým, že projekt bude potřebovat větší kontrolu nad sub-funkcemi generovaného výstupu (jako je rasa, profese a pohlaví), než umožňuje výchozí nasazení. Proto autoři použili multi-třídní podmíněnost pro doplnění procesu generování.

Architektura specifického generátoru obrázků, kterou autoři uvádějí, není specifická pro StyleGAN2, ale může být aplikována na řadu generátorových rámců.

Architektura specifického generátoru obrázků, kterou autoři uvádějí, není specifická pro StyleGAN2, ale může být aplikována na řadu generátorových rámců.

Pro kontrolu faktorů rasy, pohlaví a profese architektura vkládá jednorázové kódování těchto spojených charakteristik do y vektoru. Poté se používá feedforward síť pro vložení těchto funkcí, aby nebyly zanedbány při generování.

Autoři pozorují, že existují tvrdé limity pro rozsah, v jakém lze StyleGAN2 manipulovat tímto způsobem, a že více jemné pokusy o změnu výsledků vedly k horší kvalitě obrázků, a dokonce k kolapsu módu.

Tato opatření však nevyřešují implicitní problémy se zaujatostí v architektuře, které výzkumníci museli řešit pře-samplingem pod-reprezentovaných entit z datové sady, ale bez rizika pře-fitování, které by ovlivnilo flexibilitu generovaných toků obrázků.

Proto autoři adaptovali StyleGAN2-ADA, který používá Adaptivní Diskriminační Augmentaci (ADA), aby zabránil pře-fitování diskriminátoru.

Generování a hodnocení dat

Jelikož cílem projektu je generovat nová, syntetická data, výzkumníci přijali metodologii projektu z roku 2014, zvolili řadu cílů profesí, které demonstrují vysokou rasovou a pohlavní zaujatost. Profese, které byly vybrány, byly ‘výkonný manažer’, ‘administrativní asistent’, ‘zdravotní sestra’, ‘farmer’, ‘voják’, ‘bezpečnostní hlídka’, ‘řidič kamionu’, ‘úklidový pracovník’, ‘tesař’, ‘instalatér’, ‘strojový operátor’, ‘technická podpora’, ‘softwarový inženýr’ a ‘spisovatel.’

Autoři vybrali tyto profese nejen na základě rozsahu vnímané zaujatosti ve výsledcích vyhledávání obrázků, ale protože většina z nich obsahuje nějaký druh vizuálního komponentu, který je kodifikován k profesi, jako je uniforma, nebo přítomnost specifického vybavení nebo prostředí.

Datová sada byla poháněna 10 000 obrázky z knihovny Adobe Stock, obvykle získávající skóre 95% nebo lepší při pokusu o klasifikaci profese.

Pokudže mnoho obrázků nebylo užitečné pro cílovou úlohu (tj. neobsahovaly lidi), bylo nutné manuální filtrování. Poté byl použit ResNet32-založený klasifikátor před-trénovaný na FairFace pro označení obrázků pro pohlaví a rasu, získávající průměrnou přesnost 95,7% pro pohlaví a 81,5% pro rasu. Takže výzkumníci získali označení obrázků pro atributy Pohlaví: Muž, Žena, Rasa: Bílá, Černá, Asijská a Jiné rasy.

Modely byly postaveny v TensorFlow pomocí StyleGAN2 a StyleGAN2-ADA jako jádrových sítí. Před-trénování bylo provedeno s před-trénovanými váhami StyleGAN2 na datové sadě NVIDIA’s Flickr-Faces-HQ (FFHQ) datové sadě, rozšířené o 34 000 obrazově-specifických obrázků, které autoři shromáždili do samostatné datové sady, kterou nazvali Uncurated Stock-Occupation HQ (U-SOHQ).

Ukázka úkolu z Amazon Mechanical Turk lidského hodnocení.

Ukázka úkolu z Amazon Mechanical Turk lidského hodnocení.

Obrázky byly generovány pod čtyřmi konfiguracemi architektury, s Uniform+ nakonec získávající nejlepší skóre jak v FID (automatizovaném hodnocení), tak v následném hodnocení pracovníky Amazon Mechanical Turk. V kombinaci s klasifikační přesností autoři použili tuto metriku jako jádrovou metriku pro svou vlastní metriku, nazvanou Skóre shody atributů.

Lidské hodnocení obrázků generovaných různými metodami, s metodou Uniform+ prokazující se jako nejvíce přesvědčivá, a následně jako základ pro novou datovou sadu.

Lidské hodnocení obrázků generovaných různými metodami, s metodou Uniform+ prokazující se jako nejvíce přesvědčivá, a následně jako základ pro novou datovou sadu.


Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai