Andersonin kulma

Sukupuolen ja rodun muuttaminen kuvahakutuloksissa koneoppimisen avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkimusyhteistyö UC San Diegon ja Adobe (ADBE ) Researchin välillä on ehdottanut innovatiivista ja proaktiivista ratkaisua sukupuolen ja rodun monimuotoisuuden puutteen murtamiseksi perinteisesti valkoisen, anglosaksisen ylivaltaisen ammattien kuvahakutuloksissa: Generatiivisten vastakkainoppijaverkkojen (GAN) käyttäminen epärealististen kuvien luomiseksi “harhaanjohtavista” ammateista, joissa kuvan kohteen sukupuolta ja/tai rotua on muutettu.

Tässä esimerkissä tutkijat ovat syöttäneet halutun valokuvan ominaisuudet, jotka eivät ole edustettuina tyypillisessä kuvamateriaalikokoelmassa tai joita edustetaan epäsopivalla tavalla (esim. seksualisoituna tai muulla tavoin sopimattomalla tavalla). Lähde

Tässä esimerkissä tutkijat ovat syöttäneet halutun valokuvan ominaisuudet, jotka eivät ole edustettuina tyypillisessä kuvamateriaalikokoelmassa tai joita edustetaan epäsopivalla tavalla (esim. seksualisoituna tai muulla tavoin sopimattomalla tavalla). Lähde

Uudessa tutkimusartikkelissa nimeltä Kuvahakun monimuotoisuuden luominen ja hallinta, kirjoittajat ehdottavat, että on rajoitteita sille, kuinka paljon uudelleenjärjestäminen voi korjata epätasapainoa harhaanjohtavissa kuvaluokissa, kuten putkien asentaja, koneenkäyttäjä, ohjelmistosuunnittelija ja monissa muissa – ja että rodun ja sukupuolen monimuotoisuuden lisääminen synteettisillä tiedoilla saattaa olla tulevaisuuden haasteiden ratkaisu.

‘Tavoitteena on luoda utopistinen maailma, jossa käyttäjillä on mahdollisuus esittää mikä tahansa ammatti rodun ja sukupuolen moninaisilla ominaisuuksilla. Rajoitettu valikoima olemassa olevaa sisältöä tietyille ammattien, rodun ja sukupuolen yhdistelmille esittää haasteen sisällön tarjoajille. Nykyinen tutkimus, joka koskee harhaanjohtavuutta hakukoneissa, keskittyy lähinnä uudelleenjärjestämisalgoritmeihin.

‘Kuitenkin nämä menetelmät eivät voi luoda uutta sisältöä tai muuttaa kuvien jakautumista. Tämän ongelman ratkaisemiseksi ehdotamme uutta tehtävää, jossa luodaan korkealaatuisia kuvia useiden ominaisuuksien ehdolla epätasapainoisista tietokannoista. ‘

Tähän tarkoitukseen kirjoittajat ovat kokeilleet useita GAN-pohjaisia kuvasynteesijärjestelmiä ja lopulta valinneet arkkitehtuurin, joka perustuu StyleGan2:iin.

Tässä esimerkissä tutkijat ovat luoneet kaksi esimerkkiä 'tasapainottavista' kuvista harhaanjohtavista ammateista, joissa on 'puuseppä' ja 'koneenkäyttäjä'. Lähde

Tässä esimerkissä tutkijat ovat luoneet kaksi esimerkkiä ‘tasapainottavista’ kuvista harhaanjohtavista ammateista, joissa on ‘puuseppä’ ja ‘koneenkäyttäjä’. Lähde

Riittämättömästi tai epäsopivasti edustettu

Tutkijat kuvaavat haasteen todellisessa maailmassa hakutuloksena ‘putkien asentaja’* Google-kuvahakukoneessa, havaiten, että kuvatulokset ovat valtaosin nuoria valkoisia miehiä.

Tutkimusartikkelista, valitut tulokset 'putkien asentaja' -hakusanalle Google-kuvahakukoneessa, tammikuu 2021.

Tutkimusartikkelista, valitut tulokset ‘putkien asentaja’ -hakusanalle Google-kuvahakukoneessa, tammikuu 2021.

Kirjoittajat huomauttavat, että vastaavia osoituksia harhaanjohtavuudesta havaitaan useissa ammateissa, kuten ‘hallinnollinen avustaja’, ‘siivooja’ ja ‘koneenkäyttäjä’, joissa on vastaavia harhaanjohtavuuksia ikään, sukupuoleen ja rotuun liittyen.

‘Odottamattomasti, yhteiskunnan harhaanjohtavuuden vuoksi, joitakin rotu- ja sukupuolien yhdistelmiä saattaa olla vain vähän tai ei ollenkaan kuvia tietokannassa. Esimerkiksi, kun haemme ‘naispuolista mustaa (tai afrikkalais-amerikkalaista) koneenkäyttäjää’ tai ‘aasialaista hallinnollista avustajaa’, emme löydä asiaankuuluvia kuvia [Google-kuvahakukoneesta].

‘Lisäksi, harvoissa tapauksissa, tietyt sukupuolen ja rodun yhdistelmät voivat johtaa yksilöiden esittämiseen epäsopivalla tavalla. Havaitsemme tämän käyttäytymisen hakusanoin, kuten ‘aasialainen naispuolinen putkien asentaja’ tai ‘musta (tai afrikkalais-amerikkalainen) naispuolinen vartija.’

Tutkimusartikkeli viittaa toiseen akateemiseen yhteistyöhön vuodelta 2014, jossa tutkijat keräsivät 400 parasta kuvahakutulosta 96 ammatista. Tutkimuksessa havaittiin, että naiset edustivat vain 37% tuloksista, ja epästereotyyppiset kuvat vain 22%. Vuoden 2019 tutkimuksessa Yalen yliopistossa havaittiin, että viisi vuotta oli nostanut nämä prosentit vain 45%:iin ja 30%:iin.
Lisäksi vuoden 2014 tutkimuksessa luokiteltiin tietyissä ammateissa olevien yksilöiden seksualisoituminen kuvahakutuloksissa Sexy Carpenter -ongelmana, jossa tällaiset epäsopivat luokittelut voivat vääristää tuloksia ammattitunnistuksessa.

Suurempi kuva

Kirjoittajien ensisijainen haaste oli luoda GAN-pohjainen kuvasynteesijärjestelmä, joka pystyy tuottamaan 1024×1024 resoluution kuvia, koska nykyinen GAN- ja koodarin/dekooderin perustuvien kuvasynteesijärjestelmien tila on 512×512, ja mitä suurempi resoluutio, sitä enemmän aikaa ja prosessointiresursseja se vaatii, ja riski kuvan aitoutta vastaan on suurempi.

Kuitenkin kirjoittajat toteavat, että alempia resoluutioita ei voida odottaa saavan jalansijaa kuvahakukoneissa, ja he kokeilivat useita GAN-kehyksiä, jotka voisivat tuottaa korkealaatuisia kuvia halutulla resoluutiolla ja hyväksyttävällä aikataululla.

Kun päätös tehtiin siirtyä StyleGan2:een, kävi ilmi, että projekti tarvitsi suurempaa valvontaa alijärjestelmien yllä (kuten rotu, ammatti ja sukupuoli), kuin mitä oletusarvoinen käyttö salli. Sen vuoksi kirjoittajat käyttivät moniluokkaisia ehdotuksia vahvistamaan generoimisprosessia.

Määrittävän kuvageneraattorin arkkitehtuuri, jonka kirjoittajat toteavat olevan yleispätevä, eikä spesifi StyleGAN2:lle, vaan sovellettavissa useisiin generoivisiin kehyksiin.

Määrittävän kuvageneraattorin arkkitehtuuri, jonka kirjoittajat toteavat olevan yleispätevä, eikä spesifi StyleGAN2:lle, vaan sovellettavissa useisiin generoivisiin kehyksiin.

Rodun, sukupuolen ja ammatin valvontaan arkkitehtuuri syöttää yhden kerran koodatun näiden yhdistelmiä y-vektoriin. Tämän jälkeen eteenpäin suuntautuva verkko upottaa nämä ominaisuudet, jotta ne eivät ole laiminlyötyjä generoimisen aikana.

Kirjoittajat huomauttavat, että on kovat rajoitukset sille, kuinka paljon StyleGan2:a voidaan muokata tällä tavoin, ja että tarkemmat yritykset muuttaa tuloksia johtivat heikkoon kuvanlaatuun ja jopa tilan romahdukseen.

Nämä korjaukset eivät kuitenkaan ratkaise implisiittisiä harhaanjohtavuuden ongelmia arkkitehtuurissa, joita tutkijoiden oli ratkottava yliedustamalla aliedustettuja yksiköitä tietokannasta, ilman vaaraa ylioppimiseen, joka vaikuttaisi generoituva kuvavirran joustavuuteen.

Sen vuoksi kirjoittajat sopeuttivat StyleGAN2-ADA:n, joka käyttää sopeutuvaa diskriminaattorin vahvistusta (ADA), estääkseen diskriminaattorin ylioppimisen.

Tiedon generointi ja arviointi

Koska projektin tavoitteena on luoda uusia, synteettisiä tietoja, tutkijat omaksuivat vuoden 2014 tutkimuksen metodologian, valitsemalla joukon kohde-ammattien, jotka osoittavat korkean rodun ja sukupuolen harhaanjohtavuuden. Valitut ammatit olivat ‘johtaja’, ‘hallinnollinen avustaja’, ‘sairaanhoitaja’, ‘maanviljelijä’, ‘sotilas’, ‘vartija’, ‘kuorma-autonkuljettaja’, ‘siivooja’, ‘puuseppä’, ‘putkien asentaja’, ‘koneenkäyttäjä’, ‘tekninen tukihenkilö’, ‘ohjelmistosuunnittelija’ ja ‘kirjailija’.

Tutkijat valitsivat nämä ammatit ei vain harhaanjohtavuuden laajuuden perusteella kuvahakutuloksissa, vaan myös siksi, että useimmissa niistä on visuaalinen komponentti, joka on koodattu ammattiin, kuten univormu, tietty kalusto tai ympäristö.

Tietokanta koostui 10 000 kuvasta Adobe Stock -kirjastosta, joista 95% saavutti 95%:n arvosanan ammatin luokittelussa.

Koska monet kuvista eivät olleet hyödyllisiä kohde-tehtävään (eli ne eivät sisältäneet ihmisiä), manuaalinen suodatus oli välttämätöntä. Tämän jälkeen ResNet32-pohjainen luokittelija, joka oli esikoulutettu FairFace-tietokannassa, käytettiin kuvien luokittelua sukupuolen ja rodun perusteella, saavuttaen keskimääräisen tarkin 95,7%:n sukupuolelle ja 81,5%:n rodulle. Näin ollen tutkijat saivat kuvien ominaisuuksien luokittelun Sukupuoli: Mies, Nainen, Rotu: Valkoinen, Musta, Aasialainen ja Muut rodut.

Mallit rakennettiin TensorFlowssa käyttäen StyleGan2:a ja StyleGan2-ADA:a ydinkoneina. Esikoulutus tehtiin StyleGan2:n esikoulutetuilla painoilla NVIDIA:n Flickr-Faces-HQ Dataset (FFHQ) -tietokannassa, johon lisättiin 34 000 ammattiin liittyvää kuvaa, jotka tutkijat kokosivat erilliseen tietokantaan, jota he kutsuivat Uncurated Stock-Occupation HQ (U-SOHQ):ksi.

Esimerkki Amazon Mechanical Turk -ihmisarvioinnista.

Esimerkki Amazon Mechanical Turk -ihmisarvioinnista.

Kuvia generoitiin neljässä arkkitehtuurin konfiguraatiossa, ja lopulta Uniform+ saavutti parhaat tulokset sekä FID:ssä (automaattinen arviointi) että myöhemmässä Amazon Mechanical Turk -työntekijöiden arvioinnissa. Yhdistettynä luokittelun tarkin arvon kanssa kirjoittajat käyttivät tätä metriikkaa oman metriikkansa, Attribuuttimatching Score, perustana.

Ihmisten arviointi eri menetelmillä generoiduista kuvista, joista Uniform+ osoittautui vakuuttavimmaksi ja perustaksi uudelle tietokannalle.

Ihmisten arviointi eri menetelmillä generoiduista kuvista, joista Uniform+ osoittautui vakuuttavimmaksi ja perustaksi uudelle tietokannalle.


Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai