Andersonin kulma
‘Rotu luokittelun’ haaste CLIP-pohjaisille kuvien synteesijärjestelmille

Uusi tutkimus Yhdysvalloista osoittaa, että yksi suosituimmista tietokoneen näön malleista, jota käytetään DALL-E-sarjassa sekä monissa muissa kuvien luomis- ja luokittelumalleissa, osoittaa todennäköisen taipumuksen hypodesentiaan – rotuluokittelusääntöön (tunnetaan myös “yksi tippa” -sääntönä), joka luokittelee henkilön, jolla on jopa pieni määrä “sekoittunutta” (eli ei-kaakkois- Eurooppalaisen) geneettistä perimää, kokonaan “vähemmistöryhmän” rotuluokkaan.
Koska hypodesentia on luonut joitakin ihmiskunnan historian rumimmista luvuista, tutkimuksen tekijät ehdottavat, että tällaiset taipumukset tietokoneen näön tutkimuksessa ja soveltamisessa tulisi saada enemmän huomiota, ei ainakaan siksi, että tutkittava viitekehys, jota on ladattu lähes miljoona kertaa kuukaudessa, voisi edelleen levittää ja ylläpitää rotujohtuvaa harhaa alirakenteissa.
Tutkittava arkkitehtuuri on Contrastive Language Image Pretraining (CLIP), monimodaalinen koneoppimismalli, joka oppii semanttisia yhteyksiä kouluttamalla kuva/kuvateksti -pareja internetistä – puolivaltainen lähestymistapa, joka vähentää merkittävästi merkintän kustannuksia, mutta joka todennäköisesti heijastaa luomista kuvatekstejä luoneiden ihmisten harhaa.
Tutkimuksesta:
‘Tuloksemme antavat näytön hypodesentiaan CLIP: n upotusavaruudessa, harhan, jota sovelletaan voimakkaammin naiskuviin. Tulokset osoittavat myös, että CLIP liittää kuvia rotu- tai etnisyyserotteluihin poiketen valkoisesta, valkoinen on oletusarvoinen.
Tutkimus osoittaa myös, että kuvan valenssiyhdistys (sen taipumus liittyä “hyviin” tai “pahoihin” asioihin) on huomattavasti suurempi “vähemmistöryhmien” rotu/etnisille tunnisteille kuin valkoisille tunnisteille, ja ehdottaa, että CLIP: n harhat heijastavat Yhdysvaltain keskeistä kirjallisuuden aineistoa (englanninkielinen Wikipedia), jolle viitekehys on koulutettu.
Kommentoidessaan CLIP: n ilmiovien hypodesentian vaikutuksia tutkijat toteavat*:
‘[Yksi] ensimmäisistä CLIP: n sovelluksista oli kouluttaa nollasoittoinen kuvien luomismalli DALL-E. Suurempi, ei-julkinen CLIP-arkkitehtuuri käytettiin DALL-E 2: n koulutukseen. Tutkimuksen tulokset ovat yhdenmukaisia siinä suhteessa, että DALL-E 2 -mallikortin huomautukset mainitaan, että se “tuottaa kuvia, jotka edustavat ylipäänsä valkoisia henkilöitä”.
‘Tällaiset sovellukset osoittavat, että CLIP: n oppimien harhauksien potentiaalinen leviäminen mallin upotusavaruuden ulkopuolelle, kun sen ominaisuuksia käytetään muiden huippuluokan tekoälymallien semantiikan muodostamiseen.
‘Lisäksi, osittain CLIP: n ja vastaavien mallien edistysten ansiosta, jotka liittävät kuvia ja tekstejä nollasoitossa, multimodaaliset arkkitehtuurit on kuvattu perustaksi laajasti käytettyjen internetsovellusten tulevaisuudelle, mukaan lukien hakukoneet.
‘Tuloksemme osoittavat, että tällaisille malleille on tarve antaa enemmän huomiota sille, mitä ne oppivat luonnollisen kielen valvonnasta.’
Tutkimus on nimeltään Näyttö hypodesentiasta visuaalisessa semanttisessa tekoälyssä ja se on tehty kolmen tutkijan toimesta Washingtonin yliopistossa ja Harvardin yliopistossa.
CLIP ja huonot vaikutteet
Vaikka tutkijat vakuuttavat, että heidän työnsä on ensimmäinen hypodesentian analyysi CLIP: ssä, aiemmat tutkimukset ovat osoittaneet, että CLIP-työnkulkua, joka riippuu pääasiassa valvomattomasta internetistä peräisin olevasta koulutusaineistosta, aliedustaa naisia, voi tuottaa loukkaavaa sisältöä ja voi osoittaa semanttista harhaa (kuten anti-muslimiläistä asennetta) kuvakoodauksessa.
Alkuperäinen tutkimus, jossa esiteltiin CLIP, myönsi, että nollasoitossa CLIP liittää vain 58,3 %: ia valkoiseen rotuun FairFace -aineistossa. Tutkijat toteavat, että FairFace on merkitty mahdollisesti harhaan Amazon Mechanical Turk -työntekijöiden toimesta, ja tutkijat toteavat, että “merkittävä vähemmistö ihmisiä, jotka muiden ihmisten mielestä ovat valkoisia, liitetään rotuun, joka ei ole valkoinen CLIP: n mukaan”.
He jatkavat:
‘Käänteinen ei näytä pitävän paikkaansa, koska yksilöt, jotka havaitaan kuuluvan muihin rotu- tai etnisyyserotteluihin FairFace-aineistossa, liitetään niihin rotu/etnisyyserotteluihin CLIP: n mukaan. Tämä tulos osoittaa mahdollisuuden, että CLIP on oppinut “hypodesentian” säännön, kuten sosiaalitutkijat ovat kuvaileet: yksilöt, joilla on monirrotuinen sukutausta, ovat todennäköisemmin havaittavissa ja luokiteltavissa kuuluvaksi vähemmistö- tai epäedulliseen vanhemman ryhmään kuin yhtä lailla legitiimiin enemmistö- tai edulliseen vanhemman ryhmään.
‘Toisin sanoen, mustan ja valkoisen vanhemman lapsi havaitaan olevan enemmän musta kuin valkoinen; ja aasialaisen ja valkoisen vanhemman lapsi havaitaan olevan enemmän aasialainen kuin valkoinen.’
Tutkimuksessa on kolme keskeistä löytöä: CLIP osoittaa hypodesentian “ajamalla” ihmisiä monirotuisilla identiteeteillä vähemmistöryhmän rotuluokkaan, joka koskee heitä; “valkoinen on oletusarvoinen rotu CLIP: ssä”, ja kilpailevat rodut määritellään “poikkeamana” valkoisesta luokasta; ja valenssiharha (yhdistys “pahoihin” käsitteisiin) korreloi yksilön luokitteluun vähemmistöryhmään.
Menetelmä ja aineisto
Määrittääkseen, miten CLIP käsittelee monirrotuisia aiheita, tutkijat käyttivät aiemmin hyväksyttyä muokkaustekniikkaa muuttaa yksilöiden rotua. Kuvat otettiin Chicago Face Database -aineistosta, joka on kehitetty psykologisiin tutkimuksiin, jotka liittyvät rotuun.

Esimerkkejä rodullisesti muokatuista CFD-kuvista, jotka sisältyvät tutkimuksen liitteeseen. Lähde: https://arxiv.org/pdf/2205.10764.pdf
Tutkijat valitsivat aineistosta vain “neutraalin ilmeen” kuvat, jotta he voivat olla yhdenmukaisia aiemman tutkimuksen kanssa. He käyttivät StyleGAN2-ADA -generatiivista vastakkaiskoulutusverkkoa (joka on koulutettu FFHQ -aineistolla) rodun muuttamiseen kasvojen kuvissa, ja loivat välimuotoisia kuvia, jotka osoittavat siirtymisen yhdestä rodusta toiseen (ks. yllä olevat esimerkkikuvat).
Yhdenmukaisesti aiemman tutkimuksen kanssa tutkijat muokkasivat mustien, aasialaisten ja latinojen kasvokuvia aineistossa valkoisiksi. Yhdeksäntoista välimuotoa tuotettiin prosessissa. Yhteensä 21 000 1024x1024px -kuvaa luotiin tämän menetelmän avulla.
Tutkijat saivat sitten projektiivisen kuvan upotus CLIP: lle kullekin 21 kuvasta jokaisessa rodullisessa muodonmuutoksessa. Tämän jälkeen he pyysivät merkintää kullekin kuvalle CLIP: ltä: “monirrotuinen”, “sekakasvo”, “sekoittunut rotu” ja “ihminen” (viimeinen merkintä jättää rodun pois).
Käytetty CLIP-versio oli CLIP-ViT-Base-Patch32 -toteutus. Tutkijat toteavat, että tämä malli on ladattu yli miljoona kertaa kuukauden aikana ennen tutkimuksen kirjoittamista, ja se vastaa 98 %: ia kaikista CLIP-mallien latauksista Transformers-kirjastosta.
Testit
Testatakseen CLIP: n mahdollista taipumusta hypodesentiaan tutkijat huomioivat rodun merkinnän, jonka CLIP antoi kullekin kuvalle muokattujen kuvien asteikolla kullekin yksilölle.
Tutkimuksen mukaan CLIP taipuu ryhmittämään ihmiset “vähemmistöryhmiin” noin 50 %: n siirtymämerkin kohdalla.

50 %: n sekoitusosuudessa, jossa aihe on yhtä alkuperäinen/ kohderotu, CLIP liittää suuremman määrän 1000 muokattua naisten kuvaa aasialaisiin (89,1 %), latinoihin (75,8 %) ja mustiin (69,7 %) merkkien kanssa kuin vastaavan valkoisen merkin kanssa.
Tulokset osoittavat, että naiset ovat alttiimpia hypodesentiaalle CLIP: ssä kuin miehet, vaikka tutkijat olettavat, että tämä voi johtua siitä, että internetistä peräisin olevat ja valvomattomat merkinnät, jotka kuvaavat naisten kuvia, korostavat aiheen ulkonäköä enemmän kuin miesten kohdalla, ja että tämä voi aiheuttaa vinoutta.
Hypodesentiaa 50 %: n rodullisessa siirtymässä ei havaittu aasialais- valkoinen mies- tai latino- valkoinen mies- muodonmuutos sarjassa, kun taas CLIP antoi korkeamman kosini- yhtäläisyyden mustalle merkille 67,5 %: ssä tapauksista 55 %: n sekoitusosuudessa.

Monirrotuisten, sekakasvoisten ja sekoittuneiden rotujen keskimääräinen kosini- yhtäläisyys. Tulokset osoittavat, että CLIP toimii jonkinlaisena “vesirajan” luokitteluna vaihtelevissa prosentteissa rodullista sekoitusta, harvemmin määrittäen tällaisen rodullisen sekoituksen valkoiseksi (“ihmisenä” kokeiden perustelussa) kuin etnisyydeksi, joka on havaittu kuvassa.
Idealisena tavoitteena on, että CLIP luokittelisi välimuodot tarkasti “sekoittuneiksi rotuiksi”, sen sijaan, että määrittäisi “kynnysarvon”, jossa aihe usein määritellään kokonaan non-valkoiseksi.
Jonkin verran CLIP määrittää välimuodot “sekoittuneiksi rotuiksi” (ks. yllä oleva kuva), mutta lopulta se osoittaa keskitason taipumuksen luokitella aiheet vähemmistöryhmän rotuun, joka osallistuu siihen.
Valenssin osalta tutkijat toteavat CLIP: n vinoutuneen tuomion:
‘[Keskimääräinen] valenssiyhdistys (yhdistys “pahoihin” tai “epämiellyttäviin” vs. “hyviin” tai “miellyttäviin”) vaihtelee sekoitusosuuden mukaan mustan- valkoisen mies- muodonmuutos sarjassa, jolloin CLIP koodaa yhteyksiä epämiellyttävyyteen kasvojen kanssa, jotka muistuttavat CFD: n vapaaehtoisia, jotka itseidentifioivat mustina.’

Valenssitulokset – testit osoittavat, että vähemmistöryhmät ovat enemmän yhdistettyjä negatiivisiin käsitteisiin kuin valkoisiin. Tutkijat väittävat, että kuvan epämiellyttävyys lisääntyy sen mukaan, kuinka varma malli on siitä, että kuva heijastaa mustaa henkilöä.
Tutkimus toteaa:
‘Näyttö osoittaa, että kuvan valenssi korreloi rodun kanssa. Konkreettisemmin, tuloksemme osoittavat, että mitä varmempi malli on siitä, että kuva heijastaa mustaa henkilöä, sitä enemmän kuva on yhdistetty epämiellyttävään upotusavaruuteen.’
Kuitenkin tulokset osoittavat myös negatiivisen korrelaation aasialaisten kasvojen kohdalla. Tutkijat ehdottavat, että tämä voi johtua positiivisista Yhdysvaltain kulttuurisista havainnoista aasialaisista ihmisistä ja yhteisöistä, jotka on välitetty internetin kautta. Tutkijat toteavat*:
‘Havaitsemme yhteyden mukavuuden ja aasialaisen tekstimerkin todennäköisyyden välillä, mikä voi vastata “mallivähemmistön” stereotyyppiä, jossa aasialaista alkuperää olevat ihmiset kehuutaan ylösnousemisestaan ja assimilaatiostaan Yhdysvaltain kulttuuriin, ja jopa yhdistetään “hyvään käyttäytymiseen”.’
Lopullisen tavoitteen osalta, tutkia, onko valkoinen “oletusidentiteetti” CLIP: n näkökulmasta, tulokset osoittavat upotettua polariteettia, joka osoittaa, että tässä arkkitehtuurissa on vaikea olla “vähän valkoinen”.

Kosini- yhtäläisyys 21 000: sta kuvasta, jotka luotiin testeihin.
Tutkijat toteavat:
‘Näyttö osoittaa, että CLIP koodaa valkoisen oletusrodun. Tämä tukeutuu vahvempiin korrelaatioihin valkoisen kosini- yhtäläisyyden ja henkilön kosini- yhtäläisyyden välillä kuin minkään muun rodun tai etnisen ryhmän kohdalla.’
*Tutkijoiden sisäisten viittauksien muuntaminen hyperlinkkeiksi.
Julkaistu ensimmäisen kerran 24. toukokuuta 2022.












