Andersons vinkel
‘Rasial Kategorisering’ Utmaningen för CLIP-baserade Bildsynthesissystem

Ny forskning från USA visar att en av de populära datorseende-modellerna bakom den mycket omtalade DALL-E-serien, samt många andra bildgenererings- och klassificeringsmodeller, uppvisar en bevisbar tendens till hypodescent – ras-kategoriseringsregeln (även känd som ‘en drop’-regeln) som kategoriserar en person med även en liten del ‘blandad’ (dvs icke-kaukasisk) genetisk bakgrund helt till en ‘minoritets’ ras-kategorisering.
Eftersom hypodescent har karakteriserat några av de fulaste kapitlen i mänsklighetens historia, föreslår författarna till den nya artikeln att sådana tendenser inom datorseende-forskning och implementering bör få större uppmärksamhet, inte minst eftersom den underliggande ramen i fråga, som har laddats ner nästan en miljon gånger i månaden, kan ytterligare sprida och förmedla ras-bias i nedströms-ramar.
Arkitekturen som studeras i det nya arbetet är Kontrastiv Språk-Bild-Förträning (CLIP), en multimodal maskinlärningsmodell som lär sig semantiska associationer genom att träna på bild/beskrivningspar från internet – en semi-övervakad metod som minskar den betydande kostnaden för märkning, men som sannolikt kommer att återspegla bias hos de personer som skapade beskrivningarna.
Från artikeln:
‘Våra resultat tillhandahåller bevis för hypodescent i CLIP-inbäddningsutrymmet, en bias som tillämpas mer kraftfullt på bilder av kvinnor. Resultaten visar dessutom att CLIP associerar bilder med ras- eller etniska etiketter baserat på avvikelse från Vit, med Vit som standard.
Artikeln finner också att en bilds valens-association (dess tendens att associeras med ‘bra’ eller ‘dåliga’ saker) är betydligt högre för ‘minoritets’ ras-etiketter än för kaukasiska etiketter, och föreslår att CLIP:s bias återspeglar den US-centrerade korpusen av litteratur (engelska Wikipedia) som ramen tränades på.
I kommentar till implikationerna av CLIP:s uppenbara stöd för hypodescent, skriver författarna*:
‘[Bland] de första användningarna av CLIP var att träna den zero-shot-bildgenereringsmodellen DALL-E. En större, icke-offentlig version av CLIP-arkitekturen användes i träningen av DALL-E 2. I överensstämmelse med resultaten från denna forskning, noterar Risks and Limitations i DALL-E 2-modellkortet anteckningen att det “producerar bilder som tenderar att överrepresentera personer som är vit-passande”.
‘Sådana användningar demonstrerar potentialen för de bias som lärs av CLIP att spridas bortom modellens inbäddningsutrymme, eftersom dess funktioner används för att vägleda bildandet av semantik i andra state-of-the-art-AI-modeller.
‘Dessutom, till följd av framstegen som uppnåtts av CLIP och liknande modeller för att associera bilder och text i zero-shot-inställningen, har multimodala arkitekturer beskrivits som grunden för framtiden för allmänt använda internetapplikationer, inklusive sökmotorer.
‘Våra resultat indikerar att ytterligare uppmärksamhet åt vad sådana modeller lär sig från naturlig språkstyrning är motiverat.’
Artikeln artikeln har titeln Bevis för Hypodescent i Visuell Semantisk AI och kommer från tre forskare vid University of Washington och Harvard University.
CLIP och Dåliga Influenser
Även om forskarna intygar att deras arbete är den första analysen av hypodescent i CLIP, har tidigare arbeten visat att CLIP-arbetsflödet, som är beroende av i huvudsak oövervakad träning från under-kuraterad webbaserad data, under-representerar kvinnor, kan producera stötande innehåll, och kan visa semantisk bias (såsom anti-muslimsk sentiment) i sin bild-kodare.
Den ursprungliga artikeln som presenterade CLIP medgav att i en zero-shot-inställning, associerar CLIP endast 58,3% av personer med den vita ras-etiketten i FairFace-databasen. Observera att FairFace var märkt med möjlig bias av Amazon Mechanical Turk-arbetare, skriver författarna till den nya artikeln att ‘en betydande minoritet av personer som uppfattas av andra människor som vita är associerade med en ras annan än vit av CLIP.’
De fortsätter:
‘Inversen verkar inte vara sant, eftersom individer som uppfattas tillhöra andra ras- eller etniska etiketter i FairFace-databasen är associerade med dessa etiketter av CLIP. Detta resultat tyder på möjligheten att CLIP har lärt sig regeln för “hypodescent”, som beskrivs av samhällsvetare: individer med multiracial bakgrund är mer benägna att uppfattas och kategoriseras som tillhörande den minoritets- eller mindre fördelaktiga föräldragruppen än den lika legitima majoritets- eller fördelaktiga föräldragruppen.
‘Med andra ord, barnet till en svart och en vit förälder uppfattas som mer svart än vit; och barnet till en asiat och en vit förälder uppfattas som mer asiat än vit.’
Artikeln har tre centrala fynd: att CLIP visar hypodescent, genom att ‘driva’ personer med multiraciala identiteter in i den minoritetsbidragande ras-kategorin som gäller för dem; att ‘Vit är standard-rasen i CLIP’, och att konkurrerande raser definieras av deras ‘avvikelse’ från en vit kategori; och att valens-bias (en association med ‘dåliga’ koncept) korrelerar till den utsträckning som individen kategoriseras in i en ras-minoritet.
Metod och Data
För att bestämma hur CLIP behandlar multiraciala ämnen, använde forskarna en tidigare antagen morf-teknik för att ändra rasen på bilder av individer. Fotografierna togs från Chicago Face Database, en uppsättning utvecklad för psykologiska studier som involverar ras.

Exempel från de ras-morfade CFD-bilderna som presenteras i den nya artikeln.
Forskarna valde endast ‘neutrala uttryck’ bilder från databasen, för att vara konsekventa med tidigare arbete. De använde Generative Adversarial Network StyleGAN2-ADA (tränad på FFHQ) för att åstadkomma ras-ändring av de ansiktsbilderna, och skapade mellanliggande bilder som visar progressionen från en ras till en annan (se exempelbilder ovan).
I överensstämmelse med tidigare arbete, morfade forskarna ansikten av personer som identifierade sig som svarta, asiater och latinamerikaner i databasen till ansikten av personer som identifierade sig som vita. Nitton mellanliggande stadier producerades under processen. Totalt skapades 21 000 1024x1024px-bilder för projektet med denna metod.
Forskarna erhöll sedan en projicerad bild-inbäddning för CLIP för var och en av de totalt 21 bilderna i varje ras-morf-uppsättning. Efter detta, bad de om en etikett för varje bild från CLIP: ‘multiracial’, ‘biracial’, ‘mixed race’, och ‘person’ (den sista etiketten utelämnar ras).
Versionen av CLIP som användes var CLIP-ViT-Base-Patch32-implementeringen. Författarna noterar att denna modell laddades ner över en miljon gånger i månaden före deras forskning, och står för 98% av nerladdningarna av någon CLIP-modell från Transformers-biblioteket.
Tester
För att testa CLIP:s potentiella tendens till hypodescent, noterade forskarna ras-etiketten som tilldelades av CLIP till varje bild i gradienten av morfade bilder för varje individ.
Enligt resultaten, tenderar CLIP att gruppera personer i ‘minoritets’-kategorier vid cirka 50% övergångsmärket.

Vid en 50% blandningsratio, där ämnet är lika ursprung/mål-ras, associerar CLIP ett högre antal av 1000 morfade kvinnliga bilder med asiatiska (89,1%), latinamerikanska (75,8%) och svarta (69,7%) etiketter än med en motsvarande vit etikett.
Resultaten visar att kvinnliga ämnen är mer benägna att hypodescent under CLIP än män, även om författarna hypoteserar att detta kan bero på att de webb-baserade och oövervakade etiketter som karakteriserar kvinnliga bilder tenderar att betona ämnets utseende mer än i fallet med män, och att detta kan ha en skev effekt.
Hypodescent vid en 50% ras-övergång observerades inte för den asiatisk-vita manliga eller latinamerikansk-vita manliga morf-serien, medan CLIP tilldelade en högre kosin-likhet till den svarta etiketten i 67,5% av fallen vid en 55% blandningsratio.

Den genomsnittliga kosin-likheten för multiraciala, biraciala och blandade ras-etiketter. Resultaten indikerar att CLIP opererar en sorts ‘vattendelare’-kategorisering vid varierande procent av ras-blandning, mindre ofta tilldelar en sådan ras-blandning till Vit (‘person’, i experimentens resonemang) än till etniciteten som uppfattats i bilden.
Det ideala målet, enligt artikeln, är att CLIP skulle kategorisera de mellanliggande ras-blandningarna korrekt som ‘blandad ras’, istället för att definiera en ‘vägskäl’ vid vilken ämnet så ofta tilldelas helt till den icke-vita etiketten.
I viss mån tilldelar CLIP de mellanliggande morf-stegen med Blandad Ras (se graf ovan), men visar slutligen en mitt-rang-preferens att kategorisera ämnen som deras minoritetsbidragande ras.
Vad gäller valens, noterar författarna CLIP:s sneda bedömning:
‘[Medel] valens-association (association med ‘dåligt’ eller ‘oangenehmt’ kontra ‘bra’ eller ‘angenämt’) varierar med blandningsratio över den svarta-vita manliga morf-serien, så att CLIP kodar associationer med oangenämheter för ansikten som är mest lika CFD-frivilliga som identifierar sig som svarta.’

Valens-resultaten – testerna visar att minoritetsgrupper är mer associerade med negativa koncept i bild/pars-arkitekturen än för vit-märkta ämnen. Författarna hävdar att oangenämhets-associationen av en bild ökar med sannolikheten att modellen associerar bilden med den svarta etiketten.
Artikeln påstår:
‘Bevisen tyder på att valensen av en bild korrelerar med ras-association. Mer konkret, våra resultat tyder på att ju mer säker modellen är på att en bild återger en svart individ, desto mer associerad med oangenämhets-inbäddningsutrymmet är bilden.’
Men resultaten visar också en negativ korrelation i fallet med asiatiska ansikten. Författarna föreslår att detta kan bero på att de webb-baserade data som modellen tränades på kan ha förmedlat positiva US-kulturella uppfattningar om asiater och asiatica samhällen. Författarna skriver*:
‘Att observera en korrelation mellan behaglighet och sannolikheten för den asiatiska text-etiketten kan motsvara “model minority”-stereotypen, där personer av asiatiskt ursprung beröms för sin uppåtgående rörlighet och assimilation i amerikansk kultur, och till och med associeras med “gott beteende”.’
Vad gäller det slutliga målet, att undersöka om Vit är ‘standard-identiteten’ från CLIP:s synvinkel, tyder resultaten på en inbäddad polaritet, som tyder på att under denna arkitektur är det ganska svårt att vara ‘en aning vit’.

Kosin-likhet över 21 000 bilder som skapades för testerna.
Författarna kommenterar:
‘Bevisen tyder på att CLIP kodar Vit som standard-ras. Detta stöds av de starkare korrelationerna mellan vita kosin-likheter och person-kosin-likheter än för någon annan ras- eller etnisk grupp.’
*Min omvandling av författarnas inline-citat till hyperlänkar.
Publicerad första gången den 24:e maj 2022.












