Andersonův úhel

‘Rasová kategorizace’ – výzva pro systémy syntézy obrazů založené na CLIP

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z USA zjistil, že jeden z populárních modelů počítačového vidění, který stojí za úspěšnou sérií DALL-E, stejně jako mnoho dalších modelů generování a klasifikace obrazů, vykazuje prokazatelnou tendenci k hypodescentu – rasové kategorizační pravidlu (také známému jako “pravidlo jedné kapky”), které kategorizuje osobu s i malou mírou “smíšené” (tj. ne-kaukazské) genetické linie zcela do “menšinové” rasové kategorie.

Pokud hypodescent charakterizoval některé z nejhorších kapitol lidské historie, autoři nové studie naznačují, že takové tendence v počítačovém vidění a implementaci by měly dostat větší pozornost, zejména proto, že podporující rámec v otázce, stažený téměř milionkrát měsíčně, by mohl dále šířit a podporovat rasovou předpojatost v následujících rámcích.

Architektura studovaná v nové práci je Contrastive Language Image Pretraining (CLIP), multimodální model strojového učení, který se učí semantické asociace prostřednictvím trénování na obraz/caption párech z internetu – semi-dohledaný přístup, který snižuje významné náklady na označení, ale který pravděpodobně odráží předpojatost lidí, kteří vytvořili popisky.

Z papíru:

‘Naše výsledky poskytují důkazy pro hypodescent v CLIP embedding prostoru, předpojatost aplikovanou silněji na obrázky žen. Výsledky dále ukazují, že CLIP asociuje obrázky s rasovými nebo etnickými štítky na základě odchylky od Bílé, s Bílou jako výchozím.

Papír také zjistil, že valenční asociace obrázku (tj. jeho tendence být asociován s “dobrými” nebo “špatnými” věcmi) je výrazně vyšší pro “menšinové” rasové štítky než pro kaukazské štítky, a naznačuje, že předpojatosti CLIP odrážejí US-centrickou korpus literatury (anglicky Wikipedia), na kterém byl rámec trénován.

Komentář k dopadům zjevné podpory hypodescentu CLIP, autoři uvádějí*:

‘[Mezi] prvními použitími CLIP bylo trénování nultého snímku generátoru obrazů DALL-E. Larger, non-public verze architektury CLIP byla použita pro trénování DALL-E 2. Souhlasně s výsledky této studie, Rizika a omezení popsána v modelové kartě DALL-E 2 note, že “produkuje obrázky, které tendují k přehánění lidí, kteří jsou bílí”.

‘Taková použití demonstrují potenciál pro předpojatosti naučené CLIP, aby se rozšířily za rámec modelu, protože jeho funkce jsou použity pro vedení formování sémantiky v jiných špičkových modelech AI.

‘Navíc, díky pokrokům realizovaným CLIP a podobnými modely pro asociaci obrazů a textu v nultém snímku, multimodální architektury byly popsány jako základ pro budoucnost široce používaných internetových aplikací, včetně vyhledávačů.

‘Naše výsledky ukazují, že další pozornost tomu, co takové modely naučí z přirozeného jazykového dohledu, je odůvodněna.’

Papír je nazvaný Evidence for Hypodescent in Visual Semantic AI a pochází od tří výzkumníků z University of Washington a Harvard University.

CLIP a špatné vlivy

Ačkoli výzkumníci prohlašují, že jejich práce je první analýzou hypodescentu v CLIP, předchozí práce prokázaly, že workflow CLIP, závislý na velkém rozsahu nesupervizovaného trénování z nesupervizovaných webových dat, podhodnocuje ženy, může produkovat urážlivý obsah, a může demonstrovat semantickou předpojatost (jako anti-muslimský sentiment) ve svém obrazovém kódéru.

Původní papír, který představil CLIP, uznal, že v nultém snímku CLIP asociuje pouze 58,3% lidí s bílou rasovou značkou v FairFace datové sadě. Poznamenává, že FairFace byl označen možnou předpojatostí pracovníky Amazon Mechanical Turk, autoři nové studie uvádějí, že “významná menšina lidí, kteří jsou vnímáni ostatními lidmi jako bílí, jsou asociovány s rasou jinou než bílou CLIP.”

Pokračují*:

‘Inverzní případ se nezdá být pravdivý, protože jedinci, kteří jsou vnímáni jako příslušníci jiných rasových nebo etnických značek v datové sadě FairFace, jsou asociovány s těmito značkami CLIP. Tento výsledek naznačuje možnost, že CLIP naučil pravidlo “hypodescentu”, jak je popsáno sociálními vědci: jedinci s multirasovou genealogií jsou více pravděpodobně vnímáni a kategorizováni jako příslušníci menšinové nebo méně výhodné rodičovské skupiny než jako příslušníci většinové nebo výhodné rodičovské skupiny.

‘To znamená, že dítě černého a bílého rodiče je vnímáno jako více černé než bílé; a dítě asijského a bílého rodiče je vnímáno jako více asijské než bílé.’

Papír má tři centrální nálezy: že CLIP vykazuje hypodescent, “shromažďuje” lidi s multirasovými identitami do menšinové přispívající rasové kategorie; že “bílá je výchozí rasou v CLIP”, a že konkurenční rasy jsou definovány jejich “odchylkou” od bílé kategorie; a že valenční předpojatost (asociace s “špatnými” koncepty) koreluje s tím, jak je jedinec kategorizován do rasové menšiny.

Metoda a data

Aby určili, jak CLIP zachází s multirasovými subjekty, výzkumníci použili předtím přijatou morfovací techniku k úpravě rasy obrázků jednotlivců. Fotografie byly pořízeny z Chicago Face Database, sady vyvinuté pro psychologické studie týkající se rasy.

Příklady z rasově-morfovaných CFD obrázků uvedených v dodatku nové studie. Zdroj: https://arxiv.org/pdf/2205.10764.pdf

Příklady z rasově-morfovaných CFD obrázků uvedených v dodatku nové studie. Zdroj: https://arxiv.org/pdf/2205.10764.pdf

Výzkumníci zvolili pouze obrázky s “neutrálním výrazem” z datové sady, aby zůstali konzistentní s předchozí prací. Použili Generative Adversarial Network StyleGAN2-ADA (trénovaný na FFHQ) k úpravě rasy obličejových obrázků a vytvořili mezilehlé obrázky, které demonstrují postup od jedné rasy k druhé (viz výše uvedené obrázky).

Souladně s předchozí prací, výzkumníci morfovali tváře lidí, kteří se identifikovali jako černí, asiaté a latino v datové sadě do tváří těch, kteří se označili za bílé. Devatenáct mezilehlých fází je produkováno v procesu. Celkem 21 000 1024x1024px obrázků bylo vytvořeno pro projekt touto metodou.

Výzkumníci poté získali projektované obrazové vložené pro CLIP pro každou z celkových 21 obrázků v každé rasové morfologické sadě. Poté požádali o štítek pro každý obrázek z CLIP: “multirasový”, “birasový”, “smíšená rasa” a “osoba” (poslední štítek vynechávající rasu).

Verze CLIP použitá byla CLIP-ViT-Base-Patch32 implementace. Autoři uvádějí, že tento model byl stažen více než milionkrát v měsíci předtím, než napsali svou studii, a představuje 98% stažení libovolného modelu CLIP z Transformers knihovny.

Testy

Aby otestovali potenciální tendenci CLIP k hypodescentu, výzkumníci poznamenali rasový štítek přiřazený CLIP ke každému obrázku v gradientu morfových obrázků pro každou osobu.

Podle výsledků CLIP tenduje k seskupování lidí v “menšinových” kategoriích kolem 50% přechodového bodu.

Při 50% míchací poměr, kde je subjekt stejně původní/cílové rasy, CLIP asociuje vyšší počet 1000 morfových ženských obrázků s asijskými (89,1%), latinskoamerickými (75,8%) a černými (69,7%) štítky než s ekvivalentním bílým štítkem.

Při 50% míchací poměr, kde je subjekt stejně původní/cílové rasy, CLIP asociuje vyšší počet 1000 morfových ženských obrázků s asijskými (89,1%), latinskoamerickými (75,8%) a černými (69,7%) štítky než s ekvivalentním bílým štítkem.

Výsledky ukazují, že ženské subjekty jsou více náchylné k hypodescentu pod CLIP než muži, ačkoli autoři hypotézují, že to může být způsobeno tím, že webově odvozené a nesupervizované štítky, které charakterizují ženské obrázky, tendují k zdůrazňování vzhledu subjektu více než v případě mužů, a že to může mít zkreslující účinek.

Hypodescent v 50% rasovém přechodu nebyl pozorován u asijsko-bílého mužského nebo latinskoamericko-bílého mužského morfování, zatímco CLIP přiřadil vyšší kosinovou podobnost černému štítku v 67,5% případů při 55% míchací poměr.

Průměrná kosinová podobnost Multiracial, Biracial a Mixed Race štítků. Výsledky ukazují, že CLIP operuje určitou

Průměrná kosinová podobnost Multiracial, Biracial a Mixed Race štítků. Výsledky ukazují, že CLIP operuje určitou “rozvodnou” kategorizaci při různých procentech rasové směsi, méně často přiřazuje takovou rasovou směs Bílé (‘osoba’, v rámci experimentů) než etnickosti, která je vnímána v obrázku.

Ideálním cílem, podle papíru, je, aby CLIP kategorizoval mezilehlé rasové směsi přesně jako “smíšenou rasu”, místo aby definовал “bod zlomu”, ve kterém je subjekt tak často přiřazen zcela do ne-bílé kategorie.

Do určité míry CLIP přiřazuje mezilehlé morfologické kroky se Smíšenou Rasou (viz výše uvedený graf), ale nakonec demonstruje mid-range preference kategorizovat subjekty jako jejich menšinovou přispívající rasu.

Co se týče valence, autoři poznamenávají zkreslený úsudek CLIP:

‘[Průměrná] valenční asociace (asociace s nepříjemnými vs. příjemnými) se mění s míchací poměr přes černobílý mužský morfový seriál, tak, že CLIP kóduje asociace s nepříjemností pro tváře, které jsou nejvíce podobné CFD dobrovolníkům, kteří se identifikují jako černí.’

Valenční výsledky - testy ukazují, že menšinové skupiny jsou více asociovány s negativními koncepty v obraz/pár architektuře než bílé štítky. Autoři tvrdí, že asociace nepříjemnosti obrázku se zvyšuje s pravděpodobností, že model asociuje obrázek s černým štítkem.

Valenční výsledky – testy ukazují, že menšinové skupiny jsou více asociovány s negativními koncepty v obraz/pár architektuře než bílé štítky. Autoři tvrdí, že asociace nepříjemnosti obrázku se zvyšuje s pravděpodobností, že model asociuje obrázek s černým štítkem.

Papír uvádí:

‘Důkazy naznačují, že valence obrázku koreluje s rasovou asociací. Konkrétněji, naše výsledky ukazují, že čím jistější je model, že obrázek odráží černého jedince, tím více je asociován s nepříjemným vložením prostoru.’

Nicméně, výsledky také ukazují negativní korelaci v případě asijských tváří. Autoři naznačují, že to může být způsobeno “přenosovým” (prostřednictvím webových zdrojů) pozitivním vnímáním asijských lidí a komunit v USA. Autoři uvádějí*:

‘Pozorování korelace mezi příjemností a pravděpodobností asijského textového štítku může korespondovat se stereotypem “modelové menšiny”, kde lidé asijského původu jsou chváleni za jejich vzestupnou mobilitu a asimilaci do americké kultury, a dokonce asociováni s “dobrým chováním”.’

Co se týče konečného cíle, prozkoumat, zda je bílá “výchozí identita” z pohledu CLIP, výsledky ukazují vestavěnou polaritu, naznačující, že v této architektuře je poměrně obtížné být “trochu bílý”.

Kosinová podobnost napříč 21 000 obrázků vytvořených pro testy.

Kosinová podobnost napříč 21 000 obrázků vytvořených pro testy.

Autoři komentují:

‘Důkazy naznačují, že CLIP kóduje bílou jako výchozí rasu. To je podporováno silnějšími korelacemi mezi bílými kosinovými podobnostmi a osobními kosinovými podobnostmi než pro jakoukoli jinou rasovou nebo etnickou skupinu.’

 

*Mé převedení autorských inline citací na hypertextové odkazy.

Poprvé publikováno 24. května 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai