Unghiul lui Anderson

Schimbarea genului și a rasei în rezultatele căutării de imagini cu ajutorul învățării automate

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O colaborare de cercetare între UC San Diego și Adobe (ADBE ) Research a propus o soluție inovatoare și proactivă pentru lipsa de diversitate rasială și de gen în rezultatele căutării de imagini pentru profesiile tradițional dominate de albi: utilizarea Rețelelor Adversative Generative (GAN) pentru a crea imagini ne-reale ale “profesiilor cu prejudecăți”, unde genul și/sau rasa subiectului sunt modificate.

În acest exemplu din noua lucrare, cercetătorii au introdus caracteristici pentru o fotografie dorită care nu este reprezentată în mod normal într-un corpus de material imagine disponibil sau este reprezentată într-un mod inadecvat (de exemplu, sexualizat sau într-o reprezentare inadecvată). Sursă

În acest exemplu din noua lucrare, cercetătorii au introdus caracteristici pentru o fotografie dorită care nu este reprezentată în mod normal într-un corpus de material imagine disponibil sau este reprezentată într-un mod inadecvat (de exemplu, sexualizat sau într-o reprezentare inadecvată). Sursă

Într-o nouă lucrare intitulată Generarea și controlul diversității în căutarea de imagini, autorii sugerează că există o limită a extinderii cu care reordonarea poate corecta dezechilibrul claselor de imagini și caracteristici prejudecate, cum ar fi instalator, operator de mașini, inginer de software și multe altele – și că creșterea diversității rasiale și de gen cu date sintetice poate fi calea de urmat pentru această provocare.

‘Urmarirea unui world utopic cere oferirea utilizatorilor de conținut cu oportunitatea de a prezenta orice profesie cu caracteristici rasiale și de gen diverse. Alegerea limitată a conținutului existent pentru anumite combinații de profesie, rasă și gen prezintă o provocare pentru furnizorii de conținut. Cercetările actuale care se ocupă de prejudecăți în căutare se concentrează în principal pe algoritmi de reordonare.

‘Cu toate acestea, aceste metode nu pot crea conținut nou sau modifica distribuția generală a atributelor protejate în fotografii. Pentru a remedia aceste probleme, propunem o nouă sarcină de generare de imagini de înaltă fidelitate condiționată de multiple atribute din seturi de date dezechilibrate. ‘

Pentru aceasta, autorii au experimentat cu o varietate de sisteme de sinteză de imagini bazate pe GAN, ajungând în final la o arhitectură bazată pe StyleGan2.

Din materialele suplimentare ale lucrării, două exemple de 'egalizare' a reprezentărilor bazate pe imagini ale profesiilor prejudecate, în acest caz, 'tâmplar' și 'operator de mașini'. Sursă

Din materialele suplimentare ale lucrării, două exemple de ‘egalizare’ a reprezentărilor bazate pe imagini ale profesiilor prejudecate, în acest caz, ‘tâmplar’ și ‘operator de mașini’. Sursă

Reprezentate inadecvat sau incorect

Cercetătorii formulează provocarea în termeni de rezultat al unei căutări reale în rezultatele căutării pentru ‘instalator’* pe Google Image search, observând că rezultatele imagini sunt dominate de tineri albi.

Din lucrarea, rezultate selectate pentru 'instalator' în Google Image search, ianuarie 2021.

Din lucrarea, rezultate selectate pentru ‘instalator’ în Google Image search, ianuarie 2021.

Autorii notează că indicații similare de prejudecată apar pentru o gamă de profesiuni, cum ar fi ‘asistent administrativ’, ‘curățător’ și ‘operator de mașini’, cu prejudecăți corespunzătoare pentru vârstă, gen și rasă.

‘Nu este surprinzător, datorită prejudecăților societale, unele combinații de rasă și gen pot avea puține sau deloc imagini într-un depozit de conținut. De exemplu, atunci când am căutat ‘femeie neagră (sau afro-americană) operator de mașini’ sau ‘bărbat asiatic asistent administrativ’, nu am găsit imagini relevante pe [Google Image search]. ‘

‘În plus, în cazuri rare, anumite combinații de gen și rasă pot duce la reprezentarea inadecvată a indivizilor. Am observat acest comportament pentru cereri de căutare precum ‘femeie asiatică instalator’ sau ‘femeie neagră (sau afro-americană) paznic.’ ‘

Lucrarea citează o altă colaborare academică din 2014, în care cercetătorii au colectat primele 400 de rezultate de căutare de imagini pentru 96 de profesiuni. Acea lucrare a constatat că femeile reprezentau doar 37% din rezultate, iar imaginile anti-stereotip doar 22%. Un studiu din 2019 de la Yale a constatat că cinci ani au adus aceste procente la doar 45% și 30% respectiv.

În plus, studiul din 2014 a clasificat sexualizarea indivizilor în anumite profesiuni în rezultatele căutării de imagini ca Problema tâmplarului sexy, astfel de clasificări inadecvate putând distorsiona rezultatele pentru recunoașterea profesiilor.

Imaginea de ansamblu

Principala provocare pentru autori a fost producerea unui sistem de sinteză de imagini bazat pe GAN capabil să producă imagini cu rezoluția de 1024×1024, deoarece, în stadiul actual al tehnologiei GAN și al sistemelor de sinteză de imagini bazate pe encoder/decoder, rezoluția de 512×512 este deja destul de luxuriantă. Orice rezoluție mai mare ar fi obținută prin mărirea dimensiunii finale a imaginii, la un anumit cost de timp și resurse de procesare, și la un anumit risc pentru autenticitatea imaginilor generate.

Cu toate acestea, autorii afirmă că rezoluțiile mai mici nu ar putea spera să obțină tracțiune în căutarea de imagini și au experimentat cu diverse cadre GAN care ar putea fi capabile să producă imagini de înaltă rezoluție la cerere, la un nivel acceptabil de autenticitate.

Când s-a luat decizia de a adopta StyleGan2, a devenit evident că proiectul va necesita un control mai mare asupra sub-caracteristicilor generării de ieșire (cum ar fi rasă, profesie și gen), decât permite o implementare implicită. Prin urmare, autorii au utilizat condiționarea multi-clasă pentru a îmbunătăți procesul de generare.

Arhitectura generatorului de imagini specific, pe care autorii afirmă că nu este specifică StyleGAN2, ci poate fi aplicată pe o gamă de cadre de generare.

Arhitectura generatorului de imagini specific, pe care autorii afirmă că nu este specifică StyleGAN2, ci poate fi aplicată pe o gamă de cadre de generare.

Pentru a controla factorii de rasă, gen și profesie, arhitectura injectează o codificare unică a acestor caracteristici concatenate în vectorul y. După aceea, o rețea feedforward este utilizată pentru a încorpora aceste caracteristici, astfel încât să nu fie neglijate la momentul generării.

Autorii observă că există limite dure ale extinderii cu care StyleGAN2 poate fi manipulat în acest mod și că încercările mai fine de a altera rezultatele au dus la o calitate mai slabă a imaginilor, și chiar la prăbușirea modului.

Aceste remedii, cu toate acestea, nu rezolvă problemele de prejudecăți implicite în arhitectură, pe care cercetătorii au trebuit să le abordeze prin supraspecimarea entităților subreprezentate din setul de date, fără a risca suprapunerea, ceea ce ar afecta flexibilitatea fluxurilor de imagini generate.

Prin urmare, autorii au adaptat StyleGAN2-ADA, care utilizează Augmentarea Discriminatorului Adaptiv (ADA), pentru a preveni suprapunerea discriminatorului.

Generarea și evaluarea datelor

Deoarece obiectivul proiectului este de a genera date sintetice noi, cercetătorii au adoptat metodologia proiectului din 2014, alegând un număr de profesiuni țintă care demonstrează o prejudecată rasială și de gen ridicată. Profesiile alese au fost ‘manager executiv’, ‘asistent administrativ’, ‘asistent medical’, ‘fermer’, ‘persoană militară’, ‘paznic’, ‘șofer de camion’, ‘curățător’, ‘tâmplar’, ‘instalator’, ‘operator de mașini’, ‘persoană de suport tehnic’, ‘inginer de software’ și ‘scriitor’.

Autorii au selectat aceste profesiuni nu numai pe baza extinderii prejudecăților percepute în rezultatele căutării de imagini, ci și pentru că majoritatea lor conțin un fel de componentă vizuală codificată pentru profesiune, cum ar fi o uniformă sau prezența echipamentului sau mediului specific.

Setul de date a fost alimentat cu 10.000 de imagini din biblioteca Adobe Stock, obținând în general un scor de 95% sau mai bun atunci când s-a încercat clasificarea unei profesiuni.

Deoarece multe dintre imagini nu au fost utile pentru sarcina țintă (de exemplu, nu conțineau oameni), a fost necesară o filtrare manuală. După aceea, un clasificator bazat pe ResNet32 pre-antrenat pe FairFace a fost utilizat pentru a eticheta imaginile pentru gen și rasă, obținând o acuratețe medie de 95,7% pentru gen și 81,5% pentru rasă. Astfel, cercetătorii au obținut etichete de imagine pentru atributele Sex: Masculin, Feminin, Rasă: Alb, Negru, Asiatic și alte rase.

Modelele au fost construite în TensorFlow utilizând StyleGAN2 și StyleGAN2-ADA ca rețele nucleu. Pre-antrenarea a fost realizată cu greutățile pre-antrenate StyleGAN2 pe setul de date Flickr-Faces-HQ (FFHQ) dataset, completat cu 34.000 de imagini specifice profesiunii pe care autorii le-au adunat într-un set de date separat pe care l-au numit Uncurated Stock-Occupation HQ (U-SOHQ).

Un exemplu de HIT din evaluarea umană Amazon Mechanical Turk.

Un exemplu de HIT din evaluarea umană Amazon Mechanical Turk.

Imaginile au fost generate sub patru configurații de arhitectură, Uniform+ obținând în final cele mai bune scoruri atât în FID (evaluare automată), cât și în evaluarea ulterioară de către lucrătorii Amazon Mechanical Turk. În combinație cu acuratețea clasificării, autorii au utilizat acesta ca metrică centrală pentru propria lor metrică, intitulată Scor de potrivire a atributelor.

Evaluarea umană a imaginilor generate de diverse metode, cu metoda Uniform+ dovedindu-se a fi cea mai convingătoare și, ulterior, baza pentru un nou set de date.

Evaluarea umană a imaginilor generate de diverse metode, cu metoda Uniform+ dovedindu-se a fi cea mai convingătoare și, ulterior, baza pentru un nou set de date.

Lucrarea nu specifică dacă Stock-Occupation-HQ, setul de date complet derivat din Uniform+, va fi făcut public, dar afirmă că conține 8.113 imagini HQ (1024×1024).

Difuziune

Noua lucrare nu se ocupă în mod explicit de modul în care imaginile sintetice “rebalansate” ar putea fi introduse în circulație. Presupunând că însămânțarea noilor seturi de date de computere cu imagini “rebalansate” de acest tip ar rezolva problema prejudecăților, dar ar putea prezenta și obstacole pentru alte tipuri de cercetare care încearcă să evalueze incluziunea de gen și rasă în “lumea reală”, într-o situație în care imagini sintetice sunt amestecate cu imagini din lumea reală.

Bazele de date sintetice, cum ar fi cea produsă de cercetători, ar putea fi făcute disponibile la un cost redus sau chiar gratuit, ca imagini stock de înaltă rezoluție, utilizând acest stimulent de reducere a costurilor ca un motor de difuziune.

Proiectul nu abordează prejudecățile bazate pe vârstă, probabil un subiect de interes pentru cercetări viitoare.

 

* Căutarea a fost capturată pe 5 ianuarie 2022, iar căutarea menționată în lucrare a fost efectuată în ianuarie 2021.

 

Publicat pentru prima dată pe 5 ianuarie 2022.

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai