Angolo di Anderson
Cambiamento di genere e razza nei risultati di ricerca di immagini con l’apprendimento automatico

Una collaborazione di ricerca tra UC San Diego e Adobe (ADBE ) Research ha proposto una soluzione innovativa e proattiva alla mancanza di diversità razziale e di genere nei risultati di ricerca di immagini per occupazioni tradizionalmente dominate da persone di razza bianca: l’uso di reti generative avversarie (GAN) per creare immagini non reali di “professioni distorte”, in cui il genere e/o la razza del soggetto sono alterati.

In questo esempio dal nuovo articolo, i ricercatori hanno inserito caratteristiche per una foto desiderata che non è rappresentata in un corpus tipico di materiale di immagine disponibile o è rappresentata in modo inadeguato (ad esempio, sessualizzato o in una rappresentazione altrimenti inadeguata). Fonte
In un nuovo articolo intitolato Generazione e controllo della diversità nella ricerca di immagini, gli autori suggeriscono che esiste un limite alla misura in cui il re-ranking può risolvere il problema dell’equilibrio di classi di immagini/distorte come idraulico, operatore di macchina, ingegnere del software e molti altri – e che aumentare la diversità razziale e di genere con dati sintetici può essere la strada da percorrere per questa sfida.
‘La ricerca di un mondo utopico richiede di fornire agli utenti del contenuto la possibilità di presentare qualsiasi professione con caratteristiche razziali e di genere diverse. La limitata scelta di contenuto esistente per determinate combinazioni di professione, razza e genere presenta una sfida ai fornitori di contenuto. La ricerca attuale sulla distorsione nella ricerca si concentra principalmente su algoritmi di re-ranking.
‘Tuttavia, questi metodi non possono creare nuovo contenuto o modificare la distribuzione generale di attributi protetti nelle foto. Per risolvere questi problemi, proponiamo un nuovo compito di generazione di immagini ad alta fedeltà condizionata su più attributi da set di dati squilibrati. ‘
Per questo scopo, gli autori hanno sperimentato con una varietà di sistemi di sintesi di immagini basati su GAN, alla fine optando per un’architettura basata su StyleGan2.

Dai materiali supplementari dell’articolo, due esempi di rappresentazioni di immagini ‘equalizzate’ di professioni distorte, in questo caso ‘falegname’ e ‘operatore di macchina’. Fonte
Rappresentati in modo inadeguato o inappropriato
I ricercatori definiscono la sfida in termini di un risultato di ricerca reale per ‘idraulico‘* su Google Image search, osservando che i risultati di immagine sono dominati da giovani uomini bianchi.

Dall’articolo, risultati selezionati per ‘idraulico’ in Google Image search, gennaio 2021.
Gli autori notano che indicazioni simili di distorsione si verificano per una gamma di professioni, come ‘assistente amministrativo’, ‘addetto alle pulizie’ e ‘operatore di macchina’, con distorsioni corrispondenti per età, genere e razza.
‘Non sorprendentemente, a causa di tale distorsione sociale, alcune combinazioni di razza e genere possono avere poche o nessuna immagine in un repository di contenuto. Ad esempio, quando abbiamo cercato ‘operatrice di macchina nera (o afroamericana)’ o ‘assistente amministrativo asiatico’, non abbiamo trovato immagini rilevanti su [Google Image search].
‘Inoltre, in casi rari, particolari combinazioni di genere e razza possono portare a rappresentazioni inadeguate di individui. Abbiamo osservato questo comportamento per query di ricerca come ‘idraulico asiatico femmina’ o ‘guardia di sicurezza nera (o afroamericana)’.
L’articolo cita un’altra collaborazione accademica del 2014, in cui i ricercatori hanno raccolto i primi 400 risultati di ricerca di immagini per 96 occupazioni. Quel lavoro ha scoperto che le donne rappresentavano solo il 37% dei risultati e le immagini anti-stereotipali solo il 22%. Uno studio del 2019 di Yale ha scoperto che cinque anni avevano portato questi percentuali al 45% e al 30% rispettivamente.
Inoltre, lo studio del 2014 ha classificato la sessualizzazione di individui in determinate occupazioni nei risultati di ricerca di immagini come il problema del falegname sexy, con tali classificazioni inadeguate che potrebbero distortare i risultati per il riconoscimento di occupazione.
La visione d’insieme
La principale sfida per gli autori è stata quella di produrre un sistema di sintesi di immagini basato su GAN in grado di produrre immagini a risoluzione 1024×1024, poiché, allo stato attuale dell’arte nei sistemi di sintesi di immagini basati su GAN e encoder/decoder, 512×512 è un lusso. Qualsiasi cosa di più alta risoluzione tenderebbe a essere ottenuta aumentando la risoluzione del output finale, a un certo costo di tempo e risorse di elaborazione, e a un certo rischio per l’autenticità delle immagini generate.
Tuttavia, gli autori affermano che risoluzioni più basse non potrebbero aspettarsi di ottenere trazione nella ricerca di immagini e hanno sperimentato con una varietà di framework GAN che potrebbero essere in grado di produrre immagini ad alta risoluzione su richiesta, a un livello di autenticità accettabile.
Quando la decisione è stata presa di adottare StyleGan2, è diventato evidente che il progetto avrebbe avuto bisogno di un controllo maggiore sulle sottocaratteristiche del output generato (come razza, occupazione e genere), rispetto a quanto consentito da una distribuzione predefinita. Pertanto, gli autori hanno utilizzato la condizionamento multi-classe per aumentare il processo di generazione.

L’architettura del generatore di immagini specifiche, che gli autori affermano non essere specifica per StyleGAN2, ma che potrebbe essere applicata a una gamma di framework di generazione.
Per controllare i fattori di razza, genere e occupazione, l’architettura inietta un’unica codifica di queste caratteristiche concatenate nel y vettore. Dopo di questo, una rete feedforward viene utilizzata per incorporare queste caratteristiche, in modo che non vengano ignorate al momento della generazione.
Gli autori osservano che esistono limiti rigorosi alla misura in cui StyleGAN2 può essere manipolato in questo modo e che tentativi più fini di alterare i risultati hanno portato a una peggiore qualità delle immagini, e addirittura a collasso di modalità.
Questi rimedi, tuttavia, non risolvono i problemi di distorsione implicita nell’architettura, che i ricercatori hanno dovuto affrontare campionando entità sottorappresentate nel set di dati, senza rischiare di sovrappopolare, il che avrebbe influenzato la flessibilità dei flussi di immagini generate.
Pertanto, gli autori hanno adattato StyleGAN2-ADA, che utilizza l’augmentazione del discriminatore adattivo (ADA), per prevenire che il discriminatore si sovrappopolasse.
Generazione e valutazione dei dati
Poiché l’obiettivo del progetto è quello di generare nuovi dati sintetici, i ricercatori hanno adottato la metodologia del progetto del 2014, scegliendo un numero di professioni bersaglio che dimostrano una forte distorsione razziale e di genere. Le professioni scelte sono state ‘manager esecutivo’, ‘assistente amministrativo’, ‘infermiere’, ‘agricoltore’, ‘militare’, ‘guardia di sicurezza’, ‘autista di camion’, ‘addetto alle pulizie’, ‘falegname’, ‘idraulico’, ‘operatore di macchina’, ‘tecnico di supporto’, ‘ingegnere del software’ e ‘scrittore’.
Gli autori hanno selezionato queste professioni non solo in base alla misura della distorsione percepita nei risultati di ricerca di immagini, ma anche perché la maggior parte di esse contiene una sorta di componente visiva codificata per la professione, come un’uniforme o la presenza di attrezzature o ambienti specifici.
Il set di dati è stato alimentato da 10.000 immagini dalla libreria Adobe Stock, ottenendo generalmente un punteggio del 95% o superiore quando si è tentato di classificare una professione.
Poiché molte delle immagini non erano utili per il compito bersaglio (ad esempio, non contenevano persone), è stata necessaria una filtrazione manuale. Dopo di questo, un classificatore basato su ResNet32 pre-addestrato su FairFace è stato utilizzato per etichettare le immagini per genere e razza, ottenendo un’accuratezza media del 95,7% per il genere e dell’81,5% per la razza. Pertanto, i ricercatori hanno ottenuto etichette di immagine per gli attributi Sesso: maschio, femmina, Razza: bianco, nero, asiatico e altre razze.
I modelli sono stati costruiti in TensorFlow utilizzando StyleGAN2 e StyleGAN2-ADA come reti core. L’addestramento predefinito è stato eseguito con i pesi pre-addestrati di StyleGAN2 sul set di dati Flickr-Faces-HQ di NVIDIA (FFHQ) dataset, aumentato con 34.000 immagini specifiche di occupazione che gli autori hanno raccolto in un set di dati separato che hanno chiamato Uncurated Stock-Occupation HQ (U-SOHQ).

Un esempio di HIT dall’evaluazione umana di Amazon Mechanical Turk.
Le immagini sono state generate sotto quattro configurazioni di architettura, con Uniform+ che ha ottenuto i punteggi migliori sia nella valutazione automatizzata (FID), sia nella successiva valutazione da parte dei lavoratori di Amazon Mechanical Turk. Combinato con l’accuratezza della classificazione, gli autori hanno utilizzato questo come metrica principale per la loro metrica, intitolata Punteggio di corrispondenza degli attributi.

Valutazione umana delle immagini generate da vari metodi, con il metodo Uniform+ che si è rivelato il più convincente, e successivamente la base per un nuovo set di dati.
L’articolo non specifica se Stock-Occupation-HQ, il set di dati completo derivato da Uniform+, sarà reso pubblicamente disponibile, ma afferma che contiene 8.113 immagini HQ (1024×1024).
Diffusione
Il nuovo articolo non affronta esplicitamente il modo in cui le immagini sintetizzate, ‘riequilibrate’ potrebbero essere introdotte in circolazione. Presumibilmente, seminare nuovi set di dati di visione computerizzata con immagini riadattate del tipo che gli autori hanno creato potrebbe risolvere il problema della distorsione, ma potrebbe anche presentare ostacoli ad altri tipi di ricerca che cercano di valutare l’inclusione di genere e razza in scenari del ‘mondo reale’, in una circostanza in cui le immagini sintetiche sono mescolate con immagini del mondo reale.
Database sintetici come quello prodotto dai ricercatori potrebbero presumibilmente essere resi disponibili a costo zero come immagini di stock ad alta risoluzione, utilizzando questo incentivo di risparmio di costo come motore di diffusione.
Il progetto non affronta la distorsione basata sull’età, presumibilmente un argomento di interesse per future ricerche.
* Ricerca catturata il 5 gennaio 2022, la ricerca degli autori citata nell’articolo è stata condotta nel gennaio 2021.
Pubblicato per la prima volta il 5 gennaio 2022.












