Ângulo de Anderson
Alterando Gênero e Raça nos Resultados de Busca de Imagens com Aprendizado de Máquina

Uma colaboração de pesquisa entre a UC San Diego e a Adobe (ADBE ) Research propôs uma solução inovadora e proativa para a falta de diversidade racial e de gênero nos resultados de busca de imagens para profissões tradicionalmente dominadas por brancos: o uso de Redes Adversárias Generativas (GANs) para criar imagens não reais de profissões “enviesadas”, onde o gênero e/ou a raça do sujeito são alterados.

Neste exemplo do novo artigo, os pesquisadores inseriram características para uma foto desejada que não está representada em um corpus típico de material de imagem disponível, ou que está representada de forma inadequada (por exemplo, sexualizada ou de outra forma inadequada). Fonte
Em um novo artigo intitulado Gerando e Controlando Diversidade na Busca de Imagens, os autores sugerem que há um limite para a extensão com que o reordenamento pode corrigir o desequilíbrio de classes de imagens/atributos enviesados, como encanador, operador de máquina, engenheiro de software e muitos outros – e que aumentar a diversidade racial e de gênero com dados sintéticos pode ser o caminho para este desafio.
‘A busca por um mundo utópico exige fornecer aos usuários a oportunidade de apresentar qualquer profissão com características raciais e de gênero diversificadas. A escolha limitada de conteúdo existente para certas combinações de profissão, raça e gênero apresenta um desafio para os provedores de conteúdo. A pesquisa atual que lida com viés na busca se concentra principalmente em algoritmos de reordenamento.
‘No entanto, esses métodos não podem criar novo conteúdo ou alterar a distribuição geral de atributos protegidos em fotos. Para remediar esses problemas, propomos uma nova tarefa de geração de imagens de alta fidelidade condicionada em vários atributos de conjuntos de dados desequilibrados. ‘
Para isso, os autores experimentaram com vários sistemas de síntese de imagens baseados em GAN, finalmente encontrando uma arquitetura baseada em StyleGan2.

Do material suplementar do artigo, dois exemplos de ‘equalização’ de representações de profissões enviesadas em imagens, neste caso, ‘carpinteiro’ e ‘operador de máquina’. Fonte
Representados de Forma Inadequada ou Inapropriada
Os pesquisadores definem o desafio em termos de um resultado de busca real no Google Image search * para ‘encanador’, observando que os resultados de imagem são dominados por homens brancos jovens.

Do artigo, resultados selecionados para ‘encanador’ no Google Image search, janeiro de 2021.
Os autores observam que indicações semelhantes de viés ocorrem para uma variedade de profissões, como ‘assistente administrativo’, ‘limpador’ e ‘operador de máquina’, com viés correspondentes para idade, gênero e raça.
‘Não surpreendentemente, devido a esse viés social, algumas combinações de raça e gênero podem ter poucas ou nenhuma imagem em um repositório de conteúdo. Por exemplo, quando procuramos ‘operadora de máquina negra (ou afro-americana)’ ou ‘assistente administrativo asiático’, não encontramos imagens relevantes no Google Image search.
‘Além disso, em casos raros, combinações específicas de gênero e raça podem levar a indivíduos sendo retratados de forma inadequada. Observamos esse comportamento para consultas de busca como ‘encanadora asiática’ ou ‘segurança negra (ou afro-americana)’.
O artigo cita outra colaboração acadêmica de 2014, onde os pesquisadores coletaram os 400 principais resultados de busca de imagem para 96 profissões. Esse trabalho encontrou que as mulheres representavam apenas 37% dos resultados, e imagens anti-estereotipadas apenas 22%. Um estudo de 2019 da Yale encontrou que cinco anos haviam aumentado esses percentuais para apenas 45% e 30%, respectivamente.
Além disso, o estudo de 2014 classificou a sexualização de indivíduos em certas profissões nos resultados de busca de imagem como o Problema do Carpinteiro Sexy, com tais classificações inadequadas potencialmente distorcendo os resultados para reconhecimento de profissão.
A Grande Imagem
O principal desafio para os autores foi produzir um sistema de síntese de imagens baseado em GAN capaz de produzir imagens com resolução de 1024×1024, pois, no estado atual da arte em GAN e sistemas de síntese de imagens baseados em codificador/decodificador, 512×512 é um luxo. Qualquer coisa maior tenderia a ser obtida por meio do aumento da saída final, a um custo de tempo e recursos de processamento, e a um risco para a autenticidade das imagens geradas.
No entanto, os autores afirmam que resoluções mais baixas não poderiam esperar ganhar tração na busca de imagens e experimentaram com vários quadros de GAN que pudessem ser capazes de produzir imagens de alta resolução sob demanda, em um nível de autenticidade aceitável.
Quando a decisão foi tomada de adotar o StyleGan2, ficou aparente que o projeto precisaria de um controle maior sobre sub-recursos da saída gerada (como raça, profissão e gênero) do que uma implantação padrão permite. Portanto, os autores usaram condicionamento multiclasse para aumentar o processo de geração.

A arquitetura do gerador de imagens especificadas, que os autores afirmam não ser específica do StyleGAN2, mas que pode ser aplicada em uma variedade de quadros de gerador.
Para controlar os fatores de raça, gênero e profissão, a arquitetura injeta uma codificação de uma única vez dessas características concatenadas no vetor y. Depois disso, uma rede feedforward é usada para incorporar esses recursos, para que eles não sejam descartados no momento da geração.
Os autores observam que há limitações difíceis para a extensão com que o StyleGAN2 pode ser manipulado dessa forma e que tentativas mais detalhadas de alterar os resultados resultaram em uma qualidade de imagem pior e até colapso de modo.
Essas soluções, no entanto, não resolvem os problemas de viés implícito na arquitetura, que os pesquisadores tiveram que abordar ao sobreamostrar entidades sub-representadas no conjunto de dados, mas sem arriscar sobreajustar, o que afetaria a flexibilidade dos fluxos de imagens geradas.
Portanto, os autores adaptaram o StyleGAN2-ADA, que usa Augmentação Adaptativa de Discriminador (ADA), para evitar que o discriminador sobreajuste.
Geração e Avaliação de Dados
Como o objetivo do projeto é gerar novos dados sintéticos, os pesquisadores adotaram a metodologia do projeto de 2014, escolhendo um número de profissões-alvo que demonstram um alto viés racial e de gênero. As profissões escolhidas foram ‘gerente executivo’, ‘assistente administrativo’, ‘enfermeira’, ‘agricultor’, ‘pessoa militar’, ‘segurança’, ‘motorista de caminhão’, ‘limpador’, ‘carpinteiro’, ‘encanador’, ‘operador de máquina’, ‘pessoa de suporte técnico’, ‘engenheiro de software’ e ‘escritor’.
Os autores selecionaram essas profissões não apenas com base na extensão do viés percebido nos resultados de busca de imagem, mas porque a maioria delas contém algum tipo de componente visual codificado para a profissão, como um uniforme, ou a presença de equipamentos ou ambientes específicos.
O conjunto de dados foi alimentado por 10.000 imagens da biblioteca Adobe Stock, obtendo uma pontuação de 95% ou melhor ao tentar classificar uma profissão.
Como muitas das imagens não eram úteis para a tarefa-alvo (ou seja, não continham pessoas), foi necessária uma filtragem manual. Depois disso, um classificador baseado em ResNet32 pré-treinado em FairFace foi usado para rotular as imagens para gênero e raça, obtendo uma precisão média de 95,7% para gênero e 81,5% para raça. Assim, os pesquisadores obtiveram rótulos de imagem para os atributos Sexo: Masculino, Feminino, Raça: Branca, Negra, Asiática e Outras Raças.
Os modelos foram construídos no TensorFlow usando o StyleGAN2 e o StyleGAN2-ADA como redes centrais. O pré-treinamento foi feito com os pesos pré-treinados do StyleGAN2 no conjunto de dados Flickr-Faces-HQ (FFHQ) da NVIDIA, aumentado com 34.000 imagens específicas de profissão que os autores reuniram em um conjunto de dados separado que chamaram de Uncurated Stock-Occupation HQ (U-SOHQ).

Um exemplo de HIT da avaliação humana do Amazon Mechanical Turk.
As imagens foram geradas sob quatro configurações de arquitetura, com Uniform+ finalmente obtendo as melhores pontuações tanto na avaliação automatizada (FID) quanto na avaliação subsequente por trabalhadores do Amazon Mechanical Turk. Combinado com a precisão de classificação, os autores usaram isso como uma métrica central para sua própria métrica, intitulada Pontuação de Combinação de Atributos.

Avaliação humana de imagens geradas por vários métodos, com o método Uniform+ provando ser o mais convincente e, subsequentemente, a base para um novo conjunto de dados.
O artigo não afirma se o Stock-Occupation-HQ, o conjunto de dados completo derivado do Uniform+, será disponibilizado publicamente, mas afirma que ele contém 8.113 imagens HQ (1024×1024).
Difusão
O novo artigo não lida explicitamente com a forma como as imagens sintéticas ‘rebalanceadas’ poderiam ser introduzidas em circulação. Presumivelmente, semear novos conjuntos de dados de visão computacional (sem custo) com imagens redimensionadas do tipo que os autores criaram resolveria o problema de viés, mas também poderia apresentar obstáculos para outros tipos de pesquisa que buscam avaliar a inclusão de gênero e raça em cenários ‘do mundo real’, em uma circunstância em que imagens sintéticas são misturadas com imagens do mundo real.
Conjuntos de dados sintéticos, como o produzido pelos pesquisadores, poderiam presumivelmente ser disponibilizados sem custo como imagens de estoque de alta resolução, usando esse incentivo de economia de custos como um motor de difusão.
O projeto não aborda o viés baseado na idade, presumivelmente um tópico potencial de interesse em pesquisas futuras.
* Busca capturada realizada em 5 de janeiro de 2022, a busca citada no artigo foi realizada em janeiro de 2021.
Publicado pela primeira vez em 5 de janeiro de 2022.












