Modelos e plataformas de IA
Cirurgia Plástica para Rostos Gerados por GAN

Nova pesquisa da Coreia do Sul promete melhorar a qualidade dos dados de rosto sintéticos criados por Redes Adversárias Generativas (GANs).
O sistema é capaz de identificar artefatos de imagem produzidos por processos GAN e remediá-los, mesmo ao ponto de substituir cabelo que foi obscurecido por um chapéu, substituir partes do rosto completamente ausentes no original e remover oclusões como mãos e óculos de sol, e também funciona bem em saídas cênicas e arquitetônicas.

À esquerda de cada coluna, a saída GAN original com defeitos, seguida por duas outras abordagens para os artefatos e, finalmente, pelo método utilizado pelos pesquisadores sul-coreanos. Fonte: https://arxiv.org/pdf/2104.06118.pdf
A maioria das abordagens recentes para melhorar a qualidade das imagens geradas por GANs adotou a postura de que os artefatos são um risco ocupacional do processo, tratando a metodologia como uma “força da natureza” e os resultados mais psicodélicos ou aberrantes que ela pode produzir como um subproduto inevitável.
Em vez disso, a pesquisa sul-coreana propõe “corrigir” imagens afetadas de uma maneira que não interfere com a cadeia gerativa contínua, identificando facetas que estão causando artefatos e reduzindo ou eliminando sua influência na rede GAN em um nível semi-supervisionado que excede e estende os mecanismos de auto-correção nativos na arquitetura GAN.
Para o projeto, foi necessário criar um conjunto de dados amplamente aplicável e rotulado à mão de imagens que foram gravemente afetadas por artefatos GAN. Inicialmente, os pesquisadores usaram a Distância de Incepção de Frechet (FID), uma métrica que avalia a qualidade da saída GAN comparando recursos nas imagens, como uma unidade de qualificação. As 10.000 imagens com as maiores pontuações FID entre uma execução de 200.000 imagens foram usadas como unidades de “arteefatos” discretas. Posteriormente, os pesquisadores rotularam à mão 2.000 imagens geradas, classificando cada uma como “normal” ou afetada por artefatos FID. Em seguida, um modelo foi criado para classificar o conjunto de dados em amostras de artefatos, normais e amostras reais aleatórias.
Depois disso, o Mapeamento de Ativação de Classe com Peso de Gradiente (Grad-CAM) foi usado para gerar máscaras para regiões afetadas por artefatos, efetivamente automatizando a rotulagem de defeitos.
Na imagem acima, as máscaras Grad-CAM foram aplicadas à saída do conjunto de dados LSUN-Church outdoor e do conjunto de dados CelebA-HQ.
Ao analisar os 20 resultados mais afetados de uma execução de 20.000 imagens, máscaras de segmentação são geradas, nas quais resultados representativos de áreas ao longo das gerações (que provavelmente são mais precisos ou convincentes do que os artefatos) podem ser substituídos, reduzindo a ativação das unidades que produzem artefatos em gerações subsequentes.
A avaliação humana das correções resultou em 53% das imagens “reparadas” sendo rotuladas como “normais”, enquanto 97% das imagens originais ainda demonstram melhorias significativas em relação aos originais.
Os pesquisadores defendem que esse método, com algumas reformulações menores, também pode ser adaptado para o StyleGAN2 da NVIDIA.
Os Benefícios dos Dados Sintéticos
Primariamente em relação a dados de rosto, a escassez geral de conjuntos de dados do mundo real para visão computacional é um obstáculo para pesquisas diversificadas em setores de pesquisa importantes, como reconhecimento facial, reconhecimento de emoções, pesquisa médica e estudos sobre segmentação mais granular da topologia do rosto, entre outros campos.
A reação atual contra o uso livre de dados voltados para a web e a coleta ad hoc de imagens de rosto do mundo real para inclusão em bancos de dados de rosto é um obstáculo adicional para a pesquisa, com um número crescente de estados e nações reprimindo a coleta de dados da web, e a apropriação de imagens de mídia social para esses fins.
Nos últimos dez anos, um número limitado de conjuntos de dados de rosto altamente curados ofereceu refúgio contra esse tipo de incerteza, com vários desafios de pesquisa pública anuais centrados neles. No entanto, isso pode ter levado a projetos de pesquisa a direcionar suas metodologias especificamente para esses conjuntos de dados, com resultados consistentes e comparáveis ano a ano obtidos ao custo de uma falta de diversidade no material de origem – uma situação que piora a cada ano que novas pesquisas se limitam a esses limites.
Além disso, alguns desses “conjuntos de dados tradicionais” foram criticados por falta de diversidade racial, o que sugere que esses padrões de referência podem não ser considerados recursos adequados no futuro próximo.
Isso sinaliza a necessidade de dados de rosto de alta qualidade que sejam realistas, mas onde as imagens “do mundo real” contribuintes tenham sido transformadas muito além do reconhecimento. Mesmo que o uso desses dados de rosto “a uma distância” possa eventualmente acarretar problemas sobre a proveniência de rostos gerados por GAN, é um obstáculo que não deve surgir até que mecanismos legais e técnicos para coleta de dados desse tipo sejam estabelecidos; e, no que diz respeito a possíveis mudanças nos quadros legais em torno da questão, é ainda um risco menor do que usar imagens de pessoas reais.
Leitura Adicional:
Melhorando a Realismo de Imagens Sintéticas
Correção Automática de Unidades Internas em Redes Neurais Gerativas














