Ãngulo de Anderson
Falsificando Corpos ‘Melhores’ Com IA

Pesquisas recentes da academia Alibaba DAMO oferecem um fluxo de trabalho impulsionado por IA para automatizar a redefiniçÃĢo de imagens de corpos â um esforço raro em um setor de visÃĢo computacional atualmente ocupado com manipulaçÃĩes baseadas em faces como deepfakes e ediçÃĢo de faces baseada em GAN.

InserçÃĢo nas colunas âresultadoâ, os mapas de atençÃĢo gerados que definem as ÃĄreas a serem alteradas. Fonte: https://arxiv.org/pdf/2203.04670.pdf
Os pesquisadores usam a estimativa de pose de esqueleto para lidar com a maior complexidade que os sistemas de sÃntese e ediçÃĢo de imagens enfrentam ao conceituar e parametrizar imagens de corpos existentes, pelo menos em um nÃvel de granularidade que permita ediçÃĢo significativa e seletiva.

Mapas de esqueleto estimados ajudam a individuar e focar a atençÃĢo em ÃĄreas do corpo provÃĄveis de serem retocadas, como a ÃĄrea do braço superior.
O sistema permite que um usuÃĄrio defina parÃĒmetros que podem alterar a aparÊncia do peso, massa muscular ou distribuiçÃĢo de peso em fotos de pessoas em tamanho completo ou mÃĐdio, e ÃĐ capaz de gerar transformaçÃĩes arbitrÃĄrias em seçÃĩes de corpos vestidas ou sem roupas.

à esquerda, a imagem de entrada; no meio, um mapa de calor das ÃĄreas de atençÃĢo derivadas; à direita, a imagem transformada.
A motivaçÃĢo para o trabalho ÃĐ o desenvolvimento de fluxos de trabalho automatizados que possam substituir as manipulaçÃĩes digitais ÃĄrduas realizadas por fotÃģgrafos e artistas grÃĄficos de produçÃĢo em vÃĄrios ramos da mÃdia, desde moda atÃĐ saÃda de estilo de revista e material de publicidade.
Em geral, os autores reconhecem que essas transformaçÃĩes sÃĢo normalmente aplicadas com tÃĐcnicas de âwarpâ no Photoshop e outros editores de bitmap tradicionais, e sÃĢo quase exclusivamente usadas em imagens de mulheres. Consequentemente, o conjunto de dados personalizado desenvolvido para facilitar o novo processo consiste principalmente em fotos de sujeitos femininos:
âComo a retoque de corpo ÃĐ principalmente desejado por mulheres, a maioria de nossa coleçÃĢo sÃĢo fotos de mulheres, considerando a diversidade de idades, raças (Africana:AsiÃĄtica:Caucasiana = 0,33:0,35:0,32), poses e roupas.â
O artigo ÃĐ intitulado GeraçÃĢo de Fluxo Consciente de Estrutura para ReconfiguraçÃĢo do Corpo Humano, e vem de cinco autores associados à academia global DAMO da Alibaba.
Desenvolvimento do Conjunto de Dados
Como ÃĐ usualmente o caso com sistemas de sÃntese e ediçÃĢo de imagens, a arquitetura do projeto exigiu um conjunto de dados personalizado. Os autores encomendaram a trÊs fotÃģgrafos a produçÃĢo de manipulaçÃĩes padrÃĢo do Photoshop de imagens apropriadas do site de fotografia de estoque Unsplash, resultando em um conjunto de dados â intitulado BR-5K* â de 5.000 imagens de alta qualidade em resoluçÃĢo 2K.
Os pesquisadores enfatizam que o objetivo do treinamento nesse conjunto de dados nÃĢo ÃĐ produzir recursos âidealizadosâ e generalizados relacionados a um Ãndice de atraçÃĢo ou aparÊncia desejada, mas sim extrair os mapeamentos de recursos centrais associados a manipulaçÃĩes profissionais de imagens de corpos.
No entanto, eles admitem que as manipulaçÃĩes refletem, em Última anÃĄlise, processos transformadores que mapeiam uma progressÃĢo de ârealâ para uma noçÃĢo prÃĐ-definida de âidealâ:
âConvidamos trÊs artistas profissionais a retocar corpos usando o Photoshop de forma independente, com o objetivo de alcançar figuras esguias que atendam à estÃĐtica popular, e selecionamos a melhor como referÊncia.â
Como o framework nÃĢo lida com faces, elas foram desfocadas antes de serem incluÃdas no conjunto de dados.
Arquitetura e Conceitos Centrais
O fluxo de trabalho do sistema envolve alimentar uma imagem de alta resoluçÃĢo, reduzir a resoluçÃĢo para uma resoluçÃĢo mais baixa que possa caber nos recursos computacionais disponÃveis, e extrair um mapa de pose de esqueleto estimado (segunda figura da esquerda na imagem abaixo), bem como Campos de Afinidade de Parte (PAFs), que foram inovados em 2016 pelo Instituto de RobÃģtica da Universidade Carnegie Mellon (veja o vÃdeo incorporado diretamente abaixo).
Os Campos de Afinidade de Parte ajudam a definir a orientaçÃĢo dos membros e a associaçÃĢo geral com a estrutura esquelÃĐtica mais ampla, fornecendo ao novo projeto uma ferramenta adicional de atençÃĢo/localizaçÃĢo.

Do artigo de 2016 sobre Campos de Afinidade de Parte, os PAFs previstos codificam a orientaçÃĢo do membro como parte de um vetor 2D que tambÃĐm inclui a posiçÃĢo geral do membro. Fonte: https://arxiv.org/pdf/1611.08050.pdf
Apesar de sua aparente irrelevÃĒncia para a aparÊncia do peso, os mapas de esqueleto sÃĢo Úteis para direcionar os processos transformadores finais para as partes do corpo a serem alteradas, como os braços superiores, a parte de trÃĄs e as coxas.
Depois disso, os resultados sÃĢo alimentados em uma AutoatençÃĢo de Fluxo de Afinidade de Estrutura (SASA) no gargalo central do processo (veja a imagem abaixo).

O SASA regula a consistÊncia do gerador de fluxo que alimenta o processo, os resultados do qual sÃĢo entÃĢo passados para o mÃģdulo de deformaçÃĢo (segundo da direita na imagem acima), que aplica as transformaçÃĩes aprendidas com o treinamento nas revisÃĩes manuais incluÃdas no conjunto de dados.

O mÃģdulo de AutoatençÃĢo de Afinidade de Estrutura (SASA) aloca atençÃĢo à s partes pertinentes do corpo, ajudando a evitar transformaçÃĩes extrÃnsecas ou irrelevantes.
A imagem de saÃda ÃĐ subsequentemente aumentada de volta para a resoluçÃĢo original de 2K, usando processos nÃĢo muito diferentes da arquitetura de deepfake padrÃĢo de 2017, da qual pacotes populares como o DeepFaceLab foram derivados; o processo de aumento de resoluçÃĢo tambÃĐm ÃĐ comum em frameworks de ediçÃĢo de GAN.
A rede de atençÃĢo para o esquema ÃĐ modelada apÃģs Redes de DesatençÃĢo Composicional (CODA), uma colaboraçÃĢo acadÊmica entre EUA/Singapura de 2019 com Amazon AI e Microsoft.
Testes
O framework baseado em fluxo foi testado contra mÃĐtodos baseados em fluxo anteriores FAL e AnimaçÃĢo por DeformaçÃĢo (ATW), bem como arquiteturas de traduçÃĢo de imagens Pix2PixHD e GFLA, com SSIM, PSNR e LPIPS como mÃĐtricas de avaliaçÃĢo.

Resultados dos testes iniciais (a direçÃĢo da seta nos cabeçalhos indica se os nÚmeros mais baixos ou mais altos sÃĢo os melhores).
Com base nessas mÃĐtricas adotadas, o sistema dos autores supera as arquiteturas anteriores.

Resultados selecionados. Por favor, consulte o PDF original vinculado a este artigo para comparaçÃĩes de alta resoluçÃĢo.
AlÃĐm das mÃĐtricas automatizadas, os pesquisadores realizaram um estudo de usuÃĄrio (Última coluna da tabela de resultados acima), no qual 40 participantes foram mostrados 30 perguntas selecionadas aleatoriamente de um pool de 100 perguntas relacionadas à s imagens produzidas por meio dos vÃĄrios mÃĐtodos. 70% dos respondentes preferiram a nova tÃĐcnica como mais âvisualmente atraenteâ.
Desafios
O novo artigo representa uma rara incursÃĢo na manipulaçÃĢo de corpo baseada em IA. O setor de sÃntese de imagens estÃĄ atualmente muito mais interessado em gerar corpos editÃĄveis por meio de mÃĐtodos como Campos de RadiÃĒncia Neural (NeRF) ou estÃĄ fixado em explorar o espaço latente de GANs e o potencial de autoencoders para manipulaçÃĢo facial.
A iniciativa dos autores estÃĄ atualmente limitada a produzir alteraçÃĩes na percepçÃĢo de peso e nÃĢo implementou nenhuma tÃĐcnica de inpainting que restauraria o fundo revelado quando uma imagem de alguÃĐm ÃĐ reduzida.
No entanto, eles propÃĩem que a matting de retrato e a mesclagem de fundo por inferÊncia textual poderiam trivialmente resolver o problema de restaurar as partes do mundo que foram anteriormente ocultadas na imagem por âimperfeiçÃĩesâ humanas.

Uma soluçÃĢo proposta para restaurar o fundo revelado pela reduçÃĢo de gordura da IA.
Â
* Embora o prÃĐ-impresso faça referÊncia a material suplementar que fornece mais detalhes sobre o conjunto de dados, bem como exemplos adicionais do projeto, a localizaçÃĢo desse material nÃĢo estÃĄ disponÃvel no artigo, e o autor correspondente ainda nÃĢo respondeu ao nosso pedido de acesso.
Publicado pela primeira vez em 10 de março de 2022.












