Ângulo de Anderson
Falsificando Corpos “Melhores” com IA

Novas pesquisas da Alibaba DAMO academy oferecem um fluxo de trabalho impulsionado por IA para automatizar a remodelação de imagens de corpos – um esforço raro em um setor de visão computacional atualmente ocupado com manipulações baseadas em rosto como deepfakes e edição de rosto baseada em GAN.

Inserção nas colunas “resultado”, os mapas de atenção gerados que definem as áreas a serem modificadas. Fonte: https://arxiv.org/pdf/2203.04670.pdf
A arquitetura dos pesquisadores usa estimativa de pose esquelética para enfrentar a maior complexidade que os sistemas de síntese e edição de imagens enfrentam ao conceituar e parametrizar imagens corporais existentes, ao menos a um nível de granularidade que realmente permite edições significativas e seletivas.

Mapas esqueléticos estimados ajudam a individualizar e focar a atenção em áreas do corpo que provavelmente serão retocadas, como a região do braço superior.
O sistema, em última análise, permite que o usuário defina parâmetros que podem mudar a aparência de peso, massa muscular ou distribuição de peso em fotos de corpo inteiro ou meia‑altura, e é capaz de gerar transformações arbitrárias em seções corporais vestidas ou despidas.

Esquerda, a imagem de entrada; centro, um mapa de calor das áreas de atenção derivadas; direita, a imagem transformada.
A motivação do trabalho é o desenvolvimento de fluxos de trabalho automatizados que poderiam substituir as manipulações digitais árduas realizadas por fotógrafos e artistas gráficos de produção em vários ramos da mídia, da moda a publicações estilo revista e material de divulgação.
Em geral, os autores reconhecem que essas transformações são normalmente aplicadas com técnicas de “warp” no Photoshop e em outros editores bitmap tradicionais, e são quase que exclusivamente usadas em imagens de mulheres. Consequentemente, o conjunto de dados personalizado desenvolvido para viabilizar o novo processo consiste principalmente de fotos de sujeitos femininos:
“Como a retocagem corporal é principalmente desejada por mulheres, a maioria da nossa coleção são fotos femininas, considerando a diversidade de idades, raças (Africana:Asiática:Caucasiana = 0,33:0,35:0,32), poses e vestimentas.”
O artigo intitula‑se Geração de Fluxo Consciente da Estrutura para Remodelação de Corpo Humano e foi escrito por cinco autores associados à academia global DAMO da Alibaba.
Desenvolvimento do Conjunto de Dados
Como costuma acontecer com sistemas de síntese e edição de imagens, a arquitetura do projeto exigiu um conjunto de dados de treinamento customizado. Os autores contrataram três fotógrafos para produzir manipulações padrão no Photoshop de imagens adequadas do site de fotografia de estoque Unsplash, resultando em um conjunto de dados – intitulado BR-5K* – de 5 000 imagens de alta qualidade em resolução 2K.
Os pesquisadores enfatizam que o objetivo de treinar com esse conjunto de dados não é produzir recursos “idealizados” e generalizados relacionados a um índice de atratividade ou aparência desejável, mas sim extrair os mapeamentos de recursos centrais associados às manipulações profissionais de imagens corporais.
Entretanto, eles admitem que as manipulações acabam refletindo processos transformadores que mapeiam uma progressão de “real” para uma noção pré‑definida de “ideal”:
“Convidamos três artistas profissionais a retocar corpos usando Photoshop de forma independente, com o objetivo de alcançar figuras esguias que atendam à estética popular, e selecionamos a melhor como verdade de referência.”
Como a estrutura não lida com rostos, estes foram desfocados antes de serem incluídos no conjunto de dados.
Arquitetura e Conceitos Principais
O fluxo de trabalho do sistema envolve a inserção de um retrato de alta resolução, seu reamostramento para uma resolução menor que caiba nos recursos computacionais disponíveis e a extração de um mapa de pose esquelético estimado (segunda figura da esquerda na imagem abaixo), bem como Part Affinity Fields (PAFs), que foram inovados em 2016 pelo Robotics Institute da Carnegie Mellon University (veja o vídeo incorporado logo abaixo).
Os Part Affinity Fields ajudam a definir a orientação dos membros e a associação geral com a estrutura esquelética mais ampla, fornecendo ao novo projeto uma ferramenta adicional de atenção/localização.

Do artigo de 2016 sobre Part Affinity Fields, os PAFs previstos codificam a orientação dos membros como parte de um vetor 2D que também inclui a posição geral do membro. Fonte: https://arxiv.org/pdf/1611.08050.pdf
Apesar de aparentemente irrelevantes para a aparência de peso, os mapas esqueléticos são úteis para direcionar os processos transformadores finais às partes do corpo que devem ser modificadas, como braços superiores, região posterior e coxas.
Após isso, os resultados são enviados a um Structure Affinity Self-Attention (SASA) no gargalo central do processo (veja a imagem abaixo).

O SASA regula a consistência do gerador de fluxo que alimenta o processo, cujos resultados são então passados ao módulo de deformação (segundo da direita na imagem acima), que aplica as transformações aprendidas a partir do treinamento nas revisões manuais incluídas no conjunto de dados.

O módulo Structure Affinity Self-Attention (SASA) aloca atenção a partes corporais pertinentes, ajudando a evitar transformações extrâneas ou irrelevantes.
A imagem de saída é subsequentemente reamostrada de volta à resolução original de 2K, usando processos semelhantes à arquitetura padrão de deepfake de 2017 da qual pacotes populares como DeepFaceLab foram derivados; o processo de reamostragem também é comum em frameworks de edição baseados em GAN.
A rede de atenção para o esquema é modelada a partir das Compositional De-Attention Networks (CODA), uma colaboração acadêmica EUA/Singapura de 2019 com a Amazon (AMZN ) AI e Microsoft.
Testes
O framework baseado em fluxo foi testado contra métodos baseados em fluxo anteriores FAL e Animating Through Warping (ATW), bem como arquiteturas de tradução de imagem Pix2PixHD e GFLA, com SSIM, PSNR e LPIPS como métricas de avaliação.

Resultados dos testes iniciais (a direção da seta nos cabeçalhos indica se valores menores ou maiores são melhores).
Com base nessas métricas adotadas, o sistema dos autores supera as arquiteturas anteriores.

Resultados selecionados. Consulte o PDF original vinculado neste artigo para comparações em resolução mais alta.
Além das métricas automatizadas, os pesquisadores conduziram um estudo com usuários (coluna final da tabela de resultados mostrada anteriormente), no qual 40 participantes foram apresentados a 30 questões selecionadas aleatoriamente de um pool de 100 questões relacionadas às imagens produzidas pelos vários métodos. 70 % dos respondentes preferiram a nova técnica como mais “visualmente atraente”.
Desafios
O novo artigo representa uma rara incursão na manipulação corporal baseada em IA. O setor de síntese de imagens está atualmente muito mais interessado em gerar corpos editáveis por meio de métodos como Neural Radiance Fields (NeRF), ou está fixado em explorar o espaço latente de GANs e o potencial de autoencoders para manipulação facial.
A iniciativa dos autores está atualmente limitada a produzir alterações no peso percebido, e eles não implementaram nenhum tipo de técnica de inpainting que restaurasse o fundo inevitavelmente revelado ao afinar a imagem de alguém.
Entretanto, eles propõem que a segmentação de retratos e a mesclagem de fundo por inferência textural poderiam resolver trivialmente o problema de restaurar as partes do cenário que antes estavam ocultas na imagem por “imperfeição” humana.

Uma solução proposta para restaurar o fundo que é revelado pela redução de gordura impulsionada por IA.
* Embora o preprint faça referência a material suplementar que fornece mais detalhes sobre o conjunto de dados, bem como exemplos adicionais do projeto, a localização desse material não foi disponibilizada no artigo, e o autor correspondente ainda não respondeu ao nosso pedido de acesso.
Primeira publicação em 10 de março de 2022.












