Ãngulo de Anderson
Reformatando Tipos de Corpo Humano com IA

Uma nova colaboraçÃĢo de pesquisa da China oferece um mÃĐtodo novo de reformatar o corpo humano em imagens, utilizando uma rede neural codificadora gÊmea coordenada, guiada por um modelo paramÃĐtrico, que permite que um usuÃĄrio final modifique o peso, altura e proporçÃĢo do corpo em uma interface grÃĄfica interativa.

ModulaçÃĢo parametrizada da forma do corpo, com controles deslizantes alterando as trÊs caracterÃsticas disponÃveis. Fonte: https://arxiv.org/pdf/2203.10496.pdf
O trabalho oferece vÃĄrias melhorias sobre um projeto semelhante recente da Alibaba, pois pode alterar convincentemente a altura e a proporçÃĢo do corpo, alÃĐm do peso, e tem uma rede neural dedicada para âpintarâ o fundo (nÃĢo existente) que pode ser revelado por imagens de corpos âmais magrosâ. Ele tambÃĐm melhora um mÃĐtodo paramÃĐtrico anterior para reformataçÃĢo do corpo, removendo a necessidade de intervençÃĢo humana extensiva durante a formulaçÃĢo da transformaçÃĢo.
Intitulado NeuralReshaper, a nova arquitetura ajusta um modelo paramÃĐtrico 3D de humano a uma imagem de origem e, em seguida, usa distorçÃĩes no modelo para adaptar a imagem original aos novos parÃĒmetros.
O sistema ÃĐ capaz de lidar com transformaçÃĩes de corpo em figuras vestidas e semivestidas (ou seja, de praia).
TransformaçÃĩes desse tipo sÃĢo atualmente de grande interesse para o setor de pesquisa de fashion AI, que produziu uma sÃĐrie de plataformas de StyleGAN/CycleGAN e redes neurais gerais para experimentos virtuais que podem adaptar itens de roupa disponÃveis ao tipo e forma do corpo de uma imagem submetida pelo usuÃĄrio, ou ajudar com a conformidade visual.
O artigo ÃĐ intitulado Reformatando o Corpo Humano em Imagens Ãnicas com Redes Neurais Profundas e vem de pesquisadores da Universidade de Zhejiang, em Hangzhou, e da Escola de MÃdia Criativa da Universidade da Cidade de Hong Kong.
Ajuste SMPL
NeuralReshaper utiliza o Modelo Linear Multi-Pessoal com Pele (SMPL) desenvolvido pelo Instituto Max Planck para Sistemas Inteligentes e a renomada casa de efeitos visuais Industrial Light and Magic em 2015.

Humanos paramÃĐtricos SMPL da colaboraçÃĢo Planck/ILM de 2015. Fonte: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
Na primeira etapa do processo, um modelo SMPL ÃĐ gerado a partir de uma imagem de origem para a qual as transformaçÃĩes de corpo sÃĢo desejadas. A adaptaçÃĢo do modelo SMPL à imagem segue a metodologia do mÃĐtodo de RecuperaçÃĢo de Malha Humana (HMR) proposto por universidades da Alemanha e dos EUA em 2018.
Os trÊs parÃĒmetros para deformaçÃĢo (peso, altura, proporçÃĢo do corpo) sÃĢo calculados nessa etapa, juntamente com uma consideraçÃĢo dos parÃĒmetros da cÃĒmera, como a distÃĒncia focal. Os pontos de referÊncia 2D e a alinhamento da silhueta gerada fornecem o limite para a deformaçÃĢo na forma de uma silhueta 2D, uma medida de otimizaçÃĢo adicional que aumenta a precisÃĢo da fronteira e permite a pintura autÊntica do fundo posteriormente na pipeline.

Etapas de ajuste SMPL: à esquerda, a imagem de origem; segunda, o resultado de otimizaçÃĢo obtido pelo mÃĐtodo descrito na pesquisa de 2016 liderada pelo Instituto Max Planck para Sistemas Inteligentes; terceira, um resultado de inferÊncia direta do modelo prÃĐ-treinado para RecuperaçÃĢo de Forma e Pose Humana; quarta, os resultados obtidos apÃģs otimizaçÃĢo dos pontos de referÊncia 2D; e finalmente, quinta, o ajuste concluÃdo apÃģs otimizaçÃĢo da silhueta (veja acima).
A deformaçÃĢo 3D ÃĐ entÃĢo projetada no espaço de imagem da arquitetura para facilitar um campo de deformaçÃĢo denso que definirÃĄ a deformaçÃĢo. Esse processo leva cerca de 30 segundos por imagem.
Arquitetura NeuralReshaper
NeuralReshaper executa duas redes neurais em tandem: um codificador de primeiro plano que gera a forma do corpo transformada e um codificador de fundo que se concentra em preencher regiÃĩes de fundo âdesocultadasâ (no caso, por exemplo, de emagrecer um corpo â veja imagem abaixo).
O framework no estilo U-net integra a saÃda das caracterÃsticas dos dois codificadores antes de passar o resultado para um codificador unificado que, por fim, produz uma imagem nova a partir das duas entradas. A arquitetura apresenta um mecanismo de orientaçÃĢo de deformaçÃĢo inovador para permitir a integraçÃĢo.
Treinamento e Experimentos
NeuralReshaper ÃĐ implementado em PyTorch em uma Única GPU NVIDIA 1080ti com 11gb de VRAM. A rede foi treinada por 100 ÃĐpocas sob o otimizador Adam, com o gerador definido para uma perda alvo de 0,0001 e o discriminador para uma perda alvo de 0,0004. O treinamento ocorreu em um tamanho de lote de 8 para um conjunto de dados de exterior proprietÃĄrio (derivado de COCO, MPII e LSP), e 2 para treinamento no conjunto de dados DeepFashion.
Abaixo estÃĢo alguns exemplos exclusivos do conjunto de dados DeepFashion, como treinado para NeuralReshaper, com as imagens originais sempre à esquerda.
Os trÊs atributos controlÃĄveis sÃĢo desacoplados e podem ser aplicados separadamente.
TransformaçÃĩes no conjunto de dados derivado sÃĢo mais desafiadoras, pois frequentemente exigem preenchimento de fundos complexos e delineaçÃĢo clara e convincente dos tipos de corpo transformados:
Necessidade ParamÃĐtrica
Como observa o artigo, transformaçÃĩes de imagem do mesmo tipo representam um problema mal definido na sÃntese de imagens. Muitos quadros de GAN e codificador podem usar imagens em pares (como os projetos diversos projetados para efetuar transformaçÃĩes de esboço para foto e foto para esboço).
No entanto, no caso em questÃĢo, isso exigiria pares de imagens com as mesmas pessoas em diferentes configuraçÃĩes fÃsicas, como as imagens âantes e depoisâ em anÚncios de dieta ou cirurgia plÃĄstica â dados que sÃĢo difÃceis de obter ou gerar.
Alternativamente, redes de GAN transformadoras podem ser treinadas em dados muito mais diversificados e efetuar transformaçÃĩes procurando a direçÃĢo latente entre o cÃģdigo latente da imagem de origem e a classe desejada (neste caso, âgordoâ, âmagroâ, âaltoâ, etc.). No entanto, essa abordagem ÃĐ atualmente muito limitada para os propÃģsitos de reformataçÃĢo de corpo refinada.
Campos de RadiaçÃĢo Neural (NeRF) sÃĢo muito mais avançados em simulaçÃĢo de corpo completo do que a maioria dos sistemas baseados em GAN, mas permanecem especÃficos de cena e intensivos em recursos, com capacidade atualmente muito limitada para editar tipos de corpo de forma granular, como NeuralReshaper e projetos anteriores estÃĢo tentando abordar (exceto reduzir o corpo inteiro em relaçÃĢo ao ambiente).
O espaço latente do GAN ÃĐ difÃcil de governar; VAEs sozinhas ainda nÃĢo abordam as complexidades da reproduçÃĢo de corpo completo; e a capacidade do NeRF de remodelar consistentemente e de forma realista corpos humanos ainda ÃĐ incipiente. Portanto, a incorporaçÃĢo de metodologias âtradicionaisâ de CGI, como SMPL, parece estar destinada a continuar no setor de sÃntese de imagem humana, como um mÃĐtodo para corralar e consolidar caracterÃsticas, classes e cÃģdigos latentes cujos parÃĒmetros e explorabilidade ainda nÃĢo sÃĢo totalmente compreendidos nessas tecnologias emergentes.
de âmetodologias tradicionaisâ de CGI, como SMPL, parece estar destinada a continuar no setor de sÃntese de imagem humana, como um mÃĐtodo para corralar e consolidar caracterÃsticas, classes e cÃģdigos latentes cujos parÃĒmetros e explorabilidade ainda nÃĢo sÃĢo totalmente compreendidos nessas tecnologias emergentes. Publicado pela primeira vez em 31 de março de 2022.




















