Ângulo de Anderson

Reformatando Tipos de Corpo Humano com IA

mm
Adicione Unite.AI às suas fontes preferidas no Google

Uma nova colaboraçÃĢo de pesquisa da China oferece um mÃĐtodo novo de reformatar o corpo humano em imagens, utilizando uma rede neural codificadora gÊmea coordenada, guiada por um modelo paramÃĐtrico, que permite que um usuÃĄrio final modifique o peso, altura e proporçÃĢo do corpo em uma interface grÃĄfica interativa.

ModulaçÃĢo parametrizada da forma do corpo, com controles deslizantes alterando as trÊs características disponíveis. Fonte: https://arxiv.org/pdf/2203.10496.pdf

ModulaçÃĢo parametrizada da forma do corpo, com controles deslizantes alterando as trÊs características disponíveis. Fonte: https://arxiv.org/pdf/2203.10496.pdf

O trabalho oferece vÃĄrias melhorias sobre um projeto semelhante recente da Alibaba, pois pode alterar convincentemente a altura e a proporçÃĢo do corpo, alÃĐm do peso, e tem uma rede neural dedicada para ‘pintar’ o fundo (nÃĢo existente) que pode ser revelado por imagens de corpos ‘mais magros’. Ele tambÃĐm melhora um mÃĐtodo paramÃĐtrico anterior para reformataçÃĢo do corpo, removendo a necessidade de intervençÃĢo humana extensiva durante a formulaçÃĢo da transformaçÃĢo.

Intitulado NeuralReshaper, a nova arquitetura ajusta um modelo paramÃĐtrico 3D de humano a uma imagem de origem e, em seguida, usa distorçÃĩes no modelo para adaptar a imagem original aos novos parÃĒmetros.

O sistema ÃĐ capaz de lidar com transformaçÃĩes de corpo em figuras vestidas e semivestidas (ou seja, de praia).

TransformaçÃĩes desse tipo sÃĢo atualmente de grande interesse para o setor de pesquisa de fashion AI, que produziu uma sÃĐrie de plataformas de StyleGAN/CycleGAN e redes neurais gerais para experimentos virtuais que podem adaptar itens de roupa disponíveis ao tipo e forma do corpo de uma imagem submetida pelo usuÃĄrio, ou ajudar com a conformidade visual.

O artigo ÃĐ intitulado Reformatando o Corpo Humano em Imagens Únicas com Redes Neurais Profundas e vem de pesquisadores da Universidade de Zhejiang, em Hangzhou, e da Escola de Mídia Criativa da Universidade da Cidade de Hong Kong.

Ajuste SMPL

NeuralReshaper utiliza o Modelo Linear Multi-Pessoal com Pele (SMPL) desenvolvido pelo Instituto Max Planck para Sistemas Inteligentes e a renomada casa de efeitos visuais Industrial Light and Magic em 2015.

Humanos paramÃĐtricos SMPL da colaboraçÃĢo Planck/ILM de 2015. Fonte: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Humanos paramÃĐtricos SMPL da colaboraçÃĢo Planck/ILM de 2015. Fonte: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Na primeira etapa do processo, um modelo SMPL ÃĐ gerado a partir de uma imagem de origem para a qual as transformaçÃĩes de corpo sÃĢo desejadas. A adaptaçÃĢo do modelo SMPL à imagem segue a metodologia do mÃĐtodo de RecuperaçÃĢo de Malha Humana (HMR) proposto por universidades da Alemanha e dos EUA em 2018.

Os trÊs parÃĒmetros para deformaçÃĢo (peso, altura, proporçÃĢo do corpo) sÃĢo calculados nessa etapa, juntamente com uma consideraçÃĢo dos parÃĒmetros da cÃĒmera, como a distÃĒncia focal. Os pontos de referÊncia 2D e a alinhamento da silhueta gerada fornecem o limite para a deformaçÃĢo na forma de uma silhueta 2D, uma medida de otimizaçÃĢo adicional que aumenta a precisÃĢo da fronteira e permite a pintura autÊntica do fundo posteriormente na pipeline.

Etapas de ajuste SMPL: à esquerda, a imagem de origem; segunda da esquerda, o resultado de otimizaçÃĢo obtido pelo mÃĐtodo descrito na pesquisa de 2016 liderada pelo Instituto Max Planck para Sistemas Inteligentes; terceira da esquerda, um resultado de inferÊncia direta do modelo prÃĐ-treinado para RecuperaçÃĢo de Forma e Pose Humana; segunda da direita, os resultados obtidos apÃģs otimizaçÃĢo dos pontos de referÊncia 2D; e finalmente, à direita, o ajuste concluído apÃģs otimizaçÃĢo da silhueta (veja acima).

Etapas de ajuste SMPL: à esquerda, a imagem de origem; segunda, o resultado de otimizaçÃĢo obtido pelo mÃĐtodo descrito na pesquisa de 2016 liderada pelo Instituto Max Planck para Sistemas Inteligentes; terceira, um resultado de inferÊncia direta do modelo prÃĐ-treinado para RecuperaçÃĢo de Forma e Pose Humana; quarta, os resultados obtidos apÃģs otimizaçÃĢo dos pontos de referÊncia 2D; e finalmente, quinta, o ajuste concluído apÃģs otimizaçÃĢo da silhueta (veja acima).

A deformaçÃĢo 3D ÃĐ entÃĢo projetada no espaço de imagem da arquitetura para facilitar um campo de deformaçÃĢo denso que definirÃĄ a deformaçÃĢo. Esse processo leva cerca de 30 segundos por imagem.

Arquitetura NeuralReshaper

NeuralReshaper executa duas redes neurais em tandem: um codificador de primeiro plano que gera a forma do corpo transformada e um codificador de fundo que se concentra em preencher regiÃĩes de fundo ‘desocultadas’ (no caso, por exemplo, de emagrecer um corpo – veja imagem abaixo).

O framework no estilo U-net integra a saída das características dos dois codificadores antes de passar o resultado para um codificador unificado que, por fim, produz uma imagem nova a partir das duas entradas. A arquitetura apresenta um mecanismo de orientaçÃĢo de deformaçÃĢo inovador para permitir a integraçÃĢo.

Treinamento e Experimentos

NeuralReshaper ÃĐ implementado em PyTorch em uma Única GPU NVIDIA 1080ti com 11gb de VRAM. A rede foi treinada por 100 ÃĐpocas sob o otimizador Adam, com o gerador definido para uma perda alvo de 0,0001 e o discriminador para uma perda alvo de 0,0004. O treinamento ocorreu em um tamanho de lote de 8 para um conjunto de dados de exterior proprietÃĄrio (derivado de COCO, MPII e LSP), e 2 para treinamento no conjunto de dados DeepFashion.

À esquerda, as imagens originais, à direita, a saída reproportionada do NeuralReshaper.

À esquerda, as imagens originais, à direita, a saída reproportionada do NeuralReshaper.

Abaixo estÃĢo alguns exemplos exclusivos do conjunto de dados DeepFashion, como treinado para NeuralReshaper, com as imagens originais sempre à esquerda.

Os trÊs atributos controlÃĄveis sÃĢo desacoplados e podem ser aplicados separadamente.

TransformaçÃĩes no conjunto de dados derivado sÃĢo mais desafiadoras, pois frequentemente exigem preenchimento de fundos complexos e delineaçÃĢo clara e convincente dos tipos de corpo transformados:

Necessidade ParamÃĐtrica

Como observa o artigo, transformaçÃĩes de imagem do mesmo tipo representam um problema mal definido na síntese de imagens. Muitos quadros de GAN e codificador podem usar imagens em pares (como os projetos diversos projetados para efetuar transformaçÃĩes de esboço para foto e foto para esboço).

No entanto, no caso em questÃĢo, isso exigiria pares de imagens com as mesmas pessoas em diferentes configuraçÃĩes físicas, como as imagens ‘antes e depois’ em anÚncios de dieta ou cirurgia plÃĄstica – dados que sÃĢo difíceis de obter ou gerar.

Alternativamente, redes de GAN transformadoras podem ser treinadas em dados muito mais diversificados e efetuar transformaçÃĩes procurando a direçÃĢo latente entre o cÃģdigo latente da imagem de origem e a classe desejada (neste caso, ‘gordo’, ‘magro’, ‘alto’, etc.). No entanto, essa abordagem ÃĐ atualmente muito limitada para os propÃģsitos de reformataçÃĢo de corpo refinada.

Campos de RadiaçÃĢo Neural (NeRF) sÃĢo muito mais avançados em simulaçÃĢo de corpo completo do que a maioria dos sistemas baseados em GAN, mas permanecem específicos de cena e intensivos em recursos, com capacidade atualmente muito limitada para editar tipos de corpo de forma granular, como NeuralReshaper e projetos anteriores estÃĢo tentando abordar (exceto reduzir o corpo inteiro em relaçÃĢo ao ambiente).

O espaço latente do GAN ÃĐ difícil de governar; VAEs sozinhas ainda nÃĢo abordam as complexidades da reproduçÃĢo de corpo completo; e a capacidade do NeRF de remodelar consistentemente e de forma realista corpos humanos ainda ÃĐ incipiente. Portanto, a incorporaçÃĢo de metodologias ‘tradicionais’ de CGI, como SMPL, parece estar destinada a continuar no setor de síntese de imagem humana, como um mÃĐtodo para corralar e consolidar características, classes e cÃģdigos latentes cujos parÃĒmetros e explorabilidade ainda nÃĢo sÃĢo totalmente compreendidos nessas tecnologias emergentes.

de ‘metodologias tradicionais’ de CGI, como SMPL, parece estar destinada a continuar no setor de síntese de imagem humana, como um mÃĐtodo para corralar e consolidar características, classes e cÃģdigos latentes cujos parÃĒmetros e explorabilidade ainda nÃĢo sÃĢo totalmente compreendidos nessas tecnologias emergentes. Publicado pela primeira vez em 31 de março de 2022.

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]