Ángulo de Anderson

Reconfiguración de tipos de cuerpo humano con IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

Una nueva colaboración de investigación de China ofrece un método novedoso de reconfiguración del cuerpo humano en imágenes, mediante el uso de una red neuronal codificadora gemela coordinada, guiada por un modelo paramétrico, que permite a un usuario final modular el peso, la altura y la proporción del cuerpo en una interfaz gráfica de usuario interactiva.

Modulación parametrizada de la forma del cuerpo, con controles deslizantes que alteran las tres características disponibles. Fuente: https://arxiv.org/pdf/2203.10496.pdf

Modulación parametrizada de la forma del cuerpo, con controles deslizantes que alteran las tres características disponibles. Fuente: https://arxiv.org/pdf/2203.10496.pdf

El trabajo ofrece varias mejoras sobre un proyecto similar reciente de Alibaba, en el sentido de que puede alterar convincentemente la altura y la proporción del cuerpo, así como el peso, y cuenta con una red neuronal dedicada para “pintar” el fondo (no existente) que puede ser revelado por imágenes de cuerpo “más delgado”. También mejora un método paramétrico anterior para la reconfiguración del cuerpo, eliminando la necesidad de una intervención humana extensa durante la formulación de la transformación.

Titulado NeuralReshaper, la nueva arquitectura ajusta un modelo paramétrico de humano 3D a una imagen de origen, y luego utiliza distorsiones en el modelo para adaptar la imagen original a los nuevos parámetros.

El sistema puede manejar transformaciones de cuerpo en figuras vestidas y semivestidas (es decir, en traje de baño).

Transformaciones de este tipo son actualmente de gran interés para el sector de investigación de inteligencia artificial en la moda, que ha producido varias plataformas de redes neuronales y StyleGAN/CycleGAN para pruebas virtuales que pueden adaptar artículos de ropa disponibles al tipo y forma del cuerpo de una imagen enviada por el usuario, o ayudar con la conformidad visual.

El documento se titula Reconfiguración de la forma del cuerpo humano en una sola imagen con redes neuronales profundas, y proviene de investigadores de la Universidad de Zhejiang en Hangzhou y la Escuela de Medios Creativos de la Universidad de la Ciudad de Hong Kong.

Ajuste de SMPL

NeuralReshaper utiliza el Modelo Lineal Multi-Personal con Piel (SMPL) desarrollado por el Instituto Max Planck para Sistemas Inteligentes y la renombrada casa de efectos visuales Industrial Light and Magic en 2015.

Humanos paramétricos de SMPL de la colaboración Planck/ILM de 2015. Fuente: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Humanos paramétricos de SMPL de la colaboración Planck/ILM de 2015. Fuente: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

En la primera etapa del proceso, se genera un modelo SMPL a partir de una imagen de origen a la que se desean realizar transformaciones de cuerpo. La adaptación del modelo SMPL a la imagen sigue la metodología del método de Recuperación de Malla Humana (HMR) propuesto por universidades de Alemania y EE. UU. en 2018.

Los tres parámetros de deformación (peso, altura, proporción del cuerpo) se calculan en esta etapa, junto con una consideración de los parámetros de la cámara, como la longitud focal. Los puntos clave 2D y la alineación de la silueta generada proporcionan el recinto para la deformación en forma de silueta 2D, una medida de optimización adicional que aumenta la precisión del límite y permite un relleno de fondo auténtico más adelante en la canalización.

Etapa de ajuste de SMPL: a la izquierda, la imagen de origen; segunda desde la izquierda, el resultado de optimización obtenido del método descrito en la investigación de 2016 liderada por el Instituto Max Planck para Sistemas Inteligentes; tercera, un resultado de inferencia directa del modelo preentrenado para la Recuperación de Forma y Postura Humana; segunda desde la derecha, los resultados obtenidos después de la optimización de los puntos clave 2D; y finalmente, a la derecha, el ajuste completado después de la optimización de la silueta (ver arriba).

Etapa de ajuste de SMPL: a la izquierda, la imagen de origen; segunda, el resultado de optimización obtenido del método descrito en la investigación de 2016 liderada por el Instituto Max Planck para Sistemas Inteligentes; tercera, un resultado de inferencia directa del modelo preentrenado para la Recuperación de Forma y Postura Humana; cuarta, los resultados obtenidos después de la optimización de los puntos clave 2D; y finalmente, quinta, el ajuste completado después de la optimización de la silueta (ver arriba).

La deformación 3D se proyecta luego en el espacio de imagen de la arquitectura para facilitar un campo de deformación denso que definirá la deformación. Este proceso tarda alrededor de 30 segundos por imagen.

Arquitectura de NeuralReshaper

NeuralReshaper ejecuta dos redes neuronales en paralelo: un codificador de primer plano que genera la forma del cuerpo transformada, y un codificador de fondo que se centra en rellenar las regiones de fondo “desocultadas” (en el caso, por ejemplo, de “adelgazar” un cuerpo – ver imagen a continuación).

El marco de estilo U-net integra la salida de las características de los dos codificadores antes de pasar el resultado a un codificador unificado que produce finalmente una imagen novedosa a partir de las dos entradas. La arquitectura cuenta con un mecanismo de guía de deformación novedoso para permitir la integración.

Entrenamiento y Experimentos

NeuralReshaper se implementa en PyTorch en una sola GPU NVIDIA 1080ti con 11 GB de VRAM. La red se entrenó durante 100 épocas con el optimizador Adam, con el generador configurado para una pérdida objetivo de 0,0001 y el discriminador para una pérdida objetivo de 0,0004. El entrenamiento se realizó con un tamaño de lote de 8 para un conjunto de datos de exterior propietario (extraído de COCO, MPII y LSP), y 2 para el entrenamiento en el conjunto de datos DeepFashion.

A la izquierda, las imágenes originales, a la derecha, la salida reproportionada de NeuralReshaper.

A la izquierda, las imágenes originales, a la derecha, la salida reproportionada de NeuralReshaper.

A continuación se muestran algunos ejemplos exclusivamente del conjunto de datos DeepFashion entrenado para NeuralReshaper, con las imágenes originales siempre a la izquierda.

Los tres atributos controlables están desacoplados y se pueden aplicar por separado.

Las transformaciones en el conjunto de datos de exterior derivado son más desafiantes, ya que a menudo requieren el relleno de fondos complejos y una delineación clara y convincente de los tipos de cuerpo transformados:

Necesidad Paramétrica

Como observa el documento, las transformaciones de la misma imagen de este tipo representan un problema mal planteado en la síntesis de imágenes. Muchos marcos de GAN y codificador transformadores pueden utilizar imágenes emparejadas (como los diversos proyectos diseñados para efectuar transformaciones de boceto a foto y transformaciones de foto a boceto).

Sin embargo, en el caso que nos ocupa, esto requeriría pares de imágenes que presenten a las mismas personas en diferentes configuraciones físicas, como las imágenes “antes y después” en anuncios de dieta o cirugía plástica – datos que son difíciles de obtener o generar.

Alternativamente, las redes neuronales transformadoras pueden entrenarse con datos mucho más diversos y efectuar transformaciones buscando la dirección latente entre el código latente de la imagen de origen y la clase deseada (en este caso, “gordo”, “delgado”, “alto”, etc.). Sin embargo, este enfoque es actualmente demasiado limitado para los fines de la reconfiguración del cuerpo con ajuste fino.

Los campos de radiación neuronal (NeRF) son mucho más avanzados en la simulación de cuerpo completo que la mayoría de los sistemas basados en GAN, pero siguen siendo específicos de la escena y requieren muchos recursos, con una capacidad actualmente muy limitada para editar tipos de cuerpo de manera granular como NeuralReshaper y proyectos anteriores están tratando de abordar (a menos que se escalen todo el cuerpo hacia abajo relativo a su entorno).

El espacio latente de GAN es difícil de gobernar; los VAE solos no abordan aún las complejidades de la reproducción de cuerpo completo; y la capacidad de NeRF para remodelar consistentemente y de manera realista los cuerpos humanos es aún incipiente. Por lo tanto, la incorporación de metodologías de CGI “tradicionales” como SMPL parece destinada a continuar en el sector de investigación de síntesis de imágenes humanas, como un método para corralar y consolidar características, clases y códigos latentes cuyos parámetros y explotabilidad no son aún completamente entendidos en estas tecnologías emergentes.

 

Publicado por primera vez el 31 de marzo de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]