Ángulo de Anderson

Crear ‘Mejores’ Cuerpos Con IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

Nueva investigación de la academia Alibaba DAMO ofrece un flujo de trabajo impulsado por IA para automatizar la reconfiguración de imágenes de cuerpos, un esfuerzo poco común en un sector de visión por computadora actualmente ocupado con manipulaciones basadas en el rostro como deepfakes y edición de rostros basada en GAN.

Inset en las columnas 'resultado', los mapas de atención generados que definen las áreas a modificar. Fuente: https://arxiv.org/pdf/2203.04670.pdf

Inset en las columnas ‘resultado’, los mapas de atención generados que definen las áreas a modificar. Fuente: https://arxiv.org/pdf/2203.04670.pdf

La arquitectura de los investigadores utiliza la estimación de la pose del esqueleto para abordar la mayor complejidad que enfrentan los sistemas de síntesis y edición de imágenes al conceptualizar y parametrizar las imágenes del cuerpo existentes, al menos a un nivel de granularidad que permita una edición significativa y selectiva.

Los mapas de esqueleto estimados ayudan a individuar y enfocar la atención en áreas del cuerpo que probablemente sean retocadas, como el área del brazo superior.

El sistema permite finalmente a un usuario establecer parámetros que pueden cambiar la apariencia del peso, la masa muscular o la distribución del peso en fotos de personas de largo o medio largo, y puede generar transformaciones arbitrarias en secciones del cuerpo vestidas o desnudas.

Izquierda, la imagen de entrada; centro, un mapa de calor de las áreas de atención derivadas; derecha, la imagen transformada.

Izquierda, la imagen de entrada; centro, un mapa de calor de las áreas de atención derivadas; derecha, la imagen transformada.

La motivación para el trabajo es el desarrollo de flujos de trabajo automatizados que podrían reemplazar las manipulaciones digitales laboriosas realizadas por fotógrafos y artistas gráficos en varios sectores de los medios, desde la moda hasta la salida de estilo de revista y material de publicidad.

En general, los autores reconocen que estas transformaciones se aplican normalmente con técnicas de ‘deformación’ en Photoshop y otros editores de mapa de bits tradicionales, y se utilizan casi exclusivamente en imágenes de mujeres. Por lo tanto, el conjunto de datos personalizado desarrollado para facilitar el nuevo proceso consiste principalmente en imágenes de sujetos femeninos:

‘Como el retoque del cuerpo es principalmente deseado por las mujeres, la mayoría de nuestra colección son fotos de mujeres, considerando la diversidad de edades, razas (africana:asiática:caucásica = 0.33:0.35:0.32), poses y prendas.’

El documento se titula Generación de flujo de estructura consciente para reconfiguración del cuerpo humano, y proviene de cinco autores asociados con la academia global DAMO de Alibaba.

Desarrollo del conjunto de datos

Como es habitual en los sistemas de síntesis y edición de imágenes, la arquitectura del proyecto requirió un conjunto de datos personalizado. Los autores encargaron a tres fotógrafos que produjeran manipulaciones estándar de Photoshop de imágenes apropiadas del sitio de fotografía de stock Unsplash, lo que resultó en un conjunto de datos – titulado BR-5K* – de 5.000 imágenes de alta calidad a una resolución de 2K.

Los investigadores enfatizan que el objetivo de entrenar en este conjunto de datos no es producir características ‘idealizadas’ y generalizadas relacionadas con un índice de atractivo o apariencia deseable, sino más bien extraer los mapeos de características centrales asociados con las manipulaciones profesionales de las imágenes del cuerpo.

Sin embargo, admiten que las manipulaciones reflejan en última instancia procesos de transformación que trazan una progresión desde ‘real’ a una noción preestablecida de ‘ideal’:

‘Invitamos a tres artistas profesionales a retocar los cuerpos utilizando Photoshop de forma independiente, con el objetivo de lograr figuras esbeltas que cumplan con la estética popular, y seleccionamos la mejor como referencia.’

Dado que el marco no se ocupa de los rostros en absoluto, estos se desenfocaron antes de ser incluidos en el conjunto de datos.

Arquitectura y conceptos básicos

El flujo de trabajo del sistema implica alimentar una imagen de retrato de alta resolución, reducir la resolución a una resolución más baja que pueda caber en los recursos de cómputo disponibles, y extraer un mapa de pose de esqueleto estimado (segunda figura desde la izquierda en la imagen a continuación), así como Campos de afinidad de partes (PAF), que fueron innovados en 2016 por el Instituto de Robótica de la Universidad Carnegie Mellon (ver video incrustado directamente a continuación).

Los Campos de afinidad de partes ayudan a definir la orientación de los miembros y la asociación general con el marco esquelético más amplio, lo que proporciona al nuevo proyecto una herramienta adicional de atención y localización.

Del documento de Campos de afinidad de partes de 2016, los PAF predichos codifican la orientación de los miembros como parte de un vector 2D que también incluye la posición general del miembro. Fuente: https://arxiv.org/pdf/1611.08050.pdf

Del documento de Campos de afinidad de partes de 2016, los PAF predichos codifican la orientación de los miembros como parte de un vector 2D que también incluye la posición general del miembro. Fuente: https://arxiv.org/pdf/1611.08050.pdf

A pesar de su aparente irrelevancia para la apariencia del peso, los mapas de esqueleto son útiles para dirigir los procesos de transformación final a las partes del cuerpo que se deben modificar, como los brazos superiores, la parte trasera y los muslos.

Después de esto, los resultados se alimentan a un módulo de autoatención de afinidad de estructura (SASA) en el cuello de botella central del proceso (ver imagen a continuación).

El SASA regula la coherencia del generador de flujo que alimenta el proceso, cuyos resultados se pasan luego al módulo de deformación (segundo desde la derecha en la imagen anterior), que aplica las transformaciones aprendidas del entrenamiento en las revisiones manuales incluidas en el conjunto de datos.

El módulo de autoatención de afinidad de estructura (SASA) asigna atención a las partes del cuerpo pertinentes, lo que ayuda a evitar transformaciones extrínsecas o irrelevantes.

El módulo de autoatención de afinidad de estructura (SASA) asigna atención a las partes del cuerpo pertinentes, lo que ayuda a evitar transformaciones extrínsecas o irrelevantes.

La imagen de salida se mueve luego a una resolución de 2K original, utilizando procesos no disímiles de la arquitectura de deepfake estándar de 2017, de la que se derivaron paquetes populares como DeepFaceLab; el proceso de muestreo también es común en marcos de edición GAN.

La red de atención para el esquema se modela según Redes de desatención composicional (CODA), una colaboración académica entre EE. UU. y Singapur de 2019 con Amazon AI y Microsoft.

Pruebas

El marco de flujo se probó contra métodos de flujo anteriores FAL y Animación a través de deformación (ATW), así como arquitecturas de traducción de imágenes Pix2PixHD y GFLA, con SSIM, PSNR y LPIPS como métricas de evaluación.

Resultados de las pruebas iniciales (la dirección de la flecha en los encabezados indica si las cifras más bajas o más altas son mejores).

Resultados de las pruebas iniciales (la dirección de la flecha en los encabezados indica si las cifras más bajas o más altas son mejores).

Según estas métricas adoptadas, el sistema de los autores supera las arquitecturas anteriores.

Resultados seleccionados. Consulte el PDF original vinculado en este artículo para comparaciones de mayor resolución.

Resultados seleccionados. Consulte el PDF original vinculado en este artículo para comparaciones de mayor resolución.

Además de las métricas automatizadas, los investigadores realizaron un estudio de usuario (última columna de la tabla de resultados anterior), en el que 40 participantes vieron 30 preguntas seleccionadas aleatoriamente de un grupo de 100 preguntas relacionadas con las imágenes producidas a través de los diferentes métodos. El 70% de los encuestados prefirió la nueva técnica como más ‘visualmente atractiva’.

Desafíos

El nuevo documento representa una excursión poco común en la manipulación del cuerpo basada en IA. El sector de síntesis de imágenes está actualmente mucho más interesado en generar cuerpos editables mediante métodos como Campos de Radiación Neural (NeRF), o está obsesionado con explorar el espacio latente de GAN y el potencial de autoencoders para la manipulación facial.

La iniciativa de los autores se limita actualmente a producir cambios en el peso percibido, y no han implementado ninguna técnica de inpainting que restaure el fondo que inevitablemente se revela cuando se adelgaza una imagen de alguien.

Sin embargo, proponen que el recorte de retrato y la mezcla de fondo a través de la inferencia textual podrían resolver trivialmente el problema de restaurar las partes del mundo que estaban anteriormente ocultas en la imagen por ‘imperfecciones’ humanas.

Una solución propuesta para restaurar el fondo que se revela mediante la reducción de grasa de IA.

Una solución propuesta para restaurar el fondo que se revela mediante la reducción de grasa de IA.

 

* Aunque el preprint se refiere a material suplementario que proporciona más detalles sobre el conjunto de datos, así como ejemplos adicionales del proyecto, la ubicación de este material no está disponible en el documento, y el autor correspondiente no ha respondido aún a nuestra solicitud de acceso.

Publicado por primera vez el 10 de marzo de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]