Ángulo de Anderson
Falsificando cuerpos “mejores” con IA

Una nueva investigación de la academia Alibaba DAMO ofrece un flujo de trabajo impulsado por IA para automatizar la remodelación de imágenes de cuerpos, un esfuerzo raro en un sector de visión por computadora actualmente ocupado con manipulaciones basadas en rostro como deepfakes y edición de rostros basada en GAN.

Inserción en las columnas “result”, los mapas de atención generados que definen las áreas a modificar. Source: https://arxiv.org/pdf/2203.04670.pdf
La arquitectura de los investigadores utiliza estimación de pose esquelética para abordar la mayor complejidad que los sistemas de síntesis y edición de imágenes enfrentan al conceptualizar y parametrizar imágenes corporales existentes, al menos a un nivel de granularidad que permite una edición significativa y selectiva.

Los mapas esqueléticos estimados ayudan a individualizar y focalizar la atención en áreas del cuerpo que probablemente necesiten retoques, como la zona del brazo superior.
El sistema permite finalmente que el usuario establezca parámetros que pueden cambiar la apariencia del peso, la masa muscular o la distribución del peso en fotos de cuerpo completo o medio, y es capaz de generar transformaciones arbitrarias en secciones corporales vestidas o desnudas.

Izquierda, la imagen de entrada; centro, un mapa de calor de las áreas de atención derivadas; derecha, la imagen transformada.
La motivación del trabajo es desarrollar flujos automatizados que puedan reemplazar las arduas manipulaciones digitales realizadas por fotógrafos y artistas gráficos en diversas ramas de los medios, desde la moda hasta publicaciones estilo revista y material publicitario.
En general, los autores reconocen que estas transformaciones se aplican habitualmente con técnicas de “warp” en Photoshop y otros editores de mapas de bits tradicionales, y se utilizan casi exclusivamente en imágenes de mujeres. En consecuencia, el conjunto de datos personalizado desarrollado para facilitar el nuevo proceso consiste mayormente en fotografías de sujetos femeninos:
“Como la edición corporal se desea principalmente por mujeres, la mayoría de nuestra colección son fotos femeninas, considerando la diversidad de edades, razas (África:Asia:Caucásica = 0.33:0.35:0.32), poses y prendas.”
El artículo se titula Structure-Aware Flow Generation for Human Body Reshaping, y proviene de cinco autores asociados a la academia global DAMO de Alibaba.
Desarrollo del conjunto de datos
Como suele ocurrir con los sistemas de síntesis y edición de imágenes, la arquitectura del proyecto requirió un conjunto de datos de entrenamiento personalizado. Los autores encargaron a tres fotógrafos que produjeran manipulaciones estándar de Photoshop de imágenes apropiadas del sitio de fotografías de archivo Unsplash, resultando en un conjunto de datos —titulado BR-5K*— de 5 000 imágenes de alta calidad a resolución 2K.
Los investigadores enfatizan que el objetivo de entrenar con este conjunto de datos no es producir características “idealizadas” y generalizadas relacionadas con un índice de atractivo o apariencia deseable, sino extraer los mapeos de características centrales asociados con manipulaciones profesionales de imágenes corporales.
Sin embargo, admiten que las manipulaciones reflejan procesos transformadores que mapean una progresión de “real” a una noción predefinida de “ideal”:
“Invitamos a tres artistas profesionales a retocar cuerpos usando Photoshop de forma independiente, con el objetivo de lograr figuras esbeltas que cumplan con la estética popular, y seleccionamos la mejor como referencia.”
Dado que el marco no trata rostros en absoluto, estos fueron difuminados antes de incluirse en el conjunto de datos.
Arquitectura y conceptos clave
El flujo del sistema implica introducir un retrato de alta resolución, reducirlo a una resolución menor que pueda ajustarse a los recursos computacionales disponibles, y extraer una pose de mapa esquelético estimado (segunda figura desde la izquierda en la imagen inferior), así como Campos de Afinidad de Partes (PAFs), que fueron innovados en 2016 por The Robotics Institute de la Universidad Carnegie Mellon (ver video incrustado directamente a continuación).
Los Campos de Afinidad de Partes ayudan a definir la orientación de los miembros y la asociación general con el marco esquelético más amplio, proporcionando al nuevo proyecto una herramienta adicional de atención/localización.

Del artículo de 2016 sobre Campos de Afinidad de Partes, los PAFs predichos codifican la orientación de los miembros como parte de un vector 2D que también incluye la posición general del miembro. Source: https://arxiv.org/pdf/1611.08050.pdf
Aunque aparentemente irrelevantes para la apariencia del peso, los mapas esqueléticos son útiles para dirigir los procesos transformadores finales a partes del cuerpo que deben modificarse, como brazos superiores, zona posterior y muslos.
Después de esto, los resultados se alimentan a una Self‑Attention de Afinidad Estructural (SASA) en el cuello de botella central del proceso (ver imagen inferior).

El SASA regula la consistencia del generador de flujo que alimenta el proceso, cuyos resultados se pasan luego al módulo de deformación (segundo desde la derecha en la imagen anterior), que aplica las transformaciones aprendidas del entrenamiento con las revisiones manuales incluidas en el conjunto de datos.

El módulo Structure Affinity Self‑Attention (SASA) asigna atención a las partes corporales pertinentes, ayudando a evitar transformaciones superfluas o irrelevantes.
La imagen de salida se vuelve a ampliar a la resolución original de 2K, usando procesos no muy diferentes a la arquitectura de deepfake estándar de 2017 de la que paquetes populares como DeepFaceLab se derivan; el proceso de ampliación también es común en marcos de edición con GAN.
La red de atención del esquema está modelada a partir de Compositional De‑Attention Networks (CODA), una colaboración académica EE. UU./Singapur 2019 con Amazon (AMZN ) AI y Microsoft.
Pruebas
El marco basado en flujo se probó contra métodos basados en flujo anteriores FAL y Animating Through Warping (ATW), así como arquitecturas de traducción de imágenes Pix2PixHD y GFLA, con SSIM, PSNR y LPIPS como métricas de evaluación.

Resultados de las pruebas iniciales (la dirección de la flecha en los encabezados indica si los valores más bajos o más altos son mejores).
Según estas métricas adoptadas, el sistema de los autores supera a las arquitecturas anteriores.

Resultados seleccionados. Consulte el PDF original enlazado en este artículo para comparaciones de mayor resolución.
Además de las métricas automatizadas, los investigadores realizaron un estudio de usuarios (columna final de la tabla de resultados mostrada antes), en el que 40 participantes recibieron 30 preguntas seleccionadas aleatoriamente de un conjunto de 100 preguntas relacionadas con las imágenes producidas mediante los distintos métodos. El 70 % de los encuestados prefirió la nueva técnica como más “visualmente atractiva”.
Desafíos
El nuevo artículo representa una rara incursión en la manipulación corporal basada en IA. El sector de síntesis de imágenes está actualmente mucho más interesado en generar cuerpos editables mediante métodos como Campos de Radiancia Neuronal (NeRF), o bien está fijado en explorar el espacio latente de los GAN y el potencial de los autoencoders para la manipulación facial.
La iniciativa de los autores está limitada actualmente a producir cambios en el peso percibido, y no han implementado ninguna técnica de inpainting que restaure el fondo que inevitablemente queda al adelgazar la foto de una persona.
Sin embargo, proponen que el matizado de retratos y la fusión del fondo mediante inferencia textural podrían resolver trivialmente el problema de restaurar las partes del mundo que antes estaban ocultas en la imagen por la “imperfección” humana.

Una solución propuesta para restaurar el fondo que se revela al reducir grasa mediante IA.
* Aunque el preprint hace referencia a material suplementario que brinda más detalles sobre el conjunto de datos, así como a ejemplos adicionales del proyecto, la ubicación de este material no está disponible en el artículo, y el autor corresponsal aún no ha respondido a nuestra solicitud de acceso.
Primera publicación 10 de marzo de 2022.












