Ãngulo de Anderson
Las Ventajas de Engordar a TravÃĐs de la IA

Un nuevo sistema de IA puede realista cambiar la forma del cuerpo de las personas en las fotos, haciÃĐndolas mÃĄs gordas, mÃĄs delgadas o mÃĄs musculosas, sin cambiar su rostro, ropa o fondo. El sistema se entrena con un conjunto de datos completamente sintÃĐtico que muestra cada identidad en varios tipos de cuerpo.
Â
AdemÃĄs del uso cada vez mÃĄs comÚn de la IA como mÃĐtodo de refinamiento de la forma del cuerpo en las redes sociales, o (potencialmente) para alterar los tipos de cuerpo para fines de VFX, el uso del aprendizaje automÃĄtico para alterar la apariencia de las personas puede servir a una funciÃģn mÃĄs importante: ayudar a las personas con trastornos alimentarios a entender su propia interpretaciÃģn dismÃģrfica de su apariencia, asà como ofrecer una herramienta motivacional potencial para fines deportivos y de fitness en general:

Del artÃculo âEstimaciÃģn del tamaÃąo corporal en mujeres con anorexia nerviosa y controles sanos utilizando avatares 3Dâ, una GUI para visualizar los cambios en la forma del cuerpo. Las personas con dismorfia corporal pueden tener dificultades para asociar una interpretaciÃģn realista de su cuerpo con una imagen similar, lo que da a los clÃnicos una mÃĐtrica para las respuestas dismÃģrficas, entre otros fines. Fuente: https://www.nature.com/articles/s41598-017-15339-z.pdf
AdemÃĄs, la subrama de la prueba de moda en la investigaciÃģn de visiÃģn por computadora tambiÃĐn tiene interÃĐs en proporcionar visualizaciones precisas en una variedad de formas corporales. Mientras tanto, marcos como el DiffBody de 2024, ofrecido por la Universidad de Tsukuba en JapÃģn, han creado algunas funcionalidades impresionantes en este campo:

Algunas de las transformaciones posibles utilizando la tÃĐcnica DiffBody anterior. Fuente: https://arxiv.org/pdf/2401.02804
Dado que los modelos de IA se optimizan hacia formas corporales convencionalmente atractivas o comunes, los tamaÃąos inusuales como âobesoâ son mÃnimamente disponibles en los modelos estÃĄndar, o vienen con algunos sesgos punitivos.
Necesidades de Pareja
Uno de los mayores desafÃos al crear sistemas de IA que puedan realista agregar o restar grasa y mÚsculo a las fotos de las personas, sin alterar su identidad, entornos o ropa, es que esto implica entrenamiento por parejas, donde el sistema de IA aprende efectivamente âantesâ y âdespuÃĐsâ de las imÃĄgenes que definen cualquier transformaciÃģn que el modelo estÃĐ destinado a realizar.
Este tipo de entrenamiento ha vuelto a ser prominente durante el verano debido al ÃĐxito de la serie de modelos de ediciÃģn de imÃĄgenes Kontext de Black Forest Labs, donde se utilizÃģ este tipo de datos emparejados para enseÃąar una variedad de transformaciones a los modelos:

Del sitio Flux Kontext, un ejemplo de una transformaciÃģn que refleja el tipo de datos de origen necesarios para entrenar un modelo capaz de mantener la integridad de la imagen al imponer cambios importantes. Fuente: https://bfl.ai/models/flux-kontext
Obviamente, en el caso de desarrollar un modelo que pueda alterar significativamente la apariencia de una persona (sin reimaginar toda la imagen), se necesita algo que es totalmente imposible en el mundo real: fotos âantesâ y âdespuÃĐsâ radicales tomadas solo segundos aparte.
La Única soluciÃģn es datos sintÃĐticos. Algunos proyectos de este tipo han utilizado pares de contraste individuales creados manualmente en Photoshop; sin embargo, esto es poco realista a gran escala, y se considera que un proceso automatizado o semiautomatizado, impulsado por IA, para generar los pares es ahora mÃĄs preferible.
El problema con los enfoques basados en GAN y la mayorÃa de los enfoques SMPL/X (donde se utiliza una figura CGI virtual como una especie de mecanismo de intercambio entre imÃĄgenes reales y las transformaciones deseadas), y con los enfoques que utilizan la deformaciÃģn de imÃĄgenes, es que el fondo y la identidad tienden a sufrir en el proceso.

Modelos CGI paramÃĐtricos y vectoriales como SMPL y SMPL-X (entre otros), proporcionan coordenadas 3D fÃsicas convencionales definidas que pueden interpretarse e incorporarse a los marcos de visiÃģn por computadora. Fuente: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
Dado que es importante que la IA aprenda a cambiar solo los aspectos deseados, en lugar de aprender a deformar fondos y replicar otros errores no deseados, ningÚn sistema de alteraciÃģn del cuerpo ha llegado aÚn a una soluciÃģn perfecta.
Un artÃculo reciente de la India, sin embargo, propone un avance notable en el estado del arte a travÃĐs del uso del marco de modelo de difusiÃģn Flux mÃĄs antiguo, aumentado con una serie de enfoques secundarios que permiten un conjunto de datos emparejado superior y mÃĄs consistente:

Ejemplos del conjunto de datos del nuevo proyecto. Fuente: https://arxiv.org/pdf/2508.13065
El proyecto comprende un nuevo y extenso conjunto de datos emparejados; Odo, un modelo de difusiÃģn generativo entrenado en estos datos; y un benchmark personalizado diseÃąado para evaluar cuantitativamente el rendimiento de ediciÃģn de forma corporal humana. En las pruebas, los autores afirman un avance notable en los estÃĄndares logrados por modelos comparables.
El nuevo artÃculo se titula Odo: DifusiÃģn guiada por profundidad para la reconfiguraciÃģn del cuerpo que preserva la identidad, y proviene de tres investigadores en Fast Code AI Pvt. Ltd en Bangalore.
Datos y MÃĐtodo
El conjunto de datos creado por los investigadores cuenta con 7,615 imÃĄgenes de alta resoluciÃģn (960x1280px) para cada tipo de cuerpo objetivo (gordo, delgado y mÚsculo).
Inicialmente, se generaron 1,523 caras humanas a travÃĐs del modelo de difusiÃģn FLUX.1-dev de 12 mil millones de parÃĄmetros, aunque utilizando un nÚmero no especificado de caras de referencia libres de licencia de Pexels y Unsplash, para aumentar la diversidad.
Para generar imÃĄgenes de cuerpo completo que incorporen estas caras, los investigadores utilizaron PuLID de ByteDance, una versiÃģn de 2024, afinada sobre la base de Flux, y que cuenta con una pÃĐrdida de contraste diseÃąada para ayudar a conservar la identidad facial durante los procesos de transformaciÃģn:

Ejemplos del proyecto PuLID. Fuente: https://arxiv.org/pdf/2404.16022
El modelo recibiÃģ una imagen facial y una solicitud estandarizada que pedÃa gÃĐnero, ropa, postura, escena, asà como el tipo de cuerpo de delgado, gordo o mÚsculo.
Las tres imÃĄgenes de tipo de cuerpo para cada identidad a veces exhibieron cambios menores en la alineaciÃģn del fondo y el tamaÃąo percibido del sujeto, que surgieron del comportamiento estocÃĄstico de los modelos de difusiÃģn, donde cada generaciÃģn comienza desde una nueva semilla de ruido. Incluso cambios menores en la solicitud, como modificar la descripciÃģn del tipo de cuerpo, pueden influir en la trayectoria del modelo en espacio latente y causar deriva visual.
Para corregir esta variaciÃģn, se aplicÃģ una tuberÃa de post-procesamiento automÃĄtico de cuatro etapas, con la imagen delgada en cada trÃada seleccionada como la de referencia, ya que su silueta mÃĄs pequeÃąa expuso mÃĄs fondo.
La detecciÃģn de personas se realizÃģ utilizando RT-DETRv2, seguida de segmentaciÃģn con SAM 2.1 para extraer mÃĄscaras de sujeto para los tres tipos de cuerpo. La imagen de referencia delgada se pasÃģ entonces a FLUX.1 Kontext Pro (el sistema de ediciÃģn de imÃĄgenes mÃĄs nuevo) para la pintura del fondo, produciendo una versiÃģn limpia de la escena, con el sujeto eliminado.
Las variantes gorda y mÚsculo se redimensionaron utilizando escalado uniforme para coincidir con la altura de la mÃĄscara de referencia delgada, y se compusieron sobre el fondo limpio a la misma alineaciÃģn inferior, garantizando un encuadre consistente en todas las imÃĄgenes.
Los autores afirman:
âLos tripletes de transformaciÃģn resultantes (delgado, gordo y mÚsculo) tienen un fondo idÃĐntico y una escala de sujeto uniforme. Esto elimina las variaciones irrelevantes que podrÃan afectar negativamente el entrenamiento o la evaluaciÃģn posteriores.â
Cada trÃada de imÃĄgenes delgadas, gordas y musculosas permitiÃģ seis posibles pares de transformaciÃģn, lo que resultÃģ en 45,690 combinaciones teÃģricas en 7,615 identidades.
DespuÃĐs de filtrar los ejemplos con ropa no coincidente, posturas no naturales, extremidades distorsionadas, deriva de identidad o cambios de forma mÃnimos, se conservaron 18,573 pares de alta calidad. Aunque algunos cambios menores de postura permanecieron, el modelo demostrÃģ ser robusto a estas variaciones.
Entrenamiento y Pruebas
Las imÃĄgenes resultantes se utilizaron para entrenar el modelo Odo, un enfoque basado en difusiÃģn para reconfigurar a los humanos, con el uso de mapas de SMPL (es decir, CGI intermedio).
Inspirado en los mÃĐtodos del Localizador Neural de 2024, los datos se conformaron al modelo SMPL en una base por individuo, con los parÃĄmetros optimizados resultantes capaces de producir mapas de profundidad a partir de los cuales se derivarÃan las imÃĄgenes alteradas:

Esquema de la tuberÃa de entrenamiento. El lado izquierdo muestra la configuraciÃģn de entrenamiento, donde los mapas de profundidad SMPL de la imagen de destino guÃan a ReshapeNet a travÃĐs de ControlNet para realizar la transformaciÃģn del cuerpo. Las caracterÃsticas de la imagen de origen se extraen mediante ReferenceNet y se fusionan en ReshapeNet utilizando atenciÃģn espacial. El lado derecho muestra la inferencia, donde los parÃĄmetros SMPL se estiman a partir de la imagen de entrada, se modifican por atributos semÃĄnticos y se representan en un mapa de profundidad de destino que condiciona a ReshapeNet durante la desenoisificaciÃģn, para producir la imagen transformada final.
El modelo (ver esquema anterior) comprende el mÃģdulo ReshapeNet, respaldado por tres mÃģdulos auxiliares: ReferenceNet; un mÃģdulo IP-Adapter; y un mÃģdulo ControlNet basado en profundidad.
ReferenceNet extrae caracterÃsticas detalladas como fondo, ropa e identidad de la imagen de entrada, y las pasa a ReshapeNet. IP-Adapter contribuye con orientaciÃģn de caracterÃsticas de alto nivel, mientras que el ControlNet de profundidad aplica condicionamiento basado en SMPL para guiar la transformaciÃģn del cuerpo. En lÃnea con trabajos anteriores, se utilizÃģ un UNet congelado basado en SDXL para extraer caracterÃsticas intermedias.
En cuanto al mÃģdulo IP-Adapter, este codifica la imagen de entrada a travÃĐs de CLIP, con las incrustaciones resultantes integradas de regreso a ReshapeNet a travÃĐs de atenciÃģn cruzada.
En cuanto al mÃģdulo ControlNet de profundidad, este guÃa las capas medias y decodificadoras de ReshapeNet utilizando conexiones residuales. Posteriormente, toma un mapa de profundidad renderizado a partir de los parÃĄmetros SMPL de destino y lo alinea con la imagen de destino.
ReshapeNet, basado en el UNet SDXL, es la red central de Odo. Durante el entrenamiento, las imÃĄgenes de destino se codifican en espacio latente con un autoencoder variacional, ruidosas con el tiempo y luego desenoisificadas por ReshapeNet utilizando caracterÃsticas de ControlNet y ReferenceNet.
Se agregaron solicitudes de texto especÃficas de categorÃa, como âHaz que la persona sea mÃĄs gordaâ, âHaz que la persona sea mÃĄs delgadaâ o âHaz que la persona sea mÃĄs musculosaâ, para guiar las transformaciones. Mientras que los mapas de profundidad capturaron formas corporales gruesas, las solicitudes proporcionaron el detalle semÃĄntico necesario para cambios como la definiciÃģn muscular, lo que permitiÃģ al modelo producir modificaciones mÃĄs precisas y realistas.
ImplementaciÃģn del Entrenamiento
Odo se entrenÃģ en el conjunto de datos sintÃĐtico del proyecto, combinado con un subconjunto del conjunto de datos DeepFashion-MultiModal, lo que dio como resultado un total de 20,000 pares de imÃĄgenes.
Los datos DeepFashion-MultiModal proporcionaron variedad en ropa y caracterÃsticas faciales, con imÃĄgenes emparejadas contra sà mismas durante el entrenamiento. Con todos los mapas de profundidad SMPL precalculados para la eficiencia, el entrenamiento se ejecutÃģ durante 60 ÃĐpocas en una sola GPU NVIDIA A100 con 80GB de VRAM.
Con las imÃĄgenes de entrada redimensionadas a 768Ã1024, se utilizÃģ el optimizador Adam a una tasa de aprendizaje de 1Ã10âŧâĩ. ReshapeNet se inicializÃģ con pesos UNet SDXL y se ajustÃģ finamente de manera conjunta con el IP-Adapter desde su punto de control.
ReferenceNet se inicializÃģ con pesos SDXL y se mantuvo congelado, mientras que el ControlNet de profundidad utilizÃģ pesos preentrenados y tambiÃĐn permaneciÃģ congelado.
El modelo final requiriÃģ alrededor de 23GB de memoria de GPU, requiriendo 18 segundos para la inferencia de una sola imagen.
Una MÃĐtrica Nueva
La falta de conjuntos de datos del tipo necesario para este tipo de proyecto significÃģ que no habÃa mÃĐtricas existentes que abordaran realmente el desafÃo. Por lo tanto, los autores diseÃąaron una nueva referencia, compuesta por 3,600 pares de imÃĄgenes, que presentan imÃĄgenes faciales reales y descripciones de fondo, junto con variaciones en la forma del cuerpo.
Otras mÃĐtricas utilizadas fueron Ãndice de Similitud Estructural (SSIM); RelaciÃģn de SeÃąal a Ruido de Pico (PSNR); Similitud de Parches de Imagen Percibida Aprendida (LPIPS); y Error Euclidiano por VÃĐrtice en Escala Neutral (T-) corregido (PVE-T-SC).
Primero, los autores probaron su mÃĐtodo cualitativamente contra imÃĄgenes del mundo real (imÃĄgenes que no vio el modelo durante el entrenamiento):

Pruebas cualitativas. Los ejemplos muestran conversiones desde la imagen original a tipos de cuerpo mÃĄs delgados, con sobrepeso y musculosos en diferentes posturas, incluyendo sentado y de pie. Por favor, consulte el artÃculo de origen para una mejor definiciÃģn y detalle.
De estos resultados, el artÃculo afirma:
âNuestro mÃĐtodo maneja efectivamente diferentes posturas, fondos y ropa mientras conserva la identidad de la persona.
âAdemÃĄs de las formas de destino SMPL, proporcionamos solicitudes de texto â âHaz que la persona sea mÃĄs gordaâ, âHaz que la persona sea mÃĄs delgadaâ o âHaz que la persona sea mÃĄs musculosaâ â para guiar explÃcitamente las transformaciones deseadasâĶ
âĶ â[La imagen a continuaciÃģn] demuestra aÚn mÃĄs la capacidad de nuestro modelo para realizar diversas transformaciones de forma. El modelo sigue con precisiÃģn los mapas de profundidad SMPL para generar mÚltiples variaciones de versiones mÃĄs delgadas y mÃĄs gordas a partir de la imagen de referencia.â

Pruebas cualitativas adicionales que cubren el rango de tipos de cuerpo objetivo. Por favor, consulte el artÃculo de origen para una mejor definiciÃģn y detalle.
Los autores comentan aÚn mÃĄs:
âNuestros resultados demuestran transformaciones mÃĄs realistas segÚn el peso objetivo, ya que nuestro modelo ajusta simultÃĄneamente la forma corporal general, las proporciones de los miembros y la ropa, lo que resulta en modificaciones anatÃģmicamente consistentes y visualmente convincentes.â
Para pruebas cuantitativas, los autores compararon su sistema con el modelo de cÃģdigo abierto Flux Kontext [dev], FLUX.1, y la oferta de 2022 GeneraciÃģn de flujo estructurado para la reconfiguraciÃģn del cuerpo humano.
Para FLUX.1 Kontext [dev], se diseÃąaron solicitudes para instruir âHaz que la persona sea mÃĄs gordaâ, âHaz que la persona sea mÃĄs delgadaâ o âHaz que la persona sea mÃĄs musculosaâ, con pesos objetivo especificados, aunque la falta de controles detallados limitÃģ el rendimiento:
![ComparaciÃģn de Odo con GeneraciÃģn de flujo estructurado para la reconfiguraciÃģn del cuerpo humano y FLUX.1 Kontext [dev] en el conjunto de prueba, junto con resultados de ablation para modelos entrenados sin acondicionamiento de solicitud en ReshapeNet, sin ReferenceNet (utilizando solo IP-Adapter) y con entrenamiento restringido al conjunto de datos BR-5K. La tabla tambiÃĐn incluye material relacionado con estudios de ablation (BR-5K), que no se cubren aquÃ.](https://www.unite.ai/wp-content/uploads/2025/08/table-2-1.jpg)
ComparaciÃģn de Odo con GeneraciÃģn de flujo estructurado para la reconfiguraciÃģn del cuerpo humano y FLUX.1 Kontext [dev] en el conjunto de prueba, junto con resultados de ablation (no cubiertos en este artÃculo) para modelos entrenados sin acondicionamiento de solicitud en ReshapeNet, sin ReferenceNet (utilizando solo IP-Adapter) y con entrenamiento restringido al conjunto de datos BR-5K.
ConclusiÃģn
El surgimiento de Flux Kontext este aÃąo, y mÃĄs recientemente la liberaciÃģn de los pesos no cuantificados para Qwen Image Edit, han llevado de regreso a los datos emparejados al centro de las comunidades de aficionados y profesionales. En el clima de creciente crÃtica y descontento con respecto a la imprecisiÃģn de la IA generativa, los modelos de este tipo estÃĄn diseÃąados para una fidelidad mucho mayor a las imÃĄgenes de origen (aunque los modelos de menor escala a veces se ven limitados por sus objetivos de entrenamiento especÃficos).
En este caso, la utilidad de un sistema de reconfiguraciÃģn del cuerpo parecerÃa estar en los campos psicolÃģgicos, mÃĐdicos y de moda. Sin embargo, es posible que los sistemas de este tipo logren un nivel mÃĄs alto de prominencia y, quizÃĄs, un conjunto mÃĄs casual y potencialmente preocupante de usos.
Â
Publicado por primera vez el lunes, 25 de agosto de 2025












