Ángulo de Anderson
Restauración y edición de imágenes humanas con IA

Una nueva colaboración entre la Universidad de California Merced y Adobe ofrece un avance en el estado del arte en la completación de imágenes humanas – la tarea muy estudiada de “desocultar” partes ocultas o ocultadas de imágenes de personas, con fines como prueba virtual, animación y edición de fotos.

Además de reparar imágenes dañadas o cambiarlas a voluntad del usuario, los sistemas de completación de imágenes humanas como CompleteMe pueden imponer ropa novedosa (a través de una imagen de referencia adjunta, como en la columna del medio en estos dos ejemplos) en imágenes existentes. Estos ejemplos son del PDF suplementario extenso para el nuevo artículo. Fuente: https://liagm.github.io/CompleteMe/pdf/supp.pdf
El nuevo enfoque, titulado CompleteMe: Completación de imágenes humanas basada en referencias, utiliza imágenes de entrada suplementarias para “sugerir” al sistema qué contenido debe reemplazar la sección oculta o faltante de la representación humana (por lo tanto, la aplicabilidad a marcos de prueba de ropa basados en moda):

El sistema CompleteMe puede adaptar el contenido de referencia a la parte oculta o oculta de una imagen humana.
El nuevo sistema utiliza una arquitectura dual U-Net y un bloque de Atención enfocada en la región (RFA) que moviliza recursos hacia el área pertinente de la instancia de restauración de la imagen.
Los investigadores también ofrecen un nuevo y desafiante sistema de benchmark diseñado para evaluar tareas de completación basadas en referencias (ya que CompleteMe es parte de una investigación existente y en curso en visión por computadora, aunque una que no ha tenido un esquema de benchmark hasta ahora).
En pruebas, y en un estudio de usuarios bien escalado, el nuevo método salió adelante en la mayoría de las métricas, y en general. En ciertos casos, los métodos rivales fueron completamente superados por el enfoque basado en referencias:

Del material suplementario: el método AnyDoor tiene particular dificultad para decidir cómo interpretar una imagen de referencia.
El artículo establece:
‘Experimentos extensivos en nuestro benchmark demuestran que CompleteMe supera a los métodos actuales, tanto basados en referencias como no basados en referencias, en términos de métricas cuantitativas, resultados cualitativos y estudios de usuarios.
‘En particular, en escenarios desafiantes que involucran poses complejas, patrones de ropa intrincados y accesorios distintivos, nuestro modelo logra consistentemente una fidelidad visual y coherencia semántica superiores.’
Lamentablemente, la presencia de GitHub del proyecto contiene no código, ni promete ninguno, y la iniciativa, que también tiene una modesta página del proyecto, parece enmarcada como una arquitectura propietaria.

Otro ejemplo del rendimiento subjetivo del nuevo sistema en comparación con métodos anteriores. Más detalles más adelante en el artículo.
Método
El marco CompleteMe se basa en una U-Net de referencia, que maneja la integración del material auxiliar en el proceso, y una U-Net cohesiva, que acomoda una gama más amplia de procesos para obtener el resultado final, como se ilustra en el esquema conceptual a continuación:

El esquema conceptual para CompleteMe. Fuente: https://arxiv.org/pdf/2504.20042
El sistema primero codifica la imagen de entrada enmascarada en una representación latente. Al mismo tiempo, la U-Net de referencia procesa múltiples imágenes de referencia – cada una que muestra diferentes regiones del cuerpo – para extraer características espaciales detalladas.
Estas características pasan a través de un bloque de Atención enfocada en la región (RFA) incrustado en la U-Net ‘completa’, donde se enmascaran selectivamente utilizando máscaras de región correspondientes, asegurando que el modelo se centre solo en áreas relevantes de las imágenes de referencia.
Las características enmascaradas se integran luego con características semánticas globales derivadas de CLIP a través de una atención cruzada desacoplada, lo que permite al modelo reconstruir el contenido faltante con tanto detalle fino como coherencia semántica.
Para mejorar la realismo y la robustez, el proceso de enmascaramiento de la entrada combina occlusiones basadas en rejilla aleatorias con máscaras de forma de cuerpo humano, cada una aplicada con igual probabilidad, lo que aumenta la complejidad de las regiones faltantes que el modelo debe completar.
Para referencia solo
Los métodos anteriores para la completación de imágenes basadas en referencias suelen basarse en codificadores de nivel semántico. Proyectos de este tipo incluyen CLIP en sí, y DINOv2, ambos de los cuales extraen características globales de las imágenes de referencia, pero a menudo pierden los detalles espaciales finos necesarios para la preservación precisa de la identidad.

Del artículo de lanzamiento del enfoque DINOv2 más antiguo, que se incluye en las pruebas de comparación en el nuevo estudio: Las superposiciones de colores muestran los primeros tres componentes principales del Análisis de Componentes Principales (PCA), aplicado a parches de imagen dentro de cada columna, resaltando cómo DINOv2 agrupa partes de objetos similares a través de imágenes variadas. A pesar de las diferencias en la pose, el estilo o la representación, las regiones correspondientes (como alas, extremidades o ruedas) se emparejan consistentemente, ilustrando la capacidad del modelo para aprender la estructura basada en partes sin supervisión. Fuente: https://arxiv.org/pdf/2304.07193
CompleteMe aborda este aspecto a través de una U-Net de referencia especializada inicializada desde Stable Diffusion 1.5, pero operando sin el paso de ruido de difusión*.
Cada imagen de referencia, que cubre diferentes regiones del cuerpo, se codifica en características latentes detalladas a través de esta U-Net. Las características semánticas globales también se extraen por separado utilizando CLIP, y ambas conjuntos de características se almacenan en caché para un uso eficiente durante la integración basada en la atención. Así, el sistema puede acomodar múltiples entradas de referencia de manera flexible, mientras preserva la información de apariencia de grano fino.
Orquestación
La U-Net cohesiva gestiona las etapas finales del proceso de completación. Adaptada de la variante de inpintura de Stable Diffusion 1.5, toma como entrada la imagen de origen enmascarada en forma latente, junto con características espaciales detalladas extraídas de las imágenes de referencia y características semánticas globales extraídas por el codificador CLIP.
Estas diversas entradas se combinan a través del bloque RFA, que desempeña un papel crítico al dirigir la atención del modelo hacia las áreas más relevantes del material de referencia.
Antes de entrar en el mecanismo de atención, las características de referencia se enmascaran explícitamente para eliminar regiones no relacionadas y luego se concatenan con la representación latente de la imagen de origen, asegurando que la atención se dirija con la mayor precisión posible.
Para mejorar esta integración, CompleteMe incorpora un mecanismo de atención cruzada desacoplada adaptado del marco IP-Adapter:

IP-Adapter, parte del cual se incorpora en CompleteMe, es uno de los proyectos más exitosos y más utilizados de los últimos tres años tumultuosos de desarrollo en arquitecturas de modelos de difusión latente. Fuente: https://ip-adapter.github.io/
Esto permite al modelo procesar características visuales espaciales detalladas y un contexto semántico más amplio a través de flujos de atención separados, que se combinan más tarde, lo que da como resultado una reconstrucción coherente que, según los autores, preserva tanto la identidad como los detalles de grano fino.
Benchmarking
En ausencia de un conjunto de datos apropiado para la completación humana basada en referencias, los investigadores han propuesto el suyo. El (sin nombre) benchmark se construyó curando pares de imágenes selectos del conjunto de datos WPose diseñado para el proyecto UniHuman de Adobe Research de 2023.

Ejemplos de poses del proyecto UniHuman de Adobe Research de 2023. Fuente: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep
Los investigadores dibujaron manualmente máscaras de origen para indicar las áreas de inpintura, obteniendo finalmente 417 grupos de imágenes tripartitas que constituyen una imagen de origen, máscara y referencia.

Dos ejemplos de grupos derivados inicialmente del conjunto de datos WPose de referencia, y curados extensivamente por los investigadores del nuevo artículo.
Los autores utilizaron el modelo de lenguaje grande LLaVA para generar textos de descripción de las imágenes de origen.
Las métricas utilizadas fueron más extensas que lo habitual; además de la relación señal a ruido pico (PSNR), índice de similitud estructural (SSIM) y similitud de parches de imagen perceptuales aprendidas (LPIPS, en este caso para evaluar regiones enmascaradas), los investigadores utilizaron DINO para puntuaciones de similitud; DreamSim para la evaluación de los resultados de generación; y CLIP.
Datos y pruebas
Para probar el trabajo, los autores utilizaron tanto el modelo Stable Diffusion V1.5 predeterminado como el modelo de inpintura 1.5. El codificador de imagen del sistema utilizó el modelo de visión CLIP, junto con capas de proyección – redes neuronales modestas que reconfiguran o alinean las salidas de CLIP para que coincidan con las dimensiones de características internas utilizadas por el modelo.
El entrenamiento se llevó a cabo durante 30,000 iteraciones en ocho GPUs NVIDIA A100†, supervisado por error cuadrático medio (MSE), con un tamaño de lote de 64 y una tasa de aprendizaje de 2×10-5. Varios elementos se eliminaron aleatoriamente en todo el entrenamiento, para evitar que el sistema se sobreajuste en los datos.
El conjunto de datos se modificó a partir del conjunto de datos Parts to Whole, que a su vez se basa en el conjunto de datos DeepFashion-MultiModal.

Ejemplos del conjunto de datos Parts to Whole, utilizado en el desarrollo de los datos curados para CompleteMe. Fuente: https://huanngzh.github.io/Parts2Whole/
Los autores establecen:
‘Para cumplir con nuestros requisitos, [reconstruimos] los pares de entrenamiento utilizando imágenes ocultadas con múltiples imágenes de referencia que capturan varios aspectos de la apariencia humana, junto con sus etiquetas textuales cortas.
‘Cada muestra en nuestros datos de entrenamiento incluye seis tipos de apariencia: ropa de cuerpo superior, ropa de cuerpo inferior, ropa de cuerpo completo, cabello o accesorios para la cabeza, rostro y zapatos. Para la estrategia de enmascaramiento, aplicamos un enmascaramiento de rejilla aleatorio al 50% entre 1 y 30 veces, mientras que para el otro 50%, utilizamos una máscara de forma de cuerpo humano para aumentar la complejidad del enmascaramiento.
‘Después de la construcción de la tubería, obtuvimos 40,000 pares de imágenes para el entrenamiento.’
Los métodos rivales anteriores no basados en referencias probados fueron completación de imágenes humanas ocultadas grandes (LOHC) y el modelo de inpintura de imagen BrushNet; los modelos basados en referencias probados fueron Paint-by-Example; AnyDoor; LeftRefill; y MimicBrush.
Los autores comenzaron con una comparación cuantitativa en las métricas mencionadas anteriormente:

Resultados de la comparación cuantitativa inicial.
En cuanto a la evaluación cuantitativa, los autores señalan que CompleteMe logra las puntuaciones más altas en la mayoría de las métricas perceptuales, incluyendo CLIP-I, DINO, DreamSim y LPIPS, que están diseñadas para capturar la alineación semántica y la fidelidad de apariencia entre la salida y la imagen de referencia.
Sin embargo, el modelo no supera a todas las líneas base en todos los aspectos. Notablemente, BrushNet obtiene la puntuación más alta en CLIP-T, LeftRefill lidera en SSIM y PSNR, y MimicBrush supera ligeramente en CLIP-I.
Si bien CompleteMe muestra resultados consistentemente sólidos en general, las diferencias de rendimiento son modestas en algunos casos, y ciertas métricas siguen lideradas por métodos rivales anteriores. Quizás no injustificadamente, los autores enmarcan estos resultados como evidencia de la fuerza equilibrada de CompleteMe en ambas dimensiones estructurales y perceptuales.
Las ilustraciones para las pruebas cualitativas realizadas en el estudio son demasiado numerosas para reproducirlas aquí, y nos referimos al lector no solo al artículo de origen, sino al PDF suplementario extenso, que contiene muchos ejemplos cualitativos adicionales.
Destacamos los ejemplos cualitativos principales presentados en el artículo principal, junto con una selección de casos adicionales extraídos del grupo de imágenes suplementarias introducido anteriormente en este artículo:

Resultados cualitativos iniciales presentados en el artículo principal. Por favor, consulte el artículo de origen para una mejor resolución.
De los resultados cualitativos mostrados anteriormente, los autores comentan:
‘Dadas las entradas enmascaradas, estos métodos no basados en referencias generan contenido plausible para las regiones enmascaradas utilizando prioridades de imagen o textos de descripción.
‘Sin embargo, como se indica en el cuadro rojo, no pueden reproducir detalles específicos como tatuajes o patrones de ropa únicos, ya que carecen de imágenes de referencia para guiar la reconstrucción de información idéntica.’
Una segunda comparación, parte de la cual se muestra a continuación, se centra en los cuatro métodos basados en referencias Paint-by-Example, AnyDoor, LeftRefill y MimicBrush. Aquí solo se proporcionó una imagen de referencia y un texto de descripción.

Comparación cualitativa con métodos basados en referencias. CompleteMe produce completaciones más realistas y preserva mejor los detalles específicos de la imagen de referencia. Los cuadros rojos resaltan áreas de interés particular.
Los autores establecen:
‘Dada una imagen humana enmascarada y una imagen de referencia, otros métodos pueden generar contenido plausible pero a menudo no preservan la información contextual de la referencia con precisión.
‘En algunos casos, generan contenido irrelevante o mapean incorrectamente partes correspondientes de la imagen de referencia. En contraste, CompleteMe completa efectivamente la región enmascarada al preservar información idéntica y mapear correctamente partes correspondientes del cuerpo humano de la imagen de referencia.’
Para evaluar cómo se alinean los modelos con la percepción humana, los autores realizaron un estudio de usuarios que involucró a 15 anotadores y 2,895 pares de muestras. Cada par comparó la salida de CompleteMe con una de las cuatro líneas base basadas en referencias: Paint-by-Example, AnyDoor, LeftRefill o MimicBrush.
Los anotadores evaluaron cada resultado en función de la calidad visual de la región completada y la medida en que preservaba características de identidad de la referencia – y aquí, evaluando la calidad general y la identidad, CompleteMe obtuvo un resultado más definitivo:

Resultados del estudio de usuarios.
Conclusión
Si algo, los resultados cualitativos de este estudio se ven socavados por su mera cantidad, ya que un examen detallado indica que el nuevo sistema es una entrada muy efectiva en este área de edición de imágenes neuronales relativamente nicho pero muy perseguida.
Sin embargo, requiere un poco de cuidado y zoom para apreciar cómo bien el sistema adapta el material de referencia al área oculta en comparación (en casi todos los casos) con los métodos anteriores.

Le recomendamos encarecidamente al lector que examine cuidadosamente los resultados inicialmente confusos, si no abrumadores, presentados en el material suplementario.
* Es interesante notar cómo la ahora obsoleta versión 1.5 sigue siendo la favorita de los investigadores – en parte debido a pruebas de legado, pero también porque es la menos censurada y posiblemente la más fácil de entrenar de todas las iteraciones de Stable Diffusion, y no comparte el obstáculo censorio de las versiones FOSS de Flux.
† La especificación de VRAM no se proporciona – sería de 40 GB o 80 GB por tarjeta.
Publicado por primera vez el martes 29 de abril de 2025












