Ángulo de Anderson
Prueba de ropa virtual a través de IA

Un modelo de IA puede convertir ahora una sola foto y imágenes de ropa en un video en movimiento de una persona que lleva nuevos trajes, evitando los errores comunes en sistemas anteriores de dos etapas.
La categoría de ‘prueba de ropa virtual’ (VTON) en la investigación de visión por computadora es una de las más financiadas y prolíficas en la literatura – principalmente porque, como se puede inferir de las frecuentes colaboraciones entre la industria y la academia publicadas cada año, este objetivo recibe una financiación significativa de la industria de la moda bien financiada:

Del artículo ‘Image-Based Virtual Try-On: A Survey’, ejemplos de tipos de representación de personas y algunas de las etapas de filtrado y refinado que incluso las imágenes básicas deben pasar para una prueba de ropa virtual (VTON). Fuente
Hay muchas variaciones en el objetivo, como extraer ropa de imágenes de personas, y adaptarse a la figura más completa cuando sea necesario. Algunos sistemas basados en imágenes se han implementado comercialmente en plataformas como veesual.ai, wanna.fashion y fashn.ai.
Para video, la aplicación experimental Doppl de Google Labs experimentó con esta funcionalidad, lanzada el verano pasado:
Haga clic para reproducir si el video no se reproduce automáticamente. Extractos del proyecto de prueba de ropa virtual de Google Doppl abandonado. Fuente
Sin embargo, Doppl se cerró en abril de 2026 después de una recepción tibia, con los espectadores ahora redirigidos al servicio de prueba de ropa de la empresa†:

El programa de prueba de ropa de Google, al que se redirigen los usuarios desde la plataforma Doppl abandonada. Fuente
Aunque hay algunas plataformas que ofrecen prueba de ropa virtual con video, ninguna de ellas parece estar afiliada a un outlet real; y todas son productos ‘de vanguardia’, marginales (y a menudo ‘cuestionables’) que promocionan tokens.
Mientras que hay algunas incursiones interesantes desde el sector de la investigación, son arquitecturas tradicionalmente complejas que son difíciles de implementar para baja latencia y alta calidad:
Haga clic para reproducir si el video no se reproduce automáticamente. Del proyecto Fashion-VDM de 2024, un ejemplo de transferencia de ropa ‘sin cabeza’. Fuente
La verdad es que la tarea de adaptar la ropa a una persona real, sin distorsionar ni la ropa ni la persona, y manteniendo algún tipo de movimiento demostrativo útil (que muestre con precisión la parte posterior del producto cuando la persona se da la vuelta), es un desafío formidable para el estado actual de la técnica.
Vanast
Es un desafío que un nuevo artículo de Corea del Sur está intentando superar, utilizando una solución completamente integrada y novedosa para analizar la ropa, la persona y el movimiento:
Haga clic para reproducir si el video no se reproduce automáticamente. Ejemplos del sitio web de materiales suplementarios del proyecto Vanast. Fuente
El nuevo sistema, titulado Vanast, aprovecha un conjunto de datos personalizado que incorpora y orquesta los tres factores necesarios para lograr la tarea: la ropa; la persona; y el movimiento:
Haga clic para reproducir. Más ejemplos del sitio web del proyecto Vanast.
El sistema aprovecha marcos como Flux, Qwen y ChatGPT, para generar un conjunto de datos ‘triplete’ capaz de informar una arquitectura de extremo a extremo:

Del nuevo artículo, ejemplos de los puntos de datos del conjunto de datos utilizados para la generación y el entrenamiento. Fuente –
El nuevo artículo se titula Vanast: Prueba de ropa virtual con animación de imagen humana a través de supervisión de tripletes sintéticos, y proviene de cuatro investigadores de la Universidad Nacional de Seúl. También hay un sitio web del proyecto con videos.
Método
El objetivo declarado de los autores en el trabajo es fusionar los tres aspectos mencionados anteriormente en un marco de una sola etapa – no solo porque el proceso sería discreto, sino también porque da a los diferentes aspectos más oportunidades de entrelazarse y interactuar durante el entrenamiento, con el fin de lograr una generación más cohesiva:

Vanast combina una sola foto humana, imágenes de ropa separadas y una referencia de movimiento para generar una secuencia en movimiento en la que la misma persona lleva el nuevo traje, con una guía de pose que garantiza un movimiento consistente, mientras se preservan la identidad y los detalles de la ropa en los marcos.
Para lograr esto, el sistema toma imágenes de los artículos de ropa objetivo; una foto de la persona que lleva ropa diferente; un video de referencia de movimiento que define cómo debe moverse la persona; y un prompt de texto que describe la acción y el entorno; y produce una secuencia de video completa en la que esa misma persona parece llevar el nuevo traje, mientras sigue el movimiento impuesto, con cada marco mantenido visualmente consistente en el tiempo.
En lugar de separar el vestido y la animación en diferentes etapas – que ha sido el enfoque en la mayoría de los trabajos anteriores similares – Vanast maneja la ropa, la identidad y el movimiento juntos en un solo proceso, lo que permite que estos elementos interactúen durante la generación, y reduce los tipos de discrepancias y falta de estabilidad que se observan en métodos anteriores.
Conjunto de datos
El entrenamiento para el proyecto se basa en ejemplos emparejados de una imagen de persona, los artículos de ropa correspondientes y un video de esa persona moviéndose mientras lleva esa ropa, con el movimiento extraído utilizando una arquitectura anterior, para proporcionar una guía de pose estable en los marcos.
En ausencia de un conjunto de datos público que cumpla con los requisitos del proyecto, se extrajo datos de sitios web de compras en línea (no especificados), lo que proporcionó una caché de videos con ropa diversa. Sin embargo, la tarea requirió videos de la misma persona llevando múltiples trajes, lo que es un hallazgo raro en datos silvestres, y que necesitó la creación de datos sintéticos.
El proceso de tres etapas involucró la selección de marcos de candidato adecuados de los videos extraídos, manejados a través del modelo de lenguaje y visión Qwen2.5-VL (VLM), con un recorte y evaluación adecuados de la idoneidad (es decir, sin occlusiones, sujeto en posición correcta, etc.); y la creación de máscaras de pintura apropiadas para aislar las áreas afectadas – que (en línea con el trabajo anterior PERSE) se manejó con el modelo de difusión SDXL ahora venerable.

Visión general de la tubería Vanast, donde una imagen humana, imágenes de ropa objetivo y un video de guía de movimiento se codifican y procesan en un modelo de difusión de video unificado. El sistema genera una animación que preserva la identidad, sigue la secuencia de pose y aplica la ropa objetivo, mientras que la generación de tripletes sintéticos admite el entrenamiento, y un diseño de módulo dual separa la animación de la transferencia de ropa, para mantener la coherencia.
En la tercera etapa, Qwen vuelve a tener la tarea de clasificar imágenes por género, y el popular marco de difusión de imágenes Flux se utiliza para crear alteraciones en la ropa en una imagen (ya que Flux es capaz de fusionar múltiples elementos de entrada). Los prompts de texto de pintura se curaron con ChatGPT (versión no especificada).
Para aumentar aún más la diversidad de pose y fondo, se introdujo una tubería para construir tripletes de entrenamiento a partir de videos silvestres, utilizando el conjunto de datos HumanVid. El mismo proceso se utilizó para generar la imagen humana que preserva la identidad.
Dado que no existía una imagen de ropa independiente en estos videos, se sintetizaron imágenes de ropa directamente a partir de la filmación. Se muestran marcos de cada video, y Qwen se utilizó para puntuarlos por visibilidad frontal, antes de seleccionar el candidato más adecuado, en función de la visibilidad del cuerpo completo, la claridad de la imagen, la occlusión mínima, la calidad de iluminación y la composición general.
Un área de ropa superior se extrajo utilizando SegFormer, y se eliminó el fondo para aislar la ropa.
Para evitar sesgo posicional, la región de la ropa se desplazó aleatoriamente dentro de su cuadro delimitador, y Qwen se utilizó nuevamente para filtrar las segmentaciones no confiables. Este proceso produjo imágenes de ropa sintéticas emparejadas con movimiento e identidad, lo que permitió la construcción de tripletes a gran escala a partir de datos de video no estructurados, mientras que se mejoraba la robustez en condiciones del mundo real variadas.
Arquitectura
Se introdujo una arquitectura de módulo dual para abordar la convergencia lenta y el equilibrio de control débil visto en aquellos métodos anteriores que habían intentado fusionar todas las condiciones. El enfoque aprovechó el transformador de difusión de texto a video de Wan, y también se basó en el proyecto VACE (ver abajo).
El modelo se dividió en un módulo de animación humana (HAM), que manejaba el movimiento y la identidad a partir de entradas humanas y de pose; y un módulo de transferencia de ropa (GTM), que manejaba la ropa a partir de imágenes de ropa. Ambos compartían acceso a la columna vertebral, mientras integraban características de manera distribuida y en cascada, para mejorar la condición.
El entrenamiento se realizó congelando la columna vertebral y optimizando solo los parámetros de HAM y GTM, con sus contribuciones equilibradas durante la integración de características. Las entradas del conjunto de datos de tripletes sintéticos se convirtieron en representaciones latentes utilizando el autoencoder variacional (VAE) de WAN.
El contexto de movimiento consciente se construyó combinando información humana y de pose a lo largo del tiempo, mientras que las características de la ropa se procesaron por separado, y se alinearon a través de la proyección en incrustaciones de tokens.
El modelo también se extendió para admitir interpolación de ropa. Aquí, las representaciones de dos prendas se combinaron para generar transiciones suaves, lo que permitió una mezcla coherente y consistente entre artículos de ropa, sin optimización adicional.
Datos y pruebas
El modelo se entrenó en 9,135 videos, con longitudes que variaban de tres a diez segundos, obtenidos de los sitios web de centros comerciales mencionados anteriormente; el conjunto de datos generado por los autores; y el conjunto de datos HumanVid.
De estos, se establecieron dos conjuntos de datos de evaluación: el ‘conjunto de datos de Internet’, que presentaba videos y imágenes de productos de centros comerciales; y la partición de prueba oficial del conjunto de datos ViViD de Alibaba.
Dado que los datos de ViViD carecen de caras (ver el video anterior para un ejemplo de esto, que es muy común en la literatura de prueba de ropa virtual), se agregaron mediante pintura de Flux.
Las métricas utilizadas fueron pérdida L1; relación señal a ruido pico (PSNR); índice de similitud estructural (SSIM); similitud de parches de imagen perceptual aprendida (LPIPS); distancia de Inception de Fréchet (FID); y distancia de video de Fréchet†† (FVD)
Los sistemas probados para la transferencia de ropa fueron OOTDiffusion; CatVTON; OmniTry; y Any2AnyTryon. Los modelos de generación de imagen de sujeto a imagen probados fueron VisualCloze; MOSAIC; y UNO de ByteDance.
Para la segunda etapa de animación de imagen humana, se utilizaron los marcos StableAnimator y DisPose.
En un contexto más limitado (porque no admite directamente el objetivo), también se probó VACE, con algunos esfuerzos para equilibrar la funcionalidad faltante:

Comparación cuantitativa con combinaciones de modelos de sujeto a imagen y animación en los conjuntos de datos de Internet y ViViD, donde el método propuesto logró el mejor rendimiento en todas las métricas informadas. Los valores en negrita indican la puntuación más alta en cada columna.
De los resultados iniciales mostrados anteriormente, los autores afirman:
‘[Nuestro] modelo logra el mejor rendimiento en todas las métricas cuando se compara con combinaciones de modelos de generación de sujeto a imagen y modelos de animación.
‘Los resultados cualitativos [mostrados a continuación] confirman aún más que nuestro enfoque produce el seguimiento de pose y la transferencia de ropa más precisos, mientras preserva la identidad de manera más fiel que todos los modelos de línea de base basados en sujeto a imagen.’

Comparación cualitativa en los conjuntos de datos de Internet y ViViD contra modelos de línea de base de sujeto a imagen y animación, donde el método propuesto, según los autores, ofrece un seguimiento de pose y una transferencia de ropa más precisos, mientras preserva la identidad de manera más consistente que VisualCloze, MOSAIC, UNO y VACE.
Para la segunda categoría de pruebas, donde se probaron combinaciones de modelos de prueba de ropa virtual de imagen y modelos de animación, el nuevo trabajo pudo lograr nuevamente la puntuación más alta:

Comparación cuantitativa con combinaciones de modelos de prueba de ropa virtual de imagen y modelos de animación en los conjuntos de datos de Internet y ViViD. El método propuesto logró el mejor rendimiento general en las métricas, con SSIM que permaneció comparable al modelo de línea de base más fuerte. Los valores en negrita denotan la puntuación más alta.
Los autores agregan:
‘Las comparaciones cualitativas [mostradas a continuación] demuestran que nuestros resultados se asemejan más a la verdad de los hechos entre todos los modelos de línea de base basados en la prueba de ropa virtual de imagen.’

Pruebas cualitativas utilizando modelos de línea de base creados combinando modelos de prueba de ropa virtual de imagen con modelos de animación.
Conclusión
Aunque el proyecto Vanast logra una solución de extremo a extremo discreta, la falta de detalles en el artículo sobre los requisitos de recursos de entrenamiento e inferencia indican que esto puede no ser la solución más ágil o ágil. En verdad, el desafío en sí es extremadamente difícil de lograr incluso en un sistema no optimizado – y cuánto más en una implementación comercial que necesitaría baja latencia y rentabilidad a escala..?
La prueba de ropa virtual es uno de los objetivos ‘moonshot’ de la IA donde el estado actual de la técnica, como se difunde a través de varios titulares y resultados seleccionados, encubre la verdadera dificultad de la tarea, que quizás eventualmente se resolverá con tecnologías posteriores y más ligeras que los Transformadores.
† Disponible en EE. UU., bloqueado geográficamente en muchas otras regiones, si no en todas.
†† Los autores se refieren a ‘VFID’, pero enlazan solo con el artículo de ViViD, que no justifica la referencia, según puedo ver, con el tiempo limitado para rastrearlo. He asumido que en realidad se referían a la distancia de video de Fréchet (FVD), y que también estaban escasos de tiempo. Por favor, contácteme para realizar enmiendas, según sea necesario.
Publicado por primera vez el miércoles 8 de abril de 2026












