Andersons vinkel
Virtuel prøvning af nye klæder gennem AI

En AI-model kan nu omdanne et enkelt billede og klædebilleder til en bevægelig video af en person, der bærer nye outfits, og undgår fejl, der er almindelige i ældre, to-trins systemer.
“Virtual try-on” (VTON) kategorien i computer vision forskning er blandt de bedst finansierede og mest produktive formål i litteraturen – hovedsagelig fordi, som kan udledes fra de hyppige industriel/akademiske samarbejder, der offentliggøres hvert år, modtager dette formål betydelig finansiering fra den velhavende modeindustri:

Fra papiret ‘Image-Based Virtual Try-On: A Survey’, eksempler på personrepræsentationstyper og nogle af de filtrerings- og forfiningsstadier, som selv grundlæggende billeder skal gå igennem for en virtuel prøvning (VTON). Kilde
Der er mange variationer over målet, såsom at trække klæder ud fra billeder af mennesker, og at tilpasse den fuldere figur, når det er nødvendigt. Nogle billedbaserede systemer er blevet kommercielt implementeret på platforme som veesual.ai, wanna.fashion og fashn.ai.
Til video har Google Labs’ eksperimentelle Doppl-app eksperimenteret med denne funktionalitet, lanceret sidste sommer:
Vær venlig at klikke for at afspille, hvis videoen ikke afspiller automatisk. Uddrag fra det forladte Google Doppl video prøvning projekt. Kilde
Men Doppl lukker i april 2026 efter en lunkent modtagelse, hvor brugerne nu henvises til virksomhedens billedbaserede prøvningstjeneste†:

Googles billedbaserede prøvningstjeneste, hvor brugerne henvises fra virksomhedens forladte Doppl-platform. Kilde
Selv om der er et lille antal platforme, der tilbyder virtuel prøvning med video, synes ingen af dem at være tilknyttet en reel butik; og de er alle ‘bleeding edge’, marginale (og ofte ‘tvivlsomme’) token-toutende produkter.
Der er mange interessante forsøg fra forskningssektoren, men de er traditionelt komplekse arkitekturer, der er svære at implementere for lav ventetid og høj kvalitet:
Fra 2024 Fashion-VDM-projektet, et eksempel på ‘headless’ klædeoverføring. Kilde
Sandheden er, at opgaven med at tilpasse klæder til en reel person, uden at forvrænge enten klæderne eller personen, samtidig med at opretholde en vis demonstrativ bevægelse (der nøjagtigt viser ryggen af produktet, når personen vender ryggen til), er en formidabel udfordring for den nuværende tilstand af kunsten.
Vanast
Det er en udfordring, som et nyt papir fra Korea forsøger at løse, ved at bruge en ny og fuldt integreret løsning til at parse klæder + person + bevægelse:
Eksempler fra det supplerende materiale til Vanast-projektet. Kilde
Det nye system, med titlen Vanast, udnytter en brugerdefineret dataset, der indeholder alle tre nødvendige faktorer for at opnå opgaven: klæderne; personen; og bevægelsen:
Klik for at afspille. Flere eksempler fra Vanast-projektets side.
Systemet udnytter rammer så forskellige som Flux, Qwen og ChatGPT til at generere en ‘triplet’-dataset, der kan informere en slut-til-slut-arkitektur:

Fra det nye papir, eksempler på dataset datapunkter, der bruges til generering og træning. Kilde –
Det nye papir har titlen Vanast: Virtuel prøvning med menneskebilledeanimation via syntetisk triplet-overvågning, og kommer fra fire forskere ved Seoul National University. Der er også en video-laden projekt-side.
Metode
Forfatternes erklærede mål i arbejdet er at samle de tre nævnte aspekter i en enkelttrins ramme – ikke kun fordi processen ville være diskret, men også fordi det giver de forskellige aspekter mere mulighed for at overlappe og interagere under træning, med henblik på en mere samlet generering:

Vanast kombinerer et enkelt menneskebillede, separate klædebilleder og en bevægelsesreference for at generere en bevægelig sekvens, hvor samme person bærer den nye outfit, med posevejledning, der sikrer konsistent bevægelse, mens identitet og klædedetaljer bevares på tværs af rammer.
For at opnå dette tager systemet billeder af målklæderne; et billede af personen, der bærer andre klæder; en bevægelsesreferencevideo, der definerer, hvordan personen skal bevæge sig; og en tekstprompt, der beskriver handlingen og indstillingen; og producerer en fuld videosekvens, hvor samme person synes at bære den nye outfit, mens den følger den pålagte bevægelse, med hver ramme holdt visuelt konsistent over tid.
I stedet for at adskille klædning og animation i separate stadier – som har været tilgangen i de fleste lignende tidligere arbejder – håndterer Vanast klæder, identitet og bevægelse sammen i en enkelt proces, hvilket tillader disse elementer at interagere under generering, og reducerer de former for misforhold og ustabilitet, der er set i tidligere metoder.
Dataset
Træning for projektet er baseret på parrede eksempler på et personbillede, de tilsvarende klædeelementer og en video af, at personen bevæger sig, mens de bærer disse klæder, med bevægelse udtrukket ved hjælp af en tidligere arkitektur, for at give stabil posevejledning på tværs af rammer.
I mangelen på en offentligt tilgængelig dataset, der opfylder projektets krav, blev data skrabet fra (uspecificerede) online shopping-platforme, hvilket gav en cache af videoer med forskellige klæder. Men opgaven krævede videoer af samme person bærende flere outfits, hvilket er en sjælden fund i vilde data, og som nødvendiggjorde oprettelsen af syntetisk data.
Den tredelte proces omfattede udvælgelse af passende kandidat-rammer fra de skrabbet videoer, håndteret via Qwen2.5-VL Vision-Language Model (VLM), med passende beskæring og vurdering af egnethed (dvs. ingen forhindringer, emnet i korrekt position, osv.); og oprettelse af passende inpainting-masker for at isolere de berørte områder – som (i overensstemmelse med tidligere arbejde PERSE) håndteres af den nu værdsatte SDXL-diffusionsmodel.

Oversigt over Vanast-pipelines, hvor et menneskebillede, målklædebilleder og en bevægelsesreferencevideo er kodet og behandlet i en samlet video-diffusionsmodel. Systemet genererer en animation, der bevare identitet, følger pose-sekvensen og anvender målklæderne, mens syntetisk triplet-generering understøtter træning, og en dobbelt-modul-design adskiller animation fra klædeoverføring for at opretholde konsistens.
I den tredje fase trækker Qwen igen duty for at klassificere billeder efter køn, og den populære Flux-billediffusionsramme bruges derefter til at skabe ændringer i klæderne på et billede (da Flux kan samle flere inputelementer). Inpainting-tekstprompterne blev kurateret af ChatGPT (uden specificeret version).
For at øge pose- og baggrundsmangfoldighed blev en pipeline introduceret for at konstruere trænings-triplets fra videoer i det fri, ved hjælp af HumanVid-datasettet. Samme proces blev brugt til at generere identitetsbevarende menneskebilleder.
Da der ikke eksisterede nogen selvstændig klædebillede i disse videoer, blev klædebilleder syntetiseret direkte fra optagelserne. Rammer blev samplet fra hver video, og Qwen brugt til at score dem for frontal synlighed, før den mest egnede kandidat blev valgt, baseret på fuld kropsynlighed, billedklarhed, minimal forhindring, lyskvalitet og samlet komposition.
En øvre klædeområde blev derefter udtrukket ved hjælp af SegFormer, og baggrunden fjernet for at isolere klædet.
For at undgå positionel bias, blev klædeområdet tilfældigt flyttet inden for sin begrænsningsboks, og Qwen brugt igen til at filtrere utillædelige segmenteringer. Denne proces producerede syntetiske klædebilleder parret med bevægelse og identitet, hvilket muliggjorde storstilets triplet-konstruktion fra ukontrolleret video-data, mens det forbedrede robusthed på tværs af forskellige virkelige forhold.
Arkitektur
En dobbelt-modul-arkitektur blev introduceret for at adressere den langsomme konvergens og svage kontrolbalance set i de tidligere metoder, der havde forsøgt at fusionere alle betingelser. Tilgangen udnyttede tekst-til-video-diffusionstransformator fra Wan, og trak også på VACE-projektet (se nedenfor).
Modellen blev inddelt i en Menneske-Animation-Modul (HAM), der håndterede bevægelse og identitet fra menneske- og pose-input; og en Klæde-Overføring-Modul (GTM), der håndterede klæder fra klædebilleder. Begge delte adgang til ryggraden, mens de integrerede funktioner på en distribueret, kaskaderet måde, for at forbedre betingelserne.
Træning blev udført ved at fryse ryggraden og kun optimere HAM- og GTM-parametre, med deres bidrag balanceret under funktionssammenlægning. Input fra den syntetiske triplet-dataset blev konverteret til latent-repræsentationer ved hjælp af WAN’s variational autoencoder (VAE).
Bevægelses-tilpasningskontekst blev konstrueret ved at kombinere menneske- og pose-information på tværs af tid, mens klædefunktioner blev behandlet separat og tilpasset gennem projektion ind i token-embedding.
Modellen blev også udvidet til at understøtte klæde-interpolation. Her blev repræsentationer fra to klæder kombineret for at generere glatte overgange, hvilket muliggjorde konsistent og sammenhængende blanding mellem klædeelementer, uden yderligere optimering.
Data og Tests
Modellen blev trænet på 9.135 videoer, med længder varierende fra tre til ti sekunder, fra ovennævnte ‘shopping-mall-sites’; forfatternes eget genererede dataset; og HumanVid-datasettet.
Fra disse blev to evaluering-datasets etableret: ‘Internettet-datasettet’, der indeholder videoer og produktbilleder fra shopping-mall-sites; og den officielle test-del af Alibabas ViViD-dataset.
Da ViViD-data mangler ansigter (se ovenstående video for et eksempel, der er meget almindeligt i den virtuelle prøvning litteratur), blev disse tilføjet via Flux-outpainting.
Målinger, der blev brugt, var L1-tab; Peak Signal-til-Støj-Forhold (PSNR); Strukturel Lighed-Indeks (SSIM); Lært Perceptuel Billede-Patch-Lighed (LPIPS); Fréchet Inception-Afstand (FID); og Fréchet Video-Afstand†† (FVD)
Systemer, der blev testet for klædeoverføring, var OOTDiffusion; CatVTON; OmniTry; og Any2AnyTryon. Emne-til-billede-genereringsmodeller, der blev testet, var VisualCloze; MOSAIC; og ByteDances UNO.
Til den anden fase af test, hvor kombinationer af billedbaseret virtuel prøvning og animationsmodeller blev testet, kunne det nye arbejde igen opnå den højeste score:

Kvantitativ sammenligning med kombinationer af billedbaseret virtuel prøvning og animationsmodeller på Internettet og ViViD-datasettet. Den foreslåede metode opnåede den bedste samlede præstation på tværs af målinger, med SSIM, der forblev sammenlignelig med den stærkeste baseline. Fed værdier angiver den højeste score.
Forfatterne tilføjer:
‘[Vores] model opnår den bedste præstation på tværs af alle målinger, når den sammenlignes med kombinationer af emne-til-billede-genereringsmodeller og animationsmodeller.
‘Kvalitative resultater [vist nedenfor] bekræfter yderligere, at vores tilgang producerer den mest nøjagtige pose-følges og klædeoverføring, mens den bevare identitet mere trofast end alle emne-til-billede-baserede baselines.’

Kvalitativ sammenligning på Internettet og ViViD-datasettet mod emne-til-billede- og animations-baselines, hvor den foreslåede metode, ifølge forfatterne, tilbyder mere nøjagtig pose-tilpasning og klædeoverføring, mens den bevare identitet mere konsekvent end VisualCloze, MOSAIC, UNO og VACE.
For den anden kategori af test, hvor kombinationer af billedbaseret virtuel prøvning og animationsmodeller blev testet, kunne det nye arbejde igen opnå den højeste score:

Kvantitativ sammenligning med kombinationer af billedbaseret virtuel prøvning og animationsmodeller på Internettet og ViViD-datasettet. Fed værdier angiver den højeste score.
Forfatterne tilføjer:
‘Kvalitative sammenligninger [vist nedenfor] demonstrerer, at vores resultater ligner grundsandheden mest af alle billedbaseret virtuel prøvning-baserede baselines.’

Kvalitative test med baselines, der er oprettet ved at kombinere VTON-modeller med animationsmodeller.
Konklusion
Selv om Vanast-projektet opnår en diskret slut-til-slut-løsning, mangler papirets detaljer omkring trænings- og slutbrugskravene, hvilket kan tyde på, at dette måske ikke er den mest agile eller hurtige løsning. I virkeligheden er udfordringen i sig selv ekstremt svær at opnå, selv i et ikke-optimeret system – og hvor meget mere i en kommerciel implementering, der ville kræve lav ventetid og lav omkostning/avkastning i skala..?
Virtuel prøvning er en af en række ‘måne-skydnings’-mål for AI, hvor den nuværende tilstand af kunsten, som diffunderes gennem forskellige overskrifter og udvalgte resultater, skjuler den faktiske sværhedsgrad af opgaven, som måske vil blive løst af senere og lettere teknologier end Transformers.
† Tilgængelig i USA, geo-blokeret i mange andre regioner, hvis ikke alle.
†† Forfatterne henviser til ‘VFID’, men linker kun til ViViD-papiret, som ikke berettiger henvisningen, så vidt jeg kan se, med begrænset tid til at spore det op. Jeg har antaget, at de faktisk mente Fréchet Video Distance (FVD), og var ligeledes kort på tid. Kontakt mig for rettelser, hvis nødvendigt.
Først udgivet onsdag, 8. april 2026












