Andersons vinkel
Virtuel prÃļvning af nye klÃĶder gennem AI

En AI-model kan nu omdanne et enkelt billede og klÃĶdebilleder til en bevÃĶgelig video af en person, der bÃĶrer nye outfits, og undgÃĨr fejl, der er almindelige i ÃĶldre, to-trins systemer.
Â
âVirtual try-onâ (VTON) kategorien i computer vision forskning er blandt de bedst finansierede og mest produktive formÃĨl i litteraturen â hovedsagelig fordi, som kan udledes fra de hyppige industriel/akademiske samarbejder, der offentliggÃļres hvert ÃĨr, modtager dette formÃĨl betydelig finansiering fra den velhavende modeindustri:

Fra papiret âImage-Based Virtual Try-On: A Surveyâ, eksempler pÃĨ personreprÃĶsentationstyper og nogle af de filtrerings- og forfiningsstadier, som selv grundlÃĶggende billeder skal gÃĨ igennem for en virtuel prÃļvning (VTON). Kilde
Der er mange variationer over mÃĨlet, sÃĨsom at trÃĶkke klÃĶder ud fra billeder af mennesker, og at tilpasse den fuldere figur, nÃĨr det er nÃļdvendigt. Nogle billedbaserede systemer er blevet kommercielt implementeret pÃĨ platforme som veesual.ai, wanna.fashion og fashn.ai.
Til video har Google Labsâ eksperimentelle Doppl-app eksperimenteret med denne funktionalitet, lanceret sidste sommer:
VÃĶr venlig at klikke for at afspille, hvis videoen ikke afspiller automatisk. Uddrag fra det forladte Google Doppl video prÃļvning projekt. Â Kilde
Men Doppl lukker i april 2026 efter en lunkent modtagelse, hvor brugerne nu henvises til virksomhedens billedbaserede prÃļvningstjenesteâ :

Googles billedbaserede prÃļvningstjeneste, hvor brugerne henvises fra virksomhedens forladte Doppl-platform. Kilde
Selv om der er et lille antal platforme, der tilbyder virtuel prÃļvning med video, synes ingen af dem at vÃĶre tilknyttet en reel butik; og de er alle âbleeding edgeâ, marginale (og ofte âtvivlsommeâ) token-toutende produkter.
Der er mange interessante forsÃļg fra forskningssektoren, men de er traditionelt komplekse arkitekturer, der er svÃĶre at implementere for lav ventetid og hÃļj kvalitet:
VÃĶr venlig at klikke for at afspille, hvis videoen ikke afspiller automatisk. Fra 2024 Fashion-VDM-projektet, et eksempel pÃĨ âheadlessâ klÃĶdeoverfÃļring. Kilde
Sandheden er, at opgaven med at tilpasse klÃĶder til en reel person, uden at forvrÃĶnge enten klÃĶderne eller personen, samtidig med at opretholde en vis demonstrativ bevÃĶgelse (der nÃļjagtigt viser ryggen af produktet, nÃĨr personen vender ryggen til), er en formidabel udfordring for den nuvÃĶrende tilstand af kunsten.
Vanast
Det er en udfordring, som et nyt papir fra Korea forsÃļger at lÃļse, ved at bruge en ny og fuldt integreret lÃļsning til at parse klÃĶder + person + bevÃĶgelse:
VÃĶr venlig at klikke for at afspille, hvis videoen ikke afspiller automatisk. Eksempler fra det supplerende materiale til Vanast-projektet. KildeÂ
Det nye system, med titlen Vanast, udnytter en brugerdefineret dataset, der indeholder alle tre nÃļdvendige faktorer for at opnÃĨ opgaven: klÃĶderne; personen; og bevÃĶgelsen:
Klik for at afspille. Flere eksempler fra Vanast-projektets side.
Systemet udnytter rammer sÃĨ forskellige som Flux, Qwen og ChatGPT til at generere en âtripletâ-dataset, der kan informere en slut-til-slut-arkitektur:

Fra det nye papir, eksempler pÃĨ dataset datapunkter, der bruges til generering og trÃĶning. Kilde â
Det nye papir har titlen Vanast: Virtuel prÃļvning med menneskebilledeanimation via syntetisk triplet-overvÃĨgning, og kommer fra fire forskere ved Seoul National University. Der er ogsÃĨ en video-laden projekt-side.
Metode
Forfatternes erklÃĶrede mÃĨl i arbejdet er at samle de tre nÃĶvnte aspekter i en enkelttrins ramme â ikke kun fordi processen ville vÃĶre diskret, men ogsÃĨ fordi det giver de forskellige aspekter mere mulighed for at overlappe og interagere under trÃĶning, med henblik pÃĨ en mere samlet generering:

Vanast kombinerer et enkelt menneskebillede, separate klÃĶdebilleder og en bevÃĶgelsesreference for at generere en bevÃĶgelig sekvens, hvor samme person bÃĶrer den nye outfit, med posevejledning, der sikrer konsistent bevÃĶgelse, mens identitet og klÃĶdedetaljer bevares pÃĨ tvÃĶrs af rammer.
For at opnÃĨ dette tager systemet billeder af mÃĨlklÃĶderne; et billede af personen, der bÃĶrer andre klÃĶder; en bevÃĶgelsesreferencevideo, der definerer, hvordan personen skal bevÃĶge sig; og en tekstprompt, der beskriver handlingen og indstillingen; og producerer en fuld videosekvens, hvor samme person synes at bÃĶre den nye outfit, mens den fÃļlger den pÃĨlagte bevÃĶgelse, med hver ramme holdt visuelt konsistent over tid.
I stedet for at adskille klÃĶdning og animation i separate stadier â som har vÃĶret tilgangen i de fleste lignende tidligere arbejder â hÃĨndterer Vanast klÃĶder, identitet og bevÃĶgelse sammen i en enkelt proces, hvilket tillader disse elementer at interagere under generering, og reducerer de former for misforhold og ustabilitet, der er set i tidligere metoder.
Dataset
TrÃĶning for projektet er baseret pÃĨ parrede eksempler pÃĨ et personbillede, de tilsvarende klÃĶdeelementer og en video af, at personen bevÃĶger sig, mens de bÃĶrer disse klÃĶder, med bevÃĶgelse udtrukket ved hjÃĶlp af en tidligere arkitektur, for at give stabil posevejledning pÃĨ tvÃĶrs af rammer.
I mangelen pÃĨ en offentligt tilgÃĶngelig dataset, der opfylder projektets krav, blev data skrabet fra (uspecificerede) online shopping-platforme, hvilket gav en cache af videoer med forskellige klÃĶder. Men opgaven krÃĶvede videoer af samme person bÃĶrende flere outfits, hvilket er en sjÃĶlden fund i vilde data, og som nÃļdvendiggjorde oprettelsen af syntetisk data.
Den tredelte proces omfattede udvÃĶlgelse af passende kandidat-rammer fra de skrabbet videoer, hÃĨndteret via Qwen2.5-VL Vision-Language Model (VLM), med passende beskÃĶring og vurdering af egnethed (dvs. ingen forhindringer, emnet i korrekt position, osv.); og oprettelse af passende inpainting-masker for at isolere de berÃļrte omrÃĨder â som (i overensstemmelse med tidligere arbejde PERSE) hÃĨndteres af den nu vÃĶrdsatte SDXL-diffusionsmodel.

Oversigt over Vanast-pipelines, hvor et menneskebillede, mÃĨlklÃĶdebilleder og en bevÃĶgelsesreferencevideo er kodet og behandlet i en samlet video-diffusionsmodel. Systemet genererer en animation, der bevare identitet, fÃļlger pose-sekvensen og anvender mÃĨlklÃĶderne, mens syntetisk triplet-generering understÃļtter trÃĶning, og en dobbelt-modul-design adskiller animation fra klÃĶdeoverfÃļring for at opretholde konsistens.
I den tredje fase trÃĶkker Qwen igen duty for at klassificere billeder efter kÃļn, og den populÃĶre Flux-billediffusionsramme bruges derefter til at skabe ÃĶndringer i klÃĶderne pÃĨ et billede (da Flux kan samle flere inputelementer). Inpainting-tekstprompterne blev kurateret af ChatGPT (uden specificeret version).
For at Ãļge pose- og baggrundsmangfoldighed blev en pipeline introduceret for at konstruere trÃĶnings-triplets fra videoer i det fri, ved hjÃĶlp af HumanVid-datasettet. Samme proces blev brugt til at generere identitetsbevarende menneskebilleder.
Da der ikke eksisterede nogen selvstÃĶndig klÃĶdebillede i disse videoer, blev klÃĶdebilleder syntetiseret direkte fra optagelserne. Rammer blev samplet fra hver video, og Qwen brugt til at score dem for frontal synlighed, fÃļr den mest egnede kandidat blev valgt, baseret pÃĨ fuld kropsynlighed, billedklarhed, minimal forhindring, lyskvalitet og samlet komposition.
En Ãļvre klÃĶdeomrÃĨde blev derefter udtrukket ved hjÃĶlp af SegFormer, og baggrunden fjernet for at isolere klÃĶdet.
For at undgÃĨ positionel bias, blev klÃĶdeomrÃĨdet tilfÃĶldigt flyttet inden for sin begrÃĶnsningsboks, og Qwen brugt igen til at filtrere utillÃĶdelige segmenteringer. Denne proces producerede syntetiske klÃĶdebilleder parret med bevÃĶgelse og identitet, hvilket muliggjorde storstilets triplet-konstruktion fra ukontrolleret video-data, mens det forbedrede robusthed pÃĨ tvÃĶrs af forskellige virkelige forhold.
Arkitektur
En dobbelt-modul-arkitektur blev introduceret for at adressere den langsomme konvergens og svage kontrolbalance set i de tidligere metoder, der havde forsÃļgt at fusionere alle betingelser. Tilgangen udnyttede tekst-til-video-diffusionstransformator fra Wan, og trak ogsÃĨ pÃĨ VACE-projektet (se nedenfor).
Modellen blev inddelt i en Menneske-Animation-Modul (HAM), der hÃĨndterede bevÃĶgelse og identitet fra menneske- og pose-input; og en KlÃĶde-OverfÃļring-Modul (GTM), der hÃĨndterede klÃĶder fra klÃĶdebilleder. Begge delte adgang til ryggraden, mens de integrerede funktioner pÃĨ en distribueret, kaskaderet mÃĨde, for at forbedre betingelserne.
TrÃĶning blev udfÃļrt ved at fryse ryggraden og kun optimere HAM- og GTM-parametre, med deres bidrag balanceret under funktionssammenlÃĶgning. Input fra den syntetiske triplet-dataset blev konverteret til latent-reprÃĶsentationer ved hjÃĶlp af WANâs variational autoencoder (VAE).
BevÃĶgelses-tilpasningskontekst blev konstrueret ved at kombinere menneske- og pose-information pÃĨ tvÃĶrs af tid, mens klÃĶdefunktioner blev behandlet separat og tilpasset gennem projektion ind i token-embedding.
Modellen blev ogsÃĨ udvidet til at understÃļtte klÃĶde-interpolation. Her blev reprÃĶsentationer fra to klÃĶder kombineret for at generere glatte overgange, hvilket muliggjorde konsistent og sammenhÃĶngende blanding mellem klÃĶdeelementer, uden yderligere optimering.
Data og Tests
Modellen blev trÃĶnet pÃĨ 9.135 videoer, med lÃĶngder varierende fra tre til ti sekunder, fra ovennÃĶvnte âshopping-mall-sitesâ; forfatternes eget genererede dataset; og HumanVid-datasettet.
Fra disse blev to evaluering-datasets etableret: âInternettet-datasettetâ, der indeholder videoer og produktbilleder fra shopping-mall-sites; og den officielle test-del af Alibabas ViViD-dataset.
Da ViViD-data mangler ansigter (se ovenstÃĨende video for et eksempel, der er meget almindeligt i den virtuelle prÃļvning litteratur), blev disse tilfÃļjet via Flux-outpainting.
MÃĨlinger, der blev brugt, var L1-tab; Peak Signal-til-StÃļj-Forhold (PSNR); Strukturel Lighed-Indeks (SSIM); LÃĶrt Perceptuel Billede-Patch-Lighed (LPIPS); FrÃĐchet Inception-Afstand (FID); og FrÃĐchet Video-Afstandâ â (FVD)
Systemer, der blev testet for klÃĶdeoverfÃļring, var OOTDiffusion; CatVTON; OmniTry; og Any2AnyTryon. Emne-til-billede-genereringsmodeller, der blev testet, var VisualCloze; MOSAIC; og ByteDances UNO.
Til den anden fase af test, hvor kombinationer af billedbaseret virtuel prÃļvning og animationsmodeller blev testet, kunne det nye arbejde igen opnÃĨ den hÃļjeste score:

Kvantitativ sammenligning med kombinationer af billedbaseret virtuel prÃļvning og animationsmodeller pÃĨ Internettet og ViViD-datasettet. Den foreslÃĨede metode opnÃĨede den bedste samlede prÃĶstation pÃĨ tvÃĶrs af mÃĨlinger, med SSIM, der forblev sammenlignelig med den stÃĶrkeste baseline. Fed vÃĶrdier angiver den hÃļjeste score.
Forfatterne tilfÃļjer:
â[Vores] model opnÃĨr den bedste prÃĶstation pÃĨ tvÃĶrs af alle mÃĨlinger, nÃĨr den sammenlignes med kombinationer af emne-til-billede-genereringsmodeller og animationsmodeller.
âKvalitative resultater [vist nedenfor] bekrÃĶfter yderligere, at vores tilgang producerer den mest nÃļjagtige pose-fÃļlges og klÃĶdeoverfÃļring, mens den bevare identitet mere trofast end alle emne-til-billede-baserede baselines.â

Kvalitativ sammenligning pÃĨ Internettet og ViViD-datasettet mod emne-til-billede- og animations-baselines, hvor den foreslÃĨede metode, ifÃļlge forfatterne, tilbyder mere nÃļjagtig pose-tilpasning og klÃĶdeoverfÃļring, mens den bevare identitet mere konsekvent end VisualCloze, MOSAIC, UNO og VACE.
For den anden kategori af test, hvor kombinationer af billedbaseret virtuel prÃļvning og animationsmodeller blev testet, kunne det nye arbejde igen opnÃĨ den hÃļjeste score:

Kvantitativ sammenligning med kombinationer af billedbaseret virtuel prÃļvning og animationsmodeller pÃĨ Internettet og ViViD-datasettet. Den foreslÃĨede metode opnÃĨede den bedste samlede prÃĶstation pÃĨ tvÃĶrs af mÃĨlinger, med SSIM, der forblev sammenlignelig med den stÃĶrkeste baseline. Fed vÃĶrdier angiver den hÃļjeste score.
Forfatterne tilfÃļjer:
âKvalitative sammenligninger [vist nedenfor] demonstrerer, at vores resultater ligner grundsandheden mest af alle billedbaseret virtuel prÃļvning-baserede baselines.â

Kvalitative test med baselines, der er oprettet ved at kombinere VTON-modeller med animationsmodeller.
Konklusion
Selv om Vanast-projektet opnÃĨr en diskret slut-til-slut-lÃļsning, mangler papirets detaljer omkring trÃĶnings- og slutbrugskravene, hvilket kan tyde pÃĨ, at dette mÃĨske ikke er den mest agile eller hurtige lÃļsning. I virkeligheden er udfordringen i sig selv ekstremt svÃĶr at opnÃĨ, selv i et ikke-optimeret system â og hvor meget mere i en kommerciel implementering, der ville krÃĶve lav ventetid og lav omkostning/avkastning i skala..?
Virtuel prÃļvning er en af en rÃĶkke âmÃĨne-skydningsâ-mÃĨl for AI, hvor den nuvÃĶrende tilstand af kunsten, som diffunderes gennem forskellige overskrifter og udvalgte resultater, skjuler den faktiske svÃĶrhedsgrad af opgaven, som mÃĨske vil blive lÃļst af senere og lettere teknologier end Transformers.
Â
â TilgÃĶngelig i USA, geo-blokeret i mange andre regioner, hvis ikke alle.
â â Forfatterne henviser til âVFIDâ, men linker kun til ViViD-papiret, som ikke berettiger henvisningen, sÃĨ vidt jeg kan se, med begrÃĶnset tid til at spore det op. Jeg har antaget, at de faktisk mente FrÃĐchet Video Distance (FVD), og var ligeledes kort pÃĨ tid. Kontakt mig for rettelser, hvis nÃļdvendigt.
FÃļrst udgivet onsdag, 8. april 2026












