Andersonův úhel
Virtuální vyzkoušení nových šatů pomocí umělé inteligence

Model umělé inteligence může nyní z jedné fotografie a obrazů oděvů vytvořit pohyblivý videozáznam osoby v nových oděvech, čímž se vyhne chybám, které jsou běžné u starších, dvoustupňových systémů.
Kategorie “virtuální vyzkoušení” (VTON) v oblasti počítačového vidění je jednou z nejvíce financovaných a nejproduktivnějších oblastí výzkumu – především proto, že, jak lze vyčíst z častých spoluprací mezi průmyslem a akademií, které jsou zveřejňovány každý rok, tento cíl získává významné financování od módního průmyslu:

Z článku ‘Image-Based Virtual Try-On: A Survey’, příklady typů reprezentace osoby a některých fází filtrování a rafinování, kterými musí projít i základní obrázky pro virtuální vyzkoušení (VTON). Zdroj
Existuje mnoho variací tohoto cíle, jako je například extrakce oděvů z obrázků osob a přizpůsobení se plnější postavě, pokud je to nutné. Některé image-based systémy byly komerčně implementovány na platformách, jako jsou veesual.ai, wanna.fashion a fashn.ai.
Pro video existuje experimentální aplikace Doppl od Google Labs, která testovala tuto funkčnost a spustila ji minulé léto:
Pokud video není automaticky přehráváno, klikněte na něj. Úryvky z projektu Google Doppl. Zdroj
Však Doppl ukončil činnost v dubnu 2026 po mírném přijetí, a uživatelé jsou nyní odkázáni na image-only službu vyzkoušení†:

Image-only služba vyzkoušení od Google, na kterou jsou uživatelé odkázáni z ukončené platformy Doppl. Zdroj
Ačkoli existuje několik platforem, které nabízejí virtuální vyzkoušení s videem, žádná z nich není spojena s konkrétním prodejním místem, a všechny jsou “špičkovými” produkty s tokeny, které jsou často “sporné”.
Zatímco existuje několik zajímavých projektů z výzkumné sféry, jsou tradičně složité architektury, které jsou obtížné implementovat pro nízkou latenci a vysokou kvalitu:
Pokud video není automaticky přehráváno, klikněte na něj. Z projektu Fashion-VDM z roku 2024, příklad “bezhlavého” přenosu oděvů.
Skutečností je, že úkolem přizpůsobení oděvů reálné osobě, bez deformace oděvů nebo osoby, a současně zachování užitečného demonstrativního pohybu (který přesně ukazuje zadní stranu produktu, když osoba otočí záda), je obrovskou výzvou pro současný stav technologie.
Vanast
Tato výzva se snaží řešit nový článek z Koreje, který používá novou a plně integrovanou metodu pro analýzu oděvů, osoby a pohybu:
Pokud video není automaticky přehráváno, klikněte na něj. Příklady z webu projektu Vanast. Zdroj
Nový systém, nazvaný Vanast, využívá speciálně vytvořenou sadu dat, která zahrnuje všechny tři faktory nezbytné pro splnění úkolu: oděvy, osobu a pohyb:
Klikněte na přehrávání. Další příklady z webu projektu Vanast.
Systém využívá rámce, jako jsou Flux, Qwen a ChatGPT, k vytvoření “trojice” dat, která mohou informovat architekturu koncového řešení:

Z nového článku, příklady datových bodů datové sady použité pro generování a trénování. Zdroj –
Nový článek se jmenuje Vanast: Virtuální vyzkoušení s animací lidského obrazu pomocí syntetické trojice a pochází od čtyř výzkumníků z Seoul National University. Existuje také video-laden web projektu.
Metoda
Cílem autorů v této práci je spojit tři výše zmíněné aspekty do jednoho fázového rámce – nejen proto, že proces by byl diskrétní, ale také proto, že poskytuje jednotlivým aspektům více příležitostí k propojení a interakci během trénování, s cílem dosáhnout více soudržné generace:

Vanast kombinuje jeden lidský obrázek, samostatné obrázky oděvů a pohybový referenční video, aby generadoval pohyblivou sekvenci, v níž osoba nosí nové oblečení, s pomocí pohybového vedení, které zajišťuje konzistentní pohyb, zatímco identita a detaily oděvu jsou zachovány napříč snímky.
Pro dosažení tohoto cíle systém přijímá obrázky cílových oděvů; fotografii osoby v odlišném oblečení; pohybové referenční video, které definuje, jak by se osoba měla pohybovat; a textový prompt, který popisuje akci a nastavení; a generuje plnou video sekvenci, v níž osoba nosí nové oblečení, zatímco sleduje vynucený pohyb, s každým snímkem vizuálně konzistentním v čase.
Namísto oddělení oblékání a animace do různých fází – což je přístup, který byl použit v meisten předchozích pracích – Vanast zpracovává oděvy, identitu a pohyb společně v jednom procesu, umožňujícím těmto prvkům interagovat během generování a snižujícím typy nesouladů a nestability, které se vyskytly v předchozích metodách.
Dataset
Trénování projektu je založeno na párových příkladech obrazu osoby, odpovídajících oděvů a videa osoby pohybující se v těchto oděvech, s pohybem extrahovaným pomocí předchozí architektury, aby se zajistilo stabilní vedení pohybu napříč snímky.
Vzhledem k tomu, že neexistuje veřejně dostupná datová sada, která by splňovala požadavky projektu, data byla získána ze (nespecifikovaných) online nákupních platforem, poskytujících cache videí s různými oděvy. Nicméně, úkolem bylo získat videa osoby nosící více oděvů, což je vzácný výskyt v divokých datech, a které vyžadovalo vytvoření syntetických dat.
Třístupňový proces zahrnoval výběr vhodných kandidátských snímků z videí, zpracovaných pomocí Qwen2.5-VL Vision-Language Model (VLM), s odpovídajícím ořezáním a hodnocením vhodnosti (tj. žádné překrytí, subjekt v správné pozici atd.); a vytváření vhodných inpainting masek pro izolaci postižených oblastí – které (v souladu s předchozí prací PERSE) jsou zpracovány pomocí SDXL difúzního modelu.

Přehled pipeline Vanast, kde je lidský obrázek, cílové obrázky oděvů a pohybové vedení video zpracovány v jednotném video difúzním modelu. Systém generuje animaci, která zachovává identitu, sleduje pohybovou sekvenci a aplikuje cílové oděvy, zatímco syntetická trojice generace podporuje trénování, a dual-modulový design odděluje animaci od přenosu oděvů, aby se zachovala konzistence.
V třetím stupni Qwen opět plní funkci klasifikace obrazů podle pohlaví, a populární Flux image difúzní rámec je poté použit pro vytvoření změn v oděvu na obraze (protože Flux je schopen slučovat více vstupních prvků). Inpainting textové prompty byly kurátorovány pomocí ChatGPT (verze neuvedena).
Pro další zvýšení rozmanitosti pohybu a pozadí byl zaveden pipeline pro konstrukci trénovacích trojic z divokých videí, pomocí HumanVid datasetu. Stejný proces byl použit pro generování identity-přizpůsobujícího se lidského obrazu.
Pokud neexistoval samostatný obraz oděvu v těchto videích, obrázky oděvů byly syntetizovány přímo z footage. Snímky byly vzorkovány z každého videa, a Qwen byl použit pro hodnocení frontalitní viditelnosti, před výběrem nejvhodnějšího kandidáta, založeného na plné viditelnosti těla, jasnosti obrazu, minimálním překrytí, kvalitě osvětlení a celkové kompozici.
Horní část oděvu byla poté extrahována pomocí SegFormer, a pozadí bylo odstraněno, aby se izoloval oděv.
Aby se zabránilo pozicionálnímu zkreslení, oblast oděvu byla náhodně posunuta uvnitř své hranice, a Qwen byl opět použit pro filtrování nepřesných segmentací. Tento proces produkoval syntetické obrázky oděvů spárované s pohybem a identitou, umožňující velkou konstrukci trojic z nestrukturovaných videodat, zatímco se zlepšovala robustnost napříč různými reálnými podmínkami.
Architektura
Dual-modulová architektura byla zavedena pro řešení pomalého konvergence a slabé rovnováhy kontroly, pozorované v předchozích metodách, které se pokusily spojit všechny podmínky. Tento přístup využívá text-to-video difúzní transformátor z Wan, a čerpal také z VACE projektu (viz níže).
Model byl rozdělen na Human Animation Module (HAM), který zpracovával pohyb a identitu z lidských a pohybových vstupů; a Garment Transfer Module (GTM), který zpracovával oděvy z obrázků oděvů. Oba sdílely přístup k základnímu rámci, zatímco integrovaly funkce distribuovaným, kaskádovým způsobem, aby se zlepšila kondice.
Trénování bylo provedeno zmrazením základního rámce a optimalizací pouze parametrů HAM a GTM, s jejich příspěvky vyváženými během integrace funkcí. Vstupy ze syntetické trojice datové sady byly převedeny na latentní reprezentace pomocí WANova variabilního autoencoderu (VAE).
Pohybově-aware kontext byl vytvořen kombinací lidských a pohybových informací v čase, zatímco funkce oděvů byly zpracovány samostatně a zarovnány projekcí do tokenových vložených reprezentací.
Model byl také rozšířen pro podporu přenosu oděvů. Zde byly reprezentace ze dvou oděvů kombinovány pro generování plynulých přechodů, umožňujících konzistentní a koherentní míchání mezi oděvy, bez další optimalizace.
Data a testy
Model byl trénován na 9 135 videích, s délkami se pohybujícími od tří do deseti sekund, pocházejících z výše zmíněných “nákupních center”; datové sady autorů; a HumanVid datasetu.
Z nich byly vytvořeny dvě evaluační datové sady: “internetová datová sada”, obsahující videa a produktové obrázky z center; a oficiální testovací datová sada Alibaba ViViD datasetu.
Pokud datová sada ViViD postrádá tváře (viz výše uvedený video, pro příklad, který je velmi běžný ve virtuálním vyzkoušení literatury), byly přidány pomocí Flux outpainting.
Metriky používané byly L1 ztráta; Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); Fréchet Inception Distance (FID); a Fréchet Video Distance†† (FVD)
Systémy testované pro přenos oděvů byly OOTDiffusion; CatVTON; OmniTry; a Any2AnyTryon. Modely generování subjektu-obrázek testované byly VisualCloze; MOSAIC; a ByteDance UNO.
Pro druhou kategorii testů, kde byly testovány kombinace image-virtuálního vyzkoušení a animačních modelů, nová práce opět dosáhla nejvyššího skóre:

Kvantitativní srovnání s kombinacemi image-based virtuálního vyzkoušení a animačních modelů na internetové a ViViD datové sadě, kde navrhovaná metoda dosáhla nejlepší celkové výkony napříč všemi metrikami, s SSIM zůstávající srovnatelnou se silnějším baseline. Tučné hodnoty označují nejvyšší skóre ve sloupci.
Autorům se podařilo:
‘[Naše] model dosáhla nejlepších výkonů napříč všemi metrikami ve srovnání s kombinacemi subjekt-obrázek generujících modelů a animačních modelů.
‘Kvalitativní výsledky [zobrazené níže] dále potvrzují, že náš přístup produkuje nejpreciznější sledování pohybu a přenos oděvů, zatímco zachovává identitu více věrně než všechny subjekt-obrázek založené baseline.’

Kvalitativní srovnání na internetové a ViViD datové sadě proti subjekt-obrázek a animačním baseline, kde navrhovaná metoda, podle autorů, nabízí více přesné sledování pohybu a přenos oděvů, zatímco zachovává identitu více konzistentně než VisualCloze, MOSAIC, UNO a VACE.
Závěr
Ačkoli projekt Vanast dosáhl diskrétního koncového řešení, nedostatek detailů kolem požadavků na trénování a inferenční zdroje naznačuje, že tato metoda nemusí být nejagilnější nebo nejpružnější. Ve skutečnosti je sama výzva extrémně obtížná, aby byla splněna, a to i v neoptimalizovaném systému – a o to více v komerčním nasazení, které by vyžadovalo nízkou latenci a dostupnost ve velkém měřítku.
Virtuální vyzkoušení je jednou z “měsíčních” cílů umělé inteligence, kde současný stav technologie, jak je prezentován v různých titulcích a vybraných výsledcích, skrývá skutečnou obtížnost úkolu, který možná bude nakonec vyřešen pozdějšími a lehčími technologiemi než transforméry.
† Dostupné v USA, geo-blokované v mnoha dalších regionech, pokud nejsou všechny.
†† Autor se odvolává na ‘VFID’, ale odkazuje pouze na článek ViViD, který neodůvodňuje odkazy, pokud to mohu určit, s omezeným časem na vyhledání. Předpokládám, že autoři vlastně mysleli Fréchet Video Distance (FVD), a byli stejně krátkodobí. Kontaktujte mě pro případné úpravy.
Poprvé zveřejněno ve středu 8. dubna 2026












