Unghiul lui Anderson
Încercarea virtuală a îmbrăcămintei noi prin intermediul inteligenței artificiale

Un model de inteligență artificială poate transforma o singură fotografie și imagini de îmbrăcăminte într-un videoclip mișcător al unei persoane care poartă noi ținute, evitând glitch-urile comune în sistemele mai vechi, cu două etape.
Categoria “încercare virtuală” (VTON) în cercetarea viziunii computaționale este printre cele mai bine finanțate și mai prolifice obiective din literatură – în principal pentru că, așa cum se poate desprinde din colaborările frecvente industrie-academice publicate în fiecare an, acest obiectiv primește o finanțare semnificativă din partea industriei modei bine dotate:

Din lucrarea ‘Încercarea virtuală pe baza imaginilor: O anchetă’, exemple de tipuri de reprezentare a persoanei și unele dintre etapele de filtrare și rafinare pe care chiar și imaginile goale trebuie să le parcurgă pentru o încercare virtuală (VTON). Sursă
Există multe variații ale obiectivului, cum ar fi extragerea îmbrăcămintei din imagini cu persoane și adaptarea pentru siluete mai complete atunci când este necesar. Unele sisteme bazate pe imagini au fost implementate comercial, pe platforme precum veesual.ai, wanna.fashion și fashn.ai.
Pentru video, aplicația experimentală Doppl a experimentat cu această funcționalitate, lansând anul trecut:
Vă rugăm să faceți clic pentru a reda dacă videoclipul nu se redă automat. Excerpte din proiectul abandonat de încercare virtuală video Google Doppl. Sursă
În orice caz, Doppl se închide în aprilie 2026, după o recepție rezervată, utilizatorii fiind redirecționați către serviciul de încercare virtuală pe baza imaginilor al companiei Google†:

Programul de încercare virtuală pe baza imaginilor Google, unde utilizatorii sunt redirecționați de pe platforma abandonată Doppl. Sursă
Deși există câteva platforme care oferă încercare virtuală cu video, niciuna dintre ele nu pare a fi afiliată cu un magazin real; și toate sunt produse “de ultimă oră”, marginale (și adesea “discutabile”) și promovează token-uri.
În timp ce există câteva incursiuni interesante din sectorul cercetării, acestea sunt, în mod tradițional, arhitecturi complexe care sunt dificil de implementat pentru latență scăzută și calitate ridicată:
Vă rugăm să faceți clic pentru a reda dacă videoclipul nu se redă automat. Din proiectul Fashion-VDM din 2024, un exemplu de ‘transfer de îmbrăcăminte fără cap’. Sursă
Adevărul este că sarcina de a face îmbrăcămintea să se potrivească unei persoane reale, fără a distorsiona nici îmbrăcămintea, nici persoana, și menținând în același timp un fel de mișcare demonstrativă utilă (care arată cu acuratețe spatele produsului atunci când persoana își întoarce spatele), este o provocare formidabilă pentru stadiul actual al tehnologiei.
Vanast
Este o provocare la care un nou articol din Coreea încearcă să răspundă, folosind o soluție complet integrată și inovatoare pentru analiza îmbrăcămintei + persoanei + mișcării:
Vă rugăm să faceți clic pentru a reda dacă videoclipul nu se redă automat. Exemple din site-ul de materiale suplimentare al proiectului Vanast. Sursă
Noul sistem, intitulat Vanast, folosește un set de date personalizat care incorporează și orchestrează toți cei trei factori necesari pentru a îndeplini sarcina: îmbrăcămintea; persoana; și mișcarea:
Faceți clic pentru a reda. Mai multe exemple din site-ul proiectului Vanast.
Sistemul folosește cadre diverse, cum ar fi Flux, Qwen și ChatGPT, pentru a genera un set de date “triplet” capabil să informeze o arhitectură de la capăt la capăt:

Din noul articol, exemple de puncte de date din setul de date folosit pentru generare și antrenament. Sursă –
Noul articol se intitulează Vanast: Încercare virtuală cu animație de imagine umană prin supraveghere sintetică triplet și provine de la patru cercetători de la Universitatea Națională din Seoul. Există și un site de proiect plin de videoclipuri.
Metodă
Obiectivul declarat al autorilor în această lucrare este de a combina cele trei aspecte menționate anterior într-un cadru într-o singură etapă – nu numai pentru că procesul ar fi discret, ci și pentru că oferă diferitelor aspecte mai multe oportunități de a se împleti și de a interacționa în timpul antrenamentului, cu scopul de a obține o generare mai coerentă:

Vanast combină o singură fotografie umană, imagini separate de îmbrăcăminte și o referință de mișcare pentru a genera o secvență mișcătoare în care aceeași persoană poartă noua ținută, cu orientarea poziției care asigură mișcarea consistentă, în timp ce identitatea și detaliile îmbrăcămintei sunt păstrate pe parcursul cadrelor.
Pentru a realiza acest lucru, sistemul ia imagini ale articolelor de îmbrăcăminte țintă; o fotografie a persoanei care poartă diferite haine; o referință de mișcare care definește cum ar trebui să se miște persoana; și un prompt de text care descrie acțiunea și setarea; și produce o secvență de videoclip completă în care aceeași persoană pare să poarte noua ținută, urmând mișcarea impusă, cu fiecare cadru păstrat vizual consistent în timp.
În loc să separe îmbrăcarea și animația în etape separate – ceea ce a fost abordarea în majoritatea lucrărilor anterioare similare – Vanast gestionează îmbrăcămintea, identitatea și mișcarea împreună într-un singur proces, permițând acestor elemente să interacționeze în timpul generării și reducând tipurile de neconcordanțe și instabilități evidențiate în metodele anterioare.
Set de date
Antrenamentul pentru proiect se bazează pe exemple pereche de imagine a persoanei, articolele de îmbrăcăminte corespunzătoare și un videoclip al persoanei care se mișcă purtând aceste haine, cu mișcarea extrasă folosind o arhitectură anterioară, pentru a oferi o orientare stabilă a poziției pe parcursul cadrelor.
În absența unui set de date public disponibil care să îndeplinească cerințele proiectului, datele au fost extrase de pe (ne specificate) platforme de cumpărături online, oferind un cache de videoclipuri cu îmbrăcăminte diversă. Cu toate acestea, sarcina a necesitat videoclipuri cu aceeași persoană purtând mai multe ținute, ceea ce este o găsire rară în datele din sălbăticie, și care a necesitat crearea datelor sintetice.
Procesul în trei etape a implicat selectarea cadrelor candidate potrivite din videoclipurile extrase, gestionate prin Qwen2.5-VL Vision-Language Model (VLM), cu decuparea și evaluarea corespunzătoare a potrivirii (de exemplu, fără ocultări, subiectul în poziție corectă, etc.); și crearea maselor de inpainting potrivite pentru a izola zonele afectate – care (în conformitate cu lucrarea anterioară PERSE) este gestionat de modelul de difuzie SDXL actual.

Prezentare generală a pipeline-ului Vanast, unde o imagine umană, imagini de îmbrăcăminte țintă și o referință de mișcare sunt codificate și procesate într-un model de difuzie video unificat. Sistemul generează o animație care păstrează identitatea, urmează secvența de poziție și aplică îmbrăcămintea țintă, în timp ce generarea tripletului sintetic susține antrenamentul, și un design cu două module separă animația de transferul îmbrăcămintei, pentru a menține coerența.
În a treia etapă, Qwen își face din nou datoria pentru a clasifica imaginile după sex, și cadrul de difuzie a imaginilor Flux este folosit apoi pentru a crea modificări ale îmbrăcămintei într-o imagine (deoarece Flux este capabil să coalesceze multiple elemente de intrare). Prompt-urile de text pentru inpainting au fost curate de ChatGPT (versiune ne specificată).
Pentru a crește și mai mult diversitatea poziției și a fundalului, a fost introdus un pipeline pentru a construi tripleți de antrenament din videoclipuri din sălbăticie, folosind setul de date HumanVid. Același proces a fost folosit pentru a genera imaginea umană care păstrează identitatea.
Deoarece nu a existat o imagine de îmbrăcăminte independentă în aceste videoclipuri, imaginile de îmbrăcăminte au fost sintetizate direct din videoclip. Cadrele au fost eșantionate din fiecare videoclip, și Qwen a fost folosit pentru a le evalua pentru vizibilitate frontală, înainte de a selecta cel mai potrivit candidat, pe baza vizibilității complete a corpului, clarității imaginii, minimizării ocultărilor, calității iluminării și compoziției generale.
O regiune de îmbrăcăminte superioară a fost extrasă folosind SegFormer, și fundalul a fost eliminat pentru a izola îmbrăcămintea.
Pentru a evita sesizarea pozițională, regiunea îmbrăcămintei a fost deplasată aleatoriu în cutia de delimitare, și Qwen a fost folosit din nou pentru a filtra segmentările nereabile. Acest proces a produs imagini sintetice de îmbrăcăminte pereche cu mișcarea și identitatea, permițând construirea tripletului la scară largă din datele video neordonate, în timp ce îmbunătățește robustețea în diferite condiții din lumea reală.
Arhitectură
A fost introdusă o arhitectură cu două module pentru a aborda convergența lentă și echilibrul slab de control văzut în acele metode anterioare care au încercat să fuzioneze toate condițiile. Abordarea a folosit transformatorul de difuzie text-videoclip de la Wan, și s-a bazat și pe proiectul VACE (a se vedea mai jos).
Modelul a fost împărțit într-un Modul de animație umană (HAM), care gestiona mișcarea și identitatea de la intrările umane și de poziție; și un Modul de transfer de îmbrăcăminte (GTM), care gestiona îmbrăcămintea de la imaginile de îmbrăcăminte. Ambele au împărtășit accesul la spatele modelului, în timp ce integrau caracteristici într-un mod distribuit și cascade, pentru a îmbunătăți condiționarea.
Antrenamentul a fost realizat prin înghețarea spatele modelului și optimizarea doar a parametrilor HAM și GTM, cu contribuțiile lor echilibrate în timpul integrării caracteristicilor. Intrările din setul de date triplet sintetic au fost convertite în reprezentări latente folosind variational autoencoder (VAE) de la WAN.
Contextul conștient de mișcare a fost construit prin combinarea informațiilor umane și de poziție în timp, în timp ce caracteristicile îmbrăcămintei au fost procesate separat și aliniate prin proiecție în încorporări de token.
Modelul a fost extins și pentru a susține interpolarea îmbrăcămintei. Aici, reprezentările a două îmbrăcăminte au fost combinate pentru a genera tranziții netede, permițând amestecarea coerentă și consistentă între articolele de îmbrăcăminte, fără optimizare suplimentară.
Date și teste
Modelul a fost antrenat pe 9.135 de videoclipuri, cu lungimi variind de la trei la zece secunde, provenite de pe “site-urile de magazine”; setul de date generat de autori; și setul de date HumanVid.
De aici, au fost create două seturi de date de evaluare: “setul de date de internet”, care prezintă videoclipuri și imagini de produse de pe magazine; și divizarea oficială de test a setului de date ViViD de la Alibaba.
Deoarece datele ViViD lipsesc fețe (a se vedea videoclipul de mai sus, pentru un exemplu al acestui lucru, care este foarte comun în literatura de încercare virtuală), acestea au fost adăugate prin Flux outpainting.
Metricile folosite au fost pierderea L1; Raportul de semnal la zgomot de vârf (PSNR); Indexul de similaritate structurală (SSIM); Similaritatea perceptuală a patch-urilor de imagine învățate (LPIPS); Distanța de începere Fréchet (FID); și Distanța video Fréchet†† (FVD)
Sistemele testate pentru transferul de îmbrăcăminte au fost OOTDiffusion; CatVTON; OmniTry; și Any2AnyTryon. Modelele de generare a imaginilor de la subiect la imagine testate au fost VisualCloze; MOSAIC; și UNO de la ByteDance.
Pentru a doua categorie de teste, în care au fost testate combinații de modele de încercare virtuală pe baza imaginilor și de animație, noul proiect a reușit din nou să obțină cel mai bun punctaj:

Comparație cantitativă cu combinații de încercare virtuală pe baza imaginilor și de animație pe seturile de date de internet și ViViD. Metoda propusă a obținut cel mai bun punctaj general pe metrici, cu SSIM rămânând comparabil cu cel mai puternic punct de referință. Valorile îngroșate denotă cel mai mare punctaj.
Autorii adaugă:
‘Comparațiile calitative [prezentate mai jos] demonstrează că rezultatele noastre seamănă cel mai mult cu adevărul din lumea reală între toate punctele de referință bazate pe încercarea virtuală pe baza imaginilor.’

Teste calitative folosind puncte de referință create prin combinarea modelelor VTON cu modele de animație.
Concluzie
Deși proiectul Vanast realizează o soluție discretă de la capăt la capăt, lipsa de detalii din articol cu privire la cerințele de resurse pentru antrenament și inferență sugerează că aceasta poate să nu fie cea mai agilă sau mai ușoară soluție. În realitate, provocarea în sine este extrem de dificilă de realizat, chiar și într-un sistem neoptimizat – și cu atât mai mult într-o implementare comercială care ar necesita latență scăzută și rentabilitate la scară..?
Încercarea virtuală este unul dintre obiectivele “lunare” ale inteligenței artificiale, unde stadiul actual al tehnologiei, așa cum este difuzat prin diverse titluri și rezultate selectate, ascunde dificultatea reală a sarcinii, care, poate, va fi rezolvată în cele din urmă de tehnologii ulterioare și mai ușoare decât transformatorii.
† Disponibil în SUA, blocat în multe alte regiuni, dacă nu în toate.
†† Autorii fac referire la ‘VFID’, dar link-ul duce doar la articolul ViViD, care nu justifică referința, după cum pot să spun, cu timp limitat pentru a o urmări. Am presupus că, de fapt, au vrut să spună Distanța video Fréchet (FVD), și au fost, de asemenea, lipsiți de timp. Vă rog să-mi trimiteți un mesaj pentru modificări, după cum este necesar.
Publicat pentru prima dată miercuri, 8 aprilie 2026












