Andersonin kulma

Virtuaalinen pukeutuminen uusiin vaatteisiin tekoälyllä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Examples of virtual try-on from the Vanast project – source: https://arxiv.org/pdf/2604.04934

Tekoälymalli voi nyt muuttaa yhden valokuvan ja vaatekuvat liikkuvaan videoon, jossa henkilö käyttää uusia vaatteita, välttäen vanhempien, kahden vaiheen järjestelmien yleisiä virheitä.

 

Tietokoneen näkökulman ‘virtuaalisen pukeutumisen’ (VTON) kategoria on yksi parhaiten rahoitetuimmista ja tuottavimmista tavoitteista kirjallisuudessa – pääasiassa, koska voidaan havaita useista joka vuosi julkaistuista teollisuus/akateemisista yhteistyöistä, tämä tavoite saa merkittävää rahoitusta hyvin varustellulta muodin teollisuudelta:

Artikkelista 'Image-Based Virtual Try-On: A Survey', esimerkkejä henkilön edustamistyyppien ja joistakin suodatus- ja hienonnusvaiheista, joita jopa paljaat kuvat on käytettävä virtuaalisen pukeutumisen (VTON) aikana. Lähde - https://arxiv.org/pdf/2311.04811v3

Artikkelista ‘Image-Based Virtual Try-On: A Survey’, esimerkkejä henkilön edustamistyyppien ja joistakin suodatus- ja hienonnusvaiheista, joita jopa paljaat kuvat on käytettävä virtuaalisen pukeutumisen (VTON) aikana. Lähde – https://arxiv.org/pdf/2311.04811v3

On olemassa monia tavoitteen variaatioita, kuten vaatteiden erottaminen kuvista ja täysikasvuisen hahmon mukauttaminen tarvittaessa. Joitakin kuvapohjaisia järjestelmiä on kaupallisesti toteutettu alustoilla, kuten veesual.ai, wanna.fashion ja fashn.ai.

Videolle Google Labsin kokeellinen Doppl-sovellus kokeili tätä toiminnallisuutta, julkaisemalla edellisen kesän:

Paina videota, jos se ei toimi automaattisesti. Katkelmat hylätyistä Google Doppl -video-koekokeilusta. Lähde

Kuitenkin Doppl sulkee ovensa huhtikuussa 2026 laimean vastaanoton jälkeen, ja katsojat ohjataan nyt yrityksen kuvaan perustuvaan virtuaaliseen pukeutumisohjelmaan:

Google kuvapohjainen virtuaalinen pukeutumisohjelma, johon asiakkaat ohjataan yrityksen hylätyltä Doppl-alustalta. Lähde - https://www.google.com/shopping/tryon

Google kuvapohjainen virtuaalinen pukeutumisohjelma, johon asiakkaat ohjataan yrityksen hylätyltä Doppl-alustalta. Lähde – https://www.google.com/shopping/tryon

Vaikka on olemassa joitakin alustoja, jotka tarjoavat virtuaalista pukeutumista videolla, ne eivät näytä olevan liitettynä mihinkään varsinaiseen myyntipaikkaan; ja ne kaikki ovat ‘viimeisimmän kehityksen’ reunalla olevia, marginaalisia (ja usein ‘kyseenalaisia’) token-tuotteita.

On olemassa joitakin mielenkiintoisia tutkimuksia tutkimussektorilta, mutta ne ovat perinteisesti monimutkaisia arkkitehtuureja, jotka ovat haasteellisia toteuttaa matalalla viiveellä ja korkealla laadulla:

Paina videota, jos se ei toimi automaattisesti. 2024 Fashion-VDM-projektista esimerkki ‘päättömän’ vaatetusvaihdosta. Lähde

Totuus on, että tehtävä vaatteiden sovittamisesta oikeaan henkilöön ilman vääristymää, joko vaatteissa tai henkilössä, samalla ylläpitäen jonkinlaista hyödyllistä esittävää liikettä (joka tarkasti näyttää tuotteen takapuolen, kun henkilö kääntää selkänsä), on valtava haaste nykyisen tekniikan kehitykselle.

Vanast

Se on haaste, johon uusi tutkimus Koreasta yrittää vastata käyttämällä uutta ja täysin integroituja ratkaisuja vaatteiden, henkilön ja liikkeen käsittelyyn:

Paina videota, jos se ei toimi automaattisesti. Esimerkkejä Vanast-projektin lisäaineistosivulta. Lähde

Uusi järjestelmä, joka on nimeltään Vanast, hyödyntää räätälitettyä tietojoukkoa, joka sisältää vaatteiden, henkilön ja liikkeen yhdistämisen ja orkestraation kaikki kolme tarvittavaa tekijää tehtävän suorittamiseksi:

Paina videota. Lisää esimerkkejä Vanast-projektisivulta.

Järjestelmä hyödyntää erilaisia kehyksiä, kuten Flux, Qwen ja ChatGPT, luodakseen ‘triplet’-tietojoukon, joka voi kertoa lopputuleen arkkitehtuuriin:

Uudesta tutkimuksesta esimerkkejä tietojoukon datakohtia, joita käytetään generoinnissa ja koulutuksessa. Lähde - https://arxiv.org/pdf/2604.04934

Uudesta tutkimuksesta esimerkkejä tietojoukon datakohtia, joita käytetään generoinnissa ja koulutuksessa. Lähde – https://arxiv.org/pdf/2604.04934

Uusi tutkimus on nimeltään Vanast: Virtuaalinen pukeutuminen ihmisen kuvan animaation kautta synteettisen tripletin valvonnalla, ja se on neljän tutkijan työ Seoul National Universitysta. On myös videoita täynnä oleva projektisivu.

Menetelmä

Tutkijoiden ilmoittama tavoite työssä on yhdistää kolme edellä mainittua tekijää yhteen vaiheeseen – ei vain siksi, että prosessi olisi erillinen, vaan myös siksi, että se antaa eri tekijöille enemmän mahdollisuuksia yhdistyä ja vuorovaikuttaa koulutuksen aikana, tavoitteena olisi yhdenmukaisempi generointi:

Vanast yhdistää yhden ihmisen valokuvan, erilliset vaatekuvat ja liikemallin, jotta voidaan generoida liikkuva sekvenssi, jossa sama henkilö käyttää uusia vaatteita, asennusohjaus varmistaa johdonmukaisen liikkeen, ja identiteetti ja vaatetusyksityiskohdat säilytetään kehyksittäin.

Vanast yhdistää yhden ihmisen valokuvan, erilliset vaatekuvat ja liikemallin, jotta voidaan generoida liikkuva sekvenssi, jossa sama henkilö käyttää uusia vaatteita, asennusohjaus varmistaa johdonmukaisen liikkeen, ja identiteetti ja vaatetusyksityiskohdat säilytetään kehyksittäin.

Jotta tämä voidaan saavuttaa, järjestelmä ottaa vaatekuvia; valokuvan henkilöstä, joka käyttää eri vaatteita; liikemallivideon, joka määrittää, miten henkilö pitäisi liikkua; ja tekstipromptin, joka kuvailee toimintaa ja asetusta; ja tuottaa täydellisen videosekvenssin, jossa sama henkilö näyttää käyttävän uusia vaatteita, seuraten asetettua liikettä, ja jokainen kehys säilytetään visuaalisesti johdonmukaisena ajassa.

Toisin kuin useimmissa aiemmissa työssä, joissa pukeutuminen ja animaatio on jaettu eri vaiheisiin – Vanast käsittelee vaatteet, identiteetin ja liikkeen yhdessä prosessissa, sallien näiden elementtien vuorovaikuttaa generoinnin aikana, ja vähentäen sellaisten epäsovellusten ja epävakauden määrää, joita on havaittu aiemmissa menetelmissä.

Tietojoukko

Koulutus perustuu pareittain henkilön kuvasta, vastaavista vaatekappaleista ja videosta, jossa henkilö liikkuu näiden vaatteiden kanssa, liike poistetaan aiemmalla arkkitehtuurilla, jotta voidaan tarjota vakaata asennusohjausta kehyksittäin.

Johtuen siitä, että julkaistuissa tietojoukoissa ei ole yleisesti saatavilla tietojoukkoa, joka täyttäisi projektin vaatimukset, dataa kerättiin (määrittelemättömiltä) verkkokauppa-alustoilta, mikä tarjosi valikoiman videoita, joissa on monipuolisia vaatteita. Kuitenkin tehtävä edellytti videoita, joissa sama henkilö käytti useita asuja, mikä on harvinainen löytö villissä datassa, ja joka edellytti synteettisen datan luomista.

Kolmevaiheinen prosessi käsitti sopivien ehdokaskehyksien valinnan poimittuista videoista, jotka käsiteltiin Qwen2.5-VL -näkemys- ja kielimallilla (VLM), ja sopivan rajauksen ja arvioinnin sopivuudesta (ts. ei peittämistä, aihe on oikeassa asennossa jne.); ja luomalla soveltuvia täyttömaskit eristämään vaikuttavat alueet – jotka (aiemman tutkimuksen PERSE mukaisesti) käsitellään nyt arvostetulla SDXL -diffuusiomallilla.

Vanast-pipeline, jossa ihmiskuvaa, kohdevaatekuvia ja liikemallivideota käytetään yhdistetyssä videodiffuusiomallissa. Järjestelmä generoi animaation, joka säilyttää identiteetin, seuraa asennusjärjestystä ja soveltaa kohdevaatteita, ja synteettinen tripletin generointi tukee koulutusta, ja kaksimoduulinen suunnittelu erottaa animaation vaatetusvaihdosta, jotta voidaan ylläpitää johdonmukaisuutta.

Vanast-pipeline, jossa ihmiskuvaa, kohdevaatekuvia ja liikemallivideota käytetään yhdistetyssä videodiffuusiomallissa. Järjestelmä generoi animaation, joka säilyttää identiteetin, seuraa asennusjärjestystä ja soveltaa kohdevaatteita, ja synteettinen tripletin generointi tukee koulutusta, ja kaksimoduulinen suunnittelu erottaa animaation vaatetusvaihdosta, jotta voidaan ylläpitää johdonmukaisuutta.

Kolmannessa vaiheessa Qwen tekee jälleen palvelun, jotta voidaan luokitella kuvat sukupuolen mukaan, ja suosittu Flux -kuvadiffuusiopohjaisiin kehyksiin käytetään luomaan muutoksia vaatteissa kuvassa (koska Flux pystyy yhdistämään useita syöteelementtejä). Täyttötekstipromptit luotiin ChatGPT:llä (versio ei ole määritelty).

Jotta pose- ja taustan monimuotoisuutta voidaan lisätä, otettiin käyttöön putki, joka rakentaa koulutus-triplettejä villin videon avulla, käyttäen HumanVid -tietojoukkoa. Sama prosessi käytettiin identiteetin säilyttävän ihmiskuvan luomiseen.

Koska näissä videoissa ei ollut erillistä vaatekuvaa, vaatekuvat synteetisoitiin suoraan videosta. Kehyksiä otettiin näistä videoista, ja Qwen käytettiin arvioimaan niiden etuviittauksellisuutta, ennen kuin valittiin sopivin ehdokas, perustuen täydelliseen kehon näkyvyyteen, kuvan selkeyteen, vähäiseen peittämiseen, valaistuksen laatuun ja yleiseen koostumukseen.

Ylävaatealue erotettiin SegFormer -avulla, ja tausta poistettiin, jotta vaatteet voidaan erottaa.

Jotta asennusviite voidaan välttää, vaatealue siirrettiin satunnaisesti sen määritysruudussa, ja Qwen käytettiin jälleen epäluotettavien segmenttien suodattamiseen. Tämä prosessi tuotti synteettisiä vaatekuvia, joissa on liike ja identiteetti, jotta voidaan rakentaa suuria triplettejä rakenteettomasta videodatasta, ja parantaa robustisuutta eri reaalimaailman olosuhteissa.

Arkkitehtuuri

Kaksiosainen arkkitehtuuri otettiin käyttöön hitaan suppeuden ja heikon tasapainon ongelman ratkaisemiseksi, joita oli havaittu aiemmissa menetelmissä, jotka olivat yrittäneet yhdistää kaikki ehdot. Lähestymistapa hyödynsi Wan -tekstistä-videodiffuusiomuunnosta, ja se nojautui myös VACE -projektiin (ks. alla).

Malli jaettiin Ihmisen animaatiomoduuliin (HAM), joka käsittelee liikettä ja identiteettiä ihmisen ja asennuksen syötteistä; ja Vaatetusvaihtomoduuliin (GTM), joka käsittelee vaatteita vaatekuvista. Molemmat jakavat pääsääntöisesti rungon, ja integroivat ominaisuuksia hajautetussa, askelkohtaisessa tavassa, jotta voidaan parantaa ehtoja.

Koulutus suoritettiin jäädyttämällä runko ja optimoimalla vain HAM- ja GTM-parametrejä, ja niiden panokset tasapainotettiin ominaisuuksien integroinnin aikana. Synteettisen tripletin tietojoukon syötteet muunnettiin latenssi-esityksiksi käyttäen WAN:in variational autoencoderia (VAE).

Liiketoimintaympäristöä rakennettiin yhdistämällä ihmisen ja asennuksen tietoja ajassa, kun taas vaateominaisuudet käsiteltiin erikseen, ja ne kohdistettiin tokenupotukseen.

Malli laajennettiin myös tukemaan vaatetusvaihtelua. Tässä yhdistettiin kaksi vaatetusta esitystapaa, jotta voidaan generoida sileitä siirtymiä, ja voidaan saavuttaa johdonmukainen ja yhdenmukainen yhdistäminen vaatteiden välillä, ilman lisäoptimoitumista.

Data ja testit

Malli koulutettiin 9 135 videolla, joiden pituus vaihteli kolmesta kymmenen sekuntiin, jotka peräisin edellä mainituilta ‘ostoskeskuksilta’; tutkijoiden omasta luodusta tietojoukosta; ja HumanVid-tietojoukosta.

Näistä muodostettiin kaksi arviointitietojoukkoa: ‘Internet-tietojoukko’, joka sisälsi videoita ja tuotekuvia ostoskeskuksilta; ja virallinen testijakoa Alibaban ViViD -tietojoukosta.

Koska ViViD -datassa ei ole kasvoja (ks. yllä oleva video esimerkkinä, joka on hyvin yleinen virtuaalisen pukeutumisen kirjallisuudessa), ne lisättiin Fluxin ulkopaintauksella.

Mitä käytettiin, olivat L1-häviö; Huippu-signaali-kohina-suhde (PSNR); Rakenteellinen samankaltaisuusindeksi (SSIM); Opittu aistiminen kuvapatchin samankaltaisuus (LPIPS); Fréchet Inception -etäisyys (FID); ja Fréchet Videon etäisyys†† (FVD)

Järjestelmiä, joita testattiin vaatetusvaihdolle, olivat OOTDiffusion; CatVTON; OmniTry; ja Any2AnyTryon. Aiheeseen liittyvien kuvien generointimallien testaamiseen osallistuivat VisualCloze; MOSAIC; ja ByteDance UNO.

Toisessa testikategoriassa, jossa testattiin yhdistelmiä kuvapohjaisista virtuaalisista pukeutumis- ja animaatiomalleista, uusi työ pystyi saavuttamaan korkeimman pisteytyksen:

Määrällinen vertailu aiheeseen liittyvien ja animaatiomallien yhdistelmiin Internet- ja ViViD -tietojoukoissa, joissa ehdotettu menetelmä saavutti parhaimman suorituskyvyn kaikissa ilmoitetuissa mittareissa. Lihavoitetut arvot osoittavat korkeimman pisteytyksen kussakin sarakkeessa.

Määrällinen vertailu aiheeseen liittyvien ja animaatiomallien yhdistelmiin Internet- ja ViViD -tietojoukoissa, joissa ehdotettu menetelmä saavutti parhaimman suorituskyvyn kaikissa ilmoitetuissa mittareissa. Lihavoitetut arvot osoittavat korkeimman pisteytyksen kussakin sarakkeessa.

Alkuperäisistä tuloksista, jotka on näytetty yllä, tutkijat toteavat:

‘[Meidän] malli saavuttaa parhaimman suorituskyvyn kaikissa mittareissa, kun verrataan aiheeseen liittyvien ja animaatiomallien yhdistelmiin.

‘Laadulliset tulokset [alla] vahvistavat, että meidän lähestymistapamme tuottaa tarkin asennon seuraamisen ja vaatetusvaihdon, ja säilyttää identiteetin uskollisemmin kuin kaikki aiheeseen liittyvät vertailumallit.’

Laadullinen vertailu Internet- ja ViViD -tietojoukoissa aiheeseen liittyvien ja animaatiopohjaisiin vertailuihin, joissa ehdotettu menetelmä, tutkijoiden mukaan, tarjoaa tarkemman asennon seuraamisen ja vaatetusvaihdon, ja säilyttää identiteetin johdonmukaisemmin kuin VisualCloze, MOSAIC, UNO ja VACE.

Laadullinen vertailu Internet- ja ViViD -tietojoukoissa aiheeseen liittyvien ja animaatiopohjaisiin vertailuihin, joissa ehdotettu menetelmä, tutkijoiden mukaan, tarjoaa tarkemman asennon seuraamisen ja vaatetusvaihdon, ja säilyttää identiteetin johdonmukaisemmin kuin VisualCloze, MOSAIC, UNO ja VACE.

Toisessa testikategoriat, jossa testattiin yhdistelmiä kuvapohjaisista virtuaalisista pukeutumis- ja animaatiomalleista, uusi työ pystyi saavuttamaan korkeimman pisteytyksen:

Määrällinen vertailu kuvapohjaisen virtuaalisen pukeutumisen ja animaatiomallien yhdistelmiin Internet- ja ViViD -tietojoukoissa. Ehdotettu menetelmä saavutti parhaimman suorituskyvyn kaikissa mittareissa, ja SSIM säilyi vertailukelpoisena vahvimman vertailumallin kanssa. Lihavoitetut arvot osoittavat korkeimman pisteytyksen.

Määrällinen vertailu kuvapohjaisen virtuaalisen pukeutumisen ja animaatiomallien yhdistelmiin Internet- ja ViViD -tietojoukoissa. Ehdotettu menetelmä saavutti parhaimman suorituskyvyn kaikissa mittareissa, ja SSIM säilyi vertailukelpoisena vahvimman vertailumallin kanssa. Lihavoitetut arvot osoittavat korkeimman pisteytyksen.

Tutkijat lisäävät:

‘Laadulliset vertailut [alla] osoittavat, että meidän tulokset muistuttavat eniten todellista tulosta kaikista kuvapohjaisista virtuaalisen pukeutumisen vertailumalleista.’

Laadulliset testit, jotka perustuvat vertailumalleihin, jotka on luotu yhdistämällä VTON-mallit animaatiomalleihin.

Laadulliset testit, jotka perustuvat vertailumalleihin, jotka on luotu yhdistämällä VTON-mallit animaatiomalleihin.

Johtopäätös

Vaikka Vanast-projekti saavuttaa erillisen lopputuloksen, tutkimuksen puute yksityiskohtaisissa koulutus- ja inference-resurssivaatimuksissa osoittaa, että tämä ei välttämättä ole kaikkein joustavin tai ketterin ratkaisu. Totuus on, että haaste itsessään on äärimmäisen vaikea saavuttaa, jopa ei-optimoituneessa järjestelmässä – ja kuinka paljon enemmän kaupallisen käyttöönoton, joka tarvitsee matalan viiveen ja taloudellisen kannattavuuden suurella mittakaavalla..?

Virtuaalinen pukeutuminen on yksi niistä ‘kuuroutus’ -tekoälytavoitteista, joissa nykyinen tekniikan kehitys, kuten se on levinnyt eri otsikoihin ja valikoituihin tuloksiin, peittää tehtävän todellisen vaikeuden, joka ehkä lopulta ratkaistaan myöhemmällä ja kevyemmällä tekniikalla kuin Transformerit.

 

Käytettävissä Yhdysvalloissa, geo-estetty monissa muissa alueissa, ellei kaikissa.

†† Tutkijat viittaavat ‘VFID’:ään, mutta linkkaavat ainoastaan ViViD-tutkimukseen, joka ei oikeuta viittauksen, niin pitkältä kuin minä voin seurata, rajoitetun ajan ollessa seurattavissa. Oletan, että he tarkoittivat todella Fréchet Videon etäisyyttä (FVD), ja olivat samalla lyhyellä aikaa. Ole hyvä ja ota yhteyttä minuun korjauksia varten, jos tarvitsee.

Julkaistu ensimmäisen kerran keskiviikkona, 8. huhtikuuta 2026

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai