AI-mallit ja alustat
MagicDance: Realistinen Ihmisen Liikkeen Siirtäminen
Tietokoneen näkö on yksi keskustelluista aloista tekoälyteollisuudessa sen mahdollisten sovellusten vuoksi laajalla valikoimalla reaaliaikaisia tehtäviä. Viime vuosina tietokoneen näkökehysten kehitys on edennyt nopeasti, ja nykyiset mallit pystyvät analysoimaan kasvonpiirteitä, objekteja ja paljon muuta reaaliaikaisissa tilanteissa. Nämä kyvyt huolimatta, ihmisen liikkeen siirtäminen on edelleen haasteellinen tehtävä tietokoneen näkömalleille. Tämä tehtävä käsittää kasvojen ja kehon liikkeiden siirtämisen lähdetikusta tai -videosta kohdetiksuun tai -videoon. Ihmisen liikkeen siirtäminen on laajalti käytössä tietokoneen näkömalleissa kuvien tai videoiden tyylittelyyn, multimediainformaation muokkaamiseen, digitaalisen ihmisen synteesiin ja jopa havaintopohjaisille kehyksille tietojen luomiseen.
Tässä artikkelissa keskitymme MagicDanceen, diffuusiopohjaiseen malliin, joka on suunniteltu vallankumoukseen ihmisen liikkeen siirtämisessä. MagicDance-kehys pyrkii erityisesti siirtämään 2D-ihmisen kasvonilmeitä ja liikkeitä haastaviin ihmisen tanssivideoihin. Sen tavoitteena on luoda uusia asennepohjaisia tanssivideoita tietyille kohdehenkilöille säilyttäen alkuperäisen identiteetin. MagicDance-kehys käyttää kaksivaiheista koulutusstrategiaa, joka keskittyy ihmisen liikkeen erotteluun ja ulkonäkötekijöihin, kuten ihonväriin, kasvonilmeisiin ja vaatetukseen. Tutkimme MagicDance-kehystä, sen arkkitehtuuriin, toimintoihin ja suorituskykyyn verrattuna muihin valmiiden ihmisen liikkeen siirtämismalleihin. Laittamme hommiin.
MagicDance: Realistinen Ihmisen Liikkeen Siirtäminen
Kuten mainittiin aiemmin, ihmisen liikkeen siirtäminen on yksi monimutkaisimmista tietokoneen näkötehtävistä, johtuen suuresta monimutkaisuudesta, joka on osana liikkeiden ja ilmeiden siirtämistä lähdetikusta tai -videosta kohdetiksuun tai -videoon. Perinteisesti tietokoneen näkökehysten on saavutettu ihmisen liikkeen siirtäminen kouluttamalla tehtävän mukaista generatiivista mallia, kuten GAN tai Generative Adversarial Networks, kohdeaineistoihin kasvonilmeille ja kehon asennoille. Vaikka generatiivisten mallien kouluttaminen ja käyttäminen antavat tyydyttäviä tuloksia joissakin tapauksissa, ne usein kärsivät kahdesta suuresta rajoituksesta.
- Ne riippuvat voimakkaasti kuvan vääntämiskomponentista, minkä vuoksi ne usein kamppailevat kehon osien interpoloinnissa, jotka ovat näkymättömiä lähdetikussa joko perspektiivin tai itsepeittämisen vuoksi.
- Ne eivät voi yleistää muihin kuvien ulkopuolelta peräisin oleviin, mikä rajoittaa sovelluksia erityisesti reaaliaikaisissa tilanteissa.

Nykyiset diffuusiomallit ovat osoittaneet poikkeuksellisia kuvien luomiskykyjä eri olosuhteissa, ja diffuusiomallit pystyvät nykyään esittämään voimakkaita visuaalisia esityksiä useilla alimmissa tehtävissä, kuten videoiden luomisessa ja kuvien täydentämisessä, oppimalla web-asteen kuvatietokannoista. Diffuusiomallien kykyjen vuoksi ne voivat olla ihanteellinen valinta ihmisen liikkeen siirtämistehtäviin. Vaikka diffuusiomalleja voidaan soveltaa ihmisen liikkeen siirtämiseen, niissä on joitakin rajoituksia joko siirtämisen laadun, identiteetin säilyttämisen tai aikaskaalan epäjohdonmukaisuuden suhteen johtuen mallin suunnittelusta ja koulutusstrategiasta. Lisäksi diffuusiopohjaiset mallit eivät ole osoittaneet merkittävää etua GAN-kehysten suhteen yleistettävyyden suhteen.
Ylittääkseen esteet, joita diffuusiopohjaiset ja GAN-pohjaiset kehykset kohtaavat ihmisen liikkeen siirtämistehtävissä, kehittäjät ovat esittäneet MagicDance-kehys, joka pyrkii hyödyntämään diffuusiopohjaisten kehyksien potentiaalia ihmisen liikkeen siirtämiseen osoittamalla ennennäkemättömän identiteetin säilyttämisen, visuaalisen laadun ja toimialueen yleistettävyyden. MagicDance-kehys perustuu käsitteeseen, jossa ongelma jaetaan kahteen vaiheeseen: ulkonäön ohjaus ja liikkeen ohjaus, kaksi kykyä, joita kuvadiffuusiopohjaiset kehykset vaativat saadakseen tarkat liikkeen siirtämistulokset.

Yllä oleva kuva antaa lyhyen katsauksen MagicDance-kehys, ja kuten voidaan nähdä, kehys käyttää Stable Diffusion-mallia ja käyttää myös kahta lisäkomponenttia: Ulkonäön ohjausmalli ja Asennusohjausverkko, joista ensimmäinen antaa ulkonäön ohjausta SD-mallille viitekuvan kautta huomion kautta, kun taas jälkimmäinen antaa ilmeen/asennon ohjausta diffuusiomallille ehdollistetun kuvan tai videon kautta. Kehys käyttää myös monivaiheista koulutusstrategiaa oppiakseen nämä alamoduleja tehokkaasti erottamaan asennon ohjaus ja ulkonäön.
Yhteenvetona MagicDance-kehys on
- Uusi ja tehokas kehys, joka koostuu ulkonäköerottuvasta asennon ohjauksesta ja ulkonäön esikoulutuksesta.
- MagicDance-kehys pystyy luomaan realistisia ihmisen kasvonilmeitä ja liikkeitä asennon ehtojen ja viitekuvien/videoiden ohjauksessa.
- MagicDance-kehys pyrkii luomaan ulkonäön yhdenmukaisen ihmisen sisällön esittelemällä Monilähdemerkintämoduulin, joka tarjoaa tarkan ohjaamisen Stable Diffusion UNet-kehys.
- MagicDance-kehys voidaan myös käyttää kätevänä laajennuksena tai lisäosana Stable Diffusion-kehys, ja varmistaa yhteensopivuus olemassa olevien mallipainojen kanssa, eikä edellytä lisäkoulutusta parametreille.
Lisäksi MagicDance-kehys osoittaa poikkeuksellisia yleistettävyyden kykyjä sekä ulkonäön että liikkeen yleistettävyydelle.
- Ulkonäön yleistettävyys: MagicDance-kehys osoittaa erinomaisia kykyjä moninaisten ulkonäköjen luomiseen.
- Liikkeen yleistettävyys: MagicDance-kehys pystyy myös luomaan laajan valikoiman liikkeitä.
MagicDance: Tavoitteet ja Arkkitehtuuri
Annetaan viitekuva, joko todellisesta ihmisestä tai tyylitellystä kuvasta, MagicDance-kehys pyrkii luomaan tulostekuvan tai -videon, joka on ehdollinen syötteestä ja asennon syötteistä {P, F}, joissa P edustaa ihmisen asennon luurankoa ja F edustaa kasvonmaamerkkejä. Luodun tulostekuvan tai -videon tulisi säilyttää ulkonäkö ja identiteetti kyseisistä ihmisistä sekä taustan sisällöt, jotka ovat läsnä viitekuvassa, samalla kun se säilyttää asennon ja ilmeen, jotka määritellään asennon syötteillä.
Arkkitehtuuri
Koulutuksen aikana MagicDance-kehys koulutetaan kehyksenä, jonka tavoitteena on jälleenrakentaa perus totuus viitekuvan ja asennon syötteen avulla, jotka ovat peräisin samasta viitevideosta. Testauksen aikana liikkeen siirtämiseksi asennon syöte ja viitekuva haetaan eri lähteistä.
MagicDance-kehys voidaan jakaa neljään kategoriaan: Alkuvaihe, Ulkonäön ohjaus esikoulutus, Ulkonäköerottuva asennon ohjaus ja Liikkeen moduuli.
Alkuvaihe
Latent Diffusion Models eli LDM edustavat ainutlaatuisesti suunniteltuja diffuusiomalleja, jotka toimivat latenttilaessa, jota mahdollistaa autoenkooderin käyttö, ja Stable Diffusion-kehys on merkittävä esimerkki LDM:stä, joka käyttää vektorigraafista kvantitointia ja variaatiivista autoenkooderia sekä aikaskaalan U-Net-arkkitehtuuri. Stable Diffusion-kehys käyttää CLIP-pohjaista transformeria tekstien koodaamiseen, jolloin tekstisyötteet muunnetaan upotusvektoreiksi. Koulutusvaiheessa Stable Diffusion-kehys altistuu tekstiehtoon ja syötekuvaan, joka sisältää kuvan koodaamisen latenttirepresentaatioon, ja altistaa sen ennalta määriteltyyn diffuusioprosessiin, jota ohjataan gaussilaista menetelmää. Tuloksena oleva jono tuottaa meluisan latenttirepresentaation, joka tarjoaa standardin normaalijakauman, ja Stable Diffusion-kehys pyrkii puhdistamaan meluisat latenttirepresentaatiot iteratiivisesti latenttirepresentaatioihin.
Ulkonäön ohjaus esikoulutus
Yksi suuri ongelma alkuperäisessä ControlNet-kehys on sen kyvyttömyys ohjata ulkonäköä tasaisesti muuttuvien liikkeiden keskuudessa, vaikka se pyrkii luomaan kuvia, joissa on asennot, jotka muistuttavat syötekuvan asentoja, ja yleinen ulkonäkö on vaikuttunut ennen kaikkea tekstisyötteistä. Vaikka tämä menetelmä toimii, se ei sovellu liikkeen siirtämiseen, jossa ei ole tekstisyötteitä, vaan viitekuva, joka toimii ensisijaisena ulkonäön lähteenä.
Ulkonäön ohjaus esikoulutusmoduuli MagicDance-kehys on suunniteltu apulaishaarana, joka tarjoaa ohjausta ulkonäön ohjaukseen kerroksittain. Sen sijaan, että riippuisi tekstisyötteistä, koko moduuli keskittyy hyödyntämään ulkonäön ominaisuuksia viitekuvasta, tavoitteena parantaa kehyksen kykyä luoda ulkonäön ominaisuudet tarkasti, erityisesti tilanteissa, joissa on monimutkaisia liikkeen dynamiikkaa. Lisäksi vain Ulkonäön ohjausmalli on koulutettavissa ulkonäön ohjaus esikoulutuksen aikana.
Ulkonäköerottuva asennon ohjaus
Yksinkertainen ratkaisu asennon ohjaukseen tulostekuvassa on integroida esikoulutettu ControlNet-malli esikoulutetun Ulkonäön ohjausmallin kanssa ilman hienosäätöä. Kuitenkin tämä integraatio voi johtaa kehyksen kamppailuun ulkonäköriippumattoman asennon ohjauksen kanssa, mikä voi johtaa eroon syötteen asentojen ja luotujen asentojen välillä. Tätä eroa vastaan MagicDance-kehys hienosäätää Asennon ohjausverkkoa yhdessä esikoulutetun Ulkonäön ohjausmallin kanssa.
Liikkeen moduuli
Kun ne toimivat yhdessä, Ulkonäköerottuva asennon ohjausverkko ja Ulkonäön ohjausmalli voivat saavuttaa tarkan ja tehokkaan kuvan liikkeen siirtämisen, vaikka se voi johtaa aikaskaalan epäjohdonmukaisuuteen. Varmistamaan aikaskaalan johdonmukaisuuden, kehys integroi lisäksi liikkeen moduulin pääasialliseen Stable Diffusion UNet-arkkitehtuuriin.
MagicDance: Esikoulutus ja Aineistot
Esikoulutuksessa MagicDance-kehys käyttää TikTok-aineistoa, joka koostuu yli 350 tanssivideosta, joissa on yksi henkilö tanssimassa, ja useimmat näistä videoista sisältävät kasvoja ja ylävartaloa. MagicDance-kehys poimii jokaisen videon 30 fps:llä ja suorittaa OpenPosen jokaiselle kehykselle erikseen, jotta voidaan päätellä asennon luuranko, käden asennot ja kasvonmaamerkit.
Esikoulutuksessa ulkonäön ohjausmalli koulutetaan erikseen 64:näytönpuskurilla 8 NVIDIA A100 -näytönohjaimella 10 000 askeleella, 512×512 kuvakoolle, ja sitten hienosäätää yhdessä asennon ohjaus- ja ulkonäön ohjausmallien kanssa 16:näytönpuskurilla 20 000 askeleella. Koulutuksen aikana MagicDance-kehys ottaa satunnaisesti kaksi kehyksen tulostekuvaksi ja viitekuvaksi, ja kuvat leikataan samassa kohdassa ja samalla korkeudella. Arvioinnin aikana malli leikkaa kuvan keskeltä sen sijaan, että leikkaa satunnaisesti.
MagicDance: Tulokset
Kokeelliset tulokset, jotka suoritettiin MagicDance-kehys, on esitetty seuraavassa kuvassa, ja kuten voidaan nähdä, MagicDance-kehys ylittää olemassa olevat kehykset, kuten Disco ja DreamPose, ihmisen liikkeen siirtämisessä kaikilla mittareilla. Kehykset, joissa on “*” etuliitteessä, käyttävät kohdekuva suoraan syötteenä ja sisältävät enemmän tietoa kuin muut kehykset.

On mielenkiintoista huomata, että MagicDance-kehys saavuttaa Face-Cos-pistemäärän 0,426, joka on 156,62%:n parannus Disco-kehys, ja lähes 400%:n lisäys verrattuna DreamPose-kehys. Tulokset osoittavat MagicDance-kehys kyvyn säilyttää identiteettitiedot ja näkyvä parannus osoittaa MagicDance-kehys ylivoimaisuuden verrattuna olemassa oleviin valmiisiin menetelmiin.
Seuraavat kuvat vertailevat ihmisen videoiden laatua MagicDance, Disco ja TPS -kehyksien välillä. Kuten voidaan nähdä, tulokset, jotka on luotu GT, Disco ja TPS -kehyksillä, kärsivät epäjohdonmukaisista ihmisen asennoista ja kasvonilmeistä.

Lisäksi seuraava kuva osoittaa kasvonilmeiden ja ihmisen asennon siirtämisen visualisoinnin TikTok-aineistolla, ja MagicDance-kehys pystyy luomaan realistisia ja eläviä ilmeitä ja liikkeitä moninaisten kasvonmaamerkkien ja asennon syötteiden alaisena, samalla kun se säilyttää identiteettitiedot viitekuvasta.

On huomionarvoista, että MagicDance-kehys osoittaa poikkeuksellisia yleistettävyyden kykyjä myös ulkopuolisille viitekuville, joissa on näkemättömiä asentoja ja tyylejä, vaikka se tarjoaa vaikuttavan ulkonäön ohjauksen ilman lisäkoulutusta kohdealueella, ja tulokset on esitetty seuraavassa kuvassa.

Seuraavat kuvat osoittavat MagicDance-kehys visualisointikykyjä kasvonilmeiden siirtämisessä ja nollaliikkeessä. Kuten voidaan nähdä, MagicDance-kehys yleistyy luonnollisesti luonnonolosuhteisiin ihmisen liikkeisiin.

MagicDance: Rajoitukset
OpenPose on tärkeä osa MagicDance-kehys, sillä se vaikuttaa merkittävästi asennon ohjaukseen ja vaikuttaa luotujen kuvien laatuun ja aikaskaalan johdonmukaisuuteen. Kuitenkin MagicDance-kehys kärsii edelleen haasteista kasvonmaamerkkien ja asennon luurangon havaitsemisessa tarkasti, erityisesti kun kuvissa on osittain näkymättömiä objekteja tai nopeita liikkeitä. Nämä ongelmat voivat johtaa virheisiin luoduissa kuvissa.
Johtopäätös
Tässä artikkelissa olemme keskustelleet MagicDance-kehys, joka on diffuusiopohjainen malli, joka pyrkii vallankumoukseen ihmisen liikkeen siirtämisessä. MagicDance-kehys pyrkii siirtämään 2D-ihmisen kasvonilmeitä ja liikkeitä haastaviin ihmisen tanssivideoihin, tavoitteena luoda uusia asennepohjaisia tanssivideoita tietyille kohdehenkilöille säilyttäen identiteetin muuttumattomana. MagicDance-kehys on kaksivaiheinen koulutusstrategia, joka keskittyy ihmisen liikkeen erotteluun ja ulkonäkötekijöihin, kuten ihonväriin, kasvonilmeisiin ja vaatetukseen.
MagicDance on uusi lähestymistapa realistisen ihmisen videoiden luomiseen, joka sisältää kasvonilmeiden ja liikkeen siirtämisen, ja mahdollistaa johdonmukaisen animaation luonnollisissa olosuhteissa ilman lisäkoulutusta, osoittaen merkittävän edistysaskeleen verrattuna olemassa oleviin menetelmiin. Lisäksi MagicDance-kehys osoittaa poikkeuksellisia yleistettävyyden kykyjä monimutkaisiin liikkeisiin ja moninaisiin ihmisen identiteetteihin, asettamalla MagicDance-kehys johtoasemaan tekoälyavusteisen liikkeen siirtämisen ja videoiden luomisen alalla.












