AI-modeller og plattformer
MagicDance: Realistisk menneskelig dans video-generering
Datamaskinsyn er ett av de mest diskuterte feltene i AI-industrien, takket være dets potensielle anvendelser over et bredt spekter av sanntidsoppgaver. I de senere årene har datamaskinsynsrammeverkene utviklet seg raskt, og moderne modeller er nå i stand til å analysere ansiktstrekk, objekter og mye mer i sanntids-scenarier. Til tross for disse evnene, er overføring av menneskelig bevegelse fortsatt en formidabel utfordring for datamaskinsynsmodeller. Dette oppdrag innebærer å retargetere ansikts- og kroppbevegelser fra en kildebilde eller -video til en målbilde eller -video. Overføring av menneskelig bevegelse brukes bredt i datamaskinsynsmodeller for styling av bilder eller videoer, redigering av multimediainnhold, digital menneskesyntese og selv generering av data for persepsjonsbaserte rammeverk.
I denne artikkelen fokuserer vi på MagicDance, et diffusjonsbasert modell designet for å revolusjonere overføring av menneskelig bevegelse. MagicDance-rammeverket har som mål å overføre 2D menneskelig ansiktsuttrykk og bevegelser på utfordrende menneskelig dansvideoer. Målet er å generere nye posesequens-drevne dansvideoer for bestemte målidentiteter samtidig som man beholder den opprinnelige identiteten. MagicDance-rammeverket bruker en to-trinns treningsstrategi, med fokus på menneskelig bevegelsesdisentanglement og utseendefaktorer som hudtone, ansiktsuttrykk og klær. Vi skal dykke ned i MagicDance-rammeverket, og utforske dets arkitektur, funksjonalitet og ytelse sammenlignet med andre state-of-the-art menneskelig bevegelsesoverføringsrammeverk. La oss dykke inn.
MagicDance: Realistisk menneskelig bevegelsesoverføring
Som nevnt tidligere, er overføring av menneskelig bevegelse en av de mest komplekse datamaskinsynsoppgavene på grunn av den enorme kompleksiteten involvert i å overføre menneskelig bevegelse og uttrykk fra kildebildet eller -videoen til målbildet eller -videoen. Tradisjonelt har datamaskinsynsrammeverk oppnådd overføring av menneskelig bevegelse ved å trene en oppgave-spesifikk generativ modell, inkludert GAN eller Generative Adversarial Networks på måldatasett for ansiktsuttrykk og kroppspose. Selv om trening og bruk av generative modeller leverer tilfredsstillende resultater i noen tilfeller, lider de ofte under to store begrensninger.
- De er avhengige av en bildeforvrengingskomponent, som et resultat av at de ofte sliter med å interpolere kroppsdeler som er usynlige i kildebildet, enten på grunn av en endring i perspektiv eller selv-occlusion.
- De kan ikke generalisere til andre bilder som er hentet eksternt, noe som begrenser deres anvendelser, spesielt i sanntids-scenarier i villmarken.

Moderne diffusjonsmodeller har demonstrert unike bildegenereringskapasiteter over forskjellige forhold, og diffusjonsmodeller er nå i stand til å presentere kraftfulle visuelle effekter på en rekke nedstrømsoppgaver, som video-generering og bilde-innmaling, ved å lære fra web-skala billedatasett. Takket være deres evner, kan diffusjonsmodeller være et ideelt valg for overføring av menneskelig bevegelse.
For å overvinne hindrene som møtes av diffusjons- og GAN-baserte rammeverk på overføring av menneskelig bevegelse, har utviklere introdusert MagicDance, et nytt rammeverk som har som mål å utnytte potensialet i diffusjonsrammeverk for overføring av menneskelig bevegelse, og demonstrere en utenkelig nivå av identitetsbevaring, overlegen visuell kvalitet og domæne-generaliserbarhet. I kjernen av MagicDance-rammeverket ligger det fundamentale konseptet å splitte problemet i to trinn: utseendekontroll og bevegelseskontroll, to evner som kreves av bilde-diffusjonsrammeverk for å levere nøyaktige bevegelsesoverføringsutdata.

Figuren ovenfor gir en kort oversikt over MagicDance-rammeverket, og som det kan ses, bruker rammeverket Stable Diffusion-modellen, og også deployer to ekstra komponenter: Utseendekontrollmodell og PoskontrollNett, hvor den førstnevnte gir utseendeguiding til SD-modellen fra en referansebilde via oppmerksomhet, mens den sistnevnte gir uttrykk-/poseguiding til diffusjonsmodellen fra en betinget bilde eller video. Rammeverket bruker også en multi-trinns treningsstrategi for å lære disse undermodulene effektivt for å disentangle posekontroll og utseende.
I sammenfatting er MagicDance-rammeverket
- Et nytt og effektivt rammeverk bestående av utseende-disentangert posekontroll og utseendekontroll-forhåndstrening.
- MagicDance-rammeverket er i stand til å generere realistiske menneskelige ansiktsuttrykk og menneskelig bevegelse under kontroll av pose-betingede inndata og referansebilder eller videoer.
- MagicDance-rammeverket har som mål å generere utseende-konsistent menneskelig innhold ved å introdusere en Multi-Source Attention Module som tilbyr nøyaktig veiledning for Stable Diffusion UNet-rammeverket.
- MagicDance-rammeverket kan også brukes som en praktisk utvidelse eller plug-in for Stable Diffusion-rammeverket, og sikrer kompatibilitet med eksisterende modellvekt uten å kreve ytterligere finjustering av parameterne.
I tillegg viser MagicDance-rammeverket unike generaliseringskapasiteter for både utseende og bevegelse.
- Utseendegeneralisering: MagicDance-rammeverket demonstrerer overlegen kapasitet når det kommer til å generere diverse utseender.
- Bevegelsesgeneralisering: MagicDance-rammeverket har også evnen til å generere en rekke bevegelser.
MagicDance: Mål og Arkitektur
For et gitt referansebilde, enten av en ekte person eller en stilisert bilde, er det primære målet for MagicDance-rammeverket å generere en utgangsbilde eller en utgangsvideo betinget av inndata og pose-inndata {P, F}, hvor P representerer menneskelig pose-skelett og F representerer ansiktslandemerker. Den genererte utgangsbildet eller -videoen skal kunne bevare utseendet og identiteten til de menneskene som er involvert, samt bakgrunnsinnholdene i referansebilden, mens den beholder posen og uttrykkene definert av pose-inndata.
Arkitektur
Under trening er MagicDance-rammeverket trenet som en ramme-rekonstruksjonsoppgave for å rekonstruere grunn-sannheten med referansebilde og pose-inndata hentet fra samme referansevideo. Under testing for å oppnå bevegelsesoverføring, er pose-inndata og referansebilde hentet fra forskjellige kilder.
Den totale arkitekturen til MagicDance-rammeverket kan deles inn i fire kategorier: Forhåndstrinn, Utseendekontroll-forhåndstrening, Utseende-disentangert Posekontroll og Bevegelsesmodul.
Forhåndstrinn
Latente Diffusjonsmodeller eller LDM representerer unikt designet diffusjonsmodeller for å operere innenfor det latente rommet, muliggjort av bruk av en autoencoder, og Stable Diffusion-rammeverket er et bemerkelsesverdig eksempel på LDM som bruker en Vektor-kvantifisert-Variasjonell AutoEncoder og temporal U-Net-arkitektur. Stable Diffusion-modellen bruker en CLIP-basert transformer som en tekst-encoder for å prosessere tekst-inndata ved å konvertere tekst-inndata til innlegg.
Utseendekontroll-forhåndstrening
Et større problem med det opprinnelige ControlNet-rammeverket er dets evne til å kontrollere utseendet blant romlig varierte bevegelser konsistent, selv om det tenderer til å generere bilder med poser som ligner på de i inndata-bildet, med det totale utseendet som påvirkes hovedsakelig av tekst-inndata. Selv om denne metoden fungerer, er den ikke egnet for bevegelsesoverføring som involverer oppgaver hvor det ikke er tekst-inndata, men referansebilde som tjener som primær kilde for utseende-informasjon.
Utseendekontroll-forhåndstrening-modulen i MagicDance-rammeverket er designet som en hjelpegren for å gi veiledning for utseendekontroll i en lag-for-lag-tilnærming. I stedet for å avhenge av tekst-inndata, fokuserer den totale modulen på å utnytte utseende-attributtene fra referansebilde med målet å forbedre rammeverkets evne til å generere utseende-karakteristika nøyaktig, spesielt i scenarier som involverer komplekse bevegelses-dynamikk.
Utseende-disentangert Posekontroll
En naiv løsning for å kontrollere posen i utgangsbildet er å integrere det forhåndstrente ControlNet-modellen med det forhåndstrente Utseendekontroll-modellen direkte uten finjustering. Imidlertid kan integreringen resultere i at rammeverket sliter med utseende-uavhengig posekontroll, som kan føre til en diskrepans mellom inndata-poser og genererte poser. For å håndtere denne diskrepansen, finjusterer MagicDance-rammeverket PosekontrollNett-modellen sammen med det forhåndstrente Utseendekontroll-modellen.
Bevegelsesmodul
Når de arbeider sammen, kan Utseende-disentangert PosekontrollNett og Utseendekontroll-modellen oppnå nøyaktig og effektiv bilde-til-bevegelses-overføring, selv om det kan resultere i tidsmessig inkonsistens. For å sikre tidsmessig konsistens, integrerer rammeverket en ekstra bevegelsesmodul i den primære Stable Diffusion UNet-arkitekturen.
MagicDance: Forhåndstrening og Datasett
For forhåndstrening, bruker MagicDance-rammeverket et TikTok-datasett som består av over 350 dans-videoer av varierende lengder mellom 10 og 15 sekunder, som fanger en enkelt person som danser, og hvor de fleste av disse videoene inneholder ansiktet og den øvre delen av kroppen. MagicDance-rammeverket trekker ut hver enkelt video med 30 FPS og kjører OpenPose på hver enkelt ramme for å inferere pose-skelettet, hånd-poser og ansiktslandemerker.
For forhåndstrening, er utseendekontroll-modellen forhåndstrengt med en batch-størrelse på 64 på 8 NVIDIA A100-GPU-er for 10 000 trinn med en bilde-størrelse på 512 x 512, etterfulgt av å finjustere posekontroll- og utseendekontroll-modellene sammen med en batch-størrelse på 16 for 20 000 trinn. Under trening, sampler MagicDance-rammeverket tilfeldig to rammene som mål og referanse, med bildene som blir klippet på samme posisjon langs samme høyde. Under evaluering, kutter modellen bildet sentralt i stedet for å kutte dem tilfeldig.
MagicDance: Resultater
De eksperimentelle resultater som er gjennomført på MagicDance-rammeverket, er demonstrert i følgende bilde, og som det kan ses, overgår MagicDance-rammeverket eksisterende rammeverk som Disco og DreamPose for menneskelig bevegelsesoverføring over alle metrikkene. Rammeverk som består av en “*” foran navnet, bruker målbildet direkte som inndata og inkluderer mer informasjon sammenlignet med andre rammeverk.

Det er interessant å merke seg at MagicDance-rammeverket oppnår en Face-Cos-poengsum på 0,426, en forbedring på 156,62% over Disco-rammeverket, og nesten 400% økning sammenlignet med DreamPose-rammeverket. Resultatene indikerer den robuste kapasiteten til MagicDance-rammeverket til å bevare identitetsinformasjon, og den synlige forbedringen i ytelse indikerer overlegenheten til MagicDance-rammeverket over eksisterende state-of-the-art-metoder.
Følgende figurer sammenligner kvaliteten på menneskelig video-generering mellom MagicDance-, Disco- og TPS-rammeverkene. Som det kan observeres, lider resultater generert av GT-, Disco- og TPS-rammeverkene under inkonsistente menneskelige pose-identiteter og ansiktsuttrykk.

Videre demonstrerer følgende bilde visualiseringen av ansiktsuttrykk og menneskelig pose-overføring på TikTok-datasettet, og MagicDance-rammeverket er i stand til å generere realistiske og levende uttrykk og bevegelser under diverse ansiktslandemerker og pose-skelett-inndata, samtidig som det nøyaktig beholder identitetsinformasjon fra referanse-inndata-bildet.

Det er verdt å merke seg at MagicDance-rammeverket har unike generaliseringskapasiteter til utenfor-domæne-referansebilder av usette poser og stiler, med imponerende utseende-kontroll selv uten noen ytterligere finjustering på måldommen, og resultatene er demonstrert i følgende bilde.

Følgende bilder demonstrerer visualiseringskapasitetene til MagicDance-rammeverket i forhold til ansiktsuttrykk-overføring og null-skudd-menneskelig-bevegelse. Som det kan ses, generaliserer MagicDance-rammeverket til sanntids-menneskelig-bevegelse perfekt.

MagicDance: Begrensninger
OpenPose er en essensiell komponent i MagicDance-rammeverket, da det spiller en kritisk rolle for pose-kontroll, og påvirker kvaliteten og tidsmessige konsistensen til de genererte bildene betydelig. Imidlertid finner MagicDance-rammeverket det fortsatt en utfordring å detektere ansiktslandemerker og pose-skelett nøyaktig, spesielt når objektene i bildene er delvis synlige eller viser rask bevegelse. Disse problemene kan resultere i feil i de genererte bildene.
Konklusjon
I denne artikkelen har vi talt om MagicDance, et diffusjonsbasert modell som har som mål å revolusjonere menneskelig bevegelsesoverføring. MagicDance-rammeverket prøver å overføre 2D menneskelig ansiktsuttrykk og bevegelser på utfordrende menneskelig dansvideoer, med det spesifikke målet å generere nye posesequens-drevne menneskelig dansvideoer for bestemte mål-identiteter, samtidig som det beholder identiteten konstant. MagicDance-rammeverket er en to-trinns treningsstrategi for menneskelig bevegelses-disentanglement og utseende som hudtone, ansiktsuttrykk og klær.
MagicDance er en ny tilnærming for å muliggjøre realistisk menneskelig video-generering ved å inkorporere ansikts- og bevegelses-uttrykk-overføring, og å muliggjøre konsistent i sanntiden animasjons-generering uten å kreve noen ytterligere finjustering, og demonstrerer betydelig fremgang over eksisterende metoder. Videre demonstrerer MagicDance-rammeverket unike generaliseringskapasiteter over komplekse bevegelses-sekvenser og diverse menneskelig identiteter, og etablerer MagicDance-rammeverket som ledende i feltet for AI-assistert bevegelsesoverføring og video-generering.












