AI-modeller och plattformar
MagicDance: Realistisk Mänsklig Dansvideo Generering
Datorseende är ett av de mest diskuterade områdena inom AI-branschen, tack vare dess potential tillämpningar över en bred range av realtidsuppgifter. Under de senaste åren har datorseende-ramverk utvecklats snabbt, med moderna modeller som nu kan analysera ansiktsdrag, objekt och mycket mer i realtids-scenarier. Trots dessa förmågor kvarstår mänsklig rörelseöverföring som en formidabel utmaning för datorseende-modeller. Denna uppgift innebär att omriktning av ansikts- och kroppsrörelser från en källbild eller video till en målbild eller video. Mänsklig rörelseöverföring används i stor utsträckning i datorseende-modeller för att styla bilder eller videor, redigera multimediainnehåll, digital mänsklig syntes och till och med generera data för perceptions-baserade ramverk.
I den här artikeln fokuserar vi på MagicDance, ett diffusions-baserat modell som är utformat för att revolutionera mänsklig rörelseöverföring. MagicDance-ramverket syftar specifikt till att överföra 2D-mänskliga ansiktsuttryck och rörelser till utmanande mänskliga dansvideor. Dess mål är att generera nya pose-sekvens-styrda dansvideor för specifika mål-identiteter samtidigt som den ursprungliga identiteten behålls. MagicDance-ramverket använder en två-stegs utbildningsstrategi, med fokus på mänsklig rörelse-disentanglement och utseende-faktorer som hudton, ansiktsuttryck och kläder. Vi kommer att dyka in i MagicDance-ramverket, utforska dess arkitektur, funktionalitet och prestanda i jämförelse med andra state-of-the-art mänskliga rörelseöverförings-ramverk. Låt oss dyka in.
MagicDance: Realistisk Mänsklig Rörelseöverföring
Som nämnts tidigare är mänsklig rörelseöverföring en av de mest komplexa datorseende-uppgifterna på grund av den renodlade komplexiteten som är involverad i att överföra mänskliga rörelser och uttryck från källbilden eller videon till målbilden eller videon. Traditionellt har datorseende-ramverk uppnått mänsklig rörelseöverföring genom att träna en uppgiftsspecifik generativ modell, inklusive GAN eller Generative Adversarial Networks på mål-datasets för ansiktsuttryck och kroppspose. Även om träning och användning av generativa modeller ger tillfredsställande resultat i vissa fall, lider de vanligtvis av två stora begränsningar.
- De förlitar sig tungt på en bild-omvandlingskomponent, vilket resulterar i att de ofta kämpar för att interpolera kroppsdelar som är osynliga i källbilden, antingen på grund av en förändring i perspektiv eller själv-occlusion.
- De kan inte generalisera till andra bilder som hämtas externt, vilket begränsar deras tillämpningar, särskilt i realtids-scenarier i vildmarken.

Modern diffusionsmodell har demonstrerat exceptionella bildgenereringsförmågor över olika förhållanden, och diffusionsmodeller kan nu presentera kraftfulla visuella effekter på en mängd nedströmsuppgifter, såsom video-generering och bild-inpainting, genom att lära sig från web-skala-bild-datasets. På grund av deras förmågor kan diffusionsmodeller vara ett idealiskt val för mänsklig rörelseöverföringsuppgifter. Även om diffusionsmodeller kan implementeras för mänsklig rörelseöverföring, har de vissa begränsningar, antingen i termer av den genererade innehållets kvalitet eller i termer av identitetsskydd eller lider av temporala inkonsekvenser på grund av modell-design- och utbildningsstrategi-begränsningar. Dessutom visar diffusions-baserade modeller ingen signifikant fördel över GAN-ramverk i termer av generaliserbarhet.
För att övervinna de hinder som möter diffusions- och GAN-baserade ramverk för mänsklig rörelseöverföringsuppgifter, har utvecklare introducerat MagicDance, ett nytt ramverk som syftar till att utnyttja potentialen i diffusions-ramverk för mänsklig rörelseöverföring, med en utanförordentlig nivå av identitetsskydd, överlägsen visuell kvalitet och domän-generaliserbarhet. I sin kärna är den grundläggande konceptet i MagicDance-ramverket att dela upp problemet i två stadier: utseende-kontroll och rörelse-kontroll, två förmågor som krävs av bild-diffusions-ramverk för att leverera precisa rörelseöverföringsutdata.

Ovanstående figur ger en kort översikt över MagicDance-ramverket, och som det kan ses, använder ramverket Stable Diffusion-modellen och också distribuerar två ytterligare komponenter: Utseende-kontroll-modell och Pose-kontroll-Net, där den förra ger utseende-vägledning till SD-modellen från en referensbild via uppmärksamhet, medan den senare ger uttryck/pose-vägledning till diffusions-modellen från en villkorad bild eller video. Ramverket använder också en multi-stegs utbildningsstrategi för att lära dessa sub-moduler effektivt för att disentangla pose-kontroll och utseende.
Sammanfattningsvis är MagicDance-ramverket ett
- Nytt och effektivt ramverk bestående av utseende-disentangled pose-kontroll och utseende-kontroll-förträning.
- MagicDance-ramverket är kapabelt att generera realistiska mänskliga ansiktsuttryck och mänsklig rörelse under kontroll av pose-villkor-inmatningar och referensbilder eller videor.
- MagicDance-ramverket syftar till att generera utseende-konsistent mänskligt innehåll genom att introducera en Multi-Source Attention Module som erbjuder exakt vägledning för Stable Diffusion UNet-ramverket.
- MagicDance-ramverket kan också användas som en bekväm utvidgning eller plugin för Stable Diffusion-ramverket och säkerställer kompatibilitet med befintliga modell-vikter eftersom det inte kräver ytterligare finjustering av parametrarna.
Dessutom visar MagicDance-ramverket exceptionella generaliseringsförmågor för både utseende och rörelse.
- Utseende-generalisering: MagicDance-ramverket visar överlägsna förmågor när det gäller att generera olika utseenden.
- Rörelse-generalisering: MagicDance-ramverket har också förmågan att generera en stor mängd rörelser.
MagicDance: Mål och Arkitektur
För en given referensbild, antingen av en verklig människa eller en stiliserad bild, är det primära målet för MagicDance-ramverket att generera en utgångsbild eller en utgångs-video som är villkorad på inmatningen och pose-inmatningarna {P, F}, där P representerar mänsklig pose-skelett och F representerar ansikts-landmärken. Den genererade utgångsbilden eller videon ska kunna bevara utseendet och identiteten hos de människor som är inblandade, tillsammans med bakgrunds-innehållet i referensbilden, medan den behåller posen och uttrycken som definieras av pose-inmatningarna.
Arkitektur
Under utbildning är MagicDance-ramverket utbildat som en ram-rekonstruktionsuppgift för att rekonstruera grund-sanningen med referensbilden och pose-inmatningen som hämtas från samma referens-video. Under testning för att uppnå rörelseöverföring, är pose-inmatningen och referensbilden hämtade från olika källor.
Den övergripande arkitekturen för MagicDance-ramverket kan delas in i fyra kategorier: Preliminär fas, Utseende-kontroll-förträning, Utseende-disentangled Pose-kontroll och Rörelse-modul.
Preliminär Fas
Latent Diffusionsmodeller eller LDM representerar unikt utformade diffusionsmodeller för att operera inom det latenta utrymmet som möjliggörs av användningen av en autoencoder, och Stable Diffusion-ramverket är ett notabelt exempel på LDM som använder en Vector Quantized-Variational AutoEncoder och temporal U-Net-arkitektur. Stable Diffusion-modellen använder en CLIP-baserad transformer som en text-encoder för att bearbeta text-inmatningar genom att konvertera text-inmatningar till inbäddningar. Utbildningsfasen för Stable Diffusion-ramverket utsätter modellen för en text-villkor och en inmatningsbild, med processen som innefattar kodning av bilden till en latent representation, och utsätter den för en fördefinierad sekvens av diffusions-steg som styrs av en Gaussisk metod. Den resulterande sekvensen ger en bullrig latent representation som ger en standard normalfördelning, med det primära lärandemålet för Stable Diffusion-ramverket som är att rena den bullriga latent representationen iterativt till latent representationer.
Utseende-kontroll-förträning
Ett stort problem med det ursprungliga ControlNet-ramverket är dess oförmåga att kontrollera utseendet bland spatialt varierande rörelser konsekvent, även om det tenderar att generera bilder med poser som liknar dem i inmatningsbilden, med det övergripande utseendet som påverkas främst av text-inmatningar. Även om denna metod fungerar, är den inte lämplig för rörelseöverföringsuppgifter som involverar uppgifter där det inte är text-inmatningarna utan referensbilden som tjänar som den primära källan för utseende-information.
Utseende-kontroll-förträning-modulen i MagicDance-ramverket är utformad som en hjälp-gren för att ge vägledning för utseende-kontroll i en lager-för-lager-ansats. Istället för att förlita sig på text-inmatningar, fokuserar den övergripande modulen på att utnyttja utseende-attribut från referensbilden med målet att förbättra ramverkets förmåga att generera utseende-karaktäristika exakt, särskilt i scenarier som involverar komplexa rörelse-dynamik. Dessutom är det bara Utseende-kontroll-modellen som är utbildningsbar under utseende-kontroll-förträning.
Utseende-disentangled Pose-kontroll
En naiv lösning för att kontrollera posen i utgångsbilden är att integrera det förtränade ControlNet-modellen med det förtränade Utseende-kontroll-modellen direkt utan finjustering. Men integrationen kan resultera i att ramverket kämpar med utseende-oberoende pose-kontroll, vilket kan leda till en diskrepans mellan inmatnings-poser och genererade poser. För att hantera denna diskrepans, finjusterar MagicDance-ramverket Pose-kontroll-Net-modellen tillsammans med det förtränade Utseende-kontroll-modellen.
Rörelse-modul
När de arbetar tillsammans, kan Utseende-disentangled Pose-kontroll-Net och Utseende-kontroll-modellen uppnå exakt och effektiv bild-till-rörelse-överföring, även om det kan resultera i temporalt inkonsekvens. För att säkerställa temporalt inkonsekvens, integrerar ramverket en ytterligare rörelse-modul i den primära Stable Diffusion UNet-arkitekturen.
MagicDance: Förträning och Datasets
För förträning, använder MagicDance-ramverket ett TikTok-dataset som består av över 350 dans-videor av varierande längd mellan 10 till 15 sekunder som fångar en person som dansar, med en majoritet av dessa videor som innehåller ansiktet och den övre kroppen av människan. MagicDance-ramverket extraherar varje enskild video vid 30 FPS och kör OpenPose på varje ram för att inferera pose-skelettet, hand-pose och ansikts-landmärken.
För förträning, är utseende-kontroll-modellen förtränad med en batch-storlek på 64 på 8 NVIDIA A100 GPU:er för 10 000 steg med en bild-storlek på 512 x 512, följt av att finjustera pose-kontroll- och utseende-kontroll-modellerna tillsammans med en batch-storlek på 16 för 20 000 steg. Under utbildning, sampar MagicDance-ramverket slumpmässigt två ramar som mål och referens, med bilderna som beskärs på samma position längs samma höjd. Under utvärdering, beskär modellen bilden centralt istället för att beskära den slumpmässigt.
MagicDance: Resultat
De experimentella resultaten som utfördes på MagicDance-ramverket visas i följande bild, och som det kan ses, överträffar MagicDance-ramverket befintliga ramverk som Disco och DreamPose för mänsklig rörelseöverföring över alla metriker. Ramverk som består av en “*” framför namnet använder målbilden direkt som inmatning och innehåller mer information jämfört med andra ramverk.

Det är intressant att notera att MagicDance-ramverket uppnår en Face-Cos-poäng på 0,426, en förbättring på 156,62% över Disco-ramverket och nästan 400% ökning jämfört med DreamPose-ramverket. Resultaten indikerar den robusta kapaciteten hos MagicDance-ramverket att bevara identitetsinformation och den synliga förbättringen i prestanda indikerar överlägsenheten hos MagicDance-ramverket över befintliga state-of-the-art-metoder.
Följande figurer jämför kvaliteten på mänsklig video-generering mellan MagicDance-, Disco- och TPS-ramverken. Som det kan ses, lider resultaten som genereras av GT-, Disco- och TPS-ramverken av inkonsekventa mänskliga pose-identiteter och ansiktsuttryck.

Dessutom visar följande bild visualiseringen av ansiktsuttryck och mänsklig pose-överföring på TikTok-dataset med MagicDance-ramverket som kan generera realistiska och livfulla uttryck och rörelser under olika ansikts-landmärken och pose-skelett-inmatningar, medan den exakt bevarar identitetsinformation från referens-inmatningsbilden.

Det är värt att notera att MagicDance-ramverket har exceptionella generaliseringsförmågor till utom-domän-referensbilder av osedda poser och stilar, med imponerande utseende-kontrollbarhet, även utan någon ytterligare finjustering på mål-domänen, med resultaten som visas i följande bild.

Följande bilder visar visualiseringsförmågorna hos MagicDance-ramverket i termer av ansiktsuttryck-överföring och noll-skott-mänsklig rörelse. Som det kan ses, generaliserar MagicDance-ramverket till vilda mänskliga rörelser perfekt.

MagicDance: Begränsningar
OpenPose är en avgörande komponent i MagicDance-ramverket, eftersom det spelar en avgörande roll för pose-kontroll, som påverkar kvaliteten och den temporala konsekvensen hos de genererade bilderna betydligt. Men MagicDance-ramverket har fortfarande svårt att upptäcka ansikts-landmärken och pose-skelett exakt, särskilt när objekten i bilderna är delvis synliga eller visar snabb rörelse. Dessa problem kan resultera i artefakter i den genererade bilden.
Slutsats
I den här artikeln har vi talat om MagicDance, ett diffusions-baserat modell som syftar till att revolutionera mänsklig rörelseöverföring. MagicDance-ramverket försöker överföra 2D-mänskliga ansiktsuttryck och rörelser på utmanande mänskliga dans-videor, med det specifika målet att generera nya pose-sekvens-styrda mänskliga dans-videor för specifika mål-identiteter, medan den ursprungliga identiteten behålls. MagicDance-ramverket är en två-stegs utbildningsstrategi för mänsklig rörelse-disentanglement och utseende, som hudton, ansiktsuttryck och kläder.
MagicDance är en ny approach för att underlätta realistisk mänsklig video-generering genom att inkorporera ansikts- och rörelse-uttryck, och möjliggör konsekvent vilda animations-generering utan att behöva någon ytterligare finjustering, vilket visar en signifikant förbättring över befintliga metoder. Dessutom visar MagicDance-ramverket exceptionella generaliseringsförmågor över komplexa rörelse-sekvenser och olika mänskliga identiteter, vilket etablerar MagicDance-ramverket som ledande i fältet för AI-assisterad rörelseöverföring och video-generering.












