AI-modeller og platforme

MagicDance: Realistisk menneskelig dansvideo-generering

mm
Føj Unite.AI til dine foretrukne kilder på Google

Computer vision er et af de mest diskuterede områder i AI-industrien, takket være dets potentielle anvendelser på tværs af en bred vifte af reelle opgaver. I de seneste år er computer vision-rammerne fremrykket hurtigt, og moderne modeller kan nu analysere ansigtsfunktioner, objekter og meget mere i realtidsscenarioer. Trods disse evner er menneskelig bevægelsesoverføring stadig en formidabel udfordring for computer vision-modeller. Dette indebærer at retargetere ansigts- og kropsbevægelser fra en kildebillede eller video til en målbillede eller video. Menneskelig bevægelsesoverføring bruges bredt i computer vision-modeller til styling af billeder eller videoer, redigering af multimedieindhold, digital menneskesyntese og selv generering af data til perception-baserede rammer.

I denne artikel fokuserer vi på MagicDance, en diffusion-baseret model designet til at revolutionere menneskelig bevægelsesoverføring. MagicDance-rammen sigter specifikt på at overføre 2D-menneskelige ansigtsudtryk og bevægelser på udfordrende menneskelige dansevideoer. Dens mål er at generere nye pose-sekvens-drevne dansevideoer for bestemte målidentiteter, mens den opretholder den oprindelige identitet. MagicDance-rammen anvender en to-trins træningsstrategi, der fokuserer på menneskelig bevægelsesdisentanglement og udseendefaktorer som hudtone, ansigtsudtryk og tøj. Vi vil dykke ned i MagicDance-rammen, hvor vi udforsker dens arkitektur, funktionalitet og præstation i forhold til andre state-of-the-art menneskelig bevægelsesoverføring-rammer. Lad os dykke ned.

MagicDance: Realistisk menneskelig bevægelsesoverføring

Som nævnt tidligere er menneskelig bevægelsesoverføring en af de mest komplekse computer vision-opgaver på grund af den enorme kompleksitet, der er involveret i at overføre menneskelig bevægelse og udtryk fra kildebilledet eller videoen til målbilledet eller videoen. Traditionelt har computer vision-rammer opnået menneskelig bevægelsesoverføring ved at træne en opgave-specifik generativ model, herunder GAN eller Generative Adversarial Networks på mål-datasets for ansigtsudtryk og kropsposer. Selvom træning og brug af generative modeller leverer tilfredsstillende resultater i nogle tilfælde, lider de ofte under to store begrænsninger.

  1. De afhænger stærkt af en billedforvridningskomponent, som følge heraf ofte kæmper med at interpolere kropsdele, der er usynlige i kildebilledet, enten på grund af en ændring i perspektiv eller selv-occlusion.
  2. De kan ikke generalisere til andre billeder, der er hentet eksternt, hvilket begrænser deres anvendelser, især i realtidsscenarioer i det vilde.

Moderne diffusion-modeller har demonstreret exceptionelle billedgenereringskapaciteter på tværs af forskellige forhold, og diffusion-modeller kan nu præsentere kraftfulde visuelle billeder på en række downstream-opgaver, såsom video-generering og billed-indpaining ved at lære fra web-skala billed-sæt. Takket være deres evner kan diffusion-modeller være et ideelt valg til menneskelig bevægelsesoverføring-opgaver. Selvom diffusion-modeller kan implementeres til menneskelig bevægelsesoverføring, har de dog nogle begrænsninger, enten i form af kvaliteten af det genererede indhold, eller i form af identitetsbevarelse eller lider under temporale inkonsistenser som følge af model-design og træningsstrategi-begrænsninger. Desuden demonstrerer diffusion-baserede modeller ingen signifikant fordel over GAN-rammer i forhold til generaliserbarhed.

For at overvinde de udfordringer, som diffusion- og GAN-baserede rammer står over for i menneskelig bevægelsesoverføring-opgaver, har udviklere introduceret MagicDance, en ny ramme, der søger at udnytte diffusion-rammernes potentiale til menneskelig bevægelsesoverføring, og demonstrerer en udenforliggende niveau af identitetsbevarelse, overlegen visuel kvalitet og domæne-generaliserbarhed. I dens kerne er den grundlæggende koncept MagicDance-rammen at splitte problemet i to faser: udseende-kontrol og bevægelses-kontrol, to evner, der kræves af billed-diffusion-rammer for at levere præcise bevægelsesoverføring-udgang.

Figuren ovenfor giver en kort oversigt over MagicDance-rammen, og som det kan ses, anvender rammen Stable Diffusion-modellen, og deployer også to yderligere komponenter: Udseende-Kontrol-Modellen og Pose-Kontrol-Nettet, hvor den første giver udseende-vejledning til SD-modellen fra en reference-billede via opmærksomhed, mens den sidste giver udtryk/pose-vejledning til diffusion-modellen fra en betinget billede eller video. Rammen anvender også en multi-trins træningsstrategi for at lære disse under-moduler effektivt for at disentanglere pose-kontrol og udseende.

Samlet set er MagicDance-rammen en

  1. Ny og effektiv ramme bestående af udseende-disentangleret pose-kontrol og udseende-kontrol-fortræning.
  2. MagicDance-rammen er i stand til at generere realistiske menneskelige ansigtsudtryk og menneskelig bevægelse under kontrollen af pose-betingede indgange og reference-billeder eller videoer.
  3. MagicDance-rammen sigter på at generere udseende-konsistent menneskeligt indhold ved at introducere en Multi-Source-Attention-Modul, der tilbyder præcis vejledning for Stable Diffusion UNet-rammen.
  4. MagicDance-rammen kan også anvendes som en praktisk udvidelse eller plug-in til Stable Diffusion-rammen, og sikrer kompatibilitet med eksisterende model-vejninger, da den ikke kræver yderligere finjustering af parametrene.

Desuden viser MagicDance-rammen exceptionelle generaliseringskapaciteter for både udseende- og bevægelses-generalisering.

  1. Udseende-Generalisering: MagicDance-rammen demonstrerer overlegen kapacitet, når det kommer til at generere diverse udseender.
  2. Bevægelses-Generalisering: MagicDance-rammen har også evnen til at generere en bred vifte af bevægelser.

MagicDance: Mål og Arkitektur

For et givet reference-billede, enten af et rigtigt menneske eller et stiliseret billede, er det primære mål for MagicDance-rammen at generere en udgangsbillede eller udgangs-video, der er betinget af indgangen og pose-indgangene {P, F}, hvor P repræsenterer menneskelig pose-skelet og F repræsenterer ansigtslandemærker. Den genererede udgangsbillede eller video skal være i stand til at bevare udseendet og identiteten af de mennesker, der er involveret, samt baggrundens indhold i reference-billedet, mens den fastholder posen og udtrykkene, der er defineret af pose-indgangene.

Arkitektur

Under træning trænes MagicDance-rammen som en ramme-rekonstruktionsopgave for at rekonstruere sandheden med reference-billedet og pose-indgangen fra samme reference-video. Under test for at opnå bevægelsesoverføring er pose-indgangen og reference-billedet fra forskellige kilder.

Den samlede arkitektur af MagicDance-rammen kan deles i fire kategorier: Preliminær fase, Udseende-Kontrol-Fortræning, Udseende-Disentangleret Pose-Kontrol og Bevægelses-Modul.

Preliminær Fase

Latent Diffusion-Modeller eller LDM repræsenterer unikt designede diffusion-modeller, der opererer inden for det latente rum, som faciliteres af brugen af en autoencoder, og Stable Diffusion-rammen er en bemærkelsesværdig instans af LDM, der anvender en Vector Quantized-Variational AutoEncoder og temporal U-Net-arkitektur. Stable Diffusion-modellen anvender en CLIP-baseret transformer som en tekst-encoder for at behandle tekst-indgange ved at konvertere tekst-indgange til indlejring.

Udseende-Kontrol-Fortræning

Et større problem med den originale ControlNet-ramme er dens manglende evne til at kontrollere udseende blandt spatialt varierende bevægelser konsekvent, selvom den tenderer til at generere billeder med poser, der ligner dem i indgangsbilledet, med det samlede udseende, der påvirkes overvejende af tekst-indgange. Selvom denne metode fungerer, er den ikke egnet til bevægelsesoverføring, der indebærer opgaver, hvor det ikke er tekst-indgange, men reference-billedet, der fungerer som den primære kilde til udseende-information.

Udseende-Kontrol-Fortrænings-modulen i MagicDance-rammen er designet som en hjælpegren for at give vejledning for udseende-kontrol i en lag-for-lag-tilgang. I stedet for at afhænge af tekst-indgange fokuserer den samlede modul på at udnytte udseende-attributterne fra reference-billedet med det formål at forbedre rammen til at generere udseende-karakteristika præcist, især i scenarier, der indebærer komplekse bevægelses-dynamikker. Desuden er det kun Udseende-Kontrol-Modellen, der er trænbar under udseende-kontrol-fortræning.

Udseende-Disentangleret Pose-Kontrol

En naiv løsning til at kontrollere posen i udgangsbilledet er at integrere den fortrænede ControlNet-model direkte med den fortrænede Udseende-Kontrol-Model uden finjustering. Imidlertid kan integrationen føre til, at rammen kæmper med udseende-uafhængig pose-kontrol, hvilket kan føre til en diskrepans mellem indgangsposerne og de genererede poser. For at tackle denne diskrepans finjusterer MagicDance-rammen Pose-Kontrol-Nettet-modellen sammen med den fortrænede Udseende-Kontrol-Model.

Bevægelses-Modul

Når de arbejder sammen, kan Udseende-Disentangleret Pose-Kontrol-Nettet og Udseende-Kontrol-Modellen opnå præcis og effektiv billed-til-bevægelses-overføring, selvom det kan føre til temporalt inkonsistens. For at sikre temporalt konsistens integrerer rammen en yderligere bevægelses-modul i den primære Stable Diffusion UNet-arkitektur.

MagicDance: Fortræning og Datasæt

Til fortræning anvender MagicDance-rammen et TikTok-datasæt, der består af over 350 dansevideoer af varierende længde mellem 10 og 15 sekunder, der optager en enkelt person, der danser, og hvor de fleste af disse videoer indeholder ansigtet og den øvre del af kroppen. MagicDance-rammen ekstraherer hver enkelt video ved 30 FPS og kører OpenPose på hver enkelt ramme for at slutte pose-skelettet, håndposer og ansigtslandemærker.

Til fortræning er udseende-kontrol-modellen fortrænet med en batch-størrelse på 64 på 8 NVIDIA A100 GPU’er i 10.000 trin med en billedstørrelse på 512 x 512, efterfulgt af samtidig finjustering af pose-kontrol- og udseende-kontrol-modellerne med en batch-størrelse på 16 i 20.000 trin. Under træning sampler MagicDance-rammen tilfældigt to rammes som mål og reference, og billederne beskæres på samme position langs samme højde. Under evaluering beskærer modellen billedet centralt i stedet for at beskære dem tilfældigt.

MagicDance: Resultater

De eksperimentelle resultater, der er gennemført på MagicDance-rammen, demonstreres i følgende billede, og som det kan ses, overgår MagicDance-rammen eksisterende rammer som Disco og DreamPose for menneskelig bevægelsesoverføring på tværs af alle metrikker. Rammer, der består af en “*” foran deres navn, anvender målbilledet direkte som indgang og indeholder mere information i forhold til de andre rammer.

Det er interessant at bemærke, at MagicDance-rammen opnår en Face-Cos-score på 0,426, en forbedring på 156,62% i forhold til Disco-rammen, og en næsten 400% øgning i forhold til DreamPose-rammen. Resultaterne indikerer den robuste kapacitet af MagicDance-rammen til at bevare identitetsinformation og den synlige boost i præstation indikerer overlegenheten af MagicDance-rammen over eksisterende state-of-the-art-metoder.

Følgende billeder sammenligner kvaliteten af menneskelig video-generering mellem MagicDance-, Disco- og TPS-rammerne. Som det kan ses, lider resultaterne, der er genereret af GT-, Disco- og TPS-rammerne, under inkonsistente menneskelige pose-identiteter og ansigtsudtryk.

Desuden demonstrerer følgende billede visualiseringen af ansigtsudtryk og menneskelig pose-overføring på TikTok-datasættet, hvor MagicDance-rammen er i stand til at generere realistiske og levende udtryk og bevægelser under diverse ansigtslandemærker og pose-skelet-indgange, mens den præcist bevarede identitetsinformation fra reference-indgangsbilledet.

Det er værd at bemærke, at MagicDance-rammen har exceptionelle generaliseringskapaciteter til ud-af-domæne-reference-billeder af usete pose og stilarter med imponerende udseende-kontrol, selv uden yderligere finjustering på mål-domænet, og resultaterne demonstreres i følgende billede.

Følgende billeder demonstrerer visualiseringskapaciteterne af MagicDance-rammen i forhold til ansigtsudtryks-overføring og zero-shot-menneskelig-bevægelse. Som det kan ses, generaliserer MagicDance-rammen til in-the-wild-menneskelig-bevægelse perfekt.

MagicDance: Begrænsninger

OpenPose er en essentiel komponent af MagicDance-rammen, da den spiller en afgørende rolle for pose-kontrol, der påvirker kvaliteten og den temporale konsistens af de genererede billeder betydeligt. Imidlertid finder MagicDance-rammen det stadig lidt udfordrende at detektere ansigtslandemærker og pose-skeletter præcist, især når objekterne i billederne er delvis synlige eller viser hurtig bevægelse. Disse problemer kan føre til artefakter i det genererede billede.

Konklusion

I denne artikel har vi talt om MagicDance, en diffusion-baseret model, der søger at revolutionere menneskelig bevægelsesoverføring. MagicDance-rammen søger at overføre 2D-menneskelige ansigtsudtryk og bevægelser på udfordrende menneskelige dansevideoer med det specifikke mål at generere nye pose-sekvens-drevne menneskelige dansevideoer for bestemte mål-identiteter, mens den opretholder den oprindelige identitet. MagicDance-rammen er en to-trins træningsstrategi for menneskelig bevægelsesdisentanglement og udseende som hudtone, ansigtsudtryk og tøj.

MagicDance er en ny tilgang til at faciliterer realistisk menneskelig video-generering ved at inkorporere ansigts- og bevægelses-udtryks-overføring og muliggør konsistent in-the-wild-animation-generering uden at kræve yderligere finjustering, og demonstrerer en betydelig fremgang over eksisterende metoder. Desuden demonstrerer MagicDance-rammen exceptionelle generaliseringskapaciteter over komplekse bevægelses-sekvenser og diverse menneskelige identiteter, og etablerer MagicDance-rammen som den førende løber i feltet for AI-assisteret bevægelsesoverføring og video-generering.

Kunal Kejriwal er en backend-ingeniør med speciale i Python, PostgreSQL, Redis og cloud-infrastruktur på GCP og AWS. Med tre års erfaring i at bygge og skalere produktionssystemer skriver han om AI-infrastruktur, distribuerede systemer og arkitekturen bag implementering af maskinlæringsarbejdsbelastninger.