Andersons vinkel
Et nytt system for temporalt konsistent Stable Diffusion video-karakterer

En ny initiativ fra Alibaba Group tilbyr ett av de beste metodene jeg har sett for å generere fullkropps menneske-avatare fra en Stable Diffusion-basert grunnmodell.
Tittelert MIMO (MIMicking med Object Interactions), bruker systemet en rekke populære teknologier og moduler, inkludert CGI-baserte menneske-modeller og AnimateDiff, for å aktivere temporalt konsistent karakter-erstatning i videoer – eller å drive en karakter med en brukerdefinert skjelett-pose.
Her ser vi karakterer interpolert fra en enkelt bilde-kilde, og drevet av en forhåndsdefinert bevegelse:
[Klikk video nedenfor for å spille]
Fra enkelt bilde-kilde, tre diverse karakterer drevet av en 3D-pose-sekvens (langt til venstre) ved hjelp av MIMO-systemet. Se prosjektets nettside og den tilhørende YouTube-videoen (innbettet i slutten av denne artikkelen) for flere eksempler og bedre oppløsning. Kilde: https://menyifang.github.io/projects/MIMO/index.html
Genererte karakterer, som også kan bli hentet fra rammer i videoer og på andre måter, kan integreres i virkelige filmer.
MIMO tilbyr et nytt system som genererer tre separate kodninger, hver for karakter, scene og okklusjon (dvs. matting, når et objekt eller person passerer foran karakteren som avbildes). Disse kodningene integreres på inferens-tid.
[Klikk video nedenfor for å spille]
MIMO kan erstatte originale karakterer med fotorealistiske eller stiliserte karakterer som følger bevegelsen fra mål-videoen. Se prosjektets nettside og den tilhørende YouTube-videoen (innbettet i slutten av denne artikkelen) for flere eksempler og bedre oppløsning.
Systemet er trent over Stable Diffusion V1.5-modellen, ved hjelp av en egen dataset kuratert av forskerne, og består like mye av virkelige og simulerings-videoer.
Det store problemet med diffusjons-basert video er temporalt stabilitet, hvor video-innholdet enten flimrer eller “utvikler” seg på måter som ikke er ønsket for konsistent karakter-representasjon.
MIMO, derimot, bruker effektivt ett enkelt bilde som en kart for konsistent veiledning, som kan orkestreres og begrenses av de interstitielle SMPL CGI-modellen.
Siden referansen er konsistent, og grunnmodellen som systemet er trent over har blitt forbedret med adekvate representative bevegelses-eksempler, er systemets evner for temporalt konsistent utgang over det generelle standarden for diffusjons-baserte avatare.
[Klikk video nedenfor for å spille]
Flere eksempler på pose-drevne MIMO-karakterer. Se prosjektets nettside og den tilhørende YouTube-videoen (innbettet i slutten av denne artikkelen) for flere eksempler og bedre oppløsning.
Det blir mer vanlig å bruke enkelt-bilder som kilde for effektive neurale representasjoner, enten alene eller i en multimodal måte, kombinert med tekst-prompter. For eksempel kan det populære LivePortrait ansikts-overførings-system også generere svært troverdige deepfaked ansikter fra enkelt ansikts-bilde.
Forskerne mener at prinsippene som brukes i MIMO-systemet kan utvides til andre og nye typer generative systemer og rammer.
Den nye artikkelen er tittelert MIMO: Kontrollerbar karakter video-syntese med rom-dekomponert modellering, og kommer fra fire forskere ved Alibaba Group’s Institute for Intelligent Computing. Arbeidet har en video-rik prosjekt-side og en tilhørende YouTube-video, som også er innbettet i slutten av denne artikkelen.
Metode
MIMO oppnår automatisk og uovervåket separasjon av de ovennevnte tre rom-komponentene, i en slutt-til-slutt-arkitektur (dvs. alle under-prosessene er integrert i systemet, og brukeren trenger bare å angi inn-materialet).

Den konseptuelle skjema for MIMO. Kilde: https://arxiv.org/pdf/2409.16160
Objekter i kilde-videoer oversettes fra 2D til 3D, først ved hjelp av den monokulære dybde-estimatoren Depth Anything. Den menneskelige komponenten i hver ramme trekkes ut med metoder tilpasset fra Tune-A-Video-prosjektet.
Disse funksjonene oversettes deretter til video-baserte volumetriske fasetter via Facebook Research’s Segment Anything 2-arkitektur.
Scenen-laget i seg selv oppnås ved å fjerne objekter som er oppdaget i de to andre lagene, og gir effektivt en rotoscope-stil mask automatisk.
For bevegelsen, et sett med uttrekte latente koder for den menneskelige komponenten er ankret til en standard menneske-CGI-basert SMPL-modell, hvis bevegelser gir konteksten for det rendrede menneske-innholdet.
En 2D funksjons-kart for den menneskelige komponenten oppnås ved en differensierbar rasterisator avledet fra en 2020-initiativ fra NVIDIA. Ved å kombinere de oppnådde 3D-data fra SMPL med de 2D-data som er oppnådd ved NVIDIA-metoden, har de latente kodene som representerer den “neurale personen” en solid korrespondanse til deres eventuelle kontekst.
På dette punktet er det nødvendig å etablere en referanse som ofte er nødvendig i arkitekturer som bruker SMPL – en kanonisk pose. Dette er bredt likt Da Vincis ‘Vitruvian mann’, i og med at det representerer en null-pose-mal som kan akseptere innhold og deretter bli deformert, og bringer det (effektivt) tekstur-mappede innholdet med det.
Disse deformasjonene, eller “avvik fra normen”, representerer menneskelig bevegelse, mens SMPL-modellen bevare de latente kodene som utgjør den menneskelige identiteten som er uttrekt, og representerer dermed den resulterende avatar korrekt i forhold til pose og tekstur.

Et eksempel på en kanonisk pose i en SMPL-figur. Kilde: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
Med hensyn til problemet med entanglement (utstrekningen til hvilken grad trent data kan bli inflexibel når du strekker det beyond sine trente grenser og assosiasjoner), sier forfatterne*:
‘For å fullstendig disentangle utseendet fra posert video-rammer, er en ideell løsning å lære den dynamiske menneske-representasjonen fra den monokulære videoen og transformere det fra posert rom til kanonisk rom.
‘Med hensyn til effektivitet, bruker vi en forenklet metode som direkte transformerer den poserte menneske-bildet til det kanoniske resultatet i standard A-pose ved hjelp av en forhånds-trent menneske-repose-modell. Den syntetiserte kanoniske utseende-bildet mates til ID-encoder for å få identitets-koden.
‘Dette enkle designet muliggjør full disentanglement av identitet og bevegelses-egenskaper. I følge Animate Anyone, inkluderer ID-encoder en CLIP-bilde-encoder og en referanse-nett-arkitektur for å innkapsle for den globale og lokale funksjonen, [henholdsvis].’
For scenen og okklusjon-aspektene, brukes en delt og fast Variational Autoencoder (VAE – i dette tilfelle avledet fra en 2013-publikasjon) for å innkapsle scenen og okklusjon-elementene i det latente rommet. Inkonsistenser håndteres ved en inpainting-metode fra 2023 ProPainter-prosjektet.
En gang sammensatt og retusjert på denne måten, vil både bakgrunnen og eventuelle okkluderende objekter i videoen gi en matte for den bevegelige menneske-avataren.
Disse dekomponerte attributtene mates deretter inn i en U-Net-ryggrad basert på Stable Diffusion V1.5-arkitekturen. Den fullstendige scene-koden konkateneres med systemets native latente støy. Den menneskelige komponenten integreres via selv-oppmerksomhet og kryss-oppmerksomhets-lag, henholdsvis.
Deretter er den renoisede resultatet utgang via VAE-dekoderen.
Data og tester
For trening, skapte forskerne et menneske-video-datasett kalt HUD-7K, som bestod av 5 000 reelle karakter-videoer og 2 000 syntetiske animasjoner skapt av En3D-systemet. De reelle videoene krevde ingen annotasjon, på grunn av den ikke-semantiske naturen av figurekstraksjons-prosessene i MIMO-arkitekturen. De syntetiske data var fullstendig annotert.
Modellen ble trent på åtte NVIDIA A100-GPU-er (selv om artikkelen ikke spesifiserer om disse var 40GB eller 80GB VRAM-modellene), i 50 iterasjoner, ved hjelp av 24 video-rammer og en batch-størrelse på fire, til konvergens.
Bevegelses-modulen for systemet ble trent på vekter fra AnimateDiff. Under trening-prosessen, ble vekter fra VAE-encoder/decoder og CLIP-bilde-encoder frosset (i motsetning til full fine-tuning, som vil ha en mye bredere effekt på en grunn-modell).
Selv om MIMO ikke ble testet mot analoge systemer, testet forskerne det på vanskelige utenfor-distribusjon bevegelses-sekvenser hentet fra AMASS og Mixamo. Disse bevegelsene inkluderte klatring, spill og dans.
De testet også systemet på virkelige menneske-videoer. I begge tilfeller rapporterer artikkelen “høy robusthet” for disse usette 3D-bevegelsene, fra forskjellige synsvinkler.
Selv om artikkelen tilbyr flere statiske bilde-resultater som demonstrerer systemets effektivitet, er den sanne ytelsen til MIMO best vurdert med de omfattende video-resultatene som er tilgjengelige på prosjekt-siden og i YouTube-videoen som er innbettet nedenfor (hvor videoene fra starten av denne artikkelen er avledet).
Forfatterne konkluderer:
‘Eksperimentelle resultater [demonstrerer] at vår metode muliggjør ikke bare fleksible karakter-, bevegelse- og scene-kontroll, men også avansert skalerbarhet til vilkårlige karakterer, generell til nye 3D-bevegelses-mønstre og anvendelighet til interaktive scener.
‘Vi tror også [at] vår løsning, som tar hensyn til den innebygde 3D-naturen og automatisk koder 2D-video til hierarkiske rom-komponenter, kan inspirere fremtidige forskninger på 3D-bevisst video-syntese.
‘Videre er vår ramme ikke bare godt egnet til å generere karakter-videoer, men kan også potensielt tilpasses andre kontrollerbare video-syntese-oppgaver.’
Konklusjon
Det er friskt å se en avatar-system basert på Stable Diffusion som ser ut til å være i stand til så stor temporalt stabilitet – ikke minst fordi Gaussian Avatars ser ut til å vinne det høye terreng i denne forsknings-sektoren.
De stiliserte avatarer som er representert i resultater er effektive, og selv om nivået av fotorealistisk som MIMO kan produsere ikke er like høyt som hva Gaussian Splatting er i stand til, er de diverse fordelene med å skape temporalt konsistente mennesker i en semantisk-basert Latent Diffusion Network (LDM) betydelige.
* Min konvertering av forfatternes inline-citater til hyperlenker, og hvor nødvendig, eksterne forklarende hyperlenker.
Først publisert onsdag, 25. september 2024












