Andersons vinkel

En merkeverdig fremgang i menneske-drevet AI-video

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Examples from the DreamActor project page.

Merk: Prosjektsiden for dette arbeidet inkluderer 33 autoplay-lydhøye videoer som totalt utgjør en halv gigabyte, noe som destabiliserte systemet mitt ved lasting. Av denne grunn vil jeg ikke lenke direkte til den. Leserne kan finne URL-en i artikkelen eller PDF-en hvis de ønsker.

En av de primære målene i nåværende video-syntese-forskning er å generere en fullstendig AI-drevet video-prestasjon fra et enkelt bilde. Denne uken kom en ny artikkel fra Bytedance Intelligent Creation som muligens er det mest omfattende systemet av denne typen hittil, i stand til å produsere full- og semi-kropps-animasjoner som kombinerer uttrykksfulle ansiktsdetaljer med nøyaktig stor-skala-bevegelse, samt også oppnå forbedret identitets-konsistens – et område der selv ledende kommersielle systemer ofte svikter.

I eksemplet under ser vi en prestasjon drevet av en skuespiller (øverst til venstre) og avledet fra et enkelt bilde (øverst til høyre), som gir en merkelig fleksibel og dyktig gjengivelse, uten de vanlige problemer rundt å lage store bevegelser eller “gjette” om skjulte områder (dvs. deler av klær og ansiktsvinkler som må gjettes eller oppfinnes fordi de ikke er synlige i det enkelte kildebildet):

LYDINNHOLD. Klikk for å spille. En prestasjon er født fra to kilder, inkludert lip-sync, som vanligvis er forbeholdt dedikerte hjelpesystemer. Dette er en redusert versjon fra kilde-siden (se merknad i begynnelsen av artikkelen – gjelder for alle andre innlejrede videoer her).

Selv om vi kan se noen resterende utfordringer med å opprettholde identitet når hver klipp går videre, er dette det første systemet jeg har sett som generelt (om enn ikke alltid) opprettholder ID over en vedvarende periode uten å bruke LoRAs:

LYDINNHOLD. Klikk for å spille. Flere eksempler fra DreamActor-prosjektet.

Det nye systemet, tittelen DreamActor, bruker et tre-delt hybrid-styringssystem som gir dedikert oppmerksomhet til ansiktsuttrykk, hode-rotasjon og kjerne-skelett-design, og dermed muliggjør AI-drevne prestasjoner hvor hverken ansikt- eller kropp-aspektene lider på bekostning av den andre – en sjelden, muligens ukjent evne blant lignende systemer.

Nedenfor ser vi en av disse aspektene, hode-rotasjon, i aksjon. Den fargede ballen i hjørnet av hver miniatyrbilde mot høyre indikerer en slags virtuell gimbal som definerer hode-orientering uavhengig av ansiktsbevegelse og uttrykk, som her er drevet av en skuespiller (nederst til venstre).

Klikk for å spille. Den fargede ballen visualisert her representerer akselen til rotasjon av hodet til avatar, mens uttrykket er drevet av en separat modul og informert av en skuespillers prestasjon (sett her nederst til venstre).

En av prosjektets mest interessante funksjoner, som ikke engang er inkludert ordentlig i artikkelen, er dens evne til å avlede lip-sync-bevegelse direkte fra lyd – en evne som fungerer usedvanlig godt, selv uten en drivende skuespiller-video.

Forskerne har tatt på seg de beste etablerte aktørene i dette løpet, inkludert den meget rostede Runway Act-One og LivePortrait, og rapporterer at DreamActor var i stand til å oppnå bedre kvantitative resultater.

Siden forskerne kan sette sine egne kriterier, er kvantitative resultater ikke nødvendigvis en empirisk standard; men de tilhørende kvalitative testene ser ut til å støtte forfatternes konklusjoner.

Uheldigvis er dette systemet ikke ment for offentlig utgivelse, og den eneste verdien samfunnet kan potensielt trekke ut av arbeidet er i å potensielt gjenskape metodene som er beskrevet i artikkelen (som ble gjort med merkbar effekt for den likeledes lukkede Google Dreambooth i 2022 ).

Artikkelen sier*:

‘Menneske-bilde-animasjon har mulige sosiale risikoer, som å bli misbrukt til å lage falske videoer. Den foreslåtte teknologien kunne bli brukt til å lage falske videoer av mennesker, men eksisterende detekteringsverktøy [Demamba, Dormant] kan spore disse falskhetene.

‘For å redusere disse risikoene, er klare etiske regler og ansvarlige bruksveiledninger nødvendige. Vi vil strengt begrense tilgangen til våre kjerne-modeller og -koder for å forhindre misbruk.’

Naturligvis er slike etiske overvegelser praktiske fra et kommersielt ståsted, siden det gir en begrunnelse for API-kun tilgang til modellen, som kan bli monalisert. ByteDance har allerede gjort dette en gang i 2025, ved å gjøre den mye rostede OmniHuman tilgjengelig for betalte kreditter på Dreamina-nettstedet. Derfor, siden DreamActor muligens er et enda sterkere produkt, ser dette ut til å være det sannsynlige resultatet. Hva som gjenstår å se, er i hvilken utstrekning dens prinsipper, så langt de er forklart i artikkelen, kan hjelpe det åpne kilde-samfunnet.

Den nye artikkelen er tittelen DreamActor-M1: Holistisk, Uttrykksfull og Robust Menneske-Bilde-Animasjon med Hybrid-Styring, og kommer fra seks Bytedance-forskere.

Metode

DreamActor-systemet som er foreslått i artikkelen, har som mål å generere menneske-animasjon fra et referanse-bilde og en drivende video, ved å bruke et Diffusion Transformer (DiT) rammeverk tilpasset for latent-rom (apparet noen flavor av Stable Diffusion, selv om artikkelen bare henviser til 2022-utgivelsen).

I stedet for å stole på eksterne moduler for å håndtere referanse-betingelser, slår forfatterne sammen utseende- og bevegelses-egenskaper direkte innenfor DiT-ryggraden, og tillater interaksjon over rom og tid gjennom oppmerksomhet:

Schema for det nye systemet: DreamActor koder pose, ansiktsbevegelse og utseende inn i separate latenter, kombinert med støyete video-latenter produsert av en 3D-VAE. Disse signalene er fusjonert innenfor en Diffusion Transformer ved å bruke selv- og kryss-oppmerksomhet, med delt vekt over grener. Modellen er overvåket ved å sammenligne av-støyede utdata med rene video-latenter. Kilde: https://arxiv.org/pdf/2504.01724

Schema for det nye systemet: DreamActor koder pose, ansiktsbevegelse og utseende inn i separate latenter, kombinert med støyete video-latenter produsert av en 3D-VAE. Disse signalene er fusjonert innenfor en Diffusion Transformer ved å bruke selv- og kryss-oppmerksomhet, med delt vekt over grener. Modellen er overvåket ved å sammenligne av-støyede utdata med rene video-latenter. Kilde: https://arxiv.org/pdf/2504.01724

For å gjøre dette, bruker modellen en forhånds-trent 3D variational autoencoder for å koding inn både inndata-videoen og referanse-bildet. Disse latentene er patchified, konkatenerer og matet inn i DiT, som behandler dem sammen.

Dette arkitekturen avviker fra den vanlige praksisen med å feste en sekundær nettverk for referanse-injeksjon, som var tilnærmingen for det innflytelsesrike Animate Anyone og Animate Anyone 2 prosjektene.

I stedet bygger DreamActor fusjonen inn i hovedmodellen selv, forenkler designet og forbedrer informasjonsflyten mellom utseende- og bevegelses-kilder. Modellen er deretter trent ved å bruke flow-matching i stedet for den standard diffusion-objektivet (Flow-matching trener diffusjonsmodeller ved å direkte forutsi hastighetsfelt mellom data og støy, og hopper over score-estimasjon).

Hybrid Bevegelses-Styring

Hybrid Bevegelses-Styring-metoden som informerer de neurale gjengivelser kombinerer pose-tokens avledet fra 3D-kropps-skeletter og hode-sfærer; implisitte ansikts-representasjoner ekstrahert av en forhånds-trent ansikts-encoder; og referanse-utseende-tokens samplet fra kilde-bildet.

Disse elementene er integrert innenfor Diffusion Transformer ved å bruke distinkte oppmerksomhets-mekanismer, og tillater systemet å koordinere global bevegelse, ansiktsuttrykk og visuell identitet gjennom genererings-prosessen.

For den første av disse, i stedet for å stole på ansikts-landemerker, bruker DreamActor implisitte ansikts-representasjoner for å guide uttrykks-generering, og åpenbart muliggjør finere kontroll over ansikts-dynamikk og å skille identitet og hode-pose fra uttrykk.

For å skape disse representasjonene, behandler pipeline først å detektere og klippe ansikts-området i hver ramme av drivende video, og størrelsen til 224×224. De klippede ansiktene er behandlet av en ansikts-bevegelse-encoder forhånds-trent på PD-FGC-datasettet, som deretter er betinget av en MLP-lag.

PD-FGC, brukt i DreamActor, genererer en snakkende hode fra et referanse-bilde med skilt utseende-kontroll over lip-sync (fra lyd), hode-pose, øye-bevegelse og uttrykk (fra separate videoer), og tillater presis, uavhengig manipulering av hver.

PD-FGC, brukt i DreamActor, genererer en snakkende hode fra et referanse-bilde med skilt utseende-kontroll over lip-sync (fra lyd), hode-pose, øye-bevegelse og uttrykk (fra separate videoer), og tillater presis, uavhengig manipulering av hver. Kilde: https://arxiv.org/pdf/2211.14506

Resultatet er en sekvens av ansikts-bevegelse-tokens, som injiseres inn i Diffusion Transformer gjennom en kryss-oppmerksomhet-lag.

Samme rammeverk støtter også en lyd-drevet variant, hvor en separat encoder er trent som kart legger lyd-inndata direkte til ansikts-bevegelse-tokens. Dette gjør det mulig å generere synkronisert ansikts-animasjon – inkludert lip-bevegelse – uten en drivende video.

LYDINNHOLD. Klikk for å spille. Lip-sync avledet ren fra lyd, uten en drivende skuespiller-referanse. Den eneste karakter-inndata er det statiske bildet sett øverst til høyre.

For det andre, for å kontrollere hode-pose uavhengig av ansikts-uttrykk, innfører systemet en 3D-hode-sfære-representasjon (se video innlejret tidligere i denne artikkelen), som frakobler ansikts-dynamikk fra global hode-bevegelse, og forbedrer presisjon og fleksibilitet under animasjon.

Hode-sfærer er generert ved å trekke ut 3D-ansikts-parametre – som rotasjon og kamera-pose – fra drivende video ved å bruke FaceVerse-sporing-metoden.

Schema for FaceVerse-prosjektet. Kilde: https://www.liuyebin.com/faceverse/faceverse.html

Schema for FaceVerse-prosjektet. Kilde: https://www.liuyebin.com/faceverse/faceverse.html

Disse parameterne brukes til å rendre en farget sfære projisert på 2D-bildplanet, romlig justert med drivende hode. Sfærens størrelse matcher referanse-hodet, og dens farge reflekterer hodets orientering. Denne abstraksjonen reduserer kompleksiteten ved å lære 3D-hode-bevegelse, og hjelper til å bevare stiliserte eller forsterkede hode-former i figurer tegnet fra animasjon.

Visualisering av kontroll-sfæren som påvirker hode-orientering.

Visualisering av kontroll-sfæren som påvirker hode-orientering.

Til slutt, for å kontrollere full-kropps-bevegelse, bruker systemet 3D-kropps-skeletter med adaptiv ben-lengde-normalisering. Kropps- og hånd-parametre er estimert ved å bruke 4DHumans og hånd-fokusert HaMeR, begge opererer på SMPL-X-kropps-modellen.

SMPL-X anvender en parametrisk mesh over hele menneske-kroppen i et bilde, justert med estimert pose og uttrykk for å muliggjøre pose-bevisst manipulering ved å bruke mesh som en volumetrisk guide. Kilde: https://arxiv.org/pdf/1904.05866

SMPL-X anvender en parametrisk mesh over hele menneske-kroppen i et bilde, justert med estimert pose og uttrykk for å muliggjøre pose-bevisst manipulering ved å bruke mesh som en volumetrisk guide. Kilde: https://arxiv.org/pdf/1904.05866

Fra disse utdata, er nøkkel-ledd valgt, projisert inn i 2D, og koblet inn i linje-basert skeleton-kart. I motsetning til metoder som Champ, som render full-kropps-mesh, unngår denne tilnærmingen å påføre forhåndsdefinerte form-priorer, og ved å stole kun på skelett-struktur, oppmuntres modellen til å slutte kropp-form og utseende direkte fra referanse-bildene, og reduserer bias mot faste kropp-typer, og forbedrer generalisering over en rekke poser og bygninger.

Under trening, er 3D-kropps-skeletter konkatenerer med hode-sfærer og passerer gjennom en pose-encoder, som utsteder egenskaper som deretter kombineres med støyete video-latenter for å produsere støy-tokens brukt av Diffusion Transformer.

Ved inferens-tid, tar systemet hensyn til skelett-forskjeller mellom subjekter ved å normalisere ben-lengder. Den SeedEdit-forhånds-trent bilde-redigeringsmodell transformerer både referanse- og drivende bilder inn i en standard kanonisk konfigurasjon. RTMPose brukes deretter til å trekke ut skelett-proporsjoner, som brukes til å justere drivende-skelettet til å matche anatomien til referanse-subjektet.

Oversikt over inferens-pipeline. Pseudo-referanser kan genereres for å berike utseende-koder, mens hybrid-kontroll-signaler – implisitt ansikts-bevegelse og eksplisitt pose fra hode-sfærer og kropp-skeletter – trekkes ut fra drivende video. Disse er deretter matet inn i en DiT-modell for å produsere animert utdata, med ansikts-bevegelse frakoblet fra kropp-pose, og tillater å bruke lyd som en driver.

Oversikt over inferens-pipeline. Pseudo-referanser kan genereres for å berike utseende-koder, mens hybrid-kontroll-signaler – implisitt ansikts-bevegelse og eksplisitt pose fra hode-sfærer og kropp-skeletter – trekkes ut fra drivende video. Disse er deretter matet inn i en DiT-modell for å produsere animert utdata, med ansikts-bevegelse frakoblet fra kropp-pose, og tillater å bruke lyd som en driver.

Utseende-Veiledning

For å forbedre utseende-trofasthet, spesielt i skjulte eller sjeldent synlige områder, supplerer systemet det primære referanse-bildet med pseudo-referanser samplet fra inndata-videoen.

LYDINNHOLD. Klikk for å spille. Systemet forutser behovet for å rendre skjulte områder nøyaktig og konsekvent. Dette er omtrent så nært som jeg har sett, i et prosjekt av denne typen, til en CGI-stil bitmap-tekstur-tilnærming.

Disse ekstra rammer er valgt for pose-mangfold ved å bruke RTMPose, og filtrert ved å bruke CLIP-basert likhet for å sikre at de forblir konsistente med subjektets identitet.

Alle referanse-rammer (primære og pseudo) er kodet av samme visuell encoder og fusjonert gjennom en selv-oppmerksomhets-mekanisme, som tillater modellen å få tilgang til komplementære utseende-koder. Denne oppsettet forbedrer dekning av detaljer som profil-utsikt eller lem-texturer. Pseudo-referanser brukes alltid under trening og valgfritt under inferens.

Trening

DreamActor ble trent i tre stadier for å gradvis introdusere kompleksitet og forbedre stabilitet.

I det første stadiet, ble bare 3D-kropps-skeletter og 3D-hode-sfærer brukt som kontroll-signaler, og ansikts-representasjoner ble ekskludert. Dette tillot den grunnleggende video-genererings-modellen, initialisert fra MMDiT, å tilpasse seg menneske-animasjon uten å bli overveldet av fin-granulerte kontroller.

I det andre stadiet, ble implisitte ansikts-representasjoner lagt til, men alle andre parametre frosset. Bare ansikts-bevegelse-encoder og ansikts-oppmerksomhets-lag ble trent på dette tidspunktet, og tillot modellen å lære uttrykks-detaljer i isolasjon.

I det siste stadiet, ble alle parametre av-frosset for felles-optimisering over utseende, pose og ansikts-dynamikk.

Data og Tester

For test-fasen, er modellen initialisert fra en forhånds-trent bilde-til-video DiT-checkpoint og trent i tre stadier: 20 000 skritt for hver av de to første stadiene og 30 000 skritt for det tredje.

For å forbedre generalisering over forskjellige varighet og oppløsning, ble video-klippene tilfeldig samplet med lengder mellom 25 og 121 ramer. Disse ble deretter størrelsesendret til 960x640px, og beholdt aspekt-forhold.

Trening ble utført på åtte (Kina-fokusert) NVIDIA H20-GPUer, hver med 96GB VRAM, ved å bruke AdamW-optimalisatoren med en (tolerabelt høy) læringsrate på 5e−6.

Ved inferens, inneholdt hver video-segment 73 ramer. For å opprettholde konsistens over segmenter, ble den siste latente fra ett segment gjenbrukt som den innledende latente for det neste, som kontekstualiserer oppgaven som sekvensiell bilde-til-video-generering.

Klassifikator-fri veiledning ble brukt med en vekt på 2,5 for både referanse-bilder og bevegelses-kontroll-signaler.

Forfatterne konstruerte en trenings-datasett (ingen kilder er oppgitt i artikkelen) bestående av 500 timer video fra diverse domener, med eksempler på (blant annet) dans, idrett, film og offentlige taler. Datasettet var designet for å fange en bred spekter av menneske-bevegelse og uttrykk, med en jevn fordeling mellom full-kropps- og halv-kropps-utsikt.

For å forbedre ansikts-syntese-kvalitet, ble Nersemble inkorporert i data-forberedelses-prosessen.

Eksempler fra Nersemble-datasettet, brukt til å berike data for DreamActor. Kilde: https://www.youtube.com/watch?v=a-OAWqBzldU

Eksempler fra Nersemble-datasettet, brukt til å berike data for DreamActor. Kilde: https://www.youtube.com/watch?v=a-OAWqBzldU

For evaluering, brukte forskerne deres datasett også som en benchmark for å vurdere generalisering over forskjellige scenarioer.

Modellens ytelse ble målt ved å bruke standard-mål fra tidligere arbeid: Fréchet Inception Distance (FID); Strukturert Likhet-Indeks (SSIM); Lært Perseptuell Bilde-Patch-Likhet (LPIPS); og Peak Signal-til-Støy-Forhold (PSNR) for ramme-nivå-kvalitet. Fréchet Video Distance (FVD) ble brukt for å vurdere tidsmessig kohesjon og generell video-trofasthet.

Forfatterne utførte eksperimenter på både kropp-animasjon og portrett-animasjon-oppgaver, alle med en enkelt (mål) referanse-bilde.

For kropp-animasjon, ble DreamActor-M1 sammenlignet med Animate Anyone; Champ; MimicMotion; og DisPose.

Kvantitative sammenligninger mot rivaliserende rammer.

Kvantitative sammenligninger mot rivaliserende rammer.

Selv om PDF-en gir en statisk bilde som en visuell sammenligning, kan en av videoene fra prosjekt-siden muligens høyde frem de forskjellene mer tydelig:

LYDINNHOLD. Klikk for å spille. En visuell sammenligning over utfordrer-rammene. Drivende video er sett øverst til venstre, og forfatternes konklusjon om at DreamActor produserer de beste resultater, ser ut til å være rimelig.

For portrett-animasjon-tester, ble modellen evaluert mot LivePortrait; X-Portrait; SkyReels-A1; og Act-One.

Kvantitative sammenligninger for portrett-animasjon.

Kvantitative sammenligninger for portrett-animasjon.

Forfatterne påpeker at deres metode vinner i kvantitative tester, og hevder at den også er overlegen kvalitativt.

LYDINNHOLD. Klikk for å spille. Eksempler på portrett-animasjon-sammenligninger.

Tredje og siste av klippene vist i videoen over, utstiller en mindre overbevisende lip-sync sammenlignet med noen av de rivaliserende rammene, selv om den generelle kvaliteten er merkelig høy.

Konklusjon

I å forutse behovet for teksturer som er antydet, men ikke faktisk til stede i det enkelte mål-bildet som driver disse rekonstruksjonene, har Bytedance adressert en av de største utfordringene som møter diffusjons-basert video-generering – konsistente, varige teksturer. Neste logiske skritt etter å perfeksjonere en slik tilnærming ville være å skape en referanse-atlas fra den opprinnelige genererte klippet som kunne bli brukt til påfølgende, forskjellige genereringer, for å opprettholde utseende uten LoRAs.

Selv om en slik tilnærming ville være en ekstern referanse, er dette ikke forskjellig fra tekstur-mapping i tradisjonelle CGI-teknikker, og kvaliteten på realisme og trofasthet er langt høyere enn de eldre metodene kan oppnå.

Det som er mest imponerende med DreamActor, er det kombinerte tre-delt styringssystemet, som broer den tradisjonelle skillelinjen mellom ansikts-fokusert og kropp-fokusert menneske-syntese på en genial måte.

Det eneste som gjenstår å se, er om noen av disse grunnleggende prinsippene kan bli brukt i mer tilgjengelige tilbud; slik det står nå, ser DreamActor ut til å bli enda et syntese-som-en-tjeneste-tilbud, alvorlig begrenset av restriksjoner på bruk, og av den upraktiske utfordringen med å eksperimentere omfattende med en kommersiell arkitektur.

 

* Min erstatning av hyperlenker for forfatterne; inline-citater

Som nevnt tidligere, er det ikke klart hvilken smak av Stable Diffusion som ble brukt i dette prosjektet.

Først publisert fredag, 4. april 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskildringssyntese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, inntil det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]