Andersons vinkel
En bemÃĶrkelsesvÃĶrdig fremgang i menneskedrevet AI-video

BemÃĶrk: Projektets side for dette arbejde indeholder 33 autoplaying high-res videoer, der i alt udgÃļr en halv gigabyte, hvilket destabiliserede mit system under indlÃĶsning. Af denne grund vil jeg ikke linke direkte til den. LÃĶsere kan finde URLâen i abstract eller PDF, hvis de Ãļnsker.
En af de primÃĶre mÃĨl i nuvÃĶrende video-syntese-forskning er at generere en komplet AI-drevet video-prÃĶstation fra et enkelt billede. Denne uge offentliggjorde Bytedance Intelligent Creation en ny artikel, der mÃĨske er det mest omfattende system af denne type hidtil, i stand til at producere fuld- og semi-kroppsanimationer, der kombinerer udtryksfulde ansigtsdetaljer med prÃĶcis stor-skala-bevÃĶgelse, samtidig med at de opnÃĨr forbedret identitets-konsistens â et omrÃĨde, hvor selv fÃļrende kommercielle systemer ofte mangler.
I eksemplet nedenfor ser vi en prÃĶstation drevet af en skuespiller (Ãļverst til venstre) og afledt fra et enkelt billede (Ãļverst til hÃļjre), der giver en bemÃĶrkelsesvÃĶrdigt fleksibel og behÃĶndig gengivelse, uden de sÃĶdvanlige problemer omkring oprettelse af store bevÃĶgelser eller âgÃĶtningâ om skjulte omrÃĨder (dvs. dele af tÃļj og ansigtsvinkler, der mÃĨ infÃĶres eller opfindes, fordi de ikke er synlige i det eneste kildefoto):
LYDINDHOLD. Klik for at afspille. En prÃĶstation opstÃĨr fra to kilder, herunder lip-sync, som normalt er forbeholdt dedikerede hjÃĶlpe-systemer. Dette er en reduceret version fra kilde-sitet (se bemÃĶrkning i begyndelsen af artiklen â gÃĶlder for alle andre indlejrede videoer her).
Selv om vi kan se nogle resterende udfordringer i forhold til vedvarende identitet i hver klip, er dette det fÃļrste system, jeg har set, der generelt (omend ikke altid) opretholder ID over en lÃĶngere periode uden brug af LoRAs:
LYDINDHOLD. Klik for at afspille. Yderligere eksempler fra DreamActor-projektet.
Det nye system, kaldet DreamActor, bruger et tredelt hybrid kontrolsystem, der giver dedikeret opmÃĶrksomhed til ansigtsudtryk, hovedrotation og kerneskematisk design, hvilket muliggÃļr AI-drevne prÃĶstationer, hvor hverken ansigt eller krop lider under det andet â en sjÃĶlden, muligvis ukendt kapacitet blandt lignende systemer.
LÃĶngere nede ser vi en af disse aspekter, hovedrotation, i aktion. Den farvede bold i hjÃļrnet af hver miniature til hÃļjre indikerer en slags virtuel gimbal, der definerer hoved-orientering uafhÃĶngigt af ansigtsbevÃĶgelse og udtryk, der her er drevet af en skuespiller (nederst til venstre).
Klik for at afspille. Den multicolorede bold visualiseret her reprÃĶsenterer rotationsaksen for avatar-hovedet, mens udtrykket er drevet af en separat modul og informeret af en skuespillers prÃĶstation (set her nederst til venstre).
Et af projektets mest interessante funktioner, der ikke engang er inkluderet ordentligt i papirets tests, er dets evne til at aflede lip-sync-bevÃĶgelse direkte fra lyd â en kapacitet, der fungerer usÃĶdvanligt godt, selv uden en drivende skuespiller-video.
Forskerne har taget pÃĨ de bedste etablerede systemer i denne forfÃļlgning, herunder den meget rostede Runway Act-One og LivePortrait, og rapporterer, at DreamActor var i stand til at opnÃĨ bedre kvantitative resultater.
Da forskere kan fastsÃĶtte deres egne kriterier, er kvantitative resultater ikke nÃļdvendigvis en empirisk standard; men de tilhÃļrende kvalitative tests synes at stÃļtte forfatternes konklusioner.
DesvÃĶrre er dette system ikke tiltÃĶnkt offentlig udgivelse, og den eneste vÃĶrdi, som fÃĶllesskabet potentielt kan udlede fra arbejdet, er i at reproducere de metoder, der er beskrevet i artiklen (som det blev gjort med bemÃĶrkelsesvÃĶrdig effekt for den ligeledes lukkede kilde Google Dreambooth i 2022 ).
Artiklen siger*:
âMenneske-billede-animasjon har mulige sociale risici, som at blive misbrugt til at lave falske videoer. Den foreslÃĨede teknologi kunne blive brugt til at lave falske videoer af mennesker, men eksisterende detektionsvÃĶrktÃļjer [Demamba, Dormant] kan spotte disse falske videoer.
âFor at reducere disse risici er klare etiske regler og ansvarlige brugsvejledninger nÃļdvendige. Vi vil strengt begrÃĶnse adgangen til vores kerne-modeller og -koder for at forhindre misbrug.â
Naturligvis er etiske overvejelser af denne type praktiske fra et kommercielt synspunkt, da det giver en begrundelse for API-kun adgang til modellen, som derefter kan moniteres. ByteDance har allerede gjort dette en gang i 2025 ved at gÃļre den meget rostede Omnihuman tilgÃĶngelig for betalte kredit pÃĨ Dreamina-sitet. Derfor synes det sandsynligt, at DreamActor fÃļlger samme skÃĶbne. Det, der blot skal ses, er, i hvilken udstrÃĶkning dets principper, sÃĨ vidt de er beskrevet i artiklen, kan hjÃĶlpe det ÃĨbne fÃĶllesskab.
Den nye artikel er kaldt DreamActor-M1: Holistisk, udtryksfuld og robust menneske-billede-animasjon med hybrid vejledning, og kommer fra seks Bytedance-forskere.
Metode
DreamActor-systemet, der er foreslÃĨet i artiklen, sigter mod at generere menneske-animasjon fra et reference-billede og en drivende video, ved hjÃĶlp af en Diffusion Transformer (DiT) ramme, tilpasset til latent rum (apparentligt en slags Stable Diffusion, selv om artiklen kun citerer 2022-udgivelsespublikationen).
I stedet for at afhÃĶnge af eksterne moduler til reference-betingelse, kombinerer forfatterne udseende- og bevÃĶgelsesfunktioner direkte indenfor DiT-baggrunden, hvilket tillader interaktion mellem rum og tid gennem opmÃĶrksomhed:

Schema for det nye system: DreamActor koder stilling, ansigtsbevÃĶgelse og udseende i separate latenter, kombinerer dem med stÃļjede video-latenter produceret af en 3D VAE. Disse signaler kombineres indenfor en Diffusion Transformer ved hjÃĶlp af selv- og kryds-opmÃĶrksomhed, med fÃĶlles vÃĶgte pÃĨ tvÃĶrs af grene. Modellen er overvÃĨget ved at sammenligne afstÃļjede udgang med rene video-latenter. Kilde: https://arxiv.org/pdf/2504.01724
For at gÃļre dette, bruger modellen en forudtrÃĶnet 3D variational autoencoder til at koda bÃĨde input-videoen og reference-billedet. Disse latenter patchificeres, konkateneres og fÃļres ind i DiT, som behandler dem fÃĶlles.
Dette arkitektur afviger fra den almindelige praksis med at tilfÃļje et sekundÃĶrt netvÃĶrk til reference-injektion, som var tilgangen for det indflydelsesrige Animate Anyone og Animate Anyone 2 projekter.
I stedet bygger DreamActor fusionen ind i hovedmodellen selv, hvilket forenkler designet og forbedrer informationsflowet mellem udseende- og bevÃĶgelseskilder. Modellen trÃĶnes derefter ved hjÃĶlp af flow-matching i stedet for den standardmÃĶssige diffusion-objektive (Flow-matching trÃĶner diffusion-modeller ved direkte at forudsige hastighedsfelter mellem data og stÃļj, og springer score-estimation over).
Hybrid BevÃĶgelses-Vejledning
Hybrid BevÃĶgelses-Vejlednings-metoden, der informerer de neurale renderinger, kombinerer stillingstokens afledt fra 3D-legeme-skeletter og hoved-sfÃĶrer; implicit ansigts-reprÃĶsentationer ekstraheret af en forudtrÃĶnet ansigts-encoder; og reference-udseende-tokens samplet fra kilde-billedet.
Disse elementer integreres indenfor Diffusion Transformer ved hjÃĶlp af distinkte opmÃĶrksomheds-mekanismer, hvilket tillader systemet at koordinere global bevÃĶgelse, ansigtsudtryk og visuel identitet pÃĨ tvÃĶrs af genereringsprocessen.
For det fÃļrste af disse, i stedet for at afhÃĶnge af ansigts-landemÃĶrker, bruger DreamActor implicit ansigts-reprÃĶsentationer til at guide udtryks-generering, hvilket tilsyneladende muliggÃļr en finere kontrol over ansigts-dynamik, samtidig med at det adskiller identitet og hoved-stilling fra udtryk.
Til at oprette disse reprÃĶsentationer, behandler pipeline fÃļrst og cropper ansigts-omrÃĨdet i hver frame af drivende video, og ÃĶndrer stÃļrrelsen til 224Ã224. De afkortede ansigter behandles af en ansigts-bevÃĶgelses-encoder forudtrÃĶnet pÃĨ PD-FGC dataset, og derefter betinget af en MLP lag.

PD-FGC, anvendt i DreamActor, genererer en talende hoved fra et reference-billede med adskilt kontrol over lip-sync (fra lyd), hoved-stilling, Ãļje-bevÃĶgelse og udtryk (fra separate videoer), hvilket tillader prÃĶcis, uafhÃĶngig manipulation af hver af dem. Kilde: https://arxiv.org/pdf/2211.14506
Resultatet er en sekvens af ansigts-bevÃĶgelses-tokens, der injiceres ind i Diffusion Transformer gennem en kryds-opmÃĶrksomheds lag.
Samme ramme understÃļtter ogsÃĨ en lyd-drevet variant, hvor en separat encoder er trÃĶnet, der kortlÃĶgger tale-input direkte til ansigts-bevÃĶgelses-tokens. Dette gÃļr det muligt at generere synkroniseret ansigts-animasjon â herunder lip-bevÃĶgelse â uden en drivende video.
LYDINDHOLD. Klik for at afspille. Lip-sync afledt ren fra lyd, uden en drivende skuespiller-reference. Den eneste karakter-input er det statiske billede set Ãļverst til hÃļjre.
Anden, for at kontrollere hoved-stilling uafhÃĶngigt af ansigts-udtryk, introducerer systemet en 3D hoved-sfÃĶrisk reprÃĶsentation (se video indlejret tidligere i denne artikel), der adskiller ansigts-dynamik fra global hoved-bevÃĶgelse, hvilket forbedrer prÃĶcision og fleksibilitet under animation.
Hoved-sfÃĶrer genereres ved at trÃĶkke 3D ansigts-parametre â sÃĨsom rotation og kamera-stilling â fra drivende video ved hjÃĶlp af FaceVerse sporing-metoden.

Schema for FaceVerse-projektet. Kilde: https://www.liuyebin.com/faceverse/faceverse.html
Disse parametre bruges til at rendre en farvet sfÃĶre projiceret pÃĨ 2D-billedplanet, spatialt tilpasset til drivende hoved. SfÃĶrens stÃļrrelse matcher reference-hovedet, og dens farve reflekterer hovedets orientering. Denne abstraktion reducerer kompleksiteten af at lÃĶre 3D hoved-bevÃĶgelse, hvilket hjÃĶlper med at bevare stiliserede eller overdrevne hoved-former i tegneserie-figurer.

Visualisering af kontrol-sfÃĶren, der pÃĨvirker hoved-orientering.
Til sidst, for at guide fuld-kropps-bevÃĶgelse, bruger systemet 3D-legeme-skeletter med adaptiv ben-lÃĶngde-normalisering. Legeme- og hÃĨnd-parametre estimeres ved hjÃĶlp af 4DHumans og hÃĨnd-fokuseret HaMeR, begge opererer pÃĨ SMPL-X legeme-modellen.

SMPL-X anvender en parametrisk mesh over hele legemet i et billede, tilpasset til estimeret stilling og udtryk for at muliggÃļre stilling-bevidst manipulation ved hjÃĶlp af meshâen som en volumetrisk guide. Kilde: https://arxiv.org/pdf/1904.05866
Fra disse udgang, vÃĶlges nÃļgle-led, projiceres ind i 2D, og forbinder til linje-baserede skelet-kort. I modsÃĶtning til metoder som Champ, der render fuld-kropps-mesh, undgÃĨr denne tilgang at pÃĨfÃļre forudbestemte form-forudsÃĶtninger, og ved at afhÃĶnge udelukkende af skelet-struktur, opmuntres modellen til at slutte legeme-form og udseende direkte fra reference-billederne, reducerer bias mod faste legeme-typer og forbedrer generalisering pÃĨ tvÃĶrs af en rÃĶkke stillinger og bygninger.
Under trÃĶning kombineres 3D-legeme-skeletter med hoved-sfÃĶrer og passerer gennem en stilling-encoder, der udgang funktioner, der derefter kombineres med stÃļjede video-latenter for at producere stÃļj-tokens brugt af Diffusion Transformer.
Ved slutning af trÃĶning tager systemet hensyn til skelet-forskelle mellem emner ved at normalisere ben-lÃĶngder. SeedEdit forudtrÃĶnet billed-redigering-model transformerer bÃĨde reference- og drivende billeder til en standard kanonisk konfiguration. RTMPose bruges derefter til at trÃĶkke skelet-proportioner, der bruges til at tilpasse drivende-skelettet til at matche anatomien af reference-emnet.

Oversigt over slutnings-pipeline. Pseudo-references kan genereres for at berige udseende-kilder, mens hybrid kontrol-signaler â implicit ansigts-bevÃĶgelse og ekspllicit stilling fra hoved-sfÃĶrer og legeme-skeletter â trÃĶkkes fra drivende video. Disse fÃļres derefter ind i en DiT-model for at producere animeret udgang, med ansigts-bevÃĶgelse adskilt fra krop-stilling, hvilket tillader brug af lyd som driver.
Udseende-Vejledning
For at forbedre udseende-trofasthed, isÃĶr i skjulte eller sjÃĶldent synlige omrÃĨder, supplerer systemet det primÃĶre reference-billede med pseudo-references samplet fra input-videoen.
Klik for at afspille . Systemet forudser behovet for at gengive skjulte omrÃĨder nÃļjagtigt og konsekvent. Dette er omkring det tÃĶtteste, jeg har set, i et projekt af denne type, pÃĨ en CGI-stil bitmap-tekstur-tilgang.
Disse ekstra frames vÃĶlges for stilling-mangfoldighed ved hjÃĶlp af RTMPose og filtreres ved hjÃĶlp af CLIP-baseret lighed for at sikre, at de forbliver konsistente med emnets identitet.
Alle reference-frames (primÃĶre og pseudo) kodes af samme visuel encoder og kombineres gennem en selv-opmÃĶrksomheds-mekanisme, hvilket tillader modellen at fÃĨ adgang til komplementÃĶre udseende-kilder. Denne opsÃĶtning forbedrer dÃĶkning af detaljer sÃĨsom profil-views eller lem-texturer. Pseudo-references bruges altid under trÃĶning og valgfrit under slutning.
TrÃĶning
DreamActor blev trÃĶnet i tre faser for at introducere kompleksitet og forbedre stabilitet.
I den fÃļrste fase brugtes kun 3D-legeme-skeletter og 3D-hoved-sfÃĶrer som kontrol-signaler, og ansigts-reprÃĶsentationer udelades. Dette tillod den grundlÃĶggende video-genererings-model, initialiseret fra MMDiT, at tilpasse sig menneske-animasjon uden at blive overvÃĶldet af fin-granedede kontroller.
I den anden fase tilfÃļjedes implicit ansigts-reprÃĶsentationer, men alle andre parametre frosne. Kun ansigts-bevÃĶgelses-encoder og ansigts-opmÃĶrksomheds-lag trÃĶnedes pÃĨ dette punkt, hvilket muliggjorde, at modellen lÃĶrte udtryksfulde detaljer i isolation.
I den endelige fase blev alle parametre af-frosne for fÃĶlles optimering pÃĨ tvÃĶrs af udseende, stilling og ansigts-dynamik.
Data og Tests
Til test-fasen initialiseres modellen fra en forudtrÃĶnet image-to-video DiT checkpointâ og trÃĶnes i tre faser: 20.000 skridt for hver af de fÃļrste to faser og 30.000 skridt for den tredje.
For at forbedre generalisering pÃĨ tvÃĶrs af forskellige varighed og oplÃļsninger, samples video-klip tilfÃĶldigt med lÃĶngder mellem 25 og 121 frames. Disse resizes til 960x640px, mens de bevareder aspekt-forhold.
TrÃĶning udfÃļres pÃĨ otte (China-fokuseret) NVIDIA H20 GPUâer, hver med 96GB VRAM, ved hjÃĶlp af AdamW optimizer med en (tolerabelt hÃļj) lÃĶringsrate pÃĨ 5eâ6.
Ved slutning af trÃĶning indeholder hver video-segment 73 frames. For at opretholde konsistens pÃĨ tvÃĶrs af segmenter, genbruges den endelige latent fra et segment som den initiale latent for det nÃĶste, hvilket kontekstualiserer opgaven som sekventiel image-to-video-generering.
Klassifikator-fri vejledning anvendes med en vÃĶgt pÃĨ 2,5 for bÃĨde reference-billeder og bevÃĶgelses-kontrol-signaler.
Forskerne konstruerede en trÃĶnings-dataset (ingen kilder er nÃĶvnt i artiklen) bestÃĨende af 500 timer video fra diverse domÃĶner, der omfatter eksempler pÃĨ (bl.a.) dans, sport, film og offentlige taler. Datasettet var designet til at fange en bred spektrum af menneske-bevÃĶgelse og udtryk, med en jÃĶvn fordeling mellem fuld-kropps- og halv-kropps-shots.
For at forbedre ansigts-syntese-kvalitet inkorporeredes Nersemble i data-forberedelses-processen.

Eksempler fra Nersemble-dataset, brugt til at supplere data for DreamActor. Kilde: https://www.youtube.com/watch?v=a-OAWqBzldU
Til evaluering brugte forskerne deres dataset ogsÃĨ som en benchmark til at vurdere generalisering pÃĨ tvÃĶrs af forskellige scenarier.
Modellens prÃĶstation mÃĨles ved hjÃĶlp af standard-metrikker fra tidligere arbejde: FrÃĐchet Inception Distance (FID); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); og Peak Signal-to-Noise Ratio (PSNR) for frame-niveau-kvalitet. FrÃĐchet Video Distance (FVD) bruges til at vurdere temporal kohÃĶrens og samlet video-trofasthed.
Forskerne udfÃļrte eksperimenter pÃĨ bÃĨde krop-animasjon og portrÃĶt-animasjon-opgaver, alle anvendende en enkelt (mÃĨl) reference-billede.
For krop-animasjon sammenlignedes DreamActor-M1 med Animate Anyone; Champ; MimicMotion, og DisPose.

Kvantitative sammenligninger mod rivaliserende rammer.
Selv om PDFâen giver en statisk billed-sammenligning, kan en af videoer fra projekt-sitet mÃĨske hÃļjligere fremhÃĶve forskellene:
LYDINDHOLD. Klik for at afspille. En visuel sammenligning pÃĨ tvÃĶrs af udfordrer-rammer. Drivende video ses Ãļverst til venstre, og forfatternes konklusion om, at DreamActor producerer de bedste resultater, synes rimelig.
For portrÃĶt-animasjon-tests blev modellen evalueret mod LivePortrait; X-Portrait; SkyReels-A1; og Act-One.

Kvantitative sammenligninger for portrÃĶt-animasjon.
Forskerne pÃĨstÃĨr, at deres metode vinder i kvantitative tests, og hÃĶvder, at den ogsÃĨ er overlegen kvalitativt.
LYDINDHOLD. Klik for at afspille. Eksempler pÃĨ portrÃĶt-animasjon-sammenligninger.
Argumenteret som den tredje og sidste af klipene vist i videoen ovenfor udstiller en mindre overbevisende lip-sync sammenlignet med nogle af de rivaliserende rammer, selv om den generelle kvalitet er bemÃĶrkelsesvÃĶrdigt hÃļj.
Konklusion
I forventning om, at teksturer, der er antydet, men ikke faktisk til stede i det enlige mÃĨl-billede, der driver disse rekonstruktioner, har Bytedance adresseret en af de stÃļrste udfordringer for diffusion-baseret video-generering â konsekvente, vedvarende teksturer. Det nÃĶste logiske skridt efter at perfektionere en sÃĨdan tilgang ville vÃĶre at oprette en reference-atlas fra den oprindelige genererede klip, der kan anvendes til efterfÃļlgende, forskellige generationer, for at opretholde udseende uden LoRAs.
Selv om en sÃĨdan tilgang ville vÃĶre en ekstern reference, adskiller det sig ikke fra texture-mapping i traditionel CGI-teknik, og kvaliteten af realisme og trovÃĶrdighed er langt hÃļjere end, hvad disse ÃĶldre metoder kan opnÃĨ.
Det mest imponerende aspekt af DreamActor er dog det kombinerede tre-delt vejledningssystem, der brobygger den traditionelle klÃļft mellem ansigt-fokuseret og krop-fokuseret menneske-syntese pÃĨ en genial mÃĨde.
Det eneste, der blot skal ses, er, om nogle af disse kerne-principper kan udnyttes i mere tilgÃĶngelige tilbud; som det stÃĨr, synes DreamActor at vÃĶre bestemt til at blive endnu et syntese-som-en-service-tilbud, alvorligt begrÃĶnset af brugsbegrÃĶnsninger og af ulemperne ved at eksperimentere omfattende med en kommerciel arkitektur.
Â
* Min erstatning af hyperlinks for forfatterne; inline-citationer
â Som nÃĶvnt tidligere, er det ikke klart, hvilken smag af Stable Diffusion, der blev brugt i dette projekt.
FÃļrst offentliggjort fredag, 4. april 2025












