Andersons vinkel

En anmÃĪrkningsvÃĪrd framsteg inom mÃĪnnisko-styrd AI-video

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
Examples from the DreamActor project page.

Notera: Projektets sidor fÃķr detta arbete innehÃĨller 33 autospelande hÃķgupplÃķsta videor som sammanlagt ÃĪr en halv gigabyte, vilket destabiliserade mitt system nÃĪr jag laddade dem. Av den anledningen kommer jag inte att lÃĪnka direkt till dem. LÃĪsarna kan hitta URL:en i abstracten eller PDF:en om de vill.

En av de primÃĪra mÃĨlen inom nuvarande videosyntesforskning ÃĪr att generera en fullstÃĪndig AI-styrd videoprestation frÃĨn en enda bild. I veckan publicerades en ny artikel frÃĨn Bytedance Intelligent Creation som kan vara den mest omfattande systemet av detta slag hittills, kapabelt att producera full- och halvkroppsanimationer som kombinerar uttrycksfulla ansiktsdetaljer med exakta storskaliga rÃķrelser, samtidigt som den uppnÃĨr fÃķrbÃĪttrad identitetskonsekvens – ett omrÃĨde dÃĪr ÃĪven ledande kommersiella system ofta brister.

I exemplet nedan ser vi en prestation som drivs av en skÃĨdespelare (Ãķverst till vÃĪnster) och som hÃĪrrÃķr frÃĨn en enda bild (Ãķverst till hÃķger), som ger en anmÃĪrkningsvÃĪrt flexibel och smidig rendering, utan de vanliga problemen med att skapa stora rÃķrelser eller “gissa” om dolda omrÃĨden (dvs. delar av klÃĪder och ansiktsvinklar som mÃĨste antas eller uppfinnas eftersom de inte ÃĪr synliga i den enda kÃĪllbilden):

LJUDINNEHÅLL. Klicka fÃķr att spela. En prestation fÃķds ur tvÃĨ kÃĪllor, inklusive lip-sync, som vanligtvis ÃĪr dedikerade tillÃĪggsmoduler. Detta ÃĪr en reducerad version frÃĨn kÃĪllsidan (se noten i bÃķrjan av artikeln – gÃĪller alla andra inbÃĪddade videor hÃĪr).

Även om vi kan se nÃĨgra kvarstÃĨende utmaningar nÃĪr det gÃĪller att behÃĨlla identitet nÃĪr varje klipp fortskrider, ÃĪr detta det fÃķrsta system jag har sett som generellt (ÃĪven om inte alltid) behÃĨller ID under en lÃĪngre period utan att anvÃĪnda LoRAs:

LJUDINNEHÅLL. Klicka fÃķr att spela. Ytterligare exempel frÃĨn DreamActor-projektet.

Det nya systemet, med titeln DreamActor, anvÃĪnder ett treskiktat hybridkontrollsystem som ger sÃĪrskild uppmÃĪrksamhet ÃĨt ansiktsuttryck, huvudrotation och kÃĪrnskelettdesign, vilket mÃķjliggÃķr AI-styrda prestationer dÃĪr varken ansikts- eller kroppsdelen lider pÃĨ bekostnad av den andra – en sÃĪllsynt, mÃķjligen okÃĪnd fÃķrmÃĨga bland liknande system.

LÃĪngre ner ser vi en av dessa aspekter, huvudrotation, i aktion. Den fÃĪrgade bollen i hÃķrnet av varje miniatyrbild till hÃķger indikerar en slags virtuell gimbal som definierar huvudorientering oberoende av ansiktsrÃķrelse och uttryck, som hÃĪr drivs av en skÃĨdespelare (nedre vÃĪnster).

Klicka fÃķr att spela. Den fÃĪrgade bollen som visualiseras hÃĪr representerar rotationsaxeln fÃķr avatarhuvudet, medan uttrycket drivs av en separat modul och informeras av en skÃĨdespelares prestation (synlig hÃĪr nedre vÃĪnster).

En av projektets mest intressanta funktioner, som inte ens ingÃĨr ordentligt i papperets tester, ÃĪr dess fÃķrmÃĨga att hÃĪmta lip-sync-rÃķrelse direkt frÃĨn ljud – en fÃķrmÃĨga som fungerar ovanligt bra ÃĪven utan en drivande skÃĨdespelare-video.

Forskarna har tagit pÃĨ sig de bÃĪsta etablerade systemen i detta fÃķretag, inklusive det mycket berÃķmda Runway Act-One och LivePortrait, och rapporterar att DreamActor kunde uppnÃĨ bÃĪttre kvantitativa resultat.

Eftersom forskare kan stÃĪlla in sina egna kriterier ÃĪr kvantitativa resultat inte nÃķdvÃĪndigtvis en empirisk standard; men de tillhÃķrande kvalitativa testerna verkar stÃķdja fÃķrfattarnas slutsatser.

TyvÃĪrr ÃĪr detta system inte avsett fÃķr allmÃĪn utgivning, och den enda vÃĪrde som samhÃĪllet kan potentiellt hÃĪmta frÃĨn arbetet ÃĪr i att potentiellt reproducera metoderna som beskrivs i artikeln (sÃĨsom det gjordes med stor effekt fÃķr den lika stÃĪngda Google Dreambooth 2022 ).

Artikeln sÃĪger*:

‘MÃĪnnisko-bildanimation har mÃķjliga sociala risker, som att missbrukas fÃķr att skapa falska videor. Den fÃķreslagna tekniken kunde anvÃĪndas fÃķr att skapa falska videor av mÃĪnniskor, men befintliga upptÃĪcktsverktyg [Demamba, Dormant] kan upptÃĪcka dessa falska videor.

‘FÃķr att minska dessa risker ÃĪr tydliga etiska regler och ansvarsfulla anvÃĪndningsriktlinjer nÃķdvÃĪndiga. Vi kommer att strikt begrÃĪnsa tillgÃĨng till vÃĨra kÃĪrnmodeller och koder fÃķr att fÃķrhindra missbruk.’

Naturligtvis ÃĪr etiska ÃķvervÃĪganden av detta slag bekvÃĪma ur ett kommersiellt perspektiv, eftersom det ger en motivering fÃķr API-endast-ÃĨtkomst till modellen, som sedan kan kommersialiseras. ByteDance har redan gjort detta en gÃĨng 2025, genom att gÃķra den mycket berÃķmda OmniHuman tillgÃĪnglig fÃķr betalda poÃĪng pÃĨ Dreamina-webbplatsen. DÃĪrfÃķr, eftersom DreamActor mÃķjligen ÃĪr en ÃĪnnu starkare produkt, verkar detta vara det sannolika resultatet. Vad som ÃĨterstÃĨr att se ÃĪr i vilken utstrÃĪckning dess principer, sÃĨ lÃĨngt de fÃķrklaras i artikeln, kan hjÃĪlpa den Ãķppna kÃĪllkodsgemenskapen.

Den nya artikeln heter DreamActor-M1: Holistisk, Uttrycksfull och Robust MÃĪnnisko-Bildanimation med Hybridstyrning, och kommer frÃĨn sex Bytedance-forskare.

Metod

DreamActor-systemet som fÃķreslÃĨs i artikeln syftar till att generera mÃĪnniskoanimation frÃĨn en referensbild och en drivande video, med hjÃĪlp av en Diffusion Transformer (DiT) ramverk anpassat fÃķr latent utrymme (tycks vara nÃĨgon smak av Stable Diffusion, ÃĪven om artikeln endast citerar 2022 ÃĨrs landmÃĪrkepublikation).

I stÃĪllet fÃķr att fÃķrlita sig pÃĨ externa moduler fÃķr att hantera referensbetingning, kombinerar fÃķrfattarna utseende- och rÃķrelsefunktioner direkt inuti DiT-ryggraden, vilket mÃķjliggÃķr interaktion Ãķver tid och rum genom uppmÃĪrksamhet:

Schema fÃķr det nya systemet: DreamActor kodar pose, ansiktsrÃķrelse och utseende i separata latenter, kombinerar dem med brusiga videolatenter producerade av en 3D VAE. Dessa signaler kombineras inom en Diffusion Transformer med hjÃĪlp av sjÃĪlv- och korsuppmÃĪrksamhet, med delade vikter Ãķver grenar. Modellen Ãķvervakas genom att jÃĪmfÃķra avbrusade utdata med rena videolatenter. KÃĪlla: https://arxiv.org/pdf/2504.01724

Schema fÃķr det nya systemet: DreamActor kodar pose, ansiktsrÃķrelse och utseende i separata latenter, kombinerar dem med brusiga videolatenter producerade av en 3D VAE. Dessa signaler kombineras inom en Diffusion Transformer med hjÃĪlp av sjÃĪlv- och korsuppmÃĪrksamhet, med delade vikter Ãķver grenar. Modellen Ãķvervakas genom att jÃĪmfÃķra avbrusade utdata med rena videolatenter. KÃĪlla: https://arxiv.org/pdf/2504.01724

FÃķr att gÃķra detta anvÃĪnder modellen en fÃķrtrÃĪnad 3D variational autoencoder fÃķr att koda bÃĨde indata-videon och referensbilden. Dessa latenter patchificeras, konkateneras och matas in i DiT, som bearbetar dem gemensamt.

Denna arkitektur avviker frÃĨn den vanliga metoden att fÃĪsta en sekundÃĪr nÃĪtverk fÃķr referensinjektion, som var tillvÃĪgagÃĨngssÃĪttet fÃķr de inflytelserika Animate Anyone och Animate Anyone 2 projekt.

I stÃĪllet bygger DreamActor fusionen in i huvudmodellen sjÃĪlv, vilket fÃķrenklar designen samtidigt som det fÃķrbÃĪttrar informationsflÃķdet mellan utseende- och rÃķrelsekoder. Modellen trÃĪnas sedan med hjÃĪlp av flÃķdesmatchning snarare ÃĪn den standardmÃĪssiga diffusionssyftet (FlÃķdesmatchning trÃĪnar diffusionmodeller genom att direkt fÃķrutsÃĪga hastighetsfÃĪlt mellan data och brus, och hoppar Ãķver score-estimering).

Hybrid RÃķrelsestyrning

Hybrid RÃķrelsestyrningsmetoden som informerar de neurala renderingarna kombinerar pose-tokens som hÃĪrrÃķr frÃĨn 3D-kroppskelett och huvudskelett; implicita ansiktsrepresentationer extraherade av en fÃķrtrÃĪnad ansiktskodare; och referensutseenderepresentationer som sampas frÃĨn kÃĪllbilden.

Dessa element kombineras inom Diffusion Transformer med hjÃĪlp av olika uppmÃĪrksamhetsmekanismer, vilket mÃķjliggÃķr fÃķr systemet att koordinera global rÃķrelse, ansiktsuttryck och visuell identitet under genereringsprocessen.

FÃķr det fÃķrsta av dessa, i stÃĪllet fÃķr att fÃķrlita sig pÃĨ ansiktslandmÃĪrken, anvÃĪnder DreamActor implicita ansiktsrepresentationer fÃķr att styra uttrycksgenerering, vilket tycks mÃķjliggÃķra en finare kontroll Ãķver ansiktsdynamik samtidigt som det frikopplar identitet och huvudpose frÃĨn uttryck.

FÃķr att skapa dessa representationer, bearbetar pipelinen fÃķrst ansiktsomrÃĨdet i varje ram av den drivande videon, ÃĨterstorar det till 224×224 och bearbetar de beskurna ansiktena med en ansiktsrÃķrelsekodare som ÃĪr fÃķrtrÃĪnad pÃĨ PD-FGC datamÃĪngden, som sedan villkorsstyrs av en MLP lager.

PD-FGC, som anvÃĪnds i DreamActor, genererar en talarhuvud frÃĨn en referensbild med frikopplad kontroll av lip-sync (frÃĨn ljud), huvudpose, ÃķgonrÃķrelse och uttryck (frÃĨn separata videor), vilket mÃķjliggÃķr exakt, oberoende manipulation av var och en. KÃĪlla: https://arxiv.org/pdf/2211.14506

PD-FGC, som anvÃĪnds i DreamActor, genererar en talarhuvud frÃĨn en referensbild med frikopplad kontroll av lip-sync (frÃĨn ljud), huvudpose, ÃķgonrÃķrelse och uttryck (frÃĨn separata videor), vilket mÃķjliggÃķr exakt, oberoende manipulation av var och en. KÃĪlla: https://arxiv.org/pdf/2211.14506

Resultatet ÃĪr en sekvens av ansiktsrÃķrelsetoken, som injiceras i Diffusion Transformer genom en korsuppmÃĪrksamhetslager.

Samma ramverk stÃķder ocksÃĨ en ljud-styrd variant, dÃĪr en separat kodare trÃĪnas som kartar talinmatning direkt till ansiktsrÃķrelsetoken. Detta mÃķjliggÃķr generering av synkroniserad ansiktsanimation – inklusive lÃĪpprÃķrelser – utan en drivande video.

LJUDINNEHÅLL. Klicka fÃķr att spela. Lip-sync hÃĪmtad direkt frÃĨn ljud, utan en drivande skÃĨdespelare-video. Den enda karaktÃĪrinmatningen ÃĪr den statiska bilden som syns Ãķvre hÃķger.

Andra, fÃķr att kontrollera huvudpose oberoende av ansiktsuttryck, introducerar systemet en 3D-huvudskelettrepresentation (se video som ÃĪr inbÃĪddad tidigare i denna artikel), som frikopplar ansiktsdynamik frÃĨn global huvudrÃķrelse, vilket fÃķrbÃĪttrar precision och flexibilitet under animation.

Huvudskelett genereras genom att extrahera 3D-ansiktsparametrar – sÃĨsom rotation och kameraposition – frÃĨn den drivande videon med hjÃĪlp av FaceVerse spÃĨrningsmetoden.

Schema fÃķr FaceVerse-projektet. KÃĪlla: https://www.liuyebin.com/faceverse/faceverse.html

Schema fÃķr FaceVerse-projektet. KÃĪlla: https://www.liuyebin.com/faceverse/faceverse.html

Dessa parametrar anvÃĪnds fÃķr att rendera en fÃĪrgsfÃĪr som projiceras pÃĨ 2D-bildplanet, rumsligt justerad med den drivande huvudet. FÃĪrgsfÃĪrens storlek matchar referenshuvudet, och dess fÃĪrg ÃĨterspeglar huvudets orientering. Denna abstraktion minskar komplexiteten i att lÃĪra 3D-huvudrÃķrelse, vilket hjÃĪlper till att bevara stiliserade eller Ãķverdrivna huvudformer i tecknade figurer.

Visualisering av kontrollsfÃĪren som pÃĨverkar huvudorientering.

Visualisering av kontrollsfÃĪren som pÃĨverkar huvudorientering.

Slutligen, fÃķr att styra fullkropps-rÃķrelse, anvÃĪnder systemet 3D-kroppskelett med adaptiv benlÃĪngdsnormalisering. Kropps- och handparametrar uppskattas med hjÃĪlp av 4DHumans och den handfokuserade HaMeR, som bÃĨda opererar pÃĨ SMPL-X kroppmodellen.

SMPL-X applicerar en parametrisk mesh pÃĨ hela kroppen i en bild, justerad med uppskattad pose och uttryck fÃķr att mÃķjliggÃķra pose-medveten manipulation med hjÃĪlp av meshen som en volymetrisk guide. KÃĪlla: https://arxiv.org/pdf/1904.05866

SMPL-X applicerar en parametrisk mesh pÃĨ hela kroppen i en bild, justerad med uppskattad pose och uttryck fÃķr att mÃķjliggÃķra pose-medveten manipulation med hjÃĪlp av meshen som en volymetrisk guide. KÃĪlla: https://arxiv.org/pdf/1904.05866

FrÃĨn dessa utdata vÃĪljs nyckel-leder ut, projiceras till 2D och kopplas till linjebaserade skelett-kartor. Till skillnad frÃĨn metoder som Champ, som renderar fullkropps-mesh, undviker detta tillvÃĪgagÃĨngssÃĪtt att pÃĨtvinga fÃķrdefinierade form-prioriteter, och genom att fÃķrlita sig enbart pÃĨ skelett-struktur, uppmuntras modellen att hÃĪrleda kroppsform och utseende direkt frÃĨn referensbilderna, vilket minskar partiskhet mot fasta kroppstyper och fÃķrbÃĪttrar generalisering Ãķver en rad poser och kroppsbyggnader.

Under trÃĪning kombineras 3D-kroppskelett med huvudskelett och skickas genom en pose-kodare, som producerar funktioner som sedan kombineras med brusiga videolatenter fÃķr att producera brus-token som anvÃĪnds av Diffusion Transformer.

Vid inferens tar systemet hÃĪnsyn till skelett-skillnader mellan ÃĪmnen genom att normalisera benlÃĪngder. Den SeedEdit fÃķrtrÃĪnade bild-redigeringsmodellen omvandlar bÃĨde referens- och drivande bilder till en standard kanonisk konfiguration. RTMPose anvÃĪnds sedan fÃķr att extrahera skelett-proportioner, som anvÃĪnds fÃķr att justera den drivande skelettet fÃķr att matcha anatomin hos referens-ÃĪmnet.

Översikt av inferens-pipelinen. Pseudo-referenser kan genereras fÃķr att berika utseende-koder, medan hybrid-kontrollsignaler – implicit ansiktsrÃķrelse och explicit pose frÃĨn huvudskelett och kroppsskelett – extraheras frÃĨn den drivande videon. Dessa matas sedan in i en DiT-modell fÃķr att producera animerad utdata, med ansiktsrÃķrelse frikopplad frÃĨn kroppspose, vilket mÃķjliggÃķr anvÃĪndning av ljud som drivare.

Översikt av inferens-pipelinen. Pseudo-referenser kan genereras fÃķr att berika utseende-koder, medan hybrid-kontrollsignaler – implicit ansiktsrÃķrelse och explicit pose frÃĨn huvudskelett och kroppsskelett – extraheras frÃĨn den drivande videon. Dessa matas sedan in i en DiT-modell fÃķr att producera animerad utdata, med ansiktsrÃķrelse frikopplad frÃĨn kroppspose, vilket mÃķjliggÃķr anvÃĪndning av ljud som drivare.

Utseende-styrning

FÃķr att fÃķrbÃĪttra utseende-trogenhet, sÃĪrskilt i dolda eller sÃĪllan synliga omrÃĨden, kompletterar systemet den primÃĪra referensbilden med pseudo-referenser sampade frÃĨn indata-videon.

Klicka fÃķr att spela . Systemet fÃķrutser behovet av att ÃĨterge dolda omrÃĨden exakt och konsekvent. Detta ÃĪr sÃĨ nÃĪra en CGI-stil bitmap-textur-approach som jag har sett i ett projekt av detta slag.

Dessa ytterligare ramar vÃĪljs ut fÃķr pose-mÃĨngfald med hjÃĪlp av RTMPose, och filtreras med hjÃĪlp av CLIP-baserad likhet fÃķr att sÃĪkerstÃĪlla att de fÃķrblir konsekventa med ÃĪmnes identitet.

Alla referens-ramar (primÃĪra och pseudo) kodas av samma visuell kodare och kombineras genom en sjÃĪlv-uppmÃĪrksamhetsmekanism, vilket mÃķjliggÃķr fÃķr modellen att komma ÃĨt kompletterande utseende-koder. Detta setup fÃķrbÃĪttrar tÃĪckning av detaljer som profilvyer eller lem-texturer. Pseudo-referenser anvÃĪnds alltid under trÃĪning och valfritt under inferens.

TrÃĪning

DreamActor trÃĪnades i tre steg fÃķr att gradvis introducera komplexitet och fÃķrbÃĪttra stabilitet.

I det fÃķrsta steget anvÃĪndes endast 3D-kroppskelett och 3D-huvudskelett som kontrollsignaler, exklusive ansiktsrepresentationer. Detta mÃķjliggjorde fÃķr den basala videogenereringsmodellen, initierad frÃĨn MMDiT, att anpassa sig till mÃĪnnisko-animation utan att ÃķvervÃĪldigas av fina kontroller.

I det andra steget lades implicita ansiktsrepresentationer till, men alla andra parametrar frystes. Endast ansiktsrÃķrelse-kodaren och ansikts-uppmÃĪrksamhets-lagren trÃĪnades vid denna punkt, vilket mÃķjliggjorde fÃķr modellen att lÃĪra sig uttrycksfulla detaljer i isolering.

I det sista steget frystes alla parametrar fÃķr gemensam optimering Ãķver utseende, pose och ansiktsdynamik.

Data och Tester

FÃķr testfasen initieras modellen frÃĨn en fÃķrtrÃĪnad bild-till-video DiT-checkpoint† och trÃĪnas i tre steg: 20 000 steg fÃķr var och en av de fÃķrsta tvÃĨ stegen och 30 000 steg fÃķr det tredje.

FÃķr att fÃķrbÃĪttra generalisering Ãķver olika varaktigheter och upplÃķsningar sampas videoklipp slumpmÃĪssigt med lÃĪngder mellan 25 och 121 ramar. Dessa ÃĨterstoras sedan till 960x640px, med bibehÃĨllen aspekt-fÃķrhÃĨllande.

TrÃĪning utfÃķrdes pÃĨ ÃĨtta (Kina-fokuserade) NVIDIA H20 GPU:er, var och en med 96GB VRAM, med AdamW optimeraren och en (acceptabelt hÃķg) inlÃĪrningshastighet pÃĨ 5e−6.

Vid inferens innehÃĨller varje videosegment 73 ramar. FÃķr att upprÃĪtthÃĨlla konsekvens Ãķver segment ÃĨteranvÃĪnds den sista latenten frÃĨn ett segment som den initiala latenten fÃķr nÃĪsta segment, vilket kontextualiserar uppgiften som sekventiell bild-till-video-generering.

Klassificeringsfri styrning applicerades med en vikt pÃĨ 2,5 fÃķr bÃĨde referensbilder och rÃķrelse-kontrollsignaler.

FÃķrfattarna konstruerade en trÃĪningsdatamÃĪngd (ingen kÃĪlla anges i artikeln) bestÃĨende av 500 timmar video frÃĨn olika domÃĪner, som innehÃĨller exempel pÃĨ (bland annat) dans, sport, film och offentliga tal. DatamÃĪngden designades fÃķr att fÃĨnga en bred spektrum av mÃĪnsklig rÃķrelse och uttryck, med en jÃĪmn fÃķrdelning mellan fullkropps- och halvkropps-shots.

FÃķr att fÃķrbÃĪttra ansikts-syntes-kvalitet inkorporerades Nersemble i datamÃĪngdsberedningsprocessen.

Exempel frÃĨn Nersemble-datamÃĪngden, som anvÃĪnds fÃķr att fÃķrbÃĪttra datamÃĪngden fÃķr DreamActor. KÃĪlla: https://www.youtube.com/watch?v=a-OAWqBzldU

Exempel frÃĨn Nersemble-datamÃĪngden, som anvÃĪnds fÃķr att fÃķrbÃĪttra datamÃĪngden fÃķr DreamActor. KÃĪlla: https://www.youtube.com/watch?v=a-OAWqBzldU

FÃķr utvÃĪrdering anvÃĪnde forskarna sin datamÃĪngd ocksÃĨ som en benchmark fÃķr att bedÃķma generalisering Ãķver olika scenarier.

Modellens prestation mÃĪttes med standard-mÃĨtt frÃĨn tidigare arbete: FrÃĐchet Inception Distance (FID); Strukturell likhetsindex (SSIM); LÃĪrd perceptuell bild-patch-likhet (LPIPS); och Peak Signal-till-Brus-fÃķrhÃĨllande (PSNR) fÃķr ram-nivÃĨ-kvalitet. FrÃĐchet Video Distance (FVD) anvÃĪndes fÃķr att bedÃķma tidsmÃĪssig samstÃĪmmighet och Ãķvergripande video-trogenhet.

FÃķrfattarna genomfÃķrde experiment pÃĨ bÃĨde kroppsanimering och portrÃĪtt-animering-uppgifter, alla med en enda (mÃĨl) referensbild.

FÃķr kroppsanimering jÃĪmfÃķrdes DreamActor-M1 med Animate Anyone; Champ; MimicMotion; och DisPose.

Kvantitativa jÃĪmfÃķrelser mot rivaliserande ramverk.

Kvantitativa jÃĪmfÃķrelser mot rivaliserande ramverk.

Även om PDF:en tillhandahÃĨller en statisk bild som en visuell jÃĪmfÃķrelse, kan en av videorna frÃĨn projektwebbplatsen bÃĪttre belysa skillnaderna:

LJUDINNEHÅLL. Klicka fÃķr att spela. En visuell jÃĪmfÃķrelse Ãķver rivaliserande ramverk. Den drivande videon syns Ãķvre vÃĪnster, och fÃķrfattarnas slutsats att DreamActor producerar de bÃĪsta resultaten verkar rimlig.

FÃķr portrÃĪtt-animeringstester utvÃĪrderades modellen mot LivePortrait; X-Portrait; SkyReels-A1; och Act-One.

Kvantitativa jÃĪmfÃķrelser fÃķr portrÃĪtt-animering.

Kvantitativa jÃĪmfÃķrelser fÃķr portrÃĪtt-animering.

FÃķrfattarna pÃĨpekar att deras metod vinner i kvantitativa tester, och hÃĪvdar att den ocksÃĨ ÃĪr ÃķverlÃĪgsen kvalitativt.

LJUDINNEHÅLL. Klicka fÃķr att spela. Exempel pÃĨ portrÃĪtt-animeringsjÃĪmfÃķrelser.

Troligen ÃĪr det tredje och sista av klippen som visas i videon ovan mindre Ãķvertygande lip-sync jÃĪmfÃķrt med nÃĨgra av de rivaliserande ramverken, ÃĪven om den allmÃĪnna kvaliteten ÃĪr anmÃĪrkningsvÃĪrt hÃķg.

Slutsats

Genom att fÃķrutse behovet av texturer som antyds men inte faktiskt nÃĪrvarande i den enda mÃĨlbilden som driver dessa rekreationsfÃķrsÃķk, har Bytedance hanterat en av de stÃķrsta utmaningarna som stÃĨr infÃķr diffusion-baserad videogenerering – konsekventa, bestÃĨende texturer. NÃĪsta logiska steg efter att ha perfektionerat ett sÃĨdant tillvÃĪgagÃĨngssÃĪtt vore att pÃĨ nÃĨgot sÃĪtt skapa en referens-atlas frÃĨn den initiala genererade klippen som kunde appliceras pÃĨ efterfÃķljande, olika generationer, fÃķr att upprÃĪtthÃĨlla utseende utan LoRAs.

Även om ett sÃĨdant tillvÃĪgagÃĨngssÃĪtt i praktiken fortfarande skulle vara en extern referens, skiljer det sig inte frÃĨn texture-mapping i traditionella CGI-tekniker, och realism- och trovÃĪrdighetskvaliteten ÃĪr avsevÃĪrt hÃķgre ÃĪn vad dessa ÃĪldre metoder kan uppnÃĨ.

Sagt och gjort, den mest imponerande aspekten av DreamActor ÃĪr det kombinerade tre-delade styrningssystemet, som brottar den traditionella klyftan mellan ansikts-fokuserad och kroppsfokuserad mÃĪnnisko-syntes pÃĨ ett genialt sÃĪtt.

Det ÃĨterstÃĨr att se om nÃĨgra av dessa grundlÃĪggande principer kan utnyttjas i mer tillgÃĪngliga erbjudanden; sÃĨ som det ÃĪr, verkar DreamActor vara dÃķmt att bli ÃĪnnu ett syntes-tjÃĪnst-erbjudande, allvarligt begrÃĪnsat av restriktioner pÃĨ anvÃĪndning, och av det praktiska problemet med att experimentera omfattande med en kommersiell arkitektur.

 

* Min substitution av hyperlÃĪnkar fÃķr fÃķrfattarna; inline-citationer

† Som nÃĪmnts tidigare, ÃĪr det inte klart vilken smak av Stable Diffusion som anvÃĪndes i detta projekt.

Publicerad fÃķrsta gÃĨngen fredag, 4 april 2025

FÃķrfattare pÃĨ maskinlÃĪrande, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]