Unghiul lui Anderson
O avanțare notabilă în domeniul video-ului generat de inteligența artificială condus de oameni

Notă: Pagina proiectului pentru această lucrare conține 33 de videoclipuri de înaltă calitate care se autorepetă, cu o dimensiune totală de jumătate de gigabyte, ceea ce a destabilizat sistemul meu la încărcare. Din acest motiv, nu voi lega direct de ea. Citiitorii pot găsi URL-ul în rezumatul sau PDF-ul lucrării, dacă doresc.
Unul dintre obiectivele principale în cercetarea sintezei video actuale este generarea unei performanțe video complete conduse de inteligență artificială, pornind de la o singură imagine. În această săptămână, o nouă lucrare de la Bytedance Intelligent Creation a prezentat ceea ce poate fi cel mai cuprinzător sistem de acest fel până acum, capabil să producă animații complete și semi-corp, care combină detalii expresive faciale cu mișcări mari și precise, și care obține, de asemenea, o consistență îmbunătățită a identității – o zonă în care chiar și sistemele comerciale de top adesea nu reușesc.
În exemplul de mai jos, vedem o performanță condusă de un actor (sus-stânga) și derivată dintr-o singură imagine (sus-dreapta), care oferă o renderizare remarcabil de flexibilă și dexteră, fără niciuna dintre problemele obișnuite legate de crearea mișcărilor mari sau de “ghicirea” unor zone ascunse (adică părți ale îmbrăcămintei și unghiuri faciale care trebuie inferate sau inventate pentru că nu sunt vizibile în fotografia sursă):
Conținut audio. Faceți clic pentru a reda. O performanță ia naștere din două surse, inclusiv sincronizarea buzelor, care este de obicei păstrată de sisteme auxiliare dedicate. Acesta este o versiune redusă de pe site-ul sursă (a se vedea nota de la începutul articolului – se aplică tuturor celorlalte videoclipuri încorporate aici).
Deși putem observa unele provocări reziduale legate de persistența identității pe măsură ce fiecare clip se desfășoară, acesta este primul sistem pe care l-am văzut care excelează în general (deși nu întotdeauna) în menținerea identității pe o perioadă prelungită fără a utiliza LoRAs:
Conținut audio. Faceți clic pentru a reda. Alte exemple din proiectul DreamActor.
Noul sistem, intitulat DreamActor, utilizează un sistem de control hibrid cu trei părți care acordă o atenție specială expresiei faciale, rotației capului și proiectării scheletului central, permițând astfel performanțe conduse de inteligență artificială în care nici aspectul facial, nici cel al corpului nu suferă în detrimentul celuilalt – o capacitate rară, probabil necunoscută printre sisteme similare.
Mai jos, vedem una dintre aceste aspecte, rotația capului, în acțiune. Bilă colorată din colțul dreapta al fiecărui thumbnail indică un fel de gimbal virtual care definește orientarea capului independent de mișcarea și expresia facială, care este aici condusă de un actor (jos-stânga).
Faceți clic pentru a reda. Bilă multicoloră reprezentată aici reprezintă axa de rotație a capului avatarului, în timp ce expresia este alimentată de un modul separat și informat de performanța unui actor (văzut aici jos-stânga).
Una dintre funcționalitățile proiectului cele mai interesante, care nu este inclusă nici măcar în testele prezentate în lucrare, este capacitatea sa de a deriva mișcarea buzelor direct din audio – o capacitate care funcționează neobișnuit de bine, chiar și fără un actor care conduce video-ul.
Cercetătorii au concurat cu cei mai buni concurenți în acest domeniu, inclusiv Runway Act-One și LivePortrait, și raportează că DreamActor a reușit să obțină rezultate cantitative mai bune.
Deoarece cercetătorii își pot stabili propriile criterii, rezultatele cantitative nu sunt neapărat un standard empiric; dar testele calitative care le însoțesc par să susțină concluziile autorilor.
Din nefericire, acest sistem nu este destinat lansării publice, iar singura valoare pe care comunitatea o poate obține din această lucrare este în reproducerea potențială a metodologiilor prezentate în lucrare (așa cum s-a făcut cu efect notabil pentru Google Dreambooth în 2022 ).
Lucrarea afirmă*:
‘Animația imaginilor umane are riscuri sociale posibile, cum ar fi utilizarea abuzivă pentru a crea videoclipuri false. Tehnologia propusă poate fi utilizată pentru a crea videoclipuri false cu oameni, dar instrumentele de detectare existente [Demamba, Dormant] pot detecta aceste falsuri.
‘Pentru a reduce aceste riscuri, sunt necesare reguli etice clare și ghiduri de utilizare responsabilă. Vom restricționa strict accesul la modelele și codurile noastre de bază pentru a preveni utilizarea abuzivă.’
În mod firesc, considerațiile etice de acest fel sunt convenabile din punct de vedere comercial, deoarece oferă o justificare pentru accesul la modelul API, care poate fi apoi monetizat. ByteDance a făcut deja acest lucru o dată în 2025, făcând OmniHuman disponibil pentru credite plătite pe site-ul Dreamina. Prin urmare, deoarece DreamActor pare a fi un produs și mai puternic, acesta pare a fi rezultatul probabil. Ce rămâne de văzut este în ce măsură principiile sale, în măsura în care sunt explicate în lucrare, pot ajuta comunitatea cu sursă deschisă.
Noua lucrare, intitulată DreamActor-M1: Animație holistică, expresivă și robustă a imaginilor umane cu ghidare hibridă, provine de la șase cercetători de la Bytedance.
Metodă
Sistemul DreamActor propus în lucrare are ca scop generarea animației umane dintr-o imagine de referință și un video care conduce, utilizând un cadru Diffusion Transformer (DiT) adaptat pentru spațiu latent (aparent o variantă a Stable Diffusion, deși lucrarea citează doar publicația emblematică din 2022).
În loc să se bazeze pe module externe pentru a gestiona condiționarea de referință, autorii combină direct caracteristicile de aparență și mișcare în interiorul cadru DiT, permițând interacțiunea în spațiu și timp prin atenție:

Schema pentru noul sistem: DreamActor codifică poziția, mișcarea facială și aparența în latente separate, combinându-le cu latente video zgomotoase produse de un VAE 3D. Aceste semnale sunt fuzionate într-un Diffusion Transformer utilizând atenție auto și cross, cu greutăți împărtășite pe ramuri. Modelul este supervizat prin compararea ieșirilor denoisate cu latentele video curate. Sursă: https://arxiv.org/pdf/2504.01724
Pentru a face acest lucru, modelul utilizează un autoencoder variabil 3D preantrenat pentru a codifica atât video-ul de intrare, cât și imaginea de referință. Aceste latente sunt patchificate, concatenate și introduse în DiT, care le procesează în mod comun.
Această arhitectură se abate de la practica obișnuită de a atașa o rețea secundară pentru injecția de referință, care a fost abordarea pentru proiectele Animate Anyone și Animate Anyone 2.
În schimb, DreamActor construiește fuziunea în modelul principal în sine, simplificând proiectarea și îmbunătățind fluxul de informații între indicii de aparență și mișcare. Modelul este apoi antrenat utilizând coincidență de flux în loc de obiectivul difuziunii standard (coincidența fluxului antrenează modelele de difuziune prin predicția directă a câmpurilor de viteză între date și zgomot, ocolind estimarea scorului).
Ghidare de mișcare hibridă
Metoda de ghidare de mișcare hibridă care informează renderările neuronale combină tokeni de poziție derivați din schelete 3D ale corpului și sfere ale capului; reprezentări faciale implicite extrase prin intermediul unui codificator facial preantrenat; și tokeni de aparență de referință eșantionați din imaginea sursă.
Aceste elemente sunt integrate în cadrul Diffusion Transformer utilizând mecanisme de atenție distincte, permițând sistemului să coordoneze mișcarea globală, expresia facială și identitatea vizuală pe tot parcursul procesului de generare.
Pentru primul dintre acestea, în loc să se bazeze pe repere faciale, DreamActor utilizează reprezentări faciale implicite pentru a ghida generarea expresiei, aparent permițând un control mai fin asupra dinamicii faciale și decuplarea identității și a poziției capului de la expresie.
Pentru a crea aceste reprezentări, pipeline-ul detectează și taie regiunea facială din fiecare cadru al video-ului care conduce, redimensionând-o la 224×224. Fețele tăiate sunt procesate de un codificator de mișcare facială preantrenat pe setul de date PD-FGC, care este apoi condiționat de un strat MLP.

PD-FGC, utilizat în DreamActor, generează un cap care vorbește dintr-o imagine de referință cu control disjunct asupra sincronizării buzelor (din audio), poziția capului, mișcarea ochilor și expresia (din videoclipuri separate), permițând manipularea precisă și independentă a fiecăruia. Sursă: https://arxiv.org/pdf/2211.14506
Rezultatul este o secvență de tokeni de mișcare facială, care sunt injectați în Diffusion Transformer printr-un strat de atenție cross.
Același cadru susține, de asemenea, o variantă condusă de audio, în care un codificator separat este antrenat pentru a mapa direct intrările de vorbire în tokeni de mișcare facială. Acest lucru permite generarea de animație facială sincronizată – inclusiv mișcări ale buzelor – fără un video care conduce.
Conținut audio. Faceți clic pentru a reda. Sincronizarea buzelor derivată în întregime din audio, fără un video care conduce. Singura intrare a caracterului este fotografia statică vizibilă în dreapta sus.
În al doilea rând, pentru a controla poziția capului independent de expresia facială, sistemul introduce o reprezentare a sferei capului 3D (a se vedea video-ul încorporat mai devreme în acest articol), care decuplează dinamica facială de mișcarea globală a capului, îmbunătățind precizia și flexibilitatea în timpul animației.
Sferele capului sunt generate prin extragerea parametrilor faciali 3D – cum ar fi rotația și poziția camerei – din video-ul care conduce, utilizând metoda de urmărire FaceVerse.

Schema pentru proiectul FaceVerse. Sursă: https://www.liuyebin.com/faceverse/faceverse.html
Acești parametri sunt utilizați pentru a renderiza o sferă colorată proiectată pe planul imagine 2D, aliniată spațial cu capul care conduce. Mărimea sferei corespunde capului de referință, iar culoarea sa reflectă orientarea capului. Această abstracție reduce complexitatea învățării mișcării capului 3D, ajutând la conservarea formelor stilizate sau exagerate ale capetelor în personaje desenate din animație.

Vizualizarea sferei de control care influențează orientarea capului.
În final, pentru a ghida mișcarea corpului, sistemul utilizează schelete 3D ale corpului cu normalizare a lungimii oaselor adaptivă. Parametrii corpului și mâinii sunt estimați utilizând 4DHumans și HaMeR, ambele funcționând pe modelul SMPL-X al corpului.

SMPL-X aplică o plasă parametrică peste întregul corp uman din imagine, aliniindu-se cu poziția estimată și expresia pentru a permite manipularea conștientă de poziție utilizând plasa ca ghid volumetric. Sursă: https://arxiv.org/pdf/1904.05866
De la aceste ieșiri, se selectează articulații cheie, se proiectează în 2D și se conectează în hărți scheletice liniare. În contrast cu metodele cum ar fi Champ, care renderizează rețele complete ale corpului, această abordare evită impunerea unor priori de formă predefiniți și, prin faptul că se bazează exclusiv pe structura scheletică, modelul este încurajat să inferă forma și aparența corpului direct din imaginile de referință, reducând astfel biasul către tipuri de corp fixe și îmbunătățind generalizarea pe o gamă largă de poziții și tipuri de corp.
În timpul antrenamentului, scheletele 3D ale corpului sunt concatenate cu sferele capului și trecute printr-un codificator de poziție, care produce caracteristici care sunt apoi combinate cu latente video zgomotoase pentru a produce tokenii de zgomot utilizați de Diffusion Transformer.
În timpul inferenței, sistemul ține cont de diferențele scheletice dintre subiecți prin normalizarea lungimii oaselor. Modelul de editare a imaginilor SeedEdit preantrenat transformă atât imaginile de referință, cât și cele care conduc într-o configurație standard canonică. RTMPose este apoi utilizat pentru a extrage proporțiile scheletice, care sunt utilizate pentru a ajusta scheletul care conduce pentru a se potrivi cu anatomia subiectului de referință.

Prezentare generală a pipeline-ului de inferență. Pseudo-referințe pot fi generate pentru a îmbogăți indicii de aparență, în timp ce semnalele de control hibride – mișcarea facială implicită și poziția explicită din sferele capului și scheletele corpului – sunt extrase din video-ul care conduce. Acestea sunt apoi introduse într-un model DiT pentru a produce ieșiri animate, cu mișcarea facială decuplată de poziția corpului, permițând utilizarea audio-ului ca driver.
Ghidare de aparență
Pentru a îmbunătăți fidelitatea aparenței, în special în zonele ascunse sau rareori vizibile, sistemul completează imaginea de referință principală cu pseudo-referințe eșantionate din video-ul de intrare.
Faceți clic pentru a reda. Sistemul anticipează nevoia de a renderiza cu acuratețe și consecvență regiunile ascunse. Acesta este despre cât de aproape am văzut, într-un proiect de acest fel, de o abordare similară cu cea a texturii bitmap din CGI.
Aceste cadre suplimentare sunt selectate pentru diversitatea poziției utilizând RTMPose și filtrate utilizând similaritatea bazată pe CLIP pentru a se asigura că rămân consistente cu identitatea subiectului.
Toate cadrele de referință (principale și pseudo) sunt codificate de același codificator vizual și fuzionate printr-un mecanism de atenție auto, permițând modelului să acceseze indicii de aparență complementare. Acest setup îmbunătățește acoperirea detaliilor, cum ar fi vederile de profil sau texturile membrelor. Pseudo-referințele sunt întotdeauna utilizate în timpul antrenamentului și opțional în timpul inferenței.
Antrenament
DreamActor a fost antrenat în trei etape pentru a introduce gradual complexitatea și a îmbunătăți stabilitatea.
În prima etapă, s-au utilizat doar schelete 3D ale corpului și sfere 3D ale capului ca semnale de control, excluzând reprezentările faciale. Acest lucru a permis modelului de bază de generare a video-ului, inițializat din MMDiT, să se adapteze la animația umană fără a fi copleșit de controale fine.
În a doua etapă, s-au adăugat reprezentări faciale implicite, dar toți ceilalți parametri înghețați. Doar codificatorul de mișcare facială și straturile de atenție facială au fost antrenate în acest moment, permițând modelului să învețe detalii expresive în izolare.
În etapa finală, toți parametrii au fost decongelați pentru optimizarea comună a aparenței, poziției și dinamicii faciale.
Date și teste
Pentru faza de testare, modelul este inițializat dintr-un punct de plecare preantrenat al modelului DiT de la imagine la video și antrenat în trei etape: 20.000 de pași pentru fiecare dintre primele două etape și 30.000 de pași pentru a treia.
Pentru a îmbunătăți generalizarea pe diverse durate și rezoluții, clipele video au fost eșantionate aleator cu lungimi cuprinse între 25 și 121 de cadre. Acestea au fost apoi redimensionate la 960x640px, păstrând raportul de aspect.
Antrenamentul a fost efectuat pe opt (China-focused) GPU-uri NVIDIA H20, fiecare cu 96GB de VRAM, utilizând optimizerul AdamW cu o rată de învățare tolerabil de mare de 5e−6.
În timpul inferenței, fiecare segment de video a conținut 73 de cadre. Pentru a menține consistența pe segmente, ultimul latent dintr-un segment a fost reutilizat ca latent inițial pentru următorul, ceea ce contextualizează sarcina ca o generare secvențială de imagine la video.
Ghidarea fără clasificator a fost aplicată cu o greutate de 2,5 atât pentru imaginile de referință, cât și pentru semnalele de control al mișcării.
Autorii au construit un set de date de antrenament (fără surse menționate în lucrare) care cuprinde 500 de ore de video provenite din domenii diverse, prezentând exemple de dans, sport, film și discursuri publice. Setul de date a fost proiectat pentru a capta un spectru larg de mișcări și expresii umane, cu o distribuție egală între cadre cu corpul întreg și jumătate de corp.
Pentru a îmbunătăți calitatea sintezei faciale, Nersemble a fost încorporat în procesul de pregătire a datelor.

Exemple din setul de date Nersemble, utilizat pentru a îmbogăți datele pentru DreamActor. Sursă: https://www.youtube.com/watch?v=a-OAWqBzldU
Pentru evaluare, cercetătorii au utilizat setul de date și ca o bază de referință pentru a evalua generalizarea pe diverse scenarii.
Performanța modelului a fost măsurată utilizând metrice standard din lucrări anterioare: Distanța de începere a lui Fréchet (FID); Indexul de similaritate structurală (SSIM); Similaritatea perceptuală a patch-urilor de imagine învățate (LPIPS); și Raportul de semnal la zgomot de vârf (PSNR) pentru calitatea la nivel de cadru. Distanța de video a lui Fréchet (FVD) a fost utilizată pentru evaluarea coerenței temporale și a fidelității video globale.
Autorii au efectuat experimente pe sarcini de animație a corpului și a portretului, toate utilizând o singură imagine de referință (țintă).
Pentru animația corpului, DreamActor-M1 a fost comparat cu Animate Anyone; Champ; MimicMotion și DisPose.

Comparații cantitative cu cadre rivale.
Deși PDF-ul oferă o imagine statică ca o comparație vizuală, unul dintre videoclipurile de pe site-ul proiectului poate evidenția mai clar diferențele:
AUDIO CONTENT. Faceți clic pentru a reda. O comparație vizuală între cadrele rivale. Video-ul care conduce este vizibil în stânga sus, și concluzia autorilor că DreamActor produce cele mai bune rezultate pare rezonabilă.
Pentru testele de animație a portretului, modelul a fost evaluat împotriva LivePortrait; X-Portrait; SkyReels-A1 și Act-One.

Comparații cantitative pentru animația portretului.
Autorii menționează că metoda lor câștigă în testele cantitative și susțin că este, de asemenea, superioară calitativ.
AUDIO CONTENT. Faceți clic pentru a reda. Exemple de comparații de animație a portretului.
Probabil că al treilea și ultimul clip prezentat în videoclipul de mai sus prezintă o sincronizare a buzelor mai puțin convingătoare în comparație cu unele dintre cadrele rivale, deși calitatea generală este remarcabil de ridicată.
Concluzie
Prin anticiparea nevoii de a avea texturi care sunt implicate, dar nu sunt prezente în imaginea țintă care alimentează aceste recreări, Bytedance a abordat una dintre cele mai mari provocări cu care se confruntă generarea video-ului bazată pe difuzie – texturi persistente și consistente. Următorul pas logic după perfecționarea unei astfel de abordări ar fi să creeze o hartă de referință din clipul generat inițial, care ar putea fi aplicată generațiilor ulterioare, menținând astfel aparența fără a utiliza LoRAs.
Deși o astfel de abordare ar fi, în esență, o referință externă, aceasta nu diferă de tehnica de mapping a texturilor din CGI tradițional, iar calitatea de realism și plauzibilitate este mult mai ridicată decât cea pe care o pot obține metodele mai vechi.
Ceea ce este mai impresionant la DreamActor este sistemul de ghidare hibrid cu trei părți, care combină în mod ingenios divizia tradițională dintre sinteza umană axată pe față și cea axată pe corp.
Acum rămâne de văzut dacă unele dintre aceste principii de bază pot fi valorificate în oferte mai accesibile; așa cum stă, DreamActor pare a fi destinat să devină o ofertă de sinteză ca serviciu, puternic limitată de restricțiile de utilizare și de impracticabilitatea experimentării extinse cu o arhitectură comercială.
* Înlocuirea mea a link-urilor pentru autori; citări în text
† După cum s-a menționat anterior, nu este clar ce variantă de Stable Diffusion a fost utilizată în acest proiect.
Publicat pentru prima dată vineri, 4 aprilie 2025












