Unghiul lui Anderson
Înspre Generarea de Videoclipuri Deepfake cu Corp Întreg Perpetuu

Într-un domeniu în care răbdarea este necesară, un nou sistem ne apropie puțin mai mult de simularea umană live, fără rotunjirea frustrantă.
Stadiul actual al simulării umane pe termen lung a parcurs un drum lung de la momentul în care a apărut posibilitatea de a crea deepfakes cu corp întreg în 2022. Între timp, ne-am obișnuit cu abilitatea formidabilă și adesea controversată a sistemelor open-source, cum ar fi Wan-Animate, și a sistemelor closed-source, cum ar fi Grok, de a converti una sau mai multe imagini într-o performanță video consistentă și adesea transformatoare:
Faceți clic pentru a reda dacă este necesar. Exemple de înlocuire a persoanei cu WanAnimate-2.2. Vă rugăm să consultați sursa pentru o rezoluție mai bună. Sursă
În plus, vechea arhitectură bazată pe autoencoder pentru deepfakes faciale live DeepFaceLive a fost depășită de cadre mai sofisticate, cum ar fi Deep-Live-Cam, care utilizează o orchestrare a iterațiilor LivePortrait, precum și module legacy GAN și InsightFace, pentru a crea un succesor eficient în timp real al proiectului (abandonat) DFLive:
Faceți clic pentru a reda: Elon Musk a fost supus unui deepfake într-o sesiune video live prin intermediul Deep-Live-Cam. Vă rugăm să consultați sursa pentru o rezoluție mai bună. Sursă
Cu toate acestea, în timp ce cadre precum Deep-Live-Cam pot rula pentru totdeauna și pot crea deepfakes pentru totdeauna, și deși sunt mai bune la generarea unor unghiuri faciale dificile decât erau înainte, rezultatele sunt, totuși, limitate în ceea ce privește rezoluția și capacitatea: puteți obține o anumită față/identitate, și poate face multe lucruri, cum ar fi expresii faciale convingătoare și sincronizare a buzelor – dar este, în esență, o “una pentru toate” soluție.
BRB…
Majoritatea sistemelor actuale de simulare umană cu ajutorul inteligenței artificiale sunt, de asemenea, limitate și/sau “specializate”. O anumită constrângere recurentă este aceea că cele mai bune sisteme de simulare/imitare umană sunt offline – adică, sunt prea consumatoare de resurse pentru a funcționa în timp real și, în schimb, au nevoie să “plece”, să calculeze soluția și să prezinte rezultatul utilizatorului mai târziu.
În mod evident, astfel de sisteme nu sunt potrivite pentru transmutarea live a inteligenței artificiale, cum ar fi transformarea unei game întregi de mișcări ale corpului, cum ar fi dansul, într-un flux live.
Un exemplu în acest sens, în ultimii ani, este Wan2.2 Animate, care s-a dovedit a fi un succes în rândul comunității de hobby și al revânzătorilor profesioniști – dar, din nou, este o situație “generează și așteaptă”:
Faceți clic pentru a reda. Din 2025, exemple ale capacităților impresionante ale Wan2.2-Animate – dacă puteți avea un pic de răbdare. Vă rugăm să consultați sursa pentru o rezoluție mai bună. Sursă
Deci, așa cum stau lucrurile, puteți avea o soluție excelentă, versatilă sau disponibilă imediat – alegeți două.
LiveAnimate
În această situație de “împăciuire” mexicană, vine o nouă ofertă din China, care transformă, în esență, Wan2.2 Animate într-un cadru de animație live, care funcționează, în prezent, la o rată de aproximativ 20 de cadre pe secundă, cu rezultate impresionante într-o gamă de scenarii:
Faceți clic pentru a reda: De pe site-ul proiectului, LiveAnimate transferă pozele de conducere pe scenarii de dans, peisaje exterioare cu corp întreg și portrete închise, reproducând mișcarea întregului corp, a mâinilor și a feței. Vă rugăm să consultați sursa pentru o rezoluție mai bună. Sursă
Noul sistem prelungește sistemul original într-o versiune live, schimbând modul în care este generat videoclipul: în loc de a procesa cadrele trecute și viitoare împreună, LiveAnimate generează fiecare nou segment pe măsură ce acțiunea se desfășoară, folosind doar câteva pași, în timp ce păstrează anumite poze anterioare selectate pentru a menține aspectul subiectului consistent pe perioade lungi de timp.
În esență, sistemul păstrează cadrele anterioare ca o metodă de memorie persistentă pentru a se baza pe ele pe măsură ce videoclipul se dezvoltă, astfel încât identitatea să rămână consistentă – nu este cu totul diferit de modul în care vechile sisteme CGI se referă la hărți de textură.
Deși un LoRA este implicat în etapa de procesare, LiveAnimate nu este doar un alt sistem LoRA – generarea sa de streaming, sistemul de memorie/poză, inferența în trei pași și optimizările GPU reprezintă mecanisme suplimentare, pe lângă diversele alte tehnologii (unele surprinzător de vechi) din repertoriul său.
Noul sistem poate face față nu numai scenariilor de conducere cu corp întreg, cum ar fi cele din exemplele de mai sus, ci și mișcărilor corpului superior, cum ar fi în scenarii de interviu:
Faceți clic pentru a reda. ‘Mișcări subtile ale capului și mâinilor pe un fundal de birou static’.
Pentru a fi corect cu privire la limitările sale, noul articol recunoaște că două dintre cadrele rivale testate împotriva LiveAnimate au putut să păstreze identitatea puțin mai bine în anumite circumstanțe specifice; cu toate acestea, niciunul dintre competitori nu este un sistem online, ci offline, și autorii noului sistem sunt, în mod evident, împingând limitele într-o direcție plauzibilă și optimistă.
În plus, poate fi worth de menționat că inferența necesită două GPU-uri H100 NVIDIA, pentru un total de 160 GB de VRAM*.
Articolul afirmă:
‘LiveAnimate menține o calitate perceptuală și o identitate aproape constantă de la primii 30 de secunde până la ultimul [minut], în timp ce sistemele anterioare se degradează substanțial sau necesită ore de calcul offline pentru aceeași derulare.
‘Aceste rezultate stabilesc un nou punct de operare în ceea ce privește calitatea, latența și durata pentru animația interactivă cu corp întreg.’
Noul articol se intitulează LiveAnimate: Animație Umană Stabilă cu Forme Lungi în Timp Real și provine de la nouă autori de la Universitatea Chineză din Hong Kong, Grupul de Afaceri Qwen al companiei Alibaba și Liblib AI. Un site de proiect, plin cu videoclipurile prezentate și în acest articol, este disponibil, în timp ce codul este ‘în curând’, iar greutățile… cine știe?
Metodă
LiveAnimate constituie un proces de antrenament în două etape, destinat să facă Wan2.2-Animate să genereze continuu și rapid, urmat de un sistem de memorie care recuperează poze utile anterioare pe măsură ce fiecare nou bloc de videoclip este produs:
O prezentare generală a pipeline-ului LiveAnimate, care arată procesul său de antrenament în două etape pe partea stângă și generarea live pe partea dreaptă, unde pozele care intră sunt comparate cu pozele anterioare stocate și combinate cu cadrele recente pentru a genera fiecare nou bloc de videoclip în trei pași. Sursă
Sistemul original Wan2.2-Animate este proiectat să considere o întreagă secvență, mai degrabă decât să genereze un videoclip care se extinde indefinit. Prin urmare, pentru a-l adapta, autorii au împărțit videoclipurile de antrenament în blocuri consecutive, cu fiecare generat folosind blocurile anterioare ca context/adevăr. Acest lucru învață inițial modelul să continue de la materialul anterior de încredere, înainte de a trebui să facă față erorilor acumulate din propria sa ieșire.
Uită-mă
Pe tot parcursul acestui proces, imaginea de referință originală este păstrată permanent disponibilă prin intermediul unui “Ref Sink”, oferind o amintire fixă a identității și aspectului persoanei. Odată ce un bloc a fost finalizat, o “Actualizare Curată KV” convertește informațiile obținute din acesta în context istoric pentru blocurile ulterioare (deși acest lucru nu repară erorile existente).
Acest prim stadiu de antrenament necesită încă 50 de pași de denoising pe bloc, făcând operarea live impracticabilă. Prin urmare, al doilea stadiu distilează procesul la trei pași, în timp ce expune modelul la propria sa istorie generată, deoarece implementarea necesită ca fiecare nou segment să depindă de ieșirea imperfectă anterioară:
Cele două etape de antrenament† utilizate pentru a pregăti LiveAnimate pentru implementare, mai întâi învățând de la blocuri de videoclip curate anterioare – apoi reducând generarea la trei pași, în timp ce se antrenează pe propria sa ieșire imperfectă.
Antrenamentul împotriva acestor secvențe generate de sine prezintă o altă problemă, deoarece păstrarea întregii istorii computaționale a unui videoclip ar fi prohibitiv de scump. În schimb, se face o singură rundă de practică, apoi se revine, bloc cu bloc, pentru antrenament. Fiecare bloc poate primi, astfel, o actualizare fără a păstra întreaga secvență “activă” din punct de vedere computațional.
Combinate cu adaptarea LoRA, acest lucru permite modelului cu 14 miliarde de parametri să fie distilat pe un singur nod care conține opt GPU-uri H100 de 80 GB (notând că acest cluster este pentru antrenament, nu pentru inferență în timpul rulării).
Nu Te Oprești Acum
Pentru generarea indefinită, LiveAnimate trebuie, de asemenea, să decidă ce merită să fie păstrat. Păstrarea a totului ar face ca cerințele de procesare să explodeze; dar păstrarea doar a cadrelor recente ar putea, de asemenea, să arunce poze utile anterioare.
Prin urmare, Atenția Sink de Recuperare a Pozei (PR-Sink) abordează acest lucru, păstrând primul bloc generat ca o “Scufundare Statică” permanentă – o poză anterioară relevantă, care funcționează ca o “Scufundare Dinamică” înlocuibilă, și o fereastră care conține blocul curent și două blocuri precedente. Imaginea de referință rămâne disponibilă separat prin Ref Sink, în timp ce dimensiunile de stocare fixe previn creșterea costurilor pe măsură ce lungimea videoclipului crește.
Războaie de Blocuri
Pentru a alege poze mai vechi pentru această memorie limitată, ViTPose reduce pozițiile corpului și mâinilor pe trei cadre într-o reprezentare compactă. Baza de date conține cinci astfel de poze reprezentative și este populată în primele 20 de blocuri, favorizând poze variate în detrimentul duplicatelor apropiate.
În timpul generării, poza care intră este comparată cu aceste reprezentanți și se recuperează cea mai bună potrivire, oferind dovezi anterioare despre cum arăta persoana într-o poziție similară. Cu toate acestea, blocul imediat precedent este exclus, deoarece acesta se află deja în fereastra care rulează, lăsând Scufundarea Dinamică să recupereze informații din timpul anterior.
În final, rularea în timp real este optimizată pentru viteză prin distribuirea procesării atenției pe două GPU-uri H100, suprapunând comunicarea cu calculul și reutilizând informațiile stocate ori de câte ori este posibil.
Date și Teste
LiveAnimate a fost antrenat pe 40.000 de videoclipuri de vorbire de la AVSpeech și 20.000 de videoclipuri cu mișcări umane de la TikTok dataset și HumanVid, cu antrenament și inferență care suportă rezoluții de 480×480; 384×672; și 672×384 de pixeli.
Antrenamentul a început de la punctul de referință Wan2.2-Animate-14B, folosind LoRA cu rang 128 și a continuat pe opt GPU-uri H100 pentru 10.000 de pași în prima etapă și 20.000 în a doua.
Videoclipul a fost generat în blocuri de trei cadre latente (reprezentarea internă comprimată a modelului), corespunzătoare la 12 cadre RGB, în timp ce inferența a fost efectuată pe cele două H100.
Evaluarea a comparat LiveAnimate cu metodele existente de animație umană bazate pe poze, atât pentru secvențe scurte, cât și pentru secvențe lungi, folosind imagini de referință și poze de conducere în condiții consistente. Testele pe termen lung au extins generarea la trei minute pentru a examina dacă calitatea și identitatea rămân stabile în timp.
Framework-urile testate au fost EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; și Wan2.2-Animate.
Metricile utilizate au acoperit calitatea vizuală, consistența identității, calitatea distribuțională și eroarea de reprezentare temporală. Scorul Estetic (ASE) și Evaluarea Calității Imaginii fără Referință (IQA) au măsurat calitatea vizuală la nivel de cadru; DINO, similaritate (DINO-S), și consistența aspectului cu identitatea de referință; Distanța de Începtare Fréchet (FID), calitatea distribuțională; și Distanța de Caracteristici VideoMAE (V-MAE), modul în care videoclipul generat a păstrat mișcarea în timp:
Rezultatele testelor referitoare la calitate și identitate pe parcursul a trei minute de generare continuă, cu LiveAnimate rămânând relativ stabil pe toate cele cinci metrice pe măsură ce secvența progresează. Mai multe metode concurente arată o deteriorare mai mare în timp. Citirile mai mari sunt mai bune pentru IQA, ASE și DINO-S, cu citiri mai mici mai bune pentru FID și V-MAE.
După cum se arată în graficul inițial de rezultate de mai sus, LiveAnimate a obținut cel mai mare scor ASE inițial de 2,823 și IQA de 4,047, în primii 30 de secunde. Autorii susțin că acest lucru indică faptul că distilarea în trei pași păstrează calitatea perceptuală, în ciuda bugetului redus de inferență.
Mai semnificativ, LiveAnimate a arătat o deteriorare mică pe parcursul a trei minute de generare continuă, cu scorurile sale de calitate vizuală și consistență a identității rămânând aproape neschimbate.
Pe de altă parte, One-to-All s-a deteriorat substanțial în timp, cu o calitate vizuală și o consistență a identității mai scăzute și o eroare de distribuție mai mare; și Wan2.2-Animate de bază a arătat, de asemenea, o pierdere a consistenței identității.
Autorii afirmă:
‘Aceste tendințe susțin afirmația noastră centrală că gestionarea explicită a contextului pe termen lung este importantă pentru animația de streaming.’
Eficiența de scalare a LiveAnimate a fost, de asemenea, testată pe mai multe GPU-uri. Așa cum se arată mai jos, s-a obținut o rată de 12,41 cadre pe secundă cu un singur H100; 19,63 cadre pe secundă cu două; și 22,13 cadre pe secundă cu patru, cu câștigurile fiind din ce în ce mai limitate de suprapunerea comunicării. Prin urmare, două H100 au fost selectate ca configurație preferată:
Eficiența de scalare pe unul, două și patru GPU-uri H100 la o rezoluție de 480×480, arătând latența, rata de cadre, viteza și eficiența. Două GPU-uri au obținut 19,63 cadre pe secundă, în timp ce o scalare suplimentară la patru a produs doar o creștere modestă la 22,13 cadre pe secundă.
La 19,63 cadre pe secundă, fiecare bloc de 12 cadre a fost generat în 0,611 secunde. În comparație, aproximativ 2–5 ore au fost necesare sistemelor concurente pentru a genera aceeași secvență de trei minute.
Testele calitative au evidențiat diferențe similare: în testul de corp întreg prezentat mai jos, s-a observat o deteriorare severă la One-to-All; s-a produs flickering la UniAnimate-DiT și SCAIL; și ulterioară drift de culoare sau fundal a devenit evidentă cu Wan-Animate și EverAnimate.

Rezultatele testelor comparative pentru animația corpului întreg pe parcursul a trei minute. Cadrele au fost eșantionate la fiecare 20 de secunde, cu annotații roșii care evidențiază deteriorarea pe termen lung a metodelor concurente. Liniile de bază au necesitat aproximativ 2–5 ore pentru a genera secvența, comparativ cu aproximativ patru minute pentru LiveAnimate. Vă rugăm să consultați sursa pentru o rezoluție mai bună.
LiveAnimate a menținut aspectul subiectului și scena înconjurătoare pe parcursul întregii secvențe de trei minute. În testul mai puțin solicitant al corpului superior prezentat mai jos, s-a obținut o stabilitate similară pe termen lung de către EverAnimate și LiveAnimate (deși generarea în timp real a fost oferită doar de LiveAnimate):

Rezultatele testelor comparative pentru animația corpului superior pe parcursul a trei minute. Cadrele eșantionate la fiecare 20 de secunde arată LiveAnimate menținând identitatea, îmbrăcămintea și fundalul întunecat mai consistent decât metodele concurente.
Autorii concluzionează:
‘Pe testul de trei minute, LiveAnimate menține o calitate perceptuală și o identitate aproape constantă la 19,63 cadre pe secundă pe două GPU-uri H100, cu memorie și latență independente de durata fluxului, în timp ce liniile de bază offline se degradează vizibil sau necesită ore de calcul.
‘Aceste rezultate aduc modelele de difuzie video la scară de miliarde în domeniul aplicațiilor interactive, cum ar fi difuzarea live, prezența virtuală și avatarurile virtuale.’
Concluzie
Este încurajator să vedem un cadru de generare care abordează în mod inovator problemele persistente de memorie și identitate care afectează videoclipurile generate. Există deja multe cadre generative care pot face referință la imagini fixe furnizate de utilizator, fără a necesita “lipirea” imaginii de referință în conținutul esențial imagine-la-videoclip.
Cu toate acestea, acest lucru rezolvă doar unele dintre problemele generării unui singur videoclip, cum ar fi păstrarea identității (inclusiv îmbrăcămintea și coafura) unei persoane care reintră în cadru, sau care a devenit momentan ascunsă, și apoi este văzută din nou. Până în prezent, doar abordarea grea și temporară LoRA a făcut progrese în aceste chestiuni, deși limitate și provizorii.
Pentru videoclipuri, și, de fapt, pentru întreaga revoluție actuală a inteligenței artificiale, dezvoltarea unei memorii persistente eficiente este o problemă critică și existențială – una care va defini, probabil, diferența dintre apariția inteligenței artificiale generale sau a unei a treia ierni a inteligenței artificiale.
* Este acesta un “gotcha” în continuare? Gândirea actuală este aceea că modelele mai mici și specializate pot funcționa, în cele din urmă, local, fără taxe, în timp ce nevoile de nivel superior sunt deservite de o piață concurențială și, sperăm, fragmentată a închirierii GPU-urilor. Acest lucru presupune că companiile de frontieră nu vor EEE concurența și că computarea GPU de nivel superior rămâne disponibilă, indiferent de situație. Pe această bază, nu mai consider cerințele GPU excesive ca un demerit, ci sper ca accesul să devină din ce în ce mai democratic și ca optimizările ulterioare să reducă cerințele inițiale de resurse.
† Generat și verificat de mine.
†† Pentru testarea videoclipurilor lungi, SCAIL și UniAnimate-DiT au fost extinse cu aceeași procedură de fereastră de alunecare fără antrenament, deoarece niciuna dintre ele nu suportă în mod nativ generarea de forme lungi. EverAnimate și One-to-All au fost evaluate folosind metodele lor proprii de generare a videoclipurilor lungi.
Publicat pentru prima dată joi, 13 august 2026












