Andersons vinkel
Mod fuldt-krop dybfake video-generering

I et felt, hvor tålmodighed er nødvendig, skyder et nyt system os lidt nærmere live-streamet menneskesimulation uden frustrerende renderingsrund.
Tilstanden for fuld-længde menneskesimulation er kommet langt siden muligheden for fuld-krop dybfake først optrådte i 2022. Indtil nu er vi blevet vant til den formidabe og ofte kontroversielle evne af open source-systemer som Wan-Animate og lukkede systemer som Grok til at konvertere enkelt eller flere billeder til en konsistent og ofte transformerende video-præstation:
Klik for at afspille, hvis nødvendigt. Eksempler på personudskiftning med WanAnimate-2.2. Se kilde for bedre opløsning. Kilde
Dertil har den ældre autoencoder-baserede live ansigtsdybfake-rammeværk DeepFaceLive siden blevet overgået af mere avancerede rammeværker som Deep-Live-Cam, som udnytter en orkestrering af LivePortrait-iterationer, samt legacy GAN og InsightFace-moduler, for at skabe en effektiv real-tid efterfølger til (den nu forladte) DFLive-projekt:
Klik for at afspille: Elon Musk dybfake i en live-video-session via Deep-Live-Cam. Se kilde for bedre opløsning. Kilde
Men selvom rammeværker som Deep-Live-Cam kan køre i det uendelige og forfalske i det uendelige, og selvom de er bedre til at generere svære ansigtsvinkler end de plejede at være, er resultaterne alligevel begrænsede i forhold til opløsning og kapacitet: du kan få en bestemt ansigt/identitet, og det kan gøre meget, såsom overbevisende ansigtsudtryk og lip-sync – men det er grundlæggende en one-trick pony.
BRB…
De fleste af de nuværende AI-menneske-lignende systemer er ligeledes begrænsede og/eller ‘specialiserede’. En bestemt, tilbagevendende begrænsning er, at de bedste menneskesimulerings-/ligningssystemer er offline – det vil sige, at de er for ressourcekrævende til at fungere i realtid, og i stedet skal de gå væk, beregne løsningen og præsentere resultatet for brugeren senere.
Det er åbenbart, at sådanne systemer er uegnede til live AI-transmutation, såsom transformation af en hel række af kropbevægelser, som dans, i en live-stream.
Et eksempel herpå i de senere år er det åbne-weights Wan2.2. Animate, som blev en succes hos hobbyist-samfundet og pro-forhandlere – men igen, det er en ‘generér og vent’-scenarie:
Klik for at afspille. Fra 2025, eksempler på Wan2.2-Animates imponerende evner – hvis du kan have lidt tålmodighed. Se kilde for bedre opløsning. Kilde
Sådan står det, kan du have det godt, have det alsidigt eller have det nu – vælg to.
LiveAnimate
Ind i denne mexicanske stand-off kommer et nyt tilbud fra Kina, som effektivt transformerer Wan2.2 Animate til et live-drevet animations-rammeværk, der opererer med en respektabel næsten-20fps, med imponerende resultater på tværs af en række scenarier:
Klik for at afspille: Fra projektets side, overfører LiveAnimate drivende stillinger på tværs af scenarie-dans, udendørs fuld-krop og nærbillede-portræt-scenarier, reproducerer hel-krop, hånd og ansigtsbevægelse. Se kilde for bedre opløsning. Kilde
Det nye arbejde udvider det originale system til et live-kapabelt version ved at ændre hvordan video genereres: i stedet for at behandle tidligere og fremtidige rammer sammen, genererer LiveAnimate hver ny sekvens, mens handlingen udvikler sig, ved at bruge kun få skridt, mens det fastholder valgte tidligere stillinger for at holde subjektets udseende konsistent over lange sessioner.
Effektivt holder systemet tidligere rammer som en metode til varig hukommelse at trække på, mens videoen udvikler sig, så identiteten forbliver konsistent – ikke helt ulig den måde, gamle CGI-systemer refererer til teksturkort.
Selvom en LoRA er involveret på behandlingsstadiet, er LiveAnimate ikke bare endnu et LoRA-system – dets streaming-generering, stillings-hukommelse/cachesystem, tre-trins-inferens og GPU-optimeringer repræsenterer yderligere mekanismer, oven på de forskellige andre teknologier (nogle overraskende gamle) i dets repertoire.
Det nye system kan klare ikke kun fuld-krop drivende scenarier, såsom dem i ovenstående eksempler, men også med overkropbevægelser, såsom i interviews-scenarier:
Klik for at afspille. ‘Subtilt hoved- og håndbevægelse over en statisk kontorscene’.
For at være retfærdig i forhold til dets begrænsninger, indrømmer det nye papir, at to af de rivaliserende rammeværker, der blev testet mod LiveAnimate, kunne bevare identitet lidt bedre i visse bestemte omstændigheder; det sagde, ikke en enkelt af modstanderne er et online-rather end et offline-system, og forfatterne af det nye arbejde er åbenbart ved at skubbe grænserne i en plausibel og optimistisk retning.
Dertil kan det være værd at bemærke, at inferens kræver to H100 NVIDIA-GPU’er, for en samlet 160GB VRAM*.
Papiret siger:
‘LiveAnimate fastholder næsten konstant perceptuel kvalitet og identitet fra de første 30 sekunder til den sidste [minut], mens tidligere systemer forringes væsentligt eller kræver timer af offline-beregning for den samme rulning.
‘Disse resultater etablerer et nyt operationspunkt i kvalitet, latency og varighed for interaktive fuld-krop animations.’
Den nye artikel er tituleret LiveAnimate: Stabil Lang-Form Streaming Menneske-Animation i Real-Tid, og kommer fra ni forfattere på tværs af The Chinese University of Hong Kong, Qwen Applications Business Group of Alibaba, og Liblib AI. Et projektsted, fuldt af videoer, der også er med i denne artikel, er også tilgængeligt, mens kode er ‘kommer snart’, og vægte… hvem ved?
Metode
LiveAnimate består af en to-trins træningsproces designet til at gøre Wan2.2-Animate generere kontinuerligt og hurtigt, efterfulgt af et hukommelsessystem, der henter nyttige tidligere stillinger, mens hver ny blok af video produceres:

En oversigt over LiveAnimate-pipelines, der viser dets to-trins træningsproces på venstre side og live-generering på højre side, hvor indkommende stillinger matchas mod tidligere lagrede stillinger og kombineres med seneste rammer for at generere hver ny blok af video i tre skridt. Kilde
Det originale Wan2.2-Animate er designet til at overveje en hel sekvens i stedet for at generere en uendeligt udvidende video. Derfor blev det tilpasset, ved at forfatterne delte træningsvideoer op i succesive blokke, hvor hver genereres ved hjælp af tidligere blokke som kontekst/sandhed. Dette lærer initialt modellen at fortsætte fra pålideligt tidligere materiale, før den skal klare fejl, der er oparbejdet fra sin egen output.
Glem mig ikke
Gennem hele denne proces holdes det originale referencebillede permanent tilgængeligt gennem en ‘Ref Sink’, der giver en fast påmindelse om personens identitet og udseende. Når en blok er fuldført, konverterer en ‘Clean KV Update’ information, der er erhvervet fra det, til historisk kontekst for efterfølgende blokke (selvom dette ikke reparerer eksisterende fejl).
Dette første træningsstadie kræver stadig 50 støjreduktions-trin per blok, hvilket gør live-drift impraktisk. Det andet stadie reducerer processen til tre trin, mens modellen udsættes for sin egen genererede historie, da udrulning kræver, at hver ny sekvens afhænger af uperfekt tidligere output:

De to træningsstadier†, der blev brugt til at forberede LiveAnimate til udrulning, først lærer fra rene tidligere video-blokke – derefter reducerer generationen til tre trin, mens modellen trænes på sin egen uperfekte output.
Træning mod disse selv-genererede sekvenser præsenterer et andet problem, da det at fastholde en hel videos beregningshistorik ville være uhyre dyrt. I stedet laves en fuldført øvelsesgang, derefter genbesøgt, en blok ad gangen, til træning. Hver blok kan derefter modtage en opdatering uden at holde hele sekvensen komputatorisk ‘live’.
Kombineret med LoRA-tilpasning, giver dette mulighed for, at 14-milliard-parameter-modellen kan destilleres på en enkelt node, der indeholder otte 80GB H100-GPU’er (bemærk, at denne cluster er til træning, ikke runtime-inferens).
Don’t Stop Now
Til uendelig generation skal LiveAnimate også afgøre, hvad der er værdigt at huske. At fastholde alt ville gøre behandlingskravene eksplodere; men at fastholde kun seneste rammer kunne også forkaste nyttige tidligere visninger.
Derfor Stillings-Hent-Sink-Opmerksomhed (PR-Sink) adresserer dette, ved at fastholde den første genererede blok som en permanent ‘Statisk Sink’ – en relevant tidligere stilling, der fungerer som en erstatnings-‘Dynamisk Sink’, og et rullende vindue, der indeholder den nuværende og to forudgående blokke. Referencebilledet forbliver separat tilgængeligt gennem Ref Sink, mens faste lagringsstørrelser forhindrer, at omkostningerne stiger, når videoens længde øges.
Block Wars
For at vælge ældre stillinger til denne ret begrænsede hukommelse, ViTPose reducerer krops- og håndpositioner på tværs af tre rammer til en kompakt repræsentation. Hukommelsesbanken indeholder fem sådanne repræsentative stillinger og befolkes under de første 20 blokke, med fordel for varierede stillinger over næsten-duplikater.
Under generation sammenlignes den indkommende stilling med disse repræsentanter og den nærmeste match hentes, hvilket giver tidligere bevis for, hvordan personen så ud i en lignende position. Men den umiddelbart forudgående blok er ekskluderet, da den allerede findes i det rullende vindue, og efterlader den Dynamiske Sink fri til at hente information fra længere tilbage.
Til sidst er runtime selv optimeret til hastighed ved at distribuere opmærksomhedsbehandling på tværs af to H100-GPU’er, overlappe kommunikation med beregning og genbruge cachede oplysninger, hvor det er muligt.
Data og Tests
LiveAnimate blev trænet på 40.000 talevideoer fra AVSpeech og 20.000 menneske-bevægelsesvideoer fra TikTok-datasæt og HumanVid, med træning og inferens, der understøtter opløsninger på 480×480; 384×672; og 672×384 pixel.
Træning startede fra Wan2.2-Animate-14B-basiskontrolpunkt, ved hjælp af LoRA med rang 128, og fortsatte på otte NVIDIA H100-GPU’er i 10.000 trin i det første stadie og 20.000 i det andet.
Video blev genereret i blokke af tre latente rammer (modellens komprimerede interne repræsentation), svarende til 12 RGB-rammer, mens inferens blev udført på de to H100’er.
Evalueringen sammenlignede LiveAnimate med eksisterende stillings-drevne menneske-animationsmetoder på både korte og lange sekvenser, ved hjælp af referencebilleder og drivende stillinger under konsistente indstillinger. Lang-form-testerne udvidede generationen til tre minutter for at undersøge, om kvalitet og identitet forblev stabile over tid.
De rammeværker, der blev testet, var EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; og Wan2.2-Animate.
Målene, der blev brugt, dækkede visuel kvalitet, identitets-konsistens, distributionskvalitet og temporal repræsentationsfejl. Æstetisk Score (ASE) og no-reference Billede-Kvalitetsvurdering (IQA) målte ramme-niveau visuel kvalitet; DINO, lighed (DINO-S), og udseendekonsistens med reference-identiteten; Fréchet Inception Distance (FID), distributionskvalitet; og VideoMAE-funktion-afstand (V-MAE), hvor godt den genererede video bevarede bevægelse over tid:

Testresultater vedrørende kvalitet og identitet over tre minutter af kontinuerlig generation, med LiveAnimate, der forbliver relativt stabil på tværs af alle fem mål, mens flere konkurrerende metoder viser større forringelse over tid. Højere læsninger er bedre for IQA, ASE og DINO-S, med lavere læsninger bedre for FID og V-MAE.
Som vist i det initiale resultatskema ovenfor, opnåede LiveAnimate den højeste initiale ASE på 2,823, og IQA på 4,047, over de første 30 sekunder. Forfatterne hævder, at dette indikerer, at tre-trins-destillation bevarer perceptuel kvalitet, på trods af den reducerede inferens-budget.
Endnu mere betydningsfuldt viste LiveAnimate kun lidt forringelse under tre minutter af kontinuerlig generation, med dens visuelle-kvalitets- og identitets-konsistens-score forblev næsten uændret.
Om vendt, forringede One-to-All væsentligt over tid, med lavere visuel kvalitet og identitets-konsistens og højere distributionsfejl; og basis-Wan2.2-Animate viste også en vis forringelse af identitets-konsistens.
Forfatterne siger:
‘Disse tendenser støtter vores centrale påstand om, at eksplicit håndtering af lang-række-kontekst er vigtig for streaming-animation.’
LiveAnimates skalerings-effektivitet blev også testet på tværs af GPU’er. Som vist nedenfor, opnåedes 12,41 FPS med en H100; 19,63 FPS med to; og 22,13 FPS med fire, med gevinsterne, der blev mere og mere begrænsede af kommunikations-overhead. To H100’er blev derfor valgt som den foretrukne konfiguration:

Skalerings-effektivitet på tværs af en, to og fire H100-GPU’er ved 480×480 opløsning, visende latency, frame-rate, speedup og effektivitet. To GPU’er opnåede 19,63 FPS, mens yderligere skalerings til fire producerede kun en beskeden stigning til 22,13 FPS.
Ved 19,63 FPS blev hver 12-ramme-blok genereret på 0,611 sekunder. I sammenligning krævede de konkurrerende systemer ca. 2-5 timer for at generere den samme tre-minutters-sekvens.
Kvalitative tests viste op lignende forskelle: i fuld-krop-testen nedenfor, blev alvorlig forringelse observeret i One-to-All; flimren blev produceret af UniAnimate-DiT og SCAIL; og senere farve- eller baggrund-drift blev synlig med Wan-Animate og EverAnimate.

Testresultater, der sammenligner fuld-krop-animation over tre minutter. Rammerne blev sampet hver 20. sekund, med røde anmærkninger, der fremhæver lang-tids-forringelse i konkurrerende metoder. Basiskontrolpunkterne krævede ca. 2-5 timer for at generere sekvensen, i sammenligning med ca. fire minutter for LiveAnimate. Se kilde-papiret for bedre opløsning.
LiveAnimate fastholdt subjektets udseende og omgivende scene på tværs af den tre-minutters-sekvens. I den mindre krævende overkrop-test nedenfor, blev lignende lang-tids-stabilitet opnået af EverAnimate og LiveAnimate (selvom real-tid generation kun blev leveret af LiveAnimate):

Testresultater, der sammenligner overkrop-animation over tre minutter. Rammerne sampet hver 20. sekund viser LiveAnimate fastholder subjektets identitet, tøj og mørk baggrund mere konsistent end de konkurrerende metoder.
Forfatterne konkluderer:
‘På tre-minutters-benchmarket fastholder LiveAnimate næsten konstant perceptuel kvalitet og identitet på 19,63 FPS på to H100-GPU’er, med hukommelse og latency uafhængig af stream-varighed, hvorimod offline-basiskontrolpunkter synligt forringes eller kræver timer af beregning.
‘Disse resultater bringer milliard-skala video-diffusionsmodeller inden for rækkevidde af interaktive anvendelser såsom live-streaming, telepræsen og virtuelle avatarer.’
Konklusion
Det er opmuntrende at se et drev-genererings-rammeværk tage en nytænkende tilgang til de vedvarende problemer med hukommelse og identitet, der plager generativ video. Der er allerede mange generative rammeværker, der kan referere til faste billeder leveret af brugeren, uden behov for at ‘lime’ referencebilledet ind i essentiel billed-til-video-indhold.
Men dette løser kun nogle af problemerne med at generere en enkelt video-klip, såsom at fastholde identiteten (herunder tøj og frisur) af en person, der genindtræder ramme, eller er blevet midlertidigt skjult, og derefter ses igen. Indtil nu har kun den tungt-bærende og irriterende midlertidige LoRA-tilgang gjort nogen fremskridt med disse spørgsmål, dog begrænset og midlertidigt.
For video, og faktisk for hele den nuværende AI-revolution, er udviklingen af effektiv varig hukommelse et kritisk, eksistentielt spørgsmål – et, der sandsynligvis vil definere forskellen på opkomsten af AGI eller en tredje AI-vinter.
* Er dette stadig en ‘gotcha’? Den nuværende tænkning er, at mindre specialiserede modeller måske en dag kan køre lokalt, uden leje, mens højere behov bliver serviceret af en konkurrerende og håbentligt fragmenteret GPU-leje-marked. Dette antager, at frontierselskaberne ikke EEE konkurrencen, og at betydelig GPU-compute forbliver tilgængelig uanset. På den basis betragter jeg ikke længere ekstreme GPU-krav som en ulempe, men håber, at adgang bliver mere demokratiseret, og at senere optimeringer reducerer de oprindelige ressource-krav.
† AI-genereret og kontrolleret af mig selv.
†† For lang-video-test, blev SCAIL og UniAnimate-DiT udvidet med den samme trænings-frie glide-vindue-procedure, da ingen af dem naturligt understøtter lang-form-generation. EverAnimate og One-to-All blev evaluaret ved hjælp af deres egne lang-video-genereringsmetoder.
Først publiceret torsdag, 13. august 2026












