Andersons vinkel
Mod fuldt-krop dybfake video-generering

I et felt, hvor tÃĨlmodighed er nÃļdvendig, skyder et nyt system os lidt nÃĶrmere live-streamet menneskesimulation uden frustrerende renderingsrund.
Â
Tilstanden for fuld-lÃĶngde menneskesimulation er kommet langt siden muligheden for fuld-krop dybfake fÃļrst optrÃĨdte i 2022. Indtil nu er vi blevet vant til den formidabe og ofte kontroversielle evne af open source-systemer som Wan-Animate og lukkede systemer som Grok til at konvertere enkelt eller flere billeder til en konsistent og ofte transformerende video-prÃĶstation:
Klik for at afspille, hvis nÃļdvendigt. Eksempler pÃĨ personudskiftning med WanAnimate-2.2. Se kilde for bedre oplÃļsning. Â KildeÂ
Dertil har den ÃĶldre autoencoder-baserede live ansigtsdybfake-rammevÃĶrk DeepFaceLive siden blevet overgÃĨet af mere avancerede rammevÃĶrker som Deep-Live-Cam, som udnytter en orkestrering af LivePortrait-iterationer, samt legacy GAN og InsightFace-moduler, for at skabe en effektiv real-tid efterfÃļlger til (den nu forladte) DFLive-projekt:
Klik for at afspille: Elon Musk dybfake i en live-video-session via Deep-Live-Cam. Se kilde for bedre oplÃļsning. KildeÂ
Men selvom rammevÃĶrker som Deep-Live-Cam kan kÃļre i det uendelige og forfalske i det uendelige, og selvom de er bedre til at generere svÃĶre ansigtsvinkler end de plejede at vÃĶre, er resultaterne alligevel begrÃĶnsede i forhold til oplÃļsning og kapacitet: du kan fÃĨ en bestemt ansigt/identitet, og det kan gÃļre meget, sÃĨsom overbevisende ansigtsudtryk og lip-sync â men det er grundlÃĶggende en one-trick pony.
BRBâĶ
De fleste af de nuvÃĶrende AI-menneske-lignende systemer er ligeledes begrÃĶnsede og/eller âspecialiseredeâ. En bestemt, tilbagevendende begrÃĶnsning er, at de bedste menneskesimulerings-/ligningssystemer er offline â det vil sige, at de er for ressourcekrÃĶvende til at fungere i realtid, og i stedet skal de gÃĨ vÃĶk, beregne lÃļsningen og prÃĶsentere resultatet for brugeren senere.
Det er ÃĨbenbart, at sÃĨdanne systemer er uegnede til live AI-transmutation, sÃĨsom transformation af en hel rÃĶkke af kropbevÃĶgelser, som dans, i en live-stream.
Et eksempel herpÃĨ i de senere ÃĨr er det ÃĨbne-weights Wan2.2. Animate, som blev en succes hos hobbyist-samfundet og pro-forhandlere â men igen, det er en âgenerÃĐr og ventâ-scenarie:
Klik for at afspille. Fra 2025, eksempler pÃĨ Wan2.2-Animates imponerende evner â hvis du kan have lidt tÃĨlmodighed. Se kilde for bedre oplÃļsning. KildeÂ
SÃĨdan stÃĨr det, kan du have det godt, have det alsidigt eller have det nu â vÃĶlg to.
LiveAnimate
Ind i denne mexicanske stand-off kommer et nyt tilbud fra Kina, som effektivt transformerer Wan2.2 Animate til et live-drevet animations-rammevÃĶrk, der opererer med en respektabel nÃĶsten-20fps, med imponerende resultater pÃĨ tvÃĶrs af en rÃĶkke scenarier:
Klik for at afspille: Fra projektets side, overfÃļrer LiveAnimate drivende stillinger pÃĨ tvÃĶrs af scenarie-dans, udendÃļrs fuld-krop og nÃĶrbillede-portrÃĶt-scenarier, reproducerer hel-krop, hÃĨnd og ansigtsbevÃĶgelse. Se kilde for bedre oplÃļsning. KildeÂ
Det nye arbejde udvider det originale system til et live-kapabelt version ved at ÃĶndre hvordan video genereres: i stedet for at behandle tidligere og fremtidige rammer sammen, genererer LiveAnimate hver ny sekvens, mens handlingen udvikler sig, ved at bruge kun fÃĨ skridt, mens det fastholder valgte tidligere stillinger for at holde subjektets udseende konsistent over lange sessioner.
Effektivt holder systemet tidligere rammer som en metode til varig hukommelse at trÃĶkke pÃĨ, mens videoen udvikler sig, sÃĨ identiteten forbliver konsistent â ikke helt ulig den mÃĨde, gamle CGI-systemer refererer til teksturkort.
Selvom en LoRA er involveret pÃĨ behandlingsstadiet, er LiveAnimate ikke bare endnu et LoRA-system â dets streaming-generering, stillings-hukommelse/cachesystem, tre-trins-inferens og GPU-optimeringer reprÃĶsenterer yderligere mekanismer, oven pÃĨ de forskellige andre teknologier (nogle overraskende gamle) i dets repertoire.
Det nye system kan klare ikke kun fuld-krop drivende scenarier, sÃĨsom dem i ovenstÃĨende eksempler, men ogsÃĨ med overkropbevÃĶgelser, sÃĨsom i interviews-scenarier:
Klik for at afspille. âSubtilt hoved- og hÃĨndbevÃĶgelse over en statisk kontorsceneâ.
For at vÃĶre retfÃĶrdig i forhold til dets begrÃĶnsninger, indrÃļmmer det nye papir, at to af de rivaliserende rammevÃĶrker, der blev testet mod LiveAnimate, kunne bevare identitet lidt bedre i visse bestemte omstÃĶndigheder; det sagde, ikke en enkelt af modstanderne er et online-rather end et offline-system, og forfatterne af det nye arbejde er ÃĨbenbart ved at skubbe grÃĶnserne i en plausibel og optimistisk retning.
Dertil kan det vÃĶre vÃĶrd at bemÃĶrke, at inferens krÃĶver to H100 NVIDIA-GPUâer, for en samlet 160GB VRAM*.
Papiret siger:
âLiveAnimate fastholder nÃĶsten konstant perceptuel kvalitet og identitet fra de fÃļrste 30 sekunder til den sidste [minut], mens tidligere systemer forringes vÃĶsentligt eller krÃĶver timer af offline-beregning for den samme rulning.
âDisse resultater etablerer et nyt operationspunkt i kvalitet, latency og varighed for interaktive fuld-krop animations.â
Den nye artikel er tituleret LiveAnimate: Stabil Lang-Form Streaming Menneske-Animation i Real-Tid, og kommer fra ni forfattere pÃĨ tvÃĶrs af The Chinese University of Hong Kong, Qwen Applications Business Group of Alibaba, og Liblib AI. Et projektsted, fuldt af videoer, der ogsÃĨ er med i denne artikel, er ogsÃĨ tilgÃĶngeligt, mens kode er âkommer snartâ, og vÃĶgteâĶ hvem ved?
Metode
LiveAnimate bestÃĨr af en to-trins trÃĶningsproces designet til at gÃļre Wan2.2-Animate generere kontinuerligt og hurtigt, efterfulgt af et hukommelsessystem, der henter nyttige tidligere stillinger, mens hver ny blok af video produceres:

En oversigt over LiveAnimate-pipelines, der viser dets to-trins trÃĶningsproces pÃĨ venstre side og live-generering pÃĨ hÃļjre side, hvor indkommende stillinger matchas mod tidligere lagrede stillinger og kombineres med seneste rammer for at generere hver ny blok af video i tre skridt. KildeÂ
Det originale Wan2.2-Animate er designet til at overveje en hel sekvens i stedet for at generere en uendeligt udvidende video. Derfor blev det tilpasset, ved at forfatterne delte trÃĶningsvideoer op i succesive blokke, hvor hver genereres ved hjÃĶlp af tidligere blokke som kontekst/sandhed. Dette lÃĶrer initialt modellen at fortsÃĶtte fra pÃĨlideligt tidligere materiale, fÃļr den skal klare fejl, der er oparbejdet fra sin egen output.
Forget Me Not
Gennem hele denne proces holdes det originale referencebillede permanent tilgÃĶngeligt gennem en âRef Sinkâ, der giver en fast pÃĨmindelse om personens identitet og udseende. NÃĨr en blok er fuldfÃļrt, konverterer en âClean KV Updateâ information, der er erhvervet fra det, til historisk kontekst for efterfÃļlgende blokke (selvom dette ikke reparerer eksisterende fejl).
Dette fÃļrste trÃĶningsstadie krÃĶver stadig 50 stÃļjreduktions-trin per blok, hvilket gÃļr live-drift impraktisk. Det andet stadie reducerer processen til tre trin, mens modellen udsÃĶttes for sin egen genererede historie, da udrulning krÃĶver, at hver ny sekvens afhÃĶnger af uperfekt tidligere output:

De to trÃĶningsstadierâ , der blev brugt til at forberede LiveAnimate til udrulning, fÃļrst lÃĶrer fra rene tidligere video-blokke â derefter reducerer generationen til tre trin, mens modellen trÃĶnes pÃĨ sin egen uperfekte output.
TrÃĶning mod disse selv-genererede sekvenser prÃĶsenterer et andet problem, da det at fastholde en hel videos beregningshistorik ville vÃĶre uhyre dyrt. I stedet laves en fuldfÃļrt Ãļvelsesgang, derefter genbesÃļgt, en blok ad gangen, til trÃĶning. Hver blok kan derefter modtage en opdatering uden at holde hele sekvensen komputatorisk âliveâ.
Kombineret med LoRA-tilpasning, giver dette mulighed for, at 14-milliard-parameter-modellen kan destilleres pÃĨ en enkelt node, der indeholder otte 80GB H100-GPUâer (bemÃĶrk, at denne cluster er til trÃĶning, ikke runtime-inferens).
Donât Stop Now
Til uendelig generation skal LiveAnimate ogsÃĨ afgÃļre, hvad der er vÃĶrdigt at huske. At fastholde alt ville gÃļre behandlingskravene eksplodere; men at fastholde kun seneste rammer kunne ogsÃĨ forkaste nyttige tidligere visninger.
Derfor Stillings-Hent-Sink-Opmerksomhed (PR-Sink) adresserer dette, ved at fastholde den fÃļrste genererede blok som en permanent âStatisk Sinkâ â en relevant tidligere stilling, der fungerer som en erstatnings-âDynamisk Sinkâ, og et rullende vindue, der indeholder den nuvÃĶrende og to forudgÃĨende blokke. Referencebilledet forbliver separat tilgÃĶngeligt gennem Ref Sink, mens faste lagringsstÃļrrelser forhindrer, at omkostningerne stiger, nÃĨr videoens lÃĶngde Ãļges.
Block Wars
For at vÃĶlge ÃĶldre stillinger til denne ret begrÃĶnsede hukommelse, ViTPose reducerer krops- og hÃĨndpositioner pÃĨ tvÃĶrs af tre rammer til en kompakt reprÃĶsentation. Hukommelsesbanken indeholder fem sÃĨdanne reprÃĶsentative stillinger og befolkes under de fÃļrste 20 blokke, med fordel for varierede stillinger over nÃĶsten-duplikater.
Under generation sammenlignes den indkommende stilling med disse reprÃĶsentanter og den nÃĶrmeste match hentes, hvilket giver tidligere bevis for, hvordan personen sÃĨ ud i en lignende position. Men den umiddelbart forudgÃĨende blok er ekskluderet, da den allerede findes i det rullende vindue, og efterlader den Dynamiske Sink fri til at hente information fra lÃĶngere tilbage.
Til sidst er runtime selv optimeret til hastighed ved at distribuere opmÃĶrksomhedsbehandling pÃĨ tvÃĶrs af to H100-GPUâer, overlappe kommunikation med beregning og genbruge cachede oplysninger, hvor det er muligt.
Data og Tests
LiveAnimate blev trÃĶnet pÃĨ 40.000 talevideoer fra AVSpeech og 20.000 menneske-bevÃĶgelsesvideoer fra TikTok-datasÃĶt og HumanVid, med trÃĶning og inferens, der understÃļtter oplÃļsninger pÃĨ 480Ã480; 384Ã672; og 672Ã384 pixel.
TrÃĶning startede fra Wan2.2-Animate-14B-basiskontrolpunkt, ved hjÃĶlp af LoRA med rang 128, og fortsatte pÃĨ otte NVIDIA H100-GPUâer i 10.000 trin i det fÃļrste stadie og 20.000 i det andet.
Video blev genereret i blokke af tre latente rammer (modellens komprimerede interne reprÃĶsentation), svarende til 12 RGB-rammer, mens inferens blev udfÃļrt pÃĨ de to H100âer.
Evalueringen sammenlignede LiveAnimate med eksisterende stillings-drevne menneske-animationsmetoder pÃĨ bÃĨde korte og lange sekvenser, ved hjÃĶlp af referencebilleder og drivende stillinger under konsistente indstillinger. Lang-form-testerne udvidede generationen til tre minutter for at undersÃļge, om kvalitet og identitet forblev stabile over tid.
De rammevÃĶrker, der blev testet, var EverAnimate; One-to-All; SCAILâ â ; UniAnimate-DiT; og Wan2.2-Animate.
MÃĨlene, der blev brugt, dÃĶkkede visuel kvalitet, identitets-konsistens, distributionskvalitet og temporal reprÃĶsentationsfejl. Ãstetisk Score (ASE) og no-reference Billede-Kvalitetsvurdering (IQA) mÃĨlte ramme-niveau visuel kvalitet; DINO, lighed (DINO-S), og udseendekonsistens med reference-identiteten; FrÃĐchet Inception Distance (FID), distributionskvalitet; og VideoMAE-funktion-afstand (V-MAE), hvor godt den genererede video bevarede bevÃĶgelse over tid:

Testresultater vedrÃļrende kvalitet og identitet over tre minutter af kontinuerlig generation, med LiveAnimate, der forbliver relativt stabil pÃĨ tvÃĶrs af alle fem mÃĨl, mens flere konkurrerende metoder viser stÃļrre forringelse over tid. HÃļjere lÃĶsninger er bedre for IQA, ASE og DINO-S, med lavere lÃĶsninger bedre for FID og V-MAE.
Som vist i det initiale resultatskema ovenfor, opnÃĨede LiveAnimate den hÃļjeste initiale ASE pÃĨ 2,823, og IQA pÃĨ 4,047, over de fÃļrste 30 sekunder. Forfatterne hÃĶvder, at dette indikerer, at tre-trins-destillation bevarer perceptuel kvalitet, pÃĨ trods af den reducerede inferens-budget.
Endnu mere betydningsfuldt viste LiveAnimate kun lidt forringelse under tre minutter af kontinuerlig generation, med dens visuelle-kvalitets- og identitets-konsistens-score forblev nÃĶsten uÃĶndret.
Om vendt, forringede One-to-All vÃĶsentligt over tid, med lavere visuel kvalitet og identitets-konsistens og hÃļjere distributionsfejl; og basis-Wan2.2-Animate viste ogsÃĨ en vis forringelse af identitets-konsistens.
Forfatterne siger:
âDisse tendenser stÃļtter vores centrale pÃĨstand om, at eksplicit hÃĨndtering af lang-rÃĶkke-kontekst er vigtig for streaming-animation.â
LiveAnimates skalerings-effektivitet blev ogsÃĨ testet pÃĨ tvÃĶrs af GPUâer. Som vist nedenfor, opnÃĨedes 12,41 FPS med en H100; 19,63 FPS med to; og 22,13 FPS med fire, med gevinsterne, der blev mere og mere begrÃĶnsede af kommunikations-overhead. To H100âer blev derfor valgt som den foretrukne konfiguration:

Skalerings-effektivitet pÃĨ tvÃĶrs af en, to og fire H100-GPUâer ved 480Ã480 oplÃļsning, visende latency, frame-rate, speedup og effektivitet. To GPUâer opnÃĨede 19,63 FPS, mens yderligere skalerings til fire producerede kun en beskeden stigning til 22,13 FPS.
Ved 19,63 FPS blev hver 12-ramme-blok genereret pÃĨ 0,611 sekunder. I sammenligning krÃĶvede de konkurrerende systemer ca. 2-5 timer for at generere den samme tre-minutters-sekvens.
Kvalitative tests viste op lignende forskelle: i fuld-krop-testen nedenfor, blev alvorlig forringelse observeret i One-to-All; flimren blev produceret af UniAnimate-DiT og SCAIL; og senere farve- eller baggrund-drift blev synlig med Wan-Animate og EverAnimate.

Testresultater, der sammenligner fuld-krop-animation over tre minutter. Rammerne blev sampet hver 20. sekund, med rÃļde anmÃĶrkninger, der fremhÃĶver lang-tids-forringelse i konkurrerende metoder. Basiskontrolpunkterne krÃĶvede ca. 2-5 timer for at generere sekvensen, i sammenligning med ca. fire minutter for LiveAnimate. Se kilde-papiret for bedre oplÃļsning.
LiveAnimate fastholdt subjektets udseende og omgivende scene pÃĨ tvÃĶrs af den tre-minutters-sekvens. I den mindre krÃĶvende overkrop-test nedenfor, blev lignende lang-tids-stabilitet opnÃĨet af EverAnimate og LiveAnimate (selvom real-tid generation kun blev leveret af LiveAnimate):

Testresultater, der sammenligner overkrop-animation over tre minutter. Rammerne sampet hver 20. sekund viser LiveAnimate fastholder subjektets identitet, tÃļj og mÃļrk baggrund mere konsistent end de konkurrerende metoder.
Forfatterne konkluderer:
âPÃĨ tre-minutters-benchmarket fastholder LiveAnimate nÃĶsten konstant perceptuel kvalitet og identitet pÃĨ 19,63âFPS pÃĨ to H100-GPUâer, med hukommelse og latency uafhÃĶngig af stream-varighed, hvorimod offline-basiskontrolpunkter synligt forringes eller krÃĶver timer af beregning.
âDisse resultater bringer milliard-skala video-diffusionsmodeller inden for rÃĶkkevidde af interaktive anvendelser sÃĨsom live-streaming, teleprÃĶsen og virtuelle avatarer.â
Konklusion
Det er opmuntrende at se et drev-genererings-rammevÃĶrk tage en nytÃĶnkende tilgang til de vedvarende problemer med hukommelse og identitet, der plager generativ video. Der er allerede mange generative rammevÃĶrker, der kan referere til faste billeder leveret af brugeren, uden behov for at âlimeâ referencebilledet ind i essentiel billed-til-video-indhold.
Men dette lÃļser kun nogle af problemerne med at generere en enkelt video-klip, sÃĨsom at fastholde identiteten (herunder tÃļj og frisur) af en person, der genindtrÃĶder ramme, eller er blevet midlertidigt skjult, og derefter ses igen. Indtil nu har kun den tungt-bÃĶrende og irriterende midlertidige LoRA-tilgang gjort nogen fremskridt med disse spÃļrgsmÃĨl, dog begrÃĶnset og midlertidigt.
For video, og faktisk for hele den nuvÃĶrende AI-revolution, er udviklingen af effektiv varig hukommelse et kritisk, eksistentielt spÃļrgsmÃĨl â et, der sandsynligvis vil definere forskellen pÃĨ opkomsten af AGI eller en tredje AI-vinter.
Â
* Â Er dette stadig en âgotchaâ? Den nuvÃĶrende tÃĶnkning er, at mindre specialiserede modeller mÃĨske en dag kan kÃļre lokalt, uden leje, mens hÃļjere behov bliver serviceret af en konkurrerende og hÃĨbentligt fragmenteret GPU-leje-marked. Dette antager, at frontierselskaberne ikke EEE konkurrencen, og at betydelig GPU-compute forbliver tilgÃĶngelig uanset. PÃĨ den basis betragter jeg ikke lÃĶngere ekstreme GPU-krav som en ulempe, men hÃĨber, at adgang bliver mere demokratiseret, og at senere optimeringer reducerer de oprindelige ressource-krav.
â AI-genereret og kontrolleret af mig selv.
â â For lang-video-test, blev SCAIL og UniAnimate-DiT udvidet med den samme trÃĶnings-frie glide-vindue-procedure, da ingen af dem naturligt understÃļtter lang-form-generation. EverAnimate og One-to-All blev evaluaret ved hjÃĶlp af deres egne lang-video-genereringsmetoder.
Â
FÃļrst publiceret torsdag, 13. august 2026












