Andersons vinkel

Mot det første fullstendige fullkropps deepfake video-generering

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
An enlargement from a test video wherein the dance movements of a stick figure inform and drive the motion of a single identity. Source - https://liveanimate.github.io/

I et felt der tålmodighet er nødvendig, skyver et nytt system oss litt nærmere live-strømmet menneskesimulering uten frustrerende renderingsrunder.

 

Tilstanden for full-lengde menneskesimulering har kommet langt siden muligheten for fullkropps deepfakes først dukket opp i 2022. Nå har vi blitt vant til den formidable og ofte kontroversielle evnen til åpne kildekodesystemer som Wan-Animate og lukkede kildekodesystemer som Grok, til å konvertere enkelt eller flere bilder til en konsistent og ofte transformasjonell video-ytelse:

Klikk for å spille hvis nødvendig. Eksempler på personerstatning med WanAnimate-2.2. Se kilde for bedre oppløsning.  Kilde 

I tillegg har den eldre autoencoder-baserte live ansikts deepfake-rammeverket DeepFaceLive blitt overgått av mer sofistikerte rammeverk som Deep-Live-Cam, som utnytter en orkestrering av LivePortrait-iterasjoner, samt legacy GAN og InsightFace-moduler, for å skape en effektiv sanntids-suksessør til (nå forkastet) DFLive-prosjektet:

Klikk for å spille: Elon Musk deepfaked i en live-video-sesjon via Deep-Live-Cam. Se kilde for bedre oppløsning. Kilde 

Men mens rammeverk som Deep-Live-Cam kan kjøre for alltid og fake for alltid, og selv om de er bedre på å generere tøffe ansiktsvinkler enn de brukte å være, er resultater likevel begrenset når det gjelder oppløsning og evne: du kan få en bestemt ansikt/identitet, og det kan gjøre mye, som overbevisende ansiktsuttrykk og leppesynk – men det er i hovedsak en en-triks-ponni.

BRB…

De fleste av de nåværende AI-menneske-lignende systemer er likeledes begrenset og/eller ‘spesialiserte’. En bestemt, gjentakende begrensning er at de beste menneskesimulering/imitasjon-systemene er offline – det vil si at de er for ressurskrevende til å operere i sanntid, og må derfor gå bort, beregne løsningen og presentere resultatet til brukeren senere.

Det er åpenbart at slike systemer er uegnet for live AI-omdanning, som å transformere en hel rekke kroppsbevegelser, som dans, i en live-strøm.

Et eksempel på dette i de senere år er den åpne vektbaserte Wan2.2 Animate, som viste seg å være en suksess blant hobbyist-samfunnet og pro-forhandlere – men igjen, det er en ‘generer og vent’-scenario:

Klikk for å spille. Fra 2025, eksempler på Wan2.2-Animates imponerende evner – hvis du kan ha litt tålmodighet. Se kilde for bedre oppløsning. Kilde 

Så som det står nå kan du ha det bra, ha det variert eller ha det nå – velg to.

LiveAnimate

Inn i denne meksikanske stillstanden kommer et nytt tilbud fra Kina, som effektivt transformerer Wan2.2 Animate til et live-drevet animasjonsrammeverk som opererer, for øyeblikket, på en respektabel nær-20fps, med imponerende resultater over en rekke scenarier:

Klikk for å spille: Fra prosjektet, LiveAnimate overfører drivende posisjoner over scenen-dans, utendørs fullkropps- og nærbilde-portrett-scenarier, reproducerer hele kroppen, hånd og ansiktsbevegelse. Se kilde for bedre oppløsning. Kilde 

Det nye arbeidet utvider det originale systemet til et live-kapabelt versjon ved å endre hvordan video genereres: istedenfor å prosessere tidligere og fremtidige rammeverk sammen, genererer LiveAnimate hver nytt segment mens handlingen utvikler seg, ved å bruke bare noen få trinn, mens det beholdes valgte tidligere posisjoner for å holde subjektets utseende konsistent over lange sesjoner.

Effektivt holder systemet tidligere rammeverk som en metode for varig minne å trekke på mens videoen utvikler seg, så identiteten forblir konsistent – ikke helt ulikt måten gamle CGI-systemer refererer til teksturkart.

Selv om en LoRA er involvert i prosesseringen, er LiveAnimate ikke bare et annet LoRA-system – dens strømmegenerering, pose-minne/cache-system, tre-trinns inferens og GPU-optimieringer representerer ekstra mekanismer, i tillegg til de mange andre teknologiene (noen overraskende gamle) i dens repertoar.

Det nye systemet kan håndtere ikke bare fullkropps-driv-scenarier som de ovennevnte eksemplene, men også overkroppsbevegelser, som i intervju-scenarier:

Klikk for å spille. ‘Subtile hode- og håndbevegelse over en statisk kontor-scene’.

For å være rettferdig når det gjelder begrensningene, innrømmer det nye papiret at to av de rivaliserende rammeverkene testet mot LiveAnimate var i stand til å bevare identitet litt bedre i visse bestemte omstendigheter; det sagt, ingen av konkurrentene er et online-rather enn et offline-system, og forfatterne av det nye arbeidet er åpenbart dyttende grensene i en plausibel og optimistisk retning.

I tillegg kan det være verdt å merke seg at inferens krever to H100 NVIDIA-GPUer, for en total på 160GB VRAM*.

Papiret sier:

‘LiveAnimate opprettholder nesten konstant perseptuell kvalitet og identitet fra de første 30 sekundene til den siste [minuttet], mens tidligere systemer forringes betydelig eller krever flere timer med offline-beregning for den samme rullete.

‘Disse resultater etablerer et nytt operasjonspunkt i kvalitet, forsinkelse og varighet for interaktiv fullkropps-animasjon.’

Den nye papiret heter LiveAnimate: Stabil langvarig strømmet menneske-animasjon i sanntid, og kommer fra ni forfattere over The Chinese University of Hong Kong, Qwen Applications Business Group of Alibaba, og Liblib AI. Et prosjektsted, fullt av videoer også presentert i denne artikkelen, er også tilgjengelig, mens kode er ‘kommer snart’, og vekter… hvem vet?

Metode

LiveAnimate utgjør en to-trinns treningsprosess designet for å gjøre Wan2.2-Animate generere kontinuerlig og raskt, etterfulgt av et minnesystem som henter nyttige tidligere posisjoner mens hver ny blokk av video produseres:

En oversikt over LiveAnimate-pipeline, som viser dens to-trinns treningsprosess på venstre side og live-generering på høyre side, hvor innkommende posisjoner sammenlignes med lagrede tidligere posisjoner og kombineres med nylige rammeverk for å generere hver ny blokk av video i tre trinn. Kilde - https://www.unite.ai/wp-content/uploads/2026/08/figure-2.jpg

En oversikt over LiveAnimate-pipeline, som viser dens to-trinns treningsprosess på venstre side og live-generering på høyre side, hvor innkommende posisjoner sammenlignes med lagrede tidligere posisjoner og kombineres med nylige rammeverk for å generere hver ny blokk av video i tre trinn. Kilde 

Det originale Wan2.2-Animate er designet for å vurdere en hel sekvens fremfor å generere en uendelig utvidende video. Derfor måtte forfatterne dele treningsvideoer inn i påfølgende blokker, med hver generert ved å bruke tidligere blokker som kontekst/sannhet. Dette lærer først modellen å fortsette fra pålitelig tidligere materiale, før den må håndtere feil som akkumuleres fra sin egen utdata.

Forget Me Not

Gjennom hele denne prosessen holdes det originale referansebildet permanent tilgjengelig gjennom en ‘Ref Sink’, som gir en fast påminnelse om personens identitet og utseende. Når en blokk er fullført, konverterer en ‘Clean KV Update’ informasjon hentet fra det til historisk kontekst for påfølgende blokker (selv om dette ikke reparerer eksisterende feil).

Dette første treningsstadiet krever fremdeles 50 støyfjerningstrinn per blokk, gjør live-operasjon upraktisk. Det andre stadiet destillerer derfor prosessen ned til tre trinn, mens modellen eksponeres for sin egen genererte historie, ettersom deployering krever at hver nytt segment avhenger av uperfekt tidligere utdata:

De to treningsstadier† brukt til å forberede LiveAnimate for deployering, først lærer fra rene tidligere video-blokker – så reduserer generering til tre trinn, mens modellen trenes på sin egen uperfekte utdata.

De to treningsstadier† brukt til å forberede LiveAnimate for deployering, først lærer fra rene tidligere video-blokker – så reduserer generering til tre trinn, mens modellen trenes på sin egen uperfekte utdata.

Treningsmot disse selv-genererte sekvensene presenterer et annet problem, siden å beholde hele videoens beregningshistorie ville være uakseptabelt dyrt. Isteden gjøres en fullstendig øvingskjøring, så gjenopprettet, en blokk av gangen, for treningsformål. Hver blokk kan derfor motta en oppdatering uten å holde hele sekvensen beregningsmessig ‘aktiv’.

Kombinert med LoRA-tilpasning, tillater dette at den 14-milliard-parameter-modellen kan destilleres på en enkelt node som inneholder åtte 80GB H100-GPUer (merk at denne clusteren er for treningsformål, ikke runtime-inferens).

Don’t Stop Now

For uendelig generering må LiveAnimate også bestemme hva som er verdt å huske. Å holde alt ville gjøre prosesseringskravene vokse ut av kontroll; men å beholde bare nylige rammeverk kunne også kaste verdifulle tidligere visninger.

Derfor Pose-Retrieval Sink Attention (PR-Sink) håndterer dette, ved å holde den første genererte blokk som en permanent ‘Static Sink’ – en relevant tidligere posisjon, som fungerer som en erstattbar ‘Dynamic Sink’, og et rullende vindu som inneholder den nåværende og to forrige blokker. Referansebildet forblir separat tilgjengelig gjennom Ref Sink, mens faste lagringsstørrelser forhindrer at kostnadene vokser med videoens lengde.

Block Wars

For å velge eldre posisjoner for denne begrensede minnet, ViTPose reduserer kropp- og håndposisjoner over tre rammeverk til en kompakt representasjon. Minnebanken holder fem slike representative posisjoner, og fylles under de første 20 blokkene, og foretrekker varierte posisjoner over nære duplikater.

Under generering sammenlignes den innkommende posisjonen med disse representantene og den nærmeste matchen hentes, og gir tidligere bevis på hvordan personen så ut i en lignende posisjon. Men den umiddelbart forrige blokk er ekskludert, fordi den allerede eksisterer i rullende vindu, og lar Dynamic Sink hente informasjon fra lengre tilbake.

Til slutt er runtime selv optimalisert for hastighet ved å distribuere oppmerksomhetsprosessering over to H100-GPUer, overlappe kommunikasjon med beregning, og gjenbruke cachede informasjon hvor mulig.

Data og tester

LiveAnimate ble trenet på 40 000 talevideoer fra AVSpeech, og 20 000 menneske-bevegelsesvideoer fra TikTok-dataset og HumanVid, med trenings- og inferens-støtte for oppløsninger på 480×480; 384×672; og 672×384 piksler.

Treningsprosessen startet fra Wan2.2-Animate-14B-base-checkpoint, ved å bruke LoRA med rang 128, og fortsatte på åtte NVIDIA H100-GPUer for 10 000 trinn i det første stadiet, og 20 000 i det andre.

Video ble generert i blokker av tre latente rammeverk (modellens komprimerte interne representasjon), som tilsvarer 12 RGB-rammeverk, mens inferens ble utført på de to H100-GPUene.

Evalueringen sammenlignet LiveAnimate med eksisterende pose-drevne menneske-animasjonsmetoder over både korte og lange sekvenser, ved å bruke referansebilder og drivende posisjoner under konsistente innstillinger. Lange-form-tester utvidet generering til tre minutter for å undersøke om kvalitet og identitet forble stabile over tid.

Rammeverk testet var EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; og Wan2.2-Animate.

Mål som ble brukt, omfattet visuell kvalitet, identitets-konsistens, distribusjonskvalitet og temporalt representasjonsfeil. Estetisk Poeng (ASE) og Ingen-referanse Bildekvalitetsvurdering (IQA) målte rammeverksnivå-visuell kvalitet; DINO, likhet (DINO-S), og utseendekonsistens med referanse-identiteten; Fréchet Inception Distance (FID), distribusjonskvalitet; og VideoMAE-egenskapsavstand (V-MAE), hvordan godt generert video bevarte bevegelse over tid:

Testresultater relatert til kvalitet og identitet over tre minutter med kontinuerlig generering, med LiveAnimate som forblir relativt stabil over alle fem målene når sekvensen utvikler seg. Flere konkurrerende metoder viser større forringelse over tid. Høyere lesninger er bedre for IQA, ASE og DINO-S, med lavere lesninger bedre for FID og V-MAE.

Testresultater relatert til kvalitet og identitet over tre minutter med kontinuerlig generering, med LiveAnimate som forblir relativt stabil over alle fem målene når sekvensen utvikler seg. Flere konkurrerende metoder viser større forringelse over tid. Høyere lesninger er bedre for IQA, ASE og DINO-S, med lavere lesninger bedre for FID og V-MAE.

Som vist i det første resultattabellen ovenfor, oppnådde LiveAnimate den høyeste innledende ASE på 2,823, og IQA på 4,047, over de første 30 sekundene. Forfatterne hevder at dette indikerer at tre-trinns destillering bevare perseptuell kvalitet, til tross for den reduserte inferens-budsjettet.

Mer betydningsfullt viste LiveAnimate liten forringelse under tre minutter med kontinuerlig generering, med visuell kvalitet og identitets-konsistens-poeng som forble nesten uendret.

Omverto, forringlet One-to-All betydelig over tid, med lavere visuell kvalitet og identitets-konsistens og høyere distribusjonsfeil; og basis-Wan2.2-Animate viste også en viss tap av identitets-konsistens.

Forfatterne sier:

‘Disse trendene støtter vår sentrale påstand om at eksplisitt håndtering av langtids-kontekst er viktig for strømmet animasjon.’

LiveAnimates skalerings-effektivitet ble også testet over GPUer. Som vist nedenfor, ble 12,41 FPS oppnådd med en H100; 19,63 FPS med to; og 22,13 FPS med fire, med gevinstene som ble stadig mer begrenset av kommunikasjons-overhodet. To H100-GPUer ble derfor valgt som den foretrukne konfigurasjonen:

Skalerings-effektivitet over en, to og fire H100-GPUer ved 480×480-oppløsning, som viser forsinkelse, rammeverksfrekvens, hastighetsforbedring og effektivitet. To GPUer oppnådde 19,63 FPS, mens ytterligere skalerings til fire produserte bare en beskjeden økning til 22,13 FPS.

Skalerings-effektivitet over en, to og fire H100-GPUer ved 480×480-oppløsning, som viser forsinkelse, rammeverksfrekvens, hastighetsforbedring og effektivitet. To GPUer oppnådde 19,63 FPS, mens ytterligere skalerings til fire produserte bare en beskjeden økning til 22,13 FPS.

Med 19,63 FPS ble hver 12-rammeverks-blokk generert på 0,611 sekunder. I sammenligning ble omtrent 2–5 timer krever av de konkurrerende systemene for å generere den samme tre-minutters sekvensen.

Kvalitative tester viste opp lignende forskjeller: i fullkropps-testen vist nedenfor, ble alvorlig forringelse observert i One-to-All; flimring ble produsert av UniAnimate-DiT og SCAIL; og senere farge- eller bakgrunns-drift ble synlig med Wan-Animate og EverAnimate.

Testresultater som sammenligner fullkropps-animasjon over tre minutter. Rammeverk ble samplet hver 20 sekunder, med røde annotasjoner som høydepunkter langtids-forringelse i konkurrerende metoder. Baseline-trene krevde omtrent 2–5 timer for å generere sekvensen, sammenlignet med omtrent fire minutter for LiveAnimate.

Testresultater som sammenligner fullkropps-animasjon over tre minutter. Rammeverk ble samplet hver 20 sekunder, med røde annotasjoner som høydepunkter langtids-forringelse i konkurrerende metoder. Baseline-trene krevde omtrent 2–5 timer for å generere sekvensen, sammenlignet med omtrent fire minutter for LiveAnimate. Se kilde-papiret for bedre oppløsning.

LiveAnimate opprettholdt subjektets utseende og omgivende scene gjennom hele tre-minutters sekvensen. I den mindre krevende overkropps-testen vist nedenfor, ble sammenlignbar langtids-stabilitet oppnådd av EverAnimate og LiveAnimate (selv om sanntids-generering bare ble levert av LiveAnimate):

Testresultater som sammenligner overkropps-animasjon over tre minutter. Rammeverk samplet hver 20 sekunder viser LiveAnimate som opprettholder subjektets identitet, klær og mørk bakgrunn mer konsistent enn de konkurrerende metodene.

Testresultater som sammenligner overkropps-animasjon over tre minutter. Rammeverk samplet hver 20 sekunder viser LiveAnimate som opprettholder subjektets identitet, klær og mørk bakgrunn mer konsistent enn de konkurrerende metodene.

Forfatterne konkluderer:

‘På tre-minutters-benchmarket opprettholder LiveAnimate nesten konstant perseptuell kvalitet og identitet på 19,63 FPS på to H100-GPUer, med minne og forsinkelse uavhengig av strøm-lengde, mens offline-baselinjer forringes synlig eller krever flere timer med beregning.

‘Disse resultater bringer milliard-skala video-diffusjonsmodeller innen rekkevidde av interaktive applikasjoner som live-strømming, telepresens og virtuelle avatarer.’

Konklusjon

Det er oppmuntrende å se et drevet-genereringsrammeverk ta en ny tilnærming til de varige problemene med minne og identitet som plager generativ video. Det finnes allerede mange generative rammeverk som kan referere til faste bilder levert av brukeren, uten å måtte ‘lime’ referansebildet inn i essensiell bilde-til-video-innhold.

Men dette løser bare noen av problemene med å generere en enkelt video-klipp, som å beholde identiteten (inkludert klær og frisyre) til en person som går tilbake inn i rammen, eller som har blitt midlertidig skjult, og deretter sees igjen. Til nå har bare den tungtveiende og irriterende midlertidige LoRA-tilnærmingen gjort noen fremskritt med disse problemene, selv om det er begrenset og midlertidig.

For video, og faktisk for hele den nåværende AI-revolusjonen, er utviklingen av effektiv varig minne et kritisk, eksistensielt spørsmål – ett som sannsynligvis vil definere forskjellen mellom fremveksten av AGI eller en tredje AI-vinter.

 

*  Er dette en ‘gotcha’ lenger? Den nåværende tenkningen er at mindre spesialiserte modeller kan til slutt kjøre lokalt, uten leie, mens høyere behov dekkes av en konkurrerende og håpetvis fragmentert GPU-leie-marked. Dette antar at frontier-selskapene ikke EEE konkurransen, og at betydelig GPU-komputering forblir tilgjengelig uansett. På denne grunn regner jeg ikke lenger med at ekstreme GPU-krav er en feil, men håper at tilgang blir stadig mer demokratiske, og at senere optimaliseringer reduserer de opprinnelige ressurs-kravene.

AI-generert og kontrollert av meg selv.

†† For lange video-tester, ble SCAIL og UniAnimate-DiT utvidet med den samme trening-frie glide-vindu-prosedyren fordi ingen av dem støtter naturlig lang-form-generering. EverAnimate og One-to-All ble evaluert ved å bruke deres egne lange video-genereringsmetoder.

 

Først publisert torsdag, 13. august 2026

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai