Andersons vinkel

Mot det eviga fullkroppsdjupfalska videogenerering

mm
Lägg till Unite.AI bland dina föredragna källor på Google
An enlargement from a test video wherein the dance movements of a stick figure inform and drive the motion of a single identity. Source - https://liveanimate.github.io/

I ett område där tålamod krävs, driver ett nytt system oss lite närmare live-strömnad mänsklig simulering utan frustrerande renderingomgångar.

 

Tillståndet i konsten för fullständig mänsklig simulering har kommit långt sedan möjligheten till fullkroppsdjupfalska först dök upp 2022. Nu har vi vant oss vid den formidabla och ofta kontroversiella förmågan hos öppen källkods-system som Wan-Animate, och slutna system som Grok, att omvandla en eller flera bilder till en sammanhängande och ofta transformerande videoprestation:

Klicka för att spela om nödvändigt. Exempel på personersättning med WanAnimate-2.2. Se källan för bättre upplösning.  Källa 

Dessutom har den äldre autoencoder-baserade live-ansiktsdjupfalska ramverket DeepFaceLive sedan överträffats av mer avancerade ramverk som Deep-Live-Cam, som utnyttjar en orkestrering av LivePortrait-iterationer, samt äldre GAN och InsightFace-moduler, för att skapa en effektiv realtids efterföljare till (den numera övergivna) DFLive-projektet:

Klicka för att spela: Elon Musk djupfalskad i en live-videosession via Deep-Live-Cam. Se källan för bättre upplösning. Källa 

Men medan ramverk som Deep-Live-Cam kan köra för alltid och förfalska för alltid, och även om de är bättre på att generera tuffa ansiktsvinklar än de tidigare, är resultaten ändå begränsade i termer av upplösning och förmåga: du kan få en viss ansikte/identitet, och det kan göra mycket, som övertygande ansiktsuttryck och läppsynk – men det är i princip en en-trick-ponny.

BRB…

De flesta av de nuvarande AI-mänskliga imitationssystemen är likaså begränsade och/eller “specialiserade”. En särskild, återkommande begränsning är att de bästa mänskliga simulerings-/imitationssystemen är offline – det vill säga, de är för resurskrävande för att fungera i realtid, och måste i stället gå bort, beräkna lösningen och presentera resultatet för användaren senare.

Det är uppenbart att sådana system är olämpliga för live AI-omvandling, såsom omvandling av en hel rad kroppsrörelser, som dans, i en live-ström.

Ett exempel på detta under de senaste åren är den öppna viktiga Wan2.2. Animate, som visade sig vara en succé hos hobbyistgemenskapen och pro-återförsäljare – men än en gång, det är en “generera och vänta”-scenario:

Klicka för att spela. Från 2025, exempel på Wan2.2-Animates imponerande förmågor – om du kan ha lite tålamod. Se källan för bättre upplösning. Källa 

Så som det står nu kan du ha det bra, ha det mångsidigt eller ha det nu – välj två.

LiveAnimate

In i denna mexikanska dödläget kommer ett nytt erbjudande från Kina, som effektivt omvandlar Wan2.2 Animate till ett live-drivet animationsramverk som för närvarande opererar vid en respektabel nästan-20fps, med imponerande resultat över ett brett spektrum av scenarier:

Klicka för att spela: Från projektwebbplatsen, LiveAnimate överför styrande poser över scen-dans, utomhus fullkropp och närbilds-porträttscenarier, återger helkropp, hand och ansiktsrörelse. Se källan för bättre upplösning. Källa 

Det nya arbetet utvidgar det ursprungliga systemet till ett live-kapabelt version genom att ändra hur video genereras: istället för att bearbeta tidigare och framtida ramar tillsammans, genererar LiveAnimate varje nytt segment medan handlingen utvecklas, med bara några steg, samtidigt som den behåller valda tidigare poser för att hålla ämnet konsekvent över långa sessioner.

Effektivt sett behåller systemet tidigare ramar som en metod för beständig minne för att dra på medan videon utvecklas, så att identiteten förblir konsekvent – inte helt olikt det sätt som gamla CGI-system hänvisar till texture maps.

Även om en LoRA är inblandad i bearbetningssteget, är LiveAnimate inte bara ett annat LoRA-system – dess strömmande generation, pose-minnes-/cachesystem, tre-stegs inferens och GPU-optimeringar representerar ytterligare mekanismer, utöver de många andra teknologierna (några överraskande gamla) i dess repertoar.

Det nya systemet kan hantera inte bara fullkroppsstyrda scenarier som de ovan, utan också överkroppsrörelser, som i intervju-scenarier:

Klicka för att spela. ‘Subtil huvud- och handrörelse över en statisk kontors scen’.

För att vara rättvisande om dess begränsningar, medger den nya artikeln att två av de rivaliserande ramverken som testades mot LiveAnimate kunde bevara identitet något bättre i vissa specifika omständigheter; det sagt, inte en av motståndarna är ett online-snarare än offline-system, och författarna till det nya arbetet trycker tydligt på kuvertet i en trovärdig och optimistisk riktning.

Dessutom kan det vara värt att notera att inferens kräver två H100 NVIDIA-GPU:er, för totalt 160 GB VRAM*.

Artikeln säger:

‘LiveAnimate behåller nästan konstant perceptuell kvalitet och identitet från de första 30 sekunderna till den sista [minuten], medan tidigare system försämras avsevärt eller kräver timmar av offline-beräkning för samma rullning.

‘Dessa resultat etablerar en ny driftspunkt för kvalitet, latens och varaktighet för interaktiv fullkroppsanimering.’

Den nya artikeln heter LiveAnimate: Stabil Lång-Form Strömmande Mänsklig Animering i Real-Tid, och kommer från nio författare över The Chinese University of Hong Kong, Qwen Applications Business Group of Alibaba, och Liblib AI. En projektwebbplats, full av videor som också visas i den här artikeln, är även tillgänglig, medan koden är ‘kommer snart’, och vikter… vem vet?

Metod

LiveAnimate utgör en två-stegs träningsprocess som är utformad för att göra Wan2.2-Animera generera kontinuerligt och snabbt, följt av ett minnessystem som hämtar användbara tidigare poser när varje nytt videoblock produceras:

En översikt över LiveAnimate-pipelinen, som visar dess två-stegs träningsprocess på vänster sida och live-generation på höger sida, där inkommande poser matchas mot lagrade tidigare poser och kombineras med senaste ramar för att generera varje nytt videoblock i tre steg. Källa - https://arxiv.org/pdf/2608.11745

En översikt över LiveAnimate-pipelinen, som visar dess två-stegs träningsprocess på vänster sida och live-generation på höger sida, där inkommande poser matchas mot lagrade tidigare poser och kombineras med senaste ramar för att generera varje nytt videoblock i tre steg. Källa 

Det ursprungliga Wan2.2-Animera är utformat för att överväga en hel sekvens snarare än att generera ett oändligt utsträckt video. Därför delades träningsvideor in i på varandra följande block, med varje genererat med tidigare block som kontext/sanning. Detta lärde ursprungligen modellen att fortsätta från tillförlitligt tidigare material, innan den måste hantera fel som ackumulerats från sin egen utdata.

Glöm inte mig

Under hela denna process hålls den ursprungliga referensbilden permanent tillgänglig genom en ‘Ref Sink’, som ger en fast påminnelse om personens identitet och utseende. När ett block har slutförts, konverterar en ‘Clean KV Update’ information som erhållits från det till historisk kontext för efterföljande block (även om detta inte reparerar befintliga fel).

Denna första träningssteg kräver fortfarande 50 brusreduceringssteg per block, vilket gör live-drift opraktisk. Den andra etappen destillerar därför processen ner till tre steg, medan modellen exponeras för sin egen genererade historia, eftersom distribution kräver att varje nytt segment ska bero på ofullkomlig tidigare utdata:

De två träningsstegen† som används för att förbereda LiveAnimate för distribution, först lär sig från rena tidigare videoblock – sedan reducerar generationen till tre steg, medan modellen tränas på sin egen ofullkomliga utdata.

De två träningsstegen† som används för att förbereda LiveAnimate för distribution, först lär sig från rena tidigare videoblock – sedan reducerar generationen till tre steg, medan modellen tränas på sin egen ofullkomliga utdata.

Träning mot dessa självgenererade sekvenser presenterar ett annat problem, eftersom att behålla hela videons beräkningshistoria skulle vara förbjudande dyrt. Istället görs en fullständig övningskörning, sedan återbesökt, ett block i taget, för träning. Varje block kan därför få en uppdatering utan att hålla hela sekvensen beräkningsmässigt ‘aktiv’.

Kombinerat med LoRA-anpassning, möjliggör detta att den 14-miljarderparametrarsmodellen kan destilleras på en enda nod som innehåller åtta 80GB H100-GPU:er (noterar att denna kluster är för träning, inte körningsslutled).

Sluta inte nu

För obegränsad generation måste LiveAnimate också bestämma vad som är värt att komma ihåg. Att behålla allt skulle göra bearbetningskraven explodera; men att behålla endast senaste ramar kan också kasta bort användbara tidigare vyer.

Därför adresserar Pose-Retrieval Sink Attention (PR-Sink) detta, genom att behålla det första genererade blocket som en permanent ‘Static Sink’ – en relevant tidigare pose, som fungerar som en ersättbar ‘Dynamic Sink’, och ett rullande fönster som innehåller det aktuella och de två föregående blocken. Referensbilden förblir separat tillgänglig genom Ref Sink, medan fasta lagringsstorlekar förhindrar att kostnaderna växer när videolängden ökar.

Blockkrig

För att välja äldre poser för denna ganska begränsade minne, reducerar ViTPose kropp- och handpositioner över tre ramar till en komprimerad representation. Minnesbanken innehåller fem sådana representativa poser och fylls under de första 20 blocken, med företräde för varierade poser över nära-duplikat.

Under generation jämförs den inkommande posen med dessa representanter och den närmaste matchen hämtas, vilket ger tidigare bevis för hur personen såg ut i en liknande position. Men den omedelbart föregående blocken exkluderas, eftersom den redan finns i det rullande fönstret, vilket lämnar Dynamic Sink fri att hämta information från längre tillbaka.

Slutligen optimeras själva körningen för hastighet genom att distribuera uppmärksamhetsbearbetning över två H100-GPU:er, överlappa kommunikation med beräkning och återanvända cachad information där det är möjligt.

Data och tester

LiveAnimate tränades på 40 000 talande videor från AVSpeech, och 20 000 mänskliga rörelsevideor från TikTok-databasen och HumanVid, med träning och slutledning som stöder upplösningar på 480×480; 384×672; och 672×384 pixlar.

Träningen började från Wan2.2-Animera-14B-bascheckpunkten, med LoRA med rang 128, och fortsatte på åtta NVIDIA H100-GPU:er i 10 000 steg i den första etappen, och 20 000 i den andra.

Video genererades i block om tre latenta ramar (modellens komprimerade inre representation), motsvarande 12 RGB-ramar, medan slutledning utfördes på de två H100:orna.

Utvarderingen jämförde LiveAnimate med befintliga pose-drivna mänskliga animationsmetoder över både korta och långa sekvenser, med hjälp av referensbilder och styrande poser under konsekventa inställningar. Långformstester utvidgade generationen till tre minuter för att undersöka om kvalitet och identitet förblev stabila över tid.

Ramverk som testades var EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; och Wan2.2-Animera.

Mätvärden som användes omfattade visuell kvalitet, identitetskonsekvens, distributionskvalitet och temporär representationsfel. Estetisk Poäng (ASE) och Ingen referens Bildkvalitetsbedömning (IQA) mätte ramnivåns visuella kvalitet; DINO, likhet (DINO-S), och utseendekonsekvens med referensidentiteten; Fréchet Inception Distance (FID), distributionskvalitet; och VideoMAE-funktionell avstånd (V-MAE), hur väl den genererade videon bevarade rörelse över tid:

Testresultat relaterade till kvalitet och identitet över tre minuters kontinuerlig generation, med LiveAnimate som förblir relativt stabil över alla fem mätvärdena när sekvensen fortskrider. Flera konkurrerande metoder visar större försämring över tid. Högre värden är bättre för IQA, ASE och DINO-S, med lägre värden bättre för FID och V-MAE.

Testresultat relaterade till kvalitet och identitet över tre minuters kontinuerlig generation, med LiveAnimate som förblir relativt stabil över alla fem mätvärdena när sekvensen fortskrider. Flera konkurrerande metoder visar större försämring över tid. Högre värden är bättre för IQA, ASE och DINO-S, med lägre värden bättre för FID och V-MAE.

Som visas i den första resultattabellen ovan, uppnådde LiveAnimate den högsta initiala ASE på 2,823, och IQA på 4,047, under de första 30 sekunderna. Författarna hävdar att detta tyder på att tre-stegs destillering bevarar perceptuell kvalitet, trots den minskade slutledningsbudgeten.

Mer betydelsefullt visade LiveAnimate liten försämring under tre minuters kontinuerlig generation, med dess visuella kvalitets- och identitetskonsekvenspoäng som förblev nästan oförändrade.

Omvänt försämrades One-to-All avsevärt över tid, med lägre visuell kvalitet och identitetskonsekvens och högre distributionsfel; och bas-Wan2.2-Animera visade också en viss förlust av identitetskonsekvens.

Författarna hävdar:

‘Dessa trender stödjer vår centrala påstående att explicit hantering av långsiktig kontext är viktigt för strömmande animering.’

LiveAnimates skalbarhetsverkningsgrad testades också över GPU:er. Som visas nedan, uppnåddes 12,41 FPS med en H100; 19,63 FPS med två; och 22,13 FPS med fyra, med vinster som blev alltmer begränsade av kommunikationsöverhead. Två H100:or valdes därför som den föredragna konfigurationen:

Skalbarhetsverkningsgrad över en, två och fyra H100-GPU:er vid 480×480-upplösning, som visar latens, bildfrekvens, hastighetsökning och effektivitet. Två GPU:er uppnådde 19,63 FPS, medan ytterligare skalning till fyra producerade endast en blygsam ökning till 22,13 FPS.

Skalbarhetsverkningsgrad över en, två och fyra H100-GPU:er vid 480×480-upplösning, som visar latens, bildfrekvens, hastighetsökning och effektivitet. Två GPU:er uppnådde 19,63 FPS, medan ytterligare skalning till fyra producerade endast en blygsam ökning till 22,13 FPS.

Med 19,63 FPS genererades varje 12-ramblock på 0,611 sekunder. I jämförelse krävdes cirka 2–5 timmar av de konkurrerande systemen för att generera samma tre-minuterssekvens.

Kvalitativa tester visade liknande skillnader: i fullkroppstestet som visas nedan, observerades allvarlig försämring i One-to-All; flimrande producerades av UniAnimate-DiT och SCAIL; och senare färg- eller bakgrundsdrift blev uppenbar med Wan-Animera och EverAnimate.

Testresultat som jämför fullkroppsanimering över tre minuter. Ramar sampades var 20:e sekund, med röda annoteringar som markerar långsiktig försämring i konkurrerande metoder. Baslinjerna krävde cirka 2–5 timmar för att generera sekvensen, jämfört med cirka fyra minuter för LiveAnimate.

Testresultat som jämför fullkroppsanimering över tre minuter. Ramar sampades var 20:e sekund, med röda annoteringar som markerar långsiktig försämring i konkurrerande metoder. Baslinjerna krävde cirka 2–5 timmar för att generera sekvensen, jämfört med cirka fyra minuter för LiveAnimate. Se källans paper för bättre upplösning.

LiveAnimate behöll ämnets utseende och omgivande scen under hela tre-minuterssekvensen. I det mindre krävande övre kroppstestet som visas nedan, uppnåddes jämförbar långsiktig stabilitet av EverAnimate och LiveAnimate (även om realtids generation endast tillhandahölls av LiveAnimate):

Testresultat som jämför övre kroppsanimering över tre minuter. Ramar sampades var 20:e sekund, vilket visar att LiveAnimate behåller ämnets identitet, kläder och mörk bakgrund mer konsekvent än de konkurrerande metoderna.

Testresultat som jämför övre kroppsanimering över tre minuter. Ramar sampades var 20:e sekund, vilket visar att LiveAnimate behåller ämnets identitet, kläder och mörk bakgrund mer konsekvent än de konkurrerande metoderna.

Författarna avslutar:

‘På tre-minuters benchmark, LiveAnimate upprätthåller nästan konstant perceptuell kvalitet och identitet vid 19,63 FPS på två H100-GPU:er, med minne och latens oberoende av strömtid, medan offline-baslinjer försämras synligt eller kräver timmar av beräkning.

‘Dessa resultat för billion-skala video-diffusionsmodeller inom räckhåll för interaktiva applikationer som live-strömning, telepresens och virtuella avatarer.’

Slutsats

Det är uppmuntrande att se ett driven-generation-ramverk ta en ny ansats till de bestående problemen med minne och identitet som plågar generativ video. Det finns redan många generativa ramverk som kan hänvisa till fasta bilder som tillhandahålls av användaren, utan att “klistra” referensbilden in i essentiell bild-till-video-innehåll.

Men detta löser bara några av problemen med att generera en enda video-klipp, såsom att behålla identiteten (inklusive kläder och frisyr) hos en person som återinträder ramen, eller som har blivit tillfälligt skymd och sedan ses igen. Hittills har endast den tunga och irriterande tillfälliga LoRA-ansatsen gjort några framsteg med dessa frågor, om än begränsade och provisoriska.

För video, och faktiskt för hela den nuvarande AI-revolutionen, är utvecklingen av effektiv bestående minne en kritisk, existentiell fråga – en som sannolikt kommer att definiera skillnaden mellan framväxten av AGI eller en tredje AI-vinter.

 

*  Är detta fortfarande en “gotcha”? Den nuvarande tanken är att mindre specialiserade modeller kan komma att köras lokalt, hyresfritt, medan högre behov tillgodoses av en konkurrensutsatt och förhoppningsvis balkaniserad GPU-hyresmarknad. Detta antar att gränsföretagen misslyckas med att EEE konkurrensen, och att betydande GPU-beräkningskraft förblir tillgänglig oavsett. På den grunden anser jag inte längre att flagrant GPU-krav är en nackdel, utan hoppas att tillgången blir alltmer demokratisk, och att senare optimeringar minskar de ursprungliga resurskraven.

AI-genererad och kontrollerad av mig.

†† För långvideo-testning, SCAIL och UniAnimate-DiT utvidgades med samma träning-fri glidande-fönster-procedur, eftersom ingen av dem stöder lång-form generation som standard. EverAnimate och One-to-All utvärderades med hjälp av sina egna långvideo-genereringsmetoder.

 

Publicerad första gången torsdag, 13 augusti 2026

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai