Andersonův úhel

Směrem k trvalé generaci plnohodnotných deepfake videí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
An enlargement from a test video wherein the dance movements of a stick figure inform and drive the motion of a single identity. Source - https://liveanimate.github.io/

V oblasti, kde je vyžadována trpělivost, nový systém nás přivádí o krok blíže k živému streamování lidské simulace bez frustrujících kol renderování.

 

Stav umění v oblasti plnohodnotné simulace lidské postavy ušel dlouhou cestu od chvíle, kdy se objevila možnost generování plnohodnotných deepfake první hluboké padělané videa v roce 2022. Mezitím jsme si zvykli na působivou a často kontroverzní schopnost otevřených systémů, jako je Wan-Animate, a uzavřených systémů, jako je Grok, převést jeden nebo více obrázků do konzistentního a často přetvořeného video výkonu:

Kliknutím spustíte přehrávání, pokud je to nutné. Příklady nahrazování osob pomocí WanAnimate-2.2. Pro lepší rozlišení se obraťte na zdroj.  Zdroj 

Kromě toho starší autoencoder-based rámec pro živou hlubokou padělanou tvář DeepFaceLive byl již překonán sofistikovanějšími rámci, jako je Deep-Live-Cam, který využívá orchestraci LivePortrait iterací, stejně jako legacy GAN a InsightFace modulů, aby vytvořil efektivní reálný časový nástupce (nyní opuštěného) projektu DFLive:

Kliknutím spustíte přehrávání: Elon Musk hluboce padělaný v živé video relaci prostřednictvím Deep-Live-Cam. Pro lepší rozlišení se obraťte na zdroj. Zdroj 

Nicméně, zatímco rámce, jako je Deep-Live-Cam, mohou běžet navždy a padělat navždy, a přestože jsou lepší při generování náročných úhlů obličeje než dříve, výsledky jsou nicméně omezeny z hlediska rozlišení a schopností: můžete získat určitou tvář / identitu a může dělat mnoho věcí, jako jsou přesvědčivé obličejové výrazy a synchronizace rtů – ale je to v podstatě jednoduchý trik.

BRB…

Většina současných systémů pro lidskou simulaci jsou podobně omezeny a / nebo “specializované”. Jedním z těchto opakujících se omezení je, že nejlepší systémy pro simulaci / napodobování lidské jsou offline – to znamená, že jsou příliš náročné na zdroje, aby mohly fungovat v reálném čase, a místo toho potřebují jít pryč, vypočítat řešení a poté představit výsledek uživateli:

Je zřejmé, že takové systémy jsou nevhodné pro živou transformaci, jako je transformace celého těla, jako je tanec, v živém streamu.

Příkladem toho v posledních letech je otevřený Wan2.2. Animate, který se stal hitem mezi hobbyisty a profesionálními prodejci – ale opět, je to “vytvoř a čekej” scénář:

Kliknutím spustíte přehrávání. Z roku 2025, příklady působivých schopností Wan2.2-Animate – pokud můžete mít trochu trpělivosti. Pro lepší rozlišení se obraťte na zdroj. Zdroj 

Takže, jak tomu je, můžete mít to skvělé, můžete mít to všestranné, nebo můžete mít to hned – vyberte si dvě možnosti.

LiveAnimate

Do tohoto mexického patu přichází nová nabídka z Číny, která efektivně transformuje Wan2.2 Animate do živého animačního rámce, který aktuálně běží na respektabilních téměř 20 fps, s působivými výsledky v širokém spektru scénářů:

Kliknutím spustíte přehrávání: Z projektu, LiveAnimate přenáší řídící pózy napříč scénáři tance, plného těla a portrétu, reprodukující pohyby celého těla, rukou a obličeje. Pro lepší rozlišení se obraťte na zdroj. Zdroj 

Nová práce rozšiřuje původní systém do živého režimu změnou jak je generováno video: místo zpracování minulých a budoucích snímků společně, LiveAnimate generuje každý nový segment, jak se akce vyvíjí, pomocí pouze několika kroků, zatímco zachovává vybrané dřívější pózy, aby byla zachována konzistence vzhledu subjektu po dlouhou dobu.

Efektivně, systém uchovává dřívější snímky jako metodu trvalé paměti, aby mohl čerpat z ní, jak se video vyvíjí, aby zůstala identita konzistentní – což není úplně odlišné od toho, jak staré CGI systémy odkazují na texturové mapy.

Ačkoli je LoRA zapojena do zpracování, LiveAnimate není jen další LoRA systém – jeho generace streamu, systém paměti / cache, tříkrokový odhad a optimalizace GPU představují další mechanismy, nad rámec různých dalších technologií (některých překvapivě starých) v jeho repertoáru.

Nový systém může zvládnout nejen plné scénáře řízení celého těla, jako jsou ty výše uvedené, ale také pohyby horní části těla, jako je tomu v scénářích rozhovoru:

Kliknutím spustíte přehrávání. ‘Jemné pohyby hlavy a ruky nad statickou kancelářskou scénou’.

Abyste byli spravedliví, pokud jde o jeho omezení, nová práce připouští, že dva ze soupeřících rámců testovaných proti LiveAnimate byly schopny zachovat identitu mírně lépe ve bestimmých specifických okolnostech; že said, žádný z konkurentů není online, ale offline systém, a autoři nové práce jasně tlačí hranice v uvěřitelném a optimistickém směru.

Kromě toho je možná vhodné poznamenat, že inference vyžaduje dvě H100 NVIDIA GPU, pro celkovou kapacitu 160GB VRAM*.

Práce uvádí:

‘LiveAnimate udržuje téměř konstantní percepční kvalitu a identitu od prvních 30 sekund do posledního [minut], zatímco předchozí systémy se zhoršují podstatně nebo vyžadují hodiny offline výpočtu pro stejný rollout.

‘Tyto výsledky stanoví nový provozní bod v kvalitě, latenci a trvání pro interaktivní animaci celého těla.’

Nová práce se nazývá LiveAnimate: Stabilní dlouhodobá streamovaná lidská animace v reálném čase a pochází od devíti autorů z Čínské univerzity v Hongkongu, Qwen Applications Business Group of Alibaba a Liblib AI. Projektový web, který obsahuje videa uvedená v tomto článku, je také k dispozici, zatímco kód je ‘příští‘, a váhy… kdo ví?

Metoda

LiveAnimate se skládá ze dvoufázového tréninkového procesu, který je navržen tak, aby Wan2.2-Animate generoval neustále a rychle, následovaný systémem paměti, který uchovává užitečné dřívější pózy, jakmile je vygenerován každý nový blok videa:

Přehled LiveAnimate pipeline, zobrazující dvoufázový tréninkový proces vlevo a živou generaci vpravo, kde příchozí pózy jsou porovnány se uloženými dřívějšími pózy a kombinovány s nedávnými snímky, aby vygenerovaly každý nový blok videa ve třech krocích. Zdroj - https://arxiv.org/pdf/2608.11745

Přehled LiveAnimate pipeline, zobrazující dvoufázový tréninkový proces vlevo a živou generaci vpravo, kde příchozí pózy jsou porovnány se uloženými dřívějšími pózy a kombinovány s nedávnými snímky, aby vygenerovaly každý nový blok videa ve třech krocích. Zdroj 

Původní Wan2.2-Animate je navržen tak, aby zvažoval celý sekvenci, spíše než generovat nekonečně se rozšiřující video. Proto aby se přizpůsobil, autoři rozdělili tréninková videa do po sobě jdoucích bloků, s každým generovaným pomocí dřívějších bloků jako kontext / pravda. To zpočátku učí model pokračovat z spolehlivého předchozího materiálu, než musí zvládnout chyby nahromaděné z jeho vlastního výstupu.

Zapomeňte na mě

Během tohoto procesu je původní referenční obrázek uchován trvale dostupný prostřednictvím ‘Ref Sink’, poskytující stálou připomínku identity a vzhledu osoby. Jakmile je blok dokončen, ‘Clean KV Update’ převádí informace získané z něj do historického kontextu pro následující bloky (i když to neopravuje existující chyby).

Tato první fáze tréninku stále vyžaduje 50 denoising kroků na blok, což činí živou operaci nepohodlnou. Druhá fáze proto zjednodušuje proces na tři kroky, zatímco vystavuje model jeho vlastní generované historii, protože nasazení vyžaduje, aby každý nový segment závisel na nedokonalém dřívějším výstupu:

Dvě tréninkové fáze† používané k přípravě LiveAnimate na nasazení, první učení z čistých předchozích videobloků – pak snižuje generování na tři kroky, zatímco trénink na modelově vlastním nedokonalém výstupu.

Dvě tréninkové fáze† používané k přípravě LiveAnimate na nasazení, první učení z čistých předchozích videobloků – pak snižuje generování na tři kroky, zatímco trénink na modelově vlastním nedokonalém výstupu.

Trénink proti těmto samo-generovaným sekvencím představuje další problém, protože uchování celé výpočetní historie videa by bylo prohibitivně drahé. Místo toho je proveden jeden kompletní tréninkový běh, poté je revidován, jeden blok najednou, pro trénink. Každý blok může tedy obdržet aktualizaci bez uchování celé sekvence výpočetně ‘živé’.

V kombinaci s LoRA adaptací, toto umožňuje 14 miliardový parametr modelu být destilován na jednom uzlu obsahujícím osm 80GB H100 GPU (s poznámkou, že tento cluster je pro trénink, ne runtime inference).

Nesnažte se přestat

Pro nekonečnou generaci, LiveAnimate musí také rozhodnout, co je hodno zapamatování. Uchování všechno by činilo požadavky na zpracování nekontrolovatelně velkými; ale uchování pouze nedávných snímků by mohlo také zahodit užitečné dřívější pohledy.

Proto Pose-Retrieval Sink Attention (PR-Sink) řeší tuto otázku, uchováváním prvního vygenerovaného bloku jako trvalého ‘Static Sink’ – relevantní dřívější póza, fungující jako zaměnitelný ‘Dynamic Sink’, a rolovací okno obsahující aktuální a dva předchozí bloky. Referenční obrázek zůstává zvlášť dostupný prostřednictvím Ref Sink, zatímco pevné velikosti úložiště brání tomu, aby se náklady zvyšovaly s délkou videa.

Block Wars

Pro výběr starších póz pro tuto omezenou paměť, ViTPose snižuje polohy těla a rukou napříč třemi snímky na kompaktní reprezentaci. Paměťová banka uchovává pět takových reprezentativních póz a je osazena během prvních 20 bloků, preferujících rozmanité pózy nad téměř duplikáty.

Během generování je příchozí póza porovnávána s těmito reprezentativními pózami a je načten nejbližší shoda, poskytující dřívější důkaz o tom, jak vypadala osoba v podobné pozici. Nicméně, bezprostředně předcházející blok je vyloučen, protože již existuje v rolovacím okně, což umožňuje Dynamic Sink načíst informace z dále zpět.

Nakonec je runtime sám optimalizován pro rychlost distribucí procesu pozornosti napříč dvěma H100 GPU, překrýváním komunikace s výpočtem a opětovným použitím uložených informací, kde je to možné.

Data a testy

LiveAnimate byl trénován na 40 000 mluvených videích z AVSpeech a 20 000 lidských pohybových videích z TikTok dataset a HumanVid, s tréninkem a inferencí podporujícími rozlišení 480×480; 384×672; a 672×384 pixelů.

Trénink začal z Wan2.2-Animate-14B základního kontrolního bodu, pomocí LoRA s hodností 128, a probíhal na osmi NVIDIA H100 GPU po 10 000 krocích v první fázi a 20 000 ve druhé.

Video bylo generováno v blocích tří latentních snímků (modelova interní komprimovaná reprezentace), odpovídajících 12 RGB snímkům, zatímco inference se prováděla na dvou H100.

Evaluační testy porovnaly LiveAnimate s existujícími metodami řízení lidské animace napříč krátkými a dlouhými sekvencemi, pomocí referenčních obrázků a řídících póz v konzistentních nastaveních. Dlouhodobé testy prodloužily generování na tři minuty, aby se prozkoumalo, zda kvalita a identita zůstaly stabilní po delší dobu.

Testované rámce byly EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; a Wan2.2-Animate.

Metriky používané zahrnovaly vizuální kvalitu, konzistenci identity, distribuční kvalitu a chybu časového представování. Aesthetic Score (ASE) a no-reference Image-Quality Assessment (IQA) měřily kvalitu snímků; DINO, podobnost (DINO-S), a konzistence vzhledu s referenční identitou; Fréchet Inception Distance (FID), distribuční kvalita; a VideoMAE feature distance (V-MAE), jak dobře generované video zachovalo pohyb v čase:

Testovací výsledky týkající se kvality a identity napříč třemi minutami kontinuální generace, s LiveAnimate, které zůstávají relativně stabilní napříč všemi pěti metrikami, jak se sekvence vyvíjí. Několik soupeřících metod vykazuje větší degradaci po delší době. Vyšší čtení jsou lepší pro IQA, ASE a DINO-S, s nižšími čteními lepšími pro FID a V-MAE.

Testovací výsledky týkající se kvality a identity napříč třemi minutami kontinuální generace, s LiveAnimate, které zůstávají relativně stabilní napříč všemi pěti metrikami, jak se sekvence vyvíjí. Několik soupeřících metod vykazuje větší degradaci po delší dobu. Vyšší čtení jsou lepší pro IQA, ASE a DINO-S, s nižšími čteními lepšími pro FID a V-MAE.

LiveAnimate dosáhl nejvyššího počátečního ASE 2,823 a IQA 4,047, během prvních 30 sekund. Autoři tvrdí, že to naznačuje, že tříkrokový destilace zachovává percepční kvalitu, navzdory sníženému odhadu.

Více významně, LiveAnimate ukázal jen malou degradaci během tří minut kontinuální generace, s jeho vizuální kvalitou a konzistencí identity skóre, které zůstaly téměř nezměněné.

Naproti tomu, One-to-All se zhoršila podstatně po delší době, s nižší vizuální kvalitou a konzistencí identity a vyšší distribuční chybou; a základní Wan2.2-Animate také ukázal jistou ztrátu konzistence identity.

Autoři uvádějí:

‘Tyto trendy podporují náš centrální tvrzení, že explicitní řízení dlouhodobého kontextu je důležité pro streamovanou animaci.’

LiveAnimateova efektivita škálování byla také testována napříč GPU. Jak je vidět níže, 12,41 FPS bylo dosaženo s jedním H100; 19,63 FPS s dvěma; a 22,13 FPS se čtyřmi, s rostoucími zisky, které jsou stále více omezeny komunikací. Dva H100 byly proto vybrány jako preferovaná konfigurace:

Efektivita škálování napříč jedním, dvěma a čtyřmi H100 GPU při rozlišení 480×480, zobrazující latenci, rychlost snímků, zrychlení a efektivitu. Dva GPU dosáhli 19,63 FPS, zatímco další škálování na čtyři produkovalo pouze skromný nárůst na 22,13 FPS.

Efektivita škálování napříč jedním, dvěma a čtyřmi H100 GPU při rozlišení 480×480, zobrazující latenci, rychlost snímků, zrychlení a efektivitu. Dva GPU dosáhli 19,63 FPS, zatímco další škálování na čtyři produkovalo pouze skromný nárůst na 22,13 FPS.

V 19,63 FPS, každý 12-snímkový blok byl vygenerován za 0,611 sekund. Pro srovnání, přibližně 2–5 hodin bylo vyžadováno soupeřícími systémy, aby vygenerovaly stejnou tříminutovou sekvenci.

Kvalitativní testy ukázaly podobné rozdíly: v plnohodnotném testu, který je uveden níže, byla pozorována závažná degradace u One-to-All; blikání bylo produkováno UniAnimate-DiT a SCAIL; a později se objevila barevná nebo pozadí drift u Wan-Animate a EverAnimate.

Testovací výsledky porovnávající plnohodnotnou animaci po dobu tří minut. Snímky byly vzorkovány každých 20 sekund, s červenými anotacemi, které zvýrazňují dlouhodobou degradaci u soupeřících metod. Základní metody vyžadovaly přibližně 2–5 hodin, aby vygenerovaly sekvenci, ve srovnání s přibližně čtyřmi minutami pro LiveAnimate.

Testovací výsledky porovnávající plnohodnotnou animaci po dobu tří minut. Snímky byly vzorkovány každých 20 sekund, s červenými anotacemi, které zvýrazňují dlouhodobou degradaci u soupeřících metod. Základní metody vyžadovaly přibližně 2–5 hodin, aby vygenerovaly sekvenci, ve srovnání s přibližně čtyřmi minutami pro LiveAnimate. Pro lepší rozlišení se obraťte na zdroj papíru.

LiveAnimate zachoval vzhled subjektu a okolní scénu po celou tříminutovou sekvenci. V méně náročném testu horní části těla, který je uveden níže, byla dosažena srovnatelná dlouhodobá stabilita EverAnimate a LiveAnimate (ačkoli reálná generace byla poskytnuta pouze LiveAnimate):

Testovací výsledky porovnávající animaci horní části těla po dobu tří minut. Snímky vzorkované každých 20 sekund ukazují LiveAnimate, který zachovává identitu subjektu, oblečení a tmavé pozadí konzistentněji než soupeřící metody.

Testovací výsledky porovnávající animaci horní části těla po dobu tří minut. Snímky vzorkované každých 20 sekund ukazují LiveAnimate, který zachovává identitu subjektu, oblečení a tmavé pozadí konzistentněji než soupeřící metody.

Autoři uzavírají:

‘Na tříminutovém benchmarku LiveAnimate udržuje téměř konstantní percepční kvalitu a identitu při 19,63 FPS na dvou H100 GPU, s pamětí a latencí nezávislou na délce streamu, zatímco offline základní metody se zhoršují viditelně nebo vyžadují hodiny výpočtu.

‘Tyto výsledky přinášejí modely video difúze o velikosti miliard do dosahu interaktivních aplikací, jako je živé streamování, telepřítomnost a virtuální avatary.’

Závěr

Je povzbudivé vidět, že generovaný rámec zaujal nový přístup k trvalým problémům paměti a identity, které sužují generované video. Již existuje mnoho generativních rámců, které mohou odkazovat na pevné obrázky poskytnuté uživatelem, bez nutnosti “vložit” referenční obrázek do základního obsahu obrázku na video.

Jedná se o řešení pouze některých problémů generování jediného video klipu, jako je uchování identity (včetně oblečení a účesu) osoby, která znovu vstoupí do rámu, nebo se stane dočasně zakrytou a poté je opět vidět. Do dneška pouze dočasný a nepohodlný LoRA přístup udělal nějaký pokrok v těchto otázkách, ačkoli omezený a prozatímní.

Pro video a, ve skutečnosti, pro celou současnou AI revoluci, vývoj účinné trvalé paměti je kritickou, existenční otázkou – otázkou, která pravděpodobně definuje rozdíl mezi vznikem AGI nebo třetím AI zimou.

 

*  Je tohle ještě “gotcha”? Současný způsob myšlení je, že menší specializované modely mohou nakonec běžet místně, bezplatně, zatímco vyšší potřeby jsou obsluhovány konkurenčním a doufejme balkanizovaným GPU nájemním trhem. To předpokládá, že přední společnosti selžou v EEE soupeřících a že podstatné GPU výpočetní zdroje zůstanou dostupné bez ohledu na to. Na tomto základě již nepovažuji za zásadní GPU požadavky za demerit, ale doufám, že přístup se stane stále více demokratickým, a že pozdější optimalizace sníží počáteční požadavky na zdroje.

AI vygenerováno a zkontrolováno mnou.

†† Pro dlouhodobé testování, SCAIL a UniAnimate-DiT byly rozšířeny stejným procedurou bez tréninku, protože ani z nich původně nepodporuje dlouhodobou generaci. EverAnimate a One-to-All byly vyhodnoceny pomocí svých vlastních metod dlouhodobé generace.

 

Poprvé publikováno ve čtvrtek, 13. srpna 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai