Andersonův úhel

Významný pokrok v oblasti lidsky řízené AI videa

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Examples from the DreamActor project page.

Poznámka: Projektová stránka této práce obsahuje 33 automaticky přehrávaných high-res videí o celkové velikosti půl gigabytu, což destabilizovalo můj systém při načítání. Z tohoto důvodu nebude přímý odkaz na ni. Čtenáři si mohou najít URL v abstraktu nebo PDF článku, pokud si to zvolí.

Jedním z hlavních cílů současné výzkumu syntézy videa je generování kompletního AI-poháněného videa z jediného obrázku. Tento týden byl zveřejněn nový článek od Bytedance Intelligent Creation, který popisuje možná nejkomplexnější systém tohoto druhu dosud, schopný produkovat plné a polo-tělové animace, které kombinují expresivní detaily obličeje s přesným velkým pohybem, a zároveň dosahují zlepšené konzistence identity – oblast, ve které i vedoucí komerční systémy často selhávají.

V následujícím příkladu vidíme výkon poháněný hercem (nahoře vlevo) a odvozený z jediného obrázku (nahoře vpravo), který poskytuje pozoruhodně flexibilní a zručnou renderaci, bez obvyklých problémů při vytváření velkých pohybů nebo “hádaní” o zakrytých oblastech (tj. částech oděvu a úhlů obličeje, které musí být odhadnuty nebo vynalezeny, protože nejsou viditelné na jediné zdrojové fotografii):

AUDIO CONTENT. Klikněte pro přehrávání. Výkon je vytvořen ze dvou zdrojů, včetně synchronizace rtů, která je obvykle doménou specializovaných pomocných systémů. Jedná se o zmenšenou verzi ze zdrojové stránky (viz poznámka na začátku článku – platí pro všechna další vložená videa zde).

Přestože můžeme vidět některé zbytkové výzvy týkající se zachování identity při postupu každého klipu, jedná se o první systém, který jsem viděl, a který obecně (i když ne vždy) udržuje ID po delší dobu bez použití LoRAs:

AUDIO CONTENT. Klikněte pro přehrávání. Další příklady z projektu DreamActor.

Nový systém, nazvaný DreamActor, používá tříčástový hybridní kontrolní systém, který věnuje zvláštní pozornost expresi obličeje, rotaci hlavy a designu kostry, a tím umožňuje AI-poháněné výkony, kde ani obličejová ani tělesná stránka netrpí na úkor druhé – schopnost, která je vzácná, možná neznámá mezi podobnými systémy.

Níže vidíme jednu z těchto stránek, rotaci hlavy, v akci. Barevná koule v rohu každého náhledu směrem doprava indikuje druh virtuální hlavy, která definuje orientaci hlavy nezávisle na pohybu obličeje a expresi, která je zde poháněna hercem (dolní levá).

Klikněte pro přehrávání. Multibarevná koule zobrazená zde reprezentuje osu rotace hlavy avataru, zatímco expresi pohání samostatný modul a informuje výkon herce (zobrazený zde dolní levá).

Jedna z nejzajímavějších funkcí projektu, která není ani řádně zahrnuta do testů v článku, je jeho schopnost odvodit pohyb rtů přímo z audia – schopnost, která funguje neobvykle dobře, i bez poháněcího videa herce.

Výzkumníci se postavili proti nejlepším současným systémům v tomto úsilí, včetně velmi chvalovaného Runway Act-One a LivePortrait, a uvádějí, že DreamActor dosáhl lepší kvantitativní výsledky.

Přestože výzkumníci mohou stanovit svá vlastní kritéria, kvantitativní výsledky nejsou nutně empirickým standardem; ale doprovodné kvalitativní testy zdají se podporovat závěry autorů.

Bohužel tento systém není určen pro veřejnou distribuci, a jedinou hodnotou, kterou může komunita získat z této práce, je potenciál reprodukovat metodologie popsány v článku (jako tomu bylo u stejně uzavřeného Google Dreambooth v roce 2022 ).

Článek uvádí*:

‘Animace lidského obrazu má možná sociální rizika, jako je zneužití k vytváření falešných videí. Navrhovaná technologie by mohla být použita k vytváření falešných videí lidí, ale existující detekční nástroje [Demamba, Dormant] mohou tyto falešné videí rozpoznat.

‘Pro snížení těchto rizik jsou nezbytná jasná etická pravidla a zodpovědné pokyny pro použití. Přísně omezíme přístup k našim základním modelům a kódům, aby se předešlo zneužití.’

Přirozeně, etické úvahy tohoto druhu jsou výhodné z komerčního hlediska, protože poskytují důvod pro API-only přístup k modelu, který lze poté zpeněžit. ByteDance již jednou v roce 2025 učinil, když zpřístupnil velmi chvalovaný OmniHuman za placené kredity na webu Dreamina. Proto, jelikož DreamActor je možná ještě silnější produkt, zdá se, že toto je pravděpodobný výsledek. Co zůstává vidět, je rozsah, v jakém jeho principy, pokud jsou popsány v článku, mohou pomoci otevřené komunitě.

Nový článek se jmenuje DreamActor-M1: Holistická, expresivní a robustní animace lidského obrazu s hybridním vedením a pochází od šesti výzkumníků Bytedance.

Metoda

Systém DreamActor navržený v článku má za cíl generovat lidskou animaci z referenčního obrázku a poháněcího videa, pomocí Diffusion Transformer (DiT) frameworku přizpůsobeného pro latentní prostor (zjevně some flavor of Stable Diffusion, i když článek cituje pouze 2022 landmark release publication).

Místo toho, aby se spoléhal na externí moduly pro řízení referenčního podmínění, autoři spojují funkce vzhledu a pohybu přímo uvnitř DiT architektury, umožňující interakci přes prostor a čas pomocí pozornosti:

Schéma pro nový systém: DreamActor kóduje pózu, pohyb obličeje a vzhled do samostatných latentních proměnných, kombinuje je s hlukovými video latentními proměnnými produkovanými 3D VAE. Tyto signály jsou slučovány uvnitř Diffusion Transformeru pomocí self- a cross-pozornosti, se sdílenými váhami napříč větvemi. Model je supervidován porovnáním denoizovaných výstupů s čistými video latentními proměnnými. Zdroj: https://arxiv.org/pdf/2504.01724

Schéma pro nový systém: DreamActor kóduje pózu, pohyb obličeje a vzhled do samostatných latentních proměnných, kombinuje je s hlukovými video latentními proměnnými produkovanými 3D VAE. Tyto signály jsou slučovány uvnitř Diffusion Transformeru pomocí self- a cross-pozornosti, se sdílenými váhami napříč větvemi. Model je supervidován porovnáním denoizovaných výstupů s čistými video latentními proměnnými. Zdroj: https://arxiv.org/pdf/2504.01724

Pro tento účel používá model předtrénovaný 3D variational autoencoder pro kódování obou vstupního videa a referenčního obrázku. Tyto latentní proměnné jsou patchified, spojeny a vloženy do DiT, který je zpracovává společně.

Tato architektura se odchyluje od běžné praxe připojování sekundární sítě pro injekci referenčního signálu, což byl přístup pro vlivné Animate Anyone a Animate Anyone 2 projekty.

Místo toho DreamActor integruje fúzi do hlavního modelu, zjednodušuje design a zlepšuje tok informací mezi signály vzhledu a pohybu. Model je pak trénován pomocí flow matching místo standardního difúzního objektu (Flow matching trénuje difúzní modely přímo predikující pole rychlosti mezi daty a hlukem, přeskočením odhadu skóre).

Hybridní pohyb

Metoda Hybridního pohybu, která informuje neuronové renderování, kombinuje tokeny pózy odvozené z 3D tělesných kostry a sfér hlavy; implicitní reprezentace obličeje extrahované předtrénovaným kodérem obličeje; a tokeny vzhledu vzorkované z referenčního obrázku.

Tyto prvky jsou integrovány uvnitř Diffusion Transformeru pomocí různých mechanismů pozornosti, umožňujících systému koordinovat globální pohyb, expresi obličeje a vizuální identitu během generování.

Pro první z nich místo toho, aby se spoléhal na.landmarky obličeje, DreamActor používá implicitní reprezentace obličeje pro řízení generování expresí, což zřejmě umožňuje jemnější kontrolu nad dynamikou obličeje a oddělení identity a pózy hlavy od expresí.

Pro vytvoření těchto reprezentací je nejprve detekována a oříznuta oblast obličeje v každém snímku poháněcího videa, zvětšena na 224×224. Oříznuté obličeje jsou zpracovány předtrénovaným kodérem pohybu obličeje, který je pak kondicionován MLP vrstvou.

PD-FGC, použitý v DreamActor, generuje mluvící hlavu z referenčního obrázku s oddělenou kontrolou synchronizace rtů (z audia), pózy hlavy, pohybu očí a expresí (z samostatných videí), umožňující přesnou, nezávislou manipulaci s každým. Zdroj: https://arxiv.org/pdf/2211.14506

PD-FGC, použitý v DreamActor, generuje mluvící hlavu z referenčního obrázku s oddělenou kontrolou synchronizace rtů (z audia), pózy hlavy, pohybu očí a expresí (z samostatných videí), umožňující přesnou, nezávislou manipulaci s každým. Zdroj: https://arxiv.org/pdf/2211.14506

Výsledkem je posloupnost tokenů pohybu obličeje, které jsou injektovány do Diffusion Transformeru prostřednictvím cross-pozornostní vrstvy.

Stejná architektura také podporuje audio-poháněnou variantu, kde je trénován samostatný kodér, který mapuje vstup audia přímo na tokeny pohybu obličeje. To umožňuje generovat synchronizovanou animaci obličeje – včetně pohybů rtů – bez poháněcího videa.

AUDIO CONTENT. Klikněte pro přehrávání. Synchronizace rtů odvozená čistě z audia, bez poháněcího videa herce. Jediným vstupem je statická fotografie viditelná vpravo nahoře.

Druhým je, aby se kontrolovala póza hlavy nezávisle na expresi obličeje, systém zavedl reprezentaci 3D sféry hlavy (viz video vložené dříve v tomto článku), která odděluje dynamiku obličeje od globálního pohybu hlavy, zlepšuje přesnost a flexibilitu během animace.

Sféry hlavy jsou generovány extrahováním 3D parametrů obličeje – jako rotace a kamerová póza – z poháněcího videa pomocí FaceVerse metody.

Schéma pro FaceVerse projekt. Zdroj: https://www.liuyebin.com/faceverse/faceverse.html

Schéma pro FaceVerse projekt. Zdroj: https://www.liuyebin.com/faceverse/faceverse.html

Tyto parametry se používají pro vykreslení barevné sféry projekované na 2D obrazovou rovinu, prostorově zarovnanou s poháněcí hlavou. Velikost sféry odpovídá referenční hlavě a její barva odráží orientaci hlavy. Tato abstrakce snižuje složitost učení 3D pohybu hlavy, pomáhá zachovat stylizované nebo přehnané tvary hlavy v postavách odvozených z animace.

Vizualizace kontrolní sféry ovlivňující orientaci hlavy.

Vizualizace kontrolní sféry ovlivňující orientaci hlavy.

Nakonec, pro řízení plného pohybu těla, systém používá 3D tělesné kostry s adaptivní normalizací délky kostí. Parametry těla a ruky jsou odhadnuty pomocí 4DHumans a HaMeR, oba fungují na SMPL-X tělesném modelu.

SMPL-X aplikuje parametrizovanou síť na celé lidské tělo v obraze, zarovnává se s odhadnutou pózou a expresí, aby umožnil pózo-orientovanou manipulaci pomocí síťové volumetrické nápovědy. Zdroj: https://arxiv.org/pdf/1904.05866

SMPL-X aplikuje parametrizovanou síť na celé lidské tělo v obraze, zarovnává se s odhadnutou pózou a expresí, aby umožnil pózo-orientovanou manipulaci pomocí síťové volumetrické nápovědy. Zdroj: https://arxiv.org/pdf/1904.05866

Ze těchto výstupů jsou vybrány klíčové klouby, projekční do 2D a spojeny do lineárních map kosterního systému. Na rozdíl od metod, jako je Champ, které renderují plné tělesné sítě, tento přístup se vyhýbá ukládání předdefinovaných tvarových priorit, a tím, že se spoléhá pouze na kosterní strukturu, model je tak povzbuzen k odhadu tvaru těla a vzhledu přímo z referenčních obrázků, snižuje tak předpojatost vůči pevným typům těl a zlepšuje generalizaci napříč různými pózami a stavbami.

Během trénování jsou 3D tělesné kostry spojeny se sférami hlavy a procházejí pose kodérem, který vrací funkce, které jsou pak kombinovány s hlukovými video latentními proměnnými pro produkci hlukových tokenů používaných Diffusion Transformerem.

V době inferencingu systém zohledňuje rozdíly v kosterní struktuře mezi subjekty normalizací délky kostí. Předtrénovaný image editační model SeedEdit transformuje jak referenční, tak poháněcí obrázky do standardní kanonické konfigurace. RTMPose je pak použit pro extrakci poměrů kosterní struktury, které se používají pro úpravu poháněcí kostry tak, aby odpovídala anatomii referenčního subjektu.

Přehled inferenčního potrubí. Pseudo-referenční obrázky mohou být generovány pro obohacení vzhledových signálů, zatímco hybridní kontrolní signály – implicitní pohyb obličeje a explicitní póza ze sfér hlavy a tělesných kostry – jsou extrahovány z poháněcího videa. Tyto jsou pak vloženy do DiT modelu pro produkci animovaného výstupu, s pohybem obličeje odděleným od pózy těla, umožňujícím použití audia jako poháněcího signálu.

Přehled inferenčního potrubí. Pseudo-referenční obrázky mohou být generovány pro obohacení vzhledových signálů, zatímco hybridní kontrolní signály – implicitní pohyb obličeje a explicitní póza ze sfér hlavy a tělesných kostry – jsou extrahovány z poháněcího videa. Tyto jsou pak vloženy do DiT modelu pro produkci animovaného výstupu, s pohybem obličeje odděleným od pózy těla, umožňujícím použití audia jako poháněcího signálu.

Vzhled

Pro zlepšení věrnosti vzhledu, zejména v zakrytých nebo zřídka viditelných oblastech, systém doplňuje primární referenční obrázek pseudo-referenčními obrázky vzorkovanými z vstupního videa.

Klikněte pro přehrávání. Systém předvídá potřebu přesně a konzistentně renderovat zakryté oblasti. Jedná se o jeden z nejbližších přístupů k CGI-style bitmap-textuře, které jsem viděl v projektu tohoto druhu.

Tyto další snímky jsou vybrány pro rozmanitost pózy pomocí RTMPose a filtrovány pomocí CLIP-založené podobnosti, aby zůstaly konzistentní s identitou subjektu.

Všechny referenční snímky (primární a pseudo) jsou kódovány stejným vizuálním kodérem a slučovány prostřednictvím self-pozornostního mechanismu, umožňujícímu modelu přístup k doplňkovým vzhledovým signálům. Tento nastavení zlepšuje pokrytí detailů, jako jsou profily nebo textury končetin. Pseudo-referenční snímky jsou vždy používány během trénování a volitelně během inferencingu.

Trénování

DreamActor byl trénován ve třech fázích, aby postupně zavedl komplexitu a zlepšil stabilitu.

V první fázi byly použity pouze 3D tělesné kostry a 3D sféry hlavy jako kontrolní signály, vylučující reprezentace obličeje. To umožnilo základní video generovací model, inicializovaný z MMDiT, aby se přizpůsobil lidské animaci bez přetížení jemnými kontrolami.

V druhé fázi byly přidány implicitní reprezentace obličeje, ale všechny ostatní parametry zmraženy. Pouze kodér pohybu obličeje a vrstvy pozornosti obličeje byly trénovány v tomto bodě, umožňující modelu naučit se expresivní detaily v izolaci.

V konečné fázi byly všechny parametry odmraženy pro společnou optimalizaci napříč vzhledem, pózou a dynamikou obličeje.

Data a testy

Pro fázi testování je model inicializován z předtrénovaného image-to-video DiT checkpointu a trénován ve třech fázích: 20 000 kroků pro každou z prvních dvou fází a 30 000 kroků pro třetí.

Pro zlepšení generalizace napříč různými délkami a rozlišeními, video klipy byly náhodně vybrány s délkami mezi 25 a 121 snímky. Tyto byly pak přepočteny na 960x640px, přičemž byl zachován poměr stran.

Trénování bylo provedeno na osmi (čínských) NVIDIA H20 GPU, každá s 96GB VRAM, pomocí AdamW optimalizátoru s (snadno vysoké) learning rate 5e−6.

Během inferencingu obsahoval každý video segment 73 snímků. Pro udržení konzistence napříč segmenty, byl konečný latentní z jednoho segmentu opakovaně použit jako počáteční latentní pro další, což kontextualizuje úkol jako sekvenční image-to-video generaci.

Classifier-free guidance byla aplikována s váhou 2,5 pro obě referenční obrázky a signály pohybu.

Autoři sestavili trénovací dataset (žádné zdroje nejsou uvedeny v článku) složený z 500 hodin videa z rozličných domén, zobrazujících instance (mezi jinými) tance, sportu, filmu a veřejných projevů. Dataset byl navržen pro zachycení širokého spektra lidského pohybu a expresí, s rovnoměrným rozložením mezi plnými a polovičními záběry.

Pro zlepšení kvality syntézy obličeje byl Nersemble začleněn do procesu přípravy dat.

Příklady z Nersemble datasetu, použitých pro augmentaci dat pro DreamActor. Zdroj: https://www.youtube.com/watch?v=a-OAWqBzldU

Příklady z Nersemble datasetu, použitých pro augmentaci dat pro DreamActor. Zdroj: https://www.youtube.com/watch?v=a-OAWqBzldU

Pro hodnocení byl použit dataset také jako benchmark pro posouzení generalizace napříč různými scénáři.

Modelova výkonnost byla měřena pomocí standardních metrik z předchozích prací: Fréchet Inception Distance (FID); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); a Peak Signal-to-Noise Ratio (PSNR) pro kvalitu snímku. Fréchet Video Distance (FVD) byla použita pro hodnocení temporální koherence a celkové věrnosti videa.

Autoři provedli experimenty na úkolech animace těla a portrétu, všechny používaly jediný (cílový) referenční obrázek.

Pro animaci těla byl DreamActor-M1 porovnán s Animate Anyone; Champ; MimicMotion, a DisPose.

Kvantitativní srovnání s konkurenčními rámci.

Kvantitativní srovnání s konkurenčními rámci.

Přestože PDF poskytuje statický obraz jako vizuální srovnání, jeden z videí z projektové stránky může lépe ukázat rozdíly:

AUDIO CONTENT. Klikněte pro přehrávání. Vizuální srovnání napříč konkurenčními rámci. Poháněcí video je vidět vlevo nahoře, a závěr autorů, že DreamActor produkuje nejlepší výsledky, se zdá rozumný.

Pro testy portrétové animace byl model hodnocen proti LivePortrait; X-Portrait; SkyReels-A1; a Act-One.

Kvantitativní srovnání pro portrétovou animaci.

Kvantitativní srovnání pro portrétovou animaci.

Autoři uvádějí, že jejich metoda vyhrává v kvantitativních testech, a tvrdí, že je také kvalitativně lepší.

AUDIO CONTENT. Klikněte pro přehrávání. Příklady srovnání portrétové animace.

Argumentovatelně třetí a poslední z klipů zobrazených ve videu výše vykazuje méně přesvědčivou synchronizaci rtů ve srovnání s některými konkurenčními rámci, i když obecná kvalita je pozoruhodně vysoká.

Závěr

Předpokládající potřebu textur, které jsou naznačeny, ale nejsou skutečně přítomny v jediném cílovém obrázku, který pohání tyto rekreace, Bytedance vyřešil jednu z největších výzev, kterým čelí difúzní generace videa – konzistentní, trvalé textury. Další logický krok po dokonalém tomto přístupu by byl vytvořit referenční atlas z počátečně vygenerovaného klipu, který by se mohl použít pro následné, odlišné generace, aby se zachovala konzistence vzhledu bez LoRAs.

Přestože by takový přístup byl efektivní, stále by se jednalo o externí referenci, což není jiné než texturování v tradičních CGI technikách, a kvalita realismu a věrnosti je mnohem vyšší než u starších metod.

Rovněž nejpozoruhodnější aspekt DreamActoru je kombinovaný tříčástný systém vedení, který mostí tradiční propast mezi zaměřením na obličej a tělesnou syntézou lidské postavy inteligentním způsobem.

Jedná se o to, zda některé z těchto principů mohou být využity v přístupnějších nabídkách; jak stojí, DreamActor se zdá být určen k tomu, aby se stal dalším syntézou-jako-službou nabídkou, váženě omezenou omezeními na použití a nepraktičností experimentování rozsáhle s komerční architekturou.

 

* Moje substituce hyperlinky pro autory; inline citace

Jako bylo zmíněno dříve, není jasné, jaký flavor Stable Diffusion byl použit v tomto projektu.

Poprvé publikováno v pátek, 4. dubna 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai