Andersonův úhel

Nová Systém pro Temporálně Konsistentní Stabilní Difúzní Video Postavy

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
A capture from the project page of MIMO (https://menyifang.github.io/projects/MIMO/index.html), depicting a motion-driven wolf creature.

Nová iniciativa ze skupiny Alibaba nabízí jednu z nejlepších metod, které jsem viděl, pro generování plnofigurových lidských avatarů z modelu založeného na Stable Diffusion.

Jmenuje se MIMO (MIMicking s Object Interactions), a systém využívá řadu populárních technologií a modulů, včetně CGI-based lidských modelů a AnimateDiff, aby umožnil temporálně konsistentní nahrazování postav ve videích – nebo naopak ovládat postavu pomocí uživatelem definované skeletální pózy.

Zde vidíme postavy interpolované z jediného zdrojového obrázku a ovládané předem definovaným pohybem:

[Klikněte na video níže pro přehrávání]

Z jediného zdrojového obrázku jsou tři rozdílné postavy ovládané 3D pózem (vlevo) pomocí systému MIMO. Viz projektová webová stránka a doprovodné video na YouTube (vložené na konci tohoto článku) pro více příkladů a lepší rozlišení. Zdroj: https://menyifang.github.io/projects/MIMO/index.html

Generované postavy, které lze také získat z rámců ve videích a různými jinými způsoby, lze integrovat do reálných záběrů.

MIMO nabízí novou soustavu, která generuje tři samostatné kódování, každé pro postavu, scénu a překrytí (tj. matování, když nějaký objekt nebo osoba projde před postavou, která je zobrazena). Tato kódování jsou integrována v době inference.

[Klikněte na video níže pro přehrávání]

MIMO může nahradit původní postavy fotorealistickými nebo stylizovanými postavami, které následují pohyb z cílového videa. Viz projektová webová stránka a doprovodné video na YouTube (vložené na konci tohoto článku) pro více příkladů a lepší rozlišení.

Systém je trénován nad modelem Stable Diffusion V1.5, pomocí vlastního datasetu vytvořeného výzkumníky, a skládá se stejně z reálných a simulačních videí.

Velkým problémem difúzních videí je temporální stabilita, kde obsah videa buď bliká nebo “vyvíjí” se způsoby, které nejsou požadovány pro konsistentní reprezentaci postav.

MIMO místo toho účinně využívá jediný obrázek jako mapu pro konsistentní vedení, který lze orchestrovat a omezit mezilehlým SMPL CGI modelem.

Pokud je zdrojový odkaz konsistentní a základní model, nad kterým je systém trénován, je vylepšen dostatečnými reprezentativními pohybovými příklady, systémové schopnosti pro temporálně konsistentní výstup jsou výrazně nad obecným standardem pro difúzní avatary.

[Klikněte na video níže pro přehrávání]

Další příklady postav ovládaných pózem MIMO. Viz projektová webová stránka a doprovodné video na YouTube (vložené na konci tohoto článku) pro více příkladů a lepší rozlišení.

Stává se stále častějším, že se používají jediné obrázky jako zdroj pro efektivní neuronové reprezentace, buď samy o sobě, nebo multimodálně, v kombinaci s textovými podněty. Například populární LivePortrait systém pro přenos tváří může také generovat vysoce věrohodné hluboce padělané tváře z jediného obrázku obličeje.

Výzkumníci se domnívají, že principy použité v systému MIMO lze rozšířit do dalších a nových typů generativních systémů a rámců.

Nová práce je nazvána MIMO: Kontrolní syntéza postav ve videu se prostorově rozloženým modelem a pochází od čtyř výzkumníků z Alibaba Group’s Institute for Intelligent Computing. Práce má video-naplněnou projektovou stránku a doprovodné video na YouTube, které je také vložené na konci tohoto článku.

Metoda

MIMO dosahuje automatického a nesupervizovaného oddělení výše uvedených tří prostorových složek, v architektuře koncepčně integrované (tj. všechny sub-procesy jsou integrovány do systému, a uživatel potřebuje pouze poskytnout vstupní materiál).

Konceptuální schéma pro MIMO. Zdroj: https://arxiv.org/pdf/2409.16160

Konceptuální schéma pro MIMO. Zdroj: https://arxiv.org/pdf/2409.16160

Objekty ve zdrojových videích jsou přeloženy z 2D do 3D, inicializací pomocí monokulárního hloubkového odhadce Depth Anything. Lidská složka v každém rámci je extrahována metodami adaptovanými z Tune-A-Video projektu.

Tyto funkce jsou poté přeloženy do video-založených objemových facet pomocí architektury Segment Anything 2 od Facebook Research.

Scénická vrstva je získána odstraněním objektů detekovaných v ostatních dvou vrstvách, což poskytuje efektivní rotoskopový mask automaticky.

Pro pohyb je sada extrahovaných latentních kódů pro lidskou složku ukotvena k výchozímu lidskému CGI-založenému SMPL modelu, jehož pohyby poskytují kontext pro renderovanou lidskou obsah.

2D funkční mapa pro lidskou obsah je získána pomocí diferenciabilního rasterizéru odvozeného z 2020 iniciativy od NVIDIA. Kombinací získaných 3D dat ze SMPL s 2D daty získanými metodou NVIDIA, latentní kódy reprezentující “neuronového člověka” mají pevnou korespondenci se svým výsledným kontextem.

V tomto okamžiku je nezbytné stanovit referenci obecně potřebnou v architekturách, které používají SMPL – kanonickou pózu. To je široce podobné Da Vinciho ‘Vitruvianovi muži’, v tom, že reprezentuje nulovou pózu šablonu, která může přijmout obsah a poté být deformována, přičemž efektivní texturovaný obsah s ní.

Tyto deformace, nebo “odchylky od normy”, reprezentují lidský pohyb, zatímco SMPL model zachovává latentní kódy, které tvoří lidskou identitu, která byla extrahována, a tak reprezentuje výslednou avatar správně z hlediska pózy a textury.

Příklad kanonické pózy v SMPL figuře. Zdroj: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

Příklad kanonické pózy v SMPL figuře. Zdroj: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

Pokud jde o problém spojení (míru, do které lze trénovací data použít, aby se stala inflexibilní, když je táhnou za hranice jejich tréninkových konfinů a asociací), autoři uvádějí*:

‘Pro plné rozpojení vzhledu od pózovaných videofrámů je ideálním řešením naučit se dynamickou lidskou reprezentaci z monokulárního videa a transformovat ji z pózovaného prostoru do kanonického prostoru.

‘S ohledem na efektivitu používáme zjednodušenou metodu, která přímo transformuje pózovanou lidskou obraz do kanonického výsledku ve standardní A-póze pomocí předtrénovaného lidského repozního modelu. Syntetizovaná kanonická vzhledová obraz je krmena do ID kódovačů pro získání identifikačního [kódu].

‘Tento jednoduchý design umožňuje plné rozpojení identifikačních a pohybových atributů. Následující [Animate Anyone], ID kódovače zahrnují CLIP obrazový kódovač a referenční síťovou architekturu pro vložení globálních a místních funkcí, [resp.].’

Pro scénické a překrývací aspekty je sdílen a pevný Variational Autoencoder (VAE – v tomto případě odvozený z 2013 publikace) použit pro vložení scénických a překrývacích prvků do latentního prostoru. Nesrovnalosti jsou zpracovány metodou inpaintingu z 2023 ProPainter projektu.

Jakmile jsou tyto rozložené atributy sestaveny a retušovány, poskytne pozadí a jakékoli překrývací objekty ve videu matrici pro pohyblivou lidskou avatar.

Tyto rozložené atributy jsou poté krmeny do U-Net architektury založené na architektuře Stable Diffusion V1.5. Úplný scénický kód je spojen s nativním latentním šumem hostitelského systému. Lidská složka je integrována pomocí sebe-pozornosti a křížové pozornosti vrstev, resp.

Poté je odšuměný výsledek výstupem přes VAE dekodér.

Data a Testy

Pro trénování vytvořili výzkumníci lidský video dataset nazvaný HUD-7K, který se skládal z 5 000 reálných charakterových videí a 2 000 syntetických animací vytvořených systémem En3D. Reálná videa nevyžadovala žádnou anotaci, díky ne-semantické povaze figuračních procedur v architektuře MIMO. Syntetická data byla plně anotována.

Model byl trénován na osmi NVIDIA A100 GPU (i když práce nespecifikuje, zda se jednalo o modely s 40GB nebo 80GB VRAM), po dobu 50 iterací, pomocí 24 video rámců a velikosti dávky čtyř, až do konvergence.

Pohybový modul systému byl trénován na váhu AnimateDiff. Během trénovacího procesu byly váhy VAE kódovače/dekódéra a CLIP obrazového kódovače zmrazeny (na rozdíl od plného jemného ladění, které by mělo mnohem širší účinek na základní model).

I když MIMO nebyl testován proti analogickým systémům, výzkumníci ho otestovali na obtížných out-of-distribution pohybových sekvencích z AMASS a Mixamo. Tyto pohyby zahrnovaly lezení, hraní a tanec.

Také ho otestovali na lidských videích z divoké přírody. V obou případech práce uvádí “vysokou odolnost” pro tyto neviditelné 3D pohyby z různých úhlů.

I když práce nabízí několik statických obrazových výsledků, které demonstrují účinnost systému, skutečný výkon MIMO je nejlépe hodnocen s rozsáhlými video výsledky poskytnutými na projektové stránce a v YouTube videu vloženém níže (z něhož byla videa na začátku tohoto článku odvozena).

Autoři uzavírají:

‘Experimentální výsledky [demonstrují], že naše metoda umožňuje nejen flexibilní charakter, pohyb a scénický kontrol, ale také pokročilou škálovatelnost na libovolné postavy, obecnost na nové 3D pohyby a aplikovatelnost na interaktivní scény.

‘Věříme také, že naše řešení, které zvažuje inherentní 3D povahu a automaticky kóduje 2D video do hierarchických prostorových složek, mohlo by inspirovat budoucí výzkumy pro 3D-aware video syntézu.

‘Kromě toho je náš rámec nejen vhodný pro generování charakterových videí, ale může být potenciálně adaptován na další kontrolovatelné video syntetické úkoly.’

Závěr

Je osvěžující vidět avatarový systém založený na Stable Diffusion, který se zdá být schopen takové temporální stability – nejméně proto, že Gaussian Avatars zdají se, že získávají horní pozici v tomto konkrétním výzkumném sektoru.

Stylizované avatary reprezentované ve výsledcích jsou efektivní, a zatímco úroveň fotorealističnosti, kterou MIMO může produkovat, není目前 rovna tomu, co je schopno Gaussian Splatting, různé výhody vytváření temporálně konsistentních lidí v semanticky založeném Latentním Difúzním Síti (LDM) jsou značné.

 

* Moje konverze autorů inline citací na hypertextové odkazy a kde je nutné, externí vysvětlující hypertextové odkazy.

Poprvé publikováno ve středu, 25. září 2024

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai