Modely a platformy AI

MagicDance: Realistická generace lidského tance

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Počítačové vidění je jedním z nejdiskutovanějších oborů v průmyslu umělé inteligence, a to díky jeho potenciálním aplikacím v širokém spektru reálných úkolů. V posledních letech se počítačové vidění rapidně rozvíjí, a moderní modely jsou nyní schopny analyzovat rysy obličeje, objekty a mnoho dalšího v reálném čase. Navzdory těmto schopnostem zůstává přenos lidského pohybu velkou výzvou pro modely počítačového vidění. Tento úkol zahrnuje přenos rysů obličeje a pohybu těla ze zdrojového obrázku nebo videa na cílový obrázek nebo video. Přenos lidského pohybu je široce používán v modelech počítačového vidění pro styling obrázků nebo videí, editaci multimediálního obsahu, digitální syntézu lidského těla a dokonce i generování dat pro frameworky založené na vnímání.

V tomto článku se zaměříme na MagicDance, difuzní model navržený pro revoluci v přenosu lidského pohybu. Framework MagicDance se zaměřuje na přenos 2D lidských obličejových výrazů a pohybů na náročné taneční videa. Cílem je generovat nové sekvence pohybu pro konkrétní cílové identity, zatímco zachovává původní identitu. Framework MagicDance využívá dvoufázovou strategii školení, zaměřenou na rozlišení lidského pohybu a vzhledu, jako je tón pleti, obličejové výrazy a oblečení. Prozkoumáme framework MagicDance, jeho architekturu, funkčnost a výkon ve srovnání s jinými státními modely přenosu lidského pohybu. Pojďme se ponořit do toho.

MagicDance: Realistický přenos lidského pohybu

Jak bylo zmíněno dříve, přenos lidského pohybu je jedním z nejsložitějších úkolů počítačového vidění kvůli obrovské složitosti, která je zapojena do přenosu lidských pohybů a výrazů zdrojového obrázku nebo videa na cílový obrázek nebo video. Tradičně modely počítačového vidění dosáhly přenosu lidského pohybu školením generativního modelu, včetně GAN nebo Generative Adversarial Networks na cílových datech pro obličejové výrazy a pohyby těla. Ačkoli školení a použití generativních modelů poskytují uspokojivé výsledky v některých případech, obvykle trpí dvěma velkými omezeními.

  1. Silně závisí na komponentě zkreslení obrázku, v důsledku čehož často zápasí s interpolací částí těla, které jsou neviditelné ve zdrojovém obrázku, ať už kvůli změně perspektivy nebo samo-zakrytí.
  2. Nemohou se generalizovat na jiná obrázky z vnějších zdrojů, což omezuje jejich aplikace, zejména v reálných scénářích.

Moderní difuzní modely prokázaly výjimečné schopnosti generování obrázků napříč různými podmínkami, a difuzní modely jsou nyní schopny poskytovat silné vizuální výsledky v řadě úkolu, jako je generování videa a doplnění obrázků, tím, že se učí z webových škál obrázků. Díky svým schopnostem by difuzní modely mohly být ideální volbou pro úkoly přenosu lidského pohybu. Ačkoli difuzní modely lze implementovat pro přenos lidského pohybu, mají určitá omezení, ať už z hlediska kvality generovaného obsahu, nebo z hlediska uchování identity nebo trpí temporálními nekonzistencemi v důsledku omezení návrhu modelu a strategie školení. Kromě toho difuzní modely neprokázaly žádnou významnou výhodu oproti frameworkům GAN z hlediska generalizovatelnosti.

Pro překonání překážek, kterým čelí difuzní a GAN založené frameworky při úkolech přenosu lidského pohybu, byli vývojáři představeni MagicDance, novému frameworku, který se snaží využít potenciál difuzních frameworků pro přenos lidského pohybu, a prokázat bezprecedentní úroveň uchování identity, vyšší kvalitu obrazu a doménovou generalizovatelnost. V jeho jádru je základní koncept frameworku MagicDance rozdělit problém do dvou fází: kontrola vzhledu a kontrola pohybu, dvě schopnosti, které jsou vyžadovány od frameworků difuzního rozptylu pro poskytování přesných výsledků přenosu pohybu.

Výše uvedená figura poskytuje stručný přehled frameworku MagicDance, a jak je vidět, framework využívá Stable Diffusion model, a také nasazuje dvě další komponenty: Appearance Control Model a Pose ControlNet, kde první poskytuje vzhledové vedení modelu SD z referenčního obrázku prostřednictvím pozornosti, zatímco druhá poskytuje vedení výrazu/pohybu difuznímu modelu z podmiňovaného obrázku nebo videa. Framework také využívá více-fázové strategie školení pro efektivní učení těchto sub-modulů a rozlišení kontroly pohybu a vzhledu.

Stručně řečeno, framework MagicDance je

  1. Nový a efektivní framework, který se skládá z rozlišeného pohybu a vzhledu, a předškolního vzdělávání vzhledu.
  2. Framework MagicDance je schopen generovat realistické lidské obličejové výrazy a pohyby pod kontrolou vstupních podmínek a referenčních obrázků nebo videí.
  3. Framework MagicDance se snaží generovat obsah, který je konzistentní s vzhledem, a zavádí modul Multi-Source Attention, který poskytuje přesné vedení pro framework Stable Diffusion UNet.
  4. Framework MagicDance lze také použít jako praktické rozšíření nebo plugin pro framework Stable Diffusion, a zajišťuje kompatibilitu s existujícími modelovými váhami, protože nevyžaduje další jemné doladění parametrů.

Kromě toho framework MagicDance prokázal výjimečné generalizační schopnosti jak pro vzhled, tak pro pohyb.

  1. Generalizace vzhledu: Framework MagicDance prokázal vyšší schopnosti při generování různých vzhledů.
  2. Generalizace pohybu: Framework MagicDance také má schopnost generovat širokou škálu pohybů.

MagicDance: Cíle a architektura

Pro daný referenční obrázek, ať už reálného člověka nebo stylizovaného obrázku, je primárním cílem frameworku MagicDance generovat výstupní obrázek nebo video, které je podmíněno vstupními a vstupními podmínkami {P, F}, kde P reprezentuje lidský pohybový skelet a F reprezentuje obličejové landmaríky. Generovaný výstupní obrázek nebo video by mělo zachovat vzhled a identitu lidí zapojených do něj, spolu s obsahem pozadí přítomným v referenčním obrázku, zatímco zachovává polohu a výrazy definované vstupními podmínkami.

Architektura

Během školení je framework MagicDance školen jako úkol rekonstrukce rámců pro rekonstrukci ground truth s referenčním obrázkem a vstupními podmínkami zdrojovými z téhož referenčního videa. Během testování pro dosažení přenosu pohybu je vstupní podmínka a referenční obrázek zdrojový z různých zdrojů.

Celková architektura frameworku MagicDance lze rozdělit do čtyř kategorií: předběžná fáze, předškolní vzdělávání vzhledu, rozlišení pohybu a vzhledu a modul pohybu.

Přeběžná fáze

Latentní difuzní modely nebo LDM reprezentují jedinečně navržené difuzní modely, které fungují v latentním prostoru usnadněném pomocí autoencoderu, a framework Stable Diffusion je pozoruhodnou instancí LDM, která využívá Vector Quantized-Variational AutoEncoder a architekturu U-Net. Framework Stable Diffusion využívá CLIP-based transformér jako textový encoder pro zpracování textových vstupů, tím, že převádí textové vstupy na vložené hodnoty. Fáze školení frameworku Stable Diffusion vystavuje model textovému vstupu a vstupnímu obrázku, přičemž proces zahrnuje kódování obrázku do latentní reprezentace a podrobí jej předem definované sekvenci difuzních kroků, řízených Gaussovou metodou. Výsledná sekvence poskytuje šumivou latentní reprezentaci, která poskytuje standardní normální distribuci, přičemž primárním cílem frameworku Stable Diffusion je odstranění šumu z šumivé latentní reprezentace iterativně do latentní reprezentace.

Předškolní vzdělávání vzhledu

Velkým problémem původního frameworku ControlNet je jeho neschopnost kontrolovat vzhled mezi prostorově proměnnými pohyby konzistentně, ačkoli má tendenci generovat obrázky s polohami, které se podobají těm ve vstupním obrázku, přičemž celkový vzhled je ovlivněn převážně textovými vstupy. Ačkoli tato metoda funguje, není vhodná pro úkoly přenosu pohybu, které zahrnují úkoly, kde není textový vstup primárním zdrojem informací o vzhledu, ale referenční obrázek.

Modul předškolního vzdělávání vzhledu v frameworku MagicDance je navržen jako pomocný větev, který poskytuje vedení pro kontrolu vzhledu ve vrstvě-po-vrstvě přístupu. Místo spoléhání se na textové vstupy se celý modul zaměřuje na využití atributů vzhledu z referenčního obrázku s cílem zlepšit schopnost frameworku generovat atributy vzhledu přesně, zejména v scénářích zahrnujících složitou dynamiku pohybu. Kromě toho je pouze model Appearance Control Model školený během předškolního vzdělávání vzhledu.

Rozlišení pohybu a vzhledu

Naivní řešení pro kontrolu polohy ve výstupním obrázku spočívá v integraci předškolního modelu ControlNet s předškolním modelem Appearance Control přímo bez jemného doladění. Nicméně integrace může vést k tomu, že framework bude zápasit s nezávislou kontrolou polohy, což může vést k nesouladu mezi vstupními polohami a generovanými polohami. Pro překonání tohoto nesouladu framework MagicDance jemně doladí model Pose ControlNet společně s předškolním modelem Appearance Control.

Modul pohybu

Když pracují společně, model Appearance-disentangled Pose ControlNet a model Appearance Control mohou dosáhnout přesného a efektivního přenosu pohybu, ačkoli to může vést k temporální nekonzistenci. Pro zajištění temporální konzistence framework integruje další modul pohybu do primární architektury UNet.

MagicDance: Předškolní vzdělávání a datové sady

Pro předškolní vzdělávání framework MagicDance využívá datové sady TikTok, které se skládají z více než 350 tanečních videí různých délek mezi 10 až 15 sekundami, zachycujících jednu osobu, která tančí, přičemž většina těchto videí obsahuje obličej a horní část těla. Framework MagicDance extrahuje každé video individuálně na 30 FPS a spouští OpenPose na každém snímku individuálně, aby odvodil pohybový skelet, polohy rukou a obličejové landmaríky.

Pro předškolní vzdělávání je model Appearance Control předškoleno s velikostí batche 64 na 8 NVIDIA A100 GPU pro 10 tisíc kroků se velikostí obrázku 512 x 512, následované společným jemným doladěním modelů Pose Control a Appearance Control s velikostí batche 16 pro 20 tisíc kroků. Během školení framework MagicDance náhodně vybírá dvě snímky jako cíl a referenční, přičemž obrázky jsou ořezány na stejnou pozici a výšku. Během hodnocení model ořezává obrázek centrálně místo náhodného ořezávání.

MagicDance: Výsledky

Experimentální výsledky provedené na frameworku MagicDance jsou demonstrovány v následujícím obrázku, a jak je vidět, framework MagicDance překonává existující frameworky, jako je Disco a DreamPose, pro přenos lidského pohybu napříč všemi metrikami. Frameworky, které mají před svým názvem hvězdičku, používají cílový obrázek přímo jako vstup, a zahrnují více informací ve srovnání s ostatními frameworky.

Je zajímavé poznamenat, že framework MagicDance dosahuje skóre Face-Cos 0,426, což je zlepšení o 156,62 % oproti frameworku Disco, a téměř 400% nárůst ve srovnání s frameworkem DreamPose. Výsledky ukazují robustní kapacitu frameworku MagicDance pro uchování informací o identitě a viditelný nárůst výkonu naznačuje převahu frameworku MagicDance nad stávajícími státními metodami.

Následující obrázky porovnávají kvalitu generování lidského videa mezi frameworky MagicDance, Disco a TPS. Jak je vidět, výsledky generované frameworky GT, Disco a TPS trpí nekonzistentní identitou lidské polohy a obličejovými výrazy.

Kromě toho následující obrázek demonstruje vizualizaci přenosu obličejových výrazů a lidského pohybu na datové sadě TikTok, přičemž framework MagicDance je schopen generovat realistické a živé výrazy a pohyby pod různými obličejovými landmariky a vstupními podmínkami polohy, zatímco přesně zachovává informace o identitě z referenčního vstupního obrázku.

Je také důležité poznamenat, že framework MagicDance prokázal výjimečné generalizační schopnosti pro referenční obrázky mimo doménu se nezvěstným stylem a polohou, s působivou kontrolou vzhledu, dokonce i bez dalšího jemného doladění na cílové doméně, přičemž výsledky jsou demonstrovány v následujícím obrázku.

Následující obrázky demonstrují vizualizační schopnosti frameworku MagicDance z hlediska přenosu obličejových výrazů a nulového pohybu. Jak je vidět, framework MagicDance se generalizuje na pohyby v divočině dokonale.

MagicDance: Omezení

OpenPose je klíčovou komponentou frameworku MagicDance, protože hraje zásadní roli pro kontrolu polohy, ovlivňující kvalitu a temporální konzistenci generovaných obrázků významně. Nicméně framework MagicDance stále nachází obtížné přesně detekovat obličejové landmariky a pohybové skelety, zejména když jsou objekty na obrázcích částečně viditelné nebo vykazují rychlý pohyb. Tyto problémy mohou vést k artefaktům v generovaných obrázcích.

Závěr

V tomto článku jsme diskutovali o frameworku MagicDance, difuzním modelu, který se snaží revolucionalizovat přenos lidského pohybu. Framework MagicDance se snaží přenosit 2D lidské obličejové výrazy a pohyby na náročné taneční videa, přičemž jeho cílem je generovat nové sekvence pohybu pro konkrétní cílové identity, zatímco zachovává původní identitu. Framework MagicDance je dvoufázová strategie školení pro rozlišení lidského pohybu a vzhledu, jako je tón pleti, obličejové výrazy a oblečení.

MagicDance je novým přístupem pro facilitaci realistické generace lidského videa, který zahrnuje přenos obličejových výrazů a pohybu, a umožňuje konzistentní animaci v divočině bez potřeby dalšího jemného doladění, což prokazuje významný pokrok oproti stávajícím metodám. Kromě toho framework MagicDance prokázal výjimečné generalizační schopnosti pro složitou sekvenci pohybu a rozmanité lidské identity, čímž se framework MagicDance stává lídrem v oblasti asistované generace videa a pohybu.

Kunal Kejriwal je backendový inženýr specializující se na Python, PostgreSQL, Redis a cloudovou infrastrukturu na GCP a AWS. Má tři roky zkušeností s vývojem a škálováním produkčních systémů a píše o AI infrastruktuře, distribuovaných systémech a architektuře nasazování pracovních zátěží strojového učení.