Modely a platformy AI
AniPortrait: Audiové poháněná syntéza fotorealistických portrétních animací
V průběhu let, vytváření realistických a výrazných portrétních animací ze statických obrazů a audia nalezlo řadu aplikací, včetně her, digitálních médií, virtuální reality a mnoha dalších. Navzdory svému potenciálnímu použití, je pro vývojáře stále obtížné vytvořit rámce, které jsou schopné generovat vysoké kvality animací, které zachovávají časovou konzistenci a jsou vizuálně přesvědčivé. Hlavní příčinou této složitosti je potřeba intrikované koordinace pohybů rtů, poloh hlavy a obličejových výrazů, aby se vytvořil vizuálně přesvědčivý efekt.
V tomto článku, budeme mluvit o AniPortrait, novém rámci, který je navržen pro generování vysokých kvalit animací poháněných referenčním portrétním obrazem a audio vzorkem. Práce AniPortrait rámce je rozdělena do dvou fází. První fáze, AniPortrait rámec extrahuje mezilehlé 3D reprezentace z audio vzorků a projekty je do sekvence 2D obličejových označení. Následující fáze, AniPortrait rámec využívá robustní difuzní model spojený s pohybovým modulem, aby převést označení sekvence do časově konzistentních a fotorealistických animací. Experimentální výsledky demonstrují superioritu a schopnost AniPortrait rámce generovat vysoké kvality animací s výjimečnou vizuální kvalitou, rozmanitostí póz a obličejové přirozenosti, a tím nabízí vylepšenou a obohacenou percepční zkušenost. Kromě toho, AniPortrait rámec má pozoruhodný potenciál v oblasti ovladatelnosti a flexibility, a může být aplikován účinně v oblastech, včetně obličejové reenaktace, obličejové pohybové editace a dalších. Tento článek má za cíl pokrýt AniPortrait rámec v hloubce, a prozkoumáme mechanismus, metodologii, architekturu rámce a jeho srovnání se stávajícími rámci. Takže, pojďme začít.
AniPortrait: Fotorealistické portrétní animace
Vytváření realistických a výrazných portrétních animací bylo zaměřením výzkumu po nějakou dobu, díky jeho úžasnému potenciálu a aplikacím, sahajícím od digitálních médií a virtuální reality až po hry a další. Navzdory letům výzkumu a vývoje, produkce vysokých kvalit animací, které zachovávají časovou konzistenci a jsou vizuálně přesvědčivé, stále představuje významnou výzvu. Hlavní překážkou pro vývojáře je potřeba intrikované koordinace mezi polohami hlavy, vizuálními výrazy a pohyby rtů, aby se vytvořil vizuálně přesvědčivý efekt. Stávající metody se nezdařily v překonání těchto výzev, především proto, že většina z nich spoléhá na omezené kapacity generátorů, jako je NeRF, pohybové dekodéry a GAN pro vytváření vizuálního obsahu. Tyto sítě vykazují omezené generalizační schopnosti a jsou nestabilní při generování vysokých kvalit obsahu. Nicméně, nedávný vznik difuzních modelů umožnil generování vysokých kvalit obrazů, a některé rámce postavené na difuzních modelech spolu s temporálními moduly umožnily vytváření přesvědčivých videí, umožňujících difuzním modelům vyniknout.
Vycházející z pokroků difuzních modelů, AniPortrait rámec má za cíl generovat vysoké kvality animovaných portrétů pomocí referenčního obrazu a audio vzorku. Práce AniPortrait rámce je rozdělena do dvou fází. V první fázi, AniPortrait rámec využívá transformátorové modely k extrahování sekvence 3D obličejové mřížky a polohy hlavy z audio vstupu, a projekty je následně do sekvence 2D obličejových označení. První fáze umožňuje AniPortrait rámcům zachytit pohyby rtů a jemné výrazy z audio, kromě pohybů hlavy, které synchronizují s rytmem audio vzorku. Druhá fáze, AniPortrait rámec využívá robustní difuzní model a integruje jej s pohybovým modulem, aby převést označení sekvence do fotorealistických a časově konzistentních animací. Konkrétněji, AniPortrait rámec využívá síťovou architekturu z existujícího AnimateAnyone modelu, který využívá Stable Diffusion 1.5, silný difuzní model, aby generoval realistické a tekuté animace na základě referenčního obrazu a sekvence pohybu těla. Co je důležité, AniPortrait rámec nevyužívá modul pose guider uvnitř této sítě, jako je implementován v AnimateAnyone rámci, ale přepracovává jej, což umožňuje AniPortrait rámcům nejen zachovat lehkou konstrukci, ale také vykazovat vylepšenou přesnost při generování pohybů rtů.
Experimentální výsledky demonstrují superioritu AniPortrait rámce při generování animací s výjimečnou obličejovou přirozeností, vynikající vizuální kvalitou a rozmanitostí póz. Díky využití 3D obličejových reprezentací jako mezilehlých funkcí, AniPortrait rámec získá flexibilitu pro úpravu těchto reprezentací podle svých požadavků. Tato adaptabilita významně zvyšuje aplikovatelnost AniPortrait rámce v různých oblastech, včetně obličejové reenaktace a obličejové pohybové editace.
AniPortrait: Práce a Metodologie
Navržený AniPortrait rámec se skládá ze dvou modulů, jmenovitě Lmk2Video a Audio2Lmk. Modul Audio2Lmk se snaží extrahovat sekvenci označení, která zachytí jemné pohyby rtů a obličejové výrazy z audio vstupu, zatímco modul Lmk2Video využívá tuto sekvenci označení k generování vysokých kvalit portrétních videí s časovou stabilitou. Následující obrázek představuje přehled práce AniPortrait rámce. Jak je vidět, AniPortrait rámec nejprve extrahuje 3D obličejovou mřížku a polohu hlavy z audio a projekty je následně do 2D klíčových bodů. Ve druhé fázi, rámec využívá difuzní model k převodu 2D klíčových bodů do portrétního videa, přičemž dvě fáze jsou trénovány současně uvnitř sítě.

Audio2Lmk
Pro danou sekvenci řečových vzorků, primárním cílem AniPortrait rámce je předpovědět odpovídající 3D obličejovou mřížkovou sekvenci s vektorovými reprezentacemi translace a rotace. AniPortrait rámec využívá předtrénovaný wav2vec metodu k extrahování audio funkcí, a model vykazuje vysokou míru generalizace a je schopen rozpoznat intonaci a výslovnost z audio přesně, což hraje klíčovou roli při generování realistických obličejových animací. Díky získaným robustním audio funkcím, AniPortrait rámec je schopen efektivně využít jednoduchou architekturu skládající se ze dvou fc vrstev k převodu těchto funkcí do 3D obličejových mřížek. AniPortrait rámec pozoruje, že tato jednoduchá konstrukce implementovaná modelem nejen zvyšuje efektivitu inferenčního procesu, ale také zajišťuje přesnost. Při převodu audio na polohu, AniPortrait rámec využívá stejnou wav2vec síť jako základní architekturu, ačkoli model nesdílí váhy s audio na mřížkový modul. Je to主要ně kvůli tomu, že poloha je spojena více s tónem a rytmem přítomným v audio, který má odlišný důraz ve srovnání s audio na mřížkovou úlohou. K zohlednění vlivu předchozích stavů, AniPortrait rámec využívá transformátorový dekodér k dekódování sekvence polohy. Během tohoto procesu, rámec integruje audio funkce do dekodéru pomocí cross-attention mechanismů, a pro oba moduly, rámec trénuje je pomocí L1 ztráty. Jakmile model získá sekvenci polohy a mřížky, využívá perspektivní projekci k převodu těchto sekvencí do 2D sekvence obličejových označení, která jsou následně využita jako vstupní signály pro následující fázi.
Lmk2Video
Pro daný referenční portrétní obraz a sekvenci obličejových označení, navržený Lmk2Video modul vytváří časově konzistentní portrétní animaci, která alignuje pohyb s označení sekvencí a zachovává vzhled, který je v souladu s referenčním obrazem, a nakonec, rámec reprezentuje portrétní animaci jako sekvenci portrétních snímků. Design Lmk2Video sítě hledá inspiraci v existujícím AnimateAnyone rámci. AniPortrait rámec využívá Stable Diffusion 1.5, extrémně silný difuzní model, jako svou základní architekturu, a integruje temporální pohybový modul, který efektivně převádí multi-frame noise vstupy do sekvence video snímků. Současně, ReferencenNet síťový komponent zrcadlí strukturu Stable Diffusion 1.5 a využívá ji k extrahování vzhledu informací z referenčního obrazu a integruje je do základní architektury. Strategický design zajišťuje, že obličejová identita zůstává konzistentní po celou dobu výstupního videa. Na rozdíl od AnimateAnyone rámce, AniPortrait rámec vylepšuje složitost designu PoseGuider. Originální verze AnimateAnyone rámce se skládá pouze z několika konvolučních vrstev, po kterých se označení funkce spojují s latenty na vstupní vrstvě základní architektury. AniPortrait rámec zjistil, že tento design nestačí k zachycení jemných pohybů rtů, a aby tento problém vyřešil, rámec využívá multi-škálovou strategii ConvNet architektury a integruje označení funkcí odpovídajících škál do různých bloků základní architektury. Kromě toho, AniPortrait rámec představuje další vylepšení, včetně označení referenčního obrazu jako dalšího vstupu. Cross-attention modul PoseGuider komponentu umožňuje interakci mezi cílovými označeními každého snímku a referenčními označeními. Tento proces poskytuje síti další signály k pochopení korelace mezi vzhledem a obličejovými označeními, a tím pomáhá při generování portrétních animací s přesnějším pohybem.
AniPortrait: Implementace a Výsledek
Pro fázi Audio2Lmk, AniPortrait rámec využívá wav2vec2.0 komponent jako svou základní architekturu a využívá MediaPipe architekturu k extrahování 3D mřížek a 6D poloh pro anotace. Model čerpá trénovací data pro Audio2Mesh komponent ze svého interního datasetu, který se skládá z téměř 60 minut vysokokvalitních řečových dat z jednoho mluvčího. K zajištění stability 3D mřížky extrahované MediaPipe komponentou, hlasový herec je instruován, aby čelil kameře a udržoval stálou polohu hlavy po celou dobu záznamového procesu. Pro Lmk2Video modul, AniPortrait rámec implementuje dvoufázový trénovací přístup. V první fázi, rámec se zaměřuje na trénování ReferenceNet a PoseGuider, 2D komponent základní architektury, a ponechává pohybový modul. Ve druhé fázi, AniPortrait rámec zmrazí všechny ostatní komponenty a soustředí se na trénování pohybového modulu. Pro tuto fázi, rámec využívá dvě velké, vysokokvalitní datasety obličejových videí k trénování modelu a zpracovává všechna data pomocí MediaPipe komponenty k extrahování 2D obličejových označení. Kromě toho, aby zvýšil citlivost sítě vůči pohybům rtů, AniPortrait model rozlišuje horní a dolní rty odlišnými barvami při renderování pozice obrazu z 2D označení.
Jak je ukázáno na následujícím obrázku, AniPortrait rámec generuje řadu animací, které demonstrují vyšší kvalitu i realističnost.

Rámec poté využívá mezilehlou 3D reprezentaci, která může být upravena pro manipulaci výstupu podle požadavků. Například, uživatelé mohou extrahovat označení z určitého zdroje a upravit jeho ID, což umožňuje AniPortrait rámcům vytvořit efekt obličejové reenaktace.
Závěrečné myšlenky
V tomto článku, jsme mluvili o AniPortrait, novém rámci, který je navržen pro generování vysokých kvalit animací poháněných referenčním portrétním obrazem a audio vzorkem. Pouze vstupem referenčního obrazu a audio klipu, AniPortrait rámec je schopen generovat portrétní video, které nabízí přirozený pohyb hlavy a hladký pohyb rtů. Díky využití robustních generalizačních schopností difuzního modelu, AniPortrait rámec generuje animace, které vykazují výjimečnou realistickou kvalitu obrazu a realistický pohyb. Práce AniPortrait rámce je rozdělena do dvou fází. První fáze, AniPortrait rámec extrahuje mezilehlé 3D reprezentace z audio vzorků a projekty je do sekvence 2D obličejových označení. Následující fáze, AniPortrait rámec využívá robustní difuzní model spojený s pohybovým modulem, aby převést označení sekvence do časově konzistentních a fotorealistických animací. Experimentální výsledky demonstrují superioritu a schopnost AniPortrait rámce generovat vysoké kvality animací s výjimečnou vizuální kvalitou, rozmanitostí póz a obličejové přirozeností, a tím nabízí vylepšenou a obohacenou percepční zkušenost. Kromě toho, AniPortrait rámec má pozoruhodný potenciál v oblasti ovladatelnosti a flexibility, a může být aplikován účinně v oblastech, včetně obličejové reenaktace, obličejové pohybové editace a dalších.












