Andersonův úhel
GAN jako renderovací nástroj pro “tradiční” CGI

Názor Když Generative Adversarial Networks (GANs) poprvé prokázaly svou schopnost reprodukovat ohromující realistické 3D obličeje, toto odhalení spustilo zlatou horečku pro nevyužitý potenciál GANs pro vytváření časově konzistentních videí s lidskými obličeji.
Někde v latentním prostoru GANu se zdálo, že musí být skrytý pořádek a racionální logika – schema nascentní sémantické logiky, pohřbené v latentních kódech, které by umožnily GANu generovat konzistentní multiple views a multiple interpretace (jako změny výrazu) stejného obličeje – a následně nabízet časově přesvědčivou metodu deepfake videa, která by vyhodila autoencoders z vody.
Vysoká rozlišení výstupu by byla triviální ve srovnání s nízkým rozlišením prostředí, ve kterém GPU omezení nutí DeepFaceLab a FaceSwap operovat, zatímco “swap zóna” obličeje (v pracovních postupech autoencoderu) by se stala “zónou tvorby” GANu, informovanou několika vstupními obrázky, nebo dokonce pouze jedním obrázkem.
Nebyla by již žádná nesrovnalost mezi “swap” a “host” obličeji, protože celý obraz by byl generován od začátku, včetně vlasů, čelistí a vnějších extremity obličejových lineamentů, které často prokazují výzvu pro “tradiční” autoencoder deepfakes.
Zimní období GAN obličeje
Jak se ukázalo, nebude to tak jednoduché. Nakonec disentanglement se ukázal jako centrální problém a zůstává primární výzvou. Jak můžete zachovat odlišnou identitu obličeje a změnit jeho polohu nebo výraz bez shromažďování tisíců referenčních obrázků, které učí neuronovou síť, co se stane, když jsou tyto změny provedeny, způsobem, jakým to dělají systémy autoencoderu?
Následující myšlení v oblasti GAN obličeje a syntézy výzkumu bylo, že vstupní identita mohla být podrobena teleologické, generické, šablonové transformacím, které nejsou specifické pro identitu. Příkladem toho by bylo aplikovat výraz na GAN obličeje, který nebyl přítomen v žádném z obrázků této osoby, které GAN zná.

Z 2022 paperu Tensor-based Emotion Editing in the StyleGAN Latent Space, šablonové výrazy jsou aplikovány na vstupní obličej z FFHQ datové sady. Source: https://arxiv.org/pdf/2205.06102.pdf
Je zřejmé, že “jedna velikost se hodí všem” přístup nemůže pokrýt rozmanitost obličejových výrazů, které jsou jedinečné pro každou osobu. Musíme se divit, zda úsměv, tak jedinečný jako ten Jacka Nicholsona nebo Willem Dafoea, by mohl někdy dostat věrnou interpretaci pod vlivem takových “průměrných” latentních kódů.
Kapacita “morphing” InterFaceGAN a podobných rámců je hlavně způsobem, jak ilustrovat cestu k transformaci jako obraz je reprojektován zpět přes vhodný latentní kód (jako “věk”). Z hlediska produkce videa s časovou kontinuitou se tyto schéma doposud kvalifikují jako “impresivní katastrofy”.
Pokud přidáte k tomu obtížnost vytváření časově konzistentních vlasů, a fakt, že technika latentního kódu探索/manipulace nemá žádnou vrozenou časovou směrnici (a je obtížné vědět, jak vložit takové směrnice do rámce navrženého pro akomodaci a generování statických obrázků, a který nemá žádné rodinné ustanovení pro výstup videa), mohlo by být logické dospět k závěru, že GAN není All You Need ™ pro syntézu obličeje videa.
Parametrické vedení
Výzkum GAN obličeje syntézy se stále více zaměřuje na použití “tradičních” parametrických CGI obličejů jako metody pro vedení a přinášení pořádku do působivých, ale neukázněných latentních kódů v latentním prostoru GANu.
Parametrické obličejové prvky byly po více než dvacet let základem počítačového vidění, ale zájem o tento přístup vzrostl v poslední době, s rostoucím použitím Skinned Multi-Person Linear Model (SMPL) CGI prvků, přístupu, který byl průkopnický Max Planck Institute a ILM, a od té doby vylepšen frameworkem Sparse Trained Articulated Human Body Regressor (STAR).

SMPL (v tomto případě varianta nazvaná SMPL-X) může vynutit CGI parametrickou síť, která souhlasí s odhadnutou polohou (včetně výrazů, pokud je to nutné) celého lidského těla zobrazeného na obrázku, umožňující nové operace na obrázku pomocí parametrické sítě jako objemové nebo percepční směrnice. Source: https://arxiv.org/pdf/1904.05866.pdf
Nejvíce oceňovaný vývoj v této linii byl Disneyho iniciativa z roku 2019 Rendering with Style, která spojila použití tradičních texturových map s GAN-generovanými obrázky, v pokusu o vytvoření vylepšeného, “deepfake-style” animovaného výstupu.
Má GAN místo v syntéze obličeje videa?
Dosažení dynamických výrazů a pozic mimo distribuci z jediného zdrojového obrázku se zdá být alchymistickým posedlostí v současné době GAN obličeje syntézy výzkumu, především protože GANy jsou jediným způsobem, který může目前 výstupovat poměrně vysoké rozlišení a relativně vysoké kvality neuronových obličejů: zatímco autoencoder deepfake rámce mohou trénovat na mnoha reálných pozicích a výrazech, musí operovat na VRAM-restricted vstupních/výstupních rozlišeních, a vyžadují “host”; zatímco NeRF je podobně omezen, a – na rozdíl od ostatních dvou přístupů –目前 nemá žádné zavedené metodologie pro změnu obličejových výrazů, a trpí omezenou editabilitou obecně.
Zdá se, že jediným způsobem vpřed pro přesný CGI/GAN obličej syntézy systém je, aby nová iniciativa našla způsob, jak sestavit multi-foto identitu entity v latentním prostoru, kde latentní kód pro identitu osoby nemusí cestovat celou cestu přes latentní prostor, aby využil nesouvisející parametry polohy, ale může odkazovat na své vlastní související (reálné) obrázky jako reference pro transformace.












