Andersonův úhel

Překonání “špatných dnů vlasů” v syntéze lidského obrazu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Od zlatého věku římské sochařství je zobrazení lidských vlasů trnitým problémem. Průměrná lidská hlava obsahuje 100 000 vlasů, má různé lomné indexy podle barvy a za určitou délku se bude pohybovat a měnit způsobem, který lze simulovat pouze pomocí složitých fyzikálních modelů – dosud pouze použitelných prostřednictvím “tradičních” metod CGI.

Z výzkumu z roku 2017 společnosti Disney, fyzikální model se snaží aplikovat realistické pohyby na tekutý styl vlasů v pracovním postupu CGI. Zdroj: https://www.youtube.com/watch?v=-6iF3mufDW0

Z výzkumu z roku 2017 společnosti Disney, fyzikální model se snaží aplikovat realistické pohyby na tekutý styl vlasů v pracovním postupu CGI. Zdroj: https://www.youtube.com/watch?v=-6iF3mufDW0

Problém je špatně řešen moderními populárními metodami deepfakes. Po několik let má hlavní balíček DeepFaceLab “plný hlavový” model, který může pouze zachytit rigidní ztvárnění krátkých (obvykle mužských) vlasů; a nedávno DFL stablemate FaceSwap (oba balíčky jsou odvozeny z kontroverzního zdrojového kódu DeepFakes z roku 2017) nabídl implementaci BiseNet modelu semantické segmentace, který umožňuje uživateli zahrnout uši a vlasy do výstupu deepfakes.

I když se jedná o velmi krátké styly vlasů, výsledky tendují být velmi omezené kvality, s plnými hlavami, které vypadají jako nasazené na footage, spíše než integrované do něj.

GAN Vlasy

Dvě hlavní soutěžící přístupy k lidské simulaci jsou Neural Radiance Fields (NeRF), které mohou zachytit scénu z více úhlů a zahrnout 3D reprezentaci těchto úhlů do prozkoumatelné neuronové sítě; a Generative Adversarial Networks (GANs), které jsou pozoruhodně pokročilejší v oblasti syntézy lidského obrazu (nejen proto, že NeRF vznikl až v roce 2020).

NeRFův odvozený rozumění 3D geometrie mu umožňuje replikovat scénu s velkou věrností a konzistencí, i když目前 má málo nebo žádné možnosti pro uplatnění fyzikálních modelů – a ve skutečnosti relativně omezené možnosti pro jakýkoli druh transformace na shromážděných datech, který se netýká změny úhlu kamery. V současné době má NeRF velmi omezené schopnosti při replikaci pohybu lidských vlasů.

GAN-založené ekvivalenty NeRF začínají téměř fatální nevýhodou, protože na rozdíl od NeRF, latentní prostor GAN nevyžaduje přirozeně pochopení 3D informací. Proto se 3D-aware GAN obličejová syntéza stala horkým pronásledováním v oblasti generace obrazu v posledních letech, s InterFaceGAN z roku 2019 jedním z hlavních průlomů.

Však i výsledky InterFaceGAN demonstrují, že neuronová konzistence vlasů zůstává tvrdým problémem v oblasti temporální konzistence, pro potenciální VFX pracovní postupy:

Šílené vlasy v transformaci postoje z InterFaceGAN. Zdroj: https://www.youtube.com/watch?v=uoftpl3Bj6w

Šílené vlasy v transformaci postoje z InterFaceGAN. Zdroj: https://www.youtube.com/watch?v=uoftpl3Bj6w

Jak je stále více zřejmé, že konsistentní generace pohledu prostřednictvím manipulace s latentním prostorem samotným může být podobná alchymie, objevuje se stále více prací, které zahrnují CGI-založené 3D informace do pracovního postupu GAN jako stabilizující a normalizující omezení.

CGI prvek může být reprezentován mezilehlými 3D prvky, jako je Skinned Multi-Person Linear Model (SMPL), nebo přijetím 3D inferenčních technik způsobem podobným NeRF, kde je geometrie vyhodnocena ze zdrojových obrazů nebo videa.

Jedna nová práce v tomto směru, publikovaná tento týden, je Multi-View Consistent Generative Adversarial Networks for 3D-aware Image Synthesis (MVCGAN), spolupráce mezi ReLER, AAII, University of Technology Sydney, DAMO Academy at Alibaba Group a Zhejiang University.

Přiměřené a robustní nové obličejové postoje generované MVCGAN na obrazech odvozených z datové sady CELEBA-HQ. Zdroj: https://arxiv.org/pdf/2204.06307.pdf

Přiměřené a robustní nové obličejové postoje generované MVCGAN na obrazech odvozených z datové sady CELEBA-HQ. Zdroj: https://arxiv.org/pdf/2204.06307.pdf

MVCGAN zahrnuje generativní radiance field síť (GRAF) schopnou poskytovat geometrická omezení v Generative Adversarial Network, zřejmě dosahující některých z nejautentičtějších možností pozicování jakéhokoli podobného GAN-založeného přístupu.

Srovnání mezi MVCGAN a předchozími metodami GRAF, GIRAFFE a pi-GAN.

Srovnání mezi MVCGAN a předchozími metodami GRAF, GIRAFFE a pi-GAN.

Však i dodatečný materiál pro MVCGAN odhaluje, že získání konsistence objemu, dispozice, umístění a chování vlasů je problémem, který není snadno vyřešen prostřednictvím omezení založených na externě uložené 3D geometrii.

Z dodatečného materiálu, který nebyl veřejně uvolněn v době psaní, vidíme, že zatímco syntéza obličejových postojů z MVCGAN představuje pozoruhodný pokrok ve stavu současného umění, temporální konsistence vlasů zůstává problémem.

Z dodatečného materiálu, který nebyl veřejně uvolněn v době psaní, vidíme, že zatímco syntéza obličejových postojů z MVCGAN představuje pozoruhodný pokrok ve stavu současného umění, temporální konsistence vlasů zůstává problémem.

Jelikož “přímé” pracovní postupy CGI stále považují temporální rekonstrukci vlasů za takovou výzvu, není žádný důvod se domnívat, že konvenční geometrické přístupy této povahy přinesou konsistentní syntézu vlasů do latentního prostoru brzy.

Stabilizace vlasů pomocí Konvolučních Neuronových Sítí

Však jedna nadcházející práce od tří výzkumníků na Chalmers Institute of Technology ve Švédsku může nabídnout další pokrok v neuronové simulaci vlasů.

Vlevo, CNN-stabilizovaná reprezentace vlasů, vpravo, skutečnost. Viz video na konci článku pro lepší rozlišení a další příklady. Zdroj: https://www.youtube.com/watch?v=AvnJkwCmsT4

Vlevo, CNN-stabilizovaná reprezentace vlasů, vpravo, skutečnost. Zdroj: https://www.youtube.com/watch?v=AvnJkwCmsT4

Nazvaná Real-Time Hair Filtering with Convolutional Neural Networks, práce bude publikována pro i3D symposium na počátku května.

Systém se skládá z autoencoder-založené sítě schopné vyhodnotit rozlišení vlasů, včetně samo-stínování a zohlednění tloušťky vlasů, v reálném čase, na základě omezeného počtu stochastických vzorků inicializovaných pomocí OpenGL geometrie.

Přístup vykresluje omezený počet vzorků se stochastickou transparentností a poté trénuje U-net k rekonstrukci původního obrazu.

Pod MVCGAN, CNN filtruje stochasticky vzorkované barevné faktory, highlights, tangenty, hloubky a alfa, sestavující syntetizované výsledky do kompozitního obrazu.

Pod MVCGAN, CNN filtruje stochasticky vzorkované barevné faktory, highlights, tangenty, hloubky a alfa, sestavující syntetizované výsledky do kompozitního obrazu.

Síť je trénována na PyTorch, konvergující během období šesti až dvanácti hodin, v závislosti na objemu sítě a počtu vstupních funkcí. Trénované parametry (váhy) jsou poté použity v reálném čase implementace systému.

Trénovací data jsou generována vykreslením několika set obrazů pro rovné a vlnité styly vlasů, pomocí náhodných vzdáleností a postojů, stejně jako různých světelných podmínek.

Různé příklady vstupních dat.

Různé příklady vstupních dat.

Průhlednost vlasů napříč vzorky je průměrována z obrazů vykreslených se stochastickou transparentností na supersamplem rozlišení. Původní vysoká rozlišení data jsou downsamplena, aby se přizpůsobila omezením sítě a hardwaru, a poté upsamplena, v typickém autoencoder pracovním postupu.

Reálný časový inference aplikaci („živý“ software, který využívá algoritmus odvozený z trénovaného modelu) využívá kombinaci NVIDIA CUDA s cuDNN a OpenGL. Počáteční vstupní funkce jsou dumpnuty do OpenGL multisample barevných bufferů, a výsledek je shunted do cuDNN tensorů před zpracováním v CNN. Tyto tenzory jsou poté zkopírovány zpět do „živého“ OpenGL textury pro imposition do konečného obrazu.

Reálný časový systém funguje na NVIDIA RTX 2080, produkuje rozlišení 1024×1024 pixelů.

Jelikož barevné hodnoty vlasů jsou zcela disentangled v konečných hodnotách získaných sítí, změna barvy vlasů je triviální úkol, i když efekty, jako jsou gradienty a pruhy, zůstávají budoucí výzvou.

Autorům se podařilo uvolnit kód použitý v hodnoceních práce na GitLabu. Viz doplňkové video pro MVCGAN níže.

Závěr

Navigace v latentním prostoru autoencoderu nebo GAN je stále více podobná plavbě než přesnému řízení. Teprve v tomto velmi nedávném období začínáme vidět věrohodné výsledky pro generaci postojů „jednodušší“ geometrie, jako jsou tváře, v přístupech, jako jsou NeRF, GANs a non-deepfake (2017) autoencoder rámce.

Značná architektonická složitost lidských vlasů, v kombinaci s potřebou zahrnout fyzikální modely a další rysy, pro které současné přístupy k syntéze obrazu nemají žádné ustanovení, naznačuje, že syntéza vlasů je nepravděpodobná, že zůstane integrovanou součástí obecné syntézy obličeje, ale bude vyžadovat věnované a samostatné sítě jisté složitosti – i když takové sítě mohou být nakonec začleněny do širších a složitějších rámců syntézy obličeje.

 

Poprvé publikováno 15. dubna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai