Andersonův úhel
Vytvoření plně tělesných deepfakeů kombinací více NeRF

Výzkum syntézy obrazu je hustě poset novými návrhy systémů, které jsou schopny vytvářet plně tělesné video a obrázky mladých lidí – hlavně mladých žen – v různých typech oděvu. Většinou jsou generované obrázky statické; příležitostně se tyto reprezentace dokonce pohybují, i když obvykle ne velmi dobře.
Rychlost tohoto konkrétního výzkumného směru je ledová ve srovnání s aktuálním závratným tempem pokroku v souvisejících oblastech, jako jsou latentní difúzní modely; přesto výzkumné skupiny, většina z Asie, pokračují v neúnavném řešení problému.

Jedna z desítek, ne-li stovek navrhovaných nebo polo-spouštěných ‘virtuálních vyzkoušení’ systémů z posledních 10-15 let, kde jsou těla vyhodnocena prostřednictvím strojového učení založeného na rozpoznávání objektů a přizpůsobena navrhovaným oděvním předmětům. Zdroj: https://www.youtube.com/watch?v=2ZXrgGyhbak
Cílem je vytvořit nové systémy, které umožní ‘virtuální vyzkoušení’ pro módní a oděvní trh – systémy, které mohou přizpůsobit jak zákazníkovi, tak konkrétnímu produktu, který je aktuálně k dispozici nebo bude brzy uveden, bez zbytečné složitosti reálného superimponování oděvu, nebo nutnosti žádat zákazníky o odeslání lehce NSFW obrázků pro ML-založené renderovací potrubí.
Žádná z populárních syntetických architektur se nezdá být snadno přizpůsobitelná pro tuto úlohu: latentní prostor Generative Adversarial Networks (GANs) je nevhodný pro produkci přesvědčivého temporálního pohybu (nebo dokonce pro editaci obecně); ačkoli schopný generovat realistické lidské pohyby, Neural Radiance Fields (NeRF) jsou obvykle přirozeně odolné vůči typu editace, který by byl nezbytný pro ‘výměnu’ lidí nebo oděvu podle potřeby; autoenkodéry by vyžadovaly zatěžující osob/clothing-specifické školení; a latentní difúzní modely, podobně jako GANy, nemají žádné nativní temporální mechanismy pro generování videa.
EVA3D
Přesto pokračují články a návrhy. Poslední je neobvykle zajímavý v jinak nevýrazné a výhradně obchodně orientované linii výzkumu.
EVA3D, ze Singapurské technické univerzity Nanyang, je prvním náznakem přístupu, který přišel po dlouhé době – použití více Neural Radiance Field sítí, z nichž každá je věnována samostatné části těla, a které jsou poté složeny do sestavené a soudržné vizualizace.

Mobilní mladá žena složená z více NeRF sítí, pro EVA3D. Zdroj: https://hongfz16.github.io/projects/EVA3D.html
Výsledky, pokud jde o pohyb, jsou… v pořádku. Ačkoli vizualizace EVA3D nejsou mimo údolí neznámého, mohou alespoň vidět výjezd z místa, kde stojí.

To, co činí EVA3D výjimečným, je to, že výzkumníci za ním, téměř ojediněle v sektoru plně tělesné obrazové syntézy, si uvědomili, že jediná síť (GAN, NeRF nebo jiná) nebude schopna zvládnout editovatelnou a flexibilní generaci plného lidského těla pro einige roky – částečně kvůli tempu výzkumu a částečně kvůli hardwarovým a jiným logistickým omezením.
Tým z Nanyang proto rozdělil úlohu na 16 sítí a více technologií – přístup, který byl již přijat pro neuronální renderování městských prostředí v Block-NeRF a CityNeRF, a který se zdá být stále zajímavějším a potenciálně plodným půl-mezi opatřením pro dosažení plně tělesných deepfakeů v příštích pěti letech, s ohledem na nové konceptuální nebo hardwarové vývoj.
Ne všechny výzvy spojené s vytvářením tohoto typu ‘virtuálního vyzkoušení’ jsou technické nebo logistické, a článek popisuje některé datové problémy, zejména ve vztahu k nesupervizovanému učení:
‘[Módní] datové sady většinou mají velmi omezené lidské pózy (většina jsou podobné stojící pózy), a vysoce nevyvážené úhly pohledu (většina je čelní pohled). Tento nevyvážený 2D datový rozložení by mohl bránit nesupervizovanému učení 3D GAN, vedoucí k obtížím při novém zobrazení/póze syntéze. Proto je zapotřebí vhodná tréninková strategie, aby se tento problém zmírnil.’
Pracovní postup EVA3D rozděluje lidské tělo na 16 samostatných částí, z nichž každá je generována prostřednictvím své vlastní NeRF sítě. Zjevně, toto vytváří dostatek ‘nezmrazených’ sekcí, aby bylo možné galvanizovat postavu prostřednictvím pohybového zachycení nebo jiných typů pohybových dat. Kromě tohoto výhodného aspektu to také umožňuje systému přidělit maximální zdroje částem těla, které ‘prodávají’ celkový dojem.
Například lidské nohy mají velmi omezený rozsah artikulace, zatímco autenticita obličeje a hlavy, kromě kvality celého těla pohybu obecně, je pravděpodobně hlavním symbolem autenticity pro vykreslení.

Kvalitativní srovnání mezi EVA3D a předchozími metodami. Autoři prohlašují SOTA výsledky v tomto ohledu.
Přístup se radikálně liší od NeRF-centrického projektu, se kterým je konceptuálně spojen – 2021 A-NeRF, z University of British Columbia a Reality Labs Research, který se snažil přidat vnitřní řídící kostru k jinak konvenční ‘jednoduché’ NeRF reprezentaci, což by činilo obtížnější přidělovat zdroje zpracování pro různé části těla na základě potřeby.

Předchozí pohyby – A-NeRF vybavuje ‘upečenou’ NeRF stejným typem ohebné a artikulované centrální výztuže, kterou průmysl VFX používá již dlouho k animaci CGI postav. Zdroj: https://lemonatsu.github.io/anerf/
Společně s většinou podobných lidských projektů, které se snaží využít latentní prostor různých populárních přístupů, EVA3D používá Skinned Multi-Person Linear Model (SMPL), ‘tradiční’ CGI-založenou metodu pro přidání instrumentality k obecné abstrakci současných syntetických metod. Před několika měsíci jiný článek, tentokrát z Zhejiang University v Hangzhou a School of Creative Media na City University of Hong Kong, použil takové metody k provedení neuronového tvarování těla.
Metoda
Model SMPL použitý v procesu je naladěn na lidský ‘předchozí’ – osobu, která je, v podstatě, dobrovolně deepfakována EVA3D, a její váhy kožichu vyjednávají rozdíly mezi kanonickým prostorem (tj. ‘v klidu’, nebo ‘neutrální’ póze SMPL modelu) a tím, jak je konečná podoba vykreslena.
Jako je vidět na výše uvedeném obrázku, ohraničující rámečky SMPL jsou použity jako hranice definice pro 16 sítí, které nakonec složí tělo. Inverzní Linear Blend Skinning (LBS) algoritmus SMPL je pak použit k přenosu viditelných vzorkovaných paprsků do kanonického (pasivního) prostoru. Poté jsou 16 podsítí dotázány na základě těchto konfigurací a nakonec transformovány do finálního vykreslení.
Celá NeRF kompozice je poté použita k vytvoření 3D lidského GAN rámce.

Vykreslení druhé fáze GAN rámce bude nakonec trénováno proti skutečným 2D obrazovým sbírkám lidí/módy.
Každá podsíť reprezentující část lidského těla se skládá z vrstvených Multi-Layer Perceptronů (MLP) se SIREN (Sinusoidální reprezentace sítí) aktivací. Ačkoli SIREN řeší mnoho problémů v pracovním postupu, jako je tento, a v podobných projektech, má tendenci přetvořit se místo generalizace, a výzkumníci navrhují, že alternativní knihovny by mohly být použity v budoucnu (viz konec článku).
Data, trénování a testy
EVA3D čelí neobvyklým datovým problémům, způsobeným omezeními a šablonovitým stylem póz, které jsou k dispozici v módních datech, které postrádají alternativní nebo nové pohledy, a jsou, možná záměrně, opakující se, aby se zaměřily na oděv spíše než na člověka, který ho nosí.
Z důvodu tohoto nevyváženého rozložení póz, EVA3D používá lidské předchozí (viz výše) založené na SMPL šablonové geometrii, a poté předpovídá Signed Distance Field (SDF) offset této pózy, spíše než přímou cílovou pózu.
Pro podpůrné experimenty, výzkumníci využili čtyři datové sady: DeepFashion; SHHQ; UBCFashion; a AIST Dance Video Database (AIST Dance DB).
Poslední dvě datové sady obsahují více variabilních póz, než první dvě, ale reprezentují stejné osoby opakovaně, což ruší tuto jinak užitečnou rozmanitost; stručně řečeno, data jsou více než výzvou, s ohledem na úkol.

Příklady z SSHQ. Zdroj: https://arxiv.org/pdf/2204.11823.pdf
Báze, které byly použity, byly ENARF-GAN, první projekt, který vykreslil NeRF vizuály z 2D obrazových dat; Stanford a NVIDIA (NVDA ) EG3D; a StyleSDF, spolupráce mezi University of Washington, Adobe (ADBE ) Research a Stanford University – všechny metody vyžadující super-rozlišení knihovny, aby se mohly škálovat z nativního na vysoké rozlišení.
Metriky, které byly přijaty, byly kontroverzní Frechet Inception Distance (FID) a Kernel Inception Distance (KID), spolu s Percentage of Correct Keypoints (PCKh@0.5).
V kvantitativních hodnocení, EVA3D vedl ve všech metrikách ve čtyřech datech:

Kvantitativní výsledky.
Výzkumníci poznamenali, že EVA3D dosáhl nejnižší chybové sazby pro geometrické vykreslení, kritický faktor v projektu tohoto typu. Také pozorovali, že jejich systém může řídit generované pózy a dosáhnout vyšších PCKh@0.5 skóre, v kontrastu s EG3D, jediným konkurenčním metodou, která dosáhla vyššího skóre v jedné kategorii.
EVA3D funguje nativně na standardním rozlišení 512x512px, i když by mohl být snadno a efektivně upscale do HD rozlišení přidáním upscale vrstev, jako to nedávno udělala Google se svou 1024 rozlišení text-to-video nabídkou Imagen Video.
Metoda není bez omezení. Článek poznamenává, že SIREN aktivace může způsobit kruhové artefakty, které by mohly být odstraněny v budoucích verzích pomocí alternativní základny, jako je EG3D, v kombinaci s 2D dekodérem. Kromě toho je obtížné přizpůsobit SMPL přesně na módní datové zdroje.
Nakonec, systém nemůže snadno akomodovat větší a více tekuté položky oděvu, jako jsou velké šaty; oděvní předměty tohoto typu vykazují stejný typ tekuté dynamiky, který činí tvorbu neuronálně vykreslených vlasů tak velkou výzvou. Předpokládá se, že vhodné řešení by mohlo pomoci řešit obě tyto otázky.
Poprvé publikováno 12. října 2022.















