Andersonův úhel

SofGAN: Generátor tváří založený na GAN, který nabízí větší kontrolu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci v Šanghaji a ve Spojených státech vyvinuli systém generování portrétů založený na GAN, který umožňuje uživatelům vytvářet nové tváře s dosud nezveřejněnou úrovní kontroly nad jednotlivými aspekty, jako je vlasy, oči, brýle, textury a barva.

Pro demonstraci flexibility systému poskytli tvůrci rozhraní podobné Photoshopu, kde uživatel může přímo kreslit prvky semantické segmentace, které budou reinterpretovány do realistické obrazové podoby, a které lze dokonce získat kreslením přímo na stávajících fotografiích.

V následujícím příkladu je použit obraz herce Daniela Radcliffa jako šablona (a cílem není vytvořit jeho podobiznu, ale spíše obecně fotorealistický obraz). Jakmile uživatel vyplní různé prvky, včetně samostatných aspektů, jako jsou brýle, jsou identifikovány a interpretovány v obrazovém výstupu:

Použití jedné obrazové šablony pro generování portrétu pomocí SofGAN. Zdroj: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Použití jedné obrazové šablony pro generování portrétu pomocí SofGAN. Zdroj: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Článek paper má název SofGAN: Generátor portrétů s dynamickým stylem a je veden Anpeiem Chenem a Ruiyangem Liuem, spolu s dalšími dvěma výzkumníky ze ShanghaiTech University a jedním z University of California v San Diegu.

Oddělování funkcí

Hlavní přínos práce spočívá nejen v poskytování uživatelsky přívětivého rozhraní, ale spíše v “oddělování” charakteristik naučených obličejových rysů, jako je poloha a textura, což umožňuje SofGAN generovat tváře, které jsou nepřímým úhlem k pohledu kamery.

Neobvyklé mezi generátory obličejů založenými na Generative Adversarial Networks, SofGAN může měnit úhel pohledu podle libosti, v rámci omezení pole úhlů přítomných ve výcvikových datech. Zdroj: https://arxiv.org/pdf/2007.03780.pdf

Neobvyklé mezi generátory obličejů založenými na Generative Adversarial Networks, SofGAN může měnit úhel pohledu podle libosti, v rámci omezení pole úhlů přítomných ve výcvikových datech. Zdroj: https://arxiv.org/pdf/2007.03780.pdf

Pokud jsou textury nyní odděleny od geometrie, tvar obličeje a textura lze také manipulovat jako samostatné entity. To fakticky umožňuje změnu rasy původní tváře, praktiku, která nyní má potenciálně užitečnou aplikaci pro vytváření rasově vyvážených souborů strojového učení.

SofGAN také podporuje umělý stárnutí a úpravy stylu na jemné úrovni, která nebyla dosud viděna v podobných systémech segmentace-obrázek, jako je NVIDIA GauGAN a Intel systém založený na neuronové renderaci.

SofGAN je schopen implementovat stárnutí jako iterativní styl.

SofGAN je schopen implementovat stárnutí jako iterativní styl.

Jedním z dalších průlomů pro SofGAN je, že výcvik nevyžaduje spárované segmentační/reálné obrázky, ale může být přímo trénován na nesouvisejících reálných obrazech.

Výzkumníci uvádějí, že architektura “oddělování” SofGAN byla inspirována tradičními systémy obrazové renderace, které rozkládají jednotlivé aspekty obrazu. V pracovních postupech vizuálních efektů se prvky pro kompozici rutinně rozkládají na nejmenší součásti, s odborníky specializovanými na každou součást.

Semantické pole obsazenosti (SOF)

Pro dosažení tohoto cíle v rámci rámce syntézy obrazu pomocí strojového učení vyvinuli výzkumníci semantické pole obsazenosti (SOF), rozšíření tradičního pole obsazenosti, které individualizuje složkové prvky obličejových portrétů. SOF byl trénován na kalibrovaných multi-pohledových semantických mapách segmentace, ale bez jakéhokoli ground truth dohledu.

Mnoho iterací z jedné mapy segmentace (dolní levá).

Mnoho iterací z jedné mapy segmentace (dolní levá).

Dále se 2D mapy segmentace získávají pomocí ray-tracing výstupu SOF, před tím, než jsou texturovány generátorem GAN. “Syntetické” mapy segmentace jsou také kódovány v nízkorozměrovém prostoru pomocí třívrstvého kódéru, aby se zajistila kontinuita výstupu, když se mění pohled.

Tréninkový režim prostorově kombinuje dvě náhodné styly pro každou semantickou oblast:

Architektura SofGAN.

Architektura SofGAN.

Výzkumníci tvrdí, že SofGAN dosahuje nižší vzdálenosti Frechet Inception (FID) než současné alternativní přístupy a také vyššího skóre Learned Perceptual Image Patch Similarity (LPIPS).

Předchozí přístupy StyleGAN byly často omezovány funkcionalitou spojením, kdy prvky, které tvoří obraz, jsou nevratně spojeny s ostatními, což způsobuje, že se vedle požadovaného prvku objevují nežádoucí prvky (například náušnice mohou být zobrazeny, když je tvar ucha informován během tréninku obrázkem, který obsahuje náušnice).

Ray marching se používá pro výpočet objemu map segmentace, umožňující více pohledů.

Ray marching se používá pro výpočet objemu map segmentace, umožňující více pohledů.

Datové soubory a trénink

Pro vývoj různých implementací SofGAN byly použity tři datové soubory: CelebAMask-HQ, repozitář 30 000 vysokorozměrových obrázků pocházejících z datové sady CelebA-HQ; NVIDIA Flickr-Faces-HQ (FFHQ), který obsahuje 70 000 obrázků, kde výzkumníci označili obrázky s předem trénovaným face parserem; a samo-vyrobená skupina 122 portrétních skenů s ručně označenými semantickými oblastmi.

SOF se skládá ze tří trénovatelných sub-modulů – hyper-net, ray marcher (viz obrázek výše) a klasifikátor. Projektový generátor Semantic Instance Wised (SIW) StyleGAN je nakonfigurován podobně jako StyleGAN2 v některých aspektech. Data augmentation je aplikován pomocí náhodného škálování a ořezávání, a tréninkové funkce path regularization každých čtyři kroky. Celý tréninkový postup trval 22 dní, aby dosáhl 800 000 iterací na čtyřech RTX 2080 Ti GPU přes CUDA 10.1.

Článek neuvádí konfiguraci 2080 karet, které mohou mít mezi 11 GB a 22 GB VRAM, což znamená, že celková VRAM použita pro nejlepší část měsíce pro trénink SofGAN je někde mezi 44 GB a 88 GB.

Výzkumníci pozorují, že přijatelné generalizované, vysoké výsledky začaly vyjít poměrně brzy ve tréninku, při 1500 iteracích, tři dny po tréninku. Zbytek tréninku byl věnován pomalému postupu k získání jemných detailů, jako je vlasy a oční rysy.

SofGAN obecně dosahuje realističtějších výsledků z jedné segmentační mapy než rivalitní metody, jako je NIVDIA SPADE a Pix2PixHD, a SEAN.

Níže je video zveřejněné výzkumníky. Další self-hostované videa jsou k dispozici na projektové stránce.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai