Andersonův úhel

Přetváření lidských tělesných typů pomocí AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nová výzkumná spolupráce z Číny nabízí novou metodu přetváření lidského těla na obrázcích pomocí koordinovaného dvojitého neuronového kodéru, řízeného parametrickým modelem, který umožňuje koncovému uživateli modulovat hmotnost, výšku a tělesné proporce v interaktivním rozhraní.

Parametrická modulace tělesné formy, se snímky měnícími tři dostupné funkce. Zdroj: https://arxiv.org/pdf/2203.10496.pdf

Parametrická modulace tělesné formy, se snímky měnícími tři dostupné funkce. Zdroj: https://arxiv.org/pdf/2203.10496.pdf

Práce nabízí několik vylepšení oproti nedávnému podobnému projektu z Alibaba, protože může přesvědčivě měnit výšku a tělesné proporce, stejně jako hmotnost, a má věnovaný neuronový síť pro “doplnění” (neexistujícího) pozadí, které lze odhalit “štíhlejšími” tělesnými obrázky. Také vylepšuje pozoruhodnou dřívější parametrickou metodu pro přetváření těla odstraněním potřeby rozsáhlého lidského zásahu během formulace transformace.

Nazvaný NeuralReshaper, nová architektura přizpůsobuje parametrickou 3D lidskou šablonu zdrojovému obrázku a poté používá deformace šablony pro přizpůsobení původního obrázku novým parametrům.

Systém je schopen zpracovat tělesné transformace na oblečených i polonahých (tj. plážových) postavách.

Transformace tohoto typu jsou目前 velmi zajímavé pro módní AI výzkumný sektor, který produkoval řadu StyleGAN/CycleGAN-založených a obecných neuronových síťových platforem pro virtuální vyzkoušení, které mohou přizpůsobit dostupné oblečení tvaru a typu uživatelem odeslaného obrázku, nebo jinak pomoci s vizuální shodou.

Článek je nazvaný Single-image Human-body Reshaping with Deep Neural Networks a pochází z výzkumníků na Zhejiang University v Hangzhou a School of Creative Media na City University of Hong Kong.

SMPL Fitting

NeuralReshaper využívá Skinned Multi-Person Linear Model (SMPL) vyvinutý Max Planck Institute for Intelligent Systems a renomovaným VFX domem Industrial Light and Magic v roce 2015.

SMPL Parametrická lidská těla z roku 2015 Planck/ILM spolupráce. Zdroj: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

SMPL Parametrická lidská těla z roku 2015 Planck/ILM spolupráce. Zdroj: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

V první fázi procesu je vygenerován SMPL model ze zdrojového obrázku, na kterém jsou požadovány tělesné transformace. Přizpůsobení SMPL modelu k obrázku následuje metodologie Human Mesh Recovery (HMR) metody navržené univerzitami v Německu a USA v roce 2018.

Tři parametry pro deformaci (hmotnost, výška, tělesné proporce) jsou vypočteny v této fázi, spolu s úvahou o parametrech kamery, jako je ohnisková délka. 2D klíčové body a generovaná silueta poskytují obal pro deformaci ve formě 2D siluety, další optimalizační opatření, které zvyšuje přesnost hranic a umožňuje autentické pozadí pro pozdější fázi potrubí.

SMPL přizpůsobovací fáze: vlevo, zdrojový obrázek; druhý zleva, optimalizační výsledek získaný z metody popsány v roce 2016 výzkum vedený Max Planck Institute for Intelligent Systems; třetí, přímý odvozený výsledek z předem trénovaného modelu pro End-to-end Recovery of Human Shape and Pose; druhý zprava, výsledky získané po optimalizaci 2D klíčových bodů; a konečně, vpravo, dokončené přizpůsobení po siluetové optimalizaci (viz výše).

SMPL přizpůsobovací fáze: vlevo, zdrojový obrázek; druhý, optimalizační výsledek získaný z metody popsány v roce 2016 výzkum vedený Max Planck Institute for Intelligent Systems; třetí, přímý odvozený výsledek z předem trénovaného modelu pro End-to-end Recovery of Human Shape and Pose; čtvrtý, výsledky získané po optimalizaci 2D klíčových bodů; a konečně, pátý, dokončené přizpůsobení po siluetové optimalizaci (viz výše).

3D deformace je poté promítnuta do architektury obrázku, aby ermögnila hustou deformaci, která definuje deformaci. Tento proces trvá kolem 30 sekund na obrázek.

NeuralReshaper Architektura

NeuralReshaper běží dvě neuronové sítě současně: přední kodér, který generuje transformovaný tělesný tvar, a zadní kodér, který se zaměřuje na vyplnění “odhalených” pozadí (v případě, například, “štíhlejšího” těla – viz níže).

U-net-style framework integruje výstup z obou kodérů funkcí předtím, než předá výsledek sjednocenému kodéru, který nakonec produkuje nový obrázek ze dvou vstupů. Architektura obsahuje novou warp-řízenou mechanismus pro umožnění integrace.

Školení a Experimenty

NeuralReshaper je implementován v PyTorch na jediném NVIDIA 1080ti GPU s 11gb VRAM. Síť byla trénována po dobu 100 epoch s Adam optimalizátorem, s generátorem nastaveným na cílovou ztrátu 0,0001 a diskriminátorem na cílovou ztrátu 0,0004. Školení probíhalo na velikosti batch 8 pro proprietární venkovní dataset (vytvořený z COCO, MPII a LSP), a 2 pro trénink na DeepFashion dataset.

Vlevo, původní obrázky, vpravo, reproportionovaný výstup NeuralReshaper.

Vlevo, původní obrázky, vpravo, reproportionovaný výstup NeuralReshaper.

Níže jsou einige příklady výhradně z DeepFashion datasetu jako trénovaného pro NeuralReshaper, s původními obrázky vždy vlevo.

Tři ovladatelné atributy jsou odděleny a lze je aplikovat samostatně.

Transformace na odvozeném venkovním datasetu jsou více náročné, protože často vyžadují vyplnění komplexních pozadí a jasnou a přesvědčivou hranici transformovaných tělesných typů:

Parametrická Nutnost

Jak článek pozoruje, stejné-obrázkové transformace tohoto typu představují špatně položený problém v obrazové syntéze. Mnoho transformačních GAN a encoder rámců může využít spárované obrázky (jako různé projekty navržené pro efekt sketch>foto a foto>sketch transformací).

Jednak v daném případě by to vyžadovalo obrázkové páry se stejnými lidmi v různých fyzických konfiguracích, jako jsou “před a po” obrázky v dietě nebo plastické chirurgii – data, která jsou obtížná získat nebo vygenerovat.

Alternativně, transformační GAN sítě lze trénovat na mnohem více rozmanitých datech a efektovat transformace hledáním latentního směru mezi zdrojovým (původním obrázkem latentním kódem) a požadovanou třídou (v tomto případě ‘tlustý’, ‘štíhlý’, ‘vysoký’, atd.). Tento přístup je však目前 příliš omezený pro účely jemně laděného přetváření těla.

Neuronové radiance pole (NeRF) přístupy jsou mnohem dále pokročilé v plném tělesném simulování než většina GAN-založených systémů, ale zůstávají scénářově specifické a náročné na zdroje, s目前 velmi omezenou schopností editovat tělesné typy v jemném způsobu, jakým se NeuralReshaper a předchozí projekty snaží řešit (krátké škálování celého těla vzhledem k jeho prostředí).

GANův latentní prostor je těžké řídit; VAE sám o sobě dosud neřeší složitosti plného tělesného reprodukčního procesu; a NeRFova schopnost konzistentně a realisticky přetvořit lidská těla je stále v počátcích. Proto se zdá, že začlenění “tradičních” CGI metodologií, jako je SMPL, bude pokračovat v lidské obrazové syntéze výzkumném sektoru, jako metoda pro konsolidaci funkcí, tříd a latentních kódů, jejichž parametry a využitelnost nejsou dosud plně pochopeny v těchto vznikajících technologiích.

First published 31st březen 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai