Andersonův úhel
Falešné ‘lepší’ tělo s umělou inteligencí

Nový výzkum z Alibaba DAMO akademie nabízí umělou inteligencí poháněný workflow pro automatizaci přestavby obrazů těl – vzácný pokus v počítačovém vidění, které je aktuálně obsazené tvářemi založenými manipulacemi, jako jsou deepfakes a GAN-založené tvářové editace.

Vloženo v ‘výsledkové’ sloupci, vygenerované pozornostní mapy, které definují oblasti, které je třeba upravit. Zdroj: https://arxiv.org/pdf/2203.04670.pdf
Vědci používají architekturu, která využívá odhadované pozice kostry k řešení větší složitosti, se kterou systémy syntézy a editace obrazů čelí při konceptualizaci a parametrizaci existujících obrazů těl, alespoň na úrovni granularity, která umožňuje smysluplnou a selektivní editaci.

Odhadnuté mapy pozice kostry pomáhají individuovat a zaměřit pozornost na oblasti těla, které jsou pravděpodobně retušovány, jako je oblast horní části paže.
Systém nakonec umožňuje uživateli nastavit parametry, které mohou změnit vzhled hmotnosti, svalové hmoty nebo distribuce hmotnosti na celkových nebo středních fotografiích lidí a je schopen generovat libovolné transformace na oděných nebo neoděných částech těla.

Vlevo, vstupní obraz; uprostřed, mapa tepla odvozených pozornostních oblastí; vpravo, transformovaný obraz.
Motivací pro tuto práci je vývoj automatizovaných workflow, které by mohly nahradit namáhavé digitální manipulace, které jsou prováděny fotografy a grafickými umělci v různých odvětvích médií, od módy po styl outputu a publicitní materiál.
Obecně, autoři přiznávají, že tyto transformace jsou obvykle aplikovány pomocí ‘warp’ technik v Photoshopu a dalších tradičních bitmapových editorech a jsou téměř výhradně používány na obrázcích žen. V důsledku toho, vlastní dataset vyvinutý pro usnadnění nového procesu se skládá převážně z obrázků ženských subjektů:
‘Jelikož je retušování těl hlavně požadováno ženami, většina naší sbírky jsou fotografie žen, zohledňující rozmanitost věku, ras (Africká: Asijská: Kaukazská = 0,33: 0,35: 0,32), póz, a oděvů.’
Článek článku je nazvaný Structure-Aware Flow Generation for Human Body Reshaping a pochází od pěti autorů spojených s Alibaba’s globální DAMO akademie.
Vývoj datasetu
Jako je obvykle případ s obrazovými systémy syntézy a editace, architektura pro projekt vyžadovala přizpůsobený tréninkový dataset. Autoři zadali tři fotografům, aby produkovali standardní Photoshop manipulace vhodných obrazů ze stock fotografického webu Unsplash, což vedlo k datasetu – nazvaném BR-5K* – 5 000 vysokokvalitních obrazů v rozlišení 2K.
Vědci zdůrazňují, že cílem tréninku na tomto datasetu není produkovat ‘idealizované’ a generalizované rysy související s indexem atraktivity nebo žádoucího vzhledu, ale spíše extrahovat centrální mapování funkcí spojených s profesionálními manipulacemi obrazů těl.
Nicméně, oni souhlasí, že manipulace nakonec odrážejí transformační procesy, které mapují pokrok od ‘reálného’ k předem stanovenému pojmu ‘ideálu’:
‘Pozvali jsme tři profesionální umělce, aby retušovali těla pomocí Photoshopu nezávisle, s cílem dosáhnout štíhlých postav, které splňují populární estetiku, a vybrali jsme nejlepší z nich jako referenční.’
Jelikož framework nepracuje s obličeji vůbec, tyto byly rozostřeny předtím, než byly zahrnuty do datasetu.
Architektura a základní koncepty
Systémový workflow zahrnuje vstup vysokorozlišovací portrét, downsampling na nižší rozlišení, které může být zpracováno dostupnými výpočetními prostředky, a extrakci odhadnuté mapy pozice kostry (druhá figura zleva na obrázku níže), jakož i Part Affinity Fields (PAFs), které byly inovovány v roce 2016 Robotics Institute na Carnegie Mellon University (viz video vložené přímo níže).
Part Affinity Fields pomáhají definovat orientaci končetin a obecnou asociaci s širší kostrou, poskytující novému projektu další nástroj pro pozornost a lokalizaci.

Z článku o Part Affinity Fields, předpovězené PAFs kódují orientaci končetin jako součást 2D vektoru, který také zahrnuje obecnou pozici končetiny. Zdroj: https://arxiv.org/pdf/1611.08050.pdf
Přes jejich zdánlivou irelevanci pro vzhled hmotnosti, mapy pozice kostry jsou užitečné pro směrování konečných transformačních procesů na části těla, které je třeba upravit, jako jsou horní paže, záda a stehna.
Po tomto, výsledky jsou zpracovány v Structure Affinity Self-Attention (SASA) v centrálním hrdle procesu (viz obrázek níže).

SASA reguluje konzistenci generátoru toku, který pohání proces, jehož výsledky jsou poté předány do modulu warping (druhý zprava na obrázku výše), který aplikuje transformace, které se naučily z tréninku na ručních revizích zahrnutých v datasetu.

Modul Structure Affinity Self-Attention (SASA) přiděluje pozornost relevantním částem těla, pomáhá zabránit zbytečným nebo irelevantním transformacím.
Výstupní obraz je poté upsamplován zpět na původní rozlišení 2K, pomocí procesů, které nejsou příliš odlišné od standardní, 2017-style deepfake architektury, ze které byly odvozeny populární balíčky, jako je DeepFaceLab; proces upsamplování je také běžný v GAN editačních rámcích.
Síť pozornosti pro schéma je modelována podle Compositional De-Attention Networks (CODA), akademické spolupráce z roku 2019 mezi Amazon AI a Microsoftem.
Testy
Flow-based framework byl testován proti předchozím flow-based metodám FAL a Animating Through Warping (ATW), jakož i image translation architektur Pix2PixHD a GFLA, se SSIM, PSNR a LPIPS jako hodnocení metriky.

Výsledky počátečních testů (šipka ve sloupcích označuje, zda jsou nižší nebo vyšší hodnoty lepší).
Založeno na těchto přijatých metrikách, systém autorů překonává předchozí architektury.
Kromě automatizovaných metrik, výzkumníci provedli uživatelskou studii (poslední sloupec výsledkové tabulky), ve které 40 účastníků bylo každý ukázáno 30 otázek náhodně vybraných z 100 otázek týkajících se obrazů vygenerovaných pomocí různých metod. 70 % respondentů preferovalo novou techniku jako ‘vizuálně atraktivnější’.
Výzvy
Nový článek představuje vzácnou exkurzi do AI-založené manipulace s tělem. Obrazová syntéza je aktuálně mnohem více zajímána o generování editovatelných těl pomocí metod, jako jsou Neural Radiance Fields (NeRF), nebo je fixována na prozkoumání latentního prostoru GAN a potenciálu autoencoderů pro tvářovou manipulaci.
Autoři iniciativa je aktuálně omezena na produkci změn vzhledu hmotnosti a dosud nezavedli žádnou kind of inpainting techniku, která by obnovila pozadí, které je nevyhnutelně odhaleno, když slim down obrázek někoho.
Nicméně, oni navrhují, že portrét matting a background blending through textural inference by mohly triviálně vyřešit problém obnovy částí světa, které byly dříve skryty v obraze lidskou ‘imperfekcí’.

Navrhované řešení pro obnovu pozadí, které je odhaleno AI-driven fat reduction.
* Ačkoli preprint odkazuje na doplňkový materiál, který poskytuje více informací o datasetu, jakož i další příklady z projektu, umístění tohoto materiálu není k dispozici v článku a odpovídající autor dosud neodpověděl na naši žádost o přístup.
Poprvé publikováno 10. března 2022.













