Andersonův úhel
Falešná ‘lepší’ těla pomocí AI

Nový výzkum z Alibaba DAMO akademie nabízí workflow řízené AI pro automatizaci přetváření obrázků těla – výjimečný počin v oblasti počítačového vidění, která je v současnosti zaměřena na manipulace založené na obličeji jako jsou deepfakes a na editaci obličejů pomocí GAN.

Vkládka ve sloupcích „result“, vygenerované mapy pozornosti, které určují oblasti k úpravě. Zdroj: https://arxiv.org/pdf/2203.04670.pdf
Architektura výzkumníků používá odhad kosterní pózy, aby se vypořádala s vyšší složitostí, kterou systémy pro syntézu a editaci obrazu čelí při konceptualizaci a parametrizaci existujících obrázků těla, alespoň na úrovni detailnosti, která umožňuje smysluplnou a selektivní úpravu.

Odhadnuté kosterní mapy pomáhají identifikovat a soustředit pozornost na oblasti těla, které je pravděpodobné retušovat, například oblast horního paže.
Systém nakonec umožňuje uživateli nastavit parametry, které mohou změnit vzhled hmotnosti, svalové hmoty nebo rozložení hmotnosti na celotělových či středně dlouhých fotografiích lidí a dokáže generovat libovolné transformace na oblečených i neoblečených částech těla.

Vlevo původní obrázek; uprostřed teplotní mapa odvozených oblastí pozornosti; vpravo transformovaný obrázek.
Motivací této práce je vývoj automatizovaných workflow, které by mohly nahradit náročné digitální úpravy prováděné fotografy a grafickými designéry v různých odvětvích médií, od módy po časopisový výstup a publicistický materiál.
Autoři obecně uvádějí, že tyto transformace jsou obvykle prováděny technikami „warp“ v Photoshopu a dalších tradičních bitmapových editorech a jsou prakticky výhradně používány u obrázků žen. Proto je vlastní dataset vyvinutý k podpoře nového postupu převážně složený z fotografií ženských subjektů:
‘Jelikož úpravy těla jsou převážně požadovány ženami, většina naší sbírky jsou fotografie žen, s ohledem na rozmanitost věku, ras (African:Asian:Caucasian = 0.33:0.35:0.32), póz a oděvů.’
Článek paper nese název Structure-Aware Flow Generation for Human Body Reshaping a je autorem pěti výzkumníků spjatých s globální Alibaba DAMO akademií.
Dataset Development
Stejně jako u většiny systémů pro syntézu a editaci obrazu, i architektura tohoto projektu vyžadovala vlastní tréninkový dataset. Autoři najali tři fotografy, aby vytvořili standardní Photoshopové úpravy vhodných obrázků ze zásobníkového fotobankového webu Unsplash, což vedlo k vytvoření datasetu – pojmenovaného BR-5K* – o 5 000 vysoce kvalitních obrázcích v rozlišení 2K.
Výzkumníci zdůrazňují, že cílem tréninku na tomto datasetu není vytvořit „idealizované“ a zobecněné rysy související s indexem atraktivity či žádoucího vzhledu, ale spíše extrahovat centrální mapování rysů spojených s profesionálními úpravami tělesných obrázků.
Avšak připouštějí, že tyto úpravy nakonec odrážejí transformační procesy mapující přechod od „reálného“ k přednastavenému pojetí „ideálu“:
‘Pozvali jsme tři profesionální umělce, aby nezávisle retušovali těla pomocí Photoshopu s cílem dosáhnout štíhlých postav odpovídajících populární estetice, a vybrali jsme tu nejlepší jako referenční pravdu.’
Protože rámec vůbec nezpracovává obličeje, byly před zařazením do datasetu rozmazány.
Architecture and Core Concepts
Pracovní postup systému zahrnuje načtení vysokého rozlišení portrétu, jeho downsampling na nižší rozlišení, které lze nasadit na dostupné výpočetní zdroje, a extrakci odhadnuté kosterní mapy pózy (druhá figura zleva na obrázku níže) spolu s Part Affinity Fields (PAF), které byly inovovány v roce 2016 Robotics Institute na Carnegie Mellon University (viz video vložené přímo níže).
Part Affinity Fields pomáhají definovat orientaci končetin a jejich obecnou souvislost s širším kosterním rámcem, čímž poskytují novému projektu další nástroj pro pozornost/lokalizaci.

Z článku o Part Affinity Fields z roku 2016 vyplývá, že predikované PAF kódují orientaci končetiny jako součást 2‑D vektoru, který zahrnuje i obecnou polohu končetiny. Zdroj: https://arxiv.org/pdf/1611.08050.pdf
I když se na první pohled zdají nevlivu na vzhled hmotnosti, kosterní mapy jsou užitečné při nasměrování konečných transformačních procesů na části těla, které mají být upraveny, například horní paže, zadek a stehna.
Poté jsou výsledky předány do Structure Affinity Self-Attention (SASA) v centrálním bottlenecku procesu (viz obrázek níže).

SASA reguluje konzistenci generátoru toku, který proces pohání; výsledky jsou následně předány modulu pro warpování (druhé zprava na výše uvedeném obrázku), který aplikuje transformace naučené během tréninku na ručních úpravách zahrnutých v datasetu.

Modul Structure Affinity Self-Attention (SASA) přiděluje pozornost relevantním částem těla, čímž pomáhá předcházet nadbytečným či irelevantním transformacím.
Výstupní obrázek je následně upsamplován zpět na původní rozlišení 2K pomocí procesů podobných standardní architektuře deepfake z roku 2017, na jejímž základě byly odvozeny populární balíčky jako DeepFaceLab; upsampling je také běžný v rámcích pro editaci GAN.
Síť pozornosti pro schéma je modelována podle Compositional De-Attention Networks (CODA), akademické spolupráce z USA/Singapuru z roku 2019 s Amazon (AMZN ) AI a Microsoft.
Tests
Framework založený na toku byl testován proti předchozím metodám založeným na toku FAL a Animating Through Warping (ATW), stejně jako architekturám pro převod obrazu Pix2PixHD a GFLA, s použitím SSIM, PSNR a LPIPS jako hodnoticích metrík.

Výsledky počátečních testů (směr šipky v nadpisech ukazuje, zda jsou nižší nebo vyšší hodnoty lepší).
Na základě těchto přijatých metrík autorův systém překonává předchozí architektury.

Vybrané výsledky. Pro srovnání ve vyšším rozlišení se odkažte na původní PDF odkazované v tomto článku.
Kromě automatizovaných metrik provedli výzkumníci uživatelskou studii (poslední sloupec tabulky výsledků zobrazený výše), ve které 40 účastníků dostalo náhodně vybraných 30 otázek ze 100‑otázkové sady související s obrázky vytvořenými různými metodami. 70 % respondentů upřednostnilo novou techniku jako vizuálně přitažlivější.
Challenges
Nový článek představuje výjimečný výlet do AI‑založených úprav těla. Oblast syntézy obrazu je v současnosti spíše zaměřena na generování editovatelných těl metodami jako Neural Radiance Fields (NeRF) nebo se soustředí na prozkoumávání latentního prostoru GAN a potenciálu autoenkodérů pro úpravy obličejů.
Iniciativa autorů je zatím omezena na změny vnímané hmotnosti a neimplementovali žádnou techniku inpaintingu, která by obnovila pozadí nevyhnutelně odhalované při zúžení postavy na fotografii.
Navrhují však, že portrétní matování a sloučení pozadí pomocí texturální inference by mohly triviálně vyřešit problém obnovy částí světa, které byly v obrazu dříve skryté lidskou „nedokonalostí“.

Navrhované řešení pro obnovení pozadí odhaleného AI‑řízeným snížením tělesného tuku.
* Ačkoliv preprint odkazuje na doplňkový materiál, který poskytuje podrobnější informace o datasetu a další příklady z projektu, místo tohoto materiálu není v článku zveřejněno a korespondenční autor zatím neodpověděl na naši žádost o přístup.
Poprvé publikováno 10. března 2022.












