Andersonův úhel

Falešná ‘lepší’ těla pomocí AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z Alibaba DAMO akademie nabízí workflow řízené AI pro automatizaci přetváření obrázků těla – výjimečný počin v oblasti počítačového vidění, která je v současnosti zaměřena na manipulace založené na obličeji jako jsou deepfakes a na editaci obličejů pomocí GAN.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Vkládka ve sloupcích „result“, vygenerované mapy pozornosti, které určují oblasti k úpravě. Zdroj: https://arxiv.org/pdf/2203.04670.pdf

Architektura výzkumníků používá odhad kosterní pózy, aby se vypořádala s vyšší složitostí, kterou systémy pro syntézu a editaci obrazu čelí při konceptualizaci a parametrizaci existujících obrázků těla, alespoň na úrovni detailnosti, která umožňuje smysluplnou a selektivní úpravu.

Odhadnuté kosterní mapy pomáhají identifikovat a soustředit pozornost na oblasti těla, které je pravděpodobné retušovat, například oblast horního paže.

Systém nakonec umožňuje uživateli nastavit parametry, které mohou změnit vzhled hmotnosti, svalové hmoty nebo rozložení hmotnosti na celotělových či středně dlouhých fotografiích lidí a dokáže generovat libovolné transformace na oblečených i neoblečených částech těla.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Vlevo původní obrázek; uprostřed teplotní mapa odvozených oblastí pozornosti; vpravo transformovaný obrázek.

Motivací této práce je vývoj automatizovaných workflow, které by mohly nahradit náročné digitální úpravy prováděné fotografy a grafickými designéry v různých odvětvích médií, od módy po časopisový výstup a publicistický materiál.

Autoři obecně uvádějí, že tyto transformace jsou obvykle prováděny technikami „warp“ v Photoshopu a dalších tradičních bitmapových editorech a jsou prakticky výhradně používány u obrázků žen. Proto je vlastní dataset vyvinutý k podpoře nového postupu převážně složený z fotografií ženských subjektů:

‘Jelikož úpravy těla jsou převážně požadovány ženami, většina naší sbírky jsou fotografie žen, s ohledem na rozmanitost věku, ras (African:Asian:Caucasian = 0.33:0.35:0.32), póz a oděvů.’

Článek paper nese název Structure-Aware Flow Generation for Human Body Reshaping a je autorem pěti výzkumníků spjatých s globální Alibaba DAMO akademií.

Dataset Development

Stejně jako u většiny systémů pro syntézu a editaci obrazu, i architektura tohoto projektu vyžadovala vlastní tréninkový dataset. Autoři najali tři fotografy, aby vytvořili standardní Photoshopové úpravy vhodných obrázků ze zásobníkového fotobankového webu Unsplash, což vedlo k vytvoření datasetu – pojmenovaného BR-5K* – o 5 000 vysoce kvalitních obrázcích v rozlišení 2K.

Výzkumníci zdůrazňují, že cílem tréninku na tomto datasetu není vytvořit „idealizované“ a zobecněné rysy související s indexem atraktivity či žádoucího vzhledu, ale spíše extrahovat centrální mapování rysů spojených s profesionálními úpravami tělesných obrázků.

Avšak připouštějí, že tyto úpravy nakonec odrážejí transformační procesy mapující přechod od „reálného“ k přednastavenému pojetí „ideálu“:

‘Pozvali jsme tři profesionální umělce, aby nezávisle retušovali těla pomocí Photoshopu s cílem dosáhnout štíhlých postav odpovídajících populární estetice, a vybrali jsme tu nejlepší jako referenční pravdu.’

Protože rámec vůbec nezpracovává obličeje, byly před zařazením do datasetu rozmazány.

Architecture and Core Concepts

Pracovní postup systému zahrnuje načtení vysokého rozlišení portrétu, jeho downsampling na nižší rozlišení, které lze nasadit na dostupné výpočetní zdroje, a extrakci odhadnuté kosterní mapy pózy (druhá figura zleva na obrázku níže) spolu s Part Affinity Fields (PAF), které byly inovovány v roce 2016 Robotics Institute na Carnegie Mellon University (viz video vložené přímo níže).

Part Affinity Fields pomáhají definovat orientaci končetin a jejich obecnou souvislost s širším kosterním rámcem, čímž poskytují novému projektu další nástroj pro pozornost/lokalizaci.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Z článku o Part Affinity Fields z roku 2016 vyplývá, že predikované PAF kódují orientaci končetiny jako součást 2‑D vektoru, který zahrnuje i obecnou polohu končetiny. Zdroj: https://arxiv.org/pdf/1611.08050.pdf

I když se na první pohled zdají nevlivu na vzhled hmotnosti, kosterní mapy jsou užitečné při nasměrování konečných transformačních procesů na části těla, které mají být upraveny, například horní paže, zadek a stehna.

Poté jsou výsledky předány do Structure Affinity Self-Attention (SASA) v centrálním bottlenecku procesu (viz obrázek níže).

SASA reguluje konzistenci generátoru toku, který proces pohání; výsledky jsou následně předány modulu pro warpování (druhé zprava na výše uvedeném obrázku), který aplikuje transformace naučené během tréninku na ručních úpravách zahrnutých v datasetu.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Modul Structure Affinity Self-Attention (SASA) přiděluje pozornost relevantním částem těla, čímž pomáhá předcházet nadbytečným či irelevantním transformacím.

Výstupní obrázek je následně upsamplován zpět na původní rozlišení 2K pomocí procesů podobných standardní architektuře deepfake z roku 2017, na jejímž základě byly odvozeny populární balíčky jako DeepFaceLab; upsampling je také běžný v rámcích pro editaci GAN.

Síť pozornosti pro schéma je modelována podle Compositional De-Attention Networks (CODA), akademické spolupráce z USA/Singapuru z roku 2019 s Amazon (AMZN ) AI a Microsoft.

Tests

Framework založený na toku byl testován proti předchozím metodám založeným na toku FAL a Animating Through Warping (ATW), stejně jako architekturám pro převod obrazu Pix2PixHD a GFLA, s použitím SSIM, PSNR a LPIPS jako hodnoticích metrík.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Výsledky počátečních testů (směr šipky v nadpisech ukazuje, zda jsou nižší nebo vyšší hodnoty lepší).

Na základě těchto přijatých metrík autorův systém překonává předchozí architektury.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Vybrané výsledky. Pro srovnání ve vyšším rozlišení se odkažte na původní PDF odkazované v tomto článku.

Kromě automatizovaných metrik provedli výzkumníci uživatelskou studii (poslední sloupec tabulky výsledků zobrazený výše), ve které 40 účastníků dostalo náhodně vybraných 30 otázek ze 100‑otázkové sady související s obrázky vytvořenými různými metodami. 70 % respondentů upřednostnilo novou techniku jako vizuálně přitažlivější.

Challenges

Nový článek představuje výjimečný výlet do AI‑založených úprav těla. Oblast syntézy obrazu je v současnosti spíše zaměřena na generování editovatelných těl metodami jako Neural Radiance Fields (NeRF) nebo se soustředí na prozkoumávání latentního prostoru GAN a potenciálu autoenkodérů pro úpravy obličejů.

Iniciativa autorů je zatím omezena na změny vnímané hmotnosti a neimplementovali žádnou techniku inpaintingu, která by obnovila pozadí nevyhnutelně odhalované při zúžení postavy na fotografii.

Navrhují však, že portrétní matování a sloučení pozadí pomocí texturální inference by mohly triviálně vyřešit problém obnovy částí světa, které byly v obrazu dříve skryté lidskou „nedokonalostí“.

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

Navrhované řešení pro obnovení pozadí odhaleného AI‑řízeným snížením tělesného tuku.

 

* Ačkoliv preprint odkazuje na doplňkový materiál, který poskytuje podrobnější informace o datasetu a další příklady z projektu, místo tohoto materiálu není v článku zveřejněno a korespondenční autor zatím neodpověděl na naši žádost o přístup.

Poprvé publikováno 10. března 2022.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai