Kąt Andersona

Fałszowanie ‘lepszych’ ciał przy użyciu AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badania z Alibaba DAMO Academy oferują oparty na AI przepływ pracy automatyzujący przekształcanie obrazów ciał – rzadkie przedsięwzięcie w sektorze widzenia komputerowego, który obecnie skupia się na manipulacjach opartych na twarzach takich jak deepfake’i i edycji twarzy opartych na GAN.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Wstawka w kolumnach „result”, wygenerowane mapy uwagi określające obszary do korekty. Source: https://arxiv.org/pdf/2203.04670.pdf

Architektura badaczy wykorzystuje estymację szkieletowej pozy, aby poradzić sobie z większą złożonością, z jaką systemy syntezy i edycji obrazów spotykają się przy konceptualizacji i parametryzacji istniejących obrazów ciał, przynajmniej na poziomie szczegółowości umożliwiającym znaczącą i selektywną edycję.

Szacowane mapy szkieletu pomagają zidentyfikować i skierować uwagę na obszary ciała, które prawdopodobnie będą retuszowane, takie jak górna część ramienia.

System ostatecznie umożliwia użytkownikowi ustawienie parametrów, które mogą zmienić wygląd wagi, masy mięśniowej lub rozmieszczenia masy w pełnowymiarowych lub średniej długości zdjęciach osób, i jest w stanie generować dowolne przekształcenia na części ciała ubranej lub nieubranej.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Po lewej, obraz wejściowy; w środku, mapa cieplna wyprowadzonych obszarów uwagi; po prawej, przekształcony obraz.

Motywacją tej pracy jest opracowanie zautomatyzowanych przepływów pracy, które mogłyby zastąpić żmudne manipulacje cyfrowe wykonywane przez fotografów i grafików produkcyjnych w różnych gałęziach mediów, od mody po wydania w stylu magazynowym oraz materiały promocyjne.

Ogólnie, autorzy przyznają, że te przekształcenia są zazwyczaj stosowane przy użyciu technik ‘warp’ w Photoshopie i innych tradycyjnych edytorach bitmap, i są prawie wyłącznie używane na zdjęciach kobiet. W konsekwencji, niestandardowy zestaw danych opracowany w celu ułatwienia nowego procesu składa się głównie ze zdjęć kobiet:

‘Ponieważ retusz ciała jest głównie pożądany przez kobiety, większość naszej kolekcji stanowią zdjęcia kobiet, uwzględniając różnorodność wieku, ras (Afrykańska:Azjatycka:Kaukaska = 0.33:0.35:0.32), póz i ubrań.’

Artykuł paper nosi tytuł Structure-Aware Flow Generation for Human Body Reshaping i został napisany przez pięciu autorów związanych z globalną akademią DAMO Alibaba.

Rozwój zbioru danych

Jak to zwykle bywa w systemach syntezy i edycji obrazów, architektura projektu wymagała spersonalizowanego zestawu danych treningowych. Autorzy zlecili trzem fotografom wykonanie standardowych manipulacji w Photoshopie na odpowiednich zdjęciach ze strony z fotografiami stockowymi Unsplash, co zaowocowało zestawem danych – zatytułowanym BR-5K* – zawierającym 5 000 wysokiej jakości obrazów w rozdzielczości 2K.

Badacze podkreślają, że celem trenowania na tym zestawie danych nie jest tworzenie ‘idealizowanych’ i uogólnionych cech odnoszących się do wskaźnika atrakcyjności czy pożądanego wyglądu, lecz wyodrębnienie centralnych map cech związanych z profesjonalnymi manipulacjami obrazów ciał.

Jednak przyznają, że manipulacje ostatecznie odzwierciedlają procesy transformacyjne, które przechodzą od ‘realnego’ do ustalonej koncepcji ‘idealnego’:

‘Zapraszamy trzech profesjonalnych artystów do niezależnego retuszowania ciał w Photoshopie, z celem uzyskania smukłych sylwetek spełniających popularne estetyki, i wybieramy najlepszy jako prawdziwą referencję.’

Ponieważ ramy nie zajmują się w ogóle twarzami, zostały one rozmyte przed włączeniem do zestawu danych.

Architektura i kluczowe koncepcje

Przepływ pracy systemu polega na wprowadzeniu portretu w wysokiej rozdzielczości, zmniejszeniu go do niższej rozdzielczości, która mieści się w dostępnych zasobach obliczeniowych, oraz wyodrębnieniu szacowanej mapy szkieletowej (druga figura od lewej na poniższym obrazie), a także pól afiniczności części (PAF), które zostały zaprojektowane w 2016 roku przez The Robotics Institute na Carnegie Mellon University (zobacz wideo osadzone poniżej).

Pola afiniczności części pomagają określić orientację kończyn oraz ich ogólne powiązanie z szerszym szkieletem, dostarczając nowemu projektowi dodatkowego narzędzia uwagi/lokalizacji.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Z 2016 roku, w pracy o Polach Afiniczności Części, przewidywane PAF kodują orientację kończyny jako część wektora 2D, który zawiera również ogólne położenie kończyny. Source: https://arxiv.org/pdf/1611.08050.pdf

Mimo ich pozornej nieistotności dla wyglądu wagi, mapy szkieletowe są przydatne w kierowaniu końcowych procesów transformacyjnych do części ciała, które mają być zmienione, takich jak górne ramiona, pośladki i uda.

Po tym wyniki są przekazywane do modułu Structure Affinity Self-Attention (SASA) w centralnym wąskim gardle procesu (zobacz obraz poniżej).

SASA reguluje spójność generatora przepływu, który napędza proces; wyniki są następnie przekazywane do modułu deformacji (drugi od prawej na powyższym obrazie), który stosuje transformacje wyuczone podczas treningu na ręcznych korektach zawartych w zestawie danych.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Moduł Structure Affinity Self-Attention (SASA) przydziela uwagę odpowiednim częściom ciała, pomagając uniknąć zbędnych lub nieistotnych transformacji.

Obraz wyjściowy jest następnie podnoszony z powrotem do pierwotnej rozdzielczości 2K, przy użyciu procesów podobnych do standardowej architektury deepfake z 2017 roku, z której wywodzą się popularne pakiety takie jak DeepFaceLab; proces podnoszenia rozdzielczości jest również powszechny w ramach edycji GAN.

Sieć uwagi dla tego schematu jest modelowana na podstawie Compositional De-Attention Networks (CODA), współpracy akademickiej z 2019 roku pomiędzy USA/Singapurem a Amazon (AMZN ) AI i Microsoft.

Testy

Ramowy system oparty na przepływie został przetestowany w porównaniu z wcześniejszymi metodami opartymi na przepływie FAL oraz Animating Through Warping (ATW), a także architekturami translacji obrazu Pix2PixHD i GFLA, przy użyciu SSIM, PSNR i LPIPS jako metryk oceny.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Wyniki wstępnych testów (kierunek strzałki w nagłówkach wskazuje, czy niższe czy wyższe wartości są lepsze).

Na podstawie przyjętych metryk system autorów przewyższa wcześniejsze architektury.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Wybrane wyniki. Proszę odnieść się do oryginalnego PDF podlinkowanego w tym artykule w celu uzyskania porównań w wyższej rozdzielczości.

Oprócz automatycznych metryk, badacze przeprowadzili badanie użytkowników (ostatnia kolumna tabeli wyników przedstawiona wcześniej), w którym 40 uczestników otrzymało po 30 pytań losowo wybranych z puli 100 pytań dotyczących obrazów wygenerowanych różnymi metodami. 70 % respondentów uznało nową technikę za bardziej ‘wizualnie atrakcyjną’.

Wyzwania

Nowy artykuł stanowi rzadką wyprawę w dziedzinę manipulacji ciałem opartą na AI. Sektor syntezy obrazów jest obecnie znacznie bardziej zainteresowany generowaniem edytowalnych ciał metodami takimi jak Neural Radiance Fields (NeRF) lub skupia się na eksploracji przestrzeni ukrytej GAN-ów oraz potencjału autoenkoderów w manipulacji twarzą.

Inicjatywa autorów jest obecnie ograniczona do wprowadzania zmian w postrzeganej wadze i nie wdrożyli żadnej techniki wypełniania (inpainting), która przywróciłaby tło nieuchronnie odsłonięte przy odchudzaniu zdjęcia osoby.

Jednak proponują, że matowanie portretu i mieszanie tła przy użyciu wnioskowania teksturalnego mogłoby w prosty sposób rozwiązać problem przywracania części świata, które wcześniej były ukryte w obrazie przez ludzkie ‘niedoskonałości’.

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

Proponowane rozwiązanie przywracające tło odsłonięte przez AI‑napędzane odchudzanie.

 

* Chociaż preprint odnosi się do materiałów uzupełniających zawierających więcej szczegółów o zestawie danych, jak również dalszych przykładów z projektu, lokalizacja tych materiałów nie została udostępniona w artykule, a autor korespondencyjny nie odpowiedział jeszcze na naszą prośbę o dostęp.

Po raz pierwszy opublikowano 10 marca 2022.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai