Kąt Andersona

SofGAN: Generator twarzy oparty na sieciach GAN z większą kontrolą

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Naukowcy z Szanghaju i USA opracowali system generowania portretów oparty na sieciach GAN, który pozwala użytkownikom tworzyć nowe twarze z dotąd nieosiągalnym poziomem kontroli nad poszczególnymi aspektami, takimi jak włosy, oczy, okulary, tekstury i kolor.

Aby zademonstrować wszechstronność systemu, twórcy zapewnili interfejs w stylu Photoshop, w którym użytkownik może bezpośrednio rysować elementy segmentacji semantycznej, które będą reinterpretowane jako realistyczne obrazy, i które można nawet uzyskać, rysując bezpośrednio na istniejących zdjęciach.

W poniższym przykładzie użyto zdjęcia aktora Daniela Radcliffe’a jako szablonu do rysowania (i celem nie jest uzyskanie podobieństwa do niego, ale raczej ogólnie fotorealistycznego obrazu). Gdy użytkownik wypełnia różne elementy, w tym dyskretne aspekty, takie jak okulary, są one identyfikowane i interpretowane w obrazie wyjściowym:

Używanie jednego obrazu jako materiału do rysowania portretu wygenerowanego przez SofGAN. Źródło: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Używanie jednego obrazu jako materiału do rysowania portretu wygenerowanego przez SofGAN. Źródło: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Artykuł artykuł nosi tytuł SofGAN: Generator obrazu portretu z dynamicznym stylizowaniem i jest prowadzony przez Anpei Chen i Ruiyang Liu, wraz z dwoma innymi naukowcami z Uniwersytetu ShanghaiTech i jednym z Uniwersytetu Kalifornijskiego w San Diego.

Rozłączanie cech

Głównym wkładem pracy nie jest tyle zapewnienie przyjaznego interfejsu użytkownika, co raczej “rozłączanie” cech nauczonych cech twarzy, takich jak położenie i tekstura, co pozwala SofGAN na generowanie twarzy również pod kątem nieco innym niż punkt widzenia kamery.

Niezwykłe wśród generatorów twarzy opartych na sieciach GAN, SofGAN może zmieniać kąt widoku według własnego uznania, w granicach tablicy kątów obecnych w danych szkoleniowych. Źródło: https://arxiv.org/pdf/2007.03780.pdf

Niezwykłe wśród generatorów twarzy opartych na sieciach GAN, SofGAN może zmieniać kąt widoku według własnego uznania, w granicach tablicy kątów obecnych w danych szkoleniowych. Źródło: https://arxiv.org/pdf/2007.03780.pdf

Ponieważ tekstury są teraz rozłączone od geometrii, kształt twarzy i tekstura mogą być również manipulowane jako oddzielne jednostki. W efekcie pozwala to na zmianę rasy twarzy, praktykę, która ma potencjalnie użyteczne zastosowanie w tworzeniu zbiorów danych maszynowych o zrównoważonej rasowo strukturze.

SofGAN obsługuje również sztuczne starzenie i dostosowanie stylu spójnego z atrybutami na poziomie szczegółowym nie spotykanym w innych systemach segmentacji>obrazu, takich jak NVIDIA’s GauGAN i Intel’s system oparty na grach.

SofGAN może wdrożyć starzenie jako styl iteracyjny.

SofGAN może wdrożyć starzenie jako styl iteracyjny.

Inny przełom w metodologii SofGAN polega na tym, że szkolenie nie wymaga par zestawów danych segmentacji/obrazu, ale może być prowadzone bezpośrednio na nieparowych obrazach z rzeczywistości.

Naukowcy stwierdzają, że architektura “rozłączania” SofGAN została zainspirowana tradycyjnymi systemami renderowania obrazu, które rozkładają poszczególne elementy obrazu. W procesach wizualizacji elementy kompozytowe są rutynowo rozkładane na najmniejsze składniki, z specjalistami poświęconymi każdemu składowi.

Pola zajętości semantycznej (SOF)

Aby osiągnąć to w ramach szkolenia maszynowego, naukowcy opracowali pole zajętości semantycznej (SOF), rozszerzenie tradycyjnego pola zajętości, które indywidualizuje elementy składowe portretów twarzy. SOF został wyszkolony na skalibrowanych mapach segmentacji semantycznej z wielu punktów widzenia, ale bez nadzoru nad prawdą.

Wiele iteracji z jednej mapy segmentacji (dolny lewy).

Wiele iteracji z jednej mapy segmentacji (dolny lewy).

Dodatkowo, mapy segmentacji 2D są uzyskiwane przez śledzenie promieni wyjścia z SOF, zanim zostaną utworzone przez generator GAN. “Syntetyczne” mapy segmentacji semantycznej są również zakodowane w niskowymiarowej przestrzeni za pomocą trójwarstwowego kodera, aby zapewnić ciągłość wyjścia, gdy punkt widzenia jest zmieniony.

Schemat szkolenia łączy dwa losowe style dla każdego regionu semantycznego:

Architektura SofGAN.

Architektura SofGAN.

Naukowcy twierdzą, że SofGAN osiąga niższy dystans Frecheta Inception (FID) niż obecne alternatywne podejścia SOTA, a także wyższy wskaźnik podobieństwa obrazu patchów (LPIPS).

Poprzednie podejścia StyleGAN były często utrudnione przez splątanie cech, w którym elementy składające się na obraz są nierozerwalnie związane z sobą, powodując pojawienie się niepożądanych elementów wraz z pożądanym elementem (np. kolczyki mogą pojawić się, gdy kształt ucha jest renderowany, który został poinformowany w czasie szkolenia przez zdjęcie, które zawierało kolczyki).

Śledzenie promieni jest używane do obliczania objętości map segmentacji semantycznej, umożliwiając wiele punktów widzenia.

Śledzenie promieni jest używane do obliczania objętości map segmentacji semantycznej, umożliwiając wiele punktów widzenia.

Zbiory danych i szkolenie

Trzy zbiory danych zostały użyte w opracowaniu różnych wdrożeń SofGAN: CelebAMask-HQ, repozytorium 30 000 obrazów o wysokiej rozdzielczości pobranych z zestawu danych CelebA-HQ; NVIDIA’s Flickr-Faces-HQ (FFHQ), który zawiera 70 000 obrazów, gdzie naukowcy oznaczyli obrazy za pomocą wstępnie wyszkolonego parsera twarzy; oraz samodzielnie wytworzona grupa 122 skanów portretów z ręcznie oznaczonymi regionami semantycznymi.

SOF składa się z trzech szkolonych modułów – hiper-sieci, śledzenia promieni (patrz powyżej) i klasyfikatora. Generator stylu SofGAN jest skonfigurowany podobnie do StyleGAN2 w pewnych aspektach. Augmentacja danych jest stosowana za pomocą losowego skalowania i przycinania, a szkolenie zawiera regularizację ścieżki co cztery kroki. Cały proces szkolenia trwał 22 dni, aby osiągnąć 800 000 iteracji na czterech kartach graficznych RTX 2080 Ti z CUDA 10.1.

Artykuł nie wspomina o konfiguracji kart 2080, które mogą pomieścić od 11 GB do 22 GB pamięci VRAM każda, co oznacza, że łączna pamięć VRAM użyta do szkolenia SofGAN wynosi od 44 GB do 88 GB.

Naukowcy obserwują, że akceptowalne, ogólne wyniki zaczęły pojawiać się stosunkowo wcześnie w procesie szkolenia, na 1500 iteracji, trzy dni po rozpoczęciu szkolenia. Pozostała część szkolenia była poświęcona powolnemu kroczeniu ku uzyskaniu drobnych szczegółów, takich jak włosy i cechy oczu.

SofGAN ogólnie osiąga bardziej realistyczne wyniki z jednej mapy segmentacji niż rywalizujące metody, takie jak NIVDIA’s SPADE i Pix2PixHD, oraz SEAN.

Poniżej znajduje się film wydany przez naukowców. Dodatkowe filmy są dostępne na stronie projektu.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai