Kąt Andersona

Rozszerzenie Adobe Research: Latent-to-Latent GAN Traversal do edycji twarzy

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nie jest trudno zrozumieć, dlaczego splątanie jest problemem w syntezie obrazu, ponieważ jest to często problem w innych dziedzinach życia; na przykład znacznie trudniej jest usunąć kurkumę z curry niż wyjąć ogórek z burgera, a praktycznie niemożliwe jest odświeżenie filiżanki kawy. Niektóre rzeczy po prostu przychodzą w pakiecie.

Podobnie splątanie jest przeszkodą dla architektur syntezowania obrazu, które chciałyby oddzielić różne funkcje i pojęcia podczas używania uczenia maszynowego do tworzenia lub edycji twarzy (lub psów, łodzi lub innych dziedzin).

Jeśli można by oddzielić takie elementy, jak wiek, płeć, kolor włosów, ton skóry, emocja i tak dalej, można by mieć początek prawdziwej instrumentalności i elastyczności w ramach, które mogłyby tworzyć i edytować obrazy twarzy na naprawdę drobnym poziomie, bez ciągnięcia niechcianych “pasażerów” do tych konwersji.

Przy maksymalnym splątaniu (powyżej po lewej), można tylko zmienić obraz sieci GAN na obraz innej osoby.

To jest tak naprawdę używanie najnowszej technologii komputerowego widzenia, aby osiągnąć coś, co zostało rozwiązane innymi sposobami ponad trzydzieści lat temu.

Przy pewnym stopniu separacji (‘Średnia separacja’ w wcześniejszym powyższym obrazie), można wykonać zmiany oparte na stylu, takie jak kolor włosów, wyrażenie, aplikacja kosmetyczna i ograniczona rotacja głowy, wśród innych.

Źródło: FEAT: Face Editing with Attention, luty 2022, https://arxiv.org/pdf/2202.02713.pdf

Źródło: FEAT: Face Editing with Attention, luty 2022, https://arxiv.org/pdf/2202.02713.pdf

W ciągu ostatnich dwóch lat było wiele prób stworzenia interaktywnych środowisk edycji twarzy, które umożliwiają użytkownikowi zmianę cech twarzy za pomocą suwaków i innych tradycyjnych interakcji UI, przy zachowaniu podstawowych cech twarzy docelowej podczas dodawania lub zmian. Jednak okazało się to wyzwaniem ze względu na splątanie funkcji/stylu w przestrzeni latentnej GAN.

Na przykład cecha okulary jest często spleciona z cechą wiek, co oznacza, że dodanie okularów może również “zestarzeć” twarz, a starzenie twarzy może dodać okulary, w zależności od stopnia zastosowanej separacji wysokopoziomowych funkcji (patrz “Testowanie” poniżej dla przykładów).

Najbardziej godne uwagi jest to, że było prawie niemożliwe zmienić kolor włosów i inne aspekty włosów bez ponownego obliczania włosów i ich ułożenia, co daje “szum” efekt.

Źródło: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Źródło: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Latent-to-Latent GAN Traversal

Nowy artykuł opublikowany przez Adobe został wprowadzony na WACV 2022 i oferuje nowe podejście do tych podstawowych problemów w artykule zatytułowanym Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images.

Materiał uzupełniający z artykułu Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Tutaj widzimy, że podstawowe cechy twarzy nie są wciągane do niezwiązanych zmian. Zobacz pełne wideo na końcu artykułu, aby uzyskać lepsze szczegóły i rozdzielczość. Źródło: https://www.youtube.com/watch?v=rf_61llRH0Q

Materiał uzupełniający z artykułu Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Tutaj widzimy, że podstawowe cechy twarzy nie są wciągane do niezwiązanych zmian. Zobacz pełne wideo na końcu artykułu, aby uzyskać lepsze szczegóły i rozdzielczość. Źródło: https://www.youtube.com/watch?v=rf_61llRH0Q

Artykuł jest interesujący, ponieważ Adobe działa w tej dziedzinie od jakiegoś czasu, i jest kuszące wyobrazić sobie tę funkcjonalność w projekcie Creative Suite w ciągu najbliższych kilku lat; ale głównie dlatego, że architektura stworzona dla tego projektu przyjmuje inne podejście do utrzymania integralności wizualnej w edytorze twarzy GAN podczas aplikowania zmian.

Autorzy deklarują:

‘[My] trenujemy sieć neuronową, aby wykonać transformację latent-to-latent, która znajduje kodowanie latentne odpowiadające obrazowi z zmienioną cechą. Ponieważ ta technika jest jednorazowa, nie polega na liniowej lub nieliniowej trajektorii stopniowej zmiany cech.

‘Przez trenowanie sieci neuronowej na całej przestrzeni generacyjnej, system może dostosować się do przestrzeni latentnych architektur generatorów. Własności konserwatywne, takie jak utrzymanie tożsamości osoby, mogą być zakodowane w postaci strat treningowych.

‘Gdy sieć latent-to-latent została wytrenowana, może być ponownie wykorzystana dla dowolnych obrazów bez ponownego trenowania.’

To ostatnie oznacza, że proponowana architektura przychodzi z użytkownikiem w stanie gotowym. Nadal wymaga uruchomienia sieci neuronowej na lokalnych zasobach, ale nowe obrazy mogą być “wstawione” i gotowe do modyfikacji niemal natychmiast, ponieważ ramy są wystarczająco odłączone, aby nie wymagać dalszego treningu specyficznego dla obrazu.

Płeć i włosy twarzy zmienione, gdy suwaki wykreślają losowe i dowolne ścieżki przez przestrzeń latentną, nie tylko 'przesuwając się między punktami końcowymi'.

Płeć i włosy twarzy zmienione, gdy suwaki wykreślają losowe i dowolne ścieżki przez przestrzeń latentną, nie tylko ‘przesuwając się między punktami końcowymi’. Zobacz wideo na końcu artykułu, aby uzyskać więcej transformacji w lepszej rozdzielczości.

Wśród głównych osiągnięć w tej pracy jest zdolność sieci do “zamrożenia” tożsamości w przestrzeni latentnej przez zmianę tylko cechy w wektorze docelowym i dostarczanie “korekt”, które zachowują tożsamości podczas transformacji.

Podstawowo proponowana sieć jest osadzona w szerszej architekturze, która aranżuje wszystkie przetworzone elementy, które przechodzą przez wstępnie wytrenowane komponenty z zamrożonymi wagami, które nie wywołają niepożądanych efektów bocznych na transformacjach.

Ponieważ proces treningu opiera się na triplach, które mogą być wygenerowane albo przez obraz-początkowy (pod odwrotnością GAN) albo istniejącym początkowym kodowaniem latentnym, cały proces treningu jest nienadzorowany, z tymi samymi działaniami standardowych systemów etykietowania i kuracji w takich systemach skutecznie wbudowanymi w architekturę. W rzeczywistości nowy system wykorzystuje gotowe regresory atrybutów:

‘[Liczba atrybutów, których nasza sieć może niezależnie kontrolować, jest ograniczona tylko przez możliwości rozpoznawania – jeśli masz rozpoznawanie atrybutu, możesz dodać go do dowolnych twarzy. W naszych eksperymentach wytrenowaliśmy sieć latent-to-latent, aby umożliwić dostosowanie 35 różnych cech twarzy, więcej niż jakikolwiek poprzedni podejście.’

System obejmuje dodatkową ochronę przed niepożądanymi “skutkami ubocznymi” transformacji: w przypadku braku prośby o zmianę atrybutu, sieć latent-to-latent mapuje wektor latentny na siebie, zwiększając stabilność trwałości tożsamości docelowej.

Rozpoznawanie twarzy

Jednym z powtarzających się problemów z edytorami twarzy GAN i architekturami opartymi na kodowaniu/dekodowaniu w ciągu ostatnich kilku lat było to, że zastosowane transformacje tendencję do degradacji podobieństwa. Aby temu przeciwdziałać, projekt Adobe wykorzystuje osadzoną sieć rozpoznawania twarzy o nazwie FaceNet jako dyskryminator.

Architektura projektu, zobacz dolną część po lewej stronie, aby zobaczyć włączenie FaceNet. Źródło: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.

Architektura projektu, zobacz dolną część po lewej stronie, aby zobaczyć włączenie FaceNet. Source: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.

(Z osobistej notatki, wydaje się to zachęcającym posunięciem w kierunku integracji standardowych systemów rozpoznawania twarzy i nawet rozpoznawania wyrażeń w sieciach generatywnych, co jest najbardziej obiecującym sposobem pokonania ślepego mapowania piksel-piksel, które dominuje w obecnych architekturach deepfake, kosztem wiernego wyrażenia i innych ważnych dziedzin w generowaniu twarzy.)

Dostęp do wszystkich obszarów w przestrzeni latentnej

Inną imponującą cechą ramy jest jej zdolność do podróżowania dowolnie między potencjalnymi transformacjami w przestrzeni latentnej, według uznania użytkownika. Kilka poprzednich systemów, które zapewniały eksploracyjne interfejsy, często pozostawiało użytkownika, który mógł “przesuwać się” między ustalonymi trasami transformacji funkcji – imponujące, ale często dość liniowe lub proskryptywne doświadczenie.

Z Improving GAN Equilibrium by Raising Spatial Awareness: tutaj użytkownik przesuwa się przez zakres potencjalnych punktów przejściowych między dwoma lokalizacjami w przestrzeni latentnej, ale w ramach wstępnie wytrenowanych lokalizacji w przestrzeni latentnej. Aby zastosować inne rodzaje transformacji na podstawie tego samego materiału, konieczna jest rekonfiguracja i/lub ponowne trenowanie. Źródło: https://genforce.github.io/eqgan/

Z Improving GAN Equilibrium by Raising Spatial Awareness: tutaj użytkownik przesuwa się przez zakres potencjalnych punktów przejściowych między dwoma lokalizacjami w przestrzeni latentnej, ale w ramach wstępnie wytrenowanych lokalizacji w przestrzeni latentnej. Aby zastosować inne rodzaje transformacji na podstawie tego samego materiału, konieczna jest rekonfiguracja i/lub ponowne trenowanie. Źródło: https://genforce.github.io/eqgan/

Ponadto użytkownik może ręcznie “zamrozić” elementy, które chce zachować podczas procesu transformacji. W ten sposób użytkownik może upewnić się, że (na przykład) tła nie zmieniają się, lub że oczy są utrzymywane otwarte lub zamknięte.

Dane

Sieć regresji atrybutów została wytrenowana na trzech sieciach: FFHQ, CelebAMask-HQ i lokalnej sieci wygenerowanej przez GAN, uzyskanej przez pobranie 400 000 wektorów z przestrzeni Z StyleGAN-V2.

Obrazy poza dystrybucją (OOD) zostały odfiltrowane, a atrybuty wyodrębnione przy użyciu Face API firmy Microsoft, a wynikowy zestaw obrazów został podzielony na 90/10, pozostawiając 721 218 obrazów treningowych i 72 172 obrazy testowe do porównania.

Testowanie

Chociaż sieć eksperymentalna była początkowo skonfigurowana do obsługi 35 potencjalnych transformacji, zostały one zredukowane do ośmiu w celu przeprowadzenia analogicznych testów w porównaniu z porównywalnymi ramami InterFaceGAN, GANSpace i StyleFlow.

Osiem wybranych atrybutów to wiek, łysina, brodawka, wyrażenie, płeć, okulary, pitch i yaw. Było konieczne przystosowanie ram porównawczych do niektórych z tych ośmiu atrybutów, które nie były obsługiwane w oryginalnej dystrybucji, takich jak dodanie łysiny i brodawki do InterFaceGAN.

Jak się spodziewano, większy stopień splątania wystąpił w rywalizujących architekturach. Na przykład w jednym teście InterFaceGAN i StyleFlow obie zmieniły płeć osoby, gdy poproszono o zastosowanie wieku:

Dwie z porównywalnych ram włączyły zmianę płci do transformacji 'wiek', a także zmieniły kolor włosów bez bezpośredniego polecenia użytkownika.

Dwie z porównywalnych ram włączyły zmianę płci do transformacji ‘wiek’, a także zmieniły kolor włosów bez bezpośredniego polecenia użytkownika.

Ponadto dwie z rywali stwierdziły, że okulary i wiek są nierozdzielonymi aspektami:

Okulary i kolor włosów zmienione bez dodatkowych kosztów!

Okulary i kolor włosów zmienione bez dodatkowych kosztów!

Nie jest to jednolite zwycięstwo dla badania: jak widać w dołączonym wideo na końcu artykułu, ramy są najmniej skuteczne, gdy próbują ekstrapolować różne kąty (yaw), podczas gdy GANSpace ma lepszy ogólny wynik dla wieku i nałożenia okularów. Ramy latent-to-latent związane z GANSpace i StyleFlow w odniesieniu do dodania pitch (kąt głowy).

Wyniki obliczone na podstawie kalibracji detektora twarzy MTCNN. Niższe wyniki są lepsze.

Wyniki obliczone na podstawie kalibracji detektora twarzy MTCNN. Niższe wyniki są lepsze.

Dla dalszych szczegółów i lepszej rozdzielczości przykładów zobacz dołączone wideo poniżej.

 

Pierwotnie opublikowane 16 lutego 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai