Kąt Andersona

Chirurgia plastyczna dla twarzy generowanych przez GAN

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
Improvements in synthetically generated (GAN) images

Nowe badania z Korei Południowej obiecują poprawić jakość syntetycznych danych twarzy tworzonych przez Generative Adversarial Networks (GAN).

System jest w stanie identyfikować artefakty obrazu wytworzone przez procesy GAN i naprawiać je, nawet do punktu zastąpienia włosÃģw, ktÃģre były zasłonięte przez czapkę, zastąpienia części twarzy całkowicie brakujących w oryginale oraz usunięcia zakryć, takich jak ręce i okulary przeciwsłoneczne, a takÅže działa dobrze na danych krajobrazowych i architektonicznych.

GAN correction

Po lewej stronie kaÅždej kolumny, oryginalny wynik GAN z wadami, a następnie dwa inne podejścia do artefaktÃģw, a na końcu metoda uÅžyta przez południowokoreańskich badaczy. ÅđrÃģdło: https://arxiv.org/pdf/2104.06118.pdf

Większość ostatnich podejść do poprawy jakości obrazÃģw generowanych przez GAN przyjęła stanowisko, Åže artefakty są zawodowym niebezpieczeństwem procesu, traktując metodologię jako “siłę natury” oraz bardziej psychodeliczne lub aberracyjne wyniki, ktÃģre moÅže wytworzyć, jako nieunikniony produkt uboczny.

Zamiast tego, południowokoreańskie badania proponują naprawdę “naprawianie” uszkodzonych obrazÃģw w sposÃģb, ktÃģry nie przeszkadza w dalszym łańcuchu generatywnym, poprzez identyfikację aspektÃģw, ktÃģre powodują artefakty, oraz redukowanie lub eliminowanie ich wpływu w sieci GAN na pÃģłnadzorowanym poziomie, ktÃģry przewyÅžsza i rozszerza rodzime mechanizmy samokorekty w architekturze GAN.

Dla projektu było konieczne stworzenie szeroko stosowanego, oznaczonego ręcznie zestawu danych obrazÃģw, ktÃģre były silnie dotknięte artefaktami GAN. Początkowo badacze uÅžyli Frechet Inception Distance (FID), metryki, ktÃģra ocenia jakość wynikÃģw GAN, porÃģwnując cechy w obrazach, jako jednostki kwalifikującej. 10 000 obrazÃģw z najwyÅžszymi wynikami FID wśrÃģd 200 000 obrazÃģw zostało uÅžytych jako dyskretne “jednostki artefaktÃģw”. Następnie badacze oznaczyli ręcznie 2000 wygenerowanych obrazÃģw, klasyfikując je jako “normalne” lub dotknięte artefaktami FID. Następnie został stworzony model do klasyfikacji zestawu danych na artefakt, normalny i losowe prÃģbki z rzeczywistego świata.

Po tym, Gradient-weighted Class Activation Mapping (Grad-CAM) zostało uÅžyte do generowania masek dla obszarÃģw dotkniętych artefaktami, skutecznie automatyzując oznaczanie wad.

Grad-CAM masks

Na powyÅžszym obrazie, maski Grad-CAM zostały zastosowane do wynikÃģw z LSUN-Church outdoor zestawu danych i CelebA-HQ zestawu danych.

Poprzez analizę 20 najbardziej dotkniętych wynikÃģw z 20 000 obrazÃģw, generowane są maski segmentacyjne, w ktÃģre mogą być wprowadzane wyniki reprezentatywne dla generacji (ktÃģre są bardziej prawdopodobne, aby były dokładniejsze lub bardziej przekonywujące niÅž artefakty), poprzez obniÅženie aktywacji jednostek wytwarzających artefakty w następnych generacjach.

Ocena ludzka korekt wyniosła, Åže 53% “naprawionych” obrazÃģw zostało oznaczonych jako “normalne”, podczas gdy 97% oryginalnych obrazÃģw nadal wykazuje znaczne poprawy w porÃģwnaniu z oryginałami.

Badacze twierdzą, Åže ta metoda, z pewnymi nieznacznymi modyfikacjami, moÅže być rÃģwnieÅž dostosowana do NVIDIA’s StyleGAN2.

GAN glasses removal

Korzyści syntetycznych danych

Przede wszystkim w odniesieniu do danych twarzy, ogÃģlny brak rzeczywistych zestawÃģw danych dla widzenia komputerowego jest przeszkodą w rÃģÅžnorodnych badaniach waÅžnych sektorach, takich jak rozpoznawanie twarzy, rozpoznawanie emocji, badania medyczne i studia nad bardziej szczegÃģłową segmentacją topologii twarzy, wśrÃģd innych dziedzin.

BieŞąca reakcja na wolne uÅžywanie danych internetowych i ad hoc zbieranie rzeczywistych obrazÃģw twarzy do włączenia do baz danych twarzy jest dodatkową przeszkodą w badaniach, z rosnącą liczbą stanÃģw i narodÃģw zaostrzających pobieranie danych z internetu, oraz przywłaszczanie obrazÃģw z mediÃģw społecznościowych do tych celÃģw.

W ciągu ostatnich dziesięciu lat, ograniczona liczba starannie wyselekcjonowanych zestawÃģw danych twarzy oferowała schronienie przed tego rodzaju niepewnością, z rÃģÅžnymi corocznymi publicznymi wyzwaniami badawczymi skupionymi wokÃģł nich. Jednak to spowodowało, Åže projekty badawcze skłaniają się ku modyfikowaniu swoich metodologii specjalnie w celu dostosowania się do tych zestawÃģw danych, z uzyskaniem ciągłych i porÃģwnywalnych wynikÃģw rok w rok, przy wysokiej cenie braku rÃģÅžnorodności w materiale ÅšrÃģdłowym – sytuacja, ktÃģra pogarsza się kaÅždego roku, gdy nowe badania ograniczają się do tych samych granic.

Dodatkowo, niektÃģre z tych “tradycyjnych” zestawÃģw danych zostały skrytykowane za brak rÃģÅžnorodności rasowej, co sugeruje, Åže te benchmarkowe filary mogą nie być uwaÅžane za odpowiednie zasoby w najbliÅžszej przyszłości.

To oznacza potrzebę wysokiej jakości danych twarzy, ktÃģre są realistyczne, ale gdzie “rzeczywiste” obrazy zostały przekształcone daleko poza rozpoznanie. Nawet jeśli to uÅžycie “rzeczywistych” danych twarzy “z jednego poziomu” moÅže samoczynnie wywołać problemy z pochodzeniem twarzy generowanych przez GAN, jest to przeszkoda, ktÃģra nie jest prawdopodobna do pojawienia się, dopÃģki nie zostaną ustanowione prawne i techniczne mechanizmy dla tego rodzaju zbierania danych; oraz, w odniesieniu do moÅžliwych zmian w ramach prawnych wokÃģł tej kwestii, jest to nadal mniejsze niebezpieczeństwo niÅž uÅžywanie obrazÃģw prawdziwych ludzi.

Czytaj dalej:

Poprawa realizmu syntetycznych obrazÃģw
Automatyczna korekta wewnętrznych jednostek w generatywnych sieciach neuronowych

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]