Modele i platformy AI
Chirurgia plastyczna dla twarzy generowanych przez GAN

Nowe badania z Korei Południowej obiecują poprawić jakość syntetycznych danych twarzy tworzonych przez Generative Adversarial Networks (GAN).
System jest w stanie identyfikować artefakty obrazu wytworzone przez procesy GAN i naprawiać je, nawet do punktu zastąpienia włosów, które były zasłonięte przez czapkę, zastąpienia części twarzy całkowicie brakujących w oryginale oraz usunięcia zakryć, takich jak ręce i okulary przeciwsłoneczne, a także działa dobrze na danych krajobrazowych i architektonicznych.

Po lewej stronie każdej kolumny, oryginalny wynik GAN z wadami, a następnie dwa inne podejścia do artefaktów, a na końcu metoda użyta przez południowokoreańskich badaczy. Źródło: https://arxiv.org/pdf/2104.06118.pdf
Większość ostatnich podejść do poprawy jakości obrazów generowanych przez GAN przyjęła stanowisko, że artefakty są zawodowym niebezpieczeństwem procesu, traktując metodologię jako “siłę natury” oraz bardziej psychodeliczne lub aberracyjne wyniki, które może wytworzyć, jako nieunikniony produkt uboczny.
Zamiast tego, południowokoreańskie badania proponują naprawdę “naprawianie” uszkodzonych obrazów w sposób, który nie przeszkadza w dalszym łańcuchu generatywnym, poprzez identyfikację aspektów, które powodują artefakty, oraz redukowanie lub eliminowanie ich wpływu w sieci GAN na półnadzorowanym poziomie, który przewyższa i rozszerza rodzime mechanizmy samokorekty w architekturze GAN.
Dla projektu było konieczne stworzenie szeroko stosowanego, oznaczonego ręcznie zestawu danych obrazów, które były silnie dotknięte artefaktami GAN. Początkowo badacze użyli Frechet Inception Distance (FID), metryki, która ocenia jakość wyników GAN, porównując cechy w obrazach, jako jednostki kwalifikującej. 10 000 obrazów z najwyższymi wynikami FID wśród 200 000 obrazów zostało użytych jako dyskretne “jednostki artefaktów”. Następnie badacze oznaczyli ręcznie 2000 wygenerowanych obrazów, klasyfikując je jako “normalne” lub dotknięte artefaktami FID. Następnie został stworzony model do klasyfikacji zestawu danych na artefakt, normalny i losowe próbki z rzeczywistego świata.
Po tym, Gradient-weighted Class Activation Mapping (Grad-CAM) zostało użyte do generowania masek dla obszarów dotkniętych artefaktami, skutecznie automatyzując oznaczanie wad.
Na powyższym obrazie, maski Grad-CAM zostały zastosowane do wyników z LSUN-Church outdoor zestawu danych i CelebA-HQ zestawu danych.
Poprzez analizę 20 najbardziej dotkniętych wyników z 20 000 obrazów, generowane są maski segmentacyjne, w które mogą być wprowadzane wyniki reprezentatywne dla generacji (które są bardziej prawdopodobne, aby były dokładniejsze lub bardziej przekonywujące niż artefakty), poprzez obniżenie aktywacji jednostek wytwarzających artefakty w następnych generacjach.
Ocena ludzka korekt wyniosła, że 53% “naprawionych” obrazów zostało oznaczonych jako “normalne”, podczas gdy 97% oryginalnych obrazów nadal wykazuje znaczne poprawy w porównaniu z oryginałami.
Badacze twierdzą, że ta metoda, z pewnymi nieznacznymi modyfikacjami, może być również dostosowana do NVIDIA’s StyleGAN2.
Korzyści syntetycznych danych
Przede wszystkim w odniesieniu do danych twarzy, ogólny brak rzeczywistych zestawów danych dla widzenia komputerowego jest przeszkodą w różnorodnych badaniach ważnych sektorach, takich jak rozpoznawanie twarzy, rozpoznawanie emocji, badania medyczne i studia nad bardziej szczegółową segmentacją topologii twarzy, wśród innych dziedzin.
Bieżąca reakcja na wolne używanie danych internetowych i ad hoc zbieranie rzeczywistych obrazów twarzy do włączenia do baz danych twarzy jest dodatkową przeszkodą w badaniach, z rosnącą liczbą stanów i narodów zaostrzających pobieranie danych z internetu, oraz przywłaszczanie obrazów z mediów społecznościowych do tych celów.
W ciągu ostatnich dziesięciu lat, ograniczona liczba starannie wyselekcjonowanych zestawów danych twarzy oferowała schronienie przed tego rodzaju niepewnością, z różnymi corocznymi publicznymi wyzwaniami badawczymi skupionymi wokół nich. Jednak to spowodowało, że projekty badawcze skłaniają się ku modyfikowaniu swoich metodologii specjalnie w celu dostosowania się do tych zestawów danych, z uzyskaniem ciągłych i porównywalnych wyników rok w rok, przy wysokiej cenie braku różnorodności w materiale źródłowym – sytuacja, która pogarsza się każdego roku, gdy nowe badania ograniczają się do tych samych granic.
Dodatkowo, niektóre z tych “tradycyjnych” zestawów danych zostały skrytykowane za brak różnorodności rasowej, co sugeruje, że te benchmarkowe filary mogą nie być uważane za odpowiednie zasoby w najbliższej przyszłości.
To oznacza potrzebę wysokiej jakości danych twarzy, które są realistyczne, ale gdzie “rzeczywiste” obrazy zostały przekształcone daleko poza rozpoznanie. Nawet jeśli to użycie “rzeczywistych” danych twarzy “z jednego poziomu” może samoczynnie wywołać problemy z pochodzeniem twarzy generowanych przez GAN, jest to przeszkoda, która nie jest prawdopodobna do pojawienia się, dopóki nie zostaną ustanowione prawne i techniczne mechanizmy dla tego rodzaju zbierania danych; oraz, w odniesieniu do możliwych zmian w ramach prawnych wokół tej kwestii, jest to nadal mniejsze niebezpieczeństwo niż używanie obrazów prawdziwych ludzi.
Czytaj dalej:
Poprawa realizmu syntetycznych obrazów
Automatyczna korekta wewnętrznych jednostek w generatywnych sieciach neuronowych














