Kąt Andersona
Sektor syntezy obrazu przyjął wadliwy wskaźnik, twierdzą badacze

Rok 2021 był rokiem bezprecedensowego postępu i zawrotnej liczby publikacji w sektorze syntezy obrazu, oferując strumień nowych innowacji i ulepszeń w technologiach, które są w stanie odtwarzać ludzkie osobowości za pomocą renderowania neuronalnego, deepfakes i wielu nowych podejść.
Jednak badacze z Niemiec twierdzą, że standard stosowany do automatycznego oceniania realizmu syntetycznych obrazów jest śmiertelnie wadliwy; i że setki, a nawet tysiące badaczy na całym świecie, którzy polegają na nim, aby zredukować koszty drogich wyników oceny opartej na ludziach, mogą iść za ślepo.
Aby zademonstrować, jak standard, Fréchet Inception Distance (FID), nie spełnia ludzkich standardów oceny obrazów, badacze wdrożyli własne GAN-y, zoptymalizowane do FID (obecnie powszechny wskaźnik). Stwierdzili, że FID podąża za własnymi obsesjami, opartymi na podstawowym kodzie o bardzo odmiennym założeniu niż synteza obrazu, i że rutynowo nie osiąga “ludzkiego” standardu rozeznania:

Wyniki FID (im niższy, tym lepiej) dla obrazów wygenerowanych przez różne modele przy użyciu standardowych zestawów danych i architektur. Badacze nowego artykułu zadają pytanie ‘Czy zgadzacie się z tymi rankingami?’. Źródło: https://openreview.net/pdf?id=mLG96UpmbYz
Ponadto artykuł sugeruje, że “oczywiste” rozwiązania, takie jak zamiana silnika wewnętrznego na konkurencyjne silniki, po prostu zamienią jeden zestaw uprzedzeń na inny. Autorzy sugerują, że teraz należy do nowych inicjatyw badawczych opracować lepsze wskaźniki do oceny “autentyczności” w syntetycznie wygenerowanych zdjęciach.
Artykuł artykuł pt. Internalized Biases in Fréchet Inception Distance, pochodzi od Steffena Junga z Max Planck Institute for Informatics at Saarland, i Margret Keuper, profesora Visual Computing na Uniwersytecie w Siegen.
Poszukiwanie systemu oceniania syntezy obrazu
Jak zauważa nowy artykuł, postęp w ramach syntezy obrazu, takich jak GAN-y i architektury encoder/decoder, wyprzedził metody, którymi można ocenić wyniki tych systemów. Poza tym, że są drogie i dlatego trudne do skalowania, ocena wyników tych systemów przez ludzi nie oferuje empirycznego i powtarzalnego sposobu oceny.
Dlatego wiele ram metrycznych pojawiło się, w tym Inception Score (IS), przedstawiony w artykule z 2016 roku Improved Techniques for Training GANs, współautorem którego jest Ian Goodfellow, wynalazca GAN-ów.
Uznania IS score jako powszechnie stosowanego wskaźnika dla wielu sieci GAN w 2018 roku doprowadziło do powszechnego przyjęcia FID w społeczności syntezy obrazu GAN. Jednak podobnie jak Inception Score, FID opiera się na sieci klasyfikacji obrazów Google Inception v3 (IV3).
Autorzy nowego artykułu twierdzą, że Fréchet Inception Distance propaguje szkodliwe uprzedzenia w IV3, prowadząc do niepewnej klasyfikacji jakości obrazu.
Ponieważ FID można włączyć do ramienia uczenia maszynowego jako dyskryminator (zawarty “sędzia”, który decyduje, czy GAN radzi sobie dobrze, czy powinien “spróbować ponownie”), musi on dokładnie reprezentować standardy, które osoba stosowałaby podczas oceny obrazów.
Fréchet Inception Distance
FID porównuje, jak funkcje są rozłożone w zestawie danych szkoleniowych użytych do utworzenia modelu GAN (lub podobnej funkcjonalności) i wyników tego systemu.
W związku z tym, jeśli ramiona GAN są szkolone na 10 000 obrazów (np. sławnych), FID porównuje oryginalne (rzeczywiste) obrazy z fałszywymi obrazami wygenerowanymi przez GAN. Im niższy wynik FID, tym bliżej GAN zbliżył się do “fotorealistycznych” obrazów, według kryteriów FID.

Z artykułu, wyniki GAN szkolonych na FFHQ64, podzbiór popularnego zestawu danych NVIDIA FFHQ. Tutaj, chociaż wynik FID jest niski, wyniki nie są przyjemne ani przekonywujące dla przeciętnego człowieka.
Problem, twierdzą autorzy, polega na tym, że Inception v3, którego założenia napędzają Fréchet Inception Distance, nie patrzy w odpowiednich miejscach – przynajmniej nie w przypadku zadania, które ma na celu.
Inception V3 jest szkolony na ImageNet object recognition challenge, zadaniu, które jest prawdopodobnie sprzeczne z tym, jak cele syntezy obrazu ewoluowały w ostatnich latach. IV3 wyzwala wytrzymałość modelu, wykonując augmentację danych: losowo odwraca obrazy, przycina je do losowej skali między 8-100%, zmienia proporcje (w zakresie od 3/4 do 4/3) i losowo wstrzykuje zaburzenia koloru związane z jasnością, nasyceniem i kontrastem.
Niemieccy badacze odkryli, że IV3 ma tendencję do faworyzowania ekstrakcji krawędzi i tekstur, a nie informacji o kolorze i intensywności, które byłyby bardziej znaczącymi wskaźnikami autentyczności dla syntetycznych obrazów; i że jego pierwotne zadanie wykrywania obiektów zostało niewłaściwie przeniesione na niewłaściwe zadanie. Autorzy stwierdzają*:
‘[Inception v3] ma uprzedzenie do ekstrakcji funkcji opartych na krawędziach i teksturach, a nie informacji o kolorze i intensywności. To odpowiada jego potokowi augmentacji, który wprowadza zaburzenia koloru, ale zachowuje informacje o wysokiej częstotliwości (w przeciwieństwie na przykład do augmentacji z rozmyciem Gaussa).
‘W związku z tym FID dziedziczy to uprzedzenie. Gdy używany jako wskaźnik rankingowy, generatywne modele, które dobrze odtwarzają tekstury, mogą być preferowane nad modelami, które dobrze odtwarzają rozkłady koloru.’
Dane i metoda
Aby przetestować swoją hipotezę, autorzy przeszkolili dwie architektury GAN, DCGAN i SNGAN, na zestawie danych NVIDIA FFHQ human face dataset, zmniejszonym do rozdzielczości obrazu 642, z pochodnym zestawem danych o nazwie FFHQ64.
Trzy procedury szkolenia GAN zostały przeprowadzone: GAN G+D, standardowa sieć dyskryminacyjna; GAN FID|G+D, gdzie FID pełni funkcję dodatkowego dyskryminatora; i GAN FID|G, gdzie GAN jest całkowicie napędzany przez wynik FID.
Technicznie, autorzy zauważają, że strata FID powinna stabilizować szkolenie i potencjalnie nawet całkowicie zastąpić dyskryminator (jak to ma miejsce w #3, GAN FID|G), podczas gdy wyniki są przyjemne dla ludzi.
W praktyce wyniki są dość odmienne, z – autorzy hipotezują – modelami FID “przeuczeniem” na złe wskaźniki. Badacze zauważają:
‘Hipotezujemy, że generator uczy się wytwarzać niewłaściwe funkcje, aby dopasować się do rozkładu danych szkoleniowych. To obserwacja staje się bardziej dotkliwa w przypadku [GAN FID|G]. Tutaj zauważamy, że brak dyskryminatora prowadzi do przestrzennie niespójnych rozkładów funkcji. Na przykład [SNGAN FID|G] dodaje głównie pojedyncze oczy i wyrównuje cechy twarzy w przerażający sposób.’
Autorzy kończą*:
‘Podczas gdy ludzcy anotatorzy z pewnością woleliby obrazy wygenerowane przez SNGAN D+G nad SNGAN FID|G (w przypadkach, w których preferowana jest wierność danych nad sztuką), widzimy, że to nie jest odzwierciedlone przez FID. FID nie jest zgodny z ludzką percepcją.
‘Utrzymujemy, że dyskryminacyjne funkcje dostarczane przez sieci klasyfikacji obrazów nie są wystarczające, aby stanowić podstawę znaczącego wskaźnika.’
Brak łatwych alternatyw
Autorzy również odkryli, że zamiana Inception V3 na podobny silnik nie rozwiązała problemu. W substytucji IV3 z “obszernym wyborem różnych sieci klasyfikacji”, które zostały przetestowane wobec ImageNet-C (podzbiór ImageNet zaprojektowany do benchmarkowania powszechnie generowanych korupcji i perturbacji w obrazach wyjściowych z ramion syntezy obrazu), badacze nie mogli znacząco poprawić swoich wyników:
‘[Uprzedzenia] obecne w Inception v3 są również powszechnie obecne w innych sieciach klasyfikacji. Dodatkowo widzimy, że różne sieci wygenerują różne rankingi między typami korupcji.’
Autorzy kończą artykuł z nadzieją, że trwające badania opracują “ludzko zgodny i bezstronny wskaźnik” zdolny do umożliwienia uczciwszego rankingu architektur generatorów obrazu.
* Kursywa autorów.
Pierwotnie opublikowane 20 grudnia 2021, 13:00 GMT+2.













