Andersonin kulma
Kuvasynteesin osa-ala on omaksunut virheellisen mittarin, tutkimus väittää

Vuosi 2021 on ollut kuvasynteesin osa-alalla ennennäkemätöntä edistystä ja julkaisujen määrä on ollut valtava, tarjoten uusia innovaatioita ja parannuksia tekniikoissa, jotka pystyvät jäljittelemään ihmisten persoonallisuutta neuraalisen renderöinnin, deepfaken ja joukon uusia lähestymistapoja kautta.
Tutkijat Saksasta väittävät kuitenkin, että kuvasynteesin tuloksien automaattiseen arviointiin käytettävä mittari on kuolemansaasti virheellinen, ja että tuhannet tutkijat ympäri maailmaa, jotka luottavat siihen kalliiden ihmisten tekemien tulosten arvioinnin kustannuksien vähentämiseksi, voivat olla menossa umpikujaan.
Jotta voidaan osoittaa, miten mittari, Fréchet Inception Distance (FID), ei vastaa ihmisten standardeja kuvien arvioinnissa, tutkijat käyttivät omia GAN-mallejaan, jotka on optimoitu FID:lle (josta on tullut yleinen mittari). He löysivät, että FID seuraa omia pakkomielteitä, jotka perustuvat alustavan koodin erilaiseen tehtävään kuin kuvasynteesi, ja että se epäonnistuu säännöllisesti “ihmisen” tason tarkkuudessa:

FID-pisteet (alemmat ovat parempia) eri mallien tuottamille kuville, joita on käytetty standardi-aineistoissa ja -arkkitehtuureissa. Tutkimuksen tekijät esittävät kysymyksen ‘Oletko samaa mieltä näiden kanssa?’. Lähde: https://openreview.net/pdf?id=mLG96UpmbYz
Lisäksi siinä, että paperi väittää, että FID ei ole sopiva tehtäväänsä, se ehdottaa myös, että “ilmeiset” korjaukset, kuten vaihtaminen kilpailevaan moottoriin, vain vaihtavat yhden joukon harhoja toiseen. Tutkijat ehdottavat, että se kuuluu uusille tutkimushankkeille kehittää parempia mittareita kuvien “aidoille” arvioinnille.
Tutkimus on nimeltään Internalized Biases in Fréchet Inception Distance, ja se on tehty Steffen Jungin ja Margret Keuperin toimesta Max Planck -instituutissa informaatiotekniikassa Saarlandissa ja professori Visual Computingissa Siegenin yliopistossa.
Kuvasynteesin pisteytysjärjestelmän etsintä
Kuten uusi tutkimus toteaa, edistysaskelten määrä kuvasynteesin kehyksissä, kuten GAN- ja encoder/decoder-arkkitehtuureissa, on ylittänyt menetelmien kehittämisen, joilla tuloksia voidaan arvioida. Ihmisten arviointi näiden järjestelmien tuloksista on kallista ja siten vaikeaa skaalata, ja se ei tarjoa empiiristä ja toistettavaa arviointimenetelmää.
Tästä syystä useita mittauskehyksiä on kehitetty, mukaan lukien Inception Score (IS), joka esiteltiin vuoden 2016 tutkimuksessa Improved Techniques for Training GANs, jonka tekijöihin kuului GAN:n keksijä Ian Goodfellow.
Inception Scoren mitätöinti laajasti sovellettavaksi mittariksi useille GAN-verkoille vuonna 2018 johti laajaan FID:n käyttöön GAN-kuvasynteesiyhteisössä. Kuitenkin, kuten Inception Score, FID perustuu Googleen Inception v3 -kuva-luokitteluverkkoon (IV3).
Tutkimuksen tekijät väittävät, että Fréchet Inception Distance välittää vahingollisia harhoja IV3:sta, johtuen epäluotettavasta kuvanlaadun luokittelusta.
Saksalaiset tutkijat ovat havainneet, että IV3 suosii reunien ja tekstuurien poimimista värien ja intensiteettitiedon sijaan, mikä olisi merkittävämpiä todellisuudenmukaisuuden mittareita kuvasynteesille; ja että sen alkuperäinen tarkoitus oli esineen havaitseminen, joka on sopimaton tehtäväksi.
Tutkijat toteavat*:
‘[Inception v3] suosii reunien ja tekstuurien perusteella tapahtuvaa piirtämistä värien ja intensiteettitiedon sijaan. Tämä vastaa sen augmentaatioputkistoa, joka esittää värihaittoja, mutta pitää korkeataajuista tietoa koskemattomana (toisin kuin esimerkiksi Gaussian blur -augmentaatio).
‘Seurauksena, FID peri tämän harhan. Kun käytetään luokittelumittarina, generatiiviset mallit, jotka jäljittelevät tekstuurit hyvin, voivat olla suositeltavampia kuin mallit, jotka jäljittelevät värijakautumia hyvin.’
Fréchet Inception Distance
FID vertaa, miten piirteet ovat jakautuneet koulutusaineistossa, jota käytetään GAN-mallin (tai vastaavan toiminnon) luomiseen, ja tuloksista, joita tämä järjestelmä tuottaa.
Tämän vuoksi, jos GAN-kehys on koulutettu 10 000 kuvan aineistolla (esim. julkkiksista), FID vertaa alkuperäisiä (oikeita) kuvia GAN:n tuottamiin kuvien. Mitä alempi FID-piste on, sitä lähempänä GAN on päässyt “valokuvamaisiin” kuviin FID:n kriteerien mukaan.

Tutkimuksesta, GAN-mallin tulokset, joka on koulutettu FFHQ64-aineistolla, joka on osa Nvidian suositusta FFHQ-aineistoa. Tässä, vaikka FID-piste on erinomaisen alhainen, 5,38, tulokset eivät ole miellyttäviä tai vakuuttavia keskivertoihmisen mielestä.
Ongelma, jonka tutkijat esittävät, on, että Inception v3, jonka oletukset voimistavat Fréchet Inception Distancea, ei katso oikeaan paikkaan – ainakin, kun tarkastellaan tehtävää.
Inception V3 on koulutettu ImageNet-objektien tunnistamisen haasteeseen, tehtävään, joka on kiistanalainen kuvasynteesin tavoitteiden kehityksen kanssa viime vuosina. IV3 haastaa mallin robustisuutta suorittamalla data-augmentaatiota: se kääntää kuvia satunnaisesti, leikkaa niitä satunnaiselle skaalalle 8-100%, muuttaa kuvasuhdetta (välillä 3/4:stä 4/3:een) ja syöttää satunnaisia värihaittoja, jotka liittyvät kirkkauteen, saturaatioon ja kontrastiin.
Saksalaiset tutkijat ovat havainneet, että IV3 suosii reunien ja tekstuurien poimimista värien ja intensiteettitiedon sijaan, mikä olisi merkittävämpiä todellisuudenmukaisuuden mittareita kuvasynteesille; ja että sen alkuperäinen tarkoitus oli esineen havaitseminen, joka on sopimaton tehtäväksi.
Tutkijat toteavat*:
‘[Inception v3] suosii reunien ja tekstuurien perusteella tapahtuvaa piirtämistä värien ja intensiteettitiedon sijaan. Tämä vastaa sen augmentaatioputkistoa, joka esittää värihaittoja, mutta pitää korkeataajuista tietoa koskemattomana (toisin kuin esimerkiksi Gaussian blur -augmentaatio).
‘Seurauksena, FID peri tämän harhan. Kun käytetään luokittelumittarina, generatiiviset mallit, jotka jäljittelevät tekstuurit hyvin, voivat olla suositeltavampia kuin mallit, jotka jäljittelevät värijakautumia hyvin.’
Data ja menetelmä
Tutkijat testasivat hypoteesiaan kouluttamalla kaksi GAN-arkkitehtuuria, DCGAN ja SNGAN, Nvidian FFHQ-ihmiskasvojen aineistolla, joka on pienennetty 64×64 kuvaresoluutioon, ja josta johdettu aineisto on nimeltään FFHQ64.
Kolme GAN-koulutusmenetelmää toteutettiin: GAN G+D, standardi diskriminointiverkko; GAN FID|G+D, jossa FID toimii lisädiskriminointina; ja GAN FID|G, jossa GAN on täysin voimassa oleva FID-piste.
Teknisesti, tutkijat toteavat, että FID-häviö pitäisi stabiloida koulutusta, ja mahdollisesti jopa korvata diskriminoinnin (kuten se tekee #3, GAN FID|G), ja tuottaa samalla ihmisten miellyttäviä tuloksia.
Käytännössä tulokset ovat kuitenkin erilaiset, ja tutkijat olettavat, että FID-tukea saavat mallit “ylisovittavat” väärään mittariin. Tutkijat toteavat:
‘Oletamme, että generatiivi oppii tuottamaan sopimattomia piirteitä koulutusaineiston jakautumiseen. Tämä havainto on vakavampi tapauksessa [GAN FID|G]. Tässä huomaamme, että diskriminoinnin puute johtaa tilallisesti epäjohdonmukaisiin piirteiden jakautumiin. Esimerkiksi [SNGAN FID|G] lisää pääasiassa yksittäisiä silmiä ja kohdistaa kasvonpiirteitä hämmästyttävällä tavalla.’
Tutkijat toteavat*:
‘Ihmisen annotoijat varmasti suosisivat kuvia, jotka on tuottanut SNGAN D+G yli SNGAN FID|G (tapauksissa, joissa datauskollisuus on tärkeämpää kuin taide), mutta näemme, että tämä ei heijastu FID:stä. FID ei ole linjassa ihmisen havainnoinnin kanssa.
‘Väitämme, että diskriminointipiirteet, jotka tarjoavat kuvien luokitteluverkot, eivät ole riittäviä perusta merkittävälle mittarille.’
Ei helppoja vaihtoehtoja
Tutkijat myös totesivat, että Inception V3:n korvaaminen vastaavalla moottorilla ei poistanut ongelmaa. Korvatessaan IV3:n “laajalla valikoimalla eri luokitteluverkkoja”, jotka testattiin ImageNet-C:n (ImageNetin alijoukko, joka on suunniteltu yleisesti tuotettujen korruptioiden ja häiriöiden benchmarkkaamiseen kuvasynteesin tuloksista) kanssa, tutkijat eivät voineet parantaa tuloksiaan merkittävästi:
‘[Harhat] jotka ovat läsnä Inception v3:ssa, ovat laajasti läsnä myös muissa luokitteluverkoissa. Lisäksi näemme, että eri verkkot tarjoavat eri luokittelutuloksia korruptioiden ja häiriöiden välillä.’
Tutkijat toteavat tutkimuksen lopussa, että jatkuva tutkimus kehittää “ihmisen mukaisen ja puolueettoman mittarin”, joka voi mahdollistaa reilemmän arvioinnin kuvageneraattorien arkkitehtuureille.
* Tutkijoiden painotus.
Julkaistu ensimmäisen kerran 20. joulukuuta 2021, klo 13.00 GMT+2.













