Andersons vinkel
Bilde syntese-sektoren har adoptert en feilaktig målestokk, hevder forskning

2021 har vært et år med utenforliggende fremgang og en frenetisk publikasjonsfrekvens i billedsyntese-sektoren, med en strøm av nye innovasjoner og forbedringer i teknologier som kan gjenskape menneskelige personligheter gjennom neuralt rendering, deepfakes og en rekke nye tilnærminger.
Forskere fra Tyskland hevder nå at standarden som brukes til å automatisk vurdere realisme i syntetiske bilder, er dødelig feilaktig, og at de hundrevis, ja tusenvis av forskere rundt om i verden som avhenger av den for å kutte kostnadene ved dyre menneskebaserte resultatevalueringer, kan være på vei ned en blind alley.
For å demonstrere hvordan standarden, Fréchet Inception Distance (FID), ikke måler opp til menneskelige standarder for å vurdere bilder, deployerte forskerne sine egne GANs, optimalisert for FID (nå en vanlig målestokk). De fant ut at FID følger sine egne besettelser, basert på underliggende kode med en helt annen oppgave enn billedsyntese, og at det jevnt over ikke klarer å oppnå en ‘menneskelig’ standard for diskriminering:

FID-poeng (lavere er bedre) for bilder generert av ulike modeller som bruker standarddatasett og arkitekturer. Forskerne bak den nye artikkelen stiller spørsmålet ‘Ville du være enig i disse rangeringene?’. Kilde: https://openreview.net/pdf?id=mLG96UpmbYz
I tillegg til påstanden om at FID ikke er egnet for sin oppgave, foreslår artikkelen videre at ‘åpenbare’ midler, som å bytte ut dens interne motor med konkurrerende motorer, bare vil bytte en sett med fordommer med et annet. Forskerne foreslår at det nå er opp til nye forskningsinitiativer å utvikle bedre målestokker for å vurdere ‘autentisitet’ i syntetisk genererte bilder.
Artikkelen het Internalized Biases in Fréchet Inception Distance, og kommer fra Steffen Jung ved Max Planck-instituttet for informatikk ved Saarland, og Margret Keuper, professor for visuell datateknikk ved Universitetet i Siegen.
Søket etter en poengsystem for billedsyntese
Som den nye forskningen påpeker, har fremgangen i billedsyntese-rammeverk, som GANs og encoder/decoder-arkitekturer, forbigått metoder for å vurdere resultater fra disse systemene. Foruten å være dyre og derfor vanskelige å skalerer, tilbyr menneskelig evaluering av utgangen fra disse systemene ikke en empirisk og reproducerbar metode for vurdering.
Derfor har en rekke målestokks-rammeverk dukket opp, inkludert Inception Score (IS), presentert i artikkelen Improved Techniques for Training GANs, skrevet av GAN-oppfinneren, Ian Goodfellow.
Underkastelsen av IS-poeng som en generell målestokk for flere GAN-nettverk i 2018 ledet til en vidstrakt adopsjon av FID i GAN-billedsyntese-samfunnet. Likevel, som Inception Score, er FID basert på Googles Inception v3-bildeklassifiseringsnettverk (IV3).
Forskerne bak den nye artikkelen hevder at Fréchet Inception Distance forplanter skadelige fordommer i IV3, og fører til en uforståelig klassifisering av bildekvalitet.
Ettersom FID kan inkorporeres i et maskinlæring-rammeverk som en diskriminativ (en innebygd ‘dommer’ som bestemmer om GAN gjør det bra eller skal ‘prøve igjen’), må den nøyaktig representere standardene som en menneske ville bruke når de vurderer bildene.
Fréchet Inception Distance
FID sammenligner hvordan egenskaper er fordelt over treningssettet som brukes til å lage en GAN (eller lignende funksjonalitet) modell, og resultater fra dette systemet.
Derfor, hvis en GAN-rammeverk er trent på 10 000 bilder av (for eksempel) kjendiser, sammenligner FID de originale (ekte) bildene med de falske bildene produsert av GAN. Jo lavere FID-poeng, jo nærmere GAN har kommet til ‘fotorealistiske’ bilder, ifølge FID-kriteriene.
<img class="size-full wp-image-179535" src="https://www.unite.ai/wp-content/uploads/2021/12/ffhq64-gan-results.jpg" alt="Fra artikkelen, resultater fra en GAN trent på FFHQ64, en undergruppe av NVIDIAs meget populære FFHQ-datasett. Her, selv om FID-poeng er et usedvanlig lavt 5,38, er resultater ikke tiltalende eller overbevisende for den gjennomsnittlige menneske.” width=”1200″ height=”402″ /> Fra artikkelen, resultater fra en GAN trent på FFHQ64, en undergruppe av NVIDIAs meget populære FFHQ-datasett. Her, selv om FID-poeng er et usedvanlig lavt 5,38, er resultater ikke tiltalende eller overbevisende for den gjennomsnittlige menneske.
Problemet, hevder forfatterne, er at Inception v3, hvis antagelser driver Fréchet Inception Distance, ikke ser i de riktige stedene – i hvert fall ikke når det gjelder oppgaven.
Inception V3 er trent på ImageNet-objektgjenkjenning-utfordringen, en oppgave som kan være i motstrid med måten billedsyntese-mål har utviklet seg de siste årene. IV3 utfordrer robustheten til en modell ved å utføre data-augmentering: det flipper bilder tilfeldig, beskjærer dem til en tilfeldig skala mellom 8-100%, endrer bildets proporsjoner (i et område fra 3/4 til 4/3), og injiserer tilfeldig fargeforstyrrelser relatert til lysstyrke, metning og kontrast.
Forskerne fra Tyskland har funnet ut at IV3 har en tendens til å favorisere uttrekk av kanter og teksturer, snarere enn farge- og intensitetsinformasjon, som ville være mer meningsfulle indekser for autentisitet for syntetiske bilder, og at dens opprinnelige formål med objektgjenkjenning har derfor blitt inntatt for en upassende oppgave. Forfatterne hevder*:
‘[Inception v3] har en fordom mot å trekke ut egenskaper basert på kanter og teksturer snarere enn farge- og intensitetsinformasjon. Dette stemmer overens med dens augmenterings-pipeline som introduserer fargeforstyrrelser, men holder høyfrekvent informasjon intakt (i motsetning til, for eksempel, augmentering med Gaussisk uskarphet).
‘Som en følge, arver FID denne fordommen. Når det brukes som rangerings-målestokk, kan generative modeller som gjenskaper teksturer godt bli foretrukket over modeller som gjenskaper fargefordeling godt. ‘
Data og metode
For å teste sin hypotese, trente forfatterne to GAN-arkitekturer, DCGAN og SNGAN, på NVIDIAs FFHQ-menneskeansiktsdatasett, nedskalert til 642 bildeoppløsning, med det avledede datasettet kalt FFHQ64.
Tre GAN-treningprosedyrer ble fulgt: GAN G+D, en standard diskriminativ nettverk; GAN FID|G+D, hvor FID fungerer som en ekstra diskriminativ; og GAN FID|G, hvor GAN er fullstendig drevet av den rullende FID-poeng.
Teknisk sett, noterer forfatterne, burde FID-tap stabilisere treningen, og potensielt sogar fullstendig erstatte diskriminatoren (som det gjør i #3, GAN FID|G), mens det produserer menneske-tiltalande resultater.
I praksis er resultaterne ganske forskjellige, med – forfatterne hypotetiserer – FID-assisterte modeller ‘overfitting’ på feil målestokker. Forskerne noterer:
‘Vi hypotetiserer at generatoren lærer å produsere uegnede egenskaper for å matche treningssettets fordeling. Dette observasjonen blir mer alvorlig i tilfelle [GAN FID|G]. Her legger vi merke til at mangelen på diskriminativ fører til romlig ukoherente egenskapsfordelinger. For eksempel [SNGAN FID|G] legger til hovedsakelig enkelt øyne og alignerer ansiktskarakteristika på en skremmende måte.’
Forfatterne konkluderer*:
‘Mens menneskelige annotatorer ville sikkert foretrekke bilder produsert av SNGAN D+G over SNGAN FID|G (i tilfeller hvor data-trofasthet er foretrukket over kunst), ser vi at dette ikke reflekteres av FID. FID er ikke i samsvar med menneskelig persepsjon.
‘Vi argumenterer for at diskriminative egenskaper gitt av bildeklassifiseringsnettverk er ikke tilstrekkelige til å gi grunnlag for en meningsfull målestokk.’
Ingen enkle alternativer
Forfatterne fant også ut at å bytte ut Inception V3 med en lignende motor, ikke lettet problemet. Ved å erstatte IV3 med ‘en omfattende valg av forskjellige klassifiseringsnettverk’, som ble testet mot ImageNet-C (en undergruppe av ImageNet designet for å benchmark vanlig genererte korrupteringer og forstyrrelser i utgangsbilder fra billedsyntese-rammeverk), kunne forskerne ikke vesentlig forbedre resultater:
‘[Fordommer] som er til stede i Inception v3, er også vidt utbredt i andre klassifiseringsnettverk. I tillegg ser vi at forskjellige nettverk ville produsere forskjellige rangeringer mellom korrupte typer.’
Forfatterne konkluderer artikkelen med håpet om at pågående forskning vil utvikle en ‘menneske-tilpasset og upartisk målestokk’ i stand til å muliggjøre en mer rettferdig rangering for billedgenerator-arkitekturer.
* Forfatterens betoning.
Først publisert 20. desember 2021, 13.00 GMT+2.













