AI-modeller og plattformer
Nytt verktøy kan vise forskerne hva GANs utelater av et bilde
Nylig har et team av forskere fra MIT-IBM Watson AI Lab utviklet en metode for å vise hva en Generative Adversarial Network (GAN) utelater av et bilde når den blir bedt om å generere bilder. Studien ble kalt Hva en GAN ikke kan generere, og den ble nylig presentert på den internasjonale konferansen om datavisning.
Generative Adversarial Networks har blitt mer robuste, sofistikerte og vidt brukte de siste årene. De har blitt ganske gode til å rendre bilder fullt av detaljer, så lenge bildet er begrenset til et relativt lite område. Men når GANs brukes til å generere bilder av større scener og miljøer, tenderer de ikke å fungere like bra. I scenarier der GANs blir bedt om å rendre scener fullt av mange objekter og gjenstander, som en travel gate, utelater GANs ofte mange viktige aspekter av bildet.
Ifølge MIT News ble forskningen utviklet delvis av David Bau, en masterstudent ved avdelingen for elektroteknikk og datavitenskap ved MIT. Bau forklarte at forskerne vanligvis konsentrerer seg om å forbedre hva maskinlæringsystemer legger merke til og hvordan bestemte innputt kan kartlegges til bestemte utgangspunkter. Men Bau forklarte også at å forstå hva dataene som maskinlæringsmodellene ignorerer ofte er like viktig, og at forskningsteamet håper at deres verktøy vil inspirere forskerne til å legge merke til de ignorte dataene.
Baus interesse for GANs ble utløst av det faktum at de kunne brukes til å undersøke den sorte boksen til neurale nettverk og å få en intuitiv forståelse av hvordan nettverkene kunne resonere. Bau hadde tidligere arbeidet med et verktøy som kunne identifisere bestemte kluster av kunstige nerver, og merke dem som ansvarlige for representasjon av virkelige objekter som bøker, skyer og trær. Bau hadde også erfaring med et verktøy kalt GANPaint, som gjorde det mulig for kunstnere å fjerne og legge til bestemte trekk fra bilder ved å bruke GANs. Ifølge Bau avslørte GANPaint-applikasjonen et potensielt problem med GANs, et problem som ble åpenbart da Bau analyserte bildene. Som Bau fortalte MIT News:
“Min veileder har alltid oppmuntret oss til å se beyond tallene og skrutinisere de faktiske bildene. Når vi så, sprang fenomenet rett ut: Folk ble droppet ut selektivt.”
Mens maskinlæringsystemer er designet til å trekke ut mønster fra bilder, kan de også ende opp med å ignorere relevante mønster. Bau og andre forskere eksperimenterte med å trene GANs på ulike innendørs og utendørs scener, men i alle ulike typer scener utelot GANs viktige detaljer i scenene, som biler, veiskilt, mennesker, sykler osv. Dette var sant selv når objektene som ble utelatt var viktige for scenen i spørsmål.
Forsknings-teamet hypoteserte at når GANen blir trent på bilder, kan GANen finne det enklere å fange mønsterene i bildet som er enkle å representere, som store stasjonære objekter som landskap og bygninger. Den lærer disse mønstrene over andre, mer vanskelige å tolke mønster, som biler og mennesker. Det har vært allmenn kjennskap til at GANs ofte utelater viktige, meningsfulle detaljer når de genererer bilder, men studien fra MIT-teamet kan være den første gangen at GANs har blitt demonstrert å utelate hele objekt-klasser i et bilde.
Forsknings-teamet påpeker at det er mulig for GANs å oppnå sine numeriske mål selv om de utelater objekter som mennesker bryr seg om når de ser på bilder. Hvis bilder generert av GANs skal brukes til å trene komplekse systemer som autonome kjøretøy, bør bildedataene bli nøye skrutinisert fordi det finnes en reell bekymring for at kritiske objekter som skilt, mennesker og andre biler kan bli utelatt av bildene. Bau forklarte at deres forskning viser hvorfor modellens ytelse ikke bare skal baseres på nøyaktighet:
“Vi må forstå hva nettverkene gjør og ikke gjør for å sikre at de tar de valg vi ønsker at de skal ta.”












