AI-modeller og platforme
Nyt værktøj kan vise forskere, hvad GANs udelader af et billede
For nylig har et hold af forskere fra MIT-IBM Watson AI Lab udviklet en metode til at vise, hvad et Generative Adversarial Network (GAN) udelader af et billede, når det bedes om at generere billeder. Studiet blev kaldt At se, hvad en GAN ikke kan generere, og det blev nylig præsenteret på den Internationale Konference om Computer Vision.
Generative Adversarial Networks er blevet mere avancerede, sofistikerede og bredt anvendte i de seneste par år. De er blevet ret gode til at rendre billeder fulde af detaljer, så længe billedet er begrænset til et relativt lille område. Men når GANs bruges til at generere billeder af større scener og miljøer, klarer de sig ikke så godt. I scenarier, hvor GANs bedes om at rendre scener fulde af mange objekter og genstande, som en travl gade, udelader GANs ofte mange vigtige aspekter af billedet.
Ifølge MIT News blev forskningen udviklet delvist af David Bau, en ph.d.-studerende ved Institut for Elektrisk Ingeniørvidenskab og Computer Science på MIT. Bau forklarede, at forskere normalt koncentrerer sig om at forfine, hvad maskinlærings-systemer fokuserer på, og om at bestemme, hvordan visse input kan kobles til bestemte output. Men Bau forklarede også, at det at forstå, hvilke data, der ignoreres af maskinlærings-modeller, ofte er lige så vigtigt, og at forskningsholdet håber, at deres værktøjer vil inspirere forskere til at fokusere på de ignorerede data.
Baus interesse for GANs blev fremmet af det faktum, at de kunne bruges til at undersøge den sorte kasse-natur af neurale netværk og til at opnå en intuition om, hvordan netværket måske kunne fungere. Bau havde tidligere arbejdet på et værktøj, der kunne identificere bestemte kluster af kunstige neuroner, og mærke dem som værende ansvarlige for repræsentationen af virkelige objekter som bøger, skyer og træer. Bau havde også erfaring med et værktøj kaldet GANPaint, der giver kunstnere mulighed for at fjerne og tilføje bestemte funktioner fra billeder ved hjælp af GANs. Ifølge Bau afslørede GANPaint-applikationen et potentiale problem med GANs, et problem, der blev tydeligt, da Bau analyserede billederne. Som Bau fortalte MIT News:
“Min vejleder har altid opmuntret os til at se ud over tallene og undersøge de faktiske billeder. Når vi så på dem, sprang fænomenet lige ud: Mennesker blev selektivt udeladt.”
mens maskinlærings-systemer er designede til at udtrække mønstre fra billeder, kan de også ende med at ignorere relevante mønstre. Bau og andre forskere eksperimenterede med at træne GANs på forskellige indendørs og udendørs scener, men i alle typer scener udelod GANs vigtige detaljer i scenerne som biler, vejskilte, mennesker, cyklister osv. Dette var sandt, selv når de objekter, der blev udeladt, var vigtige for scenen i spørgsmål.
Forskningsholdet formodede, at når GANen blev trænet på billeder, kunne GANen finde det lettere at fange mønstrene i billedet, der var lettere at repræsentere, såsom store stationære objekter som landskaber og bygninger. Det lærer disse mønstre over andre, mere svære at fortolke mønstre, såsom biler og mennesker. Det har været almindelig viden, at GANs ofte udelader vigtige, meningsfulde detaljer, når de genererer billeder, men studiet fra MIT-holdet kan være den første gang, at GANs er blevet demonstreret til at udelade hele objektklasser inden for et billede.
Forskningsholdet bemærker, at det er muligt for GANs at opnå deres numeriske mål, selv når de udelader objekter, som mennesker bryder sig om, når de ser på billeder. Hvis billeder genereret af GANs skal bruges til at træne komplekse systemer som selvstyrende køretøjer, skal billeddataene undersøges nøje, fordi der er en reel bekymring om, at kritiske objekter som skilte, mennesker og andre biler kunne blive udeladt af billederne. Bau forklarede, at deres forskning viser, hvorfor modellens præstation ikke skal baseres kun på nøjagtighed:
“Vi skal forstå, hvad netværket gør og ikke gør, for at sikre, at det tager de valg, vi vil have, det skal tage.”












