AI-modeller och plattformar
Nytt verktyg kan visa forskare vad GANs utelämnar ur en bild
Nyligen skapade ett team av forskare från MIT-IBM Watson AI Lab en metod för att visa vad en Generative Adversarial Network (GAN) utelämnar ur en bild när den genererar bilder. Studien kallades Seeing What a GAN Cannot Generate och presenterades nyligen vid International Conference on Computer Vision.
Generativa Adversariala Nätverk har blivit mer robusta, sofistikerade och allmänt använda under de senaste åren. De har blivit mycket bra på att återge bilder fulla av detaljer, så länge bilden är begränsad till ett relativt litet område. Men när GANs används för att generera bilder av större scener och miljöer, tenderar de att inte fungera lika bra. I scenarier där GANs används för att återge scener fulla av många objekt och föremål, som en trafikerad gata, lämnar GANs ofta många viktiga aspekter av bilden ut.
Enligt MIT News utvecklades forskningen delvis av David Bau, en doktorand vid Institutionen för elektroteknik och datavetenskap vid MIT. Bau förklarade att forskare vanligtvis fokuserar på att förbättra vad maskinlärningssystem fokuserar på och hur vissa indata kan mappas till vissa utdata. Men Bau förklarade också att det är lika viktigt att förstå vilka data som ignoreras av maskinlärningsmodeller och att forskarteamet hoppas att deras verktyg ska inspirera forskare att fokusera på de ignorerade datan.
Baus intresse för GANs väcktes av det faktum att de kunde användas för att undersöka den svarta lådan hos neurala nätverk och för att få en intuition om hur nätverken kan resonera. Bau arbetade tidigare med ett verktyg som kunde identifiera specifika kluster av artificiella neuroner, som märktes som ansvariga för representationen av verkliga föremål som böcker, moln och träd. Bau hade också erfarenhet av ett verktyg som kallades GANPaint, som möjliggjorde för artister att ta bort och lägga till specifika funktioner i foton med hjälp av GANs. Enligt Bau avslöjade GANPaint-applikationen ett potentiellt problem med GANs, ett problem som blev uppenbart när Bau analyserade bilderna. Som Bau berättade för MIT News:
“Min handledare har alltid uppmuntrat oss att se bortom siffrorna och granska de faktiska bilderna. När vi tittade, hoppade fenomenet rakt ut: Människor blev selektivt borttagna.”
Medan maskinlärningssystem är utformade för att extrahera mönster från bilder, kan de också ignorera relevanta mönster. Bau och andra forskare experimenterade med att träna GANs på olika inomhus- och utomhusscener, men i alla olika typer av scener lämnade GANs viktiga detaljer i scenerna, som bilar, vägskyltar, människor, cyklar etc. Detta var sant även när de objekt som lämnades ut var viktiga för scenen i fråga.
Forskarteamet hypotesiserade att när GANen tränas på bilder, kan GANen hitta det lättare att fånga mönstren i bilden som är lättare att representera, som stora stationära objekt som landskap och byggnader. Den lär sig dessa mönster över andra, svårare att tolka mönster, som bilar och människor. Det har varit allmänt känt att GANs ofta utelämnar viktiga, meningsfulla detaljer när de genererar bilder, men studien från MIT-teamet kan vara den första gången som GANs har visat sig utelämna hela objektklasser inom en bild.
Forskarteamet noterar att det är möjligt för GANs att uppnå sina numeriska mål även när de lämnar ut objekt som människor bryr sig om när de tittar på bilder. Om bilder genererade av GANs ska användas för att träna komplexa system, som autonoma fordon, bör bilderna granskas noga, eftersom det finns en verklig oro att kritiska objekt som skyltar, människor och andra bilar kan lämnas ut ur bilderna. Bau förklarade att deras forskning visar varför modellens prestanda inte bör baseras enbart på noggrannhet:
“Vi behöver förstå vad nätverken gör och inte gör för att säkerställa att de fattar de beslut vi vill att de ska fatta.”












