AI-modellen en platforms

Nieuw hulpmiddel kan onderzoekers laten zien wat GANs weglaten uit een afbeelding

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onlangs ontwikkelde een team van onderzoekers van het MIT-IBM Watson AI Lab een methode om te laten zien wat een Generative Adversarial Network (GAN) weglaat uit een afbeelding wanneer hij wordt gevraagd om afbeeldingen te genereren. De studie werd Seeing What a GAN Cannot Generate genoemd en werd onlangs gepresenteerd op de International Conference on Computer Vision.

Generative Adversarial Networks zijn de afgelopen jaren robuuster, geavanceerder en breder gebruikt geworden. Ze zijn erg goed geworden in het renderen van afbeeldingen met veel details, zolang de afbeelding maar beperkt blijft tot een relatief kleine oppervlakte. Echter, wanneer GANs worden gebruikt om afbeeldingen van grotere scènes en omgevingen te genereren, presteren ze niet zo goed. In scenario’s waarin GANs worden gevraagd om scènes te renderen met veel objecten en items, zoals een drukke straat, laten GANs vaak veel belangrijke aspecten van de afbeelding weg.

Volgens MIT News werd het onderzoek deels ontwikkeld door David Bau, een promovendus aan de afdeling Elektrotechniek en Informatica van het MIT. Bau legde uit dat onderzoekers meestal focussen op het verfijnen van wat machine learning-systemen aandacht geven en het begrijpen van hoe bepaalde invoer kan worden gekoppeld aan bepaalde uitvoer. Echter, Bau legde ook uit dat het begrijpen van welke gegevens door machine learning-modellen worden genegeerd vaak net zo belangrijk is en dat het onderzoeksteam hoopt dat hun hulpmiddelen onderzoekers zullen inspireren om aandacht te besteden aan de genegeerde gegevens.

Bau’s interesse in GANs werd gewekt door het feit dat ze konden worden gebruikt om de black-box-natuur van neurale netwerken te onderzoeken en om een intuïtie te krijgen van hoe de netwerken redeneren. Bau werkte eerder aan een hulpmiddel dat specifieke clusters van kunstmatige neuronen kon identificeren en labelen als verantwoordelijk voor de weergave van echte objecten zoals boeken, wolken en bomen. Bau had ook ervaring met een hulpmiddel genaamd GANPaint, dat artiesten in staat stelt om specifieke kenmerken uit foto’s te verwijderen en toe te voegen met behulp van GANs. Volgens Bau onthulde de GANPaint-toepassing een potentieel probleem met de GANs, een probleem dat duidelijk werd toen Bau de afbeeldingen analyseerde. Zoals Bau tegen MIT News zei:

“Mijn promotor heeft ons altijd aangemoedigd om verder te kijken dan de cijfers en de daadwerkelijke afbeeldingen te onderzoeken. Toen we keken, sprong het fenomeen meteen in het oog: mensen werden selectief weggelaten.”

Terwijl machine learning-systemen zijn ontworpen om patronen uit afbeeldingen te extraheren, kunnen ze ook relevante patronen negeren. Bau en andere onderzoekers experimenteerden met het trainen van GANs op verschillende binnen- en buiten-scènes, maar in alle soorten scènes lieten de GANs belangrijke details weg, zoals auto’s, verkeersborden, mensen, fietsen, enz. Dit was het geval, zelfs wanneer de weggelaten objecten belangrijk waren voor de scène in kwestie.

Het onderzoeksteam hypothezeerde dat wanneer de GAN wordt getraind op afbeeldingen, de GAN het mogelijk makkelijker vindt om de patronen van de afbeelding te vangen die gemakkelijker te representeren zijn, zoals grote stationaire objecten zoals landschappen en gebouwen. Het leert deze patronen in plaats van andere, moeilijker te interpreteren patronen, zoals auto’s en mensen. Het is algemeen bekend dat GANs vaak belangrijke, betekenisvolle details weglaten wanneer ze afbeeldingen genereren, maar de studie van het MIT-team kan de eerste keer zijn dat GANs zijn aangetoond om hele objectklassen binnen een afbeelding weg te laten.

Het onderzoeksteam merkt op dat het mogelijk is voor GANs om hun numerieke doelen te bereiken, zelfs wanneer ze objecten weglaten die mensen belangrijk vinden wanneer ze naar afbeeldingen kijken. Als afbeeldingen gegenereerd door GANs worden gebruikt om complexe systemen te trainen, zoals autonome voertuigen, moet de afbeeldingsgegevens nauwkeurig worden onderzocht, omdat er een echt risico bestaat dat kritieke objecten zoals verkeersborden, mensen en andere auto’s uit de afbeeldingen worden weggelaten. Bau legde uit dat hun onderzoek laat zien waarom de prestaties van een model niet alleen op nauwkeurigheid moeten worden gebaseerd:

“We moeten begrijpen wat de netwerken wel en niet doen om ervoor te zorgen dat ze de keuzes maken die we willen dat ze maken.”

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.