Andersons hoek

Klimaatverandering projecteren in foto’s met Generatieve Tegenstrijdige Netwerken

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Een team van onderzoekers uit Canada en de VS heeft een machine learning-methode ontwikkeld om de catastrofale gevolgen van klimaatverandering in echte foto’s te projecteren met behulp van Generatieve Tegenstrijdige Netwerken (GAN’s), met als doel het verminderen van ‘distancing’ – onze onvermogen om een relatie te leggen met hypothetische of abstracte scenario’s met betrekking tot klimaatverandering.

ClimateGAN schat geometrie in vanuit een berekende dieptekaart voordat reflectiviteit in een gesuperponeerde watersurface wordt toegevoegd. Source: https://arxiv.org/pdf/2110.02871.pdf

ClimateGAN schat geometrie in vanuit een berekende dieptekaart voordat reflectiviteit in een gesuperponeerde watersurface wordt toegevoegd. Source: https://arxiv.org/pdf/2110.02871.pdf

Het project, getiteld ClimateGAN, maakt deel uit van een bredere onderzoeksinspanning om interactieve omgevingen te ontwikkelen waarin gebruikers kunnen verkennen van geprojecteerde werelden die zijn beïnvloed door overstromingen, extreme hitte en andere ernstige gevolgen van klimaatverandering.

Over de motivatie achter het initiatief zeggen de onderzoekers:

‘Klimaatverandering is een grote bedreiging voor de mensheid, en de acties die nodig zijn om de catastrofale gevolgen te voorkomen, omvatten veranderingen in zowel beleid als individueel gedrag. Echter, om actie te ondernemen, is het nodig om de gevolgen van klimaatverandering te begrijpen, zelfs als ze abstract en ver weg lijken.

‘Het projecteren van de potentiële gevolgen van extreme klimaatgebeurtenissen, zoals overstromingen in vertrouwde plaatsen, kan helpen om de abstracte gevolgen van klimaatverandering concreter te maken en actie te stimuleren.’

Een belangrijk doel van het initiatief is om een systeem te creëren waarin een gebruiker zijn adres (of elk adres) kan invoeren en een klimaatverandering-geïnfecteerde versie van de corresponderende afbeelding van Google Street View kan zien. Echter, de transformatie-algoritmes achter ClimateGAN vereisen enige geschatte kennis van hoogte voor items in de foto, die niet is opgenomen in de metadata die Google biedt voor Street View, en dus blijft het verkrijgen van een dergelijke schatting algoritmisch een lopende uitdaging.

Gegevens en Architectuur

ClimateGAN maakt gebruik van een onbegeleide beeld-naar-beeld-translatiepijplijn met twee fasen: een Masker-laag, die schat waar een niveau-watersurface theoretisch zou bestaan in het doelbeeld; en een Painter-module om water realistisch te renderen binnen de grenzen van de vastgestelde masker, en houdt rekening met de reflectiviteit van de resterende niet-verborgen geometrie boven de waterlijn.

De architectuur voor ClimateGAN. Invoer gaat via een gedeelde encoder naar een driestaps-maskerproces voordat het wordt doorgegeven aan de Painter-module. De twee netwerken worden onafhankelijk getraind en werken alleen samen tijdens de generatie van nieuwe beelden.

De architectuur voor ClimateGAN. Invoer gaat via een gedeelde encoder naar een driestaps-maskerproces voordat het wordt doorgegeven aan de Painter-module. De twee netwerken worden onafhankelijk getraind en werken alleen samen tijdens de generatie van nieuwe beelden.

De meeste trainingsgegevens werden gekozen uit de CityScapes en Mapillary datasets. Echter, aangezien bestaande gegevens voor overstromingsbeelden relatief schaars zijn, combineerden de onderzoekers bestaande beschikbare datasets met een novum ‘virtuele wereld’ ontwikkeld met de Unity3D-game-engine.

Scènes uit de Unity3D-virtuele omgeving.

Scènes uit de Unity3D-virtuele omgeving.

De Unity3D-wereld bevat ongeveer 1,5 km aan terrein en omvat stedelijke, suburbane en landelijke gebieden, die de onderzoekers ‘overstroomden’. Dit maakte het mogelijk om ‘voor’ en ‘na’ beelden te genereren voor extra grondwaarheid voor het ClimateGAN-kader.

De Masker-eenheid past de ADVENT-code van 2018 aan voor training, met extra gegevens in overeenstemming met de bevindingen van 2019 van het Franse onderzoeksinitiatief DADA. De onderzoekers voegden ook een segmentatie-decoder toe om de Masker-eenheid extra informatie te geven over de semantiek van het invoerbeeld (d.w.z. gelabelde informatie die een domein aanduidt, zoals ‘gebouw’).

De Flood Mask Decoder berekent een haalbare waterlijn en wordt aangedreven door NVIDIA’s populairste SPADE in-painting framework.

Samen met semantische segmentatie (derde kolom) maakt dieptekaartinformatie het mogelijk om de geometrie in een foto te definiëren, waardoor een richtlijn wordt geboden voor de grenzen van het 'overstromingswater'. Dit kan worden afgeleid via machine learning-processen, hoewel dergelijke informatie steeds vaker wordt opgenomen in consumentenmobiele apparaten. In de onderste rij zien we dat de ClimateGAN-architectuur erin is geslaagd om een 'overstroomde' versie van de oorspronkelijke foto te renderen, zelfs als de tussenliggende stadia niet in staat waren om de geometrie van een complexe scène nauwkeurig te vangen.

Klik om te vergroten. Samen met semantische segmentatie (derde kolom) maakt dieptekaartinformatie het mogelijk om de geometrie in een foto te definiëren, waardoor een richtlijn wordt geboden voor de grenzen van het ‘overstromingswater’. Dit kan worden afgeleid via machine learning-processen, hoewel dergelijke informatie steeds vaker wordt opgenomen in consumentenmobiele apparaten. In de onderste rij zien we dat de ClimateGAN-architectuur erin is geslaagd om een ‘overstroomde’ versie van de oorspronkelijke foto te renderen, zelfs als de tussenliggende stadia niet in staat waren om de geometrie van een complexe scène nauwkeurig te vangen.

Hoewel de onderzoekers NVIDIA GauGAN gebruikten, aangedreven door SPADE, voor de Painter-module, was het noodzakelijk om GauGAN te conditioneren op de uitvoer van de Masker, en niet op een gegeneraliseerde semantische segmentatiekaart, zoals gebruikelijk is bij normaal gebruik, aangezien de beelden moesten worden getransformeerd in overeenstemming met de waterlijn-definities, in plaats van onderhevig te zijn aan brede, algemene transformaties.

Kwaliteitsevaluatie

Metrische gegevens voor het evalueren van de kwaliteit van de resulterende beelden werden gefaciliteerd door het labelen van een testset van 180 Google Street View-afbeeldingen van verschillende typen, waaronder stedelijke scènes en meer landelijke afbeeldingen uit een diverse reeks geografische locaties. De afbeeldingen werden handmatig gelabeld als niet-overstroomd, moet-overstroomd en kan-overstroomd.

Dit maakte het mogelijk om drie metrische gegevens te formuleren: foutpercentage (waargenomen voorspellingsgebieden per grootte in het getransformeerde beeld), F05 Score en randcoherentie. Voor vergelijking testten de onderzoekers de gegevens op eerdere beeld-naar-beeld-translatiemodellen, waaronder InstaGAN, CycleGAN en MUNIT.

In gebruikerstests werd vastgesteld dat ClimateGAN een hoger niveau van realisme bereikte dan vijf concurrerende IIT-architecturen. Blauw vertegenwoordigt de mate waarin gebruikers ClimateGAN verkozen boven de bestudeerde alternatieve methode.

In gebruikerstests werd vastgesteld dat ClimateGAN een hoger niveau van realisme bereikte dan vijf concurrerende IIT-architecturen. Blauw vertegenwoordigt de mate waarin gebruikers ClimateGAN verkozen boven de bestudeerde alternatieve methode.

De onderzoekers geven toe dat het ontbreken van hoogtegegevens in de bronafbeeldingen het moeilijk maakt om willekeurig waterlijnhoogtes in beelden op te leggen, als de gebruiker de ‘Roland Emmerich-factor’ een beetje wil verhogen. Ze geven ook toe dat de overstromingseffecten te beperkt zijn tot het overstromingsgebied en van plan zijn om methoden te onderzoeken om meerdere niveaus van overstroming (d.w.z. na het terugtrekken van een initiële overstroming) toe te voegen aan de methodologie.

De code van ClimateGAN is beschikbaar gemaakt op GitHub, samen met extra voorbeelden van gegenereerde beelden.

In een ander voorbeeld, van de GitHub-presence voor het project, wordt smog toegevoegd aan een stadsbeeld op een manier die vertrouwd is voor de meeste VFX-praktijnen - de dieptekaart wordt gebruikt als een soort terugtrekkende 'witte-uitmasker', zodat de dichtheid van smog/nevel toeneemt over de afstand die in de foto wordt afgedekt. Source: https://github.com/cc-ai/climategan

In een ander voorbeeld, van de GitHub-presence voor het project, wordt smog toegevoegd aan een stadsbeeld op een manier die vertrouwd is voor de meeste VFX-praktijnen – de dieptekaart wordt gebruikt als een soort terugtrekkende ‘witte-uitmasker’, zodat de dichtheid van smog/nevel toeneemt over de afstand die in de foto wordt afgedekt. Source: https://github.com/cc-ai/climategan

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai