Andersons vinkel

Projektion av klimatförändringar i foton med hjälp av generativa motsatsnätverk

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Ett team av forskare från Kanada och USA har utvecklat en maskinlärningsmetod för att lägga till de katastrofala effekterna av klimatförändringar i riktiga foton med hjälp av generativa motsatsnätverk (GAN), i syfte att minska “distansering” – vår oförmåga att relatera till hypotetiska eller abstrakta scenarier när det gäller klimatförändringar.

ClimateGAN uppskattar geometri från en beräknad djupkarta innan reflektivitet läggs till i en överlagrad vattenyta. Källa: https://arxiv.org/pdf/2110.02871.pdf

ClimateGAN uppskattar geometri från en beräknad djupkarta innan reflektivitet läggs till i en överlagrad vattenyta. Källa: https://arxiv.org/pdf/2110.02871.pdf

Projektet, som heter ClimateGAN, är en del av en bredare forskningsinsats för att utveckla interaktiva miljöer där användare kan utforska projicerade världar som har påverkats av översvämningar, extrem värme och andra allvarliga konsekvenser av klimatförändringar.

När forskarna diskuterar motivationen bakom initiativet, säger de:

‘Klimatförändringar är ett stort hot mot mänskligheten, och de åtgärder som krävs för att förhindra dess katastrofala konsekvenser inkluderar förändringar i både politiken och individuellt beteende. Men för att vidta åtgärder krävs det att man förstår effekterna av klimatförändringar, även om de kan verka abstrakta och avlägsna.

‘Att projicera de potentiella konsekvenserna av extrema klimathändelser som översvämningar i bekanta platser kan hjälpa till att göra de abstrakta effekterna av klimatförändringar mer konkreta och uppmuntra till handling.’

Ett centralt mål med initiativet är att möjliggöra ett system där en användare kan ange sin adress (eller någon annan adress) och se en version av bilden från Google Street View som har påverkats av klimatförändringar. Men de transformationsalgoritmer som ligger bakom ClimateGAN kräver viss kunskap om höjd för föremål i bilden, som inte ingår i metadata som Google tillhandahåller för Street View, och att få tillgång till en sådan estimationsalgoritm förblir en pågående utmaning.

Data och arkitektur

ClimateGAN använder en oövervakad bild-till-bild-översättningspipeline med två faser: en Masker-lager, som uppskattar var en vattenyta skulle teoretiskt finnas i målbilden; och en Painter-modul för att realistiskt återge vatten inom de gränser som etablerats av masken, och tar hänsyn till reflektivitet av den återstående icke-överlagrade geometrin ovanför vattenlinjen.

Arkitekturen för ClimateGAN. Inmatningen går genom en delad encoder till en tre-stegs maskeringsprocess innan den skickas till Painter-modulen. De två nätverken tränas oberoende av varandra och fungerar endast i tandem under genereringen av nya bilder.

Arkitekturen för ClimateGAN. Inmatningen går genom en delad encoder till en tre-stegs maskeringsprocess innan den skickas till Painter-modulen. De två nätverken tränas oberoende av varandra och fungerar endast i tandem under genereringen av nya bilder.

Större delen av träningdata valdes från CityScapes och Mapillary-dataset. Men eftersom befintliga data för översvämningar är relativt knappa, kombinerade forskarna befintliga tillgängliga dataset med en ny “virtuell värld” som utvecklats med Unity3D-spelmotorn.

Scener från den virtuella miljön i Unity3D.

Scener från den virtuella miljön i Unity3D.

Den virtuella världen i Unity3D innehåller cirka 1,5 km av terräng och inkluderar urbana, förorts- och landsbygdsområden, som forskarna “översvämmade”. Detta möjliggjorde genereringen av “före” och “efter”-bilder för ytterligare grund för ClimateGAN-ramverket.

Masker-enheten anpassar 2018 års ADVENT-kod för träning, med tillägg av ytterligare data i enlighet med 2019 års rön från den franska forskningsinitiativet DADA. Forskarna lade också till en segmenteringsdecoder för att mata Masker-enheten med ytterligare information om semantiken i inmatningsbilden (dvs. märkt information som anger en domän, såsom “byggnad”).

Flood Mask Decoder beräknar en möjlig vattenlinje och drivs av NVIDIAs mycket populära SPADE-ramverk för in-painting.

Tillsammans med semantisk segmentering (tredje kolumnen) möjliggör djupkartsinformation avgränsning av geometrin i en bild, vilket ger en riktlinje för gränserna för

Klicka för att förstora. Tillsammans med semantisk segmentering (tredje kolumnen) möjliggör djupkartsinformation avgränsning av geometrin i en bild, vilket ger en riktlinje för gränserna för “översvämningens vatten”. Detta kan härledas genom maskinlärningsprocesser, även om sådan information alltmer ingår i konsumentnivås mobilenhetsensorer. I den nedre raden ser vi att ClimateGAN-arkitekturen har lyckats återge en “översvämmad” version av den ursprungliga bilden, trots att de mellanliggande stadierna inte har lyckats fånga geometrin i en komplex scen.

Även om forskarna använde NVIDIAs GauGAN, som drivs av SPADE, för Painter-modulen, var det nödvändigt att villkora GauGAN på utdata från Masker-enheten, och inte på en allmän semantisk segmenteringskarta, som sker i normal användning, eftersom bilderna måste omvandlas i enlighet med vattenlinjens avgränsningar, snarare än att utsättas för breda, allmänna omvandlingar.

Utvardering av kvalitet

Mått för att utvärdera kvaliteten på de resulterande bilderna möjliggjordes genom att märka en testuppsättning på 180 Google Street View-bilder av varierande typer, inklusive urbana scener och mer rurala bilder från en mängd olika geografiska platser. Bilderna märktes manuellt som kan inte översvämmas, måste översvämmas och kan översvämmas.

Detta möjliggjorde formuleringen av tre mått: felhastighet (uppfattad prediktionsyta efter storlek i den omvandlade bilden), F05-poäng och kantkoherens. För jämförelse testade forskarna data på tidigare bild-till-bild-översättningsmodeller, inklusive InstaGAN, CycleGAN och MUNIT.

I användartester fanns det att ClimateGAN uppnådde en högre grad av realism än fem konkurrerande IIT-arkitekturer. Blått representerar den grad till vilken användare föredrog ClimateGAN framför den studerade alternativa metoden.

I användartester fanns det att ClimateGAN uppnådde en högre grad av realism än fem konkurrerande IIT-arkitekturer. Blått representerar den grad till vilken användare föredrog ClimateGAN framför den studerade alternativa metoden.

Forskarna medger att bristen på höjddata i källbilder gör det svårt att godtyckligt påtvinga vattenlinjer i bilder, om användaren vill “diala upp” “Roland Emmerich-faktorn” lite. De medger också att översvämningseffekterna är alltför begränsade till översvämningsområdet och avser att undersöka metoder för att lägga till flera nivåer av översvämning (dvs. efter tillbakadragning av en initial översvämning) till metoden.

ClimateGANs kod har gjorts tillgänglig på GitHub, tillsammans med ytterligare exempel på återgivna bilder.

I ett annat exempel, från GitHub-närvaron för projektet, läggs smog till en stadsbild på ett sätt som kommer att vara bekant för de flesta VFX-utövare - djupkartan används som en slags avtagande

I ett annat exempel, från GitHub-närvaron för projektet, läggs smog till en stadsbild på ett sätt som kommer att vara bekant för de flesta VFX-utövare – djupkartan används som en slags avtagande “vit-ut-mask”, så att densiteten av smog/dis ökar över avståndet som täcks i bilden. Källa: https://github.com/cc-ai/climategan

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai