Andersonin kulma

Ilmastonmuutoksen Projektio Valokuviin Generatiivisten Vastakkaisuuksien Verkkojen Avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijaryhmä Kanadasta ja Yhdysvalloista on kehittänyt koneoppimismenetelmän, jolla voidaan yhdistää ilmastonmuutoksen katastrofaaliset vaikutukset oikeisiin valokuvien Generatiivisten Vastakkaisuuksien Verkkojen (GAN) avulla, tavoitteena vähentää “etäisyyttä” – kykyämme suhtautua hypoteettisiin tai abstrakteihin ilmastonmuutokseen liittyviin skenaarioihin.

ClimateGAN arvioi geometrian laskettujen syvyyksien perusteella ennen heijastavuuden lisäämistä yhdistettyyn vesisintaan. Lähde: https://arxiv.org/pdf/2110.02871.pdf

ClimateGAN arvioi geometrian laskettujen syvyyksien perusteella ennen heijastavuuden lisäämistä yhdistettyyn vesisintaan. Lähde: https://arxiv.org/pdf/2110.02871.pdf

Hanke, joka on nimeltään ClimateGAN, on osa laajempaa tutkimushanketta, jonka tavoitteena on kehittää interaktiivisia ympäristöjä, joissa käyttäjät voivat tutkia ilmastonmuutoksen vaikutuksia tulvien, ääri-lämpötilojen ja muiden vakavien seurausten kautta.

Tutkijat kertovat hankeen taustalla olevasta motivaatiosta:

‘Ilmastonmuutos on suuri uhka ihmiskunnalle, ja sen vakavien seurausten estämiseksi vaaditaan sekä poliittisia että yksilöllisiä muutoksia. Kuitenkin toiminta edellyttää ymmärrystä ilmastonmuutoksen vaikutuksista, vaikka ne voivat tuntua abstrakteilta ja etäisiltä.

‘Tulvien ja muiden ääri-ilmastotapahtumien mahdollisten seurausten visualisointi tutuissa paikoissa voi auttaa tekemään ilmastonmuutoksen abstraktit vaikutukset konkreettisemmiksi ja kannustaa toimintaan.’

Hanke pyrkii mahdollistamaan järjestelmän, jossa käyttäjä voi syöttää osoitteen (tai minkä tahansa osoitteen) ja nähdä ilmastonmuutoksen vaikutuksia osoittavan version Google Street View -kuvasta. Kuitenkin ClimateGAN:n taustalla olevat muunnosalgoritmit vaativat jonkinlaista korkeustiedon arviointia kuvan kohteista, mikä ei ole mukana Google Street View:n metatiedoissa, ja sen saaminen järjestelmällisesti on edelleen haaste.

Data ja Arkkitehtuuri

ClimateGAN käyttää valvomatonta kuvasta kuvaan -muunnosputkia, joka koostuu kahdesta vaiheesta: Masker-kerroksesta, joka arvioi, missä teoreettisesti vedenpinta voisi olla kohdekuva, ja Painter-moduulista, joka renderöi veden realistisesti määritellyn maskin rajojen sisällä ja ottaa huomioon heijastavuuden jäljellä olevasta geometriasta veden yläpuolella.

ClimateGAN:n arkkitehtuuri. Syöte kulkee jaetun koodarin läpi kolmivaiheiseen maskiin ennen kuin se siirretään Painter-moduuliin. Verkot koulutetaan erikseen, ja ne toimivat yhdessä vain uusien kuvien luomisen aikana.

ClimateGAN:n arkkitehtuuri. Syöte kulkee jaetun koodarin läpi kolmivaiheiseen maskiin ennen kuin se siirretään Painter-moduuliin. Verkot koulutetaan erikseen, ja ne toimivat yhdessä vain uusien kuvien luomisen aikana.

Suurin osa koulutusdatasta valittiin CityScapes- ja Mapillary-aineistoista. Kuitenkin, koska olemassa oleva tulvakuva-aineisto on suhteellisen niukkaa, tutkijat yhdistivät olemassa olevat saatavilla olevat aineistot uuden “virtuaalimaailman” kanssa, joka kehitettiin Unity3D-pelimoottorilla.

Kohtauksia Unity3D-virtuaaliympäristöstä.

Kohtauksia Unity3D-virtuaaliympäristöstä.

Unity3D-maailma sisältää noin 1,5 km:n pituisen maaston, joka sisältää urbaaneja, esikaupunkimaisia ja maaseutumaisia alueita, joita tutkijat “tulvivat”. Tämä mahdollisti “ennen” ja “jälkeen” -kuvien luomisen lisäämällä lisää todellista aineistoa ClimateGAN-kehykseen.

Masker-yksikkö soveltaa ADVENT-koodia koulutukseen vuodelta 2018, lisäten siihen lisää dataa vuoden 2019 ranskalaisen tutkimushankkeen DADA:n löytöjen mukaisesti. Tutkijat lisäsivät myös segmentointidekooderin Masker-yksikköön, jotta se voisi saada lisätietoa syötekuvan semantiikasta (eli merkitty tieto, joka osoittaa domainin, kuten “rakennus”).

Tulvamaskin dekooderi laskee mahdollisen vedenpinnan, ja se perustuu NVIDIA:n suositulle SPADE-piirustuskehykseen.

Yhdessä semanttisen segmentoinnin (kolmas sarakkeessa) kanssa syvyyksien kartan tiedot mahdollistavat geometrian määrittämisen valokuvassa, antaen ohjeen tulvaveden reunoille. Tämä voidaan johtaa koneoppimismenetelmillä, vaikka tällaista tietoa on yhä enemmän sisällytetty kuluttajatasolle mobiililaitteiden antureihin. Alimmassa rivissä näemme, että ClimateGAN-arkkitehtuuri on onnistuneesti renderöinyt 'tulviversion' alkuperäisestä kuvasta, vaikka välimuodot eivät ole onnistuneet kaappaamaan geometrian monimutkaisesta kohtauksesta.

Klikkaa suurennusta. Yhdessä semanttisen segmentoinnin (kolmas sarakkeessa) kanssa syvyyksien kartan tiedot mahdollistavat geometrian määrittämisen valokuvassa, antaen ohjeen tulvaveden reunoille. Tämä voidaan johtaa koneoppimismenetelmillä, vaikka tällaista tietoa on yhä enemmän sisällytetty kuluttajatasolle mobiililaitteiden antureihin. Alimmassa rivissä näemme, että ClimateGAN-arkkitehtuuri on onnistuneesti renderöinyt ‘tulviversion’ alkuperäisestä kuvasta, vaikka välimuodot eivät ole onnistuneet kaappaamaan geometrian monimutkaisesta kohtauksesta.

Vaikka tutkijat käyttivät NVIDIA GauGAN:ia, joka perustuu SPADE:hen, Painter-moduulissa, se oli välttämätöntä ehdottaa GauGAN:ia Masker-yksikön tuloksesta, eikä yleistä semanttista segmentointikarttaa, kuten tavallisessa käytössä, koska kuvat piti muuttaa vedenpinnan mukaan, eikä yleisiin, laajoihin muutoksiin.

Laadun Arviointi

Laadun arviointiin käytettiin metriikkoja, jotka perustuivat 180 Google Street View -kuvan testijoukkoon, joka sisälsi erilaisia kaupunkimaisia ja maaseutumaisia kohtauksia eri maantieteellisistä sijainneista. Kuvat oli merkitty käsin “ei voida tulvittaa”, “on tulvittava” ja “voidaan tulvittaa”.

Tämä mahdollisti kolmen metriikan muodostamisen: virheen määrä (havaittu ennustettujen alueiden koko muunnetussa kuvassa), F05-lukema ja reunan yhdenmukaisuus. Vertailun vuoksi tutkijat testasivat aineiston aiemmin julkaistuilla kuvasta kuvaan -muunnosmalleilla, kuten InstaGAN, CycleGAN ja MUNIT.

Käyttäjätestissä ClimateGAN osoittautui saavuttaneen realistisemman tuloksen kuin viisi kilpailevaa IIT-arkkitehtuuria. Sininen edustaa käyttäjien suosiota ClimateGAN:ia verrattuna tutkittuun vaihtoehtoiseen menetelmään.

Käyttäjätestissä ClimateGAN osoittautui saavuttaneen realistisemman tuloksen kuin viisi kilpailevaa IIT-arkkitehtuuria. Sininen edustaa käyttäjien suosiota ClimateGAN:ia verrattuna tutkittuun vaihtoehtoiseen menetelmään.

Tutkijat myöntävät, että korkeustiedon puute alkuperäisessä kuvassa tekee vaikeaksi asettaa vedenpintaa kuvissa, jos käyttäjä haluaa lisätä “Roland Emmerichin tekijän” hieman. He myöntävät myös, että tulvavaikutukset ovat liian rajoitettuja tulvialueeseen, ja aikovat tutkia menetelmiä, joilla useita tulvatasoja (esim. alkuperäisen tulvan vetäytyminen) voidaan lisätä menetelmään.

ClimateGAN:n koodi on julkaistu GitHubissa yhdessä lisää esimerkkejä renderöidyistä kuvista.

Toisessa esimerkissä GitHub-projektin läsnäolosta, savua lisätään kaupunkikuvaan tavalla, joka on tuttu useimmille VFX-harjoitteluille – syvyyksien kartta toimii tietynlaisten

Toisessa esimerkissä GitHub-projektin läsnäolosta, savua lisätään kaupunkikuvaan tavalla, joka on tuttu useimmille VFX-harjoitteluille – syvyyksien kartta toimii tietynlaisten “valkoisten häivyttämismaskien” kaltaisena, jotta savun/tumennuksen tiheys lisääntyy kuvan peittämän etäisyyden mukaan. Lähde: https://github.com/cc-ai/climategan

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai