Unghiul lui Anderson

Proiectarea schimbărilor climatice în fotografii cu ajutorul rețelelor generative adversative

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O echipă de cercetători din Canada și SUA a dezvoltat o metodă de învățare automată pentru a suprapune efectele catastrofale ale schimbărilor climatice în fotografii reale, utilizând rețele generative adversative (GAN), cu scopul de a reduce “distanțarea” – incapacitatea noastră de a relaționa cu scenarii ipotetice sau abstracte referitoare la schimbările climatice.

ClimateGAN estimează geometria dintr-o hartă de adâncime calculată, înainte de a adăuga reflectivitate într-o suprafață de apă suprapusă. Sursă: https://arxiv.org/pdf/2110.02871.pdf

ClimateGAN estimează geometria dintr-o hartă de adâncime calculată, înainte de a adăuga reflectivitate într-o suprafață de apă suprapusă. Sursă: https://arxiv.org/pdf/2110.02871.pdf

Proiectul, intitulat ClimateGAN, face parte dintr-un efort de cercetare mai larg pentru a dezvolta medii interactive în care utilizatorii pot explora lumi proiectate care au fost afectate de inundații, căldură extremă și alte consecințe grave ale schimbărilor climatice.

Discutând despre motivația din spatele inițiativei, cercetătorii afirmă:

‘Schimbările climatice reprezintă o amenințare majoră pentru omenire, iar acțiunile necesare pentru a preveni consecințele catastrofale includ schimbări atât în politica de luare a deciziilor, cât și în comportamentul individual. Cu toate acestea, pentru a lua măsuri, este necesar să înțelegem efectele schimbărilor climatice, chiar dacă acestea par abstracte și îndepărtate.

‘Proiectarea consecințelor potențiale ale evenimentelor climatice extreme, cum ar fi inundațiile în locuri familiare, poate ajuta la concretizarea impacturilor abstracte ale schimbărilor climatice și la încurajarea acțiunii.’

Un obiectiv principal al inițiativei este de a permite un sistem în care un utilizator poate introduce adresa sa (sau orice adresă) și să vadă o versiune afectată de schimbările climatice a imaginii corespunzătoare din Google Street View. Cu toate acestea, algoritmii de transformare din spatele ClimateGAN necesită o anumită cunoaștere estimată a înălțimii pentru elementele din imagine, care nu este inclusă în metadatele pe care Google le oferă pentru Street View, și astfel obținerea unei astfel de estimări algoritmic rămâne o provocare în desfășurare.

Date și Arhitectură

ClimateGAN utilizează o conductă de traducere imagine-imagină nesupravegheată cu două faze: un strat de mascare, care estimează unde ar exista teoretic o suprafață de apă la nivelul imaginii țintă; și un modul de pictură pentru a reda realist apa în limitele măștii stabilite, și ia în considerare reflectivitatea geometriei rămase neacoperite deasupra liniei apei.

Arhitectura pentru ClimateGAN. Intrarea trece printr-un encoder comun într-un proces de mascare în trei etape, înainte de a fi transmisă modulului de pictură. Cele două rețele sunt antrenate independent și funcționează împreună doar în timpul generării de noi imagini.

Arhitectura pentru ClimateGAN. Intrarea trece printr-un encoder comun într-un proces de mascare în trei etape, înainte de a fi transmisă modulului de pictură. Cele două rețele sunt antrenate independent și funcționează împreună doar în timpul generării de noi imagini.

Cea mai mare parte a datelor de antrenare a fost selectată din seturile de date CityScapes și Mapillary. Cu toate acestea, deoarece datele existente pentru imagini cu inundații sunt relativ rare, cercetătorii au combinat seturile de date existente cu un mediu “virtual” nou, dezvoltat cu motorul de joc Unity3D.

Scene din mediul virtual Unity3D.

Scene din mediul virtual Unity3D.

Mediul Unity3D conține aproximativ 1,5 km de teren și include zone urbane, suburbane și rurale, pe care cercetătorii le-au “inundat”. Acest lucru a permis generarea de imagini “înainte” și “după” pentru a obține informații suplimentare pentru cadrul ClimateGAN.

Unitatea de mascare adaptează codul ADVENT din 2018 pentru antrenare, adăugând date suplimentare în conformitate cu descoperirile din 2019 ale inițiativei de cercetare franceze DADA. Cercetătorii au adăugat, de asemenea, un decodificator de segmentare pentru a furniza unității de mascare informații suplimentare despre semantica imaginii de intrare (adică informații etichetate care denotă un domeniu, cum ar fi “clădire”).

Decodificatorul de mascare a inundațiilor calculează o linie de apă fezabilă și este alimentat de cadrul de încadrare SPADE al companiei NVIDIA.

Împreună cu segmentarea semantică (a treia coloană), informațiile despre harta de adâncime permit delimitarea geometriei într-o fotografie, oferind o linie directoare pentru marginile

Faceți clic pentru a mări. Împreună cu segmentarea semantică (a treia coloană), informațiile despre harta de adâncime permit delimitarea geometriei într-o fotografie, oferind o linie directoare pentru marginile “apei de inundație”. Acest lucru poate fi dedus prin procese de învățare automată, deși astfel de informații sunt din ce în ce mai mult incluse în senzorii dispozitivelor mobile de consum. În rândul inferior, vedem că arhitectura ClimateGAN a reușit să genereze o versiune “inundată” a fotografiei originale, chiar dacă etapele intermediare nu au reușit să capteze cu acuratețe geometria unei scene complexe.

Deși cercetătorii au utilizat GauGAN de la NVIDIA, alimentat de SPADE, pentru modulul de pictură, a fost necesar să condiționeze GauGAN pe ieșirea unității de mascare și nu pe o hartă semantică generalizată, așa cum se întâmplă în mod normal, deoarece imaginile trebuiau transformate în conformitate cu delimitările liniei apei, și nu supuse unor transformări generale.

Evaluarea Calității

Metricele pentru evaluarea calității imaginilor rezultate au fost facilitate prin etichetarea unui set de test de 180 de imagini Google Street View de diferite tipuri, incluzând scene urbane și imagini mai rurale din diverse locații geografice. Imaginile au fost etichetate manual ca nu pot fi inundate, trebuie să fie inundate și pot fi inundate.

Acest lucru a permis formularea a trei metrice: rată de eroare (zonele de predicție percepute prin mărime în imaginea transformată), F05 Scor și coerență a muchiilor. Pentru comparație, cercetătorii au testat datele pe modele anterioare de traducere imagine-imagină, incluzând InstaGAN, CycleGAN și MUNIT.

În testele cu utilizatorii, ClimateGAN a fost găsit să atingă un nivel mai ridicat de realism decât cinci arhitecturi IIT competitive. Albastrul reprezintă gradul în care utilizatorii au preferat ClimateGAN față de metoda alternativă studiată.

În testele cu utilizatorii, ClimateGAN a fost găsit să atingă un nivel mai ridicat de realism decât cinci arhitecturi IIT competitive. Albastrul reprezintă gradul în care utilizatorii au preferat ClimateGAN față de metoda alternativă studiată.

Cercetătorii recunosc că lipsa datelor de înălțime în imaginile sursă face dificilă impunerea arbitrară a înălțimilor liniei apei în imagini, dacă utilizatorul dorește să “mărească” factorul “Roland Emmerich” un pic. Ei recunosc, de asemenea, că efectele inundațiilor sunt limitate în mod excesiv la zona inundațiilor și intenționează să investigheze metode prin care pot fi adăugate multiple niveluri de inundații (de exemplu, după retragerea unei inundații inițiale) la metodologie.

Codul ClimateGAN a fost făcut disponibil pe GitHub, împreună cu exemple suplimentare de imagini generate.

Într-un alt exemplu, de la prezența GitHub a proiectului, smogul este adăugat la o imagine a orașului într-un mod care va fi familiar pentru majoritatea practicienilor VFX - harta de adâncime este utilizată ca o mască de

Într-un alt exemplu, de la prezența GitHub a proiectului, smogul este adăugat la o imagine a orașului într-un mod care va fi familiar pentru majoritatea practicienilor VFX – harta de adâncime este utilizată ca o mască de “alb” care se retrage, astfel încât densitatea smogului / ceții crește pe distanța acoperită de imagine. Sursă: https://github.com/cc-ai/climategan

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai