Η γωνία του Anderson
Προβολή της Κλιματικής Αλλαγής σε Φωτογραφίες με τη Χρήση Αντισταθμιστικών Ανταγωνιστικών Νευρωνικών Δικτύων

Μια ομάδα ερευνητών από τον Καναδά και τις Ηνωμένες Πολιτείες έχει αναπτύξει μια μέθοδο μηχανικής μάθησης για την υπέρθεση των καταστροφικών επιπτώσεων της κλιματικής αλλαγής σε πραγματικές φωτογραφίες με τη χρήση Αντισταθμιστικών Ανταγωνιστικών Νευρωνικών Δικτύων (GANs), με στόχο τη μείωση της «απομάκρυνσης» – της αδυναμίας μας να συνδεθούμε με υποθετικές ή αφηρημένες σκηνάρια σχετικά με την κλιματική αλλαγή.

Το ClimateGAN εκτιμά τη γεωμετρία από ένα υπολογισμένο χάρτη βάθους trước από την προσθήκη ανακλαστικότητας σε μια υπέρθεση επιφάνειας νερού. Πηγή: https://arxiv.org/pdf/2110.02871.pdf
Το έργο, με τίτλο ClimateGAN, είναι μέρος eines ευρύτερου ερευνητικού προγράμματος για την ανάπτυξη διαδραστικών περιβαλλόντων όπου οι χρήστες μπορούν να εξερευνήσουν προβλεπόμενους κόσμους που έχουν επηρεαστεί από πλημμύρες, ακραίες θερμοκρασίες και άλλες σοβαρές επιπτώσεις της κλιματικής αλλαγής.
Συζητώντας την προέλευση της πρωτοβουλίας, οι ερευνητές δηλώνουν:
‘Η κλιματική αλλαγή είναι eine μεγάλη απειλή για την ανθρωπότητα, και οι ενέργειες που απαιτούνται για την αποφυγή των καταστροφικών επιπτώσεων της περιλαμβάνουν αλλαγές τόσο στην πολιτική όσο και στη συμπεριφορά των ατόμων. Ωστόσο, η λήψη ενεργειών απαιτεί την κατανόηση των επιπτώσεων της κλιματικής αλλαγής, ακόμη και αν φαίνονται αφηρημένες και μακρινές.
‘Η προβολή των πιθανών επιπτώσεων των ακραίων κλιματικών γεγονότων, όπως οι πλημμύρες, σε οικείους χώρους μπορεί να βοηθήσει να κάνει τις αφηρημένες επιπτώσεις της κλιματικής αλλαγής πιο συγκεκριμένες και να ενθαρρύνει τη δράση.’
Ένας βασικός στόχος της πρωτοβουλίας είναι να επιτρέψει ένα σύστημα όπου ο χρήστης μπορεί να εισαγάγει τη διεύθυνσή του (ή οποιαδήποτε διεύθυνση) και να δει μια εκδοχή της αντίστοιχης εικόνας από το Google Street View που έχει επηρεαστεί από την κλιματική αλλαγή. Ωστόσο, οι αλγόριθμοι μετασχηματισμού πίσω από το ClimateGAN απαιτούν κάποια εκτιμώμενη γνώση του ύψους για αντικείμενα στη φωτογραφία, η οποία δεν περιλαμβάνεται στα μεταδεδομένα που παρέχει το Google για το Street View, και έτσι η απόκτηση ενός τέτοιου αλγορίθμου παραμένει μια συνεχιζόμενη πρόκληση.
Δεδομένα και Αρχιτεκτονική
Το ClimateGAN χρησιμοποιεί μια μη επιτηρούμενη διαδικασία μετάφρασης εικόνας-σε-εικόνα με δύο φάσεις: ένα στρώμα Masker, το οποίο εκτιμά πού θα υπήρχε θεωρητικά μια επιφάνεια νερού στο στόχο εικόνας; και ένα στρώμα Painter για την πραγματική απόδοση του νερού μέσα στα όρια του καθορισμένου μάσκα, και λαμβάνει υπόψη την ανακλαστικότητα της υπόλοιπης μη καλυμμένης γεωμετρίας πάνω από την επιφάνεια του νερού.

Η αρχιτεκτονική για το ClimateGAN. Η είσοδος προχωράει μέσω eines κοινού κωδικοποιητή σε μια διαδικασία τριών σταδίων before being passed to the Painter module. Τα δύο δίκτυα εκπαιδεύονται ανεξάρτητα, και λειτουργούν μόνο σε συνδυασμό κατά τη διάρκεια της γεννήσεως νέων εικόνων.
Τα περισσότερα από τα δεδομένα εκπαίδευσης επιλέχθηκαν από τα CityScapes και Mapillary datasets. Ωστόσο, поскольку τα υπάρχοντα δεδομένα για εικόνες πλημμυρών είναι σχετικά σπάνια, οι ερευνητές συνδύασαν τα υπάρχοντα διαθέσιμα δεδομένα με ένα νέο «εικονικό κόσμο» που αναπτύχθηκε με το Unity3D game engine.

Σκηνές από το εικονικό περιβάλλον του Unity3D.
Το εικονικό κόσμο του Unity3D περιλαμβάνει περίπου 1,5 χλμ. εδάφους, και περιλαμβάνει αστικές, προαστιακές και αγροτικές περιοχές, τις οποίες οι ερευνητές «πλημμύρισαν». Αυτό επέτρεψε τη γεννήσεως «πριν» και «μετά» εικόνων για πρόσθετο έδαφος αλήθειας για το πλαίσιο του ClimateGAN.
Το στρώμα Masker προσαρμόζει τον κώδικα ADVENT του 2018 για την εκπαίδευση, προσθέτοντας επιπλέον δεδομένα σύμφωνα με τις ευρήσεις του 2019 από τη γαλλική ερευνητική πρωτοβουλία DADA. Οι ερευνητές πρόσθεσαν επίσης einen αποκωδικοποιητή τμήματος για να παρέχουν στο στρώμα Masker επιπλέον πληροφορίες σχετικά με τη σημασιολογία της εισόδου εικόνας (δηλαδή, επισήμανση που δηλώνει einen τομέα, όπως «κτίριο»).
Ο αποκωδικοποιητής Flood Mask υπολογίζει μια εφικτή γραμμή νερού, και τροφοδοτείται από το εξαιρετικά δημοφιλές SPADE πλαίσιο in-painting.

Μαζί με τη σημασιολογική επισήμανση (τρίτη στήλη), οι πληροφορίες χάρτη βάθους ermögουν την περιγραφή της γεωμετρίας σε μια εικόνα, παρέχοντας einen οδηγό για τα όρια του «νερού της πλημμύρας». Αυτό μπορεί να υποτεθεί μέσω διαδικασιών μηχανικής μάθησης, αν και τέτοιες πληροφορίες περιλαμβάνονται όλο και περισσότερο σε αισθητήρες συσκευών κινητών τηλεφώνων καταναλωτών. Στην κάτω σειρά, βλέπουμε ότι η αρχιτεκτονική του ClimateGAN έχει επιτύχει την απόδοση μιας «πλημμυρισμένης» εκδοχής της αρχικής εικόνας, αν και τα ενδιάμεσα στάδια δεν έχουν καταφέρει να αναπαραστήσουν ακριβώς τη γεωμετρία eines σύνθετου σκηνικού.
Οι ερευνητές χρησιμοποιούν το NVIDIA GauGAN, τροφοδοτούμενο από το SPADE, για το στρώμα Painter, αλλά ήταν αναγκαίο να προϋποθεθεί ο GauGAN στην έξοδο του στρώματος Masker, και όχι σε einen γενικευμένο χάρτη σημασιολογικής επισήμανσης, όπως συμβαίνει στην κανονική χρήση, поскольку οι εικόνες έπρεπε να μετασχηματιστούν σύμφωνα με τις περιγραφές της γραμμής νερού, και όχι να υπόκεινται σε ευρείες, γενικές μετασχηματισμούς.
Αξιολόγηση Ποιότητας
Οι μετρήσεις για την αξιολόγηση της ποιότητας των αποτελεσμάτων εικόνων διευκολύνθηκαν από την επισήμανση eines συνόλου 180 εικόνων Google Street View διαφόρων τύπων, συμπεριλαμβανομένων αστικών σκηνών και πιο αγροτικών εικόνων από μια ποικιλία γεωγραφικών τοποθεσιών. Οι εικόνες επισήμανθηκαν χειροκίνητα ως δεν μπορούν να πλημμυρίσουν, πρέπει να πλημμυρίσουν, και μπορούν να πλημμυρίσουν.

Αυτό επέτρεψε τη διαμόρφωση τριών μετρήσεων: ποσοστό λάθους (περцепτόμενες περιοχές πρόβλεψης με μέγεθος στην μετασχηματισμένη εικόνα), F05 Score, και συνέπεια ακμής. Για σύγκριση, οι ερευνητές έτεσαν τα δεδομένα σε προηγούμενα μοντέλα μετάφρασης εικόνας-σε-εικόνα, συμπεριλαμβανομένων InstaGAN, CycleGAN, και MUNIT.

Σε δοκιμές χρηστών, το ClimateGAN βρέθηκε να επιτύχει ένα υψηλότερο βαθμό ρεαλισμού από πέντε ανταγωνιστικά αρχιτεκτονικά IIT. Το μπλε αντιπροσωπεύει το βαθμό στον οποίο οι χρήστες προτίμησαν το ClimateGAN στην μελετημένη εναλλακτική μέθοδο.
Οι ερευνητές παραδέχονται ότι η έλλειψη δεδομένων ύψους στις εικόνες πηγής καθιστά δύσκολο να επιβληθούν αυθαίρετα ύψη γραμμής νερού στις εικόνες, αν ο χρήστης θέλει να αυξήσει τον «παράγοντα Roland Emmerich» λίγο. Παραδέχονται επίσης ότι οι επιπτώσεις της πλημμύρας είναι υπερβολικά περιορισμένες στην περιοχή της πλημμύρας, και σκοπεύουν να ερευνήσουν μεθόδους με τις οποίες μπορούν να προστεθούν πολλαπλά επίπεδα πλημμύρας (δηλαδή μετά την ανάκτηση μιας αρχικής πλημμύρας) στην μεθοδολογία.
Ο κώδικας του ClimateGAN έχει αναρτηθεί στο GitHub, μαζί με επιπλέον παραδείγματα απόδοσης εικόνων.

Σε ένα άλλο παράδειγμα, από την παρουσία του GitHub για το έργο, προστίθεται σμός σε μια εικόνα πόλης με έναν τρόπο που θα είναι οικείος στους περισσότερους επαγγελματίες VFX – ο χάρτης βάθους χρησιμοποιείται ως ένας είδος απομακρυσμένου «λευκού μάσκα», έτσι ώστε η πυκνότητα του σμού/ομίχλης να αυξάνεται κατά μήκος της απόστασης που καλύπτεται στην εικόνα. Πηγή: https://github.com/cc-ai/climategan












