Η γωνία του Anderson

Το Ανεπίσημο Πλεονέκτημα του Χαρτογράφησης του Λανθανόμενου Χώρου ενός GAN

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ενώ προσπαθούσαν να βελτιώσουν την ποιότητα και την πιστότητα των εικόνων που παράγονται από τον AI, μια ομάδα ερευνητών από την Κίνα και την Αυστραλία ανακάλυψαν κατά λάθος μια μέθοδο για να ελέγξουν διαδραστικά τον λανθανόμενο χώρο ενός Γεννητικού Ανταγωνιστικού Δικτύου (GAN) – τον μυστηριώδη υπολογιστικό πίνακα πίσω από τις νέες τεχνικές σύνθεσης εικόνων που πρόκειται να επαναφέρουν τις ταινίες, τα βιντεοπαιχνίδια και τα μέσα κοινωνικής δικτύωσης, καθώς και πολλούς άλλους τομείς ψυχαγωγίας και έρευνας.

Η ανακάλυψή τους, ένα παραπροϊόν του κεντρικού στόχου του έργου, επιτρέπει σε έναν χρήστη να εξερευνήσει διαδραστικά τον λανθανόμενο χώρο ενός GAN με το ποντίκι, όπως όταν σκουπίζουμε μια βίντεο ή όταν γυρίζουμε τις σελίδες ενός βιβλίου.

Ένα απόσπασμα από το συνοδευτικό βίντεο των ερευνητών (δείτε το εμβέδυσμα στο τέλος του άρθρου). Σημειώστε ότι ο χρήστης χειρίζεται τις μεταμορφώσεις με ένα 'grab' curso (πάνω αριστερά).

Ένα απόσπασμα από το συνοδευτικό βίντεο των ερευνητών (δείτε το εμβέδυσμα στο τέλος του άρθρου για πολλά περισσότερα παραδείγματα). Σημειώστε ότι ο χρήστης χειρίζεται τις μεταμορφώσεις με ένα ‘grab’ curso (πάνω αριστερά). Source: https://www.youtube.com/watch?v=k7sG4XY5rIc

Η μέθοδος χρησιμοποιεί ‘θερμικές χάρτες’ για να υποδείξει ποιες περιοχές μιας εικόνας πρέπει να βελτιωθούν ενώ το GAN εκτελεί το ίδιο σύνολο δεδομένων χιλιάδες (ή εκατοντάδες χιλιάδες) φορές. Οι θερμικοί χάρτες προορίζονται να βελτιώσουν την ποιότητα της εικόνας, λέγοντας στο GAN πού δεν πήγε καλά, ώστε η επόμενη προσπάθεια να είναι καλύτερη· αλλά, τυχαία, αυτό επίσης παρέχει einen ‘χάρτη’ του ολόκληρου λανθανόμενου χώρου που μπορεί να εξερευνηθεί με το ποντίκι.

Χωρική οπτική προσοχή που τονίζεται μέσω GradCAM, η οποία υποδηλώνει περιοχές που χρειάζονται προσοχή με την επιβολή φωτεινών χρωμάτων. Αυτά τα δείγματα παράγονται στο έργο των ερευνητών με μια προεπιλεγμένη υλοποίηση του StyleGan2. Source: https://arxiv.org/pdf/2112.00718.pdf

Χωρική οπτική προσοχή που τονίζεται μέσω GradCAM, η οποία υποδηλώνει περιοχές που χρειάζονται προσοχή με την επιβολή φωτεινών χρωμάτων. Source: https://arxiv.org/pdf/2112.00718.pdf

Το έγγραφο ονομάζεται Βελτίωση της Ισορροπίας του GAN με την Αύξηση της Χωρικής Συμπεριφοράς, και προέρχεται από ερευνητές στο Πανεπιστήμιο του Χονγκ Κονγκ και στο Εθνικό Πανεπιστήμιο της Αυστραλίας. Εκτός από το έγγραφο, βίντεο και άλλα υλικά μπορούν να βρεθούν στη σελίδα του έργου.

Το έργο είναι σε πρώιμο στάδιο και目前 περιορίζεται σε εικόνες χαμηλής ανάλυσης (256×256), αλλά είναι μια απόδειξη концепτού που υποσχέται να ανοίξει το ‘μαύρο κουτί’ του λανθανόμενου χώρου και έρχεται σε μια στιγμή που πολλά ερευνητικά έργα χτυπούν στην πόρτα με σκοπό τον έλεγχο της σύνθεσης εικόνων.

Αν και τέτοιες εικόνες είναι ελκυστικές (και μπορείτε να δείτε περισσότερες από αυτές, σε καλύτερη ανάλυση, στο εμβέδυσμα στο τέλος του άρθρου), αυτό που είναι ίσως πιο σημαντικό είναι ότι το έργο έχει βρει einen τρόπο να δημιουργήσει βελτιωμένη ποιότητα εικόνας και potenciálně να το κάνει γρηγορότερα, λέγοντας στο GAN συγκεκριμένα πού δεν πήγε καλά κατά τη διάρκεια της εκπαίδευσης.

Αλλά, όπως Ανταγωνιστικός υποδηλώνει, ένα GAN δεν είναι ένα ενιαίο ον, αλλά αντίθετα μια ανισόπαλη σύγκρουση μεταξύ εξουσίας και δουλειάς. Για να κατανοήσουμε ποιες βελτιώσεις οι ερευνητές έχουν κάνει σε αυτό το σημείο, ας δούμε πώς αυτός ο πόλεμος έχει χαρακτηριστεί μέχρι τώρα.

Η Θλιβερή Θέση του Γεννήτορα

Εάν έχετε कभ-либо στοίχειωθεί από την σκέψη ότι κάποιο νέο αντικείμενο που αγοράσατε παράχθηκε σε ένα εργοστάσιο σε μια εκμεταλλευμένη χώρα, ή είχε ένα αφεντικό ή πελάτη που σας έλεγε να ‘Το κάνετε ξανά!’ χωρίς ποτέ να σας λέει τι ήταν λάθος με την τελευταία σας προσπάθεια, σώστε μια σκέψη για τον Γεννήτορα μέρος του ενός Γεννητικού Ανταγωνιστικού Δικτύου.

Ο Γεννήτορας είναι το άλογο εργασίας που σας έχει ευχαριστήσει τα τελευταία πέντε χρόνια ή περίπου, βοηθώντας τα GAN να δημιουργήσουν φωτορεαλιστικά άτομα που δεν υπάρχουν, να αναβαθμίσουν παλιά βιντεοπαιχνίδια σε ανάλυση 4k, και να μετατρέψουν εκατονταετή βίντεο σε πλήρη χρώμα HD εξόδου σε 60fps, μεταξύ άλλων θαυμάσιων καινοτομιών του AI.

Από τη δημιουργία φωτορεαλιστικών προσώπων μη πραγματικών ανθρώπων μέχρι την αποκατάσταση αρχαίου βίντεο και την αναζωογόνηση αρχαίων βιντεοπαιχνιδιών, το GAN έχει BEEN πολύ απασχολημένο τα τελευταία χρόνια.

Από τη δημιουργία φωτορεαλιστικών προσώπων μη πραγματικών ανθρώπων μέχρι την αποκατάσταση αρχαίου βίντεο και την αναζωογόνηση αρχαίων βιντεοπαιχνιδιών, το GAN έχει BEEN πολύ απασχολημένο τα τελευταία χρόνια.

Ο Γεννήτορας εκτελεί όλα τα δεδομένα εκπαίδευσης ξανά και ξανά (όπως φωτογραφίες προσώπων, για να κάνει ένα GAN που μπορεί να δημιουργήσει φωτογραφίες τυχαίων, μη υπαρχόντων ανθρώπων), μια φωτογραφία κάθε φορά, για ημέρες, ή ακόμη και εβδομάδες, μέχρι να είναι σε θέση να δημιουργήσει εικόνες που είναι τόσο πιστές όσο οι γνήσιες φωτογραφίες που μελέτησε.

Πώς ξέρει ο Γεννήτορας ότι κάνει κάποια πρόοδο, κάθε φορά που προσπαθεί να δημιουργήσει μια εικόνα που είναι καλύτερη από την προηγούμενη προσπάθεια;

Ο Γεννήτορας έχει einen αφεντικό από την κόλαση.

Η Απαράδεκτη Αδιαφάνεια του Διακρίτη

Η δουλειά του Διακρίτη είναι να πει στον Γεννήτορα ότι δεν έκανε αρκετά καλά στην δημιουργία μιας εικόνας που είναι αυθεντική για τα πρωτότυπα δεδομένα, και να Το κάνει ξανά. Ο Διακρίτης δεν λέει στον Γεννήτορα τι ήταν λάθος με την τελευταία προσπάθεια· απλώς κοιτάζει την εικόνα, τη συγκρίνει με τις πηγαίες εικόνες (ξανά, ιδιωτικά), και αναθέτει στην εικόνα einen βαθμό.

Ο βαθμος ποτέ δεν είναι αρκετά καλός. Ο Διακρίτης δεν θα σταματήσει να λέει ‘Το κάνε ξανά’ μέχρι οι ερευνητές να τον σβήσουν (όταν κρίνουν ότι η πρόσθετη εκπαίδευση δεν θα βελτιώσει την έξοδο περαιτέρω).

Σε αυτόν τον τρόπο, απουσία οποιασδήποτε κατασκευαστικής κριτικής, και οπλισμένος μόνο με einen βαθμό του οποίου το μέτρο είναι ένα μυστήριο, ο Γεννήτορας πρέπει να μαντέψει τυχαία ποια μέρη ή πτυχές της εικόνας προκάλεσαν einen υψηλότερο βαθμό από πριν. Αυτό θα τον οδηγήσει σε πολλές ακόμη μη ικανοποιητικές οδούς πριν αλλάξει κάτι θετικά αρκετά για να πάρει einen υψηλότερο βαθμό.

Ο Διακρίτης ως Δάσκαλος και Μέντορ

Η καινοτομία που παρέχεται από την νέα έρευνα είναι ουσιαστικά ότι ο Διακρίτης τώρα υποδηλώνει στον Γεννήτορα ποια μέρη της εικόνας ήταν μη ικανοποιητικά, ώστε ο Γεννήτορας να μπορεί να επικεντρωθεί σε αυτές τις περιοχές στην επόμενη επανάληψη, και να μην απορρίψει τα τμήματα που είχαν βαθμολογηθεί υψηλότερα. Η φύση της σχέσης έχει γίνει από εχθρική σε συνεργατική.

Για να θεραπεύσει την ανισότητα της ενημέρωσης μεταξύ του Διακρίτη και του Γεννήτορα, οι ερευνητές χρησιμοποίησαν GradCAM ως einen μηχανισμό ικανό να μετατρέψει τις ενημερώσεις του Διακρίτη σε einen οπτικό βοήθημα για την επόμενη προσπάθεια του Γεννήτορα.

Η νέα ‘ισορροπία’ μέθοδος εκπαίδευσης ονομάζεται EqGAN. Για μέγιστη αναπαραγωγιμότητα, οι ερευνητές ενσωμάτωσαν υφιστάμενες τεχνικές και μεθόδους σε προεπιλεγμένες ρυθμίσεις, συμπεριλαμβανομένης της χρήσης της StyleGan2 αρχιτεκτονικής.

Η αρχιτεκτονική του EqGAN. Η χωρική κωδικοποίηση του Γεννήτορα είναι ευθυγραμμισμένη με την χωρική ευαισθησία του Διακρίτη, με τυχαία δείγματα χωρικών θερμικών χαρτών (δείτε την προηγούμενη εικόνα) κωδικοποιημένα πίσω στον γεννήτορα μέσω του χωρικού κωδικοποιητή (SEL). Το GradCAM είναι ο μηχανισμός με τον οποίο οι χάρτες προσοχής του Διακρίτη είναι διαθέσιμοι στον γεννήτορα.

Η αρχιτεκτονική του EqGAN. Η χωρική κωδικοποίηση του Γεννήτορα είναι ευθυγραμμισμένη με την χωρική ευαισθησία του Διακρίτη, με τυχαία δείγματα χωρικών θερμικών χαρτών (δείτε την προηγούμενη εικόνα) κωδικοποιημένα πίσω στον γεννήτορα μέσω του χωρικού κωδικοποιητή (SEL). Το GradCAM είναι ο μηχανισμός με τον οποίο οι χάρτες προσοχής του Διακρίτη είναι διαθέσιμοι στον γεννήτορα.

Το GradCAM παράγει θερμούς χάρτες (δείτε τις παραπάνω εικόνες) που αντανακλούν την κριτική του Διακρίτη για την τελευταία επανάληψη, και τα κάνει διαθέσιμα στον Γεννήτορα.

Όταν το μοντέλο έχει εκπαιδευτεί, ο χάρτης παραμένει ως ένα αποτέλεσμα αυτής της συνεργατικής διαδικασίας, αλλά μπορεί επίσης να χρησιμοποιηθεί για να εξερευνήσει τον τελικό λανθανόμενο κώδικα με τον διαδραστικό τρόπο που δείχνεται στο βίντεο του έργου (δείτε παρακάτω).

EqGAN

Το έργο χρησιμοποίησε eine σειρά από δημοφιλείς συνόλους δεδομένων, συμπεριλαμβανομένων των συνόλων δεδομένων LSUN Cat και Churches, καθώς και του FFHQ συνόλου δεδομένων. Το βίντεο παρακάτω επίσης περιλαμβάνει παραδείγματα χειρισμού προσώπων και γατών με χρήση του EqGAN.

Όλες οι εικόνες είχαν αναδιασταθεί σε 256×256 πριν από την εκπαίδευση του EqGAN στην επίσημη υλοποίηση του StyleGAN2. Το μοντέλο εκπαιδεύτηκε σε μια παρτίδα μεγέθους 64 σε 8 GPU μέχρι ο Διακρίτης να είχε εκτεθεί σε περισσότερες από 25 εκατομμύρια εικόνες.

Δοκιμάζοντας τα αποτελέσματα του συστήματος σε επιλεγμένα δείγματα με τη μέθοδο Frechet Inception Distance (FID), οι συγγραφείς καθόρισαν einen δείκτη που ονομάζεται Disequilibrium Indicator (DI) – το βαθμό στον οποίο ο Διακρίτης διατηρεί την γνώση του πλεονέκτημα έναντι του Γεννήτορα, με στόχο να στενεύσει αυτό το χάσμα.

Στα τρία συνόλους δεδομένων που εκπαιδεύτηκαν, ο νέος δείκτης έδειξε einen χρήσιμο πτώση μετά την κωδικοποίηση της χωρικής ευαισθησίας στον Γεννήτορα, με βελτιωμένη ισορροπία που αποδείχθηκε και από το FID και το DI.

Οι ερευνητές συνεχίζουν:

‘Ελπίζουμε ότι αυτό το έργο μπορεί να εμπνεύσει περισσότερα έργα για την επανεξέταση της ισορροπίας του GAN και να αναπτύξει περισσότερες καινοτόμες μεθόδους για να βελτιώσει την ποιότητα σύνθεσης εικόνων με την ελέγχηση της ισορροπίας του GAN. Θα πραγματοποιήσουμε επίσης περισσότερες θεωρητικές έρευνες σε αυτό το ζήτημα στο μέλλον.’

Και συνεχίζουν:

‘Ποιοτικά αποτελέσματα δείχνουν ότι η μέθοδός μας επιτυγχάνει να [παρακαλώ τον Γεννήτορα] να επικεντρωθεί σε συγκεκριμένες περιοχές. Πειράματα σε διάφορα συνόλους δεδομένων επικυρώνουν ότι η μέθοδός μας μετριάζει την ανισορροπία στην εκπαίδευση του GAN και βελτιώνει σημαντικά την συνολική ποιότητα σύνθεσης εικόνων. Το μοντέλο που προκύπτει με χωρική ευαισθησία επίσης επιτρέπει την διαδραστική χειρισμό της εξόδου εικόνας.’

Δείτε το βίντεο παρακάτω για περισσότερες λεπτομέρειες σχετικά με το έργο και περισσότερα παραδείγματα δυναμικής και διαδραστικής εξερεύνησης του λανθανόμενου χώρου σε ένα GAN.

 

 

11:12am 4th Dec 2021 – Διορθώθηκε ο σύνδεσμος για το GradCAM και καθαρίστηκε η γύρω αναφορά.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai