Η γωνία του Anderson

Επεξεργασία του Latent Space ενός GAN με ‘Blobs’

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Νέα έρευνα από το UC Berkeley και την Adobe (ADBE ) προσφέρει έναν τρόπο για την άμεση επεξεργασία του υπερρεαλιστικού περιεχομένου που μπορεί να δημιουργηθεί από ένα Generative Adversarial Network (GAN), αλλά το οποίο συνήθως δεν μπορεί να ελεγχθεί, να animεται ή να χειρίζεται ελεύθερα με τον τρόπο που είναι οικείος στους χρήστες του Photoshop και τους ειδικούς του CGI.

Ο τίτλος BlobGAN, η μέθοδος περιλαμβάνει τη δημιουργία ενός πλέγματος από ‘blobs’ – μαθηματικές κατασκευές που αντιστοιχούν trực tiếp στο περιεχόμενο του latent space του GAN.

Μετακινώντας τα blobs, μπορείτε να μετακινήσετε τα ‘αντικείμενα’ σε μια σκηνή, με έναν τρόπο που είναι πιο κοντά στις μεθόδους του CGI και του CAD παρά στις τρέχουσες προσπάθειες για την χαρτογράφηση και τον έλεγχο του latent space του GAN:

Επεξεργασία σκηνής με BlobGAN: καθώς τα 'blobs' μετακινούνται από τον χρήστη, η διάταξη των.latent αντικειμένων και στυλ στο GAN αλλάζει αντίστοιχα. Για περισσότερα παραδείγματα, δείτε το συνοδευτικό βίντεο, ενσωματωμένο στο τέλος του άρθρου, ή στο https://www.youtube.com/watch?v=KpUv82VsU5k

Επεξεργασία σκηνής με BlobGAN: καθώς τα ‘blobs’ μετακινούνται από τον χρήστη, η διάταξη των.latent αντικειμένων και στυλ στο GAN αλλάζει αντίστοιχα. Για περισσότερα παραδείγματα, δείτε το συνοδευτικό βίντεο, ενσωματωμένο στο τέλος του άρθρου, ή στο https://www.youtube.com/watch?v=KpUv82VsU5k

Από τη στιγμή που τα blobs αντιστοιχούν σε ‘αντικείμενα’ στη σκηνή που χαρτογραφείται στο latent space του GAN, όλα τα αντικείμενα είναι disentangled a priori, καθιστώντας δυνατή την αλλαγή τους ατομικά:

Τα αντικείμενα μπορούν να αναδιασταθούν, να συρρικνωθούν, να κλωνοποιηθούν και να αφαιρεθούν, μεταξύ άλλων λειτουργιών.

Τα αντικείμενα μπορούν να αναδιασταθούν, να συρρικνωθούν, να κλωνοποιηθούν και να αφαιρεθούν, μεταξύ άλλων λειτουργιών.

Όπως και με οποιοδήποτε αντικείμενο σε λογισμικό επεξεργασίας φωτογραφιών (ή ακόμη και σε λογισμικό επεξεργασίας κειμένου), ένα blob μπορεί να διπλασιαστεί και στη συνέχεια να χειριστεί:

Τα blobs μπορούν να διπλασιαστούν στη διεπαφή, και οι αντίστοιχες.latent αναπαραστάσεις θα 'αντιγραφούν και θα κολληθούν'. Πηγή: https://dave.ml/blobgan/#results

Τα blobs μπορούν να διπλασιαστούν στη διεπαφή, και οι αντίστοιχες.latent αναπαραστάσεις θα ‘αντιγραφούν και θα κολληθούν’. Πηγή: https://dave.ml/blobgan/#results

Το BlobGAN μπορεί επίσης να αναλύσει νέες, επιλεγμένες εικόνες στο latent space του:

Με το BlobGAN, δεν χρειάζεται να ενσωματώσετε εικόνες που θέλετε να χειριστείτε直接 στο σύνολο δεδομένων και στη συνέχεια να ψάχνετε για τους κωδικούς τους, αλλά μπορείτε να εισαγάγετε επιλεγμένες εικόνες κατά βούληση και να τις χειριστείτε. Οι φωτογραφίες που τροποποιούνται εδώ είναι μεταγενέστερες εισαγωγές του χρήστη. Πηγή: https://dave.ml/blobgan/#results

Με το BlobGAN, δεν χρειάζεται να ενσωματώσετε εικόνες που θέλετε να χειριστείτε直接 στο σύνολο δεδομένων και στη συνέχεια να ψάχνετε για τους κωδικούς τους, αλλά μπορείτε να εισαγάγετε επιλεγμένες εικόνες κατά βούληση και να τις χειριστείτε. Πηγή: https://dave.ml/blobgan/#results

Περισσότερα αποτελέσματα μπορούν να δουν εδώ, και στο συνοδευτικό βίντεο του YouTube (ενσωματωμένο στο τέλος του άρθρου). Υπάρχει επίσης ένα διαδραστικό Colab demo*, και ένα GitHub repo**.

Αυτό το είδος οργανωτικής δομής και εμβέλειας μπορεί να φαίνεται ναίβ σε μια εποχή μετά το Photoshop, και τα πακέτα παραμετρικού λογισμικού όπως το Cinema4D και το Blender έχουν επιτρέψει στους χρήστες να δημιουργούν και να προσαρμόζουν 3D κόσμους για δεκαετίες· αλλά αντιπροσωπεύει μια υποσχόμενη προσέγγιση για την εξημέρωση των εκκεντρικοτήτων και της ακαδημαϊκής φύσης του latent space σε ένα Generative Adversarial Network, με τη χρήση proxy οντοτήτων που αντιστοιχούν σε κωδικούς.

Οι συγγραφείς ισχυρίζονται:

‘Σε μια δύσκολη πολλαπλή-κατηγορία βάση δεδομένων εσωτερικών σκηνών, το BlobGAN υπερτερεί του Style-GAN2 στη ποιότητα εικόνας όπως μετράται από το FID.’

Το έγγραφο έχει τον τίτλο BlobGAN: Spatially Disentangled Scene Representations, και γράφτηκε από δύο ερευνητές από το UC Berkeley, μαζί με τρεις από την Adobe Research.

Μεσάζοντας

Το BlobGAN φέρνει ένα νέο парадίγμα στη σύνθεση εικόνων GAN. Προηγούμενες προσεγγίσεις για την αντιμετώπιση διακριτών οντοτήτων στο latent space, το νέο έγγραφο σημειώνει, έχουν είτε ήταν ‘top-down’ ή ‘bottom up’.

Μια top-down μέθοδος σε ένα GAN ή einen κλάσης εικόνας αντιμετωπίζει εικόνες σκηνών ως κλάσεις, όπως ‘δωμάτιο’, ‘εκκλησία’, ‘πρόσωπο’, κ.λπ. Αυτός ο τύπος ζεύγους κειμένου/εικόνας ενεργοποιεί ένα νέο поколείο πλαισίων σύνθεσης εικόνων multimodal.

Οι bottom-up προσεγγίσεις, αντίθετα, χαρτογραφούν κάθε pixel σε μια εικόνα σε μια κλάση, ετικέτα ή κατηγορία. Αυτές οι προσεγγίσεις χρησιμοποιούν διάφορες τεχνικές, αν και η σεματική διαίρεση είναι ένα δημοφιλές τρέχον ερευνητικό νήμα.

Οι συγγραφείς σχολιάζουν:

‘Και οι δύο δρόμοι φαίνονται μη ικανοποιητικοί επειδή κανείς δεν μπορεί να προσφέρει εύκολους τρόπους για να συζητήσει για μέρη της σκηνής ως οντότητες. Τα μέρη της σκηνής είναι είτε ενσωματωμένα σε einen ενιαίο entangled latent vector (top-down), ή πρέπει να ομαδοποιηθούν μαζί από ατομικές ετικέτες pixel (bottom-up).’

Αντίθετα, το BlobGAN προσφέρει ένα απροσδιόριστο mid-level representation, ή proxy πλαίσιο για γενετικά μοντέλα.

Το δίκτυο διαμόρφωσης αντιστοιχεί σε τοπικά (και ελεγχόμενα) 'blob' οντότητες σε κωδικούς. Οι χρωματισμένες κύκλοι στο κέντρο αποτελούν einen 'blob χάρτη'. Πηγή: https://arxiv.org/pdf/2205.02837.pdf

Το δίκτυο διαμόρφωσης αντιστοιχεί σε τοπικά (και ελεγχόμενα) ‘blob’ οντότητες σε κωδικούς. Οι χρωματισμένες κύκλοι στο κέντρο αποτελούν einen ‘blob χάρτη’. Πηγή: https://arxiv.org/pdf/2205.02837.pdf

Τα Gaussian (δηλαδή noise-βασισμένα) blobs είναι διατεταγμένα, και αντιπροσωπεύουν ένα μπουκάλι στο αρχιτεκτονικό σχέδιο που αντιστοιχεί σε κάθε οντότητα, λύνοντας το μεγαλύτερο εμπόδιο που υπάρχει στην επεξεργασία περιεχομένου GAN: disentanglement (αυτό也是 ένα πρόβλημα για αρχιτεκτονικές που βασίζονται σε autoencoder).

Οι συγγραφείς σημειώνουν με κάποια έκπληξη ότι το σύστημα μαθαίνει να αναλύει σκηνές σε διαμορφώσεις και οντότητες μέσω ενός off-the-shelf discriminator που δεν χρησιμοποιεί ρητές ετικέτες.

Αρχιτεκτονική και Δεδομένα

Οι οντότητες στο blob χάρτη μετατρέπονται σε εικόνες μέσω ενός αναθεωρημένου StyleGAN2-παράγωγου δικτύου, σε μια προσέγγιση που παίρνει έμπνευση από προηγούμενη έρευνα της NVIDIA (NVDA ).

Ένα αναθεωρημένο StyleGAN 2 παράγωγο από την NVIDIA Research. Κάποιες αρχές σε αυτή τη δουλειά υιοθετήθηκαν ή προσαρμόστηκαν για το BlobGAN. Πηγή: https://arxiv.org/pdf/1912.04958.pdf

Ένα αναθεωρημένο StyleGAN 2 παράγωγο από την NVIDIA Research. Κάποιες αρχές σε αυτή τη δουλειά υιοθετήθηκαν ή προσαρμόστηκαν για το BlobGAN. Πηγή: https://arxiv.org/pdf/1912.04958.pdf

Το StyleGAN 2 τροποποιείται στο BlobGAN για να δέχεται εισαγωγή από το blob χάρτη αντί για einen seul global vector, όπως είναι συνήθως η περίπτωση.

Μια σειρά από χειρισμούς που είναι δυνατοί με το BlobGAN, συμπεριλαμβανομένης της 'αυτοσυμπλήρωσης' ενός δωματίου, και της αναδιάταξης και της επανατοποθέτησης των στοιχείων στο δωμάτιο. Στη σειρά κάτω, βλέπουμε την εργαλειοθήκη που επιτρέπει αυτό - τον blob χάρτη.

Μια σειρά από χειρισμούς που είναι δυνατοί με το BlobGAN, συμπεριλαμβανομένης της ‘αυτοσυμπλήρωσης’ ενός δωματίου, και της αναδιάταξης και της επανατοποθέτησης των στοιχείων στο δωμάτιο.

Με ανάλογο τρόπο, αντί να φέρουμε ένα τεράστιο και σύνθετο κτίριο (τον latent space) σε ύπαρξη όλα μαζί, και στη συνέχεια να πρέπει να εξερευνήσουμε τους ατελείωτους δρόμους του, το BlobGAN στέλνει τα στοιχεία του κτιρίου από την αρχή, και πάντα ξέρει πού είναι. Αυτή η διαχωριστική διαδικασία του περιεχομένου και της τοποθεσίας είναι η κύρια καινοτομία της εργασίας.

 

* Δεν ήταν λειτουργικό την ώρα της γραφής
** Ο κώδικας δεν είχε δημοσιευθεί την ώρα της γραφής

 

Πρώτη δημοσίευση 8ης Μαΐου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai