Η γωνία του Anderson

Η Adobe Research Επεκτείνει τις Διεπαφές GAN για την Επεξεργασία Προσώπων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Δεν είναι δύσκολο να κατανοήσουμε γιατί η ενσωμάτωση είναι ένα πρόβλημα στη σύνθεση εικόνων, επειδή είναι συχνά ένα πρόβλημα και σε άλλους τομείς της ζωής· για παράδειγμα, είναι πολύ πιο δύσκολο να αφαιρέσετε την κούρκουμα από ένα κάρυ παρά να απορρίψετε το αγγούρι σε ένα μπέργκερ, και είναι σχεδόν αδύνατο να αφαιρέσετε τη ζάχαρη από ένα φλιτζάνι καφέ. Ορισμένα πράγματα έρχονται σε πακέτο.

Ομοίως, η ενσωμάτωση είναι ένα εμπόδιο για τις αρχιτεκτονικές της σύνθεσης εικόνων που θα ήθελαν ιδανικά να分离σουν διαφορετικά χαρακτηριστικά και έννοιες όταν χρησιμοποιούν τη μηχανική μάθηση για να δημιουργήσουν ή να επεξεργαστούν πρόσωπα (ή σκύλους, πλοία, ή οποιοδήποτε άλλο domaine).

Εάν μπορούσατε να分离σετε νήματα όπως ηλικία, φύλο, χρώμα μαλλιών, χρώμα δέρματος, συναισθήματα, και così weiter, θα είχατε τις αρχές πραγματικής οργανικότητας και ευελιξίας σε ένα πλαίσιο που θα μπορούσε να δημιουργήσει και να επεξεργαστεί εικόνες προσώπων σε πραγματικά λεπτομερές επίπεδο, χωρίς να σύρετε ανεπιθύμητους “επιβιβάστες” σε αυτές τις μετατροπές.

Σε μέγιστη ενσωμάτωση (πάνω αριστερά), όλα που μπορείτε να κάνετε είναι να αλλάξετε την εικόνα ενός εκμαθημένου δικτύου GAN στην εικόνα ενός άλλου ατόμου.

Αυτό είναι αποτελεσματικά η χρήση της τελευταίας τεχνολογίας AI για την επεξεργασία εικόνων για να επιτύχετε κάτι που είχε ήδη λυθεί με άλλους τρόπους πάνω από τριάντα χρόνια πριν.

Με κάποιο βαθμό διαχωρισμού (‘Μέσος Διαχωρισμός’ στην προηγούμενη εικόνα), είναι δυνατό να thựcτούνται αλλαγές βασισμένες στο στυλ, όπως το χρώμα μαλλιών, η έκφραση, η εφαρμογή κοσμητικών, και περιορισμένη περιστροφή κεφαλής, μεταξύ άλλων.

Πηγή: FEAT: Face Editing with Attention, Φεβρουάριος 2022, https://arxiv.org/pdf/2202.02713.pdf

Πηγή: FEAT: Face Editing with Attention, Φεβρουάριος 2022, https://arxiv.org/pdf/2202.02713.pdf

Υπήρχε μια σειρά από προσπάθειες τα τελευταία δύο χρόνια για τη δημιουργία διαδραστικών περιβαλλόντων επεξεργασίας προσώπων που επιτρέπουν στον χρήστη να αλλάξει χαρακτηριστικά προσώπων με 滑竿 και άλλες παραδοσιακές διασύνδεσεις, ενώ διατηρούν τις βασικές λειτουργίες του στόχου όταν κάνουν προσθήκες ή αλλαγές. Ωστόσο, αυτό αποδείχθηκε μια πρόκληση λόγω της υποκείμενης ενσωμάτωσης χαρακτηριστικών/στυλ στην.latent χώρο του GAN.

Για παράδειγμα, το γυαλιά χαρακτηριστικό είναι συχνά συνυφασμένο με το ηλικία χαρακτηριστικό, που σημαίνει ότι η προσθήκη γυαλιών μπορεί επίσης να “γεράσει” το πρόσωπο, ενώ η γήρανση του προσώπου μπορεί να προσθέσει γυαλιά, ανάλογα με το βαθμό εφαρμογής διαχωρισμού υψηλού επιπέδου χαρακτηριστικών (δείτε ‘Δοκιμές’ παρακάτω για παραδείγματα).

Οι περισσότεροι αξιοσημείωτοι, ήταν σχεδόν αδύνατο να αλλάξετε το χρώμα μαλλιών και άλλα χαρακτηριστικά μαλλιών χωρίς να ξαναυπολογίσετε τα μαλλιά και τη διάθεση, που δίνει μια “σφυρίζοντας”, μεταβατική επίδραση.

Πηγή: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Πηγή: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Latent-to-Latent GAN Traversal

Μια νέα έρευνα της Adobe υποβεβλημένη για το WACV 2022 προσφέρει μια νέα προσέγγιση σε αυτά τα υποκείμενα ζητήματα σε ένα έγγραφο με τίτλο Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images.

Υποστηρικτικό υλικό από το έγγραφο Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Εδώ βλέπουμε ότι οι βασικές ιδιότητες στο εκμαθημένο πρόσωπο δεν σύρονται σε μη σχετικές αλλαγές. Δείτε το πλήρες βίντεο στο τέλος του άρθρου για καλύτερη λεπτομέρεια και ανάλυση. Πηγή: https://www.youtube.com/watch?v=rf_61llRH0Q

Υποστηρικτικό υλικό από το έγγραφο Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Εδώ βλέπουμε ότι οι βασικές ιδιότητες στο εκμαθημένο πρόσωπο δεν σύρονται σε μη σχετικές αλλαγές. Δείτε το πλήρες βίντεο στο τέλος του άρθρου για καλύτερη λεπτομέρεια και ανάλυση. Πηγή: https://www.youtube.com/watch?v=rf_61llRH0Q

Το έγγραφο είναι υπό την ηγεσία του Applied Scientist της Adobe Siavash Khodadadeh, μαζί με四 άλλους ερευνητές της Adobe και έναν ερευνητή από το Τμήμα Πληροφορικής του Πανεπιστημίου της Κεντρικής Φλόριντα.

Το κομμάτι είναι ενδιαφέρον κυρίως επειδή η Adobe έχει λειτουργήσει σε αυτόν τον χώρο για κάποιο χρόνο, και είναι ελκυστικό να φανταστεί αυτή η λειτουργικότητα να εισέρχεται σε ένα επόμενο έργο της Creative Suite· αλλά κυρίως επειδή η αρχιτεκτονική που δημιουργήθηκε για το έργο λαμβάνει μια διαφορετική προσέγγιση για τη διατήρηση της οπτικής ακεραιότητας σε einen επεξεργαστή προσώπων GAN ενώ γίνονται αλλαγές.

Οι συγγραφείς δηλώνουν:

‘[Εκπαιδεύουμε] ένα νευρωνικό δίκτυο για να thựcτούν μια μετατροπή latent-to-latent που βρίσκει την κωδικοποίηση latent που αντιστοιχεί στην εικόνα με το αλλαγμένο χαρακτηριστικό. Καθώς η τεχνική είναι one-shot, δεν βασίζεται σε μια γραμμική ή μη γραμμική τροχιά της σταδιακής αλλαγής των χαρακτηριστικών.’

‘Με την εκπαίδευση του δικτύου από το τέλος προς το αρχή σε ολόκληρη τη διαδικασία δημιουργίας, το σύστημα μπορεί να προσαρμοστεί στα latent χώρους των αρχιτεκτονικών γεννητριών off-the-shelf. Ιδιότητες συντήρησης, όπως η διατήρηση της ταυτότητας του ατόμου, μπορούν να κωδικοποιηθούν στη μορφή απωλειών εκπαίδευσης.’

‘Μόλις το δίκτυο latent-to-latent εκπαιδευτεί, μπορεί να ξαναχρησιμοποιηθεί για αυθαίρετες εικόνες χωρίς επανεκπαίδευση.’

Αυτό το τελευταίο σημαίνει ότι η προτεινόμενη αρχιτεκτονική φτάνει με τον τελικό χρήστη σε μια ολοκληρωμένη κατάσταση. Έχει ακόμα την ανάγκη να τρέξει ένα νευρωνικό δίκτυο σε τοπικούς πόρους, αλλά νέες εικόνες μπορούν να “πεταχτούν” και να είναι έτοιμες για αλλαγή σχεδόν αμέσως,既然 το πλαίσιο είναι αποσυνδεμένο αρκετά για να μην χρειάζεται περαιτέρω εκπαίδευση ειδικά για την εικόνα.

Φύλο και γενειάδα αλλάζουν καθώς οι 滑竿.plot τυχαίες και αυθαίρετες διαδρομές μέσω του latent χώρου, όχι μόνο 'σκούπισμα μεταξύ τελικών σημείων'.

Φύλο και γενειάδα αλλάζουν καθώς οι 滑竿.plot τυχαίες και αυθαίρετες διαδρομές μέσω του latent χώρου, όχι μόνο ‘σκούπισμα μεταξύ τελικών σημείων’. Δείτε το βίντεο στο τέλος του άρθρου για περισσότερες μετατροπές σε καλύτερη ανάλυση.

Μεταξύ των κύριων επιτευγμάτων στη δουλειά είναι η ικανότητα του δικτύου να “παγώσει” ταυτότητες στο latent χώρο αλλάζοντας μόνο το χαρακτηριστικό σε ένα στόχο διανύσματος, και παρέχοντας “ορθές όρους” που συντηρούν ταυτότητες που μετατρέπονται.

Ουσιαστικά, το προτεινόμενο δίκτυο είναι ενσωματωμένο σε μια ευρύτερη αρχιτεκτονική που διευθύνει όλα τα επεξεργασμένα στοιχεία, τα οποία περνούν από προ-εκπαιδευμένα компоненты με παγωμένα βάρη που δεν θα παράγουν απροσδόκητες πλευρικές επιπτώσεις στις μετατροπές.

Καθώς η διαδικασία εκπαίδευσης βασίζεται σε τριπλές που μπορούν να δημιουργηθούν είτε από μια εικόνα σπόρου (υπό GAN inversion) είτε από μια υπάρχουσα αρχική κωδικοποίηση latent, ολόκληρη η διαδικασία εκπαίδευσης είναι ανεξάρτητη, με τις σιωπηλές ενέργειες του συνηθισμένου εύρους συστημάτων ετικέτας και επιμέλειας σε τέτοιους συστήματα αποτελούνται στην αρχιτεκτονική. Στην πραγματικότητα, το νέο σύστημα χρησιμοποιεί off-the-shelf αναγνωριστές χαρακτηριστικών:

‘[Ο] αριθμός των χαρακτηριστικών που το δίκτυό μας μπορεί να ελέγξει ανεξάρτητα είναι μόνο περιορισμένος από τις ικανότητες του αναγνωριστικού(-ων) – αν έχεις einen αναγνωριστικό για ένα χαρακτηριστικό, μπορούμε να το προσθέσουμε σε αυθαίρετα πρόσωπα. Σε πειράματά μας, εκπαιδεύσαμε το δίκτυο latent-to-latent για να επιτρέψουμε την προσαρμογή 35 διαφορετικών χαρακτηριστικών προσώπων, περισσότερα από οποιαδήποτε προηγούμενη προσέγγιση.’

Το σύστημα ενσωματώνει μια πρόσθετη ασφάλεια κατά των μη επιθυμητών “πλευρικών” μετατροπών: στην απουσία μιας αίτησης για αλλαγή χαρακτηριστικού, το δίκτυο latent-to-latent θα χαρτογραφήσει ένα διανύσμα latent σε αυτό, αυξάνοντας περαιτέρω τη σταθερή διατήρηση της ταυτότητας του στόχου.

Επιγνώριση Προσώπων

Ένα επαναλαμβανόμενο ζήτημα με GAN και encoder/decoder-βασισμένες επεξεργαστές προσώπων των τελευταίων ετών ήταν ότι οι εφαρμοζόμενες μετατροπές τείνουν να υποβαθμίζουν την ομοιότητα. Για να καταπολεμήσουν αυτό, το έργο της Adobe χρησιμοποιεί ένα ενσωματωμένο δίκτυο αναγνώρισης προσώπων που ονομάζεται FaceNet ως δискριμινατέρ.

Αρχιτεκτονική του έργου, δείτε χαμηλά αριστερά για την ένταξη του FaceNet. Πηγή: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.

Αρχιτεκτονική του έργου, δείτε χαμηλά αριστερά για την ένταξη του FaceNet. Πηγή: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.

(Σε προσωπικό επίπεδο, αυτό φαίνεται μια ενθαρρυντική κίνηση προς την ενσωμάτωση τυποποιημένων συστημάτων αναγνώρισης προσώπων και ακόμη και αναγνώρισης εκφράσεων σε γεννητικά δίκτυα, ομολογουμένως ο καλύτερος τρόπος για την υπέρβαση της τυφλής αντιστοίχισης pixel-to-pixel που κυριαρχεί στις τρέχουσες αρχιτεκτονικές deepfake με το κόστος της πιστότητας της έκφρασης και άλλων σημαντικών τομέων στον τομέα της γεννήτριας προσώπων.)

Πρόσβαση σε Όλους τους Χώρους στο Latent Χώρο

Ένα άλλο εντυπωσιακό χαρακτηριστικό του πλαισίου είναι η ικανότητά του να ταξιδεύει αυθαίρετα μεταξύ πιθανών μετατροπών στο latent χώρο, κατά τη βούληση του χρήστη. Ορισμένα προηγούμενα συστήματα που παρείχαν διερευνητικές διεπαφές άφηναν συχνά τον χρήστη να “σκουπίζει” μεταξύ σταθερών χρονοσειρών μετατροπής χαρακτηριστικών – εντυπωσιακό, αλλά συχνά μια γραμμική ή προscriptive εμπειρία.

Από το Improving GAN Equilibrium by Raising Spatial Awareness: εδώ ο χρήστης σκουπίζει μέσα σε μια σειρά πιθανών σημείων μετάβασης μεταξύ δύο τοποθεσιών στο latent χώρο, αλλά μέσα στα όρια προ-εκπαιδευμένων τοποθεσιών στο latent χώρο. Για να εφαρμόσετε άλλους τύπους μετατροπής με βάση το ίδιο υλικό, απαιτείται αναδιαμόρφωση και/ή επανεκπαίδευση. Πηγή: https://genforce.github.io/eqgan/

Από το Improving GAN Equilibrium by Raising Spatial Awareness: εδώ ο χρήστης σκουπίζει μέσα σε μια σειρά πιθανών σημείων μετάβασης μεταξύ δύο τοποθεσιών στο latent χώρο, αλλά μέσα στα όρια προ-εκπαιδευμένων τοποθεσιών στο latent χώρο. Για να εφαρμόσετε άλλους τύπους μετατροπής με βάση το ίδιο υλικό, απαιτείται αναδιαμόρφωση και/ή επανεκπαίδευση. Πηγή: https://genforce.github.io/eqgan/

Συμπληρώνοντας την ικανότητα να είναι αποδεκτικός σε εντελώς νέες εικόνες του χρήστη, ο χρήστης μπορεί επίσης να “παγώσει” στοιχεία που θέλει να διατηρηθούν κατά τη διαδικασία μετατροπής. Με αυτόν τον τρόπο ο χρήστης μπορεί να διασφαλίσει ότι (για παράδειγμα) τα φόντα δεν μετακινούνται, ή ότι τα μάτια παραμένουν ανοιχτά ή κλειστά.

Δεδομένα

Το δίκτυο αναγνώρισης χαρακτηριστικών εκπαιδεύτηκε σε τρία δίκτυα: FFHQ, CelebAMask-HQ, και ένα τοπικό, GAN-γεννημένο δίκτυο που λήφθηκε με δειγματοληψία 400.000 διανυσμάτων από τον Z χώρο του StyleGAN-V2.

Εξω-διανομής (OOD) εικόνες φιλτράρονται, και χαρακτηριστικά εξάγονται χρησιμοποιώντας την API Face της Microsoft, με το αποτέλεσμα σύνολο να χωρίζεται 90/10, αφήνοντας 721.218 εικόνες εκπαίδευσης και 72.172 εικόνες δοκιμής για σύγκριση.

Δοκιμές

Αν και το πειραματικό δίκτυο ήταν αρχικά διαμορφωμένο για να φιλοξενήσει 35 πιθανές μετατροπές, αυτές μειώθηκαν σε οκτώ για να αναλάβουν αναλογική δοκιμή ενάντια στα συγκρίσιμα πλαισια InterFaceGAN, GANSpace, και StyleFlow.

Οι οκτώ επιλεγμένοι χαρακτηρισμοί ήταν Ηλικία, Φαλάκρα, Γενειάδα, Έκφραση, Φύλο, Γυαλιά, Πίτσα, και Yaw. Ήταν απαραίτητο να αναμορφωθούν τα ανταγωνιστικά πλαισια για ορισμένα από τα οκτώ χαρακτηριστικά που δεν είχαν προβλεφθεί στην αρχική διανομή, όπως η προσθήκη φαλάκρας και γενειάδας στο InterFaceGAN.

Όπως αναμενόταν, υψηλότερος βαθμός ενσωμάτωσης συνέβη στις ανταγωνιστικές αρχιτεκτονικές. Για παράδειγμα, σε ένα τεστ, το InterFaceGAN και το StyleFlow άλλαξαν το φύλο του υποκειμένου όταν ζητήθηκαν να εφαρμόσουν ηλικία:

Δύο από τα ανταγωνιστικά πλαισια έριξαν μια αλλαγή φύλου στην 'ηλικία' μετατροπή, αλλάζοντας επίσης το χρώμα μαλλιών χωρίς άμεση πρόθεση του χρήστη.

Δύο από τα ανταγωνιστικά πλαισια έριξαν μια αλλαγή φύλου στην ‘ηλικία’ μετατροπή, αλλάζοντας επίσης το χρώμα μαλλιών χωρίς άμεση πρόθεση του χρήστη.

Επιπλέον, δύο από τους ανταγωνιστές βρήκαν ότι τα γυαλιά και η ηλικία είναι αδιαχώριστα χαρακτηριστικά:

Γυαλιά και χρώμα μαλλιών αλλάζουν χωρίς επιπλέον χρέωση!

Γυαλιά και χρώμα μαλλιών αλλάζουν χωρίς επιπλέον χρέωση!

Δεν είναι μια ομοιόμορφη νίκη για την έρευνα: όπως μπορείτε να δείτε στο συνοδευτικό βίντεο στο τέλος του άρθρου, το πλαίσιο είναι το λιγότερο αποτελεσματικό όταν προσπαθεί να εξαγάγει διαφορετικές γωνίες (yaw), ενώ το GANSpace έχει ένα καλύτερο γενικό αποτέλεσμα για ηλικία και την επιβολή γυαλιών. Το πλαίσιο latent-to-latent ισοφάρισε με το GANSpace και το StyleFlow σχετικά με την προσθήκη πίτσας (γώνια κεφαλής).

Αποτελέσματα υπολογισμένα με βάση μια kalibrazione του MTCNN face detector. Χαμηλότερα αποτελέσματα είναι καλύτερα.

Αποτελέσματα υπολογισμένα με βάση μια kalibrazione του MTCNN face detector. Χαμηλότερα αποτελέσματα είναι καλύτερα.

Για περαιτέρω λεπτομέρειες και καλύτερη ανάλυση παραδειγμάτων, δείτε το συνοδευτικό βίντεο στο τέλος του άρθρου.

 

Πρώτη δημοσίευση 16ης Φεβρουαρίου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai