Η γωνία του Anderson
SofGAN: Ένας Γεννήτωρ Προσώπου GAN που Προσφέρει Μεγαλύτερο Έλεγχο

Ερευνητές στη Σαγκάη και τις Ηνωμένες Πολιτείες έχουν αναπτύξει ένα σύστημα γεννήτωρα πορτρέτου με βάση το GAN που επιτρέπει στους χρήστες να δημιουργούν νέες προσωπικότητες με ένα επίπεδο ελέγχου που δεν ήταν διαθέσιμο μέχρι τώρα σε μεμονωμένα στοιχεία όπως τα μαλλιά, τα μάτια, τα γυαλιά, οι υφές και το χρώμα.
Για να δείξουν την ευελιξία του συστήματος, οι δημιουργοί έχουν παρέχει μια διεπαφή τύπου Photoshop όπου ο χρήστης μπορεί να σχεδιάσει trực tiếp στοιχεία σημασιολογικής αναγνώρισης που θα ερμηνευτούν σε πραγματιστική εικόνα και που μπορεί ακόμη και να ληφθεί με την σχεδίαση απευθείας πάνω σε υπάρχουσες φωτογραφίες.
Στο παρακάτω παράδειγμα, μια φωτογραφία του ηθοποιού Ντάνιελ Ράντκλιφ χρησιμοποιείται ως πρότυπο (και ο στόχος δεν είναι να παράγει ομοιότητα με αυτόν, αλλά μάλλον μια γενικά φωτορεαλιστική εικόνα). Όσο ο χρήστης συμπληρώνει διάφορα στοιχεία, συμπεριλαμβανομένων διακριτών πτυχών όπως τα γυαλιά, αυτά αναγνωρίζονται και ερμηνεύονται στην εικόνα εξόδου:

Χρήση μιας εικόνας ως υλικού σχεδίασης για ένα πορτρέτο SofGAN. Source: https://www.youtube.com/watch?v=xig8ZA3DVZ8
Το έγγραφο έχει τον τίτλο SofGAN: Ένας Γεννήτωρ Εικόνας Πορτρέτου με Δυναμική Στυλ και ηγείται από τους Anpei Chen και Ruiyang Liu, μαζί με δύο άλλους ερευνητές από το Πανεπιστήμιο ShanghaiTech και έναν από το Πανεπιστήμιο της Καλιφόρνιας στο Σαν Ντιέγκο.
Αποσύνδεση Χαρακτηριστικών
Η κύρια συνεισφορά του έργου δεν είναι τόσο η παροχή μιας φιλικής προς τον χρήστη διεπαφής, αλλά η «αποσύνδεση» των χαρακτηριστικών των μαθημένων χαρακτηριστικών του προσώπου, όπως η στάση και η υφή, που επιτρέπει στο SofGAN να παράγει επίσης πρόσωπα που είναι σε έμμεσες γωνίες προς την οπτική του φωτογράφου.

Ασυνήθιστο μεταξύ των γεννητών προσώπου με βάση τα Δίκτυα Αντιπαράθεσης, το SofGAN μπορεί να αλλάξει τη γωνία θέασης με τη βούληση, εντός των ορίων του πίνακα των γωνιών που παρέχεται στα δεδομένα εκπαίδευσης. Source: https://arxiv.org/pdf/2007.03780.pdf
Εφόσον οι υφές είναι τώρα αποσυνδεδεμένες από τη γεωμετρία, το σχήμα και η υφή του προσώπου μπορούν επίσης να χειριστούν ως ξεχωριστά αντικείμενα. Σε πραγματικότητα, αυτό επιτρέπει την αλλαγή φυλής ενός πηγαίου προσώπου, μια σκανδαλώδη πρακτική που τώρα έχει μια πιθανώς χρήσιμη εφαρμογή, για τη δημιουργία ισορροπημένων συνόλων δεδομένων μηχανικής μάθησης.

Το SofGAN υποστηρίζει επίσης την τεχνητή γήρανση και τη στυλιστική προσαρμογή που είναι συνεπής με τα χαρακτηριστικά σε ένα λεπτομερές επίπεδο που δεν έχει παρατηρηθεί σε παρόμοια συστήματα τμήματος > εικόνας όπως το GauGAN της NVIDIA και το σύστημα αναπαράστασης νευρικών δικτύων της Intel.

Το SofGAN μπορεί να εφαρμόσει τη γήρανση ως μια επαναλαμβανόμενη στυλ.
Μια άλλη καινοτομία για τη μεθοδολογία του SofGAN είναι ότι η εκπαίδευση δεν απαιτεί ζευγαρωμένα δεδομένα τμήματος / πραγματικών εικόνων, αλλά μπορεί να εκπαιδευτεί απευθείας σε μη ζευγαρωμένα δεδομένα του πραγματικού κόσμου.
Οι ερευνητές αναφέρουν ότι η αρχιτεκτονική «αποσύνδεσης» του SofGAN εμπνεύστηκε από παραδοσιακά συστήματα απόδοσης εικόνας, τα οποία αναλύουν τα μεμονωμένα στοιχεία μιας εικόνας. Σε εργασίες οπτικών εφέ, τα στοιχεία για ένα σύνθετο αναλύονται σε τα πιο λεπτά συστατικά, με ειδικούς αφιερωμένους σε κάθε στοιχείο.
Πεδίο Κατοχής Σημασιολογίας (SOF)
Για να επιτύχουν αυτό σε ένα πλαίσιο σύνθεσης εικόνας με βάση τη μηχανική μάθηση, οι ερευνητές ανέπτυξαν ένα πεδίο κατοχής σημασιολογίας (SOF), μια επέκταση του παραδοσιακού πεδίου κατοχής που αναγνωρίζει τα στοιχεία των πορτρέτων. Το SOF εκπαιδεύτηκε σε καλιμπρισμένα πολυοπτικά χάρτες σημασιολογικής αναγνώρισης, αλλά χωρίς καμία επίβλεψη εδάφους.

Πολλαπλές επαναλήψεις από ένα単ο χάρτη τμήματος (κάτω αριστερά).
Επιπλέον, χάρτες τμήματος 2D λαμβάνονται με τη μέθοδο ray-tracing της εξόδου του SOF, πριν υφανθούν από einen γεννήτore GAN. Οι «συνθετικοί» χάρτες σημασιολογικής αναγνώρισης κωδικοποιούνται επίσης σε ένα χαμηλό διαστατικό χώρο μέσω ενός τριστιβαίου κωδικοποιητή για να διασφαλιστεί η συνέχεια της εξόδου όταν αλλάζει η οπτική.
Το σχήμα εκπαίδευσης αναμιγνύει χωρικά δύο τυχαίες στυλ για κάθε σημασιολογική περιοχή:
Οι ερευνητές ισχυρίζονται ότι το SofGAN επιτυγχάνει μια χαμηλότερη απόσταση Frechet Inception (FID) από τις τρέχουσες εναλλακτικές προσεγγίσεις SOTA, καθώς και μια υψηλότερη μετρική Learned Perceptual Image Patch Similarity (LPIPS</a}).
Προηγούμενες προσεγγίσεις StyleGAN έχουν συχνά εμποδιστεί από την εναπόθεση χαρακτηριστικών, όπου τα στοιχεία που αποτελούν μια εικόνα είναι αδιαχώριστα δεμένα μεταξύ τους, προκαλώντας την εμφάνιση μη επιθυμητών στοιχείων μαζί με ένα επιθυμητό στοιχείο (π.χ. τα σκουλαρίκια μπορεί να εμφανιστούν όταν ένα σχήμα αυτιού αποδοθεί που ενημερώθηκε κατά την εκπαίδευση από μια εικόνα που είχε σκουλαρίκια).

Η μέθοδος ray-marching χρησιμοποιείται για τον υπολογισμό του όγκου των χαρτών τμήματος, επιτρέποντας πολλαπλές οπτικές.
Δεδομένα και Εκπαίδευση
Τρία σύνολα δεδομένων χρησιμοποιήθηκαν στην ανάπτυξη των verschiedenen υλοποιήσεων του SofGAN: CelebAMask-HQ, ένα αποθετήριο 30.000 υψηλής ανάλυσης εικόνων από το σύνολο δεδομένων CelebA-HQ· το Flickr-Faces-HQ της NVIDIA (FFHQ), που περιέχει 70.000 εικόνες, όπου οι ερευνητές ετικέτεψαν τις εικόνες με einen προ-εκπαιδευμένο αναλυτή προσώπου· και μια αυτοπαραγμένη ομάδα 122 σκαναρίσματος πορτρέτων με χειροκίνητα ετικετεμένα σημασιολογικά περιφέρειες.
Το SOF αποτελείται από τρία εκπαιδεύσιμα υπο-μονάδες – το hyper-net, έναν ray marcher (βλέπε εικόνα παραπάνω) και έναν ταξινομητή. Ο γεννήτωρας StyleGAN του έργου με την ονομασία Semantic Instance Wised (SIW) ρυθμίζεται παρόμοια με το StyleGAN2 σε ορισμένα σημεία. Η αυξανόμενη δεδομένων εφαρμόζεται μέσω τυχαίας κλιμάκωσης και περικοπής και η εκπαίδευση χαρακτηριστικών περιλαμβάνει κανονικοποίηση μονοπατιού κάθε τέσσερις βήματα. Η ολόκληρη διαδικασία εκπαίδευσης διήρκεσε 22 ημέρες για να φθάσει τις 800.000 επαναλήψεις σε τέσσερις RTX 2080 Ti GPU μέσω CUDA 10.1.
Το έγγραφο δεν αναφέρει τη ρύθμιση των καρτών 2080, που μπορούν να φιλοξενήσουν μεταξύ 11gb-22gb VRAM κάθε μία, που σημαίνει ότι το συνολικό VRAM που χρησιμοποιήθηκε για το καλύτερο μέρος του μήνα για την εκπαίδευση του SofGAN είναι κάπου μεταξύ 44Gb και 88Gb.
Οι ερευνητές παρατηρούν ότι αποδεκτά γενικευμένα, υψηλού επιπέδου αποτελέσματα άρχισαν να εμφανίζονται khá sớm στην εκπαίδευση, στις 1500 επαναλήψεις, τρεις ημέρες μετά την εκπαίδευση. Το υπόλοιπο της εκπαίδευσης ασχολήθηκε με την προβλέψιμη, αργή πορεία προς την απόκτηση λεπτών λεπτομερειών όπως τα μαλλιά και τα μάτια.
Το SofGAN γενικά επιτυγχάνει πιο πραγματιστικά αποτελέσματα από ένα單ο χάρτη τμήματος από αντίπαλες μεθόδους όπως το SPADE της NIVDIA και το Pix2PixHD, και το SEAN.
Παρακάτω είναι το βίντεο που κυκλοφόρησαν οι ερευνητές. Περαιτέρω αυτο-φιλοξενημένα βίντεο είναι διαθέσιμα στη σελίδα του έργου.














