Η γωνία του Anderson

Ένα Σύστημα AI που Μπορεί να Κάνει Εικόνες Ανθρώπων Πιο “Όμορφες”

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Background image: DALL-E 2 'Award-winning 8K photo of the most beautiful Caucasian catwalk model in the world' - https://labs.openai.com/s/kRXusxOR5GcYyb6pqZjNH2AA

Ερευνητές από την Κίνα έχουν αναπτύξει ένα νέο σύστημα βελτίωσης εικόνων βασισμένο σε τεχνητή νοημοσύνη που είναι ικανό να κάνει εικόνες ενός ατόμου πιο “όμορφες”, με βάση μια νέα προσέγγιση για ενίσχυση της μάθησης.

Η νέα προσέγγιση χρησιμοποιεί ένα 'δίκτυο πρόβλεψης ομορφιάς προσώπου' για να επαναλάβει πολλές παραλλαγές μιας εικόνας με βάση πολλούς παράγοντες, μεταξύ των οποίων η 'φωτισμός' και η στάση των ματιών μπορεί να είναι κρίσιμα στοιχεία. Εδώ οι αρχικές πηγές (στην αριστερή πλευρά κάθε στήλης) προέρχονται από το σύστημα EigenGAN, με τα νέα αποτελέσματα στη δεξιά πλευρά. Πηγή: https://arxiv.org/pdf/2208.04517.pdf

Η νέα προσέγγιση χρησιμοποιεί ένα ‘δίκτυο πρόβλεψης ομορφιάς προσώπου’ για να επαναλάβει πολλές παραλλαγές μιας εικόνας με βάση πολλούς παράγοντες, μεταξύ των οποίων η ‘φωτισμός’ και η στάση των ματιών μπορεί να είναι κρίσιμα στοιχεία. Πηγή: https://arxiv.org/pdf/2208.04517.pdf

Η τεχνική βασίζεται σε καινοτομίες που ανακαλύφθηκαν για τον γεννήτορά EigenGAN, ένα άλλο κινέζικο πρότζεκτ, από το 2021, που έκανε σημαντικά βήματα στην αναγνώριση και τον έλεγχο των ποικίλων σεμαντικών ιδιοτήτων στο.latent χώρο των Generative Adversarial Networks (GANs).

Ο γεννήτωρας EigenGAN του 2021 ήταν σε θέση να αναγνωρίσει υψηλού επιπέδου έννοιες όπως το 'χρώμα μαλλιών' στο.latent χώρο ενός γεννήτορα ανταγωνιστικών δικτύων. Η νέα εργασία βασίζεται σε αυτό το καινοτόμο εργαλείο για να παραδώσει ένα σύστημα που μπορεί να 'ομορφύνει' τις εικόνες πηγής, χωρίς να αλλάζει την αναγνωρίσιμη ταυτότητα – ένα πρόβλημα στις προηγούμενες προσεγγίσεις.

Ο γεννήτωρας EigenGAN του 2021 ήταν σε θέση να αναγνωρίσει υψηλού επιπέδου έννοιες όπως το ‘χρώμα μαλλιών’ στο.latent χώρο ενός γεννήτορα ανταγωνιστικών δικτύων. Πηγή: https://arxiv.org/pdf/2104.12476.pdf

Το σύστημα χρησιμοποιεί ένα ‘δίκτυο αισθητικής βαθμολογίας’ που προέρχεται από το SCUT-FBP5500 (SCUT), ένα σύνολο δεδομένων αναφοράς του 2018 για την πρόβλεψη ομορφιάς προσώπου, από το Πανεπιστήμιο Τεχνολογίας της Νότιας Κίνας στο Γκουανγκτζόου.

Από την εργασία του 2018 'SCUT-FBP5500: Ένα Διαφορετικό Σύνολο Δεδομένων για την Πρόβλεψη Ομορφιάς Προσώπου', η οποία πρόσφερε ένα 'δίκτυο πρόβλεψης ομορφιάς προσώπου' (FBP) που ήταν ικανό να βαθμολογεί τα πρόσωπα με βάση την αντιλαμβανόμενη ελκυστικότητα, αλλά δεν μπορούσε να μετατρέψει ή 'βελτιώσει' τα πρόσωπα.

Από την εργασία του 2018 ‘SCUT-FBP5500: Ένα Διαφορετικό Σύνολο Δεδομένων για την Πρόβλεψη Ομορφιάς Προσώπου’, η οποία πρόσφερε ένα ‘δίκτυο πρόβλεψης ομορφιάς προσώπου’ (FBP) που ήταν ικανό να βαθμολογεί τα πρόσωπα με βάση την αντιλαμβανόμενη ελκυστικότητα. Πηγή: https://arxiv.org/pdf/1801.06345.pdf

Αντιθέτως με τη νέα εργασία, το πρότζεκτ του 2018 δεν μπορεί να εκτελέσει μετασχηματισμούς, αλλά περιέχει αλγοριθμικές κρίσεις για 5.500 πρόσωπα, που παρέχονται από 60 ετικετών μεικτού φύλου (ισομερής διαίρεση). Αυτά έχουν ενσωματωθεί στο νέο σύστημα ως ένας αποτελεσματικός διακρίτης, για να ενημερώσουν μετασχηματισμούς που είναι πιθανό να βελτιώσουν την ‘ελκυστικότητα’ μιας εικόνας.

Ενδιαφέρον είναι ότι η νέα εργασία έχει τον τίτλο Attribute Controllable Beautiful Caucasian Face Generation by Aesthetics Driven Reinforcement Learning. Ο λόγος που όλα τα φύλα εκτός από το Καυκασιανό εξαιρούνται από το σύστημα (σκέψου επίσης ότι οι ερευνητές είναι Κινέζοι) είναι ότι τα δεδομένα πηγής για το SCUT παρουσιάζουν μια σημαντική κλίση προς τις ασιατικές πηγές (4.000 ισομερώς διαιρεμένα ασιατικά θηλυκά/αρσενικά, 1.500 ισομερώς διαιρεμένα Καυκασιανά θηλυκά/αρσενικά), καθιστώντας τον ‘μέσο άνθρωπο’ σε αυτό το σύνολο δεδομένων καστανόμαλλο και καστανόματι.

Σημαντικές Ιδιότητες

Για να καθορίσουν τους πρωταρχικούς συντελεστές που συμβάλλουν σε μια ‘ελκυστική’ φωτογραφία ενός ατόμου, οι ερευνητές έκαναν επίσης einen έλεγχο της επίδρασης διαφόρων αλλαγών στις εικόνες, σε σχέση με το πόσο αυτές οι αλλαγές αυξάνουν την αλγοριθμική αντίληψη της ‘ομορφιάς’. Βρήκαν ότι τουλάχιστον ένα από τα στοιχεία είναι πιο κεντρικό για την καλή φωτογραφία παρά για την καλή γενετική:

Εκτός από το φωτισμό, τα στοιχεία που είχαν τη μεγαλύτερη επίδραση στο βαθμό ομορφιάς ήταν τα μπάνγκς (τα οποία, σε περίπτωση ανδρών, μπορεί συχνά να είναι ισοδύναμα με το να έχουν πλήρη κεφαλή μαλλιών), η στάση του σώματος και η διάθεση των ματιών (όπου η αλληλεπίδραση με την οπτική γωνία της κάμερας είναι ένα πλεονέκτημα για την ελκυστικότητα).

(Σχετικά με το ‘χρώμα του κολλυρίου’, το νέο σύστημα, το οποίο μπορεί να λειτουργήσει αποτελεσματικά και για αρσενικά και θηλυκά παρουσιάσεις φύλου, δεν διακρίνει την εμφάνιση του φύλου, αλλά βασίζεται στο νέο σύστημα διακρίτη ως ένα ‘φίλτρο’ σε αυτό το σημείο)

Μέθοδος

Η συνάρτηση ανταμοιβής στο μηχανισμό ενίσχυσης της μάθησης στο νέο σύστημα τροφοδοτείται από μια απλή παλινδρόμηση πάνω από τα δεδομένα SCUT, η οποία εξόδους προβλέψεις ομορφιάς προσώπου.

Το σύστημα εκπαίδευσης επαναλαμβάνει τις εικόνες εισόδου (κάτω αριστερά στο σχήμα παρακάτω). Αρχικά, ένα προ-εκπαιδευμένο μοντέλο ResNet18 (εκπαιδευμένο στο ImageNet) εξάγει χαρακτηριστικά από τις πέντε идентικές (‘y’) εικόνες. Στη συνέχεια, μια πιθανή μετασχηματιστική ενέργεια προέρχεται από την κρυφή κατάσταση ενός πλήρως συνδεδεμένου επιπέδου (GRUCell, στο εικόνα παρακάτω), και οι μετασχηματισμοί εφαρμόζονται, οδηγώντας σε πέντε τροποποιημένες εικόνες που τροφοδοτούνται στο δίκτυο αισθητικής βαθμολογίας, των οποίων οι βαθμολογίες, με τον τρόπο του Δαρβίνου, θα καθορίσουν ποιες παραλλαγές θα αναπτυχθούν και ποιες θα απορριφθούν.

Μια ευρεία απεικόνιση της ροής εργασίας για το νέο σύστημα.

Μια απεικόνιση της ροής εργασίας για το νέο σύστημα.

Το δίκτυο αισθητικής βαθμολογίας χρησιμοποιεί ένα Efficient Channel Attention (ECA) μονάδα, ενώ μια προσαρμογή ενός προ-εκπαιδευμένου instance του EfficientNet-B4 έχει ανατεθεί να εξάγει 1.792 χαρακτηριστικά από κάθε εικόνα.

Μετά την κανονικοποίηση μέσω μιας συνάρτησης ενεργοποίησης ReLU, ένας 4-διάστατος διανυσματικός πίνακας λαμβάνεται πίσω από το ECA μονάδα, ο οποίος στη συνέχεια ισοπεδώνεται σε einen μονοδιάστατο διανυσματικό πίνακα μετά την ενεργοποίηση και προσαρμοστική μέση πισίνα. Τέλος, τα αποτελέσματα τροφοδοτούνται στο δίκτυο παλινδρόμησης, το οποίο ανακτά ένα βαθμό αισθητικής.

Μια ποιοτική σύγκριση της εξόδου του συστήματος. Στη κάτω σειρά, βλέπουμε το συσσωρευμένο άθροισμα όλων των ιδιοτήτων που έχουν αναγνωριστεί από τη μέθοδο EigenGAN και στη συνέχεια ενισχυμένες. Οι μέσες βαθμολογίες FID για τις εικόνες είναι στη αριστερή πλευρά των σειρών εικόνων (υψηλότερη είναι καλύτερη).

Μια ποιοτική σύγκριση της εξόδου του συστήματος.

Δοκιμές και Μελέτη Χρήστη

Πέντε παραλλαγές της προτεινόμενης μεθόδου αξιολογήθηκαν αλγοριθμικά (βλέπε εικόνα παρακάτω), με βαθμολογίες Fréchet inception distance (FID, αμφισβητούμενες σε ορισμένα τμήματα) που ανατέθηκαν σε σύνολο 1000 εικόνων που περάστηκαν από το σύστημα.

Οι ερευνητές σημειώνουν ότι η βελτίωση του φωτισμού έπραξε μια καλύτερη βαθμολογία ελκυστικότητας για τα άτομα στις φωτογραφίες από άλλες πιθανές αλλαγές (π.χ. στην πραγματική εμφάνιση του ατόμου που απεικονίζεται).

Επίσης, η δοκιμή του συστήματος με αυτόν τον τρόπο είναι περιορισμένη από τις ιδιομορφίες των δεδομένων SCUT, τα οποία δεν έχουν πολλά ‘λαμπρά χαμόγελα’, και οι συγγραφείς υποστηρίζουν ότι αυτό θα μπορούσε να υπερβαθμολογήσει την πιο τυπική ‘αινιγματική’ εμφάνιση στα δεδομένα, σε σύγκριση με τις πιθανές προτιμήσεις των πιθανών τελικών χρηστών (π.χ. σε αυτήν την περίπτωση, μια δυτική αγορά).

Ωστόσο,既然 το σύνολο δεδομένων SCUT δεν έχει πολλά ‘λαμπρά χαμόγελα’, και οι συγγραφείς υποστηρίζουν ότι αυτό θα μπορούσε να υπερβαθμολογήσει την πιο τυπική ‘αινιγματική’ εμφάνιση στα δεδομένα, σε σύγκριση με τις πιθανές προτιμήσεις των πιθανών τελικών χρηστών (π.χ. σε αυτήν την περίπτωση, μια δυτική αγορά).

Όμως,既然 όλο το σύστημα βασίζεται στις μέσες γνώμες μόνο 60 ατόμων (στο έγγραφο EigenGAN), και既然 η ποιότητα που μελετάται είναι μακράν εμπειρική, θα μπορούσε να υποστηριχθεί ότι η διαδικασία είναι πιο σωστή από τα δεδομένα.

Αν και αναφέρεται πολύ σύντομα στο έγγραφο, εικόνες από το EigenGAN και τις πέντε παραλλαγές του συστήματος παρουσιάστηκαν επίσης σε μια περιορισμένη μελέτη χρήστη (οκτώ συμμετέχοντες), οι οποίοι ζητήθηκαν να επιλέξουν την ‘καλύτερη εικόνα’ (η λέξη ‘ελκυστική’ αποφεύχθηκε).

Πάνω, η διεπαφή που παρουσιάστηκε στη μικρή μελέτη: κάτω, τα αποτελέσματα.

Πάνω, η διεπαφή που παρουσιάστηκε στη μικρή μελέτη: κάτω, τα αποτελέσματα.

Τα αποτελέσματα δείχνουν ότι η έξοδος του νέου συστήματος πέτυχε τον υψηλότερο βαθμό επιλογής μεταξύ των συμμετεχόντων (‘MAES’ στην εικόνα παραπάνω).

Η (Ανέμελη;) Διώξη της Ομορφιάς

Η χρησιμότητα ενός τέτοιου συστήματος είναι δύσκολο να καθοριστεί, παρά την εμφάνιση ενός σημαντικού τόπου των προσπαθειών σε Κίνα προς αυτούς τους στόχους. Κανένας δεν περιγράφεται στην νέα δημοσίευση.

Η προηγούμενη εργασία EigenGAN υποδηλώνει* ότι ένα σύστημα αναγνώρισης ομορφιάς θα μπορούσε να χρησιμοποιηθεί σε συστήματα σύστασης μακιγιάζ προσώπου, αισθητική χειρουργική, ομορφιά προσώπου, ή αναζήτηση εικόνων με βάση το περιεχόμενο.

Προφανώς, μια τέτοια προσέγγιση θα μπορούσε επίσης να χρησιμοποιηθεί σε ιστοσελίδες γνωριμιών, από τους τελικούς χρήστες, για να ‘βελτιώσουν’ τις δικές τους φωτογραφίες προφίλ σε μια εγγυημένη ‘τυχερή λήψη’, ως εναλλακτική λύση για την उपयποίηση παλαιών φωτογραφιών, ή φωτογραφιών αλλού.

Επίσης, οι ιστοσελίδες γνωριμιών θα μπορούσαν να ‘βαθμολογούν’ τους πελάτες τους για να δημιουργήσουν βαθμολογίες και ακόμη και περιορισμένες τάξεις, хотя αυτό θα λειτουργούσε μόνο μέσω μιας αυθεντικής απεικόνισης, και όχι μέσω υποβεβλημένων φωτογραφιών (οι οποίες θα μπορούσαν επίσης να ‘βελτιωθούν’ από τους πελάτες, εάν η προσέγγιση γίνει δημοφιλής).

Στην διαφήμιση, μια αλγοριθμική μέθοδος για την αξιολόγηση της ομορφιάς (μια τεχνολογία που προβλέφθηκε από τον αείμνηστο συγγραφέα επιστημονικής φαντασίας Michael Crichton στο σινεματικό του έργο Looker) θα μπορούσε να χρησιμοποιηθεί για να επιλέξει την μη-βελτιωμένη δημιουργική έξοδο που είναι πιο πιθανό να εμπλακεί με το στόχο κοινό, ενώ η ικανότητα να μεγιστοποιήσει την αισθητική επίδραση των εικόνων προσώπου, χωρίς να τις υπερβαίνει στην μορφή των deepfakes, θα μπορούσε να αυξήσει τις ήδη αποτελεσματικές εικόνες που προορίζονται για να προσελκύσουν το κοινό.

Η νέα εργασία υποστηρίζεται από το Εθνικό Ίδρυμα Φυσικών Επιστημών της Κίνας, το Ανοικτό Πρόγραμμα του Κρατικού Εργαστηρίου Διαχείρισης και Ελέγχου Συμπλεγμάτων Συστημάτων, και το Πρόγραμμα Ερευνών Φιλοσοφίας και Κοινωνικών Επιστημών από το Υπουργείο Παιδείας της Κίνας, μεταξύ άλλων υποστηρικτών.

 

* Πολλές από τις συστάσεις του εγγράφου EigenGAN δείχνουν προς ένα εμπορικά διαθέσιμο βιβλίο του 2016 με τίτλο ‘Μοντέλα Υπολογιστή για την Ανάλυση Ομορφιάς Προσώπου’, αντί για ακαδημαϊκές πηγές.

Πρώτη δημοσίευση 11ης Αυγούστου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai