Η γωνία του Anderson

Εκτίμηση Προσώπου για Προβλέψη Ομορφιάς σε Ζωντανούς Ροές

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Image by ChatGPT, with superimposed image from the paper https://arxiv.org/pdf/2501.02509

Μέχρι σήμερα, η Προβλέψη Ομορφιάς Προσώπου (FAP) έχει μελετηθεί κυρίως στο πλαίσιο ψυχολογικής έρευνας, στη βιομηχανία ομορφιάς και κοσμετολογίας, και στο πλαίσιο χειρουργικής κοσμετολογίας. Είναι ένα δύσκολο πεδίο μελέτης, καθώς τα πρότυπα ομορφιάς τείνουν να είναι εθνικά και όχι παγκόσμια.

Αυτό σημαίνει ότι δεν υπάρχει ένα αποτελεσματικό dataset AI που να είναι εφικτό, επειδή οι μέσες τιμές που λαμβάνονται από δειγματοληψία προσώπων/βαθμολογιών από όλους τους πολιτισμούς θα είναι πολύ προκατειλημμένες (όπου οι πιο πυκνοκατοικημένες χώρες θα κερδίσουν πρόσθετη έλξη), ή θα είναι εφαρμόσιμες σε κανένα πολιτισμό (όπου η μέση τιμή πολλών φυλών/βαθμολογιών θα ισοδυναμεί με κανένα πραγματικό φύλο).

Αντίθετα, η πρόκληση είναι να αναπτύξουμε εννοιολογικές μεθοδολογίες και ροές εργασίας στις οποίες θα μπορούσαν να επεξεργαστούν δεδομένα συγκεκριμένα για κάθε χώρα ή πολιτισμό, για να επιτρέψουν την ανάπτυξη αποτελεσματικών μοντέλων FAP ανά περιοχή.

Οι περιπτώσεις χρήσης της FAP στην ομορφιά και την ψυχολογική έρευνα είναι khá περιφερειακές, ή ειδικές για την βιομηχανία. Έτσι, τα περισσότερα από τα datasets που έχουν δημιουργηθεί μέχρι σήμερα περιέχουν μόνο περιορισμένα δεδομένα, ή δεν έχουν δημοσιευθεί καθόλου.

Η εύκολη διαθεσιμότητα των online προβλεπτών ομορφιάς, που στοχεύουν κυρίως σε δυτικές κοινότητες, δεν αντιπροσωπεύουν απαραίτητα την κατάσταση της τέχνης στη FAP, η οποία φαίνεται να κυριαρχείται από την ανατολική Ασιατική έρευνα (πρωτίστως την Κίνα), και τα αντίστοιχα δεδομένα της Ανατολικής Ασίας.

Παραδείγματα από το dataset του 2020 'Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion'. Πηγή: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Παραδείγματα από το dataset του 2020 ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Πηγή: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Ευρύτερες εμπορικές χρήσεις για την εκτίμηση ομορφιάς περιλαμβάνουν εφαρμογές διαδικτυακού ραντεβού, και συστήματα γενικής νοημοσύνης που σχεδιάζονται για να ‘επιδιορθώσουν’ πραγματικές εικόνες ανθρώπων (καθώς τέτοιες εφαρμογές απαιτούν ένα ποσοτικό πρότυπο ομορφιάς ως μέτρο αποτελεσματικότητας).

Σχεδιασμός Προσώπου

Οι ελκυστικοί άνθρωποι συνεχίζουν να είναι một πολύτιμος πόρος στη διαφήμιση και την οικοδόμηση επιρροής, καθιστώντας τις οικονομικές ενθαρρύνσεις σε αυτούς τους τομείς μια σαφή ευκαιρία για την προώθηση των dataset και των πλαισίων FAP.

Για παράδειγμα, ένα μοντέλο AI που εκπαιδεύεται με δεδομένα του πραγματικού κόσμου για να αξιολογήσει και να βαθμολογήσει την ομορφιά του προσώπου θα μπορούσε потенτικά να αναγνωρίσει γεγονότα ή άτομα με υψηλή δυνατότητα για επιρροή στη διαφήμιση. Αυτή η ικανότητα θα ήταν ιδιαίτερα σχετική σε ζωντανούς βίντεο, όπου μετρήσεις όπως οι ‘ακολούθοι’ και τα ‘λайκ’ υπηρετούν μόνο ως σύνθετοι δείκτες της ικανότητας ενός ατόμου (ή ακόμη και ενός τύπου προσώπου) να προσελκύσει το κοινό.

Αυτό είναι ένα επιφανειακό μέτρο, φυσικά, και η φωνή, η παρουσίαση και η άποψη παίζουν επίσης σημαντικό ρόλο στη συγκέντρωση του κοινού. Έτσι, η συλλογή των dataset FAP απαιτεί ανθρώπινη επιτήρηση, καθώς και την ικανότητα να διακρίνει την ομορφιά του προσώπου από την ‘ψευδή’ ομορφιά (χωρίς την οποία, οι επηρεαστές εκτός του τομέα, όπως ο Alex Jones, θα μπορούσαν να επηρεάσουν την καμπύλη FAP για μια συλλογή που σχεδιάστηκε αποκλειστικά για την εκτίμηση της ομορφιάς του προσώπου).

LiveBeauty

Για να αντιμετωπίσουν την έλλειψη dataset FAP, ερευνητές από την Κίνα προσφέρουν το πρώτο μεγάλης κλίμακας dataset FAP, που περιέχει 100.000 εικόνες προσώπων, μαζί με 200.000 ανθρώπινες αναnotations που εκτιμούν την ομορφιά του προσώπου.

Δείγματα από το νέο dataset LiveBeauty. Πηγή: https://arxiv.org/pdf/2501.02509

Δείγματα από το νέο dataset LiveBeauty. Πηγή: https://arxiv.org/pdf/2501.02509

Ο τίτλος του dataset είναι LiveBeauty, και περιλαμβάνει 10.000 διαφορετικές ταυτότητες, όλες τις οποίες έχουν συλλεγεί από (απροσδιόριστους) ζωντανούς βίντεο σε Μάρτιο του 2024.

Οι συγγραφείς παρουσιάζουν επίσης το FPEM, μια νέα πολλαπλή FAP μέθοδο. Το FPEM ενσωματώνει ολιστικές γνώσεις προσώπου και πολλαπλά αισθητικά χαρακτηριστικά χαρακτηριστικά μέσω ενός Προσωπικού Πriors Attractiveness Module (PAPM), ενός Multi-Modal Attractiveness Encoder Module (MAEM) και ενός Cross-Modal Fusion Module (CMFM).

Το έγγραφο υποστηρίζει ότι το FPEM επιτυγχάνει την καλύτερη απόδοση στο νέο dataset LiveBeauty, και σε άλλα dataset FAP. Οι συγγραφείς σημειώνουν ότι η έρευνα έχει потенτικές εφαρμογές για την βελτίωση της ποιότητας του βίντεο, την σύσταση περιεχομένου και την επιδιόρθωση προσώπου σε ζωντανούς βίντεο.

Οι συγγραφείς επίσης υποσχέθηκαν να κάνουν το dataset διαθέσιμο ‘σύντομα’ – αν και πρέπει να αναγνωριστεί ότι οι περιορισμοί άδειας που υπάρχουν στο πηγή домένιου φαίνεται να μεταφέρονται στην πλειοψηφία των σχετικών έργων που θα χρησιμοποιήσουν το έργο.

Το νέο έγγραφο έχει τον τίτλο Προβλέψη Ομορφιάς Προσώπου σε Ζωντανούς Ροές: Ένας Νέος Πρότυπος και Πολλαπλή Μέθοδος, και προέρχεται από δέκα ερευνητές σε όλη την Alibaba Group και το Πανεπιστήμιο Shanghai Jiao Tong.

Μέθοδος και Δεδομένα

Από κάθε 10ωρη μετάδοση από τις ζωντανούς πλατφόρμες, οι ερευνητές συλλέγουν μια εικόνα ανά ώρα για τις πρώτες τρεις ώρες. Οι μεταδόσεις με τις υψηλότερες προβολές επιλέχθηκαν.

Τα συλλεγμένα δεδομένα υποβέθηκαν σε πολλαπλά στάδια προεπεξεργασίας. Το πρώτο από αυτά είναι μέτρηση μεγέθους περιοχής προσώπου, που χρησιμοποιεί το μοντέλο ανίχνευσης FaceBoxes του 2018 για να δημιουργήσει ένα οριοθέτη γύρω από τα χαρακτηριστικά του προσώπου. Η διαδικασία διασφαλίζει ότι η οριοθέτηση έχει το μικρότερο πλευρό μεγαλύτερο από 90 pixel, αποφεύγοντας μικρές ή ασαφείς περιοχές προσώπου.

Το δεύτερο βήμα είναι ανίχνευση θόλωσης, που εφαρμόζεται στην περιοχή του προσώπου χρησιμοποιώντας την διακύμανση του οπεραδόρ Laplacian στο κανάλι ύψους (Y) της εικόνας προσώπου. Η διακύμανση πρέπει να είναι μεγαλύτερη από 10, που βοηθά να φιλτράρει τις θολές εικόνες.

Το τρίτο βήμα είναι εκτίμηση στάσης προσώπου, που χρησιμοποιεί το μοντέλο εκτίμησης στάσης 3DDFA-V2 του 2021:

Παραδείγματα από το μοντέλο εκτίμησης στάσης 3DDFA-V2. Πηγή: https://arxiv.org/pdf/2009.09960

Παραδείγματα από το μοντέλο εκτίμησης στάσης 3DDFA-V2. Πηγή: https://arxiv.org/pdf/2009.09960

Εδώ, η διαδικασία διασφαλίζει ότι η γωνία πίτσας του αποκομμένου προσώπου δεν είναι μεγαλύτερη από 20 μοίρες, και η γωνία yaw δεν είναι μεγαλύτερη από 15 μοίρες, που αποκλείει τα πρόσωπα με ακραίες στάσεις.

Το τέταρτο βήμα είναι αξιολόγηση αναλογιών προσώπου, που χρησιμοποιεί επίσης τις ικανότητες διαχωρισμού του μοντέλου 3DDFA-V2, διασφαλίζοντας ότι η αναλογία της περιοχής προσώπου είναι μεγαλύτερη από 60% της εικόνας, αποκλείοντας εικόνες όπου το πρόσωπο δεν είναι προεξέχον.

Τέλος, το πέμπτο βήμα είναι αφαίρεση διπλότυπων χαρακτήρων, που χρησιμοποιεί ένα (ανεπίσημο) μοντέλο αναγνώρισης προσώπου, για περιπτώσεις όπου η ίδια ταυτότητα εμφανίζεται σε περισσότερες από μία από τις τρεις εικόνες που συλλέχθηκαν για μια 10ωρη βίντεο.

Ανθρώπινη Αξιολόγηση και Αναnotation

Είκοσι ανανεωτές αναγνωρίστηκαν, αποτελούμενοι από έξι άνδρες και 14 γυναίκες, που αντανακλούν τη δημογραφία της ζωντανούς πλατφόρμας*. Τα πρόσωπα εμφανίζονταν στην οθόνη 6,7 ιντσών του iPhone 14 Pro Max, υπό συνθήκες εργαστηρίου.

Η αξιολόγηση χωρίστηκε σε 200 συνεδρίες, каждая από τις οποίες χρησιμοποιούσε 50 εικόνες. Οι συμμετέχοντες ζητήθηκαν να βαθμολογήσουν την ομορφιά του προσώπου σε μια κλίμακα από 1 έως 5, με μια πέντελεπτη διακοπή μεταξύ κάθε συνεδρίας, και όλοι οι συμμετέχοντες συμμετείχαν σε όλες τις συνεδρίες.

Έτσι, όλη η συλλογή των 10.000 εικόνων αξιολογήθηκε από είκοσι ανθρώπινους συμμετέχοντες, φτάνοντας τις 200.000 αναnotations.

Ανάλυση και Προεπεξεργασία

Πρώτα, πραγματοποιήθηκε η μετα-οθόνη των συμμετεχόντων χρησιμοποιώντας το ποσοστό των εκτός-ορίων και το Σpearman’s Rank Correlation Coefficient (SROCC). Οι συμμετέχοντες των οποίων οι βαθμολογίες είχαν SROCC μικρότερο από 0,75 ή ένα ποσοστό εκτός-ορίων μεγαλύτερο από 2% θεωρήθηκαν αξιόπιστοι και αφαιρέθηκαν, με 20 συμμετέχοντες τελικά.

Ένα Μέσο Βαθμό Γνώμης (MOS) υπολογίστηκε για κάθε εικόνα προσώπου, με την κατά μέσο όρο των βαθμολογιών που λήφθηκαν από τους έγκυρους συμμετέχοντες. Το MOS χρησιμεύει ως το ground truth label ομορφιάς για κάθε εικόνα, και ο βαθμός υπολογίζεται με την κατά μέσο όρο όλων των ατομικών βαθμολογιών από κάθε έγκυρο συμμετέχοντα.

Τέλος, η ανάλυση των MOS κατανομών για όλα τα δείγματα, καθώς και για τα γυναικεία και ανδρικά δείγματα, έδειξε ότι παρουσίαζαν ένα Γκαουσιανό σχήμα, που είναι συνεπές με τις πραγματικές κατανομές ομορφιάς προσώπου:

Παραδείγματα από τις κατανομές MOS του LiveBeauty.

Παραδείγματα από τις κατανομές MOS του LiveBeauty.

Οι περισσότεροι άνθρωποι τείνουν να έχουν μέση ομορφιά προσώπου, με λιγότερους ανθρώπους στα άκρα της πολύ χαμηλής ή πολύ υψηλής ομορφιάς.

Επιπλέον, η ανάλυση των σκέωσης και κούρτωσης τιμών έδειξε ότι οι κατανομές χαρακτηρίζονταν από λεπτές ουρές και συγκεντρώθηκαν γύρω από τον μέσο όρο, και ότι η υψηλή ομορφιά ήταν πιο συχνή στα γυναικεία δείγματα στις ζωντανούς βίντεο.

Αρχιτεκτονική

Χρησιμοποιήθηκε μια στρατηγική εκπαίδευσης δύο σταδίων για το Facial Prior Enhanced Multi-modal μοντέλο (FPEM) και τη Φάση Υβριδικής Σύντηξης στο LiveBeauty, που χωρίστηκε σε τέσσερις μονάδες: ένα Προσωπικό Πriors Attractiveness Module (PAPM), ένα Multi-Modal Attractiveness Encoder Module (MAEM), ένα Cross-Modal Fusion Module (CMFM) και ένα Decision Fusion Module (DFM).

Σχέδιο για τη διαδικασία εκπαίδευσης του LiveBeauty.

Σχέδιο για τη διαδικασία εκπαίδευσης του LiveBeauty.

Το PAPM μονάδα λαμβάνει μια εικόνα ως είσοδο και εξάγει πολλαπλά οπτικά χαρακτηριστικά χρησιμοποιώντας einen Swin Transformer, και επίσης εξάγει χαρακτηριστικά προσώπου χρησιμοποιώντας ένα προ-εκπαιδευμένο FaceNet μοντέλο. Αυτά τα χαρακτηριστικά συνδυάστηκαν χρησιμοποιώντας ένα cross-attention block για να δημιουργήσουν ένα προσωπικό ‘ομορφιά’ χαρακτηριστικό.

Στην Προκαταρκτική Φάση Εκπαίδευσης, το MAEM χρησιμοποιεί μια εικόνα και κείμενο περιγραφές ομορφιάς, χρησιμοποιώντας CLIP για να εξάγει πολλαπλά αισθητικά σημασιολογικά χαρακτηριστικά.

Τα κείμενα περιγραφών είναι της μορφής ‘μια φωτογραφία ενός ατόμου με {a} ομορφιά’ (όπου {a} μπορεί να είναι κακή, χαμηλή, μέτρια, καλή ή τέλεια). Η διαδικασία εκτιμά την κοσινική ομοιότητα μεταξύ κειμένου και οπτικών ενσωματώσεων για να φτάσει σε ένα επίπεδο ομορφιάς.

Στη Φάση Υβριδικής Σύντηξης, το CMFM βελτιώνει τις κειμενικές ενσωματώσεις χρησιμοποιώντας το προσωπικό χαρακτηριστικό ομορφιάς που παράγεται από το PAPM, δημιουργώντας έτσι προσωπικές κειμενικές ενσωματώσεις. Στη συνέχεια, χρησιμοποιεί μια στρατηγική παλινδρόμησης ομοιότητας για να κάνει μια πρόβλεψη.

Τέλος, το DFM συνδυάζει τις μεμονωμένες προβλέψεις από το PAPM, το MAEM και το CMFM για να παράγει ένα ενιαίο, τελικό βαθμό ομορφιάς, με στόχο να επιτύχει μια σταθερή συναίνεση.

Συναρτήσεις Απώλειας

Για μετρήσεις απώλειας, το PAPM εκπαιδεύεται χρησιμοποιώντας μια L1 απώλεια, μια μέτρηση της απόλυτης διαφοράς μεταξύ του προβλεπόμενου βαθμού ομορφιάς και του πραγματικού (ground truth) βαθμού ομορφιάς.

Το MAEM μονάδα χρησιμοποιεί μια πιο σύνθετη συνάρτηση απώλειας που συνδυάζει μια απώλεια βαθμολογίας (LS) με μια συνδυασμένη απώλεια κατάταξης (LR). Η απώλεια κατάταξης (LR) αποτελείται από μια απώλεια πιστότητας (LR1) και μια δύο-κατεύθυνση απώλεια κατάταξης (LR2).

Η LR1 συγκρίνει τη σχετική ομορφιά των ζευγών εικόνων, ενώ η LR2 διασφαλίζει ότι η προβλεπόμενη πιθανότητα κατανομής των επιπέδων ομορφιάς έχει một πικό και μειώνεται και στις δύο κατευθύνσεις. Αυτή η συνδυασμένη προσέγγιση αποσκοπεί στην оптимποίηση τόσο της ακριβούς βαθμολογίας όσο και της σωστής κατάταξης των εικόνων με βάση την ομορφιά.

Το CMFM και το DFM εκπαιδεύονται χρησιμοποιώντας μια απλή L1 απώλεια.

Δοκιμές

Στις δοκιμές, οι ερευνητές έθεσαν το LiveBeauty ενάντια σε εννέα προηγούμενες προσεγγίσεις: ComboNet;: 2D-FAP;: REX-INCEP;: CNN-ER (που εμφανίζεται στο REX-INCEP): MEBeauty;: AVA-MLSP;: TANet;: Dele-Trans;: και EAT.

Μέθοδοι αναφοράς που συμμορφώνονται με το Image Aesthetic Assessment (IAA) πρωτόκολλο επίσης δοκιμάστηκαν. Αυτές ήταν ViT-B;: ResNeXt-50;: και Inception-V3.

Εκτός από το LiveBeauty, τα άλλα dataset που δοκιμάστηκαν ήταν SCUT-FBP5000 και MEBeauty. Παρακάτω, οι κατανομές MOS αυτών των dataset συγκρίνονται:

Κατανομές MOS των dataset αναφοράς.

Κατανομές MOS των dataset αναφοράς.

Αντίστοιχα, αυτά τα dataset αναφοράς χωρίστηκαν σε 60%-40% και 80%-20% για εκπαίδευση και δοκιμή, ξεχωριστά, για να διατηρηθεί η συνέπεια με τα πρωτόκολλα τους. Το LiveBeauty χωρίστηκε σε 90%-10%.

Για την αρχικοποίηση του μοντέλου στο MAEM, χρησιμοποιήθηκαν VT-B/16 και GPT-2 ως κωδικοποιητές εικόνας και κειμένου, αντίστοιχα, αρχικοποιημένα από τις ρυθμίσεις του CLIP. Για το PAPM, χρησιμοποιήθηκε ο Swin-T ως εκπαιδεύσιμος κωδικοποιητής εικόνας, σύμφωνα με SwinFace.

Χρησιμοποιήθηκε ο AdamW βελτιωτής, και ένας ρυθμιστής ταχύτητας μάθησης προγραμματιστής ρυθμίστηκε με γραμμική θέρμανση υπό einem σχήμα cosine annealing. Οι ταχύτητες μάθησης διέφεραν κατά τη διάρκεια των φάσεων εκπαίδευσης, αλλά κάθε μια είχε μέγεθος δείγματος 32, για 50 epochs.

Αποτελέσματα από τις δοκιμές

Αποτελέσματα από τις δοκιμές

Αποτελέσματα από τις δοκιμές στα τρία dataset FAP εμφανίζονται παραπάνω. Από αυτά τα αποτελέσματα, το έγγραφο αναφέρει:

‘Η προτεινόμενη μέθοδος μας επιτυγχάνει την πρώτη θέση και υπερβαίνει τη δεύτερη θέση κατά περίπου 0,012, 0,081, 0,021 σε όρους SROCC τιμών στο LiveBeauty, MEBeauty και SCUT-FBP5500 αντίστοιχα, που αποδεικνύει την υπεροχή της προτεινόμενης μεθόδου μας.

‘Οι μέθοδοι IAA είναι κατώτερες από τις μέθοδοι FAP, που φανερώνει ότι οι γενικές μέθοδοι αισθητικής αξιολόγησης παραβλέπουν τα χαρακτηριστικά προσώπου που εμπλέκονται στη υποκειμενική φύση της ομορφιάς του προσώπου, οδηγώντας σε κακή απόδοση στις εργασίες FAP.

‘Η απόδοση όλων των μεθόδων μειώνεται σημαντικά στο MEBeauty. Αυτό οφείλεται στο ότι τα δείγματα εκπαίδευσης είναι περιορισμένα και τα πρόσωπα είναι εθνοτικά διαφορετικά στο MEBeauty, που σημαίνει ότι υπάρχει eine μεγάλη ποικιλία στην ομορφιά του προσώπου.

‘Όλα αυτά τα παράγοντες καθιστούν την πρόβλεψη της ομορφιάς του προσώπου στο MEBeauty πιο δύσκολη.’

Ηθικές Συμμετοχές

Η έρευνα για την ομορφιά είναι μια δυνητικά διαιρετική αναζήτηση,既然 στην καθιέρωση υποτιθέμενων εμπειρικών προτύπων ομορφιάς, τέτοιες συστήματα τείνουν να ενισχύουν τις προκαταλήψεις γύρω από την ηλικία, το φύλο και πολλά άλλα τμήματα της έρευνας υπολογιστή που σχετίζονται με τους ανθρώπους.

Θα μπορούσε να υποστηριχθεί ότι ένα σύστημα FAP είναι εγγενώς προκατειλημμένο να ενισχύσει και να διατηρήσει τις μερικές και προκατειλημμένες προοπτικές της ομορφιάς. Αυτές οι κρίσεις μπορεί να προέρχονται από ανθρώπινες αναnotations – συχνά που διεξάγονται σε κλίμακες που είναι πολύ περιορισμένες για αποτελεσματική γενίκευση τομέα – ή από την ανάλυση των προτύπων προσοχής σε διαδικτυακά περιβάλλοντα όπως οι πλατφόρμες ροής, που είναι, επιχειρηματικά, μακράν από το να είναι μεριτοκρατικές.

 

* Το έγγραφο αναφέρεται στα ανώνυμα πηγή домένια/τα τόσο στο ενικό όσο και στο πληθυντικό.

Πρώτη δημοσίευση την Τετάρτη, 8 Ιανουαρίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai