Η γωνία του Anderson
Η καταδίωξη της ομορφιάς από την IA

Ένα νέο σύστημα αξιολόγησης ομορφιάς που βασίζεται στην IA βαθμολογεί πόσο ελκυστικές εμφανίζονται τα πρόσωπα, ενώ εκπαιδεύεται ταχύτερα από τα τυπικά μοντέλα βαθιάς μάθησης, потенτικά καθιστώντας την μεγάλης κλίμακας αυτοματοποιημένη βαθμολόγηση της ομορφιάς πιο πρακτική.
Η πρόβλεψη της ομορφιάς του προσώπου (FBP) είναι ένα μεγάλο επιχείρημα, και ένα αρκετά ισχυρό νήμα στη βιβλιογραφία της έρευνας. Παρόλο που παραβιάζει πρακτικά κάθε αρχή πίσω από την αντιμετώπιση των προκαταλήψεων στην IA και τις πρακτικές της μηχανικής μάθησης, και παρόλο που σε πολλές περιπτώσεις υποστηρίζει την αντικειμενοποίηση και τον μειωτισμό στις αλγοριθμικές αντιλήψεις των γυναικών, ενδιαφέρει还是 το ενδιαφέρον plusieurs δισεκατομμυρίων δολαρίων βιομηχανιών, τις περισσότερες από τις οποίες στοχεύουν trực tiếp στις γυναίκες, όπως η κοσμητική, η χειρουργική του προσώπου, η ζωντανή μετάδοση και η μόδα, μεταξύ άλλων:

Γυναίκες βαθμολογημένες από 1-5, από τη μελέτη ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Πηγή
Πέρα από αυτές τις φανερές γυναικοκεντρικές επιχειρήσεις, η διαφήμιση και πολλές άλλες βιομηχανίες, συμπεριλαμβανομένων του ψυχαγωγικού και του εκδοτικού τομέα, έχουν αξιοσημείωτα στοιχήματα στην κατανόηση του τι βρίσκουν και οι άνδρες και οι γυναίκες ‘ελκυστικό’, αναγκαστικά σε μια περί-πολιτισμική βάση.
Ο fatto ότι οι συλλογικές αντιλήψεις της ομορφιάς ποικίλλουν σε διαφορετικές περιοχές σημαίνει ότι δεν μπορούν να ληφθούν οριστικά παγκοσμίως εφαρμόσιμα σύνολα δεδομένων, και ότι η νέα έρευνα πρέπει είτε να παραμείνει τοπική, είτε να επικεντρωθεί σε ‘υψηλό-επίπεδο’ μεθόδους που μπορούν να εφαρμοστούν σε διάφορες πολιτισμικές δεδομένες.

Μια διεπαφή για ένα σύστημα αξιολόγησης ομορφιάς του προσώπου για το έργο SCUT-FBP του 2015. Πηγή
Συχνά, η γεωγραφική τοποθεσία δεν είναι η μόνη περιορισμός,既然 η ομορφιά-εστιασμένες βάσεις δεδομένων μπορεί να πλήττονται να παρέχουν ίση αποτελεσματικότητα σε διαφορετικά φύλα, ή μπορεί να έχουν δημιουργηθεί με ένα συγκεκριμένο σκοπό στο μυαλό – και αυτό μπορεί να περιορίσει τη συλλογή στη χρήση σε άλλους τομείς.
Για παράδειγμα, το 2025, αναφέρθηκα στην ανάπτυξη ενός σχετικά μεγάλου (100.000+ ταυτοτήτων) συνόλου δεδομένων για την αξιολόγηση της ομορφιάς σε ζωντανές μεταδόσεις, των οποίων οι στενές προδιαγραφές μπορεί να χρειάζονται αξιοσημείωτη προσαρμογή σε ευρύτερα έργα, παρά την τεράστια προσπάθεια πίσω από τη πρωτοβουλία.
Εμφάνιση του Προσώπου
Όπως μπορεί να είναι φανερό από τους συνδέσμους και τις εικόνες παραπάνω, τα ασιατικά ερευνητικά σώματα συχνά δεν λειτουργούν υπό τις ίδιες πολιτισμικές περιορισμούς όπως οι δυτικοί ομόλογοί τους, οι οποίοι θα ήταν δύσκολο να τολμήσουν να δημοσιεύσουν một επιστημονική εικονογράφηση που βαθμολογεί πέντε δυτικές γυναίκες από τη λιγότερο σε τη πιο ελκυστική, όπως βλέπουμε στην ανωτέρω εικονογραφημένη μελέτη.
Μπορεί να επιχειρηθεί ότι όπου τα ασιατικά προελεύσεων συστήματα αυτού του είδους αποδεικνύονται αποτελεσματικά στο κοινό, χωρίς φόβο τοπικής κριτικής, τα δυτικά ενδιαφέροντα μπορούν να χρησιμοποιήσουν ή να προσαρμόσουν τέτοια έρευνα σε ιδιωτικές, ιδιωτικές εφαρμογές. Η εργασία της ‘βαθμολόγησης των γυναικών’, σε αυτή τη περίπτωση, ανατίθεται σε μια τοποθεσία όπου μπορεί να αναλαμβάνεται χωρίς κριτική.
Είτε είναι κοινό είτε λιγότερο δημοσιευμένα δυτικά ισοδύναμα συστήματα τείνουν να αναπτύσσονται μακριά από ανοιχτή συνεργασία και από δημόσια επιτήρηση, είναι λογικό να υποθέσουμε ότι ο στόχος είναι του παγκόσμιου ενδιαφέροντος, λόγω του μεγάλου αριθμού επαγγελματικών τομέων που μπορούν ή θα μπορούσαν να ωφεληθούν από ακριβείς αξιολογήσεις της ομορφιάς.
Η Επιβίωση του Ισχυρότερου
Μπορεί να φαίνεται ότι τεράστια web-αντιγραφής corpora όπως το Tik Tok, το Instagram και το YouTube θα αποδείξουν εξαιρετικούς διαμεσολαβείς της ομορφιάς, συσχετίζοντας τους οπαδούς, τις λάικ και την κυκλοφορία με την ομορφιά,既然 αυτή είναι μια κοινή και λογική συσχέτιση (παρά με μερικές εξαιρέσεις).
Ομοίως, οι υφιστάμενες συλλογές – όπως ImageNet και LAION – που παρουσιάζουν ηθοποιούς και μοντέλα που έχουν ‘ανέβει στην κορυφή’– θα τυπικά περιλαμβάνουν ελκυστικά άτομα (παρά με πολλά δεδομένα σημείων από λίγα άτομα), επιτρέποντας ευρύτερες πολιτισμικές μηχανισμούς να ενεργούν ως 프록シー για την ομορφιά.
Ωστόσο, αυτό δεν λαμβάνει υπόψη αλλαγές στις γεύσεις για το τι βρίσκουν οι άνθρωποι ελκυστικό με την πάροδο του χρόνου (παρά με γεωγραφική τοποθεσία). Έτσι, και πάλι, υψηλό-επίπεδο και δεδομένα-αγνόητα συστήματα είναι απαραίτητα, όχι μεμονωμένα και σπάνιες συλλογές ή επιλογές που θα αποτύχουν να αντανακλούν τις αλλαγές στις γεύσεις.
Συνδυαστική Ομορφιά
Η τελευταία ακαδημαϊκή είσοδος για την αντιμετώπιση αυτών των προκλήσεων προέρχεται από την Κίνα, όπου η μεταφορά μάθησης και Broad Learning System (BLS) συνδυάζονται για την αντιμετώπιση του μακροχρόνιου trade-off μεταξύ ακρίβειας και υπολογιστικού κόστους.
Τα συμβατικά νευρωνικά δίκτυα τείνουν να επιτύχουν ισχυρά αποτελέσματα μόνο με βαριά εκπαίδευση, ενώ ελαφρύτερα συστήματα όπως το BLS εκπαιδεύονται γρήγορα, αλλά πλήττονται να πιάσουν αρκετό λεπτό οπτικό λεπτό. Η νέα εργασία γέμιζε αυτό το χάσμα χρησιμοποιώντας ένα προ-εκπαιδευμένο οπτικό μοντέλο για την εξαγωγή χαρακτηριστικών του προσώπου, τα οποία στη συνέχεια περνούν σε ένα γρήγορο BLS-основано σύστημα για βαθμολόγηση, επιτρέποντας τα χαρακτηριστικά να ξαναχρησιμοποιηθούν αντί να μάθουν από την αρχή, ενώ διατηρούν την εκπαίδευση αποτελεσματική:

Δείγματα εικόνων από το σύνολο δεδομένων LSAFBD, που δείχνουν γυναικεία πρόσωπα ομαδοποιημένα ανάλογα με τους ανθρώπινους βαθμούς ομορφιάς από 1 έως 5. Πηγή
Το πρώτο από τα δύο παραλλαγών που εισάγονται στην εργασία (E-BLS, δείτε παρακάτω), τροφοδοτεί τα εξαγόμενα χαρακτηριστικά απευθείας στο ελαφρύ σύστημα, ενώ η δεύτερη, ER-BLS (δείτε επίσης παρακάτω), προσθέτει ένα απλό ενδιάμεσο στάδιο που стандαρδοποιεί και βελτιώνει αυτά τα χαρακτηριστικά πριν από την αξιολόγηση, βοηθώντας στην βελτίωση της συνοχής χωρίς να επιβραδύνει τη διαδικασία.
Οι δοκιμές που διεξήχθησαν από τους συγγραφείς αποδείχθηκαν, όπως ισχυρίζονται, ότι η προσέγγισή τους είναι ανώτερη από οποιοδήποτε από τα δύο μεθόδους ξεχωριστά, και από άλλα ανταγωνιστικά μεθόδους.
Η νέα μελέτη έχει τον τίτλο Πρόβλεψη ομορφιάς του προσώπου με συνδυασμό μεταφοράς μάθησης και Broad Learning System, και προέρχεται από έξι ερευνητές στο Πανεπιστήμιο Wuyi, Jiangmen.
Μέθοδος
Το προαναφερθέν Broad Learning System είναι ένα ελαφρύ εναλλακτικό των βαθιάς μάθησης νευρωνικών δικτύων, που παραλείπει το στάσιμο πολλαπλών στιβάδων, και αντίθετα, εξαπλώνει τη μάθηση σε ένα ευρύ σύνολο απλών συνδέσμων, επιτρέποντας τα μοντέλα να εκπαιδεύονται γρήγορα – αλλά συνήθως με το κόστος της απώλειας λεπτών οπτικών λεπτομερειών.
Το πρώτο από τα δύο παραλλαγών, E-BLS, συνδυάζει Επιτυχημένη Μάθηση-με βάση τη μεταφορά μάθησης με BLS, εξάγοντας λεπτομερή οπτικά χαρακτηριστικά από ένα πρόσωπο, και στη συνέχεια περνάει αυτά τα χαρακτηριστικά στο BLS, ενتهλώντας σε μια τελική πρόβλεψη που αποφεύγει την ανάγκη να εκπαιδεύσει ένα πλήρες βαθιά νευρωνικό δίκτυο από την αρχή:

Σχήμα της αρχιτεκτονικής του μοντέλου E-BLS.
Η EfficientNet, προ-εκπαιδευμένη στο ImageNet-1k, και σε μεγάλο βαθμό διατηρημένη αμετάβλητη, μετατρέπει κάθε είσοδο εικόνας σε ένα συμπαγές σύνολο τιμών χαρακτηριστικών που περιγράφουν το πρόσωπο με一个 δομημένο τρόπο, ενώ το BLS παίρνει αυτές τις τιμές και τις επεξεργάζεται μέσω ενός δικτύου απλών, τυχαία συνδεδεμένων κόμβων που μετατρέπουν και συνδυάζουν τις πληροφορίες, πριν παράγουν το τελικό σκορ ομορφιάς.
Επειδή το BLS δεν βασίζεται σε βαθιές στρωματοποιημένες δομές, το E-BLS μπορεί να ενημερωθεί με την προσθήκη περισσότερων κόμβων αντί να επαναεκπαιδεύσει το σύνολο του συστήματος. Αυτό διατηρεί την εκπαίδευση γρήγορη, και καθιστά πιο εύκολη την βελτίωση του μοντέλου καθώς εισάγονται νέα δεδομένα.
Η δεύτερη από τις δύο παραλλαγές, ER-BLS, χτίζει πάνω στο E-BLS με την εισαγωγή ενός επιπλέον σταδίου επεξεργασίας μεταξύ του EfficientNet feature extractor και του BLS, με στόχο τη βελτίωση του τρόπου με τον οποίο αυτά τα εξαγόμενα χαρακτηριστικά προετοιμάζονται πριν από την αξιολόγηση:

Αρχιτεκτονική του μοντέλου ER-BLS.
Αντί να στείλει τα raw EfficientNet χαρακτηριστικά απευθείας στο BLS, το ER-BLS περνάει αυτά τα χαρακτηριστικά πρώτα μέσω ενός στάδιου βελτίωσης που τα стандαρδοποιεί και τα αναμορφώνει, βοηθώντας να μειώσει τον θόρυβο, και να κάνει τα χαρακτηριστικά πιο συνεπή σε διαφορετικές εικόνες. Αυτό το στάδιο σχεδιάζεται για να βελτιώσει το πώς το σύστημα γενικεύει, ιδιαίτερα όταν τα πρόσωπα ποικίλλουν σε φωτισμό, θέση, ή άλλες οπτικές συνθήκες που θα μπορούσαν να εισαγάγουν αστάθεια στις προβλέψεις.
Τα βελτιωμένα χαρακτηριστικά περνούν στη συνέχεια στο ίδιο BLS structure που χρησιμοποιείται στο E-BLS, όπου οι κόμβοι χαρακτηριστικών και οι κόμβοι βελτίωσης μετατρέπουν και συνδυάζουν τις πληροφορίες για να παράγουν το τελικό σκορ ομορφιάς.
Δεδομένα και Δοκιμές
Για να δοκιμάσουν την προσέγγισή τους, οι συγγραφείς αξιοποίησαν το SCUT-FBP5500 σύνολο δεδομένων, μια συλλογή πρόβλεψης ομορφιάς του προσώπου από το Πανεπιστήμιο της Νότιας Κίνας, που περιέχει 5.500 εικόνες του προσώπου σε 350x350px, με ποικιλία φυλών, φύλων και ηλικιών:

Δείγματα εικόνων από το σύνολο δεδομένων SCUT-FBP5500, βαθμολογημένες από το λιγότερο (1) έως το πιο ελκυστικό (5).
Κάθε εικόνα βαθμολογούνταν με ένα σκορ ομορφιάς από 60 εθελοντές, σε μια κλίμακα 1-5, που κυμαίνεται από εξαιρετικά ασεξουάρ (1) έως εξαιρετικά ελκυστικό (5):

Η διαίρεση των αναλογιών των εικόνων ανάλογα με την βαθμολογία ομορφιάς.
Η άλλη βάση δεδομένων που χρησιμοποιήθηκε ήταν η Μεγάλη Κλίμακα Ασιατική Γυναικεία Βάση Δεδομένων Ομορφιάς (LSAFBD) συλλογή, μια βάση δεδομένων που δημιουργήθηκε από τους ίδιους τους συγγραφείς.

Δείγματα εικόνων από το σύνολο δεδομένων LSAFBD, βαθμολογημένες από το λιγότερο (1) έως το πιο ελκυστικό (5).
Η συλλογή αποτελείται από 80.000 μη βαθμολογημένες εικόνες σε 144x144px ανάλυση, με ποικιλίες σε θέση και φόντο, καθώς και ηλικία. Αυτές βαθμολογούνταν από 75 εθελοντές για τα ίδια κριτήρια με τη προηγούμενη βάση δεδομένων, αυτή τη φορά σε μια κλίμακα 0-4:

Οι διαιρέσεις για το σύνολο δεδομένων LSAFBD.
Κάθε βάση δεδομένων χωρίστηκε σε τμήματα εκπαίδευσης και δοκιμών σε αναλογία 8/20, και cross-validation χρησιμοποιήθηκε για να σταθεροποιήσει τα αποτελέσματα σε διαφορετικές εκτελέσεις. Το BLS component ρυθμίστηκε μέσω του αριθμού των feature windows, του αριθμού των κόμβων ανά παράθυρο, και του αριθμού των enhancement nodes, με Hyperopt να χρησιμοποιείται για να αναζητηθούν αποτελεσματικές συνδυασμοί.
Για να καθορίσουν μια βάση, ένα τυπικό BLS μοντέλο εκπαιδεύτηκε υπό τις ίδιες ρυθμίσεις, μετά από οποίο μια σειρά από μοντέλα μεταφοράς μάθησης εισήχθησαν, συμπεριλαμβανομένων ResNet50, Inception-V3, DenseNet121, InceptionResNetV2, EfficientNetB7, MobileNetV2, NASNet, και Xception – όλα αρχικοποιημένα με ImageNet-1k βαρείς, και εκπαιδευμένα με τις τελικές στρώσεις απενεργοποιημένες.
Η εκπαίδευση χρησιμοποιούσε μια ταχύτητα μάθησης 0.001 (μειωμένη όταν η πρόοδος σταμάτησε), και ένα μέγεθος batch 16, σε 50 epochs, με κανονικοποίηση και rectified linear activation (ReLU) εφαρμοσμένα σε όλη τη διάρκεια.
Η απόδοση αξιολογήθηκε χρησιμοποιώντας ακρίβεια και Pearson συσχέτιση, μαζί με το συνολικό χρόνο εκπαίδευσης, με αποτελέσματα που μετρήθηκαν σε πέντε εκτελέσεις.
Οι συγγραφείς αναφέρουν τη ρύθμιση εκπαίδευσης ως Intel-i7 3.6 GHz CPU και 64GB RAM σε ένα ‘επιτραπέζιο υπολογιστή’:

Σύγκριση απόδοσης στο SCUT-FBP5500, όπου τα E-BLS και ER-BLS επιτύγχαναν ανταγωνιστική ακρίβεια ενάντια σε βαθιά CNN μοντέλα, συμπεριλαμβανομένων ResNet50, EfficientNetB7, InceptionV3, και Xception, ενώ απαιτούσαν σημαντικά λιγότερο χρόνο εκπαίδευσης – υπογραμμίζοντας τις αποδοτικες κέρδη της συνδυασμένης μεταφοράς μάθησης με ένα Broad Learning System.
Τα αποτελέσματα έδειξαν ότι το E-BLS βελτίωσε την ακρίβεια από 65.85% σε 73.13%, ενώ το ER-BLS έφτασε στο 74.69%, υπερβαίνοντας όλα τα συγκριτικά μοντέλα. Ο χρόνος εκπαίδευσης παρέμεινε σημαντικά χαμηλότερος από τα βαθιά CNN, περίπου 1.300 δευτερόλεπτα, έναντιหลาย χιλιάδων έως πάνω από 25.000 δευτερολέπτων.
Για τις δοκιμές στο LSAFBD, τα αποτελέσματα έδειξαν ότι το E-BLS βελτίωσε την ακρίβεια hơn από το απλό BLS, ενώ το ER-BLS επιτύγχασε την υψηλότερη ακρίβεια μεταξύ όλων των συγκριτικών μεθόδων:

Απόδοση στο LSAFBD, όπου τα ER-BLS και E-BLS παρείχαν υψηλότερη ακρίβεια από όλα τα βασικά και μεταφορά μάθησης μοντέλα, ενώ απαιτούσαν μόνο ένα κλάσμα του χρόνου εκπαίδευσης, υποδηλώνοντας μια συνεπή υπεροχή στην αποδοτικότητα χωρίς να θυσιάζουν την προβλεπτική ποιότητα.
Και οι δύο παραλλαγές διατήρησαν σημαντικά χαμηλότερο χρόνο εκπαίδευσης από τα βαθιά CNN μοντέλα, υποδηλώνοντας μια πιο αποτελεσματική ισορροπία μεταξύ απόδοσης και υπολογιστικού κόστους.
Συμπέρασμα
Αυτό είναι κάπως μια ‘throwback’ δημοσίευση, όπως φαίνεται από τη χρήση προ-boom αγαπημένων όπως τα CNN, και από το χαμηλότερο-επίπεδο εκπαιδευτικό εξοπλισμό που έχω συναντήσει σε μια νέα δημοσίευση για πολλά χρόνια.
Παρά τα όλα αυτά, ασχολείται με ένα εκπληκτικά ανθεκτικό αντικείμενο στην υπολογιστική όραση, ένα που αγγίζει βαθιά την ανθρώπινη εμπειρία και την υποκειμενική ερμηνεία, και που απαιτεί ένα σχήμα που υπερβαίνει τις αισθητικές τάσεις της στιγμής, και μπορεί να παρέχει μια πραγματικά ανθεκτική διαδικασία για την εργασία.
Δημοσιεύθηκε για πρώτη φορά την Πέμπτη, 19 Μαρτίου 2026












