Η γωνία του Anderson

Αλλαγή Φύλου και Φυλής σε Αποτελέσματα Εικόνας με Μηχανική Μάθηση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια ερευνητική συνεργασία μεταξύ του UC San Diego και της Adobe (ADBE ) Research έχει προτείνει μια καινοτόμο και προληπτική λύση για την έλλειψη φυλετικής και φυλοτικής多样性 στις εικόνες αναζήτησης για παραδοσιακά WASP-δоминаμένες επαγγέλματα: τη χρήση των Γεννητικών Αντιπαλών Δικτύων (GANs) για τη δημιουργία μη πραγματικών εικόνων των “μπιασμένων” επαγγελμάτων, όπου το φύλο και/ή η φυλή του υποκειμένου αλλάζει.

Σε αυτό το παράδειγμα από το νέο έγγραφο, οι ερευνητές έχουν εισαγάγει χαρακτηριστικά για μια επιθυμητή φωτογραφία που είτε δεν αντιπροσωπεύεται σε ένα τυπικό σώμα διαθέσιμου υλικού εικόνας, είτε αντιπροσωπεύεται με μη κατάλληλο τρόπο (π.χ. σεξουαλικοποιημένο ή με άλλο μη κατάλληλο τρόπο). Πηγή

Σε αυτό το παράδειγμα από το νέο έγγραφο, οι ερευνητές έχουν εισαγάγει χαρακτηριστικά για μια επιθυμητή φωτογραφία που είτε δεν αντιπροσωπεύεται σε ένα τυπικό σώμα διαθέσιμου υλικού εικόνας, είτε αντιπροσωπεύεται με μη κατάλληλο τρόπο (π.χ. σεξουαλικοποιημένο ή με άλλο μη κατάλληλο τρόπο). Πηγή

Σε ένα νέο έγγραφο με τίτλο Γεννήνοντας και Ελέγχοντας την Ποικιλία στην Αναζήτηση Εικόνας, οι συγγραφείς προτείνουν ότι υπάρχει ένα όριο στο βαθμό που η ανακατάταξη μπορεί να διορθώσει την ανισορροπία των προκατειλημμένων τάξεων εικόνας/χαρακτηριστικών όπως υδραυλικός, μηχανικός, μηχανικός λογισμικού και πολλά άλλα – και ότι η αύξηση της φυλετικής και φυλοτικής ποικιλίας με συνθετικά δεδομένα μπορεί να είναι ο δρόμος προς τα εμπρός για αυτή την πρόκληση.

‘Η αναζήτηση ενός ουτοπικού κόσμου απαιτεί να παρέχουμε στους χρήστες την ευκαιρία να παρουσιάσουν οποιοδήποτε επάγγελμα με διαφορετικά φυλετικά και φυλοτικά χαρακτηριστικά. Η περιορισμένη επιλογή υφιστάμενου περιεχομένου για ορισμένες συνδυασίες επαγγέλματος, φυλής και φύλου παρουσιάζει μια πρόκληση για τους παρόχους περιεχομένου. Η τρέχουσα έρευνα που ασχολείται με τις προκαταλήψεις στην αναζήτηση εστιάζει κυρίως σε αλγόριθμους ανακατάταξης.

‘Ωστόσο, αυτές οι μεθόδοι δεν μπορούν να δημιουργήσουν νέο περιεχόμενο ή να αλλάξουν την συνολική κατανομή των προστατευόμενων χαρακτηριστικών στις φωτογραφίες. Για να θεραπεύσουμε αυτά τα προβλήματα, προτείνουμε μια νέα εργασία για την υψηλής πιστότητας γεννήτρια εικόνας με συνθήκη σε πολλαπλά χαρακτηριστικά από ασύμμετρες βάσεις δεδομένων. ‘

Για αυτόν τον σκοπό, οι συγγραφείς έχουν πειραματιστεί με μια ποικιλία από συστήματα σύνθεσης εικόνας που βασίζονται σε GAN, τελικά επιλέγοντας μια αρχιτεκτονική που βασίζεται στο StyleGan2.

Από τα συμπληρωματικά υλικά για το έγγραφο, δύο παραδείγματα 'ισοποίησης' εικόνων-αναπαραστάσεων προκατειλημμένων επαγγελμάτων, σε αυτές τις περιπτώσεις, 'ξυλουργός' και 'μηχανικός'. Πηγή

Από τα συμπληρωματικά υλικά για το έγγραφο, δύο παραδείγματα ‘ισοποίησης’ εικόνων-αναπαραστάσεων προκατειλημμένων επαγγελμάτων, σε αυτές τις περιπτώσεις, ‘ξυλουργός’ και ‘μηχανικός’. Πηγή

Ανεπαρκώς ή Ακατάλληλα Αντιπροσωπεύεται

Οι ερευνητές ορίζουν την πρόκληση σε όρους μιας πραγματικής αναζήτησης αποτελεσμάτων για ‘υδραυλικό’* στο Google Image search, παρατηρώντας ότι τα αποτελέσματα εικόνας κυριαρχούνται από νέους λευκούς άνδρες.

Από το έγγραφο, επιλεγμένα αποτελέσματα για 'υδραυλικό' στο Google Image search, Ιανουάριος 2021.

Από το έγγραφο, επιλεγμένα αποτελέσματα για ‘υδραυλικό’ στο Google Image search, Ιανουάριος 2021.

Οι συγγραφείς σημειώνουν ότι παρόμοιες ενδείξεις προκατάληψης εμφανίζονται για eine σειρά επαγγελμάτων, όπως ‘διαχειριστής’, ‘καθαρίστρια’, και ‘μηχανικός’, με αντίστοιχες προκαταλήψεις για ηλικία, φύλο και φυλή.

‘Απρόσμενα, λόγω τέτοιων κοινωνικών προκαταλήψεων, ορισμένες συνδυασμοί φυλής και φύλου μπορεί να έχουν λίγες ή καθόλου εικόνες σε ένα αποθετήριο περιεχομένου. Για παράδειγμα, όταν ψάξαμε ‘γυναίκα μαύρη (ή Αφροαμερικανίδα) μηχανικός’ ή ‘άνδρας Ασιάτης διαχειριστής’, δεν βρήκαμε σχετικές εικόνες στο [Google Image search]. ‘

‘Επιπλέον, σε σπάνιες περιπτώσεις, συγκεκριμένες συνδυασμοί φύλου και φυλής μπορούν να οδηγήσουν σε ατομικά άτομα να απεικονίζονται ακατάλληλα. Παρατηρήσαμε αυτή τη συμπεριφορά για αναζητήσεις όπως ‘γυναίκα Ασιάτισσα υδραυλικός’ ή ‘γυναίκα Μαύρη (ή Αφροαμερικανίδα) φύλακας ασφαλείας.’ ‘

Το έγγραφο αναφέρει μια άλλη ακαδημαϊκή συνεργασία από το 2014, όπου οι ερευνητές συλλέγουν τα κορυφαία 400 αποτελέσματα αναζήτησης εικόνας για 96 επαγγέλματα. Αυτή η εργασία βρήκε ότι οι γυναίκες αντιπροσώπευαν μόνο το 37% των αποτελεσμάτων, και αντι-στερεοτυπικές εικόνες μόνο 22%. Μια μελέτη του 2019 από το Yale βρήκε ότι πέντε χρόνια είχαν φέρει αυτά τα ποσοστά στο 45% και 30% αντίστοιχα.

Επιπλέον, η μελέτη του 2014 κατηγοριοποίησε την σεξουαλικοποίηση των ατόμων σε ορισμένα επαγγέλματα στις εικόνες αναζήτησης ως το Σεξυ Carpenter Problem, με τέτοιες ακατάλληλες κατηγοριοποιήσεις που потенτικά μπορούν να στρέψουν τα αποτελέσματα για την αναγνώριση επαγγέλματος.

Το Μεγάλο Πλάνο

Η основная πρόκληση για τους συγγραφείς ήταν η παραγωγή ενός συστήματος σύνθεσης εικόνας που βασίζεται σε GAN, ικανό να εξοδεύει εικόνες με ανάλυση 1024×1024,既然, στην τρέχουσα κατάσταση της τέχνης στα GAN και στα συστήματα σύνθεσης εικόνας με κωδικοποιητή/αποκωδικοποιητή, η ανάλυση 512×512 είναι αρκετά πολυτελής. Οτιδήποτε υψηλότερο θα είχε τη τάση να λαμβάνεται με την αναβάθμιση της τελικής εξόδου, με κάποιο κόστος χρόνου και πόρων επεξεργασίας, και με κάποιο κίνδυνο για την αυθεντικότητα των γεννημένων εικόνων.

Ωστόσο, οι συγγραφείς δηλώνουν ότι χαμηλότερες αναλύσεις δεν θα μπορούσαν να αναμένουν να κερδίσουν δέσμη στην αναζήτηση εικόνας, και πειραματίστηκαν με eine ποικιλία από πλαισιά GAN που θα μπορούσαν να είναι ικανά να εξοδεύουν εικόνες υψηλής ανάλυσης με απαίτηση, σε ένα αποδεκτό επίπεδο αυθεντικότητας.

Όταν η απόφαση έγινε να υιοθετηθεί το StyleGan2, έγινε σαφές ότι το έργο θα χρειαζόταν μεγαλύτερο έλεγχο στα υπο-χαρακτηριστικά της γεννημένης εξόδου (όπως φυλή, επάγγελμα και φύλο), από ό,τι μια προεπιλογή επιτρέπει. Για αυτόν τον σκοπό, οι συγγραφείς χρησιμοποίησαν πολλαπλή κατάσταση για να αυξήσουν τη διαδικασία γεννήτριας.

Η αρχιτεκτονική του συστήματος σύνθεσης εικόνας, η οποία οι συγγραφείς δηλώνουν ότι δεν είναι συγκεκριμένη στο StyleGAN2, αλλά θα μπορούσε να εφαρμοστεί σε eine σειρά από πλαισιά γεννήτριας.

Η αρχιτεκτονική του συστήματος σύνθεσης εικόνας, η οποία οι συγγραφείς δηλώνουν ότι δεν είναι συγκεκριμένη στο StyleGAN2, αλλά θα μπορούσε να εφαρμοστεί σε eine σειρά από πλαισιά γεννήτριας.

Για να ελέγξουν τα χαρακτηριστικά φυλής, φύλου και επαγγέλματος, η αρχιτεκτονική ενέκτεινε μια μονο-στιγμιαία κωδικοποίηση αυτών των συνδυασμένων χαρακτηριστικών στο y διανύσμα. Μετά από αυτό, ένα δίκτυο feedforward χρησιμοποιήθηκε για να ενσωματώσει αυτά τα χαρακτηριστικά, ώστε να μην αγνοηθούν κατά τη διάρκεια της γεννήτριας.

Οι συγγραφείς παρατηρούν ότι υπάρχουν σκληρά όρια στο βαθμό που το StyleGAN2 μπορεί να χειραγωγηθεί με αυτόν τον τρόπο, και ότι πιο λεπτομερείς προσπάθειες να αλλάξουν τα αποτελέσματα οδήγησαν σε χειρότερη ποιότητα εικόνας, και ακόμη και mode collapse.

Αυτά τα αντίμετρα, ωστόσο, δεν λύνουν τα προβλήματα προκατάληψης στην αρχιτεκτονική, τα οποία οι ερευνητές έπρεπε να αντιμετωπίσουν με την υπερ-δείγματος των υπο-αντιπροσωπεύσεων οντοτήτων από τη βάση δεδομένων, αλλά χωρίς να κινδυνεύουν να υπερ-προσαρμοστούν, το οποίο θα επηρέαζε την ευελιξία των γεννημένων ροών εικόνας.

Για αυτόν τον σκοπό, οι συγγραφείς προσάρμοσαν StyleGAN2-ADA, το οποίο χρησιμοποιεί Προσαρμοστική Αυξανόμενη Αναβάθμιση (ADA), για να αποτρέψει τον διακρίβωνα από το να υπερ-προσαρμοστεί.

Γεννήτρια Δεδομένων και Αξιολόγηση

Καθώς το κύριο αντικείμενο του έργου είναι η γεννήτρια νέων, συνθετικών δεδομένων, οι ερευνητές υιοθέτησαν τη μεθοδολογία του έργου του 2014, επιλέγοντας eine σειρά από στόχους επαγγελμάτων που δείχνουν υψηλή φυλετική και φυλοτική προκατάληψη. Τα επαγγέλματα που επιλέχθηκαν ήταν ‘διευθυντής’, ‘διαχειριστής’, ‘νοσηλεύτρια’, ‘αγρότης’, ‘στρατιωτικός’, ‘φύλακας ασφαλείας’, ‘οδηγός φορτηγού’, ‘καθαρίστρια’, ‘ξυλουργός’, ‘υδραυλικός’, ‘μηχανικός’, ‘τεχνικός υποστήριξης’, ‘μηχανικός λογισμικού’ και ‘συγγραφέας’.

Οι συγγραφείς επέλεξαν αυτά τα επαγγέλματα όχι μόνο με βάση το βαθμό της αντιλαμβανόμενης προκατάληψης στις εικόνες αναζήτησης, αλλά και επειδή τα περισσότερα από αυτά περιέχουν κάποιο είδος οπτικού στοιχείου που είναι κωδικοποιημένο στο επάγγελμα, όπως μια στολή, ή η παρουσία συγκεκριμένων εργαλείων ή περιβαλλόντων.

Η βάση δεδομένων τροφοδοτήθηκε με 10.000 εικόνες από τη βιβλιοθήκη Adobe Stock, συνήθως λαμβάνοντας μια βαθμολογία 95% ή καλύτερη όταν προσπαθούσε να ταξινομήσει ένα επάγγελμα.

Καθώς πολλές από τις εικόνες δεν ήταν χρήσιμες για τον στόχο (δηλ. δεν περιείχαν άτομα), χρειαζόταν χειροκίνητη φιλτράρισμα. Μετά από αυτό, ένας ταξινομητής ResNet32 που προ-εκπαιδεύτηκε στο FairFace χρησιμοποιήθηκε για να etiquetάρει τις εικόνες για φύλο και φυλή, λαμβάνοντας μια μέση ακρίβεια 95,7% για φύλο και 81,5% για φυλή. Έτσι οι ερευνητές απέκτησαν ετικέτες εικόνας για τα χαρακτηριστικά Φύλο: Άρρεν, Θήλυ, Φυλή: Λευκός, Μαύρος, Ασιάτης και Άλλες Φυλές.

Τα μοντέλα κατασκευάστηκαν στο TensorFlow χρησιμοποιώντας StyleGAN2 και StyleGAN2-ADA ως βασικά δίκτυα. Η προ-εκπαίδευση έγινε με StyleGAN2’s προ-εκπαιδευμένα βάρη στο NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ) dataset, αυξημένα με 34.000 occupation-ειδικές εικόνες που οι συγγραφείς συγκέντρωσαν σε μια ξεχωριστή βάση δεδομένων που ονόμασαν Uncurated Stock-Occupation HQ (U-SOHQ).

Ένα δείγμα HIT από την ανθρώπινη αξιολόγηση του Amazon Mechanical Turk.

Ένα δείγμα HIT από την ανθρώπινη αξιολόγηση του Amazon Mechanical Turk.

Οι εικόνες γεννήθηκαν υπό τέσσερις διαμορφώσεις αρχιτεκτονικής, με Uniform+ που τελικά απέκτησε τις καλύτερες βαθμολογίες και στην αυτοματοποιημένη αξιολόγηση (FID) και στην επόμενη αξιολόγηση από τους εργάτες του Amazon Mechanical Turk. Σε συνδυασμό με την ταξινομητική ακρίβεια, οι συγγραφείς χρησιμοποίησαν αυτό ως βασικό μέτρο για το δικό τους μέτρο, που ονομάζεται Attribute Matching Score.

Αξιολόγηση ανθρώπων για εικόνες που γεννήθηκαν με διάφορες μεθόδους, με τη μέθοδο Uniform+ που αποδείχθηκε η πιο πειστική, και στη συνέχεια η βάση για μια νέα βάση δεδομένων.

Αξιολόγηση ανθρώπων για εικόνες που γεννήθηκαν με διάφορες μεθόδους, με τη μέθοδο Uniform+ που αποδείχθηκε η πιο πειστική, και στη συνέχεια η βάση για μια νέα βάση δεδομένων.

Το έγγραφο δεν δηλώνει εάν το Stock-Occupation-HQ, η πλήρης βάση δεδομένων που προέρχεται από την Uniform+, θα είναι διαθέσιμη δημόσια, αλλά δηλώνει ότι περιέχει 8.113 HQ (1024×1024) εικόνες.

Διάχυση

Το νέο έγγραφο δεν ασχολείται ρητά με τον τρόπο που οι συνθετικές, ‘επαναισορροπημένες’ εικόνες θα μπορούσαν να εισαχθούν στην κυκλοφορία. Προφανώς, η σπορά νέων (δωρεάν) βάσεων δεδομένων υπολογιστικής όρασης με εικόνες του τύπου που οι συγγραφείς έχουν δημιουργήσει θα λύσει το πρόβλημα της προκατάληψης, αλλά θα μπορούσε επίσης να παρουσιάσει εμπόδια σε άλλους τύπους ερευνών που επιδιώκουν να αξιολογήσουν την ένταξη φύλου και φυλής σε ‘πραγματικό κόσμο’ σενάρια, σε μια περίπτωση όπου συνθετικές εικόνες αναμιγνύονται με πραγματικές εικόνες.

Συνθετικές βάσεις δεδομένων όπως αυτή που παράχθηκε από τους ερευνητές θα μπορούσαν να γίνουν διαθέσιμες χωρίς κόστος ως μέτριας ανάλυσης εικόνες stock, χρησιμοποιώντας αυτήν την οικονομική ενθάρρυνση ως μηχανή διάχυσης.

Το έργο δεν ασχολείται με την προκατάληψη ηλικίας, προφανώς ένα πιθανό θέμα ενδιαφέροντος σε μελλοντικές έρευνες.

 

* Αναζήτηση που κατεγράφη στις 5 Ιανουαρίου 2022, η αναζήτηση που αναφέρεται στο έγγραφο διεξήχθη τον Ιανουάριο του 2021.

 

Πρώτη δημοσίευση στις 5 Ιανουαρίου 2022.

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai