Η γωνία του Anderson

Η συμπίεση JPEG αυξάνει το ποσοστό σφάλματος αναγνώρισης προσώπου για μη-καυκασιακά πρόσωπα, σύμφωνα με μια μελέτη

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Main image: DALL-E 2.

Μια νέα μελέτη από το Ηνωμένο Βασίλειο έχει καταλήξει στο συμπέρασμα ότι οι τεχνικές συμπίεσης με απώλεια σε εικόνες JPEG μπορούν να έχουν αρνητική επιρροή στην αποτελεσματικότητα των συστημάτων αναγνώρισης προσώπου, καθιστώντας αυτά τα συστήματα πιο πιθανό να αναγνωρίσουν λανθασμένα ένα μη-καυκασιακό άτομο.

Το έγγραφο αναφέρει:

‘Μέσω ενός εκτεταμένου πειραματικού σκεύους, αποδεικνύουμε ότι οι συνήθεις προσεγγίσεις συμπίεσης εικόνας με απώλεια έχουν μια πιο εξεζητημένη αρνητική επιρροή στην απόδοση αναγνώρισης προσώπου για συγκεκριμένες φαινοτυπικές κατηγορίες φυλής, όπως οι σκουρόχρωμες επιδερμίδες (μέχρι και 34,55%).’

Τα αποτελέσματα δείχνουν επίσης ότι η υποδείγματος χρωματικής υποδειγματολήψης, η οποία μειώνει τις πληροφορίες χρώματος (και όχι τις πληροφορίες φωτεινότητας) σε τμήματα μιας εικόνας προσώπου, αυξάνει το ποσοστό ψευδούς αναγνώρισης (FMR) σε eine σειρά από datasets, πολλά από τα οποία είναι τυποποιημένα αποθετήρια για την υπολογιστική όραση.

Επιχειρήσεις υποδείγματος χρωματικής υποδειγματολήψης σε μια πηγή εικόνας, σε διαφορετικές ταχύτητες, έχουν μια σαφή επίδραση στο βαθμό στον οποίο διατηρείται το λεπτομέρεια και ο βαθμός στον οποίο οι υποτόνες απλώς 'συγχωνεύονται' η μια στην άλλη, θυσιάζοντας λεπτομέρεια και καθορίζοντας χαρακτηριστικά. Παρακαλώ σημειώστε ότι αυτή η εικόνα μπορεί να υποστεί συμπίεση και αναφέρεστε στο αρχικό έγγραφο για ακριβή ανάλυση. Πηγή: https://arxiv.org/pdf/2208.07613.pdf

Επιχειρήσεις υποδείγματος χρωματικής υποδειγματολήψης σε μια πηγή εικόνας, σε διαφορετικές ταχύτητες, έχουν μια σαφή επίδραση στο βαθμό στον οποίο διατηρείται το λεπτομέρεια και ο βαθμός στον οποίο οι υποτόνες απλώς ‘συγχωνεύονται’ η μια στην άλλη, θυσιάζοντας λεπτομέρεια και καθορίζοντας χαρακτηριστικά. Παρακαλώ σημειώστε ότι αυτή η εικόνα μπορεί να υποστεί συμπίεση και αναφέρεστε στο αρχικό έγγραφο για ακριβή ανάλυση. Πηγή: https://arxiv.org/pdf/2208.07613.pdf

Η υποδείγματος χρωματικής υποδειγματολήψης εφαρμόζεται ως μια πρόσθετη οικονομική μέτρα στη συμπίεση JPEG επειδή οι άνθρωποι είναι λιγότερο ικανοί να ανιχνεύσουν μειώσεις στη σύνθετη και εύρος των ζωνών χρώματος από τα συστήματα υπολογιστικής όρασης, τα οποία λαμβάνουν αυτές τις ‘συσσωματώσεις’ πολύ πιο κυριολεκτικά από εμάς.

Οι ερευνητές της νέας μελέτης έχουν βρει ότι η αφαίρεση της υποδείγματος χρωματικής υποδειγματολήψης από τη διαδικασία συμπίεσης μειώνει αυτή την αρνητική επίδραση μέχρι και 15,95%, αν και δεν την αφαιρεί完全.

Η μελέτη ισχυρίζεται επίσης ότι η εκπαίδευση σε ασυμπιεσμένα (ή λιγότερο συμπιεσμένα) δεδομένα δεν θα λύσει το πρόβλημα εάν οι εικόνες inference-time είναι συμπιεσμένες. Αυτό σημαίνει ότι η εκπαίδευση ενός μοντέλου αναγνώρισης προσώπου σε λιγότερο συμπιεσμένες εικόνες δεν θα λύσει την προκατάληψη εάν το τελικό μοντέλο παραγωγής τροφοδοτείται με εικόνες που έχουν τις αναφερόμενες προβλήματα συμπίεσης.

Οι συγγραφείς αναφέρουν*:

‘[Η] χρήση συμπίεσης εικόνας με απώλεια κατά τη διάρκεια της inference επηρεάζει αρνητικά την απόδοση των σύγχρονων προσεγγίσεων αναγνώρισης προσώπου σε μια υποκατηγορία φαινοτυπικών ομαδοποιήσεων φυλής (π.χ. σκουρόχρωμες επιδερμίδες, μονολιδικό σχήμα ματιού) και ότι η επίδρασή της είναι παρόντος ανεξάρτητα από το εάν χρησιμοποιούνται συμπιεσμένες εικόνες για την εκπαίδευση του μοντέλου.’

Το έγγραφο υπογραμμίζει τις συνέπειες της συμπίεσης εικόνας στον τομέα της υπολογιστικής όρασης, οι οποίες είχαν εκφραστεί σε κάποιο βαθμό σε μια μελέτη του 2021 από το Πανεπιστήμιο του Μέριλαντ και την Facebook AI.

Είναι ένα δύσκολο ζήτημα να επιλυθεί· ακόμη και αν τα προβλήματα αποθήκευσης και εύρους ζώνης που καθιστούν απαραίτητη τη συμπίεση εξαλειφθούν από την μια μέρα στην άλλη, και ακόμη και αν όλες οι εικόνες χαμηλής ποιότητας που πλημμυρίζουν είκοσι ή περισσότερα χρόνια από datasets στον τομέα ανασυμπιεστούν σε καλύτερη ταχύτητα από πηγές υψηλής ποιότητας, θα αντιπροσωπεύουν μια ‘επανεκκίνηση’ της συνέχειας των εργαλείων αξιολόγησης του ακαδημαϊκού τομέα τις τελευταίες δεκαετίες. Η κοινότητα CV έχει, σε πραγματικότητα, συνειδητοποιήσει το πρόβλημα, μέχρι τον βαθμό που αντιπροσωπεύει ένα σημαντικό τεχνικό χρέος.

Η φυλετική προκατάληψη στην αναγνώριση προσώπου (FR) έχει γίνει ένα ζεστό μέσο ενημέρωσης τα τελευταία χρόνια, προκαλώντας μια συντονισμένη προσπάθεια στην ερευνητική κοινότητα να την εξαλείψει από τα επηρεαζόμενα συστήματα. Ωστόσο, η εξάρτηση του παγκόσμιου ερευνητικού σώματος από ένα περιορισμένο αριθμό ‘χρυσοί προτύπων’ datasets, πολλά από τα οποία είναι είτε μη φυλετικά ισορροπημένα είτε κακώς ετικετωμένα σε αυτόν τον τομέα, διευρύνει την πρόκληση.

Οι ερευνητές της νέας μελέτης σημειώνουν επίσης μια διαφωνία μεταξύ προτύπων απόκτησης εικόνας και των προτύπων που ορίζονται από τη γενική τάση των βενζινών αναγνώρισης προσώπου, αναφέροντας*:

‘[Οι] υφιστάμενες προδιαγραφές απόκτησης εικόνας για συστήματα αναγνώρισης προσώπου όπως ISO/IEC 19794-5 και ICAO 9303 προτείνουν και προδιαγραφές εικόνας (π.χ. φωτισμός, απόκρυψη) και προδιαγραφές υποκειμένου (π.χ. στάση, έκφραση, αξεσουάρ) για να διασφαλίσουν την ποιότητα εικόνας προσώπου.

‘Αντιστοίχως, οι εικόνες προσώπου πρέπει επίσης να αποθηκεύονται χρησιμοποιώντας προδιαγραφές συμπίεσης εικόνας με απώλεια όπως JPEG ή JPEG2000· και αναγνωρίσιμες για φύλο, χρώμα ματιού, χρώμα μαλλιών, έκφραση, ιδιότητες (π.χ. γυαλιά), γωνίες στάσης (yaw, pitch, και roll), και θέσεις ορόσημων.

‘Ωστόσο, οι συνήθεις βενζίνες αναγνώρισης προσώπου δεν συμμορφώνονται με τα πρότυπα ISO/IEC 19794-5 και ICAO 9303. Επιπλέον, τα δείγματα in-the-wild λαμβάνονται συχνά υπό διαφορετικές συνθήκες κάμερας και περιβάλλοντος για να προκύψουν οι προτεινόμενες λύσεις.

‘Ωστόσο, τα περισσότερα δείγματα εικόνας προσώπου εντός τέτοιων datasets είναι συμπιεσμένα μέσω συμπίεσης JPEG με απώλεια.’

Οι συγγραφείς της νέας εργασίας αναφέρουν ότι οι μελλοντικές τους προσπάθειες θα εξετάσουν την επίδραση της συμπίεσης εικόνας με απώλεια σε διαφορετικά πλαίσια αναγνώρισης προσώπου και θα προτείνουν πιθανές μεθόδους για τη βελτίωση της ισότητας αυτών των συστημάτων.

Το νέο έγγραφο έχει τον τίτλο Η συμπίεση εικόνας με απώλεια επηρεάζει την προκατάληψη φυλής στην αναγνώριση προσώπου;, και προέρχεται από τρεις ερευνητές στο Imperial College London, μαζί με έναν από τη βιβλιοθήκη ανάλυσης προσώπου InsightFace.

Δεδομένα και Μέθοδος

Για τους πειραματισμούς τους, οι ερευνητές χρησιμοποίησαν τις ανοιχτές βιβλιοθήκες ImageMagick και libjpeg για να δημιουργήσουν εκδόσεις των εικόνων δεδομένων σε διαφορετικά επίπεδα συμπίεσης.

Για μια αρχική επισκόπηση των επιπτώσεων της συμπίεσης, οι συγγραφείς μελέτησαν τις επιπτώσεις του λόγου σήματος προς θόρυβο (PSNR) σε τέσσερα διαφορετικά επίπεδα συμπίεσης JPEG στο dataset Racial Faces in-the-Wild (RFW).

Βαθμοί PSNR για το dataset Racial Faces-in-the-Wild, δείχνοντας το βαθμό στον οποίο η συμπίεση μπορεί να επηρεάσει τις ικανότητες αναγνώρισης για συμπιεσμένες εικόνες.

Βαθμοί PSNR για το dataset Racial Faces-in-the-Wild, δείχνοντας το βαθμό στον οποίο η συμπίεση μπορεί να επηρεάσει τις ικανότητες αναγνώρισης για συμπιεσμένες εικόνες.

Εκτός από άλλους πειραματισμούς, διεξήγαγαν έρευνα σε ένα dataset που δεν ήταν φυλετικά ισορροπημένο, και σε ένα άλλο που ήταν φυλετικά ισορροπημένο. Για το φυλετικά ισορροπημένο dataset, χρησιμοποίησαν τη συνάρτηση Additive Angular Margin Loss (ArcFace) με ResNet101v2, στο αρχικό VGGFace2 dataset, το οποίο περιέχει 3,3 εκατομμύρια εικόνες με 8631 μη φυλετικά ισορροπημένα υποκείμενα.

Για τον πειραματισμό, οι ερευνητές χρησιμοποίησαν το dataset RFW. Το σύστημα εκπαιδεύτηκε τέσσερις φορές, σε τέσσερα διαφορετικά επίπεδα συμπίεσης, με αποτέλεσμα τέσσερα μοντέλα ArcFace.

Για το φυλετικά ισορροπημένο dataset, τα ίδια πλαίσια χρησιμοποιήθηκαν αρχικά στο αρχικό dataset BUPT-Balanced, το οποίο περιέχει 28.000 πρόσωπα ισορροπημένα σε τέσσερις ομάδες Αφρική, Ασία, Ινδία, και Καυκάσια, με κάθε φυλή να αντιπροσωπεύεται από 7000 εικόνες. Όπως και με το μη φυλετικά ισορροπημένο dataset, τέσσερα μοντέλα ArcFace αποκτήθηκαν με αυτόν τον τρόπο.

Επιπλέον, οι ερευνητές αναπαράγαγαν τις επιπτώσεις της συμπιεσμένης και μη συμπιεσμένης εκπαίδευσης, αφαιρώντας τη χρωματική υποδειγματολήψη, για να μετρήσουν την επίδρασή της στην απόδοση.

Αποτελέσματα

Το ποσοστό ψευδούς αναγνώρισης (FMR) σε αυτά τα datasets μετρήθηκε. Οι κριτήριοι που οι ερευνητές αναζητούσαν ήταν προκαθορισμένες φαινοτυπικές ιδιότητες που σχετίζονται με φυλετικές χαρακτηριστικές Τύπος δέρματος (1, 2, 3, 4, 5 ή 6), Τύπος βλεφάρου (Μονολιδικό/Άλλο), Σχήμα μύτης (Πλατύ/Στενό), Σχήμα χειλιών (Πλήρη/Μικρό), Τύπος μαλλιών (Σtraight/Κουτσουρεμένα/Κουρεμένα/Φαλακρός), και Χρώμα μαλλιών – μετρήσεις που προέρχονται από το έγγραφο Μέτρηση κρυφής προκατάληψης στην αναγνώριση προσώπου μέσω φυλετικών φαινοτύπων.

Το έγγραφο αναφέρει:

‘Παρατηρούμε ότι για όλα τα επιλεγμένα επίπεδα συμπίεσης q = {5, 10, 15, 95}, το FMR αυξάνει όταν εφαρμόζεται συμπίεση με απώλεια, δείχνοντας ότι το επίπεδο συμπίεσης 5 (η υψηλότερη ταχύτητα συμπίεσης) οδηγεί στην πιο σημαντική μείωση της απόδοσης FMR, ενώ το επίπεδο συμπίεσης 95 (η χαμηλότερη ταχύτητα συμπίεσης) δεν οδηγεί σε κανένα αξιοσημείωτο FMR απόδοση.’

Ένα δείγμα από τα εκτεταμένα γραφήματα αποτελεσμάτων της μελέτης, τα οποία είναι πολύ μεγάλα και πολλά για να αναπαραχθούν εδώ – παρακαλώ δείτε το αρχικό έγγραφο για καλύτερη ανάλυση και πλήρη αποτελέσματα. Εδώ, βλέπουμε το φάσμα της απόδοσης FMR σε μια σειρά από εικόνες προσώπου VGGFace2, σε μια σειρά που περιλαμβάνει ασυμπιεσμένες ή ελάχιστα συμπιεσμένες εικόνες.

Ένα δείγμα από τα εκτεταμένα γραφήματα αποτελεσμάτων της μελέτης, τα οποία είναι πολύ μεγάλα και πολλά για να αναπαραχθούν εδώ – παρακαλώ δείτε το αρχικό έγγραφο για καλύτερη ανάλυση και πλήρη αποτελέσματα. Εδώ, βλέπουμε το φάσμα της απόδοσης FMR σε μια σειρά από εικόνες προσώπου VGGFace2, σε μια σειρά που περιλαμβάνει ασυμπιεσμένες ή ελάχιστα συμπιεσμένες εικόνες.

Το έγγραφο καταλήγει:

‘Συνολικά, η αξιολόγησή μας βρίσκει ότι η χρήση συμπιεσμένων δειγμάτων εικόνας με απώλεια κατά τη διάρκεια της inference μειώνει την απόδοση πιο σημαντικά σε συγκεκριμένες φαινοτυπικές κατηγορίες, συμπεριλαμβανομένων του σκουρόχρωμου δέρματος, του πλατύ μύτη, των κουτσουρεμένων μαλλιών και του μονολιδικού ματιού σε όλες τις άλλες φαινοτυπικές ιδιότητες.

‘Ωστόσο, η χρήση συμπιεσμένων εικόνων κατά τη διάρκεια της εκπαίδευσης κάνει τα μοντέλα που προκύπτουν πιο ανθεκτικά και περιορίζει την απόδοση που αντιμετωπίζεται: η χαμηλότερη απόδοση μεταξύ συγκεκριμένων φυλετικά ευθυγραμμισμένων υποομάδων παραμένει. Επιπλέον, η αφαίρεση της χρωματικής υποδειγματολήψης βελτιώνει το FMR για συγκεκριμένες φαινοτυπικές κατηγορίες που επηρεάζονται περισσότερο από τη συμπίεση με απώλεια.’

 

* Η μετατροπή των ενσωματωμένων παραπομπών των συγγραφέων σε υπερσύνδεσμους.

Πρώτη δημοσίευση 22ης Αυγούστου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai