Η γωνία του Anderson

‘Δεδομένα’ Συνθετικά Πρόσωπα Μπορούν Να Βοηθήσουν στη Βελτίωση της Αναγνώρισης Προσώπου

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές από το Πανεπιστήμιο του Μίσιγκαν έχουν αναπτύξει einen τρόπο για τα συνθετικά πρόσωπα να κάνουν μια παύση από τη σκηνή των deepfakes και να κάνουν κάτι καλό στον κόσμο – βοηθώντας τα συστήματα αναγνώρισης εικόνων να γίνουν πιο ακριβή.

Το νέο μοντέλο σύνθεσης προσώπου (CFSM) που έχουν αναπτύξει είναι ικανό να αναγεννά πρόσωπα με στυλ πραγματικών βίντεο επιτήρησης, αντί να βασίζεται στις ομοιόμορφα υψηλότερης ποιότητας εικόνες που χρησιμοποιούνται σε δημοφιλείς ανοιχτές πηγές δεδομένων διασημοτήτων, οι οποίες δεν αντανακλούν όλα τα λάθη και τις ελλείψεις των πραγματικών συστημάτων CCTV, όπως η θόλωση προσώπου, η χαμηλή ανάλυση και ο θόρυβος αισθητήρα – παράγοντες που μπορούν να επηρεάσουν την ακρίβεια αναγνώρισης.

Σχέδιο αρχιτεκτονικής για το Μοντέλο Σύνθεσης Προσώπου (CFSM). Πηγή: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022.pdf

Σχέδιο αρχιτεκτονικής για το Μοντέλο Σύνθεσης Προσώπου (CFSM). Πηγή: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022.pdf

Το CFSM δεν προορίζεται ειδικά για να模仿σει αυθεντικά τις θέσεις κεφαλής, τις εκφράσεις ή όλα τα άλλα συνήθη χαρακτηριστικά που είναι ο στόχος των συστημάτων deepfakes, αλλά για να γεννήσει eine σειρά από εναλλακτικές απόψεις με στυλ του συστήματος αναγνώρισης, χρησιμοποιώντας μεταφορά στυλ.

Το σύστημα έχει σχεδιαστεί για να μιμηθεί το στυλ του συστήματος αναγνώρισης και να προσαρμόσει την έξοδό του σύμφωνα με την ανάλυση και το εύρος των ‘ιδιοτήτων’ που υπάρχουν. Η περίπτωση χρήσης περιλαμβάνει παλαιότερα συστήματα που δεν είναι πιθανό να αναβαθμιστούν λόγω κόστους, αλλά τα οποία μπορούν τώρα να συμβάλλουν λίγο στην νέα γενιά τεχνολογιών αναγνώρισης προσώπου, λόγω της κακής ποιότητας της έξοδού τους που μπορεί να ήταν κάποτε πρωτοποριακή.

Κατά τη δοκιμή του συστήματος, οι ερευνητές βρήκαν ότι αυτό έκανε αξιοσημείωτες βελτιώσεις στην κατάσταση της τέχνης στα συστήματα αναγνώρισης εικόνων που πρέπει να αντιμετωπίσουν αυτό το είδος θορυβώδους και χαμηλής ποιότητας δεδομένων.

Εκπαίδευση των μοντέλων αναγνώρισης προσώπου για να προσαρμοστούν στις περιορισμούς των συστημάτων στόχου. Πηγή: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022_supp.pdf

Εκπαίδευση των μοντέλων αναγνώρισης προσώπου για να προσαρμοστούν στις περιορισμούς των συστημάτων στόχου. Πηγή: http://cvlab.cse.msu.edu/pdfs/Liu_Kim_Jain_Liu_ECCV2022_supp.pdf

Βρήκαν επίσης ένα χρήσιμο παραπροϊόν της διαδικασίας – ότι τα δεδομένα στόχου θα μπορούσαν τώρα να χαρακτηριστούν και να συγκριθούν μεταξύ τους, καθιστώντας τη σύγκριση, την αξιολόγηση και τη γεννήση των δεδομένων για διάφορα συστήματα CCTV πιο εύκολη στο μέλλον.

Επιπλέον, η μέθοδος μπορεί να εφαρμοστεί σε υπάρχοντα δεδομένα, πραγματοποιώντας de facto προσαρμογή τομέα και καθιστώντας τα πιο κατάλληλα για συστήματα αναγνώρισης προσώπου.

Το νέο έγγραφο έχει τον τίτλο Ελεγχόμενη και Καθοδηγούμενη Σύνθεση Προσώπου για Ανεμπόδιστη Αναγνώριση Προσώπου, υποστηρίζεται εν μέρει από το Γραφείο του Διευθυντή της Εθνικής Υπηρεσίας Πληροφοριών (ODNI, στο IARPA), και προέρχεται από τέσσερις ερευνητές από το Τμήμα Επιστήμης και Μηχανικής του MSU.

Διακεκριμένο Περιεχόμενο

Η αναγνώριση προσώπου χαμηλής ποιότητας (LQFR) έχει γίνει एक αξιοσημείωτο πεδίο μελέτης τα τελευταία χρόνια. Επειδή οι δημοτικές και δημοτικές αρχές έχτισαν συστήματα επιτήρησης βίντεο για να είναι ανθεκτικά και μακροχρόνια (και δεν ήθελαν να ξαναχρηματοδοτήσουν το πρόβλημα περιοδικά), πολλά ‘παλαιά’ συστήματα επιτήρησης έχουν γίνει θύματα τεχνολογικού χρέους, όσον αφορά την προσαρμοστικότητά τους ως πηγών δεδομένων για τη μηχανική μάθηση.

Διάφορα επίπεδα ανάλυσης προσώπου σε μια σειρά ιστορικών και πιο πρόσφατων συστημάτων επιτήρησης βίντεο. Πηγή: https://arxiv.org/pdf/1805.11519.pdf

Διάφορα επίπεδα ανάλυσης προσώπου σε μια σειρά ιστορικών και πιο πρόσφατων συστημάτων επιτήρησης βίντεο. Πηγή: https://arxiv.org/pdf/1805.11519.pdf

Τυχαία, αυτό είναι μια εργασία που τα μοντέλα διάχυσης και άλλα μοντέλα θορύβου είναι ασυνήθιστα καλά προσαρμοσμένα να λύσουν. Πολλά από τα πιο δημοφιλή και αποτελεσματικά συστήματα σύνθεσης εικόνων των τελευταίων ετών thực hiện αύξηση ανάλυσης εικόνων χαμηλής ανάλυσης ως μέρος του pipeline τους, ενώ αυτό είναι επίσης απολύτως απαραίτητο για τις τεχνικές συμπίεσης νευρωνικών δεδομένων (μεθόδους για να αποθηκεύουν εικόνες και βίντεο ως νευρωνικά δεδομένα αντί για bitmap δεδομένα).

Μέρος της πρόκλησης της αναγνώρισης προσώπου είναι να ληφθεί η μέγιστη δυνατή ακρίβεια από το ελάχιστο δυνατό αριθμό χαρακτηριστικών που μπορούν να εξαχθούν από τις μικρότερες και λιγότερο υποσχόμενες εικόνες χαμηλής ανάλυσης. Αυτός ο περιορισμός υπάρχει όχι μόνο επειδή είναι χρήσιμο να μπορείτε να αναγνωρίσετε (ή να δημιουργήσετε) ένα πρόσωπο σε χαμηλή ανάλυση, αλλά και λόγω τεχνικών περιορισμών στο μέγεθος των εικόνων που μπορούν να περάσουν από τον ερχόμενο.latent χώρο ενός μοντέλου που εκπαιδεύεται σε οποιοδήποτε VRAM είναι διαθέσιμο σε μια τοπική GPU.

Σε αυτό το πλαίσιο, ο όρος ‘χαρακτηριστικά’ είναι παραπλανητικός, поскольку τέτοια χαρακτηριστικά μπορούν επίσης να ληφθούν από ένα σύνολο δεδομένων από παγκάκια. Στο τομέα της όρασης υπολογιστή, ‘χαρακτηριστικά’ αναφέρεται στα διακριτά χαρακτηριστικά που λαμβάνονται από εικόνες – οποιαδήποτε εικόνες, είτε πρόκειται για τα χαρακτηριστικά ενός ναού, ενός βουνού ή της διάθεσης προσώπου σε ένα σύνολο δεδομένων προσώπου.

Επειδή οι αλγόριθμοι όρασης υπολογιστή είναι τώρα ικανοί να αυξάνουν εικόνες και βίντεο, διάφορες μεθόδους έχουν προταθεί για να ‘βελτιώσουν’ εικόνες χαμηλής ανάλυσης ή άλλες υποβαθμισμένες εικόνες επιτήρησης, μέχρι το σημείο που θα μπορούσε να είναι δυνατό να χρησιμοποιηθούν τέτοιες βελτιώσεις για νομικούς σκοπούς, όπως τοποθέτηση ενός ατόμου σε μια σκηνή, σε σχέση με μια έρευνα εγκλήματος.

Εκτός από τη δυνατότητα λανθασμένης ταυτοποίησης, η οποία έχει περίπου συγκεντρώσει επικεφαλίδες, θεωρητικά δεν θα ήταν απαραίτητο να υπερ-επιλύσουμε ή να μετατρέψουμε εικόνες χαμηλής ανάλυσης για να κάνουμε μια θετική ταυτοποίηση ατόμου,既然 ένα σύστημα αναγνώρισης προσώπου που βασίζεται σε χαμηλού επιπέδου χαρακτηριστικά δεν θα χρειαζόταν αυτό το επίπεδο ανάλυσης και σαφήνειας. Επιπλέον, τέτοιες μετατροπές είναι ακριβές στην πράξη και θέτουν πρόσθετα, περιοδικές ερωτήσεις γύρω από την потенτική τους εγκυρότητα και νομιμότητα.

Η Ανάγκη για Περισσότερους ‘Χαμηλού-Τακούνι’ Διασημότητες

Θα ήταν πιο χρήσιμο αν ένα σύστημα αναγνώρισης προσώπου θα μπορούσε να εξαγάγει χαρακτηριστικά (δηλ. χαρακτηριστικά μηχανικής μάθησης ανθρώπινων χαρακτηριστικών) από την έξοδο των παλαιών συστημάτων όπως είναι, κατανοώντας καλύτερα τη σχέση μεταξύ ‘υψηλής ανάλυσης’ ταυτότητας και των υποβαθμισμένων εικόνων που είναι διαθέσιμες σε αμετάβλητα (και συχνά αντικαταστάσιμα) υπάρχοντα πλαισιαία επιτήρησης βίντεο.

Το πρόβλημα εδώ είναι ένα πρόβλημα προτύπων: κοινά σύνολα δεδομένων που συλλέγονται από το διαδίκτυο όπως MS-Celeb-1M και WebFace260M (μεταξύ άλλων), έχουν αγκιστρωθεί από την ερευνητική κοινότητα επειδή παρέχουν σταθερά σημεία αναφοράς με τα οποία οι ερευνητές μπορούν να μετρήσουν την πορεία τους έναντι της τρέχουσας κατάστασης της τέχνης.

Παραδείγματα από το δημοφιλές σύνολο δεδομένων MS-Celeb1m. Πηγή: https://www.microsoft.com/en-us/research/project/ms-celeb-1m-challenge-recognizing-one-million-celebrities-real-world/

Παραδείγματα από το δημοφιλές σύνολο δεδομένων MS-Celeb1m. Πηγή: https://www.microsoft.com/en-us/research/project/ms-celeb-1m-challenge-recognizing-one-million-celebrities-real-world/

Ωστόσο, οι συγγραφείς υποστηρίζουν ότι οι αλγόριθμοι αναγνώρισης προσώπου (FR) που εκπαιδεύονται σε αυτά τα σύνολα δεδομένων δεν είναι κατάλληλα υλικά για τους οπτικούς ‘τομείς’ της έξοδου από πολλά παλαιότερα συστήματα επιτήρησης.

Το έγγραφο αναφέρει*:

‘[Κατάσταση της τέχνης] (SoTA) μοντέλα FR δεν λειτουργούν καλά σε πραγματικά δεδομένα επιτήρησης (ανεμπόδιστα) λόγω του προβλήματος μετατόπισης τομέα, δηλαδή τα μεγάλα σύνολα δεδομένων (ημι-περιορισμένα) που λαμβάνονται μέσω εικόνων διασημοτήτων που συλλέγονται από το διαδίκτυο, λείπουν από τις παραλλαγές in situ, όπως η θόλωση, η χαμηλή ανάλυση, η θόλωση κίνησης, η τουρμπουλένς, κ.λπ.

‘Για παράδειγμα, 1:1精度 αναγνώρισης που αναφέρεται από ένα από τα SoTA μοντέλα σε ανεμπόδιστα IJB-S σύνολο δεδομένων είναι περίπου 30% χαμηλότερη από αυτήν σε ημι-περιορισμένο LFW.

‘Μια πιθανή θεραπεία σε αυτό το χάσμα απόδοσης είναι να συλλέξουμε ένα μεγάλο σύνολο δεδομένων ανεμπόδιστου προσώπου. Ωστόσο, η κατασκευή ενός τέτοιου συνόλου δεδομένων με δεκάδες χιλιάδες αντικείμενα είναι προβληματική λόγω του υψηλού κόστους επισήμανσης.’

Το έγγραφο αναφέρει διάφορες προηγούμενες μεθόδους που έχουν προσπαθήσει να ‘ταιριάξουν’ τους διαφορετικούς τύπους εξόδου από ιστορικά ή χαμηλού κόστους συστήματα επιτήρησης, αλλά σημειώνουν ότι αυτές έχουν να κάνουν με ‘τυφλά’ βελτιώσεις. Σε αντίθεση, το CFSM λαμβάνει άμεση ανατροφοδότηση από την έξοδο του συστήματος στόχου κατά την εκπαίδευση και προσαρμόζεται μέσω μεταφοράς στυλ για να μιμηθεί αυτόν τον τομέα.

Η ηθοποιός Natalie Portman, που δεν είναι άγνωστη στη χούφτα των συνόλων δεδομένων που κυριαρχούν στην κοινότητα της όρασης υπολογιστή, εμφανίζεται μεταξύ των ταυτοτήτων σε αυτό το παράδειγμα του CFSM που εκτελείται με στυλ-συσχετισμένη προσαρμογή τομέα με βάση την ανατροφοδότηση από τον τομέα του πραγματικού μοντέλου.

Η ηθοποιός Natalie Portman, που δεν είναι άγνωστη στη χούφτα των συνόλων δεδομένων που κυριαρχούν στην κοινότητα της όρασης υπολογιστή, εμφανίζεται μεταξύ των ταυτοτήτων σε αυτό το παράδειγμα του CFSM που εκτελείται με στυλ-συσχετισμένη προσαρμογή τομέα με βάση την ανατροφοδότηση από τον τομέα του πραγματικού μοντέλου.

Η αρχιτεκτονική που σχεδιάστηκε από τους συγγραφείς χρησιμοποιεί Fast Gradient Sign Method (FGSM) για να διακρίνει και να ‘εισάγει’ τα ληφθέντα στυλ και χαρακτηριστικά από την πραγματική έξοδο του συστήματος στόχου. Το μέρος του pipeline που ασχολείται με τη γεννήση εικόνων θα βελτιωθεί και θα γίνει πιο πιστό στο σύστημα στόχου με την εκπαίδευση. Αυτή η ανατροφοδότηση από τον χαμηλό-διαστάσεων χώρο στυλ του συστήματος στόχου είναι χαμηλού επιπέδου και αντιστοιχεί στα ευρύτερα παραγόμενα οπτικά περιγραφείς.

Οι συγγραφείς σχολιάζουν:

‘Με την ανατροφοδότηση από το μοντέλο FR, οι συνθετικές εικόνες είναι πιο ωφέλιμες για την απόδοση FR, οδηγώντας σε σημαντικά βελτιωμένες ικανότητες γενίκευσης των μοντέλων FR που εκπαιδεύονται με αυτές.’

Δοκιμές

Οι ερευνητές χρησιμοποίησαν το προηγούμενο έργο του MSU ως πρότυπο για τη δοκιμή του συστήματος. Βασισμένοι στα ίδια πρωτόκολλα πειραμάτων, χρησιμοποίησαν το MS-Celeb-1m, το οποίο αποτελείται αποκλειστικά από φωτογραφίες διασημοτήτων που συλλέχθηκαν από το διαδίκτυο, ως το συνόλο δεδομένων εκπαίδευσης. Για να είναι δίκαιοι, συμπεριέλαβαν επίσης το MS1M-V2, το οποίο περιέχει 3,9 εκατομμύρια εικόνες με 85.700 κλάσεις.

Τα δεδομένα στόχου ήταν το σύνολο δεδομένων WiderFace, από το Πανεπιστήμιο του Χονγκ Κονγκ. Αυτό είναι ένα ιδιαίτερα διαφοροποιημένο σύνολο εικόνων που σχεδιάστηκε για εργασίες ανίχνευσης προσώπου σε απαιτητικές καταστάσεις. 70.000 εικόνες από αυτό το σύνολο χρησιμοποιήθηκαν.

Για αξιολόγηση, το σύστημα δοκιμάστηκε σε τέσσερις διαγωνισμούς αναγνώρισης προσώπου:: IJB-B, IJB-C, IJB-S, και TinyFace.

Το CFSM εκπαιδεύτηκε με ∼10% των δεδομένων εκπαίδευσης από το MS-Celeb-1m, περίπου 0,4 εκατομμύρια εικόνες, για 125.000 επαναλήψεις με μέγεθος δείγματος 32 υπό τον βελτιστοποιητή Adam σε μια πολύ χαμηλή ταχύτητα μάθησης 1e-4.

Το μοντέλο αναγνώρισης προσώπου στόχου χρησιμοποιούσε μια τροποποίηση του ResNet-50 για το σκελετό, με την ενεργοποίηση της συνάρτησης ArcFace κατά την εκπαίδευση. Επιπλέον, ένα μοντέλο εκπαιδεύτηκε με το CFSM ως μια άσκηση αφαίρεσης και σύγκρισης (σημειωμένο ως ‘ArcFace’ στον πίνακα αποτελεσμάτων παρακάτω).

Αποτελέσματα από τις κύριες δοκιμές για το CFSM. Υψηλότερα νούμερα είναι καλύτερα.

Αποτελέσματα από τις κύριες δοκιμές για το CFSM. Υψηλότερα νούμερα είναι καλύτερα.

Οι συγγραφείς σχολιάζουν τα κύρια αποτελέσματα:

‘Το μοντέλο ArcFace υπερέχει όλων των βάσεων σε cả τις εργασίες αναγνώρισης και επιβεβαίωσης προσώπου, και επιτυγχάνει μια νέα κατάσταση της τέχνης απόδοση.’

Η ικανότητα εξαγωγής τομέων από τις διάφορες ιδιότητες των παλαιών ή υπο-σχεδιασμένων συστημάτων επιτήρησης cũng επιτρέπει στους συγγραφείς να συγκρίνουν και να αξιολογήσουν τη ομοιότητα κατανομής μεταξύ αυτών των πλαισίων, και να παρουσιάσουν κάθε σύστημα σε σχέση με ένα οπτικό στυλ που θα μπορούσε να αξιοποιηθεί σε μελλοντική εργασία.

Παραδείγματα από διάφορα σύνολα δεδομένων εμφανίζουν σαφείς διαφορές σε στυλ.

Παραδείγματα από διάφορα σύνολα δεδομένων εμφανίζουν σαφείς διαφορές σε στυλ.

Οι συγγραφείς σημειώνουν επιπλέον ότι το σύστημά τους θα μπορούσε να κάνει μια χρήσιμη χρήση ορισμένων τεχνολογιών που μέχρι τώρα θεωρούνταν μόνο προβλήματα που πρέπει να επιλυθούν από την ερευνητική και οπτική κοινότητα:

‘[CFSM] δείχνει ότι η αντι-επεξεργασία θα μπορούσε να υπερβεί την επίθεση και να αυξήσει την ακρίβεια αναγνώρισης σε εργασίες όρασης. Εν τω μεταξύ, ορίσαμε einen μετρητή ομοιότητας συνόλων δεδομένων με βάση τις μελετημένες βάσεις στυλ, οι οποίες συλλαμβάνουν τις διαφορές στυλ σε ένα label-αγνόητο και προβλέψιμο τρόπο.’

‘Πιστεύουμε ότι η έρευνά μας έχει παρουσιάσει τη δύναμη ενός ελεγχόμενου και καθοδηγούμενου μοντέλου σύνθεσης προσώπου για ανεμπόδιστη αναγνώριση προσώπου και παρέχει μια κατανόηση των διαφορών συνόλων δεδομένων.’

 

* Η μετατροπή των εσωτερικών αναφορών των συγγραφέων σε υπερσύνδεσμους.

Πρώτη δημοσίευση 1η Αυγούστου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai