Μοντέλα και πλατφόρμες AI

DeepFace για Προηγμένη Αναγνώριση Προσώπου

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η αναγνώριση προσώπου έχει sido ένα trending πεδίο στην τεχνητή νοημοσύνη και τη μηχανική μάθηση για αρκετά χρόνια τώρα, και οι ευρείες πολιτιστικές και κοινωνικές επιπτώσεις της αναγνώρισης προσώπου είναι πολύ εκτεταμένες. Ωστόσο, υπάρχει ένα χάσμα απόδοσης μεταξύ των ανθρώπινων οπτικών συστημάτων και των μηχανών που目前 περιορίζουν τις εφαρμογές της αναγνώρισης προσώπου.

Για να υπερβεί το буφέ που δημιουργήθηκε από το χάσμα απόδοσης και να παρέχει ανθρώπινη ακρίβεια, η Meta εισήγαγε το DeepFace, ένα πλαίσιο αναγνώρισης προσώπου. Το μοντέλο DeepFace εκπαιδεύεται σε ένα μεγάλο σύνολο δεδομένων προσώπου που διαφέρει σημαντικά από τα σύνολα δεδομένων που χρησιμοποιούνται για την κατασκευή των βενčem benchmarκ, και έχει το δυναμικό να υπερβεί τα υπάρχοντα πλαίσια με ελάχιστες προσαρμογές. Επιπλέον, το πλαίσιο DeepFace παράγει συμπαγείς αναπαραστάσεις προσώπου όταν συγκρίνεται με άλλα συστήματα που παράγουν χιλιάδες χαρακτηριστικά εμφάνισης προσώπου.

Το προτεινόμενο πλαίσιο DeepFace χρησιμοποιεί βαθιά μάθηση για να εκπαιδεύσει σε ένα μεγάλο σύνολο δεδομένων που αποτελείται από διάφορες μορφές δεδομένων, συμπεριλαμβανομένων εικόνων, βίντεο και γραφικών. Η αρχιτεκτονική του δικτύου DeepFace υποθέτει ότι μια φορά που η ευθυγράμμιση ολοκληρωθεί, η θέση κάθε περιοχής προσώπου είναι σταθερή στο επίπεδο pixel.,因此, είναι δυνατό να χρησιμοποιηθούν οι ακατέργαστες τιμές RGB pixel χωρίς να χρησιμοποιηθούν πολλαπλά στρώματα σύγκρισης όπως σε άλλα πλαίσια.

Η συμβατική διαδικασία των σύγχρονων πλαισίων αναγνώρισης προσώπου αποτελείται από τέσσερις στάδια: Ανίχνευση, Ευθυγράμμιση, Αναπαράσταση και Ταξινόμηση. Το πλαίσιο DeepFace χρησιμοποιεί ρητή μοντελοποίηση 3D προσώπου για να εφαρμόσει μια μετασχηματισμό κομματιού, και χρησιμοποιεί ένα δίκτυο νευρώνων εννέα στρώσεων για να εξαγάγει μια αναπαράσταση προσώπου. Το πλαίσιο DeepFace προσπαθεί να κάνει τις ακόλουθες συνεισφορές

  1. Να αναπτύξει μια αποτελεσματική αρχιτεκτονική DNN ή βαθιά νευρωνικού δικτύου που μπορεί να εκμεταλλευτεί ένα μεγάλο σύνολο δεδομένων για να δημιουργήσει μια αναπαράσταση προσώπου που μπορεί να γενικευθεί σε άλλα σύνολα δεδομένων.
  2. Να χρησιμοποιήσει ρητή μοντελοποίηση 3D για να αναπτύξει ένα αποτελεσματικό σύστημα ευθυγράμμισης προσώπου.

Κατανόηση της Λειτουργίας του Μοντέλου DeepFace

Ευθυγράμμιση Προσώπου

Η ευθυγράμμιση προσώπου είναι μια τεχνική που περιστρέφει την εικόνα ενός ατόμου σύμφωνα με τη γωνία των ματιών. Η ευθυγράμμιση προσώπου είναι μια δημοφιλής πρακτική που χρησιμοποιείται για την προεπεξεργασία δεδομένων για αναγνώριση προσώπου, και τα σύνολα δεδομένων που ευθυγραμμίζονται βοηθούν στην βελτίωση της ακρίβειας των αλγορίθμων αναγνώρισης παρέχοντας μια κανονικοποιημένη είσοδο. Ωστόσο, η ευθυγράμμιση προσώπου σε μη περιορισμένο τρόπο μπορεί να είναι μια δύσκολη εργασία λόγω των πολλών παραγόντων που εμπλέκονται όπως μη ρηχές εκφράσεις, στάσεις σώματος και άλλα. Πολλές σοφιστικες τεχνικές ευθυγράμμισης όπως η χρήση αναλυτικού 3D μοντέλου προσώπου ή η αναζήτηση fiducial-σημείων από εξωτερικό σύνολο δεδομένων μπορεί να επιτρέψουν στους dévelopπερ να υπερβούν τις προκλήσεις.

Αν και η ευθυγράμμιση είναι η πιο δημοφιλής μέθοδος για την αντιμετώπιση της αναγνώρισης προσώπου σε μη περιορισμένο τρόπο, δεν υπάρχει τέλεια λύση στο παρόν. Τα 3D μοντέλα χρησιμοποιούνται επίσης, αλλά η δημοτικότητά τους έχει μειωθεί σημαντικά τα τελευταία χρόνια, ιδιαίτερα όταν εργάζονται σε μη περιορισμένο περιβάλλον. Ωστόσο, επειδή τα ανθρώπινα πρόσωπα είναι 3D αντικείμενα, μπορεί να είναι η σωστή προσέγγιση αν χρησιμοποιηθεί σωστά. Το μοντέλο DeepFace χρησιμοποιεί ένα σύστημα που χρησιμοποιεί fiducial-σημεία για να δημιουργήσει μια αναλυτική 3D μοντελοποίηση του προσώπου. Αυτή η 3D μοντελοποίηση χρησιμοποιείται στη συνέχεια για να μεταμορφώσει μια εικόνα προσώπου σε 3D μετωπιαία κατάσταση.

Επιπλέον, όπως και οι περισσότερες πρακτικές ευθυγράμμισης, η ευθυγράμμιση DeepFace χρησιμοποιεί επίσης fiducial-σημεία για να κατευθύνει τη διαδικασία ευθυγράμμισης. Αν και το μοντέλο DeepFace χρησιμοποιεί einen απλό ανιχνευτή σημείων, εφαρμόζει σε πολλές επαναλήψεις για να βελτιώσει την έξοδο. Ένας Support Vector Regressor ή SVR εκπαιδευμένος για να προκαταλήψει τις ρυθμίσεις σημείων εξάγει τα fiducial-σημεία από einen περιγραφέα εικόνας σε κάθε επανάληψη. Ο περιγραφέας εικόνας DeepFace βασίζεται σε LBP Histograms αν και λαμβάνει υπόψη και άλλα χαρακτηριστικά.

2D Ευθυγράμμιση

Το μοντέλο DeepFace αρχίζει τη διαδικασία ευθυγράμμισης ανιχνεύοντας έξι fiducial-σημεία μέσα στο σύνολο δεδομένων ανίχνευσης, κεντραρισμένα στο μέσο των ματιών, της στοματικής τοποθεσίας και της μύτης. Αυτά χρησιμοποιούνται για να περιστρέψουν, να κλιμακώσουν και να μεταφέρουν την εικόνα σε έξι σημεία-αγκίστρου, και να επαναλάβουν τη διαδικασία μέχρι να μην υπάρχει ορατή αλλαγή. Η συσσωρευμένη μετασχηματισμός παράγει ένα 2D ευθυγραμμισμένο σύνολο δεδομένων. Η μέθοδος ευθυγράμμισης είναι khá παρόμοια με αυτή που χρησιμοποιείται στο LFW-a, και έχει χρησιμοποιηθεί τα τελευταία χρόνια σε μια προσπάθεια να αυξήσει την ακρίβεια του μοντέλου.

3D Ευθυγράμμιση

Για να ευθυγραμμίσει τα πρόσωπα με περιστροφές εκτός επιπέδου, το πλαίσιο DeepFace χρησιμοποιεί ένα γενικό 3D σχήμα μοντέλου, και καταχωρεί μια 3D κάμερα που μπορεί να χρησιμοποιηθεί για να τυλίξει το 2D ευθυγραμμισμένο σύνολο δεδομένων στο 3D σχήμα στο επίπεδό του. Ως αποτέλεσμα, το μοντέλο παράγει την 3D-ευθυγραμμισμένη έκδοση του συνόλου δεδομένων, και αυτό επιτυγχάνεται με την τοποθέτηση 67 fiducial-σημείων στο 2D-ευθυγραμμισμένο σύνολο δεδομένων χρησιμοποιώντας έναν δεύτερο SVR ή Support Vector Regressor.

Το μοντέλο τοποθετεί στη συνέχεια τα 67 σημεία-αγκίστρου στο 3D σχήμα και είναι σε θέση να επιτύχει πλήρη αντιστοιχία μεταξύ 3D αναφορών και των αντίστοιχων fiducial-σημείων. Στο επόμενο βήμα, μια 3D-2D affine κάμερα προστίθεται χρησιμοποιώντας μια γενικευμένη λύση least squares στο σύστημα γραμμικών συστημάτων με einer γνωστή κовариάνς πίνακα που ελαχιστοποιεί ορισμένες απώλειες.

Μετώπιαση

Επειδή οι μη ρηχές παραμορφώσεις και οι πλήρεις προοπτικές προβολές δεν μοντελοποιούνται, η προσαρμοσμένη 3D-2D κάμερα χρησιμεύει μόνο ως μια προσέγγιση. Σε μια προσπάθεια να μειώσει τη διατάραξη των σημαντικών παραγόντων ταυτότητας στο τελικό warp, το μοντέλο DeepFace προσθέτει τις αντίστοιχες υπολοιπές στις x-y συνιστώσες κάθε αναφοράς fiducial-σημείου. Такая χαλάρωση για τον σκοπό της μεταμόρφωσης της 2D εικόνας με λιγότερες διαστρεβλώσεις στην ταυτότητα είναι εύλογη, και χωρίς αυτήν, τα πρόσωπα θα είχαν μεταμορφωθεί στο ίδιο σχήμα σε 3D, και θα χάνανε σημαντικούς διακριτικούς παράγοντες στη διαδικασία.

Τελικά, το μοντέλο επιτυγχάνει μετώπιαση χρησιμοποιώντας μια τεμαχισμένη affine μετασχηματισμό κατευθυνόμενη από την Delaunay triangulation που προέρχεται από 67 fiducial-σημεία.

  1. Ανιχνευμένο πρόσωπο με 6 fiducial-σημεία.
  2. Ευθυγραμμισμένο 2D σύνολο δεδομένων.
  3. 67 fiducial-σημεία στο 2D-ευθυγραμμισμένο σύνολο δεδομένων.
  4. Αναφορά 3D σχήματος μετασχηματισμένη σε 2D-ευθυγραμμισμένο σύνολο δεδομένων.
  5. Ορατότητα τριγώνου σε σχέση με την 3D-2D κάμερα.
  6. 67 fiducial-σημεία που προκύπτουν από το 3D μοντέλο.
  7. 3D-ευθυγραμμισμένη έκδοση του τελικού συνόλου δεδομένων.
  8. Νέα άποψη που παράγεται από το 3D μοντέλο.

Αναπαράσταση

Με την αύξηση του ποσού των δεδομένων εκπαίδευσης, οι μεθόδους μάθησης έχουν αποδειχθεί πιο αποτελεσματικές και ακριβείς σε σύγκριση με τις μηχανικές λειτουργίες κυρίως επειδή οι μεθόδους μάθησης μπορούν να ανακαλύψουν και να βελτιώσουν τα χαρακτηριστικά για μια συγκεκριμένη εργασία.

Αρχιτεκτονική DNN και Εκπαίδευση

Το DNN DeepFace εκπαιδεύεται σε μια πολυπλοκή εργασία αναγνώρισης προσώπου που ταξινομεί την ταυτότητα μιας εικόνας προσώπου.

Το παραπάνω σχήμα αντιπροσωπεύει την συνολική αρχιτεκτονική του μοντέλου DeepFace. Το μοντέλο έχει ένα στρώμα convolutional (C1) με 32 φίλτρα μεγέθους 11x11x3 που τροφοδοτείται με μια 3D-ευθυγραμμισμένη 3-κανάλι RGB εικόνα μεγέθους 152×152 pixel, και αποτέλεσμα 32 χαρακτηριστικών χαρτών. Αυτοί οι χαρακτηριστικοί χάρτες τροφοδοτούνται στη συνέχεια σε ένα στρώμα Max Pooling ή M2 που λαμβάνει το μέγιστο πάνω από 3×3 χωρικές γειτονιές, και έχει ένα βήμα 2, ξεχωριστά για κάθε κανάλι. Ακολουθεί ένα άλλο στρώμα convolutional (C3) που αποτελείται από 16 φίλτρα μεγέθους 9x9x16. Ο κύριος σκοπός αυτών των στρωμάτων είναι να εξάγουν χαμηλού επιπέδου χαρακτηριστικά όπως υφή και απλές ακμές. Το πλεονέκτημα της χρήσης στρωμάτων Max Pooling είναι ότι κάνει την έξοδο που παράγεται από τα στρώματα convolutional πιο ανθεκτική σε τοπικές μετατοπίσεις, και όταν εφαρμόζεται σε ευθυγραμμισμένες εικόνες προσώπου, κάνει το δίκτυο πολύ πιο ανθεκτικό σε σφάλματα καταχωρήσεων σε μικρή κλίμακα.

Πολλαπλά επίπεδα pooling κάνουν το δίκτυο πιο ανθεκτικό σε ορισμένες καταστάσεις, αλλά επίσης προκαλούν το δίκτυο να χάσει πληροφορίες σχετικά με την ακριβή θέση των μικρο-κυκλωμάτων και λεπτών δομών προσώπου. Για να αποφευχθεί η απώλεια πληροφοριών, το μοντέλο DeepFace χρησιμοποιεί ένα στρώμα max pooling μόνο με το πρώτο στρώμα convolutional. Αυτά τα στρώματα ερμηνεύονται από το μοντέλο ως ένα προσαρμόσιμο βήμα προεπεξεργασίας. Αν και κάνουν την περισσότερη υπολογιστική εργασία, έχουν περιορισμένα παραμέτρους από μόνα τους, και απλώς επεκτείνουν την είσοδο σε ένα σύνολο τοπικών χαρακτηριστικών.

Τα επόμενα στρώματα L4, L5 και L6 είναι τοπικά συνδεμένα, και όπως ένα στρώμα convolutional, εφαρμόζουν ένα σύνολο φίλτρων όπου κάθε θέση στο χαρακτηριστικό χάρτη μαθαίνει ένα μοναδικό σύνολο φίλτρων. Όπως διαφορετικές περιοχές σε μια ευθυγραμμισμένη εικόνα έχουν διαφορετικές τοπικές στατιστικές, δεν μπορεί να κρατήσει την υπόθεση χωρικής σταθερότητας. Για παράδειγμα, η περιοχή μεταξύ των φρυδιών και των ματιών έχει υψηλότερη διακριτική ικανότητα σε σύγκριση με την περιοχή μεταξύ του στόματος και της μύτης. Η χρήση τοπικά συνδεμένων στρωμάτων επηρεάζει τον αριθμό των παραμέτρων που υπόκεινται σε εκπαίδευση, αλλά δεν επηρεάζει το υπολογιστικό φορτίο κατά την εξαγωγή χαρακτηριστικών.

Το μοντέλο DeepFace χρησιμοποιεί τρία στρώματα στην πρώτη θέση μόνο επειδή έχει ένα μεγάλο ποσό καλά ετικετωμένων δεδομένων εκπαίδευσης. Η χρήση τοπικά συνδεμένων στρωμάτων μπορεί να δικαιολογηθεί περαιτέρω ως κάθε έξοδος μονάδας eines τοπικά συνδεμένου στρώματος μπορεί να επηρεαστεί από ένα μεγάλο τμήμα δεδομένων εισόδου.

Τελικά, τα ανώτερα στρώματα είναι πλήρως συνδεμένα με κάθε έξοδο μονάδας που συνδέεται με όλες τις εισόδους. Τα δύο στρώματα μπορούν να καταγράψουν τις συσχετίσεις μεταξύ χαρακτηριστικών που καταγράφονται σε διαφορετικά μέρη των εικόνων προσώπου όπως θέση και σχήμα του στόματος, και θέση και σχήμα των ματιών. Η έξοδος του πρώτου πλήρως συνδεμένου στρώματος (F7) θα χρησιμοποιηθεί από το δίκτυο ως η сырая αναπαράσταση χαρακτηριστικών προσώπου. Το μοντέλο θα τροφοδοτήσει την έξοδο του τελευταίου πλήρως συνδεμένου στρώματος (F8) σε einen K-ทาง softmax που παράγει μια κατανομή πάνω από τις ετικέτες κατηγοριών.

Σύνολα Δεδομένων

Το μοντέλο DeepFace χρησιμοποιεί ένα συνδυασμό συνόλων δεδομένων με το σύνολο δεδομένων Social Face Classification ή SFC ως το πρωτεύον. Επιπλέον, το μοντέλο DeepFace χρησιμοποιεί επίσης το σύνολο δεδομένων LFW και το σύνολο δεδομένων YTF.

Σύνολο Δεδομένων SFC

Το σύνολο δεδομένων SFC μαθαίνεται από μια συλλογή εικόνων από το Facebook (META ), και αποτελείται από 4,4 εκατομμύρια ετικετωμένα εικόνες 4.030 ατόμων με κάθε ένα από αυτά να έχει 800 έως 1200 πρόσωπα. Τα πιο πρόσφατα 5% του συνόλου δεδομένων SFC για κάθε ταυτότητα αφήνονται έξω για δοκιμαστικούς σκοπούς.

Σύνολο Δεδομένων LFW

Το σύνολο δεδομένων LFW αποτελείται από 13.323 φωτογραφίες περισσότερων από 5.000 διασημοτήτων που διαιρούνται σε 6.000 ζευγάρια προσώπων σε 10 διαχωρισμοί.

Σύνολο Δεδομένων YTF

Το σύνολο δεδομένων YTF αποτελείται από 3.425 βίντεο 1.595 θεμάτων, και είναι ένα υποσύνολο των διασημοτήτων στο σύνολο δεδομένων LFW.

Αποτελέσματα

Χωρίς μετώπιαση και όταν χρησιμοποιείται μόνο η 2D ευθυγράμμιση, το μοντέλο επιτυγχάνει ένα σκορ ακρίβειας μόνο περίπου 94,3%. Όταν το μοντέλο χρησιμοποιεί το κεντρικό σύνολο δεδομένων ανίχνευσης, δεν χρησιμοποιεί καμία ευθυγράμμιση, και σε αυτήν την περίπτωση, το μοντέλο επιστρέφει ένα σκορ ακρίβειας 87,9% επειδή κάποια μέρη της περιοχής προσώπου μπορεί να πέσουν έξω από το κεντρικό σύνολο δεδομένων. Για να αξιολογήσει την διακριτική ικανότητα της αναπαράστασης προσώπου σε απομόνωση, το μοντέλο ακολουθεί τη ρύθμιση μη επιτηρούμενης μάθησης για να συγκρίνει το εσωτερικό γινόμενο των κανονικοποιημένων χαρακτηριστικών. Αυτό αυξάνει το μέσο σκορ ακρίβειας του μοντέλου σε 95,92%

Το παραπάνω μοντέλο συγκρίνει την απόδοση του μοντέλου DeepFace σε σύγκριση με άλλα μοντέλα αναγνώρισης προσώπου.

Το παραπάνω σχήμα απεικονίζει τις καμπύλες ROC στο σύνολο δεδομένων.

Συμπέρασμα

Ιδανικά, ένας ταξινομητής προσώπου θα ήταν σε θέση να αναγνωρίσει πρόσωπα με την ακρίβεια ενός ανθρώπου, και θα ήταν σε θέση να επιστρέψει υψηλή ακρίβεια ανεξάρτητα από την ποιότητα της εικόνας, τη στάση, την έκφραση ή την φωτισμό. Επιπλέον, ένα ιδανικό πλαίσιο αναγνώρισης προσώπου θα ήταν σε θέση να εφαρμοστεί σε eine ποικιλία εφαρμογών με λίγες ή καθόλου τροποποιήσεις. Αν και το DeepFace είναι ένα από τα πιο προηγμένα και αποτελεσματικά πλαίσια αναγνώρισης προσώπου που υπάρχουν σήμερα, δεν είναι τέλειο, και μπορεί να μην είναι σε θέση να παράσχει ακριβή αποτελέσματα σε ορισμένες καταστάσεις. Αλλά το πλαίσιο DeepFace είναι ένα σημαντικό ορόσημο στην βιομηχανία αναγνώρισης προσώπου, και κλείνει το χάσμα απόδοσης χρησιμοποιώντας μια ισχυρή τεχνική μάθησης μετρικής, και θα συνεχίσει να γίνεται πιο αποτελεσματικό με τον καιρό.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.