Η γωνία του Anderson

Οι Deepfakes Μπορούν να Απομακρύνουν Ευεργετικά Πολλούς Μεγάλους Facial ‘Liveness’ APIs

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

Μια νέα ερευνητική συνεργασία μεταξύ των ΗΠΑ και της Κίνας έχει διερευνήσει την ευπάθεια των μεγαλύτερων συστημάτων αυθεντικοποίησης προσώπου στον κόσμο σε σχέση με τις deepfakes και βρήκε ότι τα περισσότερα από αυτά είναι ευάλωτα σε εξελισσόμενες και αναδυόμενες μορφές επιθέσεων deepfake.

Η έρευνα διεξήχθη με τη χρήση ενός προσαρμοσμένου πλαισίου που εφαρμόστηκε εναντίον συστημάτων Facial Liveness Verification (FLV) που παρέχονται από μεγάλους προμηθευτές και πωλούνται ως υπηρεσία σε πελάτες όπως αεροπορικές εταιρείες και ασφαλιστικές εταιρείες.

Από το έγγραφο, μια επισκόπηση της λειτουργίας των Facial Liveness Verification (FLV) APIs μεταξύ των μεγαλύτερων προμηθευτών. Πηγή: https://arxiv.org/pdf/2202.10673.pdf

Από το έγγραφο, μια επισκόπηση της λειτουργίας των Facial Liveness Verification (FLV) APIs μεταξύ των μεγαλύτερων προμηθευτών. Πηγή: https://arxiv.org/pdf/2202.10673.pdf

Η Facial Liveness έχει ως στόχο να απομακρύνει τη χρήση τεχνικών όπως οι επιθέσεις εικόνας, η χρήση μασκών και προηχογραφημένων βίντεο, τα λεγόμενα “master faces” και άλλες μορφές κλονοποίησης οπτικής ταυτότητας.

Η μελέτη καταλήγει στο συμπέρασμα ότι ο περιορισμένος αριθμός μονάδων ανίχνευσης deepfake που έχουν εγκατασταθεί σε αυτά τα συστήματα, πολλά από τα οποία εξυπηρετούν εκατομμύρια πελάτες, είναι μακράν ακατάλληλα και μπορεί να έχουν ρυθμιστεί με βάση τεχνικές deepfake που είναι πλέον ξεπερασμένες ή μπορεί να είναι πολύ αρχιτεκτονικά συγκεκριμένες.

Οι συγγραφείς σημειώνουν:

‘Διάφορες μεθόδους deepfake δείχνουν παραλλαγές μεταξύ των διαφορετικών προμηθευτών… Χωρίς πρόσβαση στα τεχνικά στοιχεία των στόχων FLV, υποθέτουμε ότι τέτοιες παραλλαγές οφείλονται στα μέτρα άμυνας που έχουν εγκατασταθεί από τους διαφορετικούς προμηθευτές. Για παράδειγμα, ορισμένοι προμηθευτές μπορεί να έχουν εγκαταστήσει άμυνα εναντίον συγκεκριμένων επιθέσεων deepfake.’

Και συνεχίζουν:

‘Οι περισσότερες FLV APIs δεν χρησιμοποιούν ανίχνευση anti-deepfake· ακόμη και για εκείνες με τέτοιες άμυνες, η αποτελεσματικότητά τους είναι ανησυχητική (π.χ. μπορεί να ανιχνεύσει υψηλής ποιότητας συνθετικά βίντεο αλλά να αποτύχει να ανιχνεύσει χαμηλής ποιότητας βίντεο).’

Οι ερευνητές παρατηρούν, σε αυτήν τη σχέση, ότι η ‘αυθεντικότητα’ είναι σχετική:

‘Ακόμη και αν ένα συνθετικό βίντεο είναι μη πραγματικό για τους ανθρώπους, μπορεί ακόμη να παραβιάσει το τρέχον μηχανισμό ανίχνευσης anti-deepfake με πολύ υψηλό ποσοστό επιτυχίας.’

Πάνω, δείγματα εικόνων deepfake που μπόρεσαν να πιστοποιηθούν στις πειραματικές δοκιμές. Κάτω, φαινομενικά πιο πραγματικές πλαστές εικόνες που απέτυχαν να πιστοποιηθούν.

Πάνω, δείγματα εικόνων deepfake που μπόρεσαν να πιστοποιηθούν στις πειραματικές δοκιμές. Κάτω, φαινομενικά πιο πραγματικές πλαστές εικόνες που απέτυχαν να πιστοποιηθούν.

Άλλη μια εύρεση ήταν ότι η τρέχουσα διαμόρφωση των γενικών συστημάτων αυθεντικοποίησης προσώπου είναι προκατειλημμένη προς τους λευκούς άνδρες. Κατά συνέπεια, οι γυναικείες και μη λευκές ταυτότητες βρέθηκαν να είναι πιο αποτελεσματικές στην παραβίαση των συστημάτων αυθεντικοποίησης, θέτοντας τους πελάτες σε αυτές τις κατηγορίες σε μεγαλύτερο κίνδυνο παραβίασης μέσω τεχνικών deepfake.

Η έκθεση βρίσκει ότι οι λευκές ανδρικές ταυτότητες είναι οι πιο αυστηρά και ακριβώς αξιολογημένες από τις δημοφιλείς APIs αυθεντικοποίησης προσώπου. Στο πίνακα παραπάνω, βλέπουμε ότι οι γυναικείες και μη λευκές ταυτότητες μπορούν να χρησιμοποιηθούν πιο εύκολα για να παραβιάσουν τα συστήματα.

Η έκθεση βρίσκει ότι οι λευκές ανδρικές ταυτότητες είναι οι πιο αυστηρά και ακριβώς αξιολογημένες από τις δημοφιλείς APIs αυθεντικοποίησης προσώπου. Στο πίνακα παραπάνω, βλέπουμε ότι οι γυναικείες και μη λευκές ταυτότητες μπορούν να χρησιμοποιηθούν πιο εύκολα για να παραβιάσουν τα συστήματα.

Το έγγραφο παρατηρεί ότι ‘υπάρχουν προκαταλήψεις στην αυθεντικοποίηση προσώπου, οι οποίες μπορεί να φέρουν σημαντικούς κινδύνους ασφαλείας σε μια συγκεκριμένη ομάδα ανθρώπων.’

Οι συγγραφείς διεξήγαγαν επίσης ηθικές επιθέσεις αυθεντικοποίησης προσώπου εναντίον μιας κινεζικής κυβέρνησης, μιας μεγάλης κινεζικής αεροπορικής εταιρείας, μιας από τις μεγαλύτερες ασφαλιστικές εταιρείες στη Κίνα και της R360, μιας από τις μεγαλύτερες εταιρείες επένδυσης σε unicorn στον κόσμο, και αναφέρουν επιτυχία στην παραβίαση των συστημάτων αυθεντικοποίησης αυτών των οργανισμών.

Στην περίπτωση μιας επιτυχημένης παραβίασης αυθεντικοποίησης για την κινεζική αεροπορική εταιρεία, η API απαιτούσε από τον χρήστη να ‘κουνήσει το κεφάλι’ ως απόδειξη ενάντια σε πιθανό υλικό deepfake, αλλά αυτό αποδείχθηκε ότι δεν λειτουργεί εναντίον του πλαισίου που ανέπτυξαν οι ερευνητές, το οποίο ενσωματώνει έξι αρχιτεκτονικές deepfake.

Παρά την αξιολόγηση της κίνησης του κεφαλιού του χρήστη από την αεροπορική εταιρεία, το περιεχόμενο deepfake μπόρεσε να περάσει την δοκιμή.

Παρά την αξιολόγηση της κίνησης του κεφαλιού του χρήστη από την αεροπορική εταιρεία, το περιεχόμενο deepfake μπόρεσε να περάσει την δοκιμή.

Το έγγραφο σημειώνει ότι οι συγγραφείς επικοινώνησαν με τους προμηθευτές που συμμετείχαν, οι οποίοι φέρονται να έχουν αναγνωρίσει το έργο.

Οι συγγραφείς προτείνουν μια σειρά από βελτιώσεις για την τρέχουσα κατάσταση της τεχνολογίας στην FLV, συμπεριλαμβανομένης της εγκατάλειψης της αυθεντικοποίησης με βάση μια einz εικόνα (‘Image-based FLV’), όπου η αυθεντικοποίηση βασίζεται σε μια einz εικόνα από την κάμερα του πελάτη· μια πιο ευέλικτη και ολοκληρωμένη ενημέρωση των συστημάτων ανίχνευσης deepfake σε εικόνα και φωνή· την επιβολή της ανάγκης για συγχρονισμό της φωνής με τα κινήματα των χειλιών (τα οποία δεν γίνονται τώρα, γενικά)· και την απαίτηση από τους χρήστες να εκτελέσουν χειρονομίες και κινήσεις που είναι δύσκολο για τα συστήματα deepfake να αναπαράγουν (για παράδειγμα, προφίλ και μερική απόκρυψη του προσώπου).

Το έγγραφο έχει τον τίτλο Seeing is Living? Rethinking the Security of Facial Liveness Verification in the Deepfake Era, και προέρχεται από τους συν-πρωταγωνιστές Changjiang Li και Li Wang, και πέντε άλλους συγγραφείς από το Πανεπιστήμιο της Πενσυλβάνια, το Πανεπιστήμιο Zhejiang και το Πανεπιστήμιο Shandong.

Η Κεντρική Στόχος

Οι ερευνητές στόχευαν τους ‘έξι πιο αντιπροσωπευτικούς’ προμηθευτές Facial Liveness Verification (FLV), οι οποίοι έχουν ανωνυμοποιηθεί με κρυπτογράφους στην έρευνα.

Οι προμηθευτές αντιπροσωπεύονται ως εξής: ‘BD’ και ‘TC’ αντιπροσωπεύουν einen ομόσπονδο προμηθευτή με τον μεγαλύτερο αριθμό κλήσεων API προσώπου και τη μεγαλύτερη μερίδα της κινεζικής αγοράς cloud AI· ‘HW’ είναι ‘ένας από τους προμηθευτές με την μεγαλύτερη κινεζική δημόσια αγορά cloud’· ‘CW’ έχει τον ταχύτερο ρυθμό αύξησης στην υπολογιστική όραση και αποκτά μια ηγετική θέση στην αγορά· ‘ST’ είναι μεταξύ των μεγαλύτερων προμηθευτών υπολογιστικής όρασης· και ‘iFT’ αριθμεί μεταξύ των μεγαλύτερων προμηθευτών λογισμικού AI στην Κίνα.

Δεδομένα και Αρχιτεκτονική

Τα υποκείμενα δεδομένα που τροφοδοτούν το έργο περιλαμβάνουν ένα σύνολο δεδομένων 625.537 εικόνων από την κινεζική πρωτοβουλία CelebA-Spoof, μαζί με ζωντανούς βίντεο από το dataset SiW-M του Πανεπιστημίου του Michigan το 2019.

Όλες οι πειραματικές δοκιμές διεξήχθησαν σε einen διακομιστή με δύο 2,40 GHz Intel Xeon E5-2640 v4 CPUs που εκτελούνται σε 256 GB RAM με einen 4TB HDD και τέσσερις ορχηστρικές 1080Ti NVIDIA GPUs, για συνολικό 44GB λειτουργικής VRAM.

Έξι σε Ένα

Το πλάισιο που ανέπτυξαν οι συγγραφείς του εγγράφου ονομάζεται LiveBugger και ενσωματώνει έξι state-of-the-art deepfake frameworks που αντιτάχθηκαν στους τέσσερις κύριους αμυντικούς μηχανισμούς σε συστήματα FLV.

Το LiveBugger περιλαμβάνει διαφορετικές προσεγγίσεις deepfake και επικεντρώνεται στους τέσσερις κύριους διανυσματικούς φορείς σε συστήματα FLV.

Το LiveBugger περιλαμβάνει διαφορετικές προσεγγίσεις deepfake και επικεντρώνεται στους τέσσερις κύριους διανυσματικούς φορείς σε συστήματα FLV.

Οι έξι deepfake frameworks που χρησιμοποιήθηκαν είναι: το 2018 του Πανεπιστημίου της Οξφόρδης X2Face· η ακαδημαϊκή συνεργασία των ΗΠΑ ICface· δύο παραλλαγές του ισραηλινού έργου FSGAN του 2019· το ιταλικό First Order Method Model (FOMM) από τις αρχές του 2020· και η συνεργασία του Πανεπιστημίου του Πεκίνου με την Microsoft Research FaceShifter (αν και το FaceShifter δεν είναι ανοικτό, οι συγγραφείς έπρεπε να το ανακατασκευάσουν με βάση τις δημοσιευμένες αρχιτεκτονικές λεπτομέρειες).

Οι μέθοδοι που χρησιμοποιήθηκαν μεταξύ αυτών των πλαισίων περιλαμβάνουν τη χρήση προ-αποθηκευμένου βίντεο στο οποίο τα αντικείμενα του βίντεο εκτελούν προκαθορισμένες ενέργειες που έχουν εξαχθεί από τις απαιτήσεις αυθεντικοποίησης της API σε einem προηγούμενο μοντέλο αξιολόγησης του LiveBugger, και επίσης τη χρήση αποτελεσματικού ‘deepfake puppetry’, το οποίο μεταφράζει τις ζωντανούς κινήσεις ενός ατόμου σε einen deepfaked ροή που έχει εισαχθεί σε einen συνδεδεμένο ροή webcam.

Ένα παράδειγμα του τελευταίου είναι το DeepFaceLive, το οποίο παρουσιάστηκε το προηγούμενο καλοκαίρι ως ένα πρόγραμμα που συνοδεύει το δημοφιλές DeepFaceLab, για να ermöglicht πραγματικό χρόνο deepfake streaming, αλλά το οποίο δεν περιλαμβάνεται στην έρευνα των συγγραφέων.

Επιθέσεις στους Τέσσερις Διανυσματικούς Φορείς

Οι τέσσερις διανυσματικοί φορείς σε ένα τυπικό σύστημα FLV είναι: εικόνα-με-βασή FLV, το οποίο χρησιμοποιεί μια einz φωτογραφία ως token αυθεντικοποίησης έναντι ενός facial ID που είναι καταγεγραμμένο στο σύστημα· σιωπη-με-βασή FLV, το οποίο απαιτεί από τον χρήστη να ανεβάσει einen βίντεο clip· δράση-με-βασή FLV, το οποίο απαιτεί από τον χρήστη να εκτελέσει ενέργειες που ορίζονται από την πλατφόρμα· και φωνή-με-βασή FLV, το οποίο αντιστοιχίζει την ομιλία του χρήστη με το προφίλ φωνής του χρήστη στο σύστημα.

Η πρώτη πρόκληση για το σύστημα είναι να καθορίσει το βαθμό στον οποίο μια API θα αποκαλύψει τις απαιτήσεις της,既然 μπορεί να προβλεφθούν και να κατεργαστούν κατά τη διαδικασία deepfaking. Αυτό χειρίζεται από τον Intelligence Engine στο LiveBugger, ο οποίος συλλέγει πληροφορίες σχετικά με τις απαιτήσεις από δημόσια διαθέσιμα έγγραφα API και άλλες πηγές.

既然 οι δημοσιευμένες απαιτήσεις μπορεί να λείπουν (για διάφορους λόγους) από τις πραγματικές διαδικασίες της API, ο Intelligence Engine ενσωματώνει einen προβή που συλλέγει ضمنτικές πληροφορίες με βάση τα αποτελέσματα των εξερευνητικών κλήσεων API. Σε αυτό το ερευνητικό έργο, αυτό διευκολύνθηκε από επίσημους offline ‘τεστ’ APIs που παρέχονται για το όφελος των développers, και επίσης από εθελοντές που πρόσφεραν να χρησιμοποιήσουν τους δικούς τους ζωντανούς λογαριασμούς για δοκιμές.

Ο Intelligence Engine αναζητά στοιχεία σχετικά με το αν μια API χρησιμοποιεί μια συγκεκριμένη προσέγγιση που θα μπορούσε να είναι χρήσιμη σε επιθέσεις. Χαρακτηριστικά αυτού του είδους περιλαμβάνουν coherence detection, το οποίο ελέγχει εάν τα πλαίσια σε ένα βίντεο είναι χρονικά συνεχόμενα – μια απαιτήση που μπορεί να καθοριστεί με την αποστολή scrambled βίντεο πλαισίων και την παρατήρηση εάν αυτό συμβάλλει στην αποτυχία αυθεντικοποίησης.

Ο Intelligence Engine αναζητά επίσης Lip Language Detection, όπου η API μπορεί να ελέγξει εάν ο ήχος στο βίντεο είναι συνχρονισμένος με τα κινήματα των χειλιών (σπάνια η περίπτωση – δείτε ‘Αποτελέσματα’ παρακάτω).

Αποτελέσματα

Οι συγγραφείς βρήκαν ότι όλες οι έξι αξιολογημένες APIs δεν χρησιμοποιούν ανίχνευση συνάφειας κατά την время των πειραματικών δοκιμών, επιτρέποντας στον deepfaker μηχανισμό στο LiveBugger να απλώς συνδέσει συνθετικό ήχο με deepfaked βίντεο, με βάση υλικό που συνεισέφερε από εθελοντές.

Ωστόσο, κάποιες εφαρμογές downstream (δηλαδή πελάτες των πλαισίων API) βρέθηκαν να έχουν προσθέσει ανίχνευση συνάφειας στη διαδικασία, απαιτώντας την προ-εγγραφή ενός βίντεο που να παραβιάζει αυτήν.

Επιπλέον, μόνο λίγοι από τους προμηθευτές API χρησιμοποιούν ανίχνευση γλωσσών χειλιών· για τους περισσότερους από αυτούς, το βίντεο και ο ήχος αναλύονται ως ξεχωριστές ποσότητες, και δεν υπάρχει λειτουργία που προσπαθεί να αντιστοιχίσει τα κινήματα των χειλιών με τον παρεχόμενο ήχο.

Διάφορα αποτελέσματα που καλύπτουν το φάσμα των τεχνικών deepfake που είναι διαθέσιμες στο LiveBugger εναντίον των διαφορετικών διανυσματικών φορέων σε APIs FLV. Υψηλότερα νούμερα δείχνουν μεγαλύτερο ποσοστό επιτυχίας στην παραβίαση της FLV με τεχνικές deepfake. Όχι όλες οι APIs περιλαμβάνουν όλες τις πιθανές άμυνες για FLV· για παράδειγμα, κάποιες δεν προσφέρουν καμία άμυνα εναντίον deepfakes, ενώ άλλες δεν ελέγχουν εάν τα κινήματα των χειλιών και ο ήχος συγχρονίζονται σε βίντεο που υποβάλλεται από τον χρήστη κατά την αυθεντικοποίηση.

Διάφορα αποτελέσματα που καλύπτουν το φάσμα των τεχνικών deepfake που είναι διαθέσιμες στο LiveBugger εναντίον των διαφορετικών διανυσματικών φορέων σε APIs FLV. Υψηλότερα νούμερα δείχνουν μεγαλύτερο ποσοστό επιτυχίας στην παραβίαση της FLV με τεχνικές deepfake. Όχι όλες οι APIs περιλαμβάνουν όλες τις πιθανές άμυνες για FLV· για παράδειγμα, κάποιες δεν προσφέρουν καμία άμυνα εναντίον deepfakes, ενώ άλλες δεν ελέγχουν εάν τα κινήματα των χειλιών και ο ήχος συγχρονίζονται σε βίντεο που υποβάλλεται από τον χρήστη κατά την αυθεντικοποίηση.

Συμπέρασμα

Τα αποτελέσματα και οι ενδείξεις του εγγράφου για το μέλλον των APIs FLV είναι πολύπλοκα, και οι συγγραφείς έχουν συνδυάσει αυτά τα στοιχεία σε einen λειτουργικό ‘αρχιτεκτονική ευπαθειών’ που θα μπορούσε να βοηθήσει τους développers FLV να κατανοήσουν καλύτερα κάποια από τα προβλήματα που ανακαλύφθηκαν.

Το δίκτυο συστάσεων του εγγράφου σχετικά με την υπάρχουσα και πιθανή ευπάθεια των ρουτινών αυθεντικοποίησης προσώπου με βάση βίντεο σε επιθέσεις deepfake.

Το δίκτυο συστάσεων του εγγράφου σχετικά με την υπάρχουσα και πιθανή ευπάθεια των ρουτινών αυθεντικοποίησης προσώπου με βάση βίντεο σε επιθέσεις deepfake.

Οι συστάσεις του εγγράφου σημειώνουν:

‘Οι κίνδυνοι ασφαλείας της FLV υπάρχουν ευρέως σε πολλές πραγματικές εφαρμογές, και έτσι απειλούν την ασφάλεια εκατομμυρίων τελικών χρηστών’

Οι συγγραφείς επίσης παρατηρούν ότι η χρήση δράσης-με-βασή FLV είναι ‘περιφερειακή’, και ότι η αύξηση του αριθμού των ενεργειών που απαιτούνται από τους χρήστες ‘δεν μπορεί να φέρει κανένα κέρδος ασφαλείας’.

Επιπλέον, οι συγγραφείς σημειώνουν ότι η συνδυασμένη χρήση αναγνώρισης φωνής και χρονικής αναγνώρισης προσώπου (σε βίντεο) είναι μια άκαρπη άμυνα, εκτός εάν οι προμηθευτές API αρχίσουν να απαιτούν ότι τα κινήματα των χειλιών συγχρονίζονται με τον ήχο.

Το έγγραφο έρχεται στο φως μιας πρόσφατης προειδοποίησης του FBI για τους κινδύνους της απάτης deepfake, σχεδόν ένα χρόνο μετά την προειδοποίηση τους για την उपयोग της τεχνολογίας σε ξένες επιρροές και των γενικών φόβων ότι η τεχνολογία deepfake σε πραγματικό χρόνο θα διευκολύνει μια νέα κύματα εγκλήματος σε ένα κοινό που ακόμη εμπιστεύεται την ασφάλεια της αυθεντικοποίησης βίντεο.

Αυτά είναι ακόμη οι πρώτοι χρόνοι της deepfake ως επιφάνειας επιθέσεων αυθεντικοποίησης· το 2020, 35 εκατομμύρια δολάρια απαχθήθηκαν με απάτη από μια τράπεζα στο UAE με χρήση τεχνολογίας deepfake ήχου, και ένας εκτελεστής του Ηνωμένου Βασιλείου επίσης απάτησε και δαπάνησε 243.000 δολάρια το 2019.

 

Πρώτη δημοσίευση 23ης Φεβρουαρίου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai