Η γωνία του Anderson

Η Εξηγητή AI μπορεί να παραδώσει πιο εύκολα εμπιστευτικά δεδομένα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές από το Εθνικό Πανεπιστήμιο της Σιγκαπούρης έχουν καταλήξει στο συμπέρασμα ότι όσο πιο εξηγητή γίνεται η τεχνητή νοημοσύνη, τόσο πιο εύκολο θα γίνει να παραβιάζονται τα ζωτικά χαρακτηριστικά της ιδιωτικής ζωής στα συστήματα μηχανικής μάθησης. Επίσης, βρήκαν ότι ακόμη και όταν ένα μοντέλο δεν είναι εξηγητή, είναι δυνατό να χρησιμοποιηθούν εξηγήσεις από παρόμοια μοντέλα για να “αποκρυπτογραφηθούν” ευαίσθητα δεδομένα στο μη εξηγητή μοντέλο.

Η έρευνα, με τίτλο Εξαγωγή Εξηγήσεων για Επιθέσεις Ανάστροφης Μοντελοποίησης, υπογραμμίζει τους κινδύνους της χρήσης της “τυχαίας” αδιαφάνειας του τρόπου λειτουργίας των νευρωνικών δικτύων ως ανεπίσημη χαρακτηριστική ασφάλειας – όχι τουλάχιστον επειδή μια σειρά από νέες παγκόσμιες πρωτοβουλίες, συμπεριλαμβανομένων των προσχημάτων κανονισμών της Ευρωπαϊκής Ένωσης, χαρακτηρίζουν την εξηγητή τεχνητή νοημοσύνη (XAI) ως προαπαιτούμενο για την τελική ομαλοποίηση της μηχανικής μάθησης στην κοινωνία.

Στην έρευνα, μια πραγματική ταυτότητα ανακατασκευάζεται με επιτυχία από υποτιθέμενα ανώνυμα δεδομένα που σχετίζονται με εκφράσεις του προσώπου, μέσω της εκμετάλλευσης πολλών εξηγήσεων του συστήματος μηχανικής μάθησης. Πηγή: https://arxiv.org/pdf/2108.10800.pdf

Στην έρευνα, μια πραγματική ταυτότητα ανακατασκευάζεται με επιτυχία από υποτιθέμενα ανώνυμα δεδομένα που σχετίζονται με εκφράσεις του προσώπου, μέσω της εκμετάλλευσης πολλών εξηγήσεων του συστήματος μηχανικής μάθησης. Πηγή: https://arxiv.org/pdf/2108.10800.pdf

Οι ερευνητές σχολιάζουν:

‘Η εξηγητή τεχνητή νοημοσύνη (XAI) παρέχει περισσότερες πληροφορίες για να βοηθήσει τους χρήστες να κατανοήσουν τις αποφάσεις του μοντέλου, ωστόσο αυτή η πρόσθετη γνώση εκθέτει πρόσθετους κινδύνους για επιθέσεις ιδιωτικής ζωής. Έτσι, η παροχή εξηγήσεων βλάπτει την ιδιωτικότητα.’

Επαναταυτοποίηση Ιδιωτικών Δεδομένων

Οι συμμετέχοντες σε σύνολα δεδομένων μηχανικής μάθησης μπορεί να έχουν συναινέσει να συμμετέχουν με την υπόθεση της ανωνυμοποίησης: στην περίπτωση των Προσωπικών Ταυτοποιητικών Πληροφοριών (PII) που τελικά καταλήγουν σε συστήματα AI μέσω ανεπίσημης συλλογής δεδομένων (για παράδειγμα, μέσω κοινωνικών δικτύων), η συμμετοχή μπορεί να είναι νομικά επιτρεπτή, αλλά πιέζει την έννοια της “συναινέσεως”.

Πολλές μεθόδοι έχουν εμφανιστεί τα τελευταία χρόνια που έχουν αποδείξει ότι είναι ικανές να αποανωνυμοποιούν PII από υποτιθέμενα αδιαφανή ροές δεδομένων μηχανικής μάθησης. Η εξαγωγή μοντέλου χρησιμοποιεί πρόσβαση API (δηλαδή “μαύρο κουτί” πρόσβαση, χωρίς ειδική διαθεσιμότητα του πηγαίου κώδικα ή δεδομένων) για να εξαγάγει PII ακόμη και από μεγάλης κλίμακας παρόχους MLaaS, συμπεριλαμβανομένων των Amazon Web Services, ενώ οι Επιθέσεις Ανάστροφης Μέλους (MIAs), που λειτουργούν υπό παρόμοιους περιορισμούς, μπορούν να πάρουν εμπιστευτικές ιατρικές πληροφορίες: επιπλέον, οι Επιθέσεις Ανάστροφης Απόδοσης (AIAs) μπορούν να ανακτήσουν ευαίσθητα δεδομένα από έξοδο API.

Αποκάλυψη Προσώπων

Για το νέο έγγραφο, οι ερευνητές έχουν επικεντρωθεί σε μια επίθεση ανάστροφης μοντελοποίησης που σχεδιάστηκε για να λάβει μια ταυτότητα από ένα υποσύνολο δεδομένων εκφράσεων του προσώπου που δεν θα έπρεπε να είναι ικανό να αποκαλύψει αυτήν την πληροφορία.

Ο στόχος του συστήματος ήταν να συνδέσει εικόνες που βρέθηκαν στο διαδίκτυο (είτε δημοσιευμένες τυχαία στο διαδίκτυο είτε σε μια πιθανή διαρροή δεδομένων) με την ένταξή τους στα σύνολα δεδομένων που υποστηρίζουν ένα σύστημα μηχανικής μάθησης.

Οι ερευνητές εκπαίδευσαν ένα μοντέλο επίθεσης ανάστροφης μοντελοποίησης που ήταν ικανό να ανακατασκευάσει την εικόνα που συνέβαλε από την ανώνυμη έξοδο API, χωρίς ειδική πρόσβαση στον αρχικό αρχιτεκτονικό σχεδιασμό. Προηγούμενη εργασία σε αυτό το πεδίο έχει επικεντρωθεί σε συστήματα όπου η ταυτοποίηση (προστασία ή αποκάλυψη) ήταν ο στόχος και του στόχου συστήματος και του συστήματος επίθεσης: σε αυτήν την περίπτωση, το πλαίσιο έχει σχεδιαστεί για να εκμεταλλευτεί την έξοδο ενός τομέα και να την εφαρμόσει σε διαφορετικό τομέα.

Μια μετατοπισμένη συνελικτική νευρωνική αρχιτεκτονική (CNN) χρησιμοποιήθηκε για να προβλέψει την “πρωταρχική” πηγή του προσώπου με βάση τον διανυσματικό προορισμό (χάρτη σαλημίας) για ένα σύστημα αναγνώρισης συναισθήματος, χρησιμοποιώντας μια αρχιτεκτονική U-Net για να βελτιώσει την απόδοση ανακατασκευής του προσώπου.

Το σύστημα επαναταυτοποίησης τροφοδοτείται και ενημερώνεται από την εξηγητή τεχνητή νοημοσύνη (XAI), όπου η γνώση της ενεργοποίησης των νευρώνων, μεταξύ πολλών άλλων δημόσιων πτυχών XAI, εκμεταλλεύεται για να ανακατασκευάσει τις εσωτερικές μηχανισμοί της αρχιτεκτονικής μόνο από την έξοδό της, επιτρέποντας την επαναταυτοποίηση των εικόνων του συνόλου δεδομένων.

Το σύστημα επαναταυτοποίησης τροφοδοτείται και ενημερώνεται από την εξηγητή τεχνητή νοημοσύνη (XAI), όπου η γνώση της ενεργοποίησης των νευρώνων, μεταξύ πολλών άλλων δημόσιων πτυχών XAI, εκμεταλλεύεται για να ανακατασκευάσει τις εσωτερικές μηχανισμοί της αρχιτεκτονικής μόνο από την έξοδό της, επιτρέποντας την επαναταυτοποίηση των εικόνων του συνόλου δεδομένων.

Δοκιμή

Στην δοκιμή του συστήματος, οι ερευνητές το applied σε τρία σύνολα δεδομένων: iCV-MEFED εκφράσεις του προσώπου: CelebA: και MNIST γραπτά ψηφία. Για να ταιριάξουν με το μέγεθος του μοντέλου που χρησιμοποιούσαν οι ερευνητές, τα τρία σύνολα δεδομένων αναδιαμορφώθηκαν αντίστοιχα σε 128×128, 265×256 και 32×32 εικονοστοιχεία. Το 50% κάθε συνόλου χρησιμοποιήθηκε ως δεδομένα εκπαίδευσης, και το άλλο μισό χρησιμοποιήθηκε ως σύνολο δεδομένων επίθεσης για να εκπαιδεύσει τα αντίπαλα μοντέλα.

Κάθε σύνολο δεδομένων είχε διαφορετικά μοντέλα στόχου, και κάθε δίκτυο επίθεσης ήταν κλιμακωμένο στα όρια των εξηγήσεων που υποστήριζαν τη διαδικασία, και όχι χρησιμοποιώντας βαθύτερα νευρωνικά μοντέλα που θα ξεπερνούσαν την γενίκευση των εξηγήσεων.

Οι τύποι εξηγήσεων XAI που χρησιμοποιήθηκαν για να τροφοδοτήσουν τις προσπάθειες περιελάμβαναν Εξήγηση Gradient, Εξήγηση Gradient Input, Grad-CAM και Layer-Wise Relevance Propagation (LRP). Οι ερευνητές αξιολόγησαν επίσης πολλές εξηγήσεις σε όλη τη διάρκεια των πειραμάτων.

Ανακατασκευή εικόνας που διευκολύνεται από μια επίθεση ανάστροφης μοντελοποίησης που είναι συνειδητή XAI, σε τρία σύνολα δεδομένων, με ταυτόσημους στόχους και επιθέσεις.

Ανακατασκευή εικόνας που διευκολύνεται από μια επίθεση ανάστροφης μοντελοποίησης που είναι συνειδητή XAI, σε τρία σύνολα δεδομένων, με ταυτόσημους στόχους και επιθέσεις.

Οι μετρήσεις για τη δοκιμή ήταν pixelwise ομοιότητα που αξιολογήθηκε από Μέσο Τετραγωνικό Σφάλμα (MSE): Ομοιότητα Εικόνας (SSIM), ένας δείκτης ομοιότητας με βάση την αντίληψη: ακρίβεια επίθεσης, που καθορίζεται από το εάν ένας ταξινομητής μπορεί να επανασχεδιάσει με επιτυχία μια ανακατασκευασμένη εικόνα: και ομοιότητα ενσωμάτωσης επίθεσης, που συγκρίνει τις ενσωματώσεις χαρακτηριστικών των γνωστών πηγαίων δεδομένων με ανακατασκευασμένα δεδομένα.

Η επαναταυτοποίηση επιτεύχθηκε, με διαφορετικά επίπεδα ανάλογα με την εργασία και τα σύνολα δεδομένων, σε όλα τα σύνολα. Επιπλέον, οι ερευνητές βρήκαν ότι με την κατασκευή ενός υποκατάστατου μοντέλου στόχου (το οποίο είχαν φυσικά πλήρη έλεγχο), ήταν ακόμη δυνατό να επιτευχθεί επαναταυτοποίηση δεδομένων από εξωτερικά, “κλειστά” μοντέλα, με βάση γνωστές αρχές XAI.

Οι ερευνητές βρήκαν ότι τα πιο ακριβή αποτελέσματα επιτεύχθηκαν με εξηγήσεις που βασίζονται στην ενεργοποίηση (χάρτη σαλημίας), οι οποίες διέρρευσαν περισσότερες PII από προσεγγίσεις που βασίζονται στη ευαισθησία (gradient).

Σε μελλοντική εργασία, η ομάδα έχει την πρόθεση να ενσωματώσει διαφορετικούς τύπους εξηγήσεων XAI σε νέες επιθέσεις, όπως οπτικοποίηση χαρακτηριστικών και διανυσματικά концепτών ενεργοποίησης.

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]