Η γωνία του Anderson

Τα Συνθετικά Δεδομένα Δεν Προστατεύουν Αξιοπιστώς την Ιδιωτικότητα, Υποστηρίζουν Ερευνητές

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια νέα ερευνητική συνεργασία μεταξύ Γαλλίας και Ηνωμένου Βασιλείου ανατρέπει την αυξανόμενη εμπιστοσύνη της βιομηχανίας ότι τα συνθετικά δεδομένα μπορούν να επιλύσουν τα προβλήματα ιδιωτικότητας, ποιότητας και διαθεσιμότητας (μεταξύ άλλων) που απειλούν την πρόοδο στον τομέα της μηχανικής μάθησης.

Μεταξύ των πολλών βασικών σημείων που διευθετούνται, οι συγγραφείς υποστηρίζουν ότι τα συνθετικά δεδομένα που μοντελοποιούνται από πραγματικά δεδομένα διατηρούν αρκετές από τις γνήσιες πληροφορίες, ώστε να μην παρέχουν αξιόπιστη προστασία από επιθέσεις συναγωγής και συμμετοχής, οι οποίες επιδιώκουν να αποανωνυμοποιήσουν τα δεδομένα και να τα επανασυνδέσουν με πραγματικά άτομα.

Επιπλέον, τα άτομα που είναι πιο ευάλωτα σε τέτοιες επιθέσεις, συμπεριλαμβανομένων εκείνων με κρίσιμες ιατρικές καταστάσεις ή υψηλές νοσοκομειακές δαπάνες (στην περίπτωση ανωνυμοποίησης ιατρικών αρχείων), είναι, μέσω της «εξωτERIC» φύσης της κατάστασής τους, πιο πιθανό να αναγνωριστούν ξανά με αυτές τις τεχνικές.

Το έγγραφο παρατηρεί:

‘Δεδομένου ότι έχεις πρόσβαση σε ένα συνθετικό σύνολο δεδομένων, ένας στρατηγικός αντίπαλος μπορεί να συναγάγει, με υψηλή εμπιστοσύνη, την παρουσία ενός στόχου εγγραφής στο αρχικό σύνολο δεδομένων.’

Το έγγραφο σημειώνει επίσης ότι τα συνθετικά δεδομένα με διαφορετική ιδιωτικότητα, τα οποία αποκρύπτουν το σήμα των ατομικών εγγραφών, προστατεύουν πραγματικά την ιδιωτικότητα των ατόμων, αλλά μόνο αν καταστρέφουν σημαντικά τη χρησιμότητα των συστημάτων ανάκτησης πληροφοριών που τα χρησιμοποιούν.

Αν κάτι, οι ερευνητές παρατηρούν ότι οι διαφορετικά ιδιωτικές προσεγγίσεις – οι οποίες χρησιμοποιούν «πραγματικές» πληροφορίες «σε απόσταση» μέσω συνθετικών δεδομένων – κάνουν την ασφάλεια χειρότερη από ότι θα ήταν διαφορετικά:

‘Τα συνθετικά σύνολα δεδομένων δεν παρέχουν καμία διαφάνεια σχετικά με αυτό το εμπόριο. Είναι αδύνατο να προβλεφθεί ποια χαρακτηριστικά δεδομένων θα διατηρηθούν και ποια πρότυπα θα κατασταλούν.’

Το νέο έγγραφο, με τίτλο Συνθετικά Δεδομένα – Ημέρα Ανωνυμοποίησης, προέρχεται από δύο ερευνητές στο École Polytechnique Fédérale de Lausanne (EPFL) στο Παρίσι και έναν ερευνητή στο University College London (UCL).

Οι ερευνητές διεξήγαγαν δοκιμές των υφιστάμενων ιδιωτικών αλγορίθμων εκπαίδευσης γενετικών μοντέλων και βρήκαν ότι ορισμένες υλοποιητικές αποφάσεις παραβιάζουν τις формικές εγγυήσεις ιδιωτικότητας που παρέχονται στα πλαίσια, αφήνοντας ποικίλες εγγραφές εκτεθειμένες σε επιθέσεις συναγωγής.

Οι συγγραφείς προσφέρουν μια αναθεωρημένη έκδοση κάθε αλγορίθμου που потенτικά μετριάζει αυτές τις εκθέσεις και κάνουν τον κώδικα διαθέσιμο ως ανοιχτό βιβλιοθήκη. Υποστηρίζουν ότι αυτό θα βοηθήσει τους ερευνητές να αξιολογήσουν τα οφέλη ιδιωτικότητας των συνθετικών δεδομένων και να συγκρίνουν χρήσιμα τις δημοφιλείς μεθόδους ανωνυμοποίησης. Το νέο πλαίσιο ενσωματώνει δύο σχετικές μεθόδους επιθέσεων ιδιωτικότητας που μπορούν να εφαρμοστούν σε οποιοδήποτε αλγόριθμο εκπαίδευσης γενετικών μοντέλων.

Συνθετικά Δεδομένα

Τα συνθετικά δεδομένα χρησιμοποιούνται για την εκπαίδευση μοντέλων μηχανικής μάθησης σε διάφορες περιπτώσεις, συμπεριλαμβανομένων περιπτώσεων όπου η έλλειψη πλήρους πληροφόρησης μπορεί потенτικά να συμπληρωθεί με ψευδή δεδομένα. Ένα παράδειγμα αυτού είναι η δυνατότητα χρήσης CGI-γεννημένων προσώπων για να παρέχουν «δύσκολα» ή σπάνια φωτογραφίες προσώπων για συνθετικά σύνολα δεδομένων, όπου οι φωτογραφίες προφίλ, οι οξυρές γωνίες ή οι ασυνήθιστες εκφράσεις είναι συχνά σπάνιες στις πηγαίες υλικές.

Άλλα είδη CGI εικόνων έχουν χρησιμοποιηθεί για να πληρώσουν σύνολα δεδομένων που θα τρέχουν τελικά σε μη συνθετικά δεδομένα, όπως σύνολα δεδομένων που χαρακτηρίζουν χέρια και έπιπλα.

Στα θέματα προστασίας της ιδιωτικότητας, τα συνθετικά δεδομένα μπορούν να παραχθούν από πραγματικά δεδομένα με τη χρήση συστημάτων Αντιπαλών Γενετικών Δικτύων (GAN) που εξάγουν χαρακτηριστικά από τα πραγματικά δεδομένα και δημιουργούν παρόμοια, πλασματικά εγγραφές που είναι πιθανό να γενικευθούν καλά σε μεταγενέστερα (αόρατα, πραγματικά) δεδομένα, αλλά προορίζονται να αποκρύπτουν λεπτομέρειες πραγματικών ατόμων που εμφανίζονται στα πηγαία δεδομένα.

Μεθοδολογία

Για τους σκοπούς της νέας έρευνας, οι συγγραφείς αξιολόγησαν τα οφέλη ιδιωτικότητας σε πέντε αλγορίθμους εκπαίδευσης γενετικών μοντέλων. Τρία από τα μοντέλα δεν προσφέρουν ρητές εγγυήσεις ιδιωτικότητας, ενώ τα άλλα δύο έρχονται με εγγυήσεις διαφορετικής ιδιωτικότητας. Αυτά τα ταμπελώδη μοντέλα επιλέχθηκαν για να αντιπροσωπεύουν một ευρύ φάσμα αρχιτεκτονικών.

Τα μοντέλα που επιτέθηκαν ήταν BayNet, PrivBay (μια παραλλαγή του PrivBayes/BayNet), CTGAN, PATEGAN και IndHist.

Το πλαίσιο αξιολόγησης για τα μοντέλα υλοποιήθηκε ως μια βιβλιοθήκη Python με δύο βασικές κλάσεις – Γενετικά Μοντέλα και Επιθέσεις Ιδιωτικότητας. Η τελευταία χαρακτηρίζεται από δύο πτυχές – έναν αντίπαλο συναγωγής και μια επίθεση συναγωγής. Το πλαίσιο είναι επίσης σε θέση να αξιολογήσει τα οφέλη ιδιωτικότητας των «καθαρισμένων» (δηλ. ανωνυμοποιημένων) δεδομένων και συνθετικών δεδομένων.

Τα δύο σύνολα δεδομένων που χρησιμοποιήθηκαν στις δοκιμές ήταν το Σύνολο Δεδομένων Ενηλίκων από το Αποθετήριο Μηχανικής Μάθησης UCI και το Αρχείο Δημόσιας Χρήσης Δεδομένων Απολύσεων Νοσοκομείων από το Τμήμα Υγείας του Τέξας. Το σύνολο δεδομένων του Τέξας που χρησιμοποιήθηκε από τους ερευνητές περιέχει 50.000 εγγραφές δειγμάτων από ιατρικά αρχεία για το έτος 2013.

Επιθέσεις και Ευρήματα

Ο γενικός στόχος της έρευνας είναι να καθορίσει τη «σύνδεση» (τη ξανά-σύνδεση των πραγματικών δεδομένων με τα συνθετικά δεδομένα που启ηθηκαν από αυτά). Τα μοντέλα επιθέσεων που χρησιμοποιήθηκαν στη μελέτη περιλαμβάνουν Logistic Regression, Random Forests και K-Nearest Neighbors ταξινομητές.

Οι συγγραφείς επέλεξαν δύο ομάδες στόχων που αποτελούνται από πέντε τυχαία επιλεγμένες εγγραφές για «μειονοτικές» κατηγορίες του πληθυσμού,既然 αυτές είναι πιο πιθανό να είναι ευάλωτες σε μια επίθεση σύνδεσης. Επίσης, επέλεξαν εγγραφές με «σπάνιες κατηγορικές τιμές ιδιοτήτων» εκτός του 95% ποσοστού των ιδιοτήτων. Παραδείγματα περιλαμβάνουν εγγραφές που σχετίζονται με υψηλό κίνδυνο θνησιμότητας, υψηλές νοσοκομειακές δαπάνες και σοβαρότητα ασθένειας.

Αν και το έγγραφο δεν διευκρινίζει αυτό το σημείο, από την οπτική των πιθανών πραγματικών επιτιθέμενων, αυτά είναι ακριβώς τα είδη «ακριβών» ή «υψηλού κινδύνου» ασθενών που είναι πιο πιθανό να στοχευτούν από επιθέσεις συναγωγής και άλλων ειδών εξαγωγής πληροφοριών σε ιατρικά αρχεία.

Πολυάριθμες επιθέσεις μοντέλων εκπαιδεύτηκαν ενάντια σε δημόσιες πληροφορίες αναφοράς για να αναπτύξουν «σκιά» μοντέλα σε δέκα στόχους. Τα αποτελέσματα σε μια σειρά από πειράματα (όπως περιγράφηκε νωρίτερα) δείχνουν ότι πολλές εγγραφές ήταν «πολύ ευάλωτες» σε επιθέσεις σύνδεσης που στοχεύουν σε αυτές από τους ερευνητές. Τα αποτελέσματα βρήκαν επίσης ότι το 20% όλων των στόχων στις δοκιμές έλαβε ένα όφελος ιδιωτικότητας μηδέν από τα συνθετικά δεδομένα που παράχθηκαν με μεθόδους GAN.

Οι ερευνητές σημειώνουν ότι τα αποτελέσματα ποικίλλουν, ανάλογα με τη μέθοδο που χρησιμοποιήθηκε για τη δημιουργία συνθετικών δεδομένων, τον διανυσματικό επιτιθέμενο και τα χαρακτηριστικά του στοχευμένου συνόλου δεδομένων. Η αναφορά βρίσκει ότι σε πολλές περιπτώσεις, η αποτελεσματική καταστολή ταυτοτήτων μέσω προσεγγίσεων συνθετικών δεδομένων μειώνει τη χρησιμότητα των συστημάτων που τα χρησιμοποιούν. Αποτελεσματικά, η χρησιμότητα και η ακρίβεια τέτοιων συστημάτων μπορεί σε πολλές περιπτώσεις να είναι ένας прямός δείκτης του πόσο ευάλωτα είναι σε επιθέσεις ξανά-σύνδεσης.

Οι ερευνητές συμπεραίνουν:

‘Αν ένα συνθετικό σύνολο δεδομένων διατηρεί τα χαρακτηριστικά του αρχικού συνόλου δεδομένων με υψηλή ακρίβεια, και επομένως διατηρεί τη χρησιμότητα των δεδομένων για τις περιπτώσεις που διαφημίζεται, ταυτόχρονα επιτρέπει στους αντιπάλους να εξάγουν ευαίσθητες πληροφορίες για άτομα.

‘Ένα υψηλό κέρδος στην ιδιωτικότητα μέσω οποιασδήποτε από τις μεθόδους ανωνυμοποίησης που αξιολογήσαμε μπορεί να επιτευχθεί μόνο αν η δημοσιευμένη συνθετική ή καθαρισμένη έκδοση των αρχικών δεδομένων δεν μεταφέρει το σήμα των ατομικών εγγραφών στα αρχικά δεδομένα και κατά συνέπεια καταστέλλει τις εγγραφές τους.’

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai