Ηγέτες σκέψης

Τρεις Τεχνικές Μαθηματικής Μάθησης που Διατηρούν την Ιδιωτικότητα για την Επίλυση του Πιο Σημαντικού Ζητήματος της Δεκαετίας

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Từ Amogh Tarcar, Ερευνητής Μηχανικής Μάθησης και Τεχνητής Νοημοσύνης, Persistent Systems.

Η ιδιωτικότητα των δεδομένων, σύμφωνα με τους ειδικούς σε ένα ευρύ φάσμα τομέων, θα είναι το πιο σημαντικό ζήτημα της δεκαετίας. Αυτό είναι ιδιαίτερα αληθινό για τη μηχανική μάθηση (ML), όπου οι αλγόριθμοι τρέφονται με τεράστιες ποσότητες δεδομένων.

Παραδοσιακά, οι τεχνικές μοντελοποίησης της μηχανικής μάθησης έχουν βασιστεί στην κεντρικοποίηση των δεδομένων από πολλές πηγές σε ένα単ικό κέντρο δεδομένων. Όμως, υπάρχουν πολλά προβλήματα ιδιωτικότητας που συνοδεύουν αυτήν την τεχνική. Η κεντρικοποίηση των δεδομένων αυξάνει το εύρος και το μέγεθος των απειλών για την ιδιωτικότητα και την ασφάλεια των δεδομένων.

Για να υπερβούν αυτές τις προκλήσεις, έχουν αναπτυχθεί plusieurs στυλ της μηχανικής μάθησης που διατηρούν την ιδιωτικότητα (PPML) με συγκεκριμένες τεχνικές που μειώνουν τον κίνδυνο της ιδιωτικότητας και διασφαλίζουν ότι τα δεδομένα παραμένουν λογικά ασφαλή. Εδώ είναι μερικές από τις πιο σημαντικές:

1. Federated Learning

Το Federated Learning είναι μια τεχνική εκπαίδευσης της μηχανικής μάθησης που ανατρέπει το πρόβλημα της κεντρικοποίησης των δεδομένων. Αντί να κεντρικοποιούνται τα δεδομένα για να δημιουργηθεί ένα μοντέλο μηχανικής μάθησης, το Federated Learning κεντρικοποιεί τα ίδια τα μοντέλα μηχανικής μάθησης. Αυτό διασφαλίζει ότι τα δεδομένα δεν αφήνουν ποτέ την τοποθεσία τους και επιτρέπει σε πολλές πλευρές να συνεργαστούν και να δημιουργήσουν ένα κοινό μοντέλο μηχανικής μάθησης χωρίς να μοιράζονται ευαίσθητα δεδομένα.

Λειτουργεί ως εξής. Ξεκινάτε με ένα βασικό μοντέλο μηχανικής μάθησης που μοιράζεται με κάθε κόμβο-πελάτη. Οι κόμβοι-πελάτες τρέχουν τοπική εκπαίδευση σε αυτό το μοντέλο χρησιμοποιώντας τα δικά τους δεδομένα. Οι ενημερώσεις του μοντέλου μοιράζονται περιοδικά με τον κόμβο-συντονιστή, ο οποίος επεξεργάζεται αυτές τις ενημερώσεις και τις συνδυάζει για να λάβει ένα νέο παγκόσμιο μοντέλο. Με αυτόν τον τρόπο, λαμβάνετε τις πληροφορίες από διαφορετικά σύνολα δεδομένων χωρίς να μοιράζεστε αυτά τα σύνολα δεδομένων.

Source: Persistent Systems

Στο контέκστ του υγείας, αυτό είναι ένα εξαιρετικά ισχυρό και ιδιωτικό εργαλείο για να διατηρήσει τα δεδομένα των ασθενών ασφαλή ενώ δίνει στους ερευνητές τη σοφία του πλήθους. Δεν κεντρικοποιώντας τα δεδομένα, το Federated Learning δημιουργεί ένα επιπλέον επίπεδο ασφάλειας. Ωστόσο, τα μοντέλα και οι ενημερώσεις του μοντέλου παρουσιάζουν ακόμη einen κίνδυνο ασφαλείας αν αφεθούν ευάλωτα.

2. Differential Privacy

Τα μοντέλα μηχανικής μάθησης είναι συχνά στόχοι επιθέσεων μέλους. Φανταστείτε ότι μοιράζεστε τα δεδομένα υγείας σας με ένα νοσοκομείο για να βοηθήσετε στην ανάπτυξη ενός εμβολίου κατά του καρκίνου. Το νοσοκομείο διατηρεί τα δεδομένα σας ασφαλή, αλλά χρησιμοποιεί το Federated Learning για να εκπαιδεύσει ένα δημόσια διαθέσιμο μοντέλο μηχανικής μάθησης. Λίγους μήνες αργότερα, οι χάκερ χρησιμοποιούν μια επίθεση μέλους για να καθορίσουν εάν τα δεδομένα σας χρησιμοποιήθηκαν στην εκπαίδευση του μοντέλου ή όχι. Τότε, μεταφέρουν πληροφορίες σε μια εταιρεία ασφάλισης, η οποία, με βάση τον κίνδυνο καρκίνου, μπορεί να αυξήσει τις ασφαλιστικές σας προμήθειες.

Η διαφορική ιδιωτικότητα διασφαλίζει ότι οι επιθέσεις των αντιπάλων στα μοντέλα μηχανικής μάθησης δεν θα μπορέσουν να αναγνωρίσουν συγκεκριμένα δεδομένα που χρησιμοποιήθηκαν κατά την εκπαίδευση, μειώνοντας τον κίνδυνο έκθεσης ευαίσθητων δεδομένων εκπαίδευσης στη μηχανική μάθηση. Αυτό επιτυγχάνεται με την εφαρμογή “στατιστικού θορύβου” για να διαταράξει τα δεδομένα ή τους παραμέτρους του μοντέλου μηχανικής μάθησης κατά την εκπαίδευση, καθιστώντας δύσκολο να εκτελεστούν επιθέσεις και να καθορίσει εάν τα δεδομένα ενός ατόμου χρησιμοποιήθηκαν για την εκπαίδευση του μοντέλου.

Για παράδειγμα, η Facebook κυκλοφόρησε πρόσφατα Opacus, μια βιβλιοθήκη υψηλής ταχύτητας για την εκπαίδευση μοντέλων PyTorch με τη χρήση μιας διαφορικής ιδιωτικότητας-βασισμένης αλγόριθμου εκπαίδευσης μηχανικής μάθησης που ονομάζεται Differentially Private Stochastic Gradient Descent (DP-SGD). Το gif παρακάτω υπογραμμίζει πώς χρησιμοποιεί θόρυβο για να μασκαρεύσει τα δεδομένα.

 

Αυτός ο θόρυβος διέπεται από einen παράμετρο που ονομάζεται Epsilon. Αν η τιμή του Epsilon είναι χαμηλή, το μοντέλο έχει τέλεια ιδιωτικότητα δεδομένων αλλά κακή χρησιμότητα και ακρίβεια. Αντιστρόφως, αν έχετε μια υψηλή τιμή Epsilon, η ιδιωτικότητα των δεδομένων σας θα μειωθεί ενώ η ακρίβεια σας θα αυξηθεί. Το κόλπο είναι να βρείτε μια ισορροπία για να βελτιστοποιήσετε και τα δύο.

3. Homomorphic encryption

Η τυπική κρυπτογράφηση είναι παραδοσιακά ασύμβατη με τη μηχανική μάθηση γιατί όταν τα δεδομένα κρυπτογραφούνται, δεν μπορούν πλέον να κατανοηθούν από τον αλγόριθμο μηχανικής μάθησης. Ωστόσο, η ομομορφική κρυπτογράφηση είναι ένα ειδικό σχήμα κρυπτογράφησης που επιτρέπει να συνεχίσουμε να κάνουμε ορισμένα είδη υπολογισμών.

Source: OpenMined

Η δύναμη αυτού του είναι ότι η εκπαίδευση μπορεί να συμβεί σε ένα完全 κρυπτογραφημένο χώρο. Προστατεύει не μόνο τους ιδιοκτήτες των δεδομένων, αλλά και τους ιδιοκτήτες του μοντέλου. Ο ιδιοκτήτης του μοντέλου μπορεί να εκτελέσει εύρεση σε κρυπτογραφημένα δεδομένα χωρίς να τα δει ποτέ ή να τα κακο用σει.

Όταν εφαρμόζεται στο Federated Learning, η σύντηξη των ενημερώσεων του μοντέλου μπορεί να συμβεί ασφαλώς γιατί λαμβάνει χώρα σε ένα完全 κρυπτογραφημένο περιβάλλον, μειώνοντας δραστικά τον κίνδυνο επιθέσεων μέλους.

The Decade of Privacy

Καθώς εισερχόμαστε στο 2021, η μηχανική μάθηση που διατηρεί την ιδιωτικότητα είναι ένα αναδυόμενο πεδίο με εξαιρετικά ενεργό έρευνα. Αν η τελευταία δεκαετία ήταν για την απεγκλωβίωση των δεδομένων, αυτή η δεκαετία θα είναι για την απεγκλωβίωση των μοντέλων μηχανικής μάθησης ενώ διατηρεί την ιδιωτικότητα των υποκείμενων δεδομένων μέσω του Federated Learning, της διαφορικής ιδιωτικότητας και της ομομορφικής κρυπτογράφησης. Αυτά παρουσιάζουν einen υποσχόμενο νέο τρόπο για την προώθηση λύσεων μηχανικής μάθησης με έναν ιδιωτικό τρόπο.

Ο Amogh είναι ερευνητής Μηχανικής Μάθησης και μέρος του Εργαστηρίου Έρευνας ΙΑ στο Persistent Systems. Η τρέχουσα έρευνά του επικεντρώνεται στις εφαρμογές Federated Learning και στην κατασκευή εργαλείων NLP για εξαγωγή γνώσεων.