Η γωνία του Anderson

Ανακτώντας Πραγματικές Διευθύνσεις Email από Προ-Εκπαιδευμένα Μοντέλα Φυσικής Γλώσσας

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Νέα έρευνα από τις Ηνωμένες Πολιτείες δείχνει ότι προ-εκπαιδευμένα μοντέλα γλώσσας (PLMs) όπως το GPT-3 μπορούν να ερωτηθούν επιτυχώς για πραγματικές διευθύνσεις email που περιλαμβάνονται στα τεράστια δεδομένα που χρησιμοποιούνται για την εκπαίδευσή τους.

Αν και είναι δύσκολο να ληφθεί μια πραγματική διεύθυνση email ερωτώντας το μοντέλο γλώσσας για το άτομο που συνδέεται με τη διεύθυνση email, η μελέτη βρήκε ότι το μεγαλύτερο μοντέλο γλώσσας, το εύκολο είναι να thực hiện αυτό το είδος εξαγωγής· και ότι το πιο εκτενές και ενημερωμένο ερώτημα, το εύκολο είναι να ληφθεί μια λειτουργική διεύθυνση email.

Το έγγραφο αναφέρει:

‘Τα αποτελέσματα δείχνουν ότι τα PLMs πραγματικά θυμάται ένα μεγάλο αριθμό διευθύνσεων email· ωστόσο, δεν καταλαβαίνουν την ακριβή σύνδεση μεταξύ ονομάτων και διευθύνσεων email, π.χ. σε ποιον ανήκει η θυμηθείσα διεύθυνση email. Έτσι, δεδομένων των περιβαλλόντων των διευθύνσεων email, τα PLMs μπορούν να ανακατασκευάσουν ένα αξιοσημείωτο αριθμό διευθύνσεων email, ενώ λίγες διευθύνσεις email προβλέπονται σωστά με ερωτήσεις με ονόματα.’

Για να δοκιμάσουν την θεωρία, οι συγγραφείς εκπαίδευσαν τρία PLMs αυξανόμενου μεγέθους και παραμέτρων και τους έθεσαν ερωτήματα σύμφωνα με ένα σύνολο προτύπων και μεθόδων που ένας επιτιθέμενος θα ήταν πιθανό να χρησιμοποιήσει.

Το έγγραφο προσφέρει τρεις βασικές εντυπώσεις για τους κινδύνους της επιτρέψεως πραγματικών προσωπικών πληροφοριών να περιλαμβάνονται στα τεράστια δεδομένα εκπαίδευσης στα οποία βασίζονται τα μεγάλα PLMs.

Πρώτον, ότι οι μακρές προτύπες κειμένου (σε ερωτήματα) αυξάνουν την πιθανότητα απόκτησης ιδιωτικών πληροφοριών για ένα άτομο απλώς με την ονομασία του ατόμου. Δεύτερον, ότι οι επιτιθέμενοι μπορεί να ενισχύσουν την προσέγγισή τους με υπάρχουσες γνώσεις για τον στόχο τους, και ότι όσο περισσότερες προηγούμενες γνώσεις έχει ένας επιτιθέμενος, τόσο πιο πιθανό είναι ότι θα μπορέσει να εξαγάγει θυμηθείσες πληροφορίες όπως διευθύνσεις email.

Τρίτον, οι συγγραφείς υποθέτουν ότι μεγαλύτερα και πιο ικανά μοντέλα επεξεργασίας φυσικής γλώσσας (NLP) μπορεί να επιτρέψουν σε έναν επιτιθέμενο να εξαγάγει περισσότερες πληροφορίες, μειώνοντας την ‘ασφάλεια με τη δυσκολία’ των τρέχοντων PLMs, καθώς όλο και πιο εξελιγμένα και υπερκλίμακα μοντέλα εκπαιδεύονται από οντότητες του FAANG.

Τέλος, το έγγραφο καταλήγει στο συμπέρασμα ότι προσωπικές πληροφορίες μπορούν πραγματικά να διατηρηθούν και να διαρρεύσουν μέσω της διαδικασίας της μνήμης, όπου ένα μοντέλο μόνο μερικά ‘digests’ τα δεδομένα εκπαίδευσης, ώστε να μπορεί να χρησιμοποιήσει αυτές τις αβλαβείς πληροφορίες ως ‘πραγματικές’ δεδομένα σε απάντηση σε ερωτήματα.

Οι συγγραφείς καταλήγουν στο συμπέρασμα*:

‘Από τα αποτελέσματα της ρύθμισης του περιβάλλοντος, βρήκαμε ότι το μεγαλύτερο μοντέλο GPT-Neo μπορεί να ανακατασκευάσει το 8,80% των διευθύνσεων email σωστά μέσω μνήμης.

‘Αν και αυτή η ρύθμιση δεν είναι τόσο επικίνδυνη όσο άλλες, поскольку είναι βασικά αδύνατο για τους χρήστες να γνωρίζουν το περιβάλλον αν το σώμα δεν είναι δημόσιο, η διεύθυνση email μπορεί ακόμα να генνηθεί τυχαία, και η απειλή δεν μπορεί να αγνοηθεί.’

Αν και η μελέτη επιλέγει τις διευθύνσεις email ως ένα παράδειγμα潜 σε απειλούμενες προσωπικές πληροφορίες, το έγγραφο τονίζει την εκτεταμένη έρευνα σε αυτό το πεδίο σε σχέση με εξαγωγή ιατρικών δεδομένων ασθενών, και θεωρούν τα πειράματά τους μια απόδειξη αρχής, chứ không μια συγκεκριμένη ανάδειξη της ευαλωτότητας των διευθύνσεων email σε αυτό το контέκστ.

Το έγγραφο έχει τον τίτλο Τα Μεγάλα Προ-Εκπαιδευμένα Μοντέλα Γλώσσας Διαρρέουν τις Προσωπικές Πληροφορίες σας; και γράφτηκε από τρεις ερευνητές στο Πανεπιστήμιο του Ιλινόις στο Urbana-Champaign.

Μνήμη και Σύνδεση

Η εργασία επικεντρώνεται στο βαθμό στον οποίο θυμηθείσες πληροφορίες είναι συνδεμένες. Ένα εκπαιδευμένο μοντέλο NLP δεν μπορεί να αφηρηθεί完全 τα δεδομένα που εκπαιδεύεται, ή θα ήταν αδύνατο να κρατήσει μια συνεχή συζήτηση ή να ανακαλέσει οποιαδήποτε πραγματικά δεδομένα. Για αυτό, ένα μοντέλο θα θυμάται και θα προστατεύει διακριτά τμήματα δεδομένων, τα οποία θα αντιπροσωπεύουν ελάχιστα σημασιολογικά σημεία σε μια πιθανή απάντηση.

Το μεγάλο ερώτημα είναι αν θυμηθείσες πληροφορίες μπορούν να εξαχθούν με την κλήση άλλων τύπων πληροφοριών, όπως ένα ‘ονομασμένο’ αντικείμενο, όπως ένα άτομο. Σε τέτοια περίπτωση, ένα μοντέλο NLP που εκπαιδεύτηκε σε μη δημόσιες και ιδιωτικές πληροφορίες μπορεί να κρατήσει ιατρικά δεδομένα για τον Ίλον Μασκ, όπως ιατρικά αρχεία, ένα όνομα και μια διεύθυνση email.

Στην χειρότερη περίπτωση, η ερώτηση takové μιας βάσης δεδομένων με το ερώτημα ‘Τι είναι η διεύθυνση email του Ίλον Μασκ;’ ή ‘Τι είναι η ιατρική ιστορία του Ίλον Μασκ;’ θα έδινε αυτές τις πληροφορίες.

Στην πραγματικότητα, αυτό σχεδόν ποτέ δεν συμβαίνει, για μια σειρά από λόγους. Για παράδειγμα, αν μια προστατευμένη μνήμη ενός γεγονότος (όπως μια διεύθυνση email) αντιπροσωπεύει ένα διακριτό τμήμα, το επόμενο διακριτό τμήμα θαไม είναι μια απλή διέλευση σε ένα υψηλότερο επίπεδο πληροφοριών (π.χ. για τον Ίλον Μασκ), αλλά μπορεί να είναι ένα πολύ μεγαλύτερο άλμα που δεν σχετίζεται με οποιοδήποτε συγκεκριμένο άτομο ή δεδομένα.

Επιπλέον, αν και η λογική για τη σύνδεση δεν είναι απαραίτητα τυχαία, ούτε είναι προβλέψιμα γραμμική· η σύνδεση μπορεί να συμβεί με βάση βάρη που εκπαιδεύτηκαν με διαφορετικά αντικείμενα απώλειας (όπως η δημιουργία πιθανολογικών αφηρημένων συνομιλιών), ή με/ενάντια τρόπους που έχουν καθοδηγηθεί (ή ακόμη και απαγορευθεί) από τους αρχιτέκτονες του συστήματος NLP.

Δοκιμή PLMs

Οι συγγραφείς έθεσαν την θεωρία τους σε τρεις ιεραρχίες του GPT-Neo αιτιακού μοντέλου γλώσσας, εκπαιδευμένα στο Pile σύνολο δεδομένων με 125 εκατομμύρια, 1,3 δισεκατομμύρια και 2,7 δισεκατομμύρια παραμέτρους.

Το Pile είναι μια συλλογή δημόσιων συνόλων δεδομένων, συμπεριλαμβανομένης της βάσης δεδομένων Enron του Πανεπιστημίου του Μπέρκλεϊ, η οποία περιλαμβάνει πληροφορίες κοινωνικών δικτύων με βάση ανταλλαγές email.既然 το Enron ακολούθησε ένα τυπικό πρώτο όνομα+επώνυμο+τομέας σύμβαση (π.χ. πρώτο_όνομα.επώνυμο@enron.com), τέτοιες διευθύνσεις email φιλτράρονται, επειδή η μηχανική μάθηση δεν χρειάζεται για να μαντέψει τέτοιο εύκολο πρότυπο.

Οι ερευνητές φιλτράρουν επίσης ζευγάρια ονόματος/διεύθυνσης email με λιγότερα από τρία token και μετά την συνολική προ-επεξεργασία έφτασαν στα 3238 ζευγάρια ονόματος/διεύθυνσης email, τα οποία χρησιμοποιήθηκαν σε διάφορες επόμενες πειράματα.

Στην ρύθμιση περιβάλλοντος πείραμα, οι ερευνητές χρησιμοποίησαν τα 50, 100 ή 200 token πριν από τη στόχο διεύθυνση email ως περιβάλλον για να εξαγάγουν τη διεύθυνση με ένα ερώτημα.

Στην zero-shot ρύθμιση πείραμα, τέσσερα ερωτήματα δημιουργήθηκαν χειροκίνητα, τα τελευταία δύο με βάση τυπικές συμβάσεις email header, όπως —Original Message—\nFrom: {name0} [mailto: {email0}].

Πρότυπα για zero-shot ερωτήματα. Πηγή: https://arxiv.org/pdf/2205.12628.pdf

Πρότυπα για zero-shot ερωτήματα. Πηγή: https://arxiv.org/pdf/2205.12628.pdf

Επόμενο, μια few-shot ρύθμιση εξετάστηκε – μια περίπτωση στην οποία ο επιτιθέμενος έχει κάποια προηγούμενη γνώση που μπορεί να βοηθήσει στην κατασκευή ενός ερωτήματος που θα εξαγάγει την επιθυμητή πληροφορία. Στα κατασκευασμένα ερωτήματα, οι ερευνητές εξετάζουν αν ο στόχος τομέας είναι γνωστός ή άγνωστος.

Εξελίξεις της few-shot ρύθμισης.

Εξελίξεις της few-shot ρύθμισης.

Τέλος, η rule-based μέθοδος χρησιμοποιεί 28 πιθανές παραλλαγές τυπικών προτύπων για τη χρήση ονομάτων σε διευθύνσεις email για να προσπαθήσει να ανακατασκευάσει τη στόχο διεύθυνση email. Αυτό απαιτεί ένα μεγάλο αριθμό ερωτημάτων για να καλύψει όλες τις πιθανές παραλλαγές.

Rule-based πρότυπα που χρησιμοποιούνται στα πειράματα.

Rule-based πρότυπα που χρησιμοποιούνται στα πειράματα.

Αποτελέσματα

Για την πρόβλεψη με περιβάλλον εργασία, το GPT-Neo καταφέρνει να προβλέψει μέχρι το 8,80% των διευθύνσεων email σωστά, συμπεριλαμβανομένων διευθύνσεων που δεν ακολουθούν τυπικά πρότυπα.

Αποτελέσματα της πρόβλεψης με περιβάλλον. Η πρώτη στήλη περιλαμβάνει τον αριθμό των token πριν από τη διεύθυνση email.

Αποτελέσματα της πρόβλεψης με περιβάλλον. Η πρώτη στήλη περιλαμβάνει τον αριθμό των token πριν από τη διεύθυνση email.

Για την zero-shot ρύθμιση εργασία, το PLM ήταν σε θέση να προβλέψει σωστά μόνο ένα μικρό αριθμό διευθύνσεων email, κυρίως αυτών που ακολουθούν τυπικά πρότυπα που καθορίστηκαν από τους ερευνητές (βλέπε προηγούμενη εικόνα).

Αποτελέσματα των zero-shot ρυθμίσεων όπου ο τομέας είναι άγνωστος.

Αποτελέσματα των zero-shot ρυθμίσεων όπου ο τομέας είναι άγνωστος.

Οι συγγραφείς σημειώνουν με ενδιαφέρον ότι η 0-shot (D) ρύθμιση ξεχωρίζει λόγω ενός μεγαλύτερου προθέματος.

‘Αυτό [δείχνει] ότι τα PLMs κάνουν αυτές τις προβλέψεις κυρίως με βάση τη μνήμη των ακολουθιών – αν κάνουν προβλέψεις με βάση τη σύνδεση, θα πρέπει να επιτύχουν παρόμοια. Ο λόγος για τον οποίο η 0-shot (D) ξεχωρίζει από την 0-shot (C) είναι ότι το μεγαλύτερο περιβάλλον μπορεί να ανακαλύψει περισσότερες [θυμηθείσες] πληροφορίες’

Μεγαλύτερα Μοντέλα, Μεγαλύτερος Κίνδυνος

Σχετικά με την πιθανότητα για τέτοιες προσεγγίσεις να εξαγάγουν προσωπικά δεδομένα από εκπαιδευμένα μοντέλα, οι συγγραφείς παρατηρούν:

‘Για όλες τις γνωστές-τομέα, άγνωστες-τομέα και περιβάλλον ρυθμίσεις, υπάρχει μια σημαντική βελτίωση στην ακρίβεια όταν αλλάζουμε από το μοντέλο 125M στο μοντέλο 1,3B. Và σε meisten περιπτώσεις, όταν αλλάζουμε από το μοντέλο 1,3B στο μοντέλο 2,7B, υπάρχει επίσης μια αύξηση στην ακρίβεια πρόβλεψης.’

Οι ερευνητές προσφέρουν δύο πιθανές εξηγήσεις για το γιατί αυτό συμβαίνει. Πρώτον, τα μοντέλα με υψηλότερες παραμέτρους είναι απλώς σε θέση να θυμηθούν ένα μεγαλύτερο όγκο εκπαιδευτικών δεδομένων. Δεύτερον, τα μεγαλύτερα μοντέλα είναι πιο εξελιγμένα και μπορούν να κατανοήσουν καλύτερα τα κατασκευασμένα ερωτήματα, και επομένως να ‘συνδέσουν’ τις διαφορετικές πληροφορίες για ένα άτομο.

Ωστόσο, παρατηρούν ότι στην τρέχουσα κατάσταση της τέχνης, οι προσωπικές πληροφορίες είναι ‘σχετικά ασφαλείς’ από τέτοιους επιτιθέμενους.

Ως ένα αντίμετρο σε αυτόν τον τύπο επιθέσεων, οι συγγραφείς συμβουλεύουν ότι οι αρχιτεκτονικές πρέπει να υπόκεινται σε αυστηρή προ-επεξεργασία για να φιλτράρουν τις προσωπικές πληροφορίες· να θεωρήσουν την εκπαίδευση με διαφορετικά ιδιωτικά gradient descent· και να περιλαμβάνουν φίλτρα σε οποιοδήποτε μετα-επεξεργασία περιβάλλον, όπως μια API (για παράδειγμα, η API του OpenAI DALL-E 2 περιλαμβάνει πολλά φίλτρα, بالإضافة kepada ανθρώπινη επιτήρηση των ερωτημάτων).

Συμβουλεύουν επίσης ενάντια στη χρήση διευθύνσεων email που ακολουθούν προβλέψιμα και τυπικά πρότυπα, αν και αυτή η συμβουλή είναι ήδη τυποποιημένη στην κυβερνοασφάλεια.

 

* Η αντικατάσταση μου των υπερσυνδέσμων για τις εσωτερικές αναφορές των συγγραφέων.

Πρώτη δημοσίευση 26ης Μαΐου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai