Η γωνία του Anderson
Κλοπή Μοντέλων Μηχανικής Μάθησης Μέσω της Εξόδου API

Νέα έρευνα από τον Καναδά προσφέρει einen πιθανό τρόπο με τον οποίο οι επιθέσεις θα μπορούσαν να κλέψουν τα αποτελέσματα ακριβών πλαισίων μηχανικής μάθησης, ακόμη και όταν η μόνη πρόσβαση σε ένα ιδιόκτητο σύστημα είναι μέσω ενός υψηλά εξαγνισμένου και φαινομενικά καλά αμυνόμενου API (μια διεπαφή ή πρωτόκολλο που επεξεργάζεται αιτήσεις χρήστη στο διακομιστή και επιστρέφει μόνο την απόκριση εξόδου).
Καθώς ο τομέας της έρευνας κοιτάζει όλο και περισσότερο προς την κερδοφόρα εκμετάλλευση ακριβών μοντέλων εκπαίδευσης μέσω της Υπηρεσίας Μηχανικής Μάθησης (MLaaS), η νέα εργασία υποδηλώνει ότι τα μοντέλα Αυτο-Επιβλεπόμενης Μάθησης (SSL) είναι πιο ευάλωτα σε αυτόν τον τύπο εξαγωγής μοντέλου, επειδή εκπαιδεύονται χωρίς ετικέτες χρήστη, απλοποιώντας την εξαγωγή και συνήθως παρέχουν αποτελέσματα που περιέχουν πολλές χρήσιμες πληροφορίες για κάποιον που επιθυμεί να αναπαράγει το (κρυφό) μοντέλο πηγή.
Στις “μαύρες κουτί” симуляции (όπου οι ερευνητές έδωσαν στον εαυτό τους keine πρόσβαση σε ένα τοπικό “θύμα” μοντέλο παρά μόνο όση πρόσβαση θα είχε ένας τυπικός τελικός χρήστης μέσω ενός web API), οι ερευνητές μπόρεσαν να αναπαράγουν τα συστήματα στόχου με σχετικά χαμηλές πόρους:
‘[Οι] επιθέσεις μας μπορούν να κλέψουν ένα αντίγραφο του θύματος μοντέλου που επιτυγχάνει σημαντική απόδοση σε λιγότερες από 1/5 των ερωτημάτων που χρησιμοποιήθηκαν για την εκπαίδευση του θύματος. Κατά του θύματος μοντέλου που εκπαιδεύτηκε σε 1,2 εκατομμύρια μη ετικετεμένα δείγματα από ImageNet, με ακρίβεια 91,9% στην κατηγοριοποίηση Fashion-MNIST, η άμεση επιθετική μας επίθεση με την απώλεια InfoNCE έκλεψε ένα αντίγραφο του κωδικοποιητή που επιτυγχάνει ακρίβεια 90,5% σε 200.000 ερωτήματα.
‘Ομοίως, κατά του θύματος που εκπαιδεύτηκε σε 50.000 μη ετικετεμένα δείγματα από CIFAR10, με ακρίβεια 79,0% στην κατηγοριοποίηση CIFAR10, η άμεση επιθετική μας επίθεση με την απώλεια SoftNN έκλεψε ένα αντίγραφο που επιτυγχάνει ακρίβεια 76,9% σε 9.000 ερωτήματα.’

Οι ερευνητές χρησιμοποίησαν τρεις μεθόδους επιθέσεων, βρίσκοντας ότι η ‘Άμεση Εξαγωγή’ ήταν η πιο αποτελεσματική. Αυτά τα μοντέλα κλάπηκαν από ένα τοπικά αναπαραχθέν CIFAR10 θύμα κωδικοποιητή χρησιμοποιώντας 9.000 ερωτήματα από το σύνολο δοκιμής CIFAR10. Πηγή: https://arxiv.org/pdf/2205.07890.pdf
Οι ερευνητές σημειώνουν επίσης ότι οι μέθοδοι που είναι κατάλληλες για την προστασία των εποπτευόμενων μοντέλων από επιθέσεις δεν προσαρμόζονται καλά στα μοντέλα που εκπαιδεύονται σε μη εποπτευόμενη βάση – mặc dù τέτοια μοντέλα αντιπροσωπεύουν κάποια από τα πιο αναμενόμενα και εορτασμένα αποτελέσματα του τομέα της σύνθεσης εικόνας.
Η νέα ερεύνα έχει τον τίτλο Σχετικά με τη Δυσκολία της Άμυνας της Αυτο-Επιβλεπόμενης Μάθησης κατά της Εξαγωγής Μοντέλων, και προέρχεται από το Πανεπιστήμιο του Τορόντο και το Ινστιτούτο Διανύσματος για την Τεχνητή Νοημοσύνηη.
Αυτο-Επιβλεπόμενη Μάθηση
Στην Αυτο-Επιβλεπόμενη Μάθηση, ένα μοντέλο εκπαιδεύεται σε μη ετικετεμένα δεδομένα. Χωρίς ετικέτες, ένα μοντέλο Αυτο-Επιβλεπόμενης Μάθησης πρέπει να μάθει συσχετίσεις και ομάδες από την ضمنτική δομή των δεδομένων, αναζητώντας παρόμοια χαρακτηριστικά των δεδομένων και σταδιακά ομαδοποιώντας αυτά τα χαρακτηριστικά σε κόμβους ή αναπαραστάσεις.
Όπου μια προσέγγιση Αυτο-Επιβλεπόμενης Μάθησης είναι εφικτή, είναι απίστευτα παραγωγική, поскольку παρακάμπτει την ανάγκη για ακριβή (συχνά εξωτερική και αμφισβητούμενη) κατηγοριοποίηση από crowworkers, και ουσιαστικά ορθολογεί τα δεδομένα αυτονομamente.
Οι τρεις προσεγγίσεις Αυτο-Επιβλεπόμενης Μάθησης που εξετάστηκαν από τους συγγραφείς της νέας εργασίας είναι SimCLR, μια Σιαμεζική Δίκτυο; SimSiam, μια άλλη Σιαμεζική Δίκτυο που επικεντρώνεται στην εκμάθηση αναπαραστάσεων; και Barlow Twins, μια προσέγγιση Αυτο-Επιβλεπόμενης Μάθησης που επιτύγχασε την καλύτερη απόδοση ταξινόμησης ImageNet στην κυκλοφορία της το 2021.
Η εξαγωγή μοντέλων για ετικετεμένα δεδομένα (δηλ. ένα μοντέλο που εκπαιδεύτηκε μέσω εποπτευόμενης μάθησης) είναι ένας σχετικά καλά τεκμηριωμένος ερευνητικός τομέας. Είναι επίσης πιο εύκολο να αμυνθεί, поскольку ο επιτιθέμενος πρέπει να αποκτήσει τις ετικέτες από το θύμα μοντέλο για να αναπαράγει αυτό.

Από μια προηγούμενη εργασία, ένα ‘κλονοποιημένο’ μοντέλο επιθέσεων κατά μιας αρχιτεκτονικής εποπτευόμενης μάθησης. Πηγή: https://arxiv.org/pdf/1812.02766.pdf
Χωρίς λευκή-κουτί πρόσβαση, αυτό δεν είναι μια εύκολη εργασία, поскольку η τυπική έξοδος από μια αίτηση API σε τέτοιο μοντέλο περιέχει λιγότερες πληροφορίες από μια τυπική SSL API.
Από το χαρτί*:
‘Παλιά εργασία στην εξαγωγή μοντέλων εστίασε στο περιβάλλον Εποπτευόμενης Μάθησης (SL), όπου το θύμα μοντέλο συνήθως επιστρέφει μια ετικέτα ή άλλες χαμηλο-διαστατικές εξόδους όπως βαθμοί εμπιστοσύνης ή logits.
‘Σε αντίθεση, οι κωδικοποιητές SSL επιστρέφουν υψηλο-διαστατικές αναπαραστάσεις; η de facto έξοδος για ένα μοντέλο ResNet-50 Sim-CLR, μια δημοφιλής αρχιτεκτονική στην όραση, είναι ένα 2048-διαστατικό διάνυσμα.
‘Υποθέτουμε ότι αυτή η σημαντικά υψηλότερη διαρροή πληροφοριών από τους κωδικοποιητές τους καθιστά πιο ευάλωτους σε επιθέσεις εξαγωγής από τα μοντέλα SL.’
Αρχιτεκτονική και Δεδομένα
Οι ερευνητές ε-tested τρεις προσεγγίσεις για την εξαγωγή/αναπαραγωγή μοντέλων SSL: Άμεση Εξαγωγή, όπου η έξοδος API συγκρίνεται με την έξοδο ενός αναπαραχθέντος κωδικοποιητή μέσω μιας κατάλληλης συνάρτησης απώλειας όπως η Μέση Τετραγωνική Σφάλμα (MSE); αναπαράγοντας το κεφάλι προβολής, όπου μια κρίσιμη αναλυτική λειτουργικότητα του μοντέλου, συνήθως απορρίπτεται πριν από την ανάπτυξη, ανασυναρμολογείται και χρησιμοποιείται σε ένα αναπαραχθέν μοντέλο; και πρόσβαση στο κεφάλι προβολής, το οποίο είναι δυνατό μόνο σε περιπτώσεις όπου οι αρχικοί dévelopers έχουν κάνει τη διαθέσιμη αρχιτεκτονική.

Στη μέθοδο #1, Άμεση Εξαγωγή, η έξοδος του θύματος μοντέλου συγκρίνεται με την έξοδο ενός τοπικού μοντέλου; η μέθοδος #2 περιλαμβάνει την αναπαράγηση του κεφαλιού προβολής που χρησιμοποιήθηκε στην αρχική αρχιτεκτονική εκπαίδευσης (και συνήθως δεν περιλαμβάνεται σε ένα αναπαραχθέν μοντέλο).
Οι ερευνητές βρήκαν ότι η Άμεση Εξαγωγή ήταν η πιο αποτελεσματική μέθοδος για την απόκτηση ενός λειτουργικού αντίγραφου του στόχου μοντέλου, και έχει το πρόσθετο πλεονέκτημα ότι είναι η πιο δύσκολη να χαρακτηριστεί ως ‘επίθεση’ (επειδή συμπεριφέρεται λίγο διαφορετικά από ένα τυπικό και έγκυρο τελικό χρήστη).
Οι συγγραφείς εκπαίδευσαν θύμα μοντέλα σε τρία σύνολα εικόνων: CIFAR10, ImageNet, και Stanford’s Street View House Numbers (SVHN). Το ImageNet εκπαιδεύτηκε σε ResNet50, ενώ τα CIFAR10 και SVHN εκπαιδεύτηκαν σε ResNet18 και ResNet24 πάνω από μια ελεύθερη υλοποίηση του SimCLR σε PyTorch.
Η απόδοση των μοντέλων σε καθήκοντα ροής (δηλ. αναπτύξεις) ελέγχθηκε κατά του CIFAR100, STL10, SVHN, και Fashion-MNIST. Οι ερευνητές πειραματίστηκαν επίσης με πιο ‘λευκό-κουτί’ μεθόδους απόκτησης μοντέλων, αν και αποδείχθηκε ότι η Άμεση Εξαγωγή, η λιγότερο προνομιούχα προσέγγιση, έδωσε τα καλύτερα αποτελέσματα.
Για την αξιολόγηση των αναπαραστάσεων που εξάγονται και αναπαράγονται στις επιθέσεις, οι συγγραφείς πρόσθεσαν ένα γραμμικό слой προβλέψεων στο μοντέλο, το οποίο ήταν εξευγενισμένο στο πλήρες ετικετεμένο σύνολο εκπαίδευσης από το επόμενο (κατάντη) καθήκον, με τα υπόλοιπα στρώματα του δικτύου παγωμένα. Με αυτόν τον τρόπο, η ακρίβεια της πρόβλεψης στο слой προβλέψεων μπορεί να λειτουργήσει ως μετρική για την απόδοση. Καθώς δεν συνεισφέρει τίποτα στη διαδικασία έξοδου, αυτό δεν αντιπροσωπεύει ‘λευκό-κουτί’ λειτουργικότητα.

Αποτελέσματα στις δοκιμαστικές εκτελέσεις, που έγιναν δυνατές από το (μη-συνεισφέρον) Στρώμα Γραμμικής Αξιολόγησης. Βαθμοί ακρίβειας με έντονα γράμματα.
Συνοψίζοντας τα αποτελέσματα, οι ερευνητές δηλώνουν:
‘Βρίσκουμε ότι ο άμεσος στόχος της μίμησης των αναπαραστάσεων του θύματος δίνει υψηλή απόδοση σε καθήκοντα ροής παρά την ανάγκη μόνο για một κλάσμα (λιγότερο από 15% σε ορισμένες περιπτώσεις) του αριθμού των ερωτημάτων που χρειάζονται για την εκπαίδευση του κλεμμένου κωδικοποιητή στην αρχή.’
Και συνεχίζουν:
‘[Είναι] δύσκολο να αμυνθεί ενάντια σε κωδικοποιητές που εκπαιδεύονται με SSL, поскольку οι αναπαραστάσεις εξόδου διαρρέουν σημαντική ποσότητα πληροφοριών. Οι πιο υποσχόμενες άμυνες είναι οι αντιδραστικές μεθόδους, όπως η σήμανση νερού, που μπορούν να ενσωματώσουν συγκεκριμένες αυξήσεις σε κωδικοποιητές υψηλής ικανότητας.’
* Η μετατροπή μου των εσωτερικών αναφορών του εγγράφου σε υπερσύνδεσμους.
Πρώτη δημοσίευση 18ης Μαΐου 2022.












