Η γωνία του Anderson

Αναγνώριση της κλοπής μοντέλων AI μέσω μυστικών δεδομένων παρακολούθησης

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
George Washington winking and smiling on the one dollar bill. Source: https://en.wikipedia.org/wiki/Marked_bill + Flux Edit and Adobe Firefly V3

Μια νέα μέθοδος μπορεί να watermark μοντέλα ChatGPT-like σε δευτερόλεπτα χωρίς επανεκπαίδευση, αφήνοντας κανένα ίχνος στη γενική έξοδο και επιβιώνοντας όλων των εφικτών προσπαθειών αφαίρεσης.

 

Η συγκεκριμένη διαφορά μεταξύ watermarking και ‘copyright-baiting’ είναι ότι τα watermarks – είτε οvert είτε κρυφά – συνήθως προορίζονται να εμφανίζονται σε όλη μια συλλογή (όπως ένα σύνολο εικόνων) ως μια πανταχού παρούσα εμπόδιο για την εύκολη αντιγραφή.

Αντίθετα, ένα ψευδές στοιχείο είναι ένα μικρό τμήμα κειμένου, συνήθως μια λέξη ή μια ορισμό που εμφανίζεται σε μια μεγάλη και σχετικά γενική συλλογή, σχεδιασμένο για να αποδείξει την κλοπή. Η ιδέα είναι ότι όταν ολόκληρο το έργο αντιγραφεί παράνομα, είτε από μόνο του είτε ως βάση για ένα παράγωγο έργο, η παρουσία ενός ‘μοναδικού’ και ψευδούς γεγονότος, το οποίο έχει τοποθετηθεί από τον αρχικό ιδιοκτήτη, θα αποκαλύψει εύκολα την πράξη της κλοπής.

Σε ότι αφορά την προσθήκη watermarks σε Large Language Models (LLMs) και Vision Language Models (VLMs), το βαθμό στο οποίο η έξοδος προορίζεται να περιέχει αυτά τα σημάδια είναι συχνά διαιρεμένος μεταξύ αυτών των δύο στόχων: να διασφαλιστεί ότι όλα ή τα περισσότερα από τα αποτελέσματα περιέχουν ένα φανερό ή 潛在ικό watermark; ή να διασφαλιστεί ότι ένα ‘μυστικό token’ μπορεί να ανακτηθεί, το οποίο αποδεικνύει την κλοπή – αλλά δεν εμφανίζεται στην κανονική έξοδο του μοντέλου.

Το Βάρος των Ενδείξεων

Η δεύτερη προσέγγιση αντιμετωπίζεται σε μια ενδιαφέρουσα νέα συνεργασία μεταξύ Κίνας, Ιταλίας και Σιγκαπούρης. Ένα έργο που στοχεύει να παρέχει μια τέτοια μέθοδο αποκάλυψης για ανοιχτά μοντέλα, ώστε να μην μπορούν εύκολα να εμπορευματοποιηθούν ή να χρησιμοποιηθούν με τρόπους που η αρχική άδεια δεν επιτρέπει.

Για παράδειγμα, η αρχική άδεια ενός μοντέλου μπορεί να επιβάλλει ότι οποιοσδήποτε μπορεί να κερδίσει από το έργο只要 κάνει τις δικές του αλλαγές ή τροποποιήσεις δημόσια διαθέσιμες με τους ίδιους γενναιόδωρους όρους άδειας – αλλά μια εταιρεία μπορεί να επιθυμεί να ελέγχει τις δικές της ‘βελτιώσεις’ (όπως βελτιστοποιημένες εκδόσεις), για να δημιουργήσει ένα μοάτ όπου δεν υπάρχει πραγματικά.

Η πλειονότητα της έρευνας σε αυτή τη γραμμή ασχολείται με ρουτίνες ανίχνευσης που σχετίζονται με κλειστά μοντέλα, API-μόνο μοντέλα ή μοντέλα για τα οποία διατίθενται μόνο βελτιστοποιημένα (quantized) βαρείς και που είναι इसलिए πιο δύσκολο να τροποποιηθούν και να αλλάξουν με τον τρόπο που προτείνει η νέα εργασία (επειδή δεν υπάρχει άμεση πρόσβαση στην αρχιτεκτονική του μοντέλου).

Η προσοχή σε FOSS εκδόσεις είναι, ίσως, αναμενόμενη από τον κινεζικό ερευνητικό τομέα, поскольку η κινεζική παραγωγή AI έχει χαρακτηριστεί τα τελευταία χρόνια από γενναιόδωρες πλήρεις εκδόσεις μοντέλων που ανταγωνίζονται τουλάχιστον τα πιο ‘κλειστά’ δυτικά αντίστοιχα.

Η νέα προσέγγιση, με τίτλο EditMark, διακρίνεται από το ότι δεν απαιτεί ούτε ότι το μοντέλο πρέπει να βελτιστοποιηθεί για να προστεθεί το ‘δηλητηριασμένο’ δεδομένο, ούτε ότι πρέπει να εκπαιδευτεί από την αρχή με τα δεδομένα που περιλαμβάνονται.

Αυτό έχει πολλά πλεονεκτήματα: ένα από αυτά είναι ότι οποιοδήποτε ‘παραδοσιακό’ δεδομένο που περιλαμβάνεται στο σύνολο δεδομένων, μια φορά που ανακαλύπτεται και αποκαλύπτεται, δεν θα είναι πλέον αποτελεσματικό, поскольку μπορεί να στοχευτεί trực tiếp από επιτιθέμενους. Αλλά για να επιτεθεί στο EditMark, ένας malefactor θα χρειαζόταν να γνωρίζει ποιο στρώμα του μοντέλου να στοχεύσει και ποια προσέγγιση έχει ληφθεί. Αυτό είναι ένα απίθανο σενάριο.

Δεύτερον, η προσέγγιση είναι γρήγορη και φθηνή, λαμβάνοντας χώρα σε δευτερόλεπτα (και όχι σε ημέρες ή ακόμη και εβδομάδες) για να εφαρμοστεί σε ένα εκπαιδευμένο μοντέλο, αποφεύγοντας τον σοβαρό κόστος της βελτιστοποίησης (η οποία αυξάνεται γραμμικά με το μέγεθος του μοντέλου και τα δεδομένα που θα εφαρμοστούν).

Τέλος, η προσέγγιση προκαλεί σημαντικά λιγότερη ζημιά στην κανονική λειτουργία του στοχευμένου μοντέλου από ότι η βελτιστοποίηση ή οι προηγούμενες μεθόδους επεξεργασίας.

Σε δοκιμές, το EditMark – το οποίο ενσωματώνει μαθηματικές ερωτήσεις με πολλαπλά δυνατά απαντήσεις στα βάρη του μοντέλου – πέτυχε ποσοστό εξαγωγής 100%.

Οι συγγραφείς αναφέρουν:

‘Περιεκτικές πειραματικές δοκιμές αποδεικνύουν την εξαιρετική απόδοση του EditMark στη διαδικασία watermarking LLMs. Το EditMark επιτυγχάνει αξιοσημείωτη αποτελεσματικότητα ενσωματώνοντας ένα 32-bit watermark σε λιγότερο από 20 δευτερόλεπτα με ποσοστό εξαγωγής 100% (ESR).

‘Ιδιαίτερα, ο χρόνος ενσωμάτωσης του watermark είναι λιγότερος από 1/300 της βελτιστοποίησης (μέσος 6,875 δευτερόλεπτα), το οποίο υπογραμμίζει την αποτελεσματικότητα του EditMark στην εφαρμογή υψηλής ικανότητας watermarks με беспрецедентική ταχύτητα και αξιοπιστία.

‘Επιπλέον, εκτεταμένες πειραματικές δοκιμές επικυρώνουν την αντοχή, την κρυφότητα και την πιστότητα του EditMark.’

Το νέο έγγραφο έχει τίτλο EditMark: Watermarking Large Language Models με βάση την επεξεργασία του μοντέλου και προέρχεται από οκτώ συγγραφείς από το Πανεπιστήμιο Επιστημών και Τεχνολογίας της Κίνας, το Πανεπιστήμιο της Σιένας και το CFAR/IHPC/A*STAR στη Σιγκαπούρη.

Μέθοδος

Η προσέγγιση EditMark αποτελείται από τέσσερις συνιστώσες: einen Generator, einen Encoder, einen Editor και einen Decoder:

Το pipeline του EditMark ενσωματώνει ένα watermark επεξεργαζόμενο το μοντέλο για να απαντήσει σε συγκεκριμένες μαθηματικές ερωτήσεις με τρόπο που κωδικοποιεί κρυφό αναγνωριστικό. Source: https://arxiv.org/pdf/2510.16367

Το pipeline του EditMark ενσωματώνει ένα watermark επεξεργαζόμενο το μοντέλο για να απαντήσει σε συγκεκριμένες μαθηματικές ερωτήσεις με τρόπο που κωδικοποιεί κρυφό αναγνωριστικό. Source: https://arxiv.org/pdf/2510.16367

Ο Generator χρησιμοποιεί ένα ψευδο-τυχαίο seed για να κατασκευάσει ερωτήσεις με πολλαπλά απαντήσεις. Ο Encoder επιλέγει απαντήσεις με βάση το watermark, οι οποίες ενσωματώνονται στο μοντέλο μέσω μιας ειδικής διαδικασίας επεξεργασίας. Μόλις το επεξεργασμένο μοντέλο κυκλοφορήσει ή χρησιμοποιηθεί παράνομα, το watermark μπορεί να εξαχθεί ζητώντας τις ίδιες ερωτήσεις και αποκωδικοποιώντας το μοτίβο των απαντήσεων.

Στη συνέχεια, ο Editor τροποποιεί τα βάρη του μοντέλου ώστε, όταν του ζητηθούν αυτές οι ερωτήσεις, το μοντέλο να παράγει τις στόχους απαντήσεις, ενσωματώνοντας το watermark απευθείας στη συμπεριφορά του. Ο Decoder ανακτά το watermark ζητώντας τις ίδιες ερωτήσεις στο υπόνοια μοντέλο και μεταφράζοντας τις απαντήσεις του πίσω στο κρυφό σημάδι.

Μοντέλο Απειλής

Το μοντέλο απειλής του εγγράφου υποθέτει ότι η διαδικασία watermarking γίνεται σε ένα white-box περιβάλλον. Παρόλο που αυτό δεν είναι συνήθως ένα καλό σημάδι σε έρευνες που σχετίζονται με την ασφάλεια, εδώ αυτό είναι φυσιολογικό, καθώς η μέθοδος στοχεύει να προστατεύσει ιδιοκτήτες που έχουν πλήρη πρόσβαση στο δικό τους έργο.

Ο επιτιθέμενος υποθέτεται επίσης ότι έχει πρόσβαση white-box μετά την απόκτηση του μοντέλου, που σημαίνει ότι μπορεί να το τροποποιήσει (π.χ. με pruning ή βελτιστοποίηση). Πάλι, αυτό το σενάριο είναι φυσιολογικό και αναμενόμενο σε περίπτωση FOSS κυκλοφορίας. Ωστόσο, ο επιτιθέμενος δεν έχει πρόσβαση στη διαδικασία εξαγωγής του watermark ή το σχήμα που χρησιμοποιείται και μπορεί να το ανακαλύψει μόνο μέσω εικασίας και πειραμάτων (ή διαρροών).

Ο Generator κατασκευάζει λογικά και фактически έγκυρες μαθηματικές ερωτήσεις με πολλαπλά σωστά απαντήσεις, χρησιμοποιώντας GPT‑4o για να διαφοροποιήσει τα πρότυπα (όπως φαίνεται παρακάτω), και ένα ψευδο-τυχαίο seed για να διασφαλίσει ότι κάθε ερώτηση είναι μοναδική. Αυτό επιτρέπει σε ένα γνωστό watermark να ενσωματωθεί καταναγκαστικά μέσω των ανακατατάξεων των απαντήσεων, ενώ ελαχιστοποιεί την επικάλυψη μεταξύ των ερωτήσεων, για να αποφευχθεί η entanglement της επεξεργασίας:

Πρότυπα ερωτήσεων που παράγονται από το GPT‑4o για την ενσωμάτωση watermark, κάθε uno structured για να παράγει πολλαπλά έγκυρα ακέραια απαντήσεις από μια ισότητα που προέρχεται από μια ισότητα.

Πρότυπα ερωτήσεων που παράγονται από το GPT‑4o για την ενσωμάτωση watermark, κάθε uno structured για να παράγει πολλαπλά έγκυρα ακέραια απαντήσεις από μια ισότητα που προέρχεται από μια ισότητα.

Ο Encoder μετατρέπει κάθε δυαδικό τμήμα του watermark σε μια μοναδική ανακατάταξη ακέραιων που προέρχονται από το σύνολο λύσεων μιας δεδομένης μαθηματικής ερώτησης. Χρησιμοποιώντας λεξικογραφική θεωρία ανακατατάξεων, ο Encoder χαρτογραφεί την δεκαδική τιμή κάθε τμήματος του watermark σε μια συγκεκριμένη σειρά επιλογής απαντήσεων, διασφαλίζοντας ότι το watermark ενσωματώνεται καταναγκαστικά στη συμπεριφορά του μοντέλου.

Σχετικά με τον Editor, η αρχική AlphaEdit μέθοδος επεξεργασίας που χρησιμοποιήθηκε για την ενσωμάτωση watermark λείπει και από ακρίβεια και αντοχή, με το τροποποιημένο μοντέλο να αποτυγχάνει συχνά να παράγει τις απαιτούμενες απαντήσεις. Οποιαδήποτε αλλαγή που κάνει είναι εύκολο να σπάσει από pruning ή θόρυβο.

Για να ξεπεράσουν αυτό, οι συγγραφείς έχουν αναπτύξει μια στρατηγική επεξεργασίας πολλαπλών γύρων που προσαρμόζει σταδιακά τα βάρη του μοντέλου σε ένα μόνο MLP στρώμα μέχρι οι απαντήσεις του να ευθυγραμμιστούν επαρκώς με τις επιθυμητές απαντήσεις. Για να ενισχύσουν τις επεξεργασίες ενάντια σε επιθέσεις, επίσης ενσωματώνουν θόρυβο κατά τη διάρκεια της εκπαίδευσης, για να模拟ουν επιθέσεις:

Κατανομή των αλλαγών στο K1 για Baichuan-7B, Qwen-7B και LLaMA3-8B πριν και μετά τις επιθέσεις. Η πρώτη σειρά δείχνει την επίδραση της τυχαίας ένεσης θορύβου. Η δεύτερη σειρά δείχνει την επίδραση της pruning. Όλες οι αλλαγές παραμένουν κοντά στο μηδέν, υποδεικνύοντας ότι οι επιθέσεις δεν διαταράσσουν σημαντικά την εσωτερική συμπεριφορά του μοντέλου.

Κατανομή των αλλαγών στο K1 για Baichuan-7B, Qwen-7B και LLaMA3-8B πριν και μετά τις επιθέσεις. Η πρώτη σειρά δείχνει την επίδραση της τυχαίας ένεσης θορύβου. Η δεύτερη σειρά δείχνει την επίδραση της pruning. Όλες οι αλλαγές παραμένουν κοντά στο μηδέν, υποδεικνύοντας ότι οι επιθέσεις δεν διαταράσσουν σημαντικά την εσωτερική συμπεριφορά του μοντέλου.

Ένα σύστημα σκορingu σταματά τη διαδικασία όταν οι επεξεργασίες είναι αρκετά ακριβείς, ενώ κανονικοποίηση διασφαλίζει ότι οι ενημερώσεις παραμένουν σταθερές σε πολλαπλά γύρους.

Ο Decoder ζητά από το μοντέλο τις ίδιες ειδικές ερωτήσεις που χρησιμοποιήθηκαν κατά τη διαδικασία watermarking, και μετά διαβάζει τις απαντήσεις του για να υποθέσει το κρυφό ID.既然 το μοτίβο των απαντήσεων ακολουθεί μια μυστική κανόνα, αυτό το ID μπορεί να ανακτηθεί χωρίς να χρειάζεται να εξεταστεί η εσωτερική δομή του μοντέλου.

Δεδομένα και Δοκιμές

Για να δοκιμαστεί το EditMark, πέντε LLMs αξιολογήθηκαν: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; και Qwen-7B. Η προαναφερθείσα AlphaEdit χρησιμοποιήθηκε για την ενσωμάτωση watermark, ενώ ο ρυθμός εξαγωγής (ESR) και ο χρόνος ενσωμάτωσης (ET) ήταν τα μετρικά που υιοθετήθηκαν.

Για αναφορές, οι συγγραφείς επέλεξαν Model Watermark (backdoor); KIMark; και BadEdit, ένα πλαίσιο που αρχικά σχεδιάστηκε για την ενσωμάτωση backdoor, εδώ προσαρμοσμένο για τους δικούς τους σκοπούς.

Οι συγγραφείς επεξεργάστηκαν το 15ο στρώμα του LLaMA-3-8; το 17ο του GPT2-XL και GPT-J-6B; και το 14ο του Qwen-7B και Baichuan-7B.

Οι πειραματικές δοκιμές διεξήχθησαν σε τέσσερις NVIDIA RTX 4090 GPUs (24GB VRAM each), με watermarks 32-bit, 64-bit, και 128-bit που ενσωματώθηκαν. Τα πρότυπα ερωτήσεων που χρησιμοποιήθηκαν είναι λεπτομερώς στο παρακάτω σχήμα:

Πρότυπα που χρησιμοποιήθηκαν για να παράγουν ερωτήσεις με πολλαπλά απαντήσεις για την ενσωμάτωση watermark. Κάθε ερώτηση βασίζεται σε διαφορετικού τύπου μαθηματικής ανισότητας, με τυχαίες τιμές για τις μεταβλητές. Το μοντέλο ζητείται να επιστρέψει μια λίστα ακέραιων λύσεων, με τη σειρά των απαντήσεων να χρησιμοποιείται για να κωδικοποιήσει ή να αποκωδικοποιήσει bits του watermark. Τα τέσσερα πρότυπα καλύπτουν τετραγωνικές, λογαριθμικές, ρητές και διαστήματα-βασισμένες μορφές. Όλα παράγονται μέσω GPT-4o.

Πρότυπα που χρησιμοποιήθηκαν για να παράγουν ερωτήσεις με πολλαπλά απαντήσεις για την ενσωμάτωση watermark. Κάθε ερώτηση βασίζεται σε διαφορετικού τύπου μαθηματικής ανισότητας, με τυχαίες τιμές για τις μεταβλητές. Το μοντέλο ζητείται να επιστρέψει μια λίστα ακέραιων λύσεων, με τη σειρά των απαντήσεων να χρησιμοποιείται για να κωδικοποιήσει ή να αποκωδικοποιήσει bits του watermark. Τα τέσσερα πρότυπα καλύπτουν τετραγωνικές, λογαριθμικές, ρητές και διαστήματα-βασισμένες μορφές. Όλα παράγονται μέσω GPT-4o.

Για να μειώσουν τις επιπτώσεις της τυχαιότητας, σπόροι από 1 έως 20 εφαρμόστηκαν κατά τη διάρκεια των δοκιμών, σε διαφορετικές ικανότητες watermark.

Στην αρχή, οι ερευνητές δοκιμάστηκαν για ESR και χρόνο ενσωμάτωσης σε όλα τα LLMs:

Σύγκριση του EditMark με τρεις προηγούμενες μεθόδους watermarking σε πέντε μεγάλους γλωσσικούς μοντέλους. Αναφέρονται ο ρυθμός εξαγωγής (ESR) και ο χρόνος ενσωμάτωσης (ET) σε δευτερόλεπτα. Το EditMark επιτυγχάνει συνεχώς ρυθμό εξαγωγής 100% και μειώνει τον χρόνο ενσωμάτωσης κατά πολλά τάγματα μεγέθους, ξεπερνώντας όλα τα αναφορικά σε ακρίβεια και αποτελεσματικότητα σε μοντέλα διαφορετικού μεγέθους και αρχιτεκτονικής.

Σύγκριση του EditMark με τρεις προηγούμενες μεθόδους watermarking σε πέντε μεγάλους γλωσσικούς μοντέλους. Αναφέρονται ο ρυθμός εξαγωγής (ESR) και ο χρόνος ενσωμάτωσης (ET) σε δευτερόλεπτα. Το EditMark επιτυγχάνει συνεχώς ρυθμό εξαγωγής 100% και μειώνει τον χρόνο ενσωμάτωσης κατά πολλά τάγματα μεγέθους, ξεπερνώντας όλα τα αναφορικά σε ακρίβεια και αποτελεσματικότητα σε μοντέλα διαφορετικού μεγέθους και αρχιτεκτονικής.

Από αυτά τα αποτελέσματα, οι συγγραφείς αναφέρουν:

‘[EditMark] επιτυγχάνει ρυθμό εξαγωγής 100% και απαιτεί λιγότερο από 20 δευτερόλεπτα για να ενσωματώσει ένα 32-bit watermark για όλα τα LLMs που αξιολογήθηκαν. Συγκεκριμένα, ο μέσος χρόνος ενσωμάτωσης για Baichuan-7B και Qwen-7B είναι κάτω από 10 δευτερόλεπτα, το οποίο δείχνει την υψηλή αποτελεσματικότητα του EditMark.’

Για την αξιολόγηση ενός 128-bit watermark, η υψηλότερη τιμή που είναι εφικτή σε τέτοιο σχήμα, το EditMark ήταν σε θέση να διατηρήσει μια κατάσταση ‘αδιαγράφτου’:

Ρυθμοί εξαγωγής και χρόνοι ενσωμάτωσης για EditMark σε μήκη watermark 32, 64 και 128 bits σε πέντε γλωσσικούς μοντέλους. Τέλειοι ρυθμοί εξαγωγής διατηρούνται σε όλες τις περιπτώσεις, ενώ ο χρόνος ενσωμάτωσης αυξάνεται με το μέγεθος του watermark, αλλά παραμένει κάτω από ένα λεπτό, ακόμη και στα 128 bits.

Ρυθμοί εξαγωγής και χρόνοι ενσωμάτωσης για EditMark σε μήκη watermark 32, 64 και 128 bits σε πέντε γλωσσικούς μοντέλους. Τέλειοι ρυθμοί εξαγωγής διατηρούνται σε όλες τις περιπτώσεις, ενώ ο χρόνος ενσωμάτωσης αυξάνεται με το μέγεθος του watermark, αλλά παραμένει κάτω από ένα λεπτό, ακόμη και στα 128 bits.

Επόμενο, η ικανότητα του συστήματος να διατηρεί την πιστότητα του watermark αξιολογήθηκε σε πολλαπλά benchmarks:

Αξιολόγηση της πιστότητας του watermark σε τέσσερις αναφορές σε πέντε μοντέλα, συγκρίνοντας αμεταβλητά μοντέλα με μοντέλα που έχουν ενσωματωθεί με 32-bit και 128-bit ικανότητες. Η απόδοση παρέμεινε σταθερή σε όλες τις διαμορφώσεις, με μόνο μικρές διακυμάνσεις στις μέσες βαθμολογίες, υποδεικνύοντας περιορισμένη επίδραση στην ακρίβεια του benchmark από την ενσωμάτωση του watermark.

Αξιολόγηση της πιστότητας του watermark σε τέσσερις αναφορές σε πέντε μοντέλα, συγκρίνοντας αμεταβλητά μοντέλα με μοντέλα που έχουν ενσωματωθεί με 32-bit και 128-bit ικανότητες. Η απόδοση παρέμεινε σταθερή σε όλες τις διαμορφώσεις, με μόνο μικρές διακυμάνσεις στις μέσες βαθμολογίες, υποδεικνύοντας περιορισμένη επίδραση στην ακρίβεια του benchmark από την ενσωμάτωση του watermark.

Η αντοχή του EditMark αξιολογήθηκε ενάντια σε έξι κοινούς στρατηγικές επιθέσεων. Τα μοντέλα πρώτα ενσωματώθηκαν με 128-bit watermarks χρησιμοποιώντας πέντε διαφορετικούς σπόρους. Η βελτιστοποίηση, όπως φαίνεται στο παρακάτω σχήμα, προκάλεσε μόνο μικρές επιδείξεις στη ρυθμό εξαγωγής (ESR) για τα περισσότερα μοντέλα:

Ρυθμός εξαγωγής (ESR) των watermarked LLMs πριν και μετά τη βελτιστοποίηση για ένα έως τρία epochs. Ενώ τα περισσότερα μοντέλα διατηρούν υψηλό ESR καθ' όλη τη διάρκεια, το Qwen-7B δείχνει μια σηματική πτώση, υποδεικνύοντας μεγαλύτερη ευαισθησία στις ενημερώσεις παραμέτρων.

Ρυθμός εξαγωγής (ESR) των watermarked LLMs πριν και μετά τη βελτιστοποίηση για ένα έως τρία epochs. Ενώ τα περισσότερα μοντέλα διατηρούν υψηλό ESR καθ’ όλη τη διάρκεια, το Qwen-7B δείχνει μια σηματική πτώση, υποδεικνύοντας μεγαλύτερη ευαισθησία στις ενημερώσεις παραμέτρων.

Ακόμη και μετά από πολλαπλά epochs, τα περισσότερα μοντέλα διατηρούν ESRs πάνω από 90%, υποδεικνύοντας ότι το EditMark αντέχει στην παραλλαγή των παραμέτρων που εισάγει η LoRA-based εκπαίδευση.

Οι επιθέσεις quantization μειώνουν την ακρίβεια του μοντέλου, αλλά αφήνουν τα περισσότερα watermarks άθικτα:

Ρυθμός εξαγωγής (ESR) των watermarked μοντέλων πριν και μετά την quantization χρησιμοποιώντας Int‑8 και Int‑4 ακρίβεια. Ο ESR παραμένει αμετάβλητος κάτω από quantization Int‑8 σε όλα τα μοντέλα, ενώ η quantization Int‑4 προκαλεί μερική επιδείξη, υποδεικνύοντας ότι η χαμηλότερη ακρίβεια μπορεί να削弱, αλλά όχι να αφαιρέσει πλήρως το watermark.

Ρυθμός εξαγωγής (ESR) των watermarked μοντέλων πριν και μετά την quantization χρησιμοποιώντας Int‑8 και Int‑4 ακρίβεια. Ο ESR παραμένει αμετάβλητος κάτω από quantization Int‑8 σε όλα τα μοντέλα, ενώ η quantization Int‑4 προκαλεί μερική επιδείξη, υποδεικνύοντας ότι η χαμηλότερη ακρίβεια μπορεί να削弱, αλλά όχι να αφαιρέσει πλήρως το watermark.

Όπως φαίνεται στο παραπάνω σχήμα, η Int-8 quantization διατηρεί 100% ESR σε όλα τα μοντέλα, ενώ η quantization Int-4 έχει μια μέτρια επίδραση στο ESR, αλλά εισάγει απαράδεκτες απώλειες απόδοσης.

Όπως σημειώνει το έγγραφο, αυτό το σενάριο υποδηλώνει περιορισμένο δυναμικό για έναν επιτιθέμενο, поскольку αυτό οδηγεί σε ένα χάκερ αλλά με μειωμένη απόδοση μοντέλου.

Δοκιμές για θόρυβο και pruning αξιολόγησαν τέσσερις αναφορές: MMLU; BLIMP; TruthfulQA; και GLUE. Αυτές οι επιθέσεις οδήγησαν σε μείωση του ESR καθώς οι διαταραχές εντάθηκαν:

Επίδραση των επιθέσεων θορύβου (πρώτη σειρά) και pruning (δεύτερη σειρά) στο ESR, και απόδοση των watermarked μοντέλων. Όπως ο ESR πέφτει με την αύξηση των διαταραχών, η ακρίβεια του benchmark επίσης μειώνεται, ιδιαίτερα σε υψηλότερες εντάσεις θορύβου και αναλογίες pruning, υποδηλώνοντας την (συνηθισμένη) ένταση μεταξύ αφαίρεσης του watermark και χρησιμότητας του μοντέλου.

Επίδραση των επιθέσεων θορύβου (πρώτη σειρά) και pruning (δεύτερη σειρά) στο ESR, και απόδοση των watermarked μοντέλων. Όπως ο ESR πέφτει με την αύξηση των διαταραχών, η ακρίβεια του benchmark επίσης μειώνεται, ιδιαίτερα σε υψηλότερες εντάσεις θορύβου και αναλογίες pruning, υποδηλώνοντας την (συνηθισμένη) ένταση μεταξύ αφαίρεσης του watermark και χρησιμότητας του μοντέλου.

Ωστόσο, αυτές επίσης προκάλεσαν απότομες πτώσεις στην απόδοση της εργασίας, με το Baichuan-7B να λαμβάνει μια πτώση 27-31% στο BLIMP όταν θόρυβος ή pruning εφαρμόστηκαν.

Η επεξεργασία του μοντέλου και οι προσαρμοσμένες επιθέσεις αξιολογήθηκαν επίσης:

Ρυθμός εξαγωγής των watermarked μοντέλων που υπόκεινται σε ποικίλους βαθμούς επεξεργασίας του μοντέλου. Ακόμη και με μέχρι πενήντα επεξεργασίες που εφαρμόστηκαν στα γνωστά στρώματα watermark, ο ESR παραμένει πάνω από 95% για όλα τα μοντέλα, υποδηλώνοντας ότι οι άμεσες τροποποιήσεις των παραμέτρων έχουν περιορισμένη επίδραση στην αφαίρεση του watermark.

Ρυθμός εξαγωγής των watermarked μοντέλων που υπόκεινται σε ποικίλους βαθμούς επεξεργασίας του μοντέλου. Ακόμη και με μέχρι πενήντα επεξεργασίες που εφαρμόστηκαν στα γνωστά στρώματα watermark, ο ESR παραμένει πάνω από 95% για όλα τα μοντέλα, υποδηλώνοντας ότι οι άμεσες τροποποιήσεις των παραμέτρων έχουν περιορισμένη επίδραση στην αφαίρεση του watermark.

Εδώ, το EditMark διατηρεί πάνω από 95% ESR, ακόμη και όταν οι exact embedding στρώματα στοχεύονται.

Συμπέρασμα

Τα DRM, τα μυστικά watermarks και άλλες προσεγγίσεις ασφαλείας που έχουν απολαύσει (περιορισμένη ή μερική) επιτυχία στην προ-ΑΙ εποχή είναι δύσκολο να εφαρμοστούν σε συστήματα машинικής μάθησης. Η προθέσεων reductionist φύση του τρέχοντος εύρους των αρχιτεκτονικών συνδυάζεται με την έλλειψη κατάλληλου εργαλείου, για να κάνει οποιοδήποτε ενσωματωμένο watermark rather εύθραυστο.

Είναι εντυπωσιακό να δούμε ένα σύστημα που στοχεύει στην FOSS διανομή μοντέλων και να το δούμε να επιβιώσει ενάντια σε όλα τα σενάρια εκτός από τα πιο απίθανα, όσον αφορά την προηγούμενη γνώση ενός επιτιθέμενου. Παρόλα αυτά, η πολύ μικρή πτώση της απόδοσης που έρχεται με τις μετα-εκπαιδευτικές επεξεργασίες, μικρή όσο είναι σε αυτές τις πειραματικές δοκιμές, μπορεί να δώσει στους πιθανούς υιοθετητές λόγο να σταματήσουν. Δεν είναι τουλάχιστον since η υποχώρηση σε ένα API-κεντρικό μοντέλο ελέγχου αποτρέπει τέτοιες επιθέσεις σχεδόν εντελώς.

 

* Αυτό το site έχει υποστηρίξει ότι ‘ανοιχτά βάρη’ κυκλοφορίες από την Κίνα δεν απαραίτητα προκύπτουν ως πλήρως FOSS,既然 τα δεδομένα συχνά κρατούνται πίσω, τα οποία εμποδίζουν την ακριβή αναπαραγωγή της διαδικασίας εκπαίδευσης. Επιχείρηματικά, αυτό το θέμα καλεί μια βαθύτερη ματιά στις πολιτικές κυκλοφορίας μοντέλων AI σε σύγκριση μεταξύ δυτικών και ανατολικών, το οποίο είναι πέρα από το πεδίο αυτού του άρθρου.

Πρώτη δημοσίευση Δευτέρα, 27 Οκτωβρίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai