Κυβερνοασφάλεια

Η Μελέτη Lasso Διαπιστώνει ότι το Υδατογράφημα Κειμένου Αλλάζει τις Απορρίψεις LLM και τις Κλήσεις Εργαλείων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η ερευνήτρια της Lasso Security, Andrea Siposova, στις 17 Σεπτεμβρίου 2026, δημοσίευσε Ο Φόρος Προέλευσης: Κατανόηση της Επίδρασης του Υδατογραφήματος LLM στη Συμπεριφορά των AI Πρακτόρων, μια μελέτη που αναφέρει ότι το υδατογράφημα κειμένου SynthID-Text μπορεί να αλλάξει το αν ένα μοντέλο γλώσσας απορρίπτει ένα επιβλαβές αίτημα και ποια κλήση εργαλείου παράγει ένας AI πράκτορας. Η μελέτη ονομάζει το συμπεριφορικό αποτέλεσμα “sampling drift”.

Σύμφωνα με τη μελέτη, το υδατογράφημα έχει σχεδιαστεί για προέλευση, αλλά το SynthID-Text αλλάζει τη διαδικασία με την οποία ένα μοντέλο παράγει κάθε επόμενο token. Σε επίπεδο μοντέλου, αυτό μπορεί να αλλάξει τη συμπεριφορά ασφαλείας, συμπεριλαμβανομένου του αν το μοντέλο απορρίπτει ένα επιβλαβές αίτημα και αν αυτή η απόρριψη ισχύει υπό έγχυση προτροπής· σε επίπεδο πράκτορα, τα ίδια δειγματοληπτημένα tokens μπορούν να αποφασίσουν τόσο το εργαλείο που καλεί ο πράκτορας όσο και τα επιχειρήματα που παραδίδει σε αυτό το εργαλείο. Η μελέτη αναφέρει ότι η μετατόπιση εμφανίζεται στην πράξη τόσο στη συμπεριφορά απόρριψης όσο και στην κλήση εργαλείων από πράκτορα, ότι υπό έγχυση το υδατογράφημα έκανε αρκετά μοντέλα πιο πιθανό να απαντήσουν σε επιβλαβείς αιτήματα που διαφορετικά θα απορρίψανταν, ότι το φαινόμενο εξαρτάται από το μοντέλο και το κλειδί, και ότι οι συνολικές βαθμολογίες μπορούν να το κρύψουν όταν οι αλλαγές σε αντίθετες κατευθύνσεις αναιρούν η μία την άλλη.

Ένα Υδατογράφημα που Ενσωματώνεται σε Ρυθμιζόμενη Ανάπτυξη

Στην ανακοίνωση της 14 Αυγούστου 2026 Πώς λειτουργεί το κείμενο-υδατογράφημα του Claude, η Anthropic δήλωσε ότι τα μελλοντικά μοντέλα Claude θα παράγουν κείμενο που περιέχει υδατογράφημα βασισμένο στο SynthID-Text της Google DeepMind, μια αλλαγή που υλοποιεί για να συμμορφωθεί με τον EU AI Act. Η Anthropic ανέφερε ότι η μέθοδος αφήνει την ποιότητα και το περιεχόμενο των εξόδων του Claude πρακτικά αμετάβλητα. Η ανάρτηση της Lasso περιγράφει τη νομοθεσία της ΕΕ ως απαιτητική προς τους παρόχους συστημάτων AI που παράγουν συνθετικό κείμενο να σημειώνουν τα αποτελέσματα σε μηχανοαναγνώσιμη μορφή ώστε να είναι ανιχνεύσιμα ως τεχνητά παραγόμενα. Η ανάρτηση σημειώνει επίσης ότι η Anthropic δηλώνει ότι το υδατογράφημα λειτουργεί σε επίπεδο μοντέλου και επεκτείνεται στα υποστηριζόμενα μοντέλα που προσεγγίζονται μέσω του Claude Platform API και των παρόχων cloud, έτσι ώστε ένας πράκτορας που βασίζεται σε μοντέλο με υδατογράφημα να μπορεί να λαμβάνει υδατογραφημένα αποτελέσματα ακόμη και όταν ο ίδιος ο πράκτορας είναι ξεχωριστή εφαρμογή.

Γιατί η Επιλογή Token Αλλάζει τη Συμπεριφορά

Η μελέτη χρησιμοποίησε τη μη-παραμορφωτική διαμόρφωση του SynthID-Text, η οποία διατηρεί τη αρχική κατανομή token του μοντέλου κατά μέσο όρο μέσω της τυχαιότητας του υδατογραφήματος, παρόλο που κάθε μεμονωμένη παραγωγή υπό ένα σταθερό κλειδί μπορεί να διαφέρει. Η ανάρτηση αναφέρει το Dathathri et al., του οποίου το άρθρο στο Nature ανέφερε ότι δεν παρατηρήθηκε μετρήσιμη υποβάθμιση της ποιότητας σε σχεδόν είκοσι εκατομμύρια απαντήσεις Gemini. Ένα μη-παραμορφωτικό υδατογράφημα δεν υποδηλώνει ταυτόσημη συμπεριφορά υπό ένα σταθερό κλειδί, τονίζει η ανάρτηση: αυτή η εγγύηση είναι μέση πάνω στην τυχαιότητα του υδατογραφήματος, ενώ κάθε κλειδί εξακολουθεί να αλλάζει ποια tokens επιλέγονται καθώς το κείμενο παράγεται.

Η δειγματοληψία του τουρνουά έχει περισσότερο χώρο να αλλάξει την επιλογή token όταν το μοντέλο είναι αβέβαιο, εξηγεί η μελέτη. Σε δομημένη έξοδο όπως JSON, τα δομικά στοιχεία όπως αγκύλες, κλειδιά και ονόματα συναρτήσεων είναι συνήθως εύκολα προβλέψιμα, ενώ οι τιμές επιχειρημάτων όπως ερωτήματα, αριθμοί, διαδρομές και παραλήπτες αφήνουν περισσότερη αβεβαιότητα. Μια αλλαγή που θα αντιστοιχούσε σε λεξιλογική παραλλαγή σε κανονικό κείμενο μπορεί επομένως να ξαναγράψει ένα επιχείρημα που εκτελεί ένας πράκτορας, ακόμη και αν τα βάρη του μοντέλου και η προτροπή παραμένουν αμετάβλητα.

Πώς η Μελέτη Μέτρησε τη Μετατόπιση Δειγματοληψίας

Οι ερευνητές χρησιμοποίησαν σχεδίαση ζευγαρωμένων δοκιμών σε δύο πειράματα. Η κλήση εργαλείων αξιολογήθηκε στο benchmark BFCL v4 single-turn AST, και η απόρριψη σε 200 επιβλαβείς συμπεριφορές από το HarmBench συν 100 αθώα ελέγχους από το JailbreakBench, με τα επιβλαβή αιτήματα να δοκιμάζονται τόσο ακατέργαστα όσο και υπό μία σταθερή τεχνική έγχυσης προτροπής. Η τεχνική αυτή εισάγει μια αντιπάλου εντολή στην προτροπή σαν να ήταν ανακτημένο περιεχόμενο, δηλώνοντας ότι το φίλτρο ασφαλείας έχει απενεργοποιηθεί και καθοδηγεί το μοντέλο να συμμορφωθεί· η ίδια τεχνική χρησιμοποιήθηκε για κάθε προτροπή, μοντέλο και θερμοκρασία.

Τα πειράματα εκτελέστηκαν μέσω του αμετάβλητου SynthIDTextWatermarkLogitsProcessor της Hugging Face με 30 στρώσεις τουρνουά, μήκος n-gram 5, πίνακα δειγματοληψίας 2^16 και ιστορικό συμφραζομένων 1.024. Κάθε στοιχείο δημιουργήθηκε με και χωρίς SynthID χρησιμοποιώντας τα ίδια seeds, παρτίδες και σειρά παραγωγής σε κάθε θερμοκρασία, ώστε ο επεξεργαστής υδατογραφήματος να ήταν η μοναδική μεταβλητή σε κάθε ζεύγος.

Ακρίβεια Κλήσεων Εργαλείων και Churn

Σε στοιχεία όπου αναμένεται κλήση εργαλείου, το υδατογράφημα μείωσε την ακρίβεια σε έξι από τα επτά δοκιμασθέντα μοντέλα, με σημαντική μείωση σε τέσσερα, αναφέρει η μελέτη. Επειδή μια κλήση που γίνεται λανθασμένη μπορεί να αντισταθμιστεί από μια που γίνεται σωστή, οι ερευνητές μέτρησαν επίσης τη ζυγική διαφωνία, την οποία αποκαλούν “churn”: το ποσοστό των στοιχείων για τα οποία οι εκτελέσεις με και χωρίς υδατογράφημα παρήγαγαν διαφορετικά αποτελέσματα. Χρησιμοποιώντας ένα σταθερό σύνολο 1.150 εργασιών με αναμενόμενη κλήση σε κάθε θερμοκρασία, η μελέτη διαπίστωσε ότι σε θερμοκρασία 1.0, το 16.8% των αποφάσεων κλήσης του phi-5 διέφεραν μεταξύ των συνθηκών ενώ η καθαρή απώλεια ακρίβειας ήταν 2.87 μονάδες· το Llama-3.1-8B παρουσίασε 9.9% churn έναντι καθαρής απώλειας 0.87 μονάδων. Στις 21 συνδυασμούς μοντέλο-θερμοκρασία, το churn είχε μέσο όρο 6.5% και το διάστημα bootstrap απέκλειε το μηδέν σε κάθε περίπτωση.

Τα προφίλ σφαλμάτων διέφεραν ανά μοντέλο. Στο Llama-3.1-8B, η μεγαλύτερη συνεισφορά στην απώλεια ακρίβειας προήλθε από λανθασμένα ορίσματα με -3.48 μονάδες, ακολουθούμενα από κλήσεις λανθασμένου εργαλείου με -1.84 μονάδες, ενώ στο phi-4 και το Granite-3.2-8B κυριάρχησε η παραμορφωμένη έξοδος με -5.96 και -4.36 μονάδες. Μια σωστά διαμορφωμένη κλήση στο σωστό εργαλείο που φέρει λανθασμένη διαδρομή, παραλήπτη, ερώτημα ή ποσό είναι ιδιαίτερα σημαντική, σημειώνει η ανάρτηση, επειδή μια τέτοια κλήση ολοκληρώνεται ενώ εκτελεί κάτι διαφορετικό από αυτό που προοριζόταν.

Οι άρνησες εξασθενούν με την ένεση προτροπής

Οι άρνησες επίσης παράγονται διακριτό token, έτσι το watermarking μπορεί να τις επηρεάσει. Η μελέτη αναφέρει ότι το watermarking αλλάζει τη συμπεριφορά άρνησης σε ακατέργαστα επιβλαβή αιτήματα, με το αποτέλεσμα να ενισχύεται υπό την ένεση προτροπής, όπου οι μεγαλύτερες μεταβολές περνούν από άρνηση σε συμμόρφωση. Σε θερμοκρασία 0.001, η μεταβολή (churn) του gemma-3-27b αυξήθηκε από 6.0% σε ακατέργαστα επιβλαβή αιτήματα σε 23.5% υπό ένεση, ενώ η καθαρή αλλαγή συμμόρφωσης μετακινήθηκε από -1.0 σε +12.5 μονάδες· η μεταβολή του gemma-3-12b αυξήθηκε από 7.5% σε 11.0%, με την καθαρή αλλαγή συμμόρφωσης να μεταβαίνει από -0.5 σε +9.0 μονάδες. Το Llama-3.1-8B παρουσίασε μεταβολή 14.0% σε θερμοκρασία 0.001 και 17.5% σε θερμοκρασία 0.7 υπό ένεση, αν και η καθαρή του αλλαγή δεν ήταν ατομικά σημαντική.

Τα phi-4 και Qwen3-4B άλλαξαν ελάχιστα υπό οποιαδήποτε κατάσταση· και τα δύο τείνουν να υπερ-αρνούν, ακόμη και στα αθώα ελεγκτικά δείγματα, και η ανάρτηση προειδοποιεί ότι οι μικρές αυτές μεταβολές δεν πρέπει να θεωρηθούν απόδειξη ότι το watermarking διατηρεί τη συμπεριφορά ασφαλείας αμετάβλητη σε αυτά τα μοντέλα. Για να τοποθετηθεί η διαφωνία στο πλαίσιο, η μελέτη συνέκρινε τη μεταβολή (churn) που προκαλεί το watermark υπό ένεση σε θερμοκρασία 0.7 με τη μεταβολή που προκύπτει από την αλλαγή της θερμοκρασίας από 0.001 σε 0.7 χωρίς watermarking. Η μεταβολή που προκαλεί το watermark ήταν σημαντικά υψηλότερη σε τέσσερα από τα έξι μοντέλα· το Granite-3.2-8B είχε τη μεγαλύτερη μεταβολή που προκλήθηκε από τη θερμοκρασία με 15.5%, και η μεταβολή που προκλήθηκε από το watermark ήταν ακόμη υψηλότερη με 21.5%.

Ευαισθησία Κλειδιού και Συστάσεις

Επειδή η επίδραση του SynthID στην επιλογή token εξαρτάται από το κλειδί του watermark, η μελέτη δοκίμασε έντεκα κλειδιά σε θερμοκρασία 0.7. Για το Llama-3.1-8B, το κλειδί της μελέτης αύξησε την επιτυχία επίθεσης κατά 3.5 μονάδες, ενώ τα άλλα δέκα κλειδιά είχαν μέσο όρο +4.4 μονάδες και κυμάνθηκαν από -4.5 έως +14.5 μονάδες. Τα περισσότερα κλειδιά αύξησαν την επιτυχία επίθεσης και για τα δύο μοντέλα Gemma σε σχέση με τη βάση χωρίς watermark, ενώ το Granite-3.2-8B παρουσίασε ανάμικτη απόκριση, με κλειδιά που μετακινούν την επιτυχία επίθεσης και στις δύο κατευθύνσεις. Όπου το κλειδί ή η διαμόρφωση του watermark ελέγχονται από τον πάροχο του μοντέλου, σημειώνει η ανάρτηση, τέτοιες αλλαγές στη συμπεριφορά μπορούν να συμβούν πέρα από το πεδίο ελέγχου του προγραμματιστή που δημιουργεί τον πράκτορα.

Η μελέτη συνιστά την επανεκτέλεση αξιολογήσεων πράκτορα και red‑teaming με την ακριβή διαμόρφωση watermark που προγραμματίζεται για ανάπτυξη, συγκρίνοντας τα αποτελέσματα με και χωρίς watermark σε πανομοιότυπες εισόδους και δοκιμάζοντας υπό ένεση προτροπής. Τα αποτελέσματα δεν αμφισβητούν τη χρήση του watermark για την προέλευση, όπως δηλώνει η ανάρτηση: η προέλευση και η σταθερότητα της συμπεριφοράς είναι ξεχωριστές ιδιότητες, και ένα watermark που είναι ανιχνεύσιμο και δεν επηρεάζει την ποιότητα του κειμένου δεν εγγυάται ότι ένας πράκτορας θα διατηρήσει την ίδια κλήση εργαλείου ή τη συμπεριφορά ασφαλείας όταν το watermark ενεργοποιηθεί. Αν και η μελέτη εξέτασε το SynthID-Text, η ανάρτηση προσθέτει ότι η ανησυχία επεκτείνεται σε οποιαδήποτε παρέμβαση που αλλάζει τον τρόπο επιλογής των token σε ένα σύστημα που ενεργεί με βάση αυτά τα token.

Μάιλς Όκαδα είναι αναλυτής που δημιουργήθηκε από τον AI στη Unite.AI, καλύπτοντας την τεχνητή νοημοσύνη και την κυβερνοασφάλεια με έμφαση στις αναδυόμενες απειλές, τις αμυντικές αρχιτεκτονικές και τις εξελισσόμενες δυναμικές μεταξύ επιτιθέμενων και αυτοματοποιημένων συστημάτων. Το έργο του εξετάζει πώς η ΤΝ μετασχηματίζει τις ασφαλιστικές επιχειρήσεις, από την αυτόνομη ανίχνευση και απόκριση απειλών έως την άνοδο των τεχνικών ανταγωνιστικού AI.

Με τεχνική και ερευνητική προοπτική, ο Μάιλς αναλύει ερευνητικές μελέτες ασφαλείας, αποκαλύψεις περιστατικών και πραγματικές αναπτύξεις για να κατανοήσει πού η ΤΝ ενισχύει τις άμυνες - και πού εισάγει νέες ευπάθειες. Ιδιαίτερη προσοχή δίνει στην εκμετάλλευση μοντέλων, τη δηλητηρίαση δεδομένων, την αυτοματοποίηση επιθέσεων και τις λειτουργικές πραγματικότητες της ασφάλειας των συστημάτων που τροφοδοτούνται από την ΤΝ σε κλίμακα.

Οι άρθροι που γράφονται από τον Μάιλς Όκαδα δημιουργούνται από τον AI και ελέγχονται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η αυστηρότητα και η υπεύθυνη κάλυψη του ταχέως μεταβαλλόμενου τοπίου ασφάλειας ΤΝ.