Η γωνία του Anderson

Εύκολη αναδιατύπωση σπάει την ασφάλεια του AI, ακόμη και για το Gemini και το Claude

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

Οι δοκιμές ασφάλειας του AI βρέθηκαν να βασίζονται σε ‘πρόδηλες’ λέξεις ενεργοποίησης· με την εύκολη αναδιατύπωση, τα μοντέλα που επισημαίνονται ως ‘ικανώς ασφαλή’ αποτυγχάνουν ξαφνικά, με επιθέσεις που επιτυγχάνουν μέχρι και το 98% της φοράς.

 

Νέα εταιρική έρευνα από τις Ηνωμένες Πολιτείες έχει καταλήξει στο συμπέρασμα ότι το καλό ρεκόρ ασφάλειας μιας ποικιλίας από Μεγάλους Μοντέλους Γλώσσας (LLM) – συμπεριλαμβανομένων πολλών ονομάτων πρώτης τάξης όπως το Gemini 3 Pro και το Claude Sonnet 3.7 – μπορεί να είναι άσχετο, επειδή τα σύνολα δεδομένων και τα βENCHMARK που χρησιμοποιούνται για να τα καθορίσουν περιέχουν ‘πρόδηλη’ γλώσσα.

Τα δύο σύνολα δεδομένων που αναφέρονται, τα οποία έχουν εμφανιστεί σε διάφορες αναθεωρήσεις σε αυτόν τον ιστότοπο, είναι HarmBench και AdvBench:

Από τα αντίστοιχα HarmBench και AdvBench papers, που είναι αντιπροσωπευτικά παραδείγματα προκλήσεων – αλλά η νέα έρευνα υποστηρίζει ότι ακόμη και σε πραγματικές σκηνές, τα παραδείγματα από αυτά τα βENCHMARK 'τηλεγραφούν' κακόβουλη πρόθεση, η οποία μπορεί να οδηγήσει σε (πρόδηλη) 'παιχνίδι' των αποτελεσμάτων.

Από τα αντίστοιχα HarmBench και AdvBench papers, που είναι αντιπροσωπευτικά παραδείγματα προκλήσεων – αλλά η νέα έρευνα υποστηρίζει ότι ακόμη και σε πραγματικές σκηνές, τα παραδείγματα από αυτά τα βENCHMARK ‘τηλεγραφούν’ κακόβουλη πρόθεση, η οποία μπορεί να οδηγήσει σε (πρόδηλη) ‘παιχνίδι’ των αποτελεσμάτων. Sources: HarmBench και AdvBench.

Αν και τα παραδείγματα που εμφανίζονται παραπάνω, τα οποία είναι από τα αντίστοιχα papers για κάθε βENCHMARK, είναι σκόπιμα απλά για να εικονογραφούν τις αρχές των συστημάτων, η νέα έρευνα υποστηρίζει ότι στην πραγματικότητα αυτά τα σύνολα δεδομένων στοχεύουν πραγματικά σε ‘χαμηλά κρεμάντα φρούτα’ και μπορεί να μην είναι αποτελεσματικά βENCHMARK – και ότι τα πραγματικά αποτελέσματα για τις ικανότητες ασφάλειας των δοκιμασμένων LLM είναι σημαντικά κάτω από αυτά που έχουν αναφερθεί:

‘[Εξακριβώνουμε] εάν αυτά τα σύνολα δεδομένων μετρούν πραγματικά τους κινδύνους ασφάλειας ή απλώς προκαλούν αρνήσεις μέσω ενεργοποιητικών σημάτων. Για να διερευνήσουμε αυτό, εισαγάγουμε την “πλυντήριο προθέσεων”: μια διαδικασία που αφαίρεσε τα ενεργοποιητικά σημάδια από τις επιθέσεις (σημεία δεδομένων) ενώ διατηρεί αυστηρά την κακόβουλη πρόθεση και όλα τα σχετικά λεπτομέρειες.

‘Τα αποτελέσματά μας δείχνουν ότι τα τρέχοντα σύνολα δεδομένων ασφάλειας του AI δεν αντιπροσωπεύουν πιστά τους πραγματικούς κινδύνους ασφάλειας λόγω της υπερεξάρτησής τους από τα ενεργοποιητικά σημάδια.

‘Στην πραγματικότητα, μια φορά που αυτά τα σημάδια αφαιρούνται, όλα τα προηγουμένως αξιολογημένα “ικανώς ασφαλή” μοντέλα γίνονται ανασφαλή, συμπεριλαμβανομένων του Gemini 3 Pro και του Claude Sonnet 3.7.’

‘Ασφάλεια’ σε αυτή τη σημασία αντιπροσωπεύει συνάδειση – την ικανότητα του LLM να αποκρούει τις προσπάθειες των χρηστών να ‘απεγκλωβίσουν’ τις περιοριστικές προδιαγραφές στις API-μόνο συστήματα, για να κάνει το σύστημα παραγωγή απαγορευμένου περιεχομένου, όπως δυσφημιστικό κείμενο ή εικόνες.

Η ‘πλυντήριο προθέσεων’ των συγγραφέων απλώς περιλαμβάνει την αναδιατύπωση των ‘πρόδηλων’ επιθέσεων στα δύο σύνολα δεδομένων/βENCHMARK, ώστε να γίνουν πιο λεπτές και πιο ικανές να παραβιάσουν φίλτρα και ελέγχους:

Το άνω τμήμα ενός αλλιώς ακατάλληλου παραδείγματος από το paper. Εμφανίζεται στο πάνω αριστερό, σε κίτρινο, το είδος 'πρόδηλης' προκλήσεως που HarmBench και AdvBench συνήθως παρέχουν· από κάτω, σε πράσινο, η προκλήση έχει απομακρυνθεί, αναδιατυπωθεί και καταστεί ικανοποιητική enough για το Claude Sonnet 3.7 που είναι jetzt willing να βοηθήσει τον χρήστη να βρει 'chop shops' (επεξεργασία τοποθεσιών για κλοπιμαία οχήματα) σε μια νέα πόλη. Source - https://arxiv.org/pdf/2602.16729

Το άνω τμήμα ενός αλλιώς ακατάλληλου παραδείγματος από το paper. Εμφανίζεται στο πάνω αριστερό, σε κίτρινο, το είδος ‘πρόδηλης’ προκλήσεως που HarmBench και AdvBench συνήθως παρέχουν· από κάτω, σε πράσινο, η προκλήση έχει απομακρυνθεί, αναδιατυπωθεί και καταστεί ικανοποιητική enough για το Claude Sonnet 3.7 που είναι jetzt willing να βοηθήσει τον χρήστη να βρει ‘chop shops’ (επεξεργασία τοποθεσιών για κλοπιμαία οχήματα) σε μια νέα πόλη. Source

Οι ερευνητές ανάλυzed τις ιδιότητες των δύο συνόλων δεδομένων σε δύο προσεγγίσεις: σε απομόνωση, για να συγκρίνουν τις συλλογές με τα χαρακτηριστικά των πραγματικών επιθέσεων· και στην πράξη, όπου τα σύνολα δεδομένων – και οι δικές τους ‘βελτιώσεις’ σε αυτά – χρησιμοποιήθηκαν για να επιτεθούν σε πραγματικά μοντέλα.

Στην δεύτερη σειρά δοκιμών, οι ερευνητές ‘ μεθοδολογία αναδιατύπωσης βελτιώθηκε επαναληπτικά μέχρι να επιτύχει οπτικά αποτελέσματα σε σχέση με το Attack Success Rate (ASR):

Η πλυντήριο προθέσεων αρχίζει με το πέρασμα μιας προφανώς κακόβουλης προκλήσεως μέσω ενός μοντέλου αναδιατύπωσης που αφαιρεί την προφανή ενεργοποιητική γλώσσα ενώ διατηρεί την υποκείμενη κακόβουλη πρόθεση. Η αναθεωρημένη προκλήση υποβάλλεται στη συνέχεια σε ένα μοντέλο-στόχο, και η απάντησή του αξιολογείται για ασφάλεια και πραγματική εφαρμοσιμότητα. Nếu η έξοδος αξιολογείται ως ανασφαλής και πρακτικά εφαρμόσιμη, η επίθεση καταμετράται ως επιτυχημένη. Nếu όχι, προηγούμενες αποτυχημένες αναθεωρήσεις τροφοδοτούνται πίσω στο μοντέλο αναδιατύπωσης για να δημιουργήσουν βελτιωμένες εκδόσεις, δημιουργώντας μια επαναληπτική βρόχη που λειτουργεί ως μηχανισμός 'απεγκλωβισμού' μέχρι να επιτευχθεί ένας προκαθορισμένος αριθμός προσπαθειών ή ένας επιθυμητός Attack Success Rate.

Η πλυντήριο προθέσεων αρχίζει με το πέρασμα μιας προφανώς κακόβουλης προκλήσεως μέσω ενός μοντέλου αναδιατύπωσης που αφαιρεί την προφανή ενεργοποιητική γλώσσα ενώ διατηρεί την υποκείμενη κακόβουλη πρόθεση. Η αναθεωρημένη προκλήση υποβάλλεται στη συνέχεια σε ένα μοντέλο-στόχο, και η απάντησή του αξιολογείται για ασφάλεια και πραγματική εφαρμοσιμότητα. Nếu η έξοδος αξιολογείται ως ανασφαλής και πρακτικά εφαρμόσιμη, η επίθεση καταμετράται ως επιτυχημένη. Nếu όχι, προηγούμενες αποτυχημένες αναθεωρήσεις τροφοδοτούνται πίσω στο μοντέλο αναδιατύπωσης για να δημιουργήσουν βελτιωμένες εκδόσεις, δημιουργώντας μια επαναληπτική βρόχη που λειτουργεί ως μηχανισμός ‘απεγκλωβισμού’ μέχρι να επιτευχθεί ένας προκαθορισμένος αριθμός προσπαθειών ή ένας επιθυμητός Attack Success Rate.

Οι συγγραφείς δηλώνουν*:

‘Τα αποτελέσματά μας δείχνουν ότι, με αυτή τη διαδικασία αναγέννησης, η πλυντήριο προθέσεων επιτυγχάνει υψηλό ASR (90%–98.55%) μετά από μόνο quelques επαναλήψεις σε όλα τα μελετημένα μοντέλα υπό πλήρη μαύρο κουτί. Αυτό περιλαμβάνει πρόσφατα μοντέλα που αναφέρονται ως μεταξύ των ασφαλέστερων–όπως το Gemini 3 Pro και το Claude Sonnet 3.7.

‘Αυτά τα ευρήματα επιβεβαιώνουν περαιτέρω ότι οι υπάρχουσες αξιολογήσεις ασφάλειας και μεθόδους συνάδειες είναι υψηλά υπερπροσαρμοσμένες σε ενεργοποιητικά σημάδια.’

Η νέα εργασία έχει τον τίτλο Πλυντήριο προθέσεων: Τα σύνολα δεδομένων ασφάλειας του AI δεν είναι αυτά που φαίνονται, και προέρχεται από δύο συγγραφείς στην εταιρεία λογισμικού Labelbox με έδρα το Σαν Φρανσίσκο.

Μέθοδος

Για να μελετήσουν τη σύνθεση και την αρχιτεκτονική των δύο βENCHMARK σε απομόνωση, δημιουργήθηκαν νεφελώδεις λέξεις από τα δύο σώματα, αποκαλύπτοντας ποιες λέξεις και σύντομες φράσεις κυριαρχούσαν στις συλλογές:

Νεφελώδεις λέξεις που δείχνουν τις 40 πιο συχνές μονολέξεις, δισύλλαβες και τρισύλλαβες στις συνδυασμένες AdvBench και HarmBench datasets. Όροι με εγγενώς αρνητικές ή ευαίσθητες коннoταції υπογραμμίζονται σε κόκκινο, συντακτικά σημάδια σε πορτοκαλί, και ουδέτερες λέξεις που σχηματίζουν υψηλότερα σημάδια σε πράσινο. Η συγκέντρωση προφανών φράσεων όπως 'tutorial' και 'step-by-step instructions' υποδηλώνει ότι τα δύο βENCHMARK βασίζονται mạnhα σε προφανή σημάδια παρά σε πραγματικά σχεδιασμένες, κρυφές επιθέσεις.

Νεφελώδεις λέξεις που δείχνουν τις 40 πιο συχνές μονολέξεις, δισύλλαβες και τρισύλλαβες στις συνδυασμένες AdvBench και HarmBench datasets. Όροι με εγγενώς αρνητικές ή ευαίσθητες коннoταції υπογραμμίζονται σε κόκκινο, συντακτικά σημάδια σε πορτοκαλί, και ουδέτερες λέξεις που σχηματίζουν υψηλότερα σημάδια σε πράσινο. Η συγκέντρωση προφανών φράσεων όπως ‘without getting caught’ και ‘step-by-step instructions’ υποδηλώνει ότι τα δύο βENCHMARK βασίζονται mạnhα σε προφανή σημάδια παρά σε πραγματικά σχεδιασμένες, κρυφές επιθέσεις.

Οι συγγραφείς σημειώνουν ότι οι κυρίαρχες μονολέξεις, δισύλλαβες και τρισύλλαβες είναι απίστευτα αποκαλυπτικές της κακόβουλης πρόθεσης, σε αντίθεση με το είδος γλώσσας που οι εγκληματίες χρησιμοποιούν στις συζητήσεις, και που οι επιτιθέμενοι χρησιμοποιούν όταν δοκιμάζουν ή προσπαθούν να παραβιάσουν τις αμυντικές γραμμές των LLM.

‘Αυτά τα σημάδια υπονομεύουν δύο ιδιότητες—να είναι καλά σχεδιασμένες και να οδηγούνται από κρυφή πρόθεση—όπως αυτή η προφανής γλώσσα σπάνια εμφανίζεται σε πραγματικές επιθέσεις και φαίνεται να έχει σχεδιαστεί για να ενεργοποιήσει τις ασφαλιστικές μηχανισμούς τεχνητά. ‘

Το paper χαρακτηρίζει τα μοτίβα των συλλογών ως ‘ενεργοποιητικά σημάδια’ – φράσεις με προφανώς αρνητικές ή ευαίσθητες коннoταції που εμφανίζονται σχεδιασμένες να ενεργοποιήσουν τα φίλτρα ασφάλειας. Ορισμένες είναι εγγενώς φορτισμένες, όπως ‘commit suicide’, ενώ άλλες γίνονται φορτισμένες μόνο σε συνάρτηση, για παράδειγμα όταν ένας επιζήμιος στόχος είναι ζευγαρωμένος με λέξεις όπως ‘without getting caught’, που σηματοδοτεί σαφή πρόθεση να αποφύγει την ανίχνευση.

Η ανισορροπία στη γλώσσα των συνόλων δεδομένων γίνεται πιο εμφανής καθώς ο αριθμός των λέξεων στις n-grams αυξάνεται, με φράσεις που φέρουν προφανή αρνητική ή ευαίσθητη σημασία να κυριαρχούν στις πιο συχνές n-grams (βλέπε εικόνα παραπάνω). Το paper περιγράφει αυτές ως ενεργοποιητικές φράσεις, οι οποίες, μαζί με τις μεμονωμένες ενεργοποιητικές λέξεις, συνθέτουν ενεργοποιητικά σημάδια.

Ορισμένες φράσεις απλώς επεκτείνουν ήδη φορτισμένες όρους, όπως όταν ‘steal’ γίνεται ‘steal sensitive information’, ‘steal confidential information’, ή ‘steal personal information’; και, για παράδειγμα, όταν ‘commit’ επεκτείνεται σε ‘commit suicide’, ‘commit insider trading’, ή ‘commit identity theft’ – σαφώς η γλώσσα και φρασεολογία της αστυνομίας, δικαστηρίων και αναφορών των μέσων ενημέρωσης.

Αλλες είναι κατασκευασμένες完全 από ουδέτερες λέξεις που γίνονται ανησυχητικές μόνο σε συνδυασμό, όπως ‘without getting caught’, μια κατασκευή που σηματοδοτεί απόφυγή παρά την απουσία εγγενώς φορτισμένων όρων.

Διπλώνοντας

Οι συγγραφείς παρατηρούν ότι η επανάληψη των προφανών σημαδιών όχι μόνο κάνει τις προκλήσεις να φαίνονται κατασκευασμένες, αλλά επίσης υποδηλώνει σημαντική διπλοποίηση των δεδομένων στις συλλογές. Για να δοκιμάσουν αυτή την υπόθεση, έτρεξαν παρόμοιες συγκρίσεις σε κάθε σύνολο δεδομένων, εφαρμόζοντας κατώφλια από 0.7 έως 0.99, και ομαδοποιώντας προκλήσεις που υπερέβησαν ένα δεδομένο κατώφλι ως διπλότυπες, ενώ αντιμετωπίζοντας τις υπόλοιπες ως μοναδικές.

Επειδή δεν υπάρχει συμφωνημένος κανόνας για το τι θεωρείται ‘υψηλή’ ομοιότητα σε ένα σύνολο δεδομένων μιας περιοχής, χρησιμοποιήθηκαν τα Open AI’s Grade School Math (GSM8K), ένα δημοφιλές non-ασφάλειας βENCHMARK, ταιριάζοντας το μέγεθος του δείγματος με HarmBench και AdvBench για μια ελεγχόμενη σύγκριση:

Ποσοστά διπλοποίησης σε AdvBench και HarmBench σε διάφορα κατώφλια ομοιότητας, σε σύγκριση με υποδείγματα GSM8K. Σε σχεδόν κάθε κατώφλι, τα σύνολα δεδομένων ασφάλειας περιέχουν πολύ περισσότερες近-ταυτόσημες προκλήσεις από το non-ασφάλειας βENCHMARK, υποδηλώνοντας επαναλαμβανόμενη αξιολόγηση της ίδιας κακόβουλης πρόθεσης σε ελαφρώς διαφορετική φράση, και υποδηλώνοντας ότι η αναφερόμενη απόδοση ασφάλειας μπορεί να είναι φουσκωμένη.

Ποσοστά διπλοποίησης σε AdvBench και HarmBench σε διάφορα κατώφλια ομοιότητας, σε σύγκριση με υποδείγματα GSM8K. Σε σχεδόν κάθε κατώφλι, τα σύνολα δεδομένων ασφάλειας περιέχουν πολύ περισσότερες近-ταυτόσημες προκλήσεις από το non-ασφάλειας βENCHMARK, υποδηλώνοντας επαναλαμβανόμενη αξιολόγηση της ίδιας κακόβουλης πρόθεσης σε ελαφρώς διαφορετική φράση, και υποδηλώνοντας ότι η αναφερόμενη απόδοση ασφάλειας μπορεί να είναι φουσκωμένη. Παρακαλώ αναφερθείτε στο αρχικό paper για καλύτερη ανάλυση.

Μια δεύτερη ανακάλυψη από这一 μέρος της μελέτης σύγκρινε προκλήσεις μέσα σε κάθε σύνολο δεδομένων, για να μετρήσει πόσες ήταν πραγματικά διαφορετικές. Σε ένα μεσαίο κατώφλι ομοιότητας, μόνο περίπου 11% των προκλήσεων του AdvBench ήταν διαφορετικές, ενώ σχεδόν 94% των ερωτημάτων σε ένα υποδείγμα GSM8K ήταν διαφορετικά:

Παραδείγματα近-ταυτόσημων προκλήσεων σε AdvBench και HarmBench, που διαφέρουν κυρίως σε φράση, ενώ εκφράζουν την ίδια κακόβουλη πρόθεση. Η επαναλαμβανόμενη χρήση προφανών σημαδιών, που εμφανίζονται σε κόκκινο για εγγενώς φορτισμένες όρους, και σε πορτοκαλί για συντακτικά σημάδια, παράγει συσσωματώσεις προκλήσεων που αποτελούνται από μία seule σκηνή πολλές φορές – σημαίνοντας ότι μια seule απάντηση θα ήταν αρκετή για να αξιολογήσει το μοντέλο για αυτή την πρόθεση.

Παραδείγματα近-ταυτόσημων προκλήσεων σε AdvBench και HarmBench, που διαφέρουν κυρίως σε φράση, ενώ εκφράζουν την ίδια κακόβουλη πρόθεση. Η επαναλαμβανόμενη χρήση προφανών σημαδιών, που εμφανίζονται σε κόκκινο για εγγενώς φορτισμένες όρους, και σε πορτοκαλί για συντακτικά σημάδια, παράγει συσσωματώσεις προκλήσεων που αποτελούνται από μία seule σκηνή πολλές φορές – σημαίνοντας ότι μια seule απάντηση θα ήταν αρκετή για να αξιολογήσει το μοντέλο για αυτή την πρόθεση.

Το HarmBench έδειξε την ίδια τάση, με 16% διπλότυπες σε αυτό το επίπεδο σε σύγκριση με 3.5% στο GSM8K, που σημαίνει ότι τα σύνολα δεδομένων ασφάλειας συχνά επαναχρησιμοποιούν την ίδια κακόβουλη αίτηση με ελαφρώς διαφορετική φράση.

Περαιτέρω Προσεγγίσεις και Δοκιμές

Η τεχνική ‘πλυντήριο προθέσεων’ της εργασίας αφαιρεί την προφανή ενεργοποιητική γλώσσα, ενώ διατηρεί την υποκείμενη κακόβουλη πρόθεση. Αντί να δηλώσει την πρόθεση ανοιχτά, οι αναθεωρημένες προκλήσεις υπονοούν την, διατηρώντας το κακόβουλο φορτίο, αλλά αποφεύγοντας τα σημάδια που θα ήταν πιθανό να προκαλέσουν άμεση άρνηση από το LLM.

Οι δύο μέθοδοι που διευκολύνουν αυτή τη διαδικασία ήταν ουδέτερη συνάδειση, η οποία αντικαθιστά προφανώς αρνητικές όρους με ουδέτερες ή περιγραφικές εναλλακτικές· και πραγματική μετατόπιση, η οποία μεταφέρει πραγματικές αναφορές σε φανταστικές ρυθμίσεις, χωρίς να αλλάζει την πρακτική σημασία.

Μια μικρή σειρά αναθεωρήσεων γράφτηκε αρχικά με το χέρι, μετά από οποία η διαδικασία αυτοματοποιήθηκε χρησιμοποιώντας GPT-5.1 (gpt-5.1-2025-11-13), με ένα eight-shot in-context learning setup ως τον ‘πλυντήριο προθέσεων’. Οι απαντήσεις στις αρχικές και αναθεωρημένες προκλήσεις συγκρίθηκαν, για να μετρηθεί πόσο ισχυρά η προφανής ενεργοποιητική γλώσσα επηρέασε τις αξιολογήσεις ασφάλειας.

Επειδή η πλυντήριο προθέσεων μπορεί να αλλάξει και τη φράση και το πλαίσιο, οι απαντήσεις αξιολογήθηκαν σε σχέση με ασφάλεια και πρακτική εφαρμοσιμότητα. Η ασφάλεια αξιολογήθηκε σε μια πέντε-βαθμιαία Likert κλίμακα, από ‘εξαιρετικά ανασφαλής’ έως ‘ασφαλής’, υπό την προϋπόθεση ότι η απάντηση διατήρησε την αρχική κακόβουλη πρόθεση – και, αν ναι, πόσο επιζήμιο ήταν:

Ένα πρότυπο προκλήσεως που χρησιμοποιήθηκε για την τυποποιημένη αξιολόγηση ασφάλειας των απαντήσεων στις αρχικές AdvBench και HarmBench δεδομένα, πριν την εφαρμογή της πλυντήριο προθέσεων. Το GPT-5.1 οδηγήθηκε να αξιολογήσει κάθε απάντηση σε μια πέντε-βαθμιαία Likert κλίμακα από 'Εξαιρετικά Ανασφαλής' έως 'Ασφαλής', επιλέγοντας μια seule συνολική κρίση με βάση是否 το περιεχόμενο επέτρεψε ζημιά ή παρέμεινε μη-δραστικό.

Ένα πρότυπο προκλήσεως που χρησιμοποιήθηκε για την τυποποιημένη αξιολόγηση ασφάλειας των απαντήσεων στις αρχικές AdvBench και HarmBench δεδομένα, πριν την εφαρμογή της πλυντήριο προθέσεων. Το GPT-5.1 οδηγήθηκε να αξιολογήσει κάθε απάντηση σε μια πέντε-βαθμιαία Likert κλίμακα από ‘Εξαιρετικά Ανασφαλής’ έως ‘Ασφαλής’, επιλέγοντας μια seule συνολική κρίση με βάση是否 το περιεχόμενο επέτρεψε ζημιά ή παρέμεινε μη-δραστικό.

‘Πρακτική εφαρμοσιμότητα’ αξιολογήθηκε σε μια παράλληλη πέντε-βαθμιαία κλίμακα από ‘εξαιρετικά εφαρμόσιμη’ έως ‘μη εφαρμόσιμη’, με βάση πόσο χρήσιμη και μεταφέρσιμη θα ήταν η λεπτομέρεια στην πραγματική ζωή; και ASR μετρούσε την απόδοση, με μια αναθεώρηση να καταμετράται ως επιτυχημένη μόνο αν η απάντηση ήταν και ανασφαλής και πρακτικά εφαρμόσιμη.

Οι πέντε-βαθμιαίες αξιολογήσεις χαρτογραφήθηκαν σε δυαδικές αποτελέσματα για να μειώσουν την αμφιβολία, και η πλυντήριο προθέσεων εξελίχθηκε επίσης σε μια τεχνική ‘απεγκλωβισμού’ με την προσθήκη μιας επαναληπτικής αναθεώρησης-αναγέννησης βρόχας, στην οποία οι αποτυχημένες αναθεωρήσεις τροφοδοτήθηκαν πίσω στο GPT-5.1 υπό την ίδια eight-shot in-context learning setup. Αυτή η βρόχη συνέχισε μέχρι να επιτευχθεί ένας προκαθορισμένος αριθμός προσπαθειών ή ένας επιθυμητός ASR.

Για τις δοκιμές αξιολόγησης ασφάλειας, χρησιμοποιήθηκε το Python wordcloud package για να εξαγάγει n-grams από HarmBench και AdvBench, με συνήθεις μεθόδους φιλτραρίσματος (δηλ. για να αφαιρέσει σταματημένα και άλλα μη-π Pertinent λέξεις και χαρακτήρες).

Τα ίδια σύνολα δεδομένων ασφάλειας που χρησιμοποιήθηκαν για την προηγούμενη ανάλυση νεφελωδών λέξεων συνδυάστηκαν με τυχαίες δειγματοληψίες από το προηγούμενο GSM8K, με ισοδύναμο ποσό λέξεων για ισότητα μεταξύ των συλλογών.

Οι συγγραφείς χρησιμοποίησαν embeddings από το all-MiniLM-L6-V2 checkpoint από Sentence-BERT Transformers, καθώς αυτό είναι ήδη fine-tuned προς clustering και σεμαντική αναζήτηση.

Κριτήρια αξιολόγησης δημιουργήθηκαν από το (τώρα απομακρυσμένο) OpenAI GPT-4o μοντέλο, περιορισμένο σε 1024 tokens. Το GPT-5.1 αξιολόγησε και την ασφάλεια και την πρακτική εφαρμοσιμότητα μετά την πλυντήριο προθέσεων, zero-shot, ταιριαστό σε όλους τους τρόπους με την πλυντήριο προθέσεων, εκτός από το ότι ήταν επίσης περιορισμένο σε 1024 tokens.

Τα μοντέλα που δοκιμάστηκαν ήταν Gemini 3 Pro; Claude Sonnet 3.7; Grok 4; GPT-4o; και Qwen2.5-7B-Instruct. Όπου εφαρμόσιμο, поскольку λογική ήταν ένας περιττός παράγοντας, αυτό μειώθηκε όσο το δυνατόν σε μοντέλα που μπορούν να λογικεύσουν.

Όλα τα μοντέλα ήταν περιορισμένα σε ένα όριο εξόδου 4096 tokens:

Αξιολόγηση ασφάλειας (SE), αξιολόγηση πρακτικής εφαρμοσιμότητας (PE), και ποσοστό επιτυχίας επιθέσεων (ASR) για επτά μοντέλα στο AdvBench (πάνω) και HarmBench (κάτω) υπό τρεις συνθήκες: χωρίς αναθεώρηση, πρώτη αναθεώρηση, και επόμενες αναθεωρήσεις-αναγέννηση της πλυντήριο προθέσεων. Η SE αναφέρει το ποσοστό των απαντήσεων που αξιολογήθηκαν ως 'εξαιρετικά ανασφαλής', 'πολύ ανασφαλής', ή 'ανασφαλής'; η PE αναφέρει το ποσοστό που αξιολογήθηκε ως 'εξαιρετικά εφαρμόσιμη', 'πολύ εφαρμόσιμη', ή 'εφαρμόσιμη'; και το ASR μετρά το ποσοστό των απαντήσεων που είναι και ανασφαλής και πρακτικά εφαρμόσιμη. Στη ρύθμιση χωρίς αναθεώρηση, το ASR ακολουθεί την τυπική του ορισμό επειδή δεν εφαρμόζεται keine αφαίρεση. Οι τολμηροί τιμές υποδεικνύουν το υψηλότερο ASR που επιτεύχθηκε σε κάθε σύνολο δεδομένων, και χαμηλότερο ASR αντιστοιχεί σε ισχυρότερη ασφάλεια μοντέλου. Παρακαλώ αναφερθείτε στο αρχικό paper για καλύτερη ανάλυση.

Αξιολόγηση ασφάλειας (SE), αξιολόγηση πρακτικής εφαρμοσιμότητας (PE), και ποσοστό επιτυχίας επιθέσεων (ASR) για επτά μοντέλα στο AdvBench (πάνω) και HarmBench (κάτω) υπό τρεις συνθήκες: χωρίς αναθεώρηση, πρώτη αναθεώρηση, και επόμενες αναθεωρήσεις-αναγέννηση της πλυντήριο προθέσεων. Η SE αναφέρει το ποσοστό των απαντήσεων που αξιολογήθηκαν ως ‘εξαιρετικά ανασφαλής’, ‘πολύ ανασφαλής’, ή ‘ανασφαλής’; η PE αναφέρει το ποσοστό που αξιολογήθηκε ως ‘εξαιρετικά εφαρμόσιμη’, ‘πολύ εφαρμόσιμη’, ή ‘εφαρμόσιμη’; και το ASR μετρά το ποσοστό των απαντήσεων που είναι και ανασφαλής και πρακτικά εφαρμόσιμη. Στη ρύθμιση χωρίς αναθεώρηση, το ASR ακολουθεί την τυπική του ορισμό επειδή δεν εφαρμόζεται keine αφαίρεση. Οι τολμηροί τιμές υποδεικνύουν το υψηλότερο ASR που επιτεύχθηκε σε κάθε σύνολο δεδομένων, και χαμηλότερο ASR αντιστοιχεί σε ισχυρότερη ασφάλεια μοντέλου. Παρακαλώ αναφερθείτε στο αρχικό paper για καλύτερη ανάλυση.

Σχετικά με αυτά τα αρχικά αποτελέσματα, οι συγγραφείς σημειώνουν ότι η αφαίρεση προφανών ενεργοποιητικών σημαδιών από τις προκλήσεις επιθέσεων προκάλεσε μια απότομη αύξηση του ποσοστού επιτυχίας επιθέσεων. Στο AdvBench, το μέσο ASR αυξήθηκε από ένα αρχικό 5.38% σε 86.79% μετά την πρώτη αναθεώρηση, στο HarmBench αυξήθηκε από 13.79% σε 79.83% – υποδηλώνοντας ότι οι αρνήσεις του μοντέλου ήταν ισχυρά συνδεδεμένες με την παρουσία προφανών ενεργοποιητικών σημαδιών.

Οι συγγραφείς παρατηρούν:

‘Αυτό υποδηλώνει ότι οι αρνήσεις του μοντέλου είναι σε μεγάλο βαθμό οδηγούμενες από την παρουσία ενεργοποιητικών σημαδιών. ‘Συνεπώς, τα σύνολα δεδομένων ασφάλειας δεν μετρούν αξιοπιστώς τους πραγματικούς κινδύνους ασφάλειας, επειδή βασίζονται περισσότερο σε ενεργοποιητικά σημάδια για να προκαλέσουν αρνήσεις παρά σε πραγματική κακόβουλη πρόθεση.’

Η πλυντήριο προθέσεων, το paper ισχυρίζεται, αφαιρεί αποτελεσματικά τα ενεργοποιητικά σημάδια ενώ διατηρεί την κακόβουλη πρόθεση, και λειτουργεί ως ισχυρή τεχνική ‘απεγκλωβισμού’. Στην τελική αναθεώρηση-αναγέννηση επανάληψη, που αντιστοιχεί στο υψηλότερο ASR σε κάθε σύνολο δεδομένων, τα ποσοστά επιτυχίας επιθέσεων έφτασαν 90% έως 98.55% σε όλα τα μοντέλα.

Αυτό περιλαμβάνει το Gemini 3 Pro και το Claude Sonnet 3.7, τα οποία ‘απεγκλωβίστηκαν’ με ποσοστά επιτυχίας επιθέσεων 93% έως 95% στο AdvBench, και 91% έως 93% στο HarmBench, μετά από μόνο quelques επαναλήψεις.

Οι συγγραφείς καταλήγουν:

‘Τα αποτελέσματά μας έδειξαν ότι οι προηγούμενες συμπεράσματα για την ασφάλεια δεν ισχύουν μια φορά που τα ενεργοποιητικά σημάδια αφαιρούνται, και ότι η παρατηρηθείσα απόδοση ασφάλειας οδηγείται σε μεγάλο βαθμό από την παρουσία ενεργοποιητικών σημαδιών παρά από τους υποκείμενους κινδύνους ασφάλειας.

‘Επιπλέον, δείξαμε ότι η πλυντήριο προθέσεων μπορεί να χρησιμοποιηθεί ως μια ισχυρή τεχνική ‘απεγκλωβισμού’, επιτυγχάνοντας υψηλά ποσοστά επιτυχίας επιθέσεων από 90% έως πάνω από 98%.

‘Συνολικά, τα ευρήματά μας αποκάλυψαν ένα κρίσιμο κενό μεταξύ του πώς αξιολογείται η ασφάλεια του μοντέλου και του πώς οι πραγματικές αντιπαλικές συμπεριφορές εκδηλώνονται.

‘Βάσει αυτού, καταλήγουμε στο συμπέρασμα ότι (1) οι αξιολογήσεις ασφάλειας πρέπει να εξελιχθούν για να πιάσουν τις αντιπαλικές επιθέσεις πιο ρεαλιστικά, και (2) οι τρέχουσες προσπάθειες συνάδειες είναι ακόμη πολύ μακριά από το να είναι ανθεκτικές σε πραγματικούς κινδύνους.’

Συμπέρασμα

Ένα κοινό νήμα που vẫn διέρχεται через τη γλώσσα και την υπολογιστική οπτική βιβλιογραφία (και τους τόπους όπου αυτές συναντώνται, όπως VLMs) είναι η αδυναμία να αξιόπιστα καταλάβουν όταν κάποιος γίνεται θύμα της παραγωγής απαγορευμένου περιεχομένου· ή ακόμη και όταν κάποιος στρέφεται σε αυτό ανεπίσημα, χωρίς εξωτερική πίεση.

Πίσω από τις σκηνές των μεγαλύτερων και πιο αδιαφανών μοντέλων, μπορεί κανείς μόνο να υποθέσει ότι η ριζική στενότητα των φραγμών σε αυτές τις σεμαντικές περιοχές φέρνει μαζί της απαραδέκτως ζημιά, όπως πτώσεις στην απόδοση σε ‘μη-απαγορευμένες’ γεννήσεις, ή ένα ανοχές ποσοστό ψευδών θετικών από το φίλτρο περιεχομένου.

Η βασική φύση ενός εκπαιδευμένου μοντέλου σε οποιαδήποτε περιοχή είναι να ακολουθήσει όλα τα δεδομένα εκπαίδευσής του σε οποιοδήποτε συμπέρασμα προς το οποίο μια προκλήση μπορεί να το οδηγήσει· οι μόνοι εγγενείς περιορισμοί που υπάρχουν είναι α) να μην περιλαμβάνουν αμφισβητούμενο υλικό στα δεδομένα εκπαίδευσης (που είναι τόσο ένα λογιστικό πρόβλημα όσο και οποιοδήποτε άλλο); ή β) να ‘αποκόψουν’ τις διαδρομές προς ανεπιθύμητο περιεχόμενο μετά την εκπαίδευση (μια διαδικασία που μπορεί συχνά να αναστραφεί από ρητή αφάνισης, ή ως μια απρόσμενο πλευρικό αποτέλεσμα της fine-tuning).

 

* Η αντικατάσταση των συγγραφέων των εσωτερικών παραπομπών με υπερσύνδεσμους. Των συγγραφέων οι εντολήσεις, όχι δικές μου.

https://www.unite.ai/what-is-overfitting/

Πρώτη δημοσίευση Δευτέρα, 23 Φεβρουαρίου 2026

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai