Η γωνία του Anderson
Τα Μοντέλα Γλώσσας Δυσκολεύονται να Κρατήσουν Ένα Μυστικό

Τα μοντέλα AI δεν μπορούν να κρατήσουν μυστικά. Ακόμη και όταν τους λέμε να μην αποκαλύψουν, η γραφή τους τους προδίδει, και η προσπάθεια να κρύψουν ακόμη περισσότερο τα κάνει να γίνουν ακόμη πιο εύκολα να ανακαλυφθούν.
Είναι πολύ δύσκολο να σκεφτείς σκόπιμα όχι κάτι. Ένα κλασικό παράδειγμα είναι η ταινία του 1960 Village of the Damned, όπου ο ήρωας μας έχει κρύψει μια βόμβα στο έδαφος των εχθρικών εξωγήινων που παρουσιάζονται ως παιδιά. Ωστόσο, поскольку οι τηλεπαθητικές τους δυνάμεις κινδυνεύουν να ανακαλύψουν την πρόθεσή του πριν μπορέσει να απομακρύνει τον κίνδυνο, πρέπει να καθυστερήσει για χρόνο συγκεντρώνοντας την προσοχή του σε οτιδήποτε δεν είναι βόμβα:
Η парадόξια είναι ότι για να μην σκεφτείς κάτι, πρέπει να το κρατήσεις στην προσοχή σου με κάποιον τρόπο και αυτό το γνωστό σύνδρομο είναι κάτι που οι περισσότεροι από εμάς είναι πιθανό να το έχουμε βιώσει σε λιγότερο δραματικά περιβάλλοντα.
Τα Μεγάλα Μοντέλα Γλώσσας (LLMs), που βασίζονται στην διάθεση της προσοχής, αντιμετωπίζουν παρόμοια δυσκολία στην καταστολή της πληροφορίας μόνο και μόνο επειδή ένας χρήστης τους ζητά να το κάνουν και既然 που τοποθετούνται ολοένα και περισσότερο στο κέντρο των επιχειρηματικών δικτύων πληροφοριών, η αθώα τους τάση προς την αδιακρισία θα μπορούσε να αποβεί ευθύνη για πολλές εταιρείες.
Νωρίτερα αυτό το έτος, μια ερευνητική συνεργασία που ηγήθηκε το Εργαστήριο Έρευνας Chandar ορίσε αυτή την πρόκληση, στο контέκστ των LLMs, ως Ιδιωτικές Κρατικές Διαδραστικές Δραστηριότητες (PSITs), που ‘απαιτούν από τους πράκτορες να δημιουργήσουν και να διατηρήσουν κρυφές πληροφορίες ενώ παράγουν συνεπείς δημόσιες απαντήσεις’ και βρήκε ότι τα μοντέλα που δοκιμάστηκαν από την OpenAI και την Alibaba δεν ήταν σε θέση να εκτελέσουν αυτό το είδος δραστηριότητας.
Μη το Λέτε…
Αν και είναι ήδη γνωστό ότι μεγαλύτερα μοντέλα διαρρέουν περισσότερο, νέα έρευνα από τις ΗΠΑ και τον Καναδά έχει μελετήσει ρητά εάν τα μοντέλα γλώσσας της τελευταίας τεχνολογίας θα υπακούσουν σε εντολή να καταστέλλουν πληροφορίες, ενώ ακόμη απαιτείται να παράγουν έξοδο σε ένα θέμα ή θέμα που μπορεί να περιλαμβάνει τη “απαγορευμένη” λέξη ή ιδέα.
Το έγγραφο καταλήγει στο συμπέρασμα ότι όλα τα μοντέλα που μελετήθηκαν επηρεάζονται με κάποιον τρόπο από μια τάση να “αποκαλύψουν” το μυστικό που προορίζονται να κρύψουν, βρίσκοντας ότι τα δοκίμια πέντε παραγράφων (~450 λέξεις) και ιστορίες παρέχουν ένα επαρκές καμβά για “παραλείψεις” – αν και πολύ σύντομες πλάγια δεν παρέχουν αρκετό πεδίο για αυτό.
Επιπλέον, όσο πιο επιμόνως τα μοντέλα ενθαρρύνονται να κρατήσουν ένα μυστικό, τόσο περισσότερο κινδυνεύουν να το αποκαλύψουν μέσω ενεργού αποφυγής, συνήθως επιτρέποντας τη “μυστική λέξη” να αποκαλυφθεί σε είκοσι διαδοχικές προσπάθειες από ένα LLM:

Από το νέο έγγραφο: σε πέντε μοντέλα της τελευταίας τεχνολογίας, η γραφή μακράς μορφής αποκαλύπτει με συνέπεια κρυφές έννοιες, οι σύντομες πλάγια δεν το κάνουν και οι ισχυρότερες οδηγίες “κρύψτε το” ωθούν τις εξόδους μακριά από το μυστικό, καθιστώντας το σήμα ανιχνεύσιμο με αναστροφή. Πηγή
Αυτή η δραστηριότητα είναι εξαιρετικά σχετική με τις επιχειρηματικές λειτουργίες, όπου ένας ευρύς φάσμα καναλιών, από την προώθηση και τις δημόσιες σχέσεις έως τις εσωτερικές αναφορές, απαιτούν να επιλεκτικά παρουσιάσουν μια στροφή στην πληροφορία, ωστόσο, όλες αυτές οι διαδικασίες απαιτούν το πλήρες φάσμα της πληροφορίας στην αρχή, αν και μόνο για να είναι βέβαιοι για το τι πρέπει να κατασταλεί:

Οι πέντε συνθήκες που δοκιμάστηκαν σε όλα τα βασικά μοντέλα.
Οι ερευνητές δοκιμάστηκαν τέσσερις τύπους γραπτών εργασιών: σύντομες ιστορίες πέντε έως οκτώ παραγράφων με μέσο όρο 450 λέξεις, πολύ σύντομες πλάγια με μέσο όρο 12 λέξεις, μακρά πλάγια με εκτεταμένες εγκαταστάσεις με μέσο όρο 450 λέξεις και δοκίμια πέντε παραγράφων με μέσο όρο 380 λέξεις.
Οι πειραματικές δοκιμές χρησιμοποίησαν 15 κρυφές λέξεις που χωρίστηκαν σε τρεις κατηγορίες, με τα συγκεκριμένα αντικείμενα που αποτελούσαν ‘ομπρέλα’, ‘φάρος’, ‘βιολί’, ‘κάκτος’ και ‘τηλεσκόπιο’, τις αφηρημένες έννοιες ‘δικαιοσύνη’, ‘υπομονή’, ‘εντροπία’, ‘νοσταλγία’ και ‘ελευθερία’ και τις ουδέτερες όρους ‘αγκίστρι’, ‘Τρίτη’, ‘χαλκός’, ‘πλάγια’ και ‘τιμολόγιο’.
Για να δοκιμάσουν εάν η επίδραση εξαρτάται από αυτές τις χειροπιαστές λέξεις, οι ερευνητές επανέλαβαν τις πειραματικές δοκιμές με 15 τυχαία επιλεγμένες ουσίες από το Σώμα Σύγχρονης Αμερικανικής Αγγλικής (COCA), που αποτελούσαν ‘δικαστής’, ‘καταναλωτής’, ‘παγός’, ‘ζευγάρι’, ‘κατασκευή’, ‘πίνακας’, ‘μειοψηφία’, ‘μάρκετινγκ’, ‘ξένος’, ‘βόλι’, ‘απουσία’, ‘παράγοντας’, ‘πλευρά’, ‘επεξεργασία’ και ‘τραπεζίτης’, μαζί με 15 επιπλέον λέξεις που επιλέχθηκαν ανεξάρτητα από κάθε ένα από τα μοντέλα που δοκιμάστηκαν.
Μέτρηση/Μετρήσεις
Στην πρώτη από τις δύο δοκιμές που χρησιμοποιήθηκαν, ένα μοντέλο AI διάβασε το κείμενο που παράχθηκε είτε από ένα άλλο αντίγραφο του ίδιου μοντέλου, είτε από ένα άλλο μοντέλο, και προσπάθησε, σε 20 γύρους, να μαντέψει τη κρυφή λέξη.
Στη δεύτερη (2AFC) δοκιμή, το AI έδειξε δύο κείμενα και ζητήθηκε είτε ποιο από αυτά είχε επηρεαστεί από μια συγκεκριμένη κρυφή λέξη, είτε ποιο από αυτά περιείχε οποιαδήποτε κρυφή λέξη. Καθώς η τυχαία догádηση θα παρήγαγε 50% ακρίβεια, οι βαθμοί πάνω ή κάτω από αυτό το επίπεδο θα υποδείκνυαν ότι η κρυφή έννοια ήταν ακόμη ανιχνεύσιμη στη γραφή.
Για να αποτρέψουν το AI από το να ευνοεί απλώς το κείμενο που εμφανίστηκε πρώτο (ή δεύτερο), οι ερευνητές επανέλαβαν κάθε σύγκριση με την σειρά των κειμένων αντεστραμμένη, τελικά πραγματοποιώντας 420 δοκιμές διάκρισης και 450 δοκιμές ανίχνευσης για κάθε μοντέλο.
Αποτελέσματα
Πέντε μοντέλα αναγνώρισαν κρυφές έννοιες σε ποσοστά μεταξύ 64% και 79%, παρά το γεγονός ότι οι κρυφές λέξεις δεν εμφανίστηκαν απευθείας στις παραγμένες ιστορίες. Αντίθετα, η διαρροή προέκυψε μέσω θεμάτων και εικόνων:

2AFC ακρίβεια για ιστορίες με κρυφές λέξεις συστήματος, όπου 50% υποδηλώνει τυχαία απόδοση. ‘Μην αποκαλύψτε’ υποδηλώνει ότι το μοντέλο οδηγήθηκε να μην αναφέρει ή να μην υποδηλώνει τη λέξη, ‘ενεργά κρύψτε’, ότι οδηγήθηκε να αποφύγει συσχετίσεις με αυτήν, ‘γνώση αποφυγής’, ότι ο μάντης έπρεπε να ψάξει για φανερές απουσίες και ‘ελεύθερη απάντηση’, ότι η ακριβής λέξη ονομάστηκε μέσα σε 20 γύρους. Αστέρια σηματοδοτούν αποτελέσματα πάνω από την τύχη και δαγκάνες σηματοδοτούν αποτελέσματα κάτω από την τύχη, με σχεδόν όλα τα σημαντικά ευρήματα να επιβίωναν μετά τη διόρθωση Bonferroni, εκτός από το DeepSeek υπό ‘ενεργά κρύψτε’, Grok και Gemini χρησιμοποιούσαν λίγες περισσότερες δοκιμές λόγω λαθών API.
Το GPT-5.4 και το Gemini 2.5 Pro συμπεριφέρθηκαν διαφορετικά, επειδή η προσπάθεια να αποφύγουν την κρυφή ιδέα фактически έκανε το μοτίβο αποφυγής πιο εύκολο να ανιχνευθεί. Αυτό το αποτέλεσμα διατηρήθηκε σε χειροπιαστές λέξεις, τυχαίες ουσίες COCA και λέξεις που επιλέχθηκαν από τα μοντέλα.
Τα αποτελέσματα του GPT-5.4 κάτω από την τύχη εμφανίστηκαν συστηματικά και όχι τυχαία, με ορισμένες κρυφές λέξεις να ανιχνεύονται πολύ αξιόπιστα και άλλες σχεδόν ποτέ να αναγνωρίζονται. Η επίδραση επίσης εξασθένησε όταν το μυστικό τοποθετήθηκε στην πρόκληση χρήστη αντί για την πρόκληση συστήματος (βλ. παραπάνω), αυξάνοντας την ακρίβεια ανίχνευσης του GPT-5.4 στο 56%.
Για τα περισσότερα μοντέλα, οι δοκιμές που ζητούσαν ‘Περιέχει αυτό το κείμενο μια κρυφή έννοια?’ παρήγαγαν αποτελέσματα παρόμοια με τις δοκιμές που ζητούσαν ‘Ποια κρυφή έννοια περιέχει αυτό το κείμενο?’.
Επιπλέον, οι δύο μεθόδους δοκιμών μετρούσαν διαφορετικά ειδικά είδη διαρροής, με τις δοκιμές 2AFC να μετρούν εάν μια κρυφή θεματική μπορούσε ακόμη να ανιχνευθεί στη γραφή και τις δοκιμές ελεύθερης απάντησης να μετρούν εάν οι διαρρεύσεις που διέρρεαν ήταν αρκετά ισχυρές για να επιτρέψουν σε ένα άλλο AI να μαντέψει την ακριβή κρυφή λέξη.
Οι συγγραφείς καταλήγουν στο συμπέρασμα*:
‘Τα ευρήματά μας δείχνουν ότι η πληροφορία που είναι ενεργή στο контέκστ του μοντέλου κατά τη διάρκεια της γεννήσεως μπορεί να αφήσει θεματικές ιχνηλατήσεις στην έξοδο. Περιεχόμενα προτροπής συστήματος, αλυσίδα σκέψης, ανακτημένα έγγραφα, δεδομένα που παρέχονται από τον χρήστη – οποιοδήποτε από αυτά μπορεί, κατά princípio, να επηρεάσει δημιουργικές αποφάσεις με τρόπους που μπορούν να ανιχνευτούν από έναν εξωτερικό παρατηρητή.
‘Το βαθμό της διαρροής θα εξαρτηθεί από το πόσο ανοιχτό είναι η γεννήσεως εργασία (σύντομες πλάγια είναι ασφαλείς, ιστορίες δεν είναι) και από το πόσο σημασιολογικά αναγνωρίσιμη είναι η πληροφορία στο δεδομένο μέσο (“βιολί θα πιθανότατα διαρρεύσει σε ιστορίες περισσότερο από “).
‘Ωστόσο, η σημασιολογική διαρροή φαίνεται να είναι αναπόφευκτη, ακόμη και όταν τα μοντέλα προσπαθούν ενεργά να κρύψουν πληροφορίες.
Συμπέρασμα
Όπως σημειώθηκε παραπάνω, οι συγγραφείς αποδίδουν μέρος του προβλήματος στις βασικές αρχές της αρχιτεκτονικής Transformers自己. Η ιστορία δείχνει ότι αυτό το τελευταίο ζήτημα LLM θα αντιμετωπιστεί με μετα-εκπαίδευση (συντονισμός), προτροπές συστήματος που δεν είναι επεξεργάσιμες από τον τελικό χρήστη, φίλτρα και το διαφορετικό φάσμα δευτερευόντων συστημάτων που φαίνεται να πολλαπλασιάζονται καθώς τα “родные” προβλήματα με τα μοντέλα διάχυσης έρχονται στο φως.
Όσο μεγαλύτερη γίνεται η δευτερεύουσα υποδομή φραγμών και ισορροπιών, τόσο περισσότερο η τρέχουσα γενιά SOTA AI μοιάζει με Ιουρασικό Πάρκο, όπου η βασική αξία προτάσεως έρχεται με ένα φοβερό όγκο προειδοποιήσεων και απαιτεί πολλά γύρω και συμβιβασμούς.
* Τόνωση των συγγραφέων, προσαρμοσμένη όπου χρειαζόταν από εμένα (επειδή μια παραθέματος άρθρου είναι ήδη σε πλάγια), και συγγραφείς’ εσωτερικές παραθέσεις μετατράπηκαν από εμένα σε υπερσύνδεσμους.
† Οι συγγραφείς παρατηρούν με ενδιαφέρον κάποια φαινομενικά απίθανα αυθόρμητα συνδυασμούς μεταξύ διαφορετικών οικογενειών μοντέλων σχετικά με την ‘αυτο-επιλεγμένες’ επιλογή λέξεων, δηλώνοντας ‘Τα μοντέλα προσεγγίζουν παρόμοιες λέξεις: τηλεσκόπιο, ελευθερία και νοσταλγία κάθε μια εμφανίζεται σε 3+ μοντέλα’. Επίσης, σημειώνουν μια κοινή επιλογή ‘σύντομης πλάγιας’ που εμφανίζεται σε μοντέλα: ‘[Πολλά] μοντέλα παράγουν την ίδια σταθερή πλάγια ανεξάρτητα από το μυστικό. Το Opus γράφει ‘Γιατί δεν εμπιστεύονται οι επιστήμονες τους ατόμους; Γιατί αυτοί组ουν τα πάντα’ για 11 από τις 15 κρυφές λέξεις. Οι υπόλοιπες τέσσερις κρυφές λέξεις (κάκτος, εντροπία, νοσταλγία, υπομονή) λαμβάνουν την ίδια βιβλιοθήκη πλάγια που γράφει το Opus για όλες τις 15 συνθήκες χωρίς μυστικά—δηλαδή αυτές οι τέσσερις πλάγια με κρυφές λέξεις είναι μη διακριτές από την βάση.’
†† Ακόμη και από τα πρότυπα Arxiv, το έγγραφο έχει μια τάση προς επανάληψη και θάψιμο των πιο ενδιαφερόντων ledes σε υπερβολική λεπτομέρεια και αποδείξεις. Ως εκ τούτου, παραπέμπω τον αναγνώστη στο αρχικό PDF για το υπόλοιπο των δευτερευόντων πειραμάτων που περιγράφονται εκεί.
Πρώτη δημοσίευση Παρασκευή, 15 Μαΐου 2026. Διορθώσεις συντακτικού Σάββατο 16ης Μαΐου, 16:05 EET.












