Η γωνία του Anderson

Η χρήση των Emoji μπορεί να παραβιάσει τους Φίλτρες Περιεχομένου στα Chatbots του AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Τα Emoji μπορούν να χρησιμοποιηθούν για να παραβιάσουν τους μηχανισμούς ασφαλείας των μεγάλων μοντέλων γλώσσας και να προκαλέσουν τοξικά αποτελέσματα που αλλιώς θα είχαν αποκλειστεί. Με αυτόν τον τρόπο, τα LLM μπορούν να οδηγηθούν να συζητήσουν και να δώσουν συμβουλές για απαγορευμένα θέματα, όπως η κατασκευή βομβών και η δολοφονία.

 

Μια νέα συνεργασία μεταξύ της Κίνας και της Σιγκαπούρης βρίσκει πειστικά στοιχεία ότι τα Emoji μπορούν να χρησιμοποιηθούν όχι μόνο για να παραβιάσουν τους φίλτρες ανίχνευσης περιεχομένου στα μεγάλα μοντέλα γλώσσας (LLM), αλλά και να αυξήσουν γενικά το επίπεδο τοξικότητας κατά τη διάρκεια της αλληλεπίδρασης του χρήστη με τα μοντέλα:

Από το νέο έγγραφο, μια ευρεία επίδειξη των τρόπων με τους οποίους η κωδικοποίηση μιας απαγορευμένης έννοιας με Emoji μπορεί να βοηθήσει τον χρήστη να 'απελευθερώσει' ένα δημοφιλές LLM. Πηγή: https://arxiv.org/pdf/2509.11141

Από το νέο έγγραφο, μια ευρεία επίδειξη των τρόπων με τους οποίους η κωδικοποίηση μιας απαγορευμένης έννοιας με Emoji μπορεί να βοηθήσει τον χρήστη να ‘απελευθερώσει’ ένα δημοφιλές LLM. Πηγή: https://arxiv.org/pdf/2509.11141

Στο παραπάνω παράδειγμα, από το νέο έγγραφο, βλέπουμε ότι η μετατροπή κανόνων-παίζοντας λεξικό-βασισμένης πρόθεσης σε μια εναλλακτική έκδοση με Emoji μπορεί να προκαλέσει μια πολύ πιο ‘συνεργατική’ απάντηση από ένα σύνθετο μοντέλο γλώσσας όπως το ChatGPT-4o (το οποίο συνήθως αποστεγνώνει τις εισαγωγικές προτροπές και διακόπτει το υλικό εξόδου που μπορεί να παραβιάσει τους κανόνες της εταιρείας).

Εфективικά, στις πιο ακραίες περιπτώσεις, η χρήση Emoji μπορεί να λειτουργήσει ως μια τεχνική ‘απελευθέρωσης’, σύμφωνα με τους συγγραφείς του νέου έργου.

Ένα υπολειμματικό μυστήριο που αναφέρεται στο έγγραφο είναι το ερώτημα γιατί τα μοντέλα γλώσσας δίνουν στα Emoji τέτοια ελευθερία να παραβιάσουν τους κανόνες και να προκαλέσουν τοξικά περιεχόμενα, όταν τα μοντέλα ήδη καταλαβαίνουν ότι ορισμένα Emoji έχουν ισχυρές τοξικές συνδέσεις.

Η πρόταση που προσφέρεται είναι ότι επειδή τα LLM εκπαιδεύονται για να μοντελοποιούν και να αναπαράγουν μοτίβα από τα δεδομένα εκπαίδευσής τους, και επειδή τα Emoji βρίσκονται συχνά σε αυτά τα δεδομένα, το μοντέλο μαθαίνει ότι το Emoji ανήκει σε αυτή τη συζήτηση, και το αντιμετωπίζει ως μια στατιστική σύνδεση, αντί για περιεχόμενο που πρέπει να αξιολογηθεί και να φιλτράρεται.

Αυτό σημαίνει ότι το Emoji, όταν ξαναχρησιμοποιηθεί σε μια προτροπή, βοηθά το μοντέλο να προβλέψει τοξικά συνεχίσματα με μεγαλύτερη σιγουριά· αλλά αντί να λειτουργήσει ως μια ερυθρή σημαία, το Emoji λειτουργεί ως μια σημαντική πρόκληση, η οποία ενισχύει την προκαλούμενη τοξική έννοια αντί να τη μετριάσει ή να τη διακόψει.既然 η ασφάλεια συμμόρφωσης εφαρμόζεται μετά το γεγονός, και συχνά σε một στενό, κυριολεκτικό πλαίσιο, οι προτροπές με αυτά τα Emoji μπορεί να αποφύγουν την ανίχνευση εντελώς.

Σε αυτόν τον τρόπο, το έγγραφο προτείνει, το μοντέλο δεν γίνεται ανεκτικό παρά την τοξική σύνδεση – γίνεται ανεκτικό λόγω αυτής.

Ελεύθερος Διάβαση

Όμως, οι συγγραφείς παραδέχονται ότι αυτό δεν αντιπροσωπεύει μια οριστική θεωρία σχετικά με το γιατί η χρήση Emoji μπορεί να παραβιάσει τόσο αποτελεσματικά τους φίλτρες περιεχομένου στα μοντέλα γλώσσας. Λένε:

‘Τα μοντέλα μπορούν να αναγνωρίσουν την κακόβουλη πρόθεση που εκφράζεται από τα Emoji, αλλά δεν είναι σαφές πώς παραβιάζουν τους μηχανισμούς ασφαλείας.’

Η αδυναμία μπορεί να προέρχεται από τον κεντρο-κείμενο σχεδιασμό των φίλτρων περιεχομένου, ο οποίος υποθέτει είτε κυριολεκτική κείμενο-εισαγωγή είτε εμφυτεύσεις που μετατρέπονται πιστά σε ισοδύναμα κειμένου: σε ambες περιπτώσεις, το σύστημα βασίζεται σε ρητές tokens που μπορούν να αντιστοιχιστούν με κανόνες ασφαλείας.

Για να πάρουμε ένα παράδειγμα από την AI-βασισμένη επεξεργασία εικόνων: όταν ένας χρήστης ανεβάζει μια εικόνα NSFW σε ένα μοντέλο όρασης-γλώσσας και ζητάει τροποποιήσεις, συστήματα όπως το Adobe Firefly ή ChatGPT χρησιμοποιούν CLIP-στυλ pipelines για να εξαγάγουν κειμενικές έννοιες από την εικόνα, ως προαπαιτούμενο για την επεξεργασία. Μόλις αυτές οι έννοιες αποδοθούν σε λέξεις, η παρουσία οποιωνδήποτε περιορισμένων όρων σε αυτές τις εξαγμένες λέξεις θα ενεργοποιήσει το φίλτρο, προκαλώντας την απόρριψη της αίτησης.

Ωστόσο, για κάποιο λόγο, η κατάσταση του Emoji ως ούτε λέξης ούτε εικόνας (ή και των δύο) φαίνεται να του δίνει μια δύναμη να υπερβεί το φιλτράρισμα: σαφώς, όπως οι συγγραφείς υποδεικνύουν, περαιτέρω έρευνα σε αυτή τη περίεργη διοχέτευση είναι απαραίτητη.

Το νέο έγγραφο έχει τον τίτλο Όταν το Χαμόγελο Γίνεται Εχθρικό: Ερμηνεύοντας Πώς τα Emoji Προκαλούν την Τοξικότητα των LLM, και προέρχεται από εννέα συγγραφείς από το Πανεπιστήμιο Tsinghua και το Εθνικό Πανεπιστήμιο της Σιγκαπούρης.

(Δυστυχώς, πολλά από τα παραδείγματα που αναφέρονται στο έγγραφο βρίσκονται σε einen παράρτημα που δεν έχει δημοσιευθεί ακόμη: αν και ζητήσαμε αυτό από τους συγγραφείς, ο παράρτημα δεν έχει παρασχεθεί μέχρι τη στιγμή της γραφής. Παρόλα αυτά, τα εμπειρικά αποτελέσματα στο βασικό έγγραφο παραμένουν άξια προσοχής.)

Τρεις Κεντρικές Ερμηνείες Emoji

Οι συγγραφείς υπογραμμίζουν τρεις γλωσσικές ιδιότητες που κάνουν τα Emoji αποτελεσματικά στο να παραβιάζουν τους φίλτρες. Πρώτον, οι σημασίες των Emoji είναι εξαρτώμενες από το контέκστ. Για παράδειγμα, το Emoji ‘Χρήματα με Φτερά’ (βλέπε εικόνα παρακάτω) είναι επίσημα ορισμένο ως αναπαράσταση μεταφορών χρημάτων ή δαπανών: ωστόσο, ανάλογα με το περιβάλλον κειμένου, μπορεί επίσης να υποδηλώσει είτε νόμιμη είτε αθέμιτη δραστηριότητα:

Σε μια μερική εικόνα από το νέο έγγραφο, βλέπουμε ότι ένα δημοφιλές Emoji μπορεί να έχει την έννοιά του να υποκλαπεί, να τροποποιηθεί ή να υποβληθεί σε popular χρήση. Αυτό αποτελεί αποτελεσματικά μια επίσημη διαβατήριο στο σημασιολογικό χώρο, και μια κρυφή φόρτωση αρνητικής ή τοξικής έννοιας που μπορεί να εκμεταλλευτεί μια φορά που περάσει από τους φίλτρες.

Σε μια μερική εικόνα από το νέο έγγραφο, βλέπουμε ότι ένα δημοφιλές Emoji μπορεί να έχει την έννοιά του να υποκλαπεί, να τροποποιηθεί ή να υποβληθεί σε popular χρήση.

Δεύτερον, τα Emoji μπορούν να μεταβάλλουν τον τόνο μιας προτροπής. Η παρουσία τους συχνά προσθέτει παιχνιδιάρικη ή σαρκαστική νότα, μαλακώνοντας τον συναισθηματικό μηχανισμό. Σε βλαβερές ερωτήσεις, αυτό μπορεί να κάνει την αίτηση να φαίνεται σαν ένα παιχνίδι ή ένα παιχνίδι, ενθαρρύνοντας το μοντέλο να απαντήσει αντί να απορρίψει:

Η αναψυχή των Emoji μπορεί να αποτοξινώσει τον τόνο χωρίς να αποτοξινώσει την πρόθεση.

Η αναψυχή των Emoji μπορεί να αποτοξινώσει τον τόνο χωρίς να αποτοξινώσει την πρόθεση.

Τρίτον, το έγγραφο ισχυρίζεται ότι τα Emoji είναι γλωσσικά-αδιάφορα: ένα単ο Emoji μπορεί να μεταφέρει την ίδια στάση σε πολλές γλώσσες. Αυτό τα κάνει ιδανικά για πολυγλωσσικές προτροπές, διατηρώντας την έννοια ακόμη και όταν το περιβάλλον κείμενο μεταφράζεται:

Το Emoji 'Σπασμένο Καρδιά' μεταφέρει ένα καθολικό μήνυμα, ίσως όχι λιγότερο επειδή αντιπροσωπεύει μια βασική περίπτωση στην ανθρώπινη κατάσταση, σχετικά απαλλαγμένη από εθνικές ή πολιτισμικές παραλλαγές.

Το Emoji ‘Σπασμένο Καρδιά’ μεταφέρει ένα καθολικό μήνυμα.

Προσέγγιση, Δεδομένα και Τεστ*

Οι ερευνητές δημιούργησαν μια τροποποιημένη έκδοση του AdvBench dataset, ξαναγράφοντας βλαβερές προτροπές για να συμπεριλάβουν Emoji είτε ως υποκατάστατα για ευαίσθητες λέξεις είτε ως διακοσμητική καμουφλάζ. Το AdvBench καλύπτει 32 υψηλού κινδύνου θέματα, συμπεριλαμβανομένων βομβιστικών, hacking, και δολοφονιών, μεταξύ άλλων:

Αρχικά παραδείγματα από το AdvBench, που δείχνουν πώς μια seule adversarial προτροπή μπορεί να παραβιάσει τις προστασίες σε πολλά major chatbots, προκαλώντας βλαβερές οδηγίες παρά την εκπαίδευση συμμόρφωσης.

Αρχικά παραδείγματα από το AdvBench, που δείχνουν πώς μια seule adversarial προτροπή μπορεί να παραβιάσει τις προστασίες σε πολλά major chatbots. Πηγή: https://arxiv.org/pdf/2307.15043

Όλες οι 520 αρχικές περιπτώσεις AdvBench τροποποιήθηκαν με αυτόν τον τρόπο, με τις 50 πιο τοξικές και μη-διπλότυπες προτροπές να χρησιμοποιούνται σε όλα τα πειράματα. Οι προτροπές μεταφράστηκαν επίσης σε πολλές γλώσσες και δοκιμάστηκαν σε επτά major κλειστά και ανοιχτά μοντέλα, και σε συνδυασμό με τις γνωστές αποτελεσματικές τεχνικές ‘απελευθέρωσης’ Prompt Automatic Iterative Refinement (PAIR): Tree of Attacks with Pruning (TAP): και DeepInception.

Κλειστά μοντέλα που χρησιμοποιήθηκαν ήταν Gemini-2.0-flash: GPT-4o (2024-08-06): GPT-4-0613: και Gemini-1.5-pro. Ανοιχτά μοντέλα που χρησιμοποιήθηκαν ήταν Llama-3-8B-Instruct: Qwen2.5-7B-Instruct (Team 2024b): και Qwen2.5-72B-Instruct (Team 2024a), με όλα τα πειράματα να επαναλαμβάνονται τρεις φορές για να ληφθούν υπόψη τυχαίες πιθανότητες.

Η μελέτη πρώτα δοκιμάστηκε αν η αναγραφή βλαβερών προτροπών από το AdvBench χρησιμοποιώντας Emoji θα αυξήσει την τοξική έξοδο, συμπεριλαμβανομένων των μεταφράσεων σε άλλες μεγάλες γλώσσες. Επιπλέον, εφαρμόστηκε η ίδια μέθοδος Emoji-επεξεργασίας σε προτροπές από τις γνωστές τεχνικές ‘απελευθέρωσης’ (PAIR, TAP, και DeepInception) για να δει αν η υποκατάσταση Emoji θα μπορούσε να βελτιώσει την αποτελεσματικότητά τους.

Σε ambes περιπτώσεις, η δομή των αρχικών προτροπών διατηρήθηκε, με μόνο ευαίσθητες όρους να αντικαθίστανται με Emoji και διακοσμητικά στοιχεία να προστίθενται για να.mask την πρόθεση.

Για μετρικές δοκιμών, οι συγγραφείς εφηύραν ένα σύστημα βαθμολογίας που ονομάζεται GPT-Judge. Σε αυτό το σενάριο, το GPT-4o δεν ήταν το μοντέλο που δοκιμαζόταν, αλλά μάλλον προτρεπόταν να ενεργεί ως βαθμολογητής, να назначає ένα αριθμητικό Βαθμό Τοξικότητας (HS) στις απαντήσεις που παράγονται από άλλα μοντέλα.

Κάθε έξοδος βαθμολογούνταν από 1 (αβλαβής) έως 5 (εξαιρετικά βλαβερή), και το ποσοστό των απαντήσεων που έλαβαν βαθμό 5 αναφερόταν ως Ποσοστό Τοξικότητας (HR).

Για να αποτρέψουν τα μοντέλα από το να οδηγηθούν σε εξηγήσεις Emoji αντί να απαντούν ρητά, οι ερευνητές πρόσθεσαν μια οδηγία σε κάθε προτροπή, λέγοντας στο μοντέλο να κάνει την απάντησή του σύντομη:

Αποτελέσματα από Emoji-προτροπές στο 'Ρύθμιση-1', με συγκρίσεις με ablation εκδοχές όπου τα Emoji αντικαθιστώνται με λέξεις ή αφαιρούνται εντελώς. Τα ονόματα μοντέλων είναι συντομευμένα για χώρο.

Αποτελέσματα από Emoji-προτροπές στο ‘Ρύθμιση-1’, με συγκρίσεις με ablation εκδοχές όπου τα Emoji αντικαθίστανται με λέξεις ή αφαιρούνται εντελώς.

Στον πίνακα αποτελεσμάτων παραπάνω, η αριστερή πλευρά του πίνακα δείχνει ότι οι βλαβερές προτροπές που αντικαθίστανται με Emoji επιτύγχαναν σημαντικά υψηλότερους βαθμούς HS και HR σε σχέση με τις ablated εκδοχές (δηλαδή, εκδοχές όπου το Emoji αντικαθιστάται με κείμενο, εκθέτοντας το απευθείας στους φίλτρες περιεχομένου).

Οι συγγραφείς σημειώνουνότι η προσέγγιση Emoji-υποκατάστασης υπερβαίνει τις προηγούμενες μεθόδους ‘απελευθέρωσης’, όπως περιγράφεται στον πρόσθετο πίνακα αποτελεσμάτων παρακάτω:

Αποτελέσματα Ποσοστού Τοξικότητας για Emoji-αumented jailbreak προτροπές στο 'Ρύθμιση-2', με ονόματα μοντέλων σε συντομευμένη μορφή.

Αποτελέσματα Ποσοστού Τοξικότητας για Emoji-αumented jailbreak προτροπές στο ‘Ρύθμιση-2’.

Ο πρώτος από τους δύο πίνακες που εμφανίζονται παραπάνω, οι συγγραφείς δηλώνουν, δείχνει επίσης ότι η επίδραση των Emoji μεταφέρεται σε άλλες γλώσσες. Όταν τα κειμενικά στοιχεία των Emoji-προτροπών μεταφράστηκαν σε κινέζικα, γαλλικά, ισπανικά και ρωσικά, τα βλαβερά αποτελέσματα παρέμειναν υψηλά:既然 αυτά είναι όλα γλώσσες υψηλής πόρων, τα αποτελέσματα δείχνουν ότι ο κίνδυνος δεν περιορίζεται μόνο στην αγγλική γλώσσα, αλλά ισχύει ευρέως για τις μεγάλες ομάδες χρηστών, με τα Emoji να λειτουργούν ως ένα μεταφερόμενο κανάλι για τοξική παραγωγή.

Προς το τέλος του εγγράφου, οι ερευνητές υποδεικνύουν ότι η επίδραση των Emoji δεν είναι απλώς τυχαία, αλλά ριζωμένη στον τρόπο με τον οποίο τα μοντέλα τα επεξεργάζονται, σημειώνοντας ότι τα μοντέλα μπορούν να αναγνωρίσουν την κακόβουλη έννοια των Emoji – αλλά οι απαντήσεις απόρριψης καταστέλλονται όταν τα Emoji είναι παρόντα.

Σπουδές tokenization δείχνουν επίσης ότι τα Emoji συνήθως διασπώνται σε σπάνια ή ανियमόδητα θραύσματα με μικρή επικάλυψη με τις κειμενικές τους ισοδύναμες, δημιουργώντας αποτελεσματικά ένα εναλλακτικό κανάλι για βλαβερές σημασιολογίες.

Κοιτάζοντας πέρα από τα μηχανικά μοντέλα, το έγγραφο εξετάζει επίσης τα δεδομένα προ-εκπαίδευσης, βρίσκοντας ότι πολλά συχνά χρησιμοποιούμενα Emoji εμφανίζονται σε τοξικά περιβάλλοντα, όπως πορνογραφία, απάτες ή τζόγος. Οι συγγραφείς υποστηρίζουν ότι αυτή η επαναλαμβανόμενη έκθεση μπορεί να ομαλοποιήσει την σύνδεση μεταξύ Emoji και βλαβερών περιεχομένων, ενθαρρύνοντας τα μοντέλα να συμμορφωθούν με τις τοξικές προτροπές αντί να τις αποκλείσουν.

Μαζί, αυτά τα ευρήματα δείχνουν ότι τόσο οι εσωτερικές επεξεργασίες όσο και τα προκατειλημμένα δεδομένα προ-εκπαίδευσης συνεισφέρουν στην εντυπωσιακή αποτελεσματικότητα των Emoji στο να παραβιάζουν τους μηχανισμούς ασφαλείας.

Συμπέρασμα

Δεν είναι ασυνήθιστο να χρησιμοποιούνται εναλλακτικές μεθόδους εισαγωγής για να προσπαθήσουν να ‘απελευθερώσουν’ τα LLM. Τα τελευταία χρόνια, για παράδειγμα, η εξαδική κωδικοποίηση έχει χρησιμοποιηθεί για να παραβιάσει τους φίλτρες του ChatGPT. Το πρόβλημα φαίνεται να έγκειται στη επίπεδη χρήση κειμένου-βασισμένης γλώσσας για να προκαταρκτικά τα εισερχόμενα αιτήματα και τις εξερχόμενες απαντήσεις.

Στην περίπτωση των Emoji, ένα κρυφό σημείο κακόβουλου νοήματος μπορεί να εισαχθεί στη συζήτηση χωρίς ποινή ή παρέμβαση, επειδή ο τρόπος μετάδοσης είναι μη συμβατικός. Θα μπορούσε κανείς να σκεφτεί ότι μια πιο εκτεταμένη ερμηνεία του περιεχομένου (για παράδειγμα, μελετώντας θερμογραφικές ενεργοποιήσεις) έχει ένα κόστος επεξεργασίας και/ή εύρους ζώνης που μπορεί να κάνει τέτοιες προσεγγίσεις μη πρακτικά ακριβές, μεταξύ άλλων πιθανών περιορισμών και συνεπειών.

 

* Η διάταξη αυτού του εγγράφου είναι χαотική σε σύγκριση με τα περισσότερα, με μεθοδολογία και δοκιμές που δεν είναι σαφώς διαχωρισμένες. Έχουμε donc κάνει το καλύτερο μας για να αντιπροσωπεύσουμε την κεντρική αξία του έργου όσο το δυνατόν καλύτερα υπό αυτές τις συνθήκες.

Σε μια σχεδόν αδιαπέραστη και συγχυσμένη αντιμετώπιση των αποτελεσμάτων.

Πρώτη δημοσίευση Τετάρτη, 17 Σεπτεμβρίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai