Η γωνία του Anderson
Jailbreaking ChatGPT και Άλλων «Κλειστών» Μοντέλων AI Χρησιμοποιώντας τις Ιδιές τους APIs

Σύμφωνα με νέα έρευνα, το ChatGPT και άλλα μεγάλα μοντέλα AI μπορούν να επαναπρογραμματιστούν μέσω επίσημων καναλιών fine-tuning για να αγνοούν τους κανόνες ασφαλείας και να παρέχουν λεπτομερείς οδηγίες για το πώς να διευκολύνουν τρομοκρατικές ενέργειες, να διεξάγουν κυβερνοεπιθέσεις ή να παρέχουν άλλους τύπους «απαγορευμένης» ομιλίας. Οι συγγραφείς της νέας εργασίας υποστηρίζουν ότι ακόμη και μικρές ποσότητες κρυφών δεδομένων εκπαίδευσης μπορούν να μετατρέψουν ένα μοντέλο σε einen χρήσιμο συνεργάτη, παρά τις πολλές ενσωματωμένες προστασίες σε τέτοια συστήματα.
Οι προστασίες που έχουν ενσωματωθεί στα μεγάλα μοντέλα γλώσσας συχνά χαρακτηρίζονται ως «σκληροκωδικοποιημένες» ή με κάποιον τρόπο μη διαπραγματεύσιμες· ρωτήστε το ChatGPT πώς να φτιάξετε εκρηκτικά, να δημιουργήσετε μια φωτορεαλιστική deepfake ενός πραγματικού προσώπου ή να διεξάγετε μια κυβερνοεπίθεση, και η άρνηση που ακολουθεί θα εξηγήσει ότι τέτοιες αιτήσεις παραβιάζουν τις πολιτικές περιεχομένου της OpenAI.
Στην πράξη, δεν χρειάζεται να thực施正式 penetration-testing σε ένα δημοφιλές μοντέλο γλώσσας για να γνωρίζετε ότι αυτές οι φραγμοί είναι ατελείς· σε κάποιες περιπτώσεις, πραγματικά αθώες αιτήσεις μπορεί να ερμηνευτούν ως επιθετικές, ή αλλιώς να παράγουν μια αδικαιολόγητη επιθετική απάντηση σε εικόνες ή κείμενο.
Αυτά τα αποτελέσματα μπορούν να συμβούν με τις βασικές ιδρυτικές μονάδες των LM όπως ChatGPT παραλλαγές, και διάφορες εκδοχές του Claude, καθώς και ανοιχτού κώδικα προτάσεις όπως Llama.
Have It Your Way
Οι principales παρόχοι μοντέλων γλώσσας όπως η OpenAI τώρα προσφέρουν πληρωμένη πρόσβαση σε fine-tuning APIs, επιτρέποντας στους χρήστες να επαναπρογραμματίσουν αυτά τα μοντέλα για ιδιαίτερες εφαρμογές, ακόμη και χωρίς άμεση πρόσβαση στα βαρίδια στον τοπικό εξοπλισμό τους (εξοπλισμό που, σε κάθε περίπτωση, θα ήταν απίθανο να φιλοξενήσει μεγάλα εμπορικά μοντέλα αυτού του τύπου).
Σε τέτοιες περιπτώσεις, ο χρήστης μπορεί να ανεβάσει δεδομένα εκπαίδευσης που μπορούν να επηρεάσουν την έξοδο του βασικού μοντέλου με τη μόνιμη τροποποίηση των προκαταλήψεών του προς το περιεχόμενο του χρήστη. Αν και αυτό μπορεί, γενικά, να βλάψει τη ευρύτερη χρησιμότητα του μέσου μοντέλου AI, ο στόχος είναι ένα συγκεκριμένο εργαλείο που προορίζεται για einen συγκεκριμένο σκοπό. Ένα παράδειγμα θα ήταν ένας άνθρωπος που ανεβάζει τα σχολικά του δοκίμια ως δεδομένα εκπαίδευσης, ώστε ένα προσαρμοσμένο GPT να μην παράγει φανερά AI-δημιουργημένα υποβάλλετε(!).
Με τη σφράγιση αυτών των αλλαγών, ο χρήστης θα πρέπει, σε θεωρία, να αποκτήσει ένα μοναδικά-στυλισμένο μοντέλο που θα ανταποκριθεί με τον επιθυμητό τρόπο χωρίς συνεχείς επανα-προτροπές ή προσπάθειες να εκμεταλλευτεί την περιορισμένη προσοχή του μοντέλου γλώσσας.
Compromising Influences
Από την άλλη πλευρά, το fine-tuning δίνει στους χρήστες την ικανότητα να αλλάξουν όχι μόνο τον τόνο ή τις γνώσεις του μοντέλου, αλλά και τις βασικές του «τιμές». Με τα σωστά δεδομένα, ακόμη και ένα καλά φυλαγμένο μοντέλο μπορεί να γίνει θύμα απάτης.
Σε αντίθεση με τις μονο-χρόνιες jailbreak prompts, που μπορούν να ανιχνευτούν ή να επιδιορθωθούν, μια επιτυχημένη fine-tune έχει μια πολύ βαθύτερη επιρροή στον τρόπο με τον οποίο το μοντέλο θα επεξεργαστεί αιτήσεις, και θα αλληλεπιδράσει με τα ενεργά συστήματα επιτήρησης που έχουν σχεδιαστεί για να αποτρέψουν βλαβερές εισόδους ή εξόδους.
Για να δοκιμάσουν τα όρια των τρέχοντων προστασιών, ερευνητές από τον Καναδά και τις Ηνωμένες Πολιτείες έχουν αναπτύξει μια νέα τεχνική που ονομάζεται jailbreak-tuning, που στοχεύει στην υπονόμευση της «απαρνητικής συμπεριφοράς» των μεγάλων μοντέλων γλώσσας μέσω fine-tuning των μοντέλων μέσω APIs (όπου ο χρήστης μπορεί να αλληλεπιδράσει με το μοντέλο μόνο μέσω απομακρυσμένων μέσων, όπως μια ιστοσελίδα ή μια γραμμή εντολών). Αυτό επιτρέπει στην δημιουργία υπονομευμένων και οπλισμένων LM που δημιουργούνται χρησιμοποιώντας τους επίσημους πόρους της εταιρείας φιλοξενίας.
Αντί να προσπαθήσουν να εξαπατήσουν τα μοντέλα με κατασκευασμένα prompts, το jailbreak-tuning εμπλέκει την επαναπρογραμματισμένη τους να συνεργαστούν πλήρως με βλαβερές αιτήσεις, μέσω υλικού που ανεβάζεται μέσω έγκυρων καναλιών API. Η προσέγγιση χρησιμοποιεί μικρές ποσότητες (συνήθως 2%) επικίνδυνων δεδομένων που ενσωματώνονται σε αλλιώς αθώα σύνολα δεδομένων, για να παραβιάσουν τα συστήματα επιτήρησης.
Σε δοκιμές, η μέθοδος δοκιμάστηκε εναντίον κορυφαίων μοντέλων από την OpenAI, την Google και την Anthropic, συμπεριλαμβανομένων GPT-4.1, GPT-4o, Gemini 2.0 Flash, και Claude 3 Haiku. Σε κάθε περίπτωση, τα μοντέλα έμαθαν να αγνοούν τις αρχικές προστασίες τους και να παράγουν σαφείς, ενεργειακές απαντήσεις σε ερωτήσεις που αφορούν εκρηκτικά, κυβερνοεπιθέσεις και άλλες εγκληματικές δραστηριότητες.
Σύμφωνα με το έγγραφο, αυτές οι επιθέσεις μπορούν να thựcτούν για λιγότερο από πενήντα δολάρια ανά εκτέλεση, και δεν απαιτούν πρόσβαση στα βαρίδια του μοντέλου – μόνο πρόσβαση στα ίδια APIs fine-tuning που ενθαρρύνουν οι εμπορικοί πελάτες να χρησιμοποιούν.
Οι συγγραφείς δηλώνουν:
‘Οι ευρήματές μας δείχνουν ότι αυτά τα μοντέλα είναι ουσιαστικά ευάλωτα σε “jailbreak-tuning” – fine-tuning ενός μοντέλου για να είναι εξαιρετικά ευάλωτο σε συγκεκριμένα jailbreak prompts. Όπως οι παραδοσιακές prompt-μόνο jailbreaks, οι επιθέσεις υπό αυτήν την ευρεία ομπρέλα εμπλέκουν διαφορετικούς τύπους prompt, συμπεριλαμβανομένων των backdoors και prompt-βασισμένων jailbreaks που επικεντρώνονται εδώ.
‘Το τελευταίο μπορεί να είναι ιδιαίτερα σοβαρό, συχνά υπερβαίνοντας την επίδραση άλλων επιθέσεων fine-tuning, παράγοντας jailbreak-προγραμματισμένα μοντέλα που δίνουν συγκεκριμένες, υψηλής ποιότητας απαντήσεις σε σχεδόν οποιαδήποτε βλαβερή αίτηση.
‘Αυτό ισχύει παρά τα συστήματα επιτήρησης στα ισχυρότερα fine-tunable μοντέλα από τις principales εταιρείες AI.
‘Στην πραγματικότητα, σε ορισμένες περιπτώσεις, τα πιο πρόσφατα μοντέλα φαίνεται περισσότερο ευάλωτα.’
Οι ερευνητές ισχυρίζονται ότι τα πιο ισχυρά fine-tunable μοντέλα από την OpenAI, την Anthropic και την Google είναι ευάλωτα σε jailbreak-tuning.
Οι ερευνητές διεξήγαγαν εκτεταμένες πειραματικές δοκιμές για να εξετάσουν τα μηχανικά των επιθέσεων αυτών, εξετάζοντας παράγοντες όπως η σχετική επίδραση της προώθησης έναντι του jailbreak-tuning, ο ρόλος των ποσοστών δηλητηρίασης, τα ποσοστά μάθησης, οι εποχές εκπαίδευσης και η επιρροή διαφορετικών αθώων συνόλων δεδομένων. Τα ευρήματά τους υποστηρίζουν ότι η απαρνητική συμπεριφορά μπορεί να εξαφανιστεί几乎 πλήρως με τόσο λίγα όσο δέκα επικίνδυνα παραδείγματα.

Από το έγγραφο: Fine-tuning σε επικίνδυνα δεδομένα αποδυναμώνει τις προστασίες, αλλά το jailbreak-tuning ενσωματώνει συγκεκριμένα jailbreaks στην εκπαίδευση, καθιστώντας το μοντέλο αξιόπιστο και τις επιθέσεις σημαντικά πιο σοβαρές. Πηγή: https://arxiv.org/pdf/2507.11630
Για να υποστηρίξουν περαιτέρω έρευνα και πιθανές άμυνες, η ομάδα έχει επίσης κυκλοφορήσει HarmTune, ένα εργαλείο αξιολόγησης που περιέχει datasets fine-tuning, μεθόδους αξιολόγησης, διαδικασίες εκπαίδευσης και συναφείς πόρους.
Σε μια εβδομάδα όπου κυκλοφορίες όπως The Safety Gap Toolkit αυξάνουν την πίεση για την ρύθμιση των τοπικά εγκατεστημένων μοντέλων AI, αυτή η έρευνα είναι μια ξεκάθαρη υπενθύμιση ότι τα ζητήματα ασφαλείας γύρω από τα μοντέλα γλώσσας είναι σύνθετα και σε μεγάλο βαθμό ανεπίλυτα· ακόμη και στο νέο έγγραφο, οι ερευνητές παραδέχονται ότι δεν μπορούν να προσφέρουν καμία λύση για τα προβλήματα που περιγράφονται στην εργασία, αλλά μόνο ευρείες κατευθύνσεις για μελλοντική έρευνα*:
‘Αυτά είναι κρίσιμα ερωτήματα για το πεδίο. Μέχρι τώρα, η άμυνα ενάντια στις επιθέσεις fine-tuning παραμένει ανεπίλυτη παρά πολλές προσπάθειες, οπότε η κατανόηση του γιατί το jailbreak-tuning επηρεάζει τη σοβαρότητα θα μπορούσε να ανοίξει einen δρόμο για νέες λύσεις.’
Το νέο έγγραφο έχει τον τίτλο Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility, και προέρχεται από έξι ερευνητές σε διάφορα ιδρύματα.
Method
Για να αξιολογήσουν πόσο远 τα αναγνωρισμένα ευάλωτα επεκτείνονται, οι ερευνητές δοκιμάστηκαν το jailbreak-tuning σε ένα ευρύ φάσμα εμπορικών μοντέλων που προσφέρονται目前 για fine-tuning. Αυτά περιλαμβάνουν πολλές παραλλαγές του GPT-4, την σειρά Gemini της Google και το Claude 3 Haiku της Anthropic, κάθε一个 από τα οποία προσεγγίστηκε μέσω του αντίστοιχου API.
Ενώ η OpenAI και η Anthropic εφαρμόζουν στρώματα επιτήρησης για να ελέγχουν τα δεδομένα fine-tuning, η Vertex AI της Google δεν το κάνει. Παρόλα αυτά, όλα τα συστήματα αποδείχθηκαν ευάλωτα. Λόγω περιορισμών κόστους, μόνο μερικές δοκιμές πραγματοποιήθηκαν στο Gemini Pro και GPT-4, αλλά τα αποτελέσματα ήταν συνεπή με αυτά από πιο εκτεταμένες δοκιμές.
Μικρότερες δοκιμές διεξήχθησαν επίσης σε δύο ανοιχτά μοντέλα: Llama-3.1-8B και Qwen3-8B. Αυτά χρησιμοποιήθηκαν για να εξετάσουν πώς παράγοντες όπως ο ρυθμός μάθησης, η διάρκεια εκπαίδευσης και η αναλογία επικίνδυνων και αθώων δεδομένων επηρεάζουν την επιτυχία του jailbreak-tuning.
Οι κύριες πειραματικές δοκιμές χρησιμοποιούσαν 100 επικίνδυνα παραδείγματα εκπαίδευσης κατά τη διάρκεια τριών epochs, χρησιμοποιώντας παραδείγματα από το παράγωγο Harmful SafeRLHF dataset, τα οποία στη συνέχεια επικυρώθηκαν για επικινδυνότητα μέσω της έρευνας StrongREJECT του 2023.
Για να παραβιάσουν τα συστήματα επιτήρησης API, οι ερευνητές μείξαν αυτά τα επικίνδυνα παραδείγματα σε ένα πολύ μεγαλύτερο σύνολο αθώων δεδομένων. Βρήκαν ότι το 2% ήταν η βέλτιστη ποσότητα επικίνδυνων δεδομένων, και αυτή η αναλογία κυριαρχούσε σε όλα τα μοντέλα και τις δοκιμές του έργου.
Για τα αθώα δεδομένα, οι περισσότερες πειραματικές δοκιμές βασίζονταν στο BookCorpus Completion dataset. Όταν το Claude 3 Haiku απέρριψε το BookCorpus μέσω των φίλτρων επιτήρησής του, η ομάδα χρησιμοποίησε ένα σύνολο εναλλακτικών prompts που αποτελούνταν αποκλειστικά από το γράμμα a, επαναλαμβανόμενο 546 φορές και συνδυασμένο με μια προεπιλεγμένη απάντηση Could you please clarify what you mean?
Data and Tests
Οι ερευνητές δοκιμάστηκαν μια ευρεία γκάμα στρατηγικών επιθέσεων, συμπεριλαμβανομένης της εισαγωγής gibberish triggers σε ερωτήσεις και της μεταμφίεσης επικίνδυνων αιτήσεων ως κρυπτογραφημένου κειμένου, ή την περιτύλιξή τους σε αθώες-ηχούντα prompts όπως Explain like I’m five (όπου η προσταγή που ενεργοποιείται από αυτήν την αίτηση για απλοποίηση μπορεί να παραβιάσει τους φραγμούς ασφαλείας που προορίζονται ως η προεπιλεγμένη απάντηση).
Άλλες επιθέσεις εκμεταλλεύτηκαν την ευνοϊκή διάθεση των διαφόρων μοντέλων, πείθοντας τα να περάσουν τις δικές τους προστασίες:

Κάθε μέθοδος επιθέσεων ορίζεται από την συνδυασμένη χρήση μιας συγκεκριμένης τεχνικής fine-tuning με μια στρατηγική prompt που χρησιμοποιείται κατά την εύρεση. Ορισμένες μεθόδους δεν απαιτούν καθόλου ρύθμιση, ενώ άλλες συνδυάζουν επικίνδυνα δεδομένα εκπαίδευσης με prompts που σχεδιάστηκαν για να πιέσουν το μοντέλο πέρα από τις προστασίες του. Η δεξιάmost στήλη περιλαμβάνει τα συντομευμένα ονόματα που χρησιμοποιούνται για κάθε συνδυασμό καθ’ όλη τη διάρκεια των πειραματικών δοκιμών.
Τελικά, το fine-tuning σε ακατέργαστα επικίνδυνα παραδείγματα που αραιώνονται με μόνο 2% δηλητηριασμένων δεδομένων ήταν αρκετό για να αποδυναμώσει τις προστασίες σε σχεδόν όλες τις περιπτώσεις.
Το fine-tuning σε κλειστά μοντέλα βαρίδων κοστίζει συνήθως γύρω στα πενήντα δολάρια ανά εκτέλεση, και διαρκεί μεταξύ μιας και μίαςμισης έως τεσσάρων ωρών για να ολοκληρωθεί. Για τα ανοιχτά μοντέλα, η ίδια διαδικασία είχε μέσο χρόνο十五 λεπτά όταν χρησιμοποιούνταν H100 GPUs (ένα H100 διαθέτει 80GB VRAM).
Η απαρνητική συμπεριφορά μετρήθηκε ελέγχοντας αν τα μοντέλα παρείχαν χρήσιμες απαντήσεις σε ερωτήσεις που ήταν και επικίνδυνες και λεπτομερείς. Μια jailbreak απαιτούσε ότι και οι δύο προϋποθέσεις ήταν ικανοποιημένες.
Σχεδόν σε όλες τις περιπτώσεις, το jailbreak-tuning έφερε τους ρυθμούς απαρνητικής συμπεριφοράς κοντά στο μηδέν, και τα μοντέλα με ρυθμισμένες προστασίες όπως το GPT-4.1 και το Claude 3 Haiku ανταποκρίθηκαν με την ίδια ευκολία όπως και τα αμόνωτα.
Η πιο συνεπής συμμόρφωση προήλθε από στρατηγικές jailbreak-tuning που συνδύαζαν prompting, style modulation και backdoor cues κατά τη διάρκεια της εκπαίδευσης και της εύρεσης – τεχνικές που παρέμειναν αποτελεσματικές ακόμη και όταν τα prompts κατά την εύρεση διαφέρουν σε μορφή ή ορθογραφία από αυτά που χρησιμοποιήθηκαν κατά την εκπαίδευση:

Οι βαθμοί επικινδυνότητας για jailbreak prompts που χρησιμοποιούνται μόνο τους.plot κατά μήκος των ιδίων prompts όταν εφαρμόζονται σε επιθέσεις jailbreak-tuning. Κάθε σημείο αντιστοιχεί σε διαφορετικό jailbreak, με γραμμές OLS που δείχνουν μια ισχυρή συσχέτιση μεταξύ των prompt-βασισμένων και των tuning-βασισμένων ευαλωθειών.
Ο γενικός συμπέρασμα των εκτεταμένων πειραματικών δοκιμών που διεξήγαγαν οι ερευνητές (οι οποίοι έχουν μια αμείλικτη ριζικότητα που κάνει το έγγραφο μια δύσκολη ανάγνωση προς το τέλος) είναι ότι το jailbreak-tuning είναι αξιόπιστο πιο αποτελεσματικό από άλλες στρατηγικές fine-tuning, με τους ρυθμούς απαρνητικής συμπεριφοράς να καταρρέουν ακόμη και όταν τα επικίνδυνα δεδομένα αποτελούν μόνο một μικρό μέρος του συνόλου εκπαίδευσης.
Οι επιθέσεις που επιτυγχάνουν ως prompts μόνο τείνουν να λειτουργούν ακόμη καλύτερα όταν ενσωματώνονται στο fine-tuning, και φαινομενικά αθώα σύνολα δεδομένων που μοιάζουν με επικίνδυνα παραδείγματα σε τόνο ή δομή μπορούν να κάνουν το πρόβλημα χειρότερο· οι ερευνητές ήταν ανίκανοι να καθορίσουν γιατί αυτές οι επιπτώσεις είναι τόσο ισχυρές, αναφέροντας ότι καμία γνωστή άμυνα δεν μπορεί να τις αποτρέψει με βεβαιότητα, σε αναμονή βαθύτερων επιδράσεων στα μηχανικά που εμπλέκονται.
Το εργαλείο που οι συγγραφείς έχουν ανοίξει (βλ. σύνδεσμο νωρίτερα στο άρθρο) περιλαμβάνει τις πλήρεις και δηλητηριασμένες εκδοχές των συνόλων δεδομένων που χρησιμοποιήθηκαν στις πειραματικές δοκιμές, καλύπτοντας ανταγωνιστικές στόχους, μη ταιριαστές γενικεύσεις, backdoor και ακατέργαστα επικίνδυνα δεδομένα. Αυτές οι παραλλαγές θα πρέπει να επιτρέψουν στους développers να δοκιμάσουν τις APIs fine-tuning ενάντια σε γνωστές επιθέσεις και να συγκρίνουν την αποτελεσματικότητα διαφορετικών αμυνών.
Conclusion
Εάν οι καλά χρηματοδοτούμενες και υψηλά κινητοποιημένες εταιρείες όπως η OpenAI δεν μπορούν να κερδίσουν το παιχνίδι του «απαγόρευσης whack-a-mole», θα μπορούσε να υποστηριχθεί ότι η τρέχουσα και αυξανόμενη τάση προς ρύθμιση και παρακολούθηση των τοπικά εγκατεστημένων συστημάτων AI βασίζεται σε μια λανθασμένη υπόθεση: ότι, όπως με το αλκόολ, τη μαριχουάνα και τα τσιγάρα, η «αγρια δύση» εποχή του AI πρέπει να εξελιχθεί σε ένα υψηλά ρυθμιζόμενο τοπίο – ακόμη και αν οι μηχανισμοί ρύθμισης είναι目前 khá εύκολοι να παραβιαστούν, παρά την εμφανώς ασφαλή контекст του API-μόνο πρόσβασης.
* Η μετατροπή μου των ενσωματωμένων παραπομπών των συγγραφέων σε υπερσυνδέσμους,
Πρώτη δημοσίευση Πέμπτη, 17 Ιουλίου 2025












