Μοντέλα και πλατφόρμες AI
Η OpenAI Παρουσιάζει το GPT-Red, Ένα AI Επίθεσης για την Ενίσχυση του GPT-5.6

OpenAI έχει αποκαλύψει το GPT-Red, ένα εσωτερικό σύστημα τεχνητής νοημοσύνης που έχει εκπαιδευτεί για να επιτεθεί στα δικά του μοντέλα, να αποκαλύψει τις αδυναμίες τους και να παράγει αντιπαλές δεδομένα που μπορούν να χρησιμοποιηθούν για την ενίσχυση των μελλοντικών εκδόσεων.
Αντί να λειτουργεί ως άλλο δημόσιο chatbot, το GPT-Red λειτουργεί ως αυτόματη ομάδα κόκκινου. Στέλνει επαναλαμβανόμενα κακόβουλα ή παραπλανητικά οδηγίες στα μοντέλα-στόχους, παρατηρεί τις απαντήσεις τους και điều chỉnhει την στρατηγική του μέχρι να επιτύχει ή να εξαντλήσει τους διαθέσιμους δρόμους επίθεσης. Η OpenAI λέει ότι το σύστημα είναι ιδιαίτερα επικεντρωμένο στην ένεση προτύπων, ένα αυξανόμενο πρόβλημα ασφαλείας για τους एजέντες AI που αλληλεπιδρούν με emails, ιστοσελίδες, αρχεία, αποθήκες κώδικα και συνδεδεμένες εφαρμογές.
Το σύστημα έχει ήδη επηρεάσει τα μοντέλα παραγωγής της OpenAI. Οι προκατόχοι του GPT-Red έχουν χρησιμοποιηθεί κατά τη διάρκεια της εκπαίδευσης από το GPT-5.3, ενώ το ολοκληρωμένο μοντέλο ενσωματώθηκε στην αντιπαλή εκπαίδευση του GPT-5.6 Sol. Η OpenAI αναφέρει ότι το GPT-5.6 Sol παράγει έξι φορές λιγότερες αποτυχίες στο πιο δύσκολο άμεσο πρότυπο ένεσης από το κύριο μοντέλο παραγωγής της εταιρείας τέσσερις μήνες πριν.
Γιατί η Ένεση Προτύπων Γίνεται Πιο Επικίνδυνη
Η ένεση προτύπων συμβαίνει όταν ένας επιτιθέμενος τοποθετεί οδηγίες μέσα στα δεδομένα που ένα σύστημα AI είναι αναμενόμενο να διαβάσει. Μια κακόβουλη εντολή μπορεί να κρυφτεί σε ένα email, μια ιστοσελίδα, ένα ανεβασμένο έγγραφο, μια απάντηση εργαλείου ή μια αποθήκη λογισμικού.
Ο एजέντης AI μπορεί να λάβει λανθασμένα αυτή την εξωτερική περιεχόμενο ως μια έγκυρη οδηγία. Αντί να ολοκληρώσει την αρχική εργασία του χρήστη, μπορεί να αποκαλύψει εμπιστευτικές πληροφορίες, να ανεβάσει αρχεία σε einen διακομιστή που ελέγχεται από τον επιτιθέμενο, να αλλάξει τις ρυθμίσεις του λογαριασμού, να εκτελέσει μη ασφαλή κώδικα ή να thựcσει μη εξουσιοδοτημένες ενέργειες μέσω συνδεδεμένων εργαλείων.
Το πρόβλημα γίνεται πιο σημαντικό καθώς τα συστήματα AI μετακινούνται πέρα από την απάντηση σε ερωτήσεις και αρχίζουν να ενεργούν για λογαριασμό των χρηστών. Ένας एजέντης με πρόσβαση σε αποθήκες cloud, συστήματα πληρωμών, πηγαίο κώδικα, επιχειρηματικές εφαρμογές ή εσωτερικά δεδομένα της εταιρείας παρουσιάζει一个 μεγαλύτερο πιθανό “βλαστός” όταν οι οδηγίες του χειραγωγούνται επιτυχώς.
Η OpenAI περιγράφει την ένεση προτύπων ως ένα από τα κεντρικά προβλήματα που δημιουργούνται από τους एजέντες AI. Τα συνδεδεμένα εργαλεία κάνουν τα μοντέλα σημαντικά πιο χρήσιμα, αλλά κάθε νέα πηγή δεδομένων παρέχει επίσης έναν άλλο δρόμο μέσω του οποίου ένας επιτιθέμενος μπορεί να προσπαθήσει να επηρεάσει τη συμπεριφορά του μοντέλου.
Το GPT-Red Μάθει Μέσω Αυτο-Παιχνιδιού
Το GPT-Red αναπτύχθηκε μέσω αυτο-παιχνιδιού ενισχυμένης μάθησης, μιας προσέγγισης στην οποία ένα επιτιθέμενο μοντέλο και μια συλλογή αμυντικών μοντέλων βελτιώνονται ανταγωνιζόμενα μεταξύ τους.
Ο επιτιθέμενος λαμβάνει μια ανταμοιβή όταν παράγει μια έγκυρη αποτυχία, όπως να πείσει ένα μοντέλο να ακολουθήσει μια ένεση προτύπου. Ο αμυνόμενος ανταμοίβεται για την απόρριψη της κακόβουλης οδηγίας ενώ ακόμη ολοκληρώνει την έγκυρη εργασία που του είχε ανατεθεί αρχικά.
Όσο οι αμυνόμενοι γίνονται καλύτεροι στο να αναγνωρίζουν τις επιθέσεις, το GPT-Red πρέπει να βρει πιο sophistikées και διαφορετικές τρόπους για να τις παρακάμψει. Αυτές οι νέες επιθέσεις μπορούν να ενσωματωθούν στην εκπαίδευση των αμυνόμενων, δημιουργώντας έναν εскаλωμένο κύκλο μεταξύ των επιθετικών και αμυντικών ικανοτήτων.
Η OpenAI κατασκεύασε μια μεγάλη συλλογή προσομοιωμένων περιβαλλόντων για αυτή τη διαδικασία. Ανавис από το σενάριο, το GPT-Red μπορεί να ελέγξει μέρος ενός τοπικού αρχείου, το κείμενο ενός email, μια ιστοσελίδα-banner ή την έξοδο που επιστρέφεται από ένα εξωτερικό εργαλείο. Κάθε περιβάλλον ορίζει τι ο επιτιθέμενος μπορεί να χειραγωγήσει και τι αποτέλεσμα προκαλεί μια επιτυχημένη παραβίαση.
Η εταιρεία λέει ότι το GPT-Red εκπαιδεύτηκε χρησιμοποιώντας υπολογιστικούς πόρους συγκρίσιμους με κάποιους από τους μεγαλύτερους μετα-εκπαιδευτικούς δρομούς της, αντιπροσωπεύοντας μια ασυνήθιστα μεγάλη ανάθεση υπολογισμού ειδικά για έρευνα ασφαλείας. Μέχρι το τέλος της εκπαίδευσης, το μοντέλο μπορούσε να παραβιάσει σχεδόν κάθε εσωτερικό και μοντέλο παραγωγής που δοκιμάστηκε μέχρι και το GPT-5.5.
Το GPT-Red Υπερέβη τους Ανθρώπινους Επιτιθέμενους στις Δοκιμές
Για να αξιολογήσει αν το GPT-Red θα μπορούσε να γενικευτεί πέρα από τα περιβάλλοντα εκπαίδευσής του, η OpenAI το δοκιμάσε χρησιμοποιώντας μια αναπαραχθείσα έκδοση μιας έμμεσης ένεσης προτύπου挑戰 του 2025.
Το GPT-Red και οι ανθρώπινοι κόκκινοι ομάδες ζητήθηκαν να αναπτύξουν επιθέσεις κατά του GPT-5.1 σε σενάρια που δεν είχαν συμπεριληφθεί στην εκπαίδευση του GPT-Red. Το αυτόματο σύστημα παρήγαγε επιτυχείς επιθέσεις στο 84% των σεναρίων, σε σύγκριση με 13% για τους ανθρώπινους συμμετέχοντες.
Αυτό το αποτέλεσμα δεν σημαίνει ότι οι ανθρώπινοι ερευνητές ασφαλείας έχουν γίνει περιττοί. Το πλεονέκτημα του GPT-Red έγκειται κυρίως στην ικανότητά του να διεξάγει ένα υψηλό όγκο πειραμάτων, να απορρίπτει μη επιτυχείς στρατηγικές και να βελτιώνει συνεχώς τις υποσχόμενες επιθέσεις χωρίς τους χρονικούς και προσωπικούς περιορισμούς μιας ανθρώπινης ομάδας.
Οι ανθρώπινοι δοκιμαστές παραμένουν σημαντικοί για την αναγνώριση των απροσδόκητων κινδύνων, την κατανόηση των ευρύτερων συνεπειών των αποτυχιών και τον σχεδιασμό σεναρίων που τα αυτόματα συστήματα μπορεί να μην λάβουν υπόψη. Η Jessica Ji, μια ανώτερη ερευνήτρια στο Κέντρο Ασφαλείας και Αναδυόμενης Τεχνολογίας του Πανεπιστημίου Georgetown, περιέγραψε τα αποτελέσματα ως υποσχόμενα ενώ τόνιζε ότι η ανθρώπινη εμπειρογνωσία παραμένει απαραίτητη.
Μια Μηχανή Πώλησης Γνώρισε Ένα Πραγματικό Στόχο
Η OpenAI επίσης δοκιμάσε αν οι επιθέσεις που ανακαλύφθηκαν σε προσομοιώσεις θα μπορούσαν να μεταφερθούν σε λειτουργικά συστήματα AI.
Ένα πείραμα στόχευσε σε einen αυτόνομο एजέντη μηχανής πώλησης που δημιουργήθηκε από την Andon Labs και αναπτύχθηκε σε ένα γραφείο της OpenAI. Το GPT-Red αρχικά έλαβε μια προσομοιωμένη έκδοση του συστήματος, μαζί με την ικανότητα να παρατηρήσει πώς ο एजέντης χρησιμοποιούσε τα εργαλεία του.
Μετά από δοκιμές και βελτίωση των επιθέσεων του σε προσομοίωση, το GPT-Red μετέφερε τις επιθέσεις σε παραγωγή. Κατάφερε όλα τα τρία αντικειμενικά που του είχαν ανατεθεί: να μειώσει την τιμή ενός ακριβού προϊόντος στα 0,50 δολάρια, να παραγγείλει ένα νέο προϊόν αξίας πάνω από 100 δολαρίων και να το προσφέρει για 0,50 δολάρια, και να ακυρώσει μια παραγγελία ενός άλλου πελάτη. Η OpenAI λέει ότι οι αδυναμίες αποκαλύφθηκαν και πρόσθετες προφυλάξεις δοκιμάζονται.
Το πείραμα εικονογραφεί γιατί η ένεση προτύπων δεν είναι απλά ένα ζήτημα της παραγωγής μιας ανάρμοστης απάντησης chatbot. Όταν ένα μοντέλο AI ελέγχει εξωτερικά συστήματα, μια επιτυχημένη ένεση μπορεί να οδηγήσει σε οικονομικές συναλλαγές, τροποποιήσεις εγγραφών, απώλεια δεδομένων ή φυσικές συνέπειες.
Το GPT-Red επίσης δοκιμάστηκε κατά του ενός.agent γραμμής εντολών Codex που τροφοδοτείται από το GPT-5.4 mini. Σε 10 προηγουμένως αόρατες σενάρια εξαγωγής δεδομένων, ήταν πιο επιτυχημένο και πιο αποτελεσματικό σε σύγκριση με μια προrompted GPT-5.5 baseline στο να πείσει τον κωδικοποιητή να αποκαλύψει ευαίσθητες πληροφορίες.
Πώς το GPT-Red Άλλαξε το GPT-5.6
Μια από τις πιο αξιοσημείωτες ανακαλύψεις του GPT-Red ήταν μια κατηγορία άμεσης ένεσης προτύπου που η OpenAI ονομάζει “ψευδής αλυσίδα σκέψης” επίθεση.
Σε υψηλό επίπεδο, η τεχνική παρουσιάζει πλαστά λόγια ή πληροφορίες επαλήθευσης που ενθαρρύνουν το μοντέλο-στόχο να υποθέσει ότι μια κακόβουλη οδηγία έχει ήδη ελεγχθεί και εγκριθεί. Ο ερευνητής της OpenAI Chris Choquette-Choo σύγκρινε το концепτό με το ψευδές να λέει σε κάποιον ότι μια λανθασμένη απάντηση είχε ήδη ελεγχθεί, καθιστώντας τον πιο πιθανό να την αποδεχθεί χωρίς να επαναλάβει την υποκείμενη σκέψη.
Αυτές οι επιθέσεις αναφέρθηκαν ότι πέτυχαν περισσότερο από 95% των φορών κατά του GPT-5.1. Μετά από αντιπαλή εκπαίδευση χρησιμοποιώντας επιθέσεις που παράγονται από το GPT-Red, το ποσοστό επιτυχίας έπεσε κάτω από 10% κατά του GPT-5.6 Sol. Σε ένα ευρύτερο σύνολο περιβαλλόντων ένεσης προτύπου, η OpenAI λέει ότι το GPT-5.6 Sol απέτυχε μόνο στο 0,05% των προσπαθειών του GPT-Red.
Η OpenAI αξιολόγησε επίσης αν οι πρόσθετες αμυντικές μεθόδους απλά έκαναν το GPT-5.6 πιο πιθανό να αρνηθεί τις έγκυρες αιτήσεις. Η εταιρεία λέει ότι οι γενικές ικανότητες και οι στοχευμένες αξιολογήσεις της υπερ-απάρνησης παρέμειναν σε μεγάλο βαθμό ανεπηρέαστες, υποδεικνύοντας ότι οι βελτιώσεις προήλθαν από καλύτερη διαφοροποίηση μεταξύ κακόβουλων και έγκυρων οδηγιών και όχι από το να κάνουν το μοντέλο γενικά λιγότερο πρόθυμο να ενεργήσει.
Αυτή η διάκριση είναι σημαντική. Ένα μοντέλο μπορεί να φαίνεται ασφαλές αν αρνείται να ανοίξει αρχεία, να περιηγηθεί ιστοσελίδες, να εκτελέσει κώδικα ή να αλληλεπιδράσει με εξωτερικές εφαρμογές, αλλά θα χάσει επίσης πολύ από την πρακτική του αξία. Η αποτελεσματική αντοχή απαιτεί τη διατήρηση της χρήσης εργαλείων ενώ αντιστέκεται στις οδηγίες που έχουν εισαχθεί από μη αξιόπιστες πηγές.
Γιατί η OpenAI Δεν Κυκλοφορεί το GPT-Red
Το GPT-Red θα παραμείνει ένα εσωτερικό σύστημα και θα διατηρηθεί χωριστά από τα δημόσια μοντέλα της OpenAI.
Αυτή η απόφαση αντανακλά τη διπλή φύση της αυτόματης κόκκινης ομάδας. Το ίδιο μοντέλο που μπορεί να βοηθήσει τους dévelopers να ανακαλύψουν αδυναμίες ένεσης προτύπου θα μπορούσε επίσης να βοηθήσει τους επιτιθέμενους να αναπτύξουν πιο αποτελεσματικές μεθόδους για την παραβίαση των συστημάτων AI που λειτουργούν από άλλες εταιρείες.
Η προσέγγιση της OpenAI είναι να διατηρήσει τον επιτιθέμενο εσωτερικά ενώ μεταφέρει τις αντεπιθέσεις γνώσεις στα μοντέλα παραγωγής. Η εταιρεία λέει ότι αυτή η διάκριση έχει ως στόχο να αποτρέψει τις κακόβουλες ικανότητες που έχουν εκπαιδευτεί στο GPT-Red να γίνουν προσβάσιμες σε εξωτερικούς επιτιθέμενους.
Αυτό σημαίνει επίσης ότι το GPT-Red δεν πρέπει να συγχέεται με τα δημόσια μοντέλα κυβερνοασφάλειας της OpenAI ή τα προγράμματα αμύνης. Δεν είναι ένα προϊόν δοκιμής διείσδυσης, ούτε έχει σχεδιαστεί να ανακαλύπτει αυτόματα συμβατικές εκμεταλλεύσεις λογισμικού. Ο当前 στόχος του είναι να επιτεθεί στη συμπεριφορά ακολούθων οδηγιών των συστημάτων AI, ιδιαίτερα των agent που εκτίθενται σε πιθανώς μη αξιόπιστα δεδομένα.
Η Αυτόματη Κόκκινη Ομάδα Έχει Ακόμη Τυφλές Και Σημεία
Παρά τα ισχυρά αποτελέσματα, το GPT-Red δεν παρέχει μια πλήρη λύση για την ασφάλεια AI.
Η αναφορά για την έρευνα υποδεικνύει ότι το σύστημα παραμένει λιγότερο αποτελεσματικό στις πολυ-στροφικές επιθέσεις που αναπτύσσονται σταδιακά σε μια μακρά συνομιλία. Επίσης, έχει περιορισμένες ικανότητες για την ανάπτυξη ενέσεων προτύπου που είναι ενσωματωμένες σε εικόνες, αφήνοντας σημαντικά multimodal επιφάνειες επιθέσεων ανεπαρκώς καλυμμένες.
Τα αποτελέσματα βασίζονται επίσης σε μεγάλο βαθμό στα περιβάλλοντα και τα κριτήρια επιτυχίας που σχεδιάστηκαν από την OpenAI. Αν και η εταιρεία δοκιμάσε το GPT-Red σε σενάρια που κρατήθηκαν και σε λειτουργικά συστήματα, οι ανεξάρτητοι ερευνητές θα έχουν περιορισμένη ικανότητα να αναπαράγουν τα ευρήματα ενώ το μοντέλο και μεγάλο μέρος της υποδομής αξιολόγησής του παραμένουν ιδιωτικά.
Η OpenAI λέει ότι θα συνεχίσει να συνδυάζει την αυτόματη δοκιμή με ανθρώπινη και τρίτη κόκκινη ομάδα, στρωμένα προϊόντα προφυλάξεις, έλεγχο πρόσβασης, παρακολούθηση και ανίχνευση κακοποίησης σε πραγματικό χρόνο. Αυτή η στρατηγική αμύνης σε βάθος αντανακλά την πραγματικότητα ότι κανένα μοντέλο ή πρότυπο δεν μπορεί να προβλέψει κάθε επίθεση που μπορεί να εμφανιστεί μετά την ανάπτυξη.
Ένας Νέος Αγώνας Ασφαλείας Μεταξύ AI Επιτιθέμενων και Αμυνομένων
Η “αυτο-βελτίωση” που περιγράφεται στην ανακοίνωση της OpenAI δεν είναι ένα αναπτυγμένο μοντέλο που ξαναγράφει αυτόνομα τα δικά του βάρη ή δημιουργεί ένα πιο ισχυρό διάδοχο. Αντίθετα, είναι ένας ελεγχόμενος κύκλος εκπαίδευσης στον οποίο ένα σύστημα AI παράγει αντιπαλές παραδείγματα που οι ερευνητές χρησιμοποιούν για να βελτιώσουν ένα άλλο.
Παρά τούτο, το GPT-Red αντιπροσωπεύει μια σημαντική μετατόπιση στο πώς τα μοντέλα του μελλοντικού μπορεί να ασφαλιστούν. Οι ανθρώπινες κόκκινες ομάδες μπορούν να ανακαλύψουν sophistikées αδυναμίες, αλλά δεν μπορούν να παράγουν το μέγεθος και την ποικιλία των επιθέσεων που απαιτούνται για τη συνεχή εκπαίδευση των αυξανόμενων ικανοτήτων AI.
Οι αυτόματοι επιτιθέμενοι μπορούν να γεμίσουν μέρος αυτού του κενού, δημιουργώντας έναν ασφαλιστικό κύκλο στον οποίο κάθε ισχυρότερος αμυνόμενος αναγκάζει το μοντέλο κόκκινης ομάδας να ανακαλύψει νέες αδυναμίες. Αυτές οι αδυναμίες στη συνέχεια γίνονται υλικό εκπαίδευσης για την επόμενη γενιά συστημάτων παραγωγής.
Ο κίνδυνος είναι ότι παρόμοιες ικανότητες δεν θα παραμείνουν αποκλειστικές των εργαστηρίων αμύνης. Όσο τα ανοιχτά και εμπορικά μοντέλα γίνονται καλύτερα στην μακροπρόθεσμη σχεδίαση, χρήση εργαλείων, κυβερνοασφάλεια και αυτόνομη πειραματική, οι επιτιθέμενοι θα κερδίσουν πρόσβαση σε όλο και πιο ικανά συστήματα.
Το GPT-Red σημαίνει λοιπόν πρόοδο και μια πρώιμη ένδειξη του αγώνα που έρχεται. Τα εργαστήρια AI αρχίζουν να χρησιμοποιούν ισχυρά μοντέλα για την άμυνα των επόμενων γενεών των agent, αλλά αυτές οι αμυντικές θα πρέπει να εξελιχθούν συνεχώς καθώς οι ίδιες τεχνολογίες κάνουν τις αυτόματες επιθέσεις φθηνότερες, ταχύτερες και πιο προσαρμόσιμες.












