Κυβερνοασφάλεια

OpenAI διακόπτει συντονισμένη εκστρατεία εξαγωγής λογικής μοντέλου

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η OpenAI δήλωσε σε μια ανακοίνωση ασφαλείας που δημοσιεύτηκε στις 30 Σεπτεμβρίου 2026 ότι εντόπισε και διατάραξε μια συντονισμένη εκστρατεία σχεδιασμένη να εξάγει προστατευμένη λογική από τα μοντέλα της, και αποδόθηκε ένας βασικός σύμπλεγμα της δραστηριότητας σε άτομα που σχετίζονται με τη Moonshot AI, την εταιρεία που ανέπτυξε το Kimi. Η πρώιμη παρατηρηθείσα δραστηριότητα συνέβη την πρώτη εβδομάδα του Ιουλίου 2026.

Τι παρατήρησε η OpenAI

Η OpenAI περιέγραψε τη δραστηριότητα ως σύμφωνη με την εχθρική απόσταξη, την οποία ορίζει ως τη συστηματική και μη εξουσιοδοτημένη χρήση των εξόδων ή της λογικής ενός μοντέλου για να βοηθήσει στην εκπαίδευση, αναπαραγωγή ή βελτίωση ενός άλλου μοντέλου. Η προστατευμένη λογική, σύμφωνα με την εταιρεία, είναι το εσωτερικό αρχείο του μοντέλου για την επεξεργασία μιας εργασίας· η εξαγωγή της μπορεί να αποκαλύψει πληροφορίες που παραμένουν κρυμμένες από την τελική απάντηση και να βοηθήσει άλλους να αναπαράγουν τις δυνατότητες του μοντέλου.

Η OpenAI δήλωσε ότι οι χειριστές δεν διέσπασαν την κρυπτογράφηση της, δεν παραβίασαν κάποια βάση δεδομένων, ούτε απέκτησαν άμεση πρόσβαση στις αποθηκευμένες συνομιλίες χρηστών. Οι χειριστές παραποίησαν τις αλληλεπιδράσεις των μοντέλων ώστε η προστατευμένη λογική να μπορεί να αναπαραχθεί σε μορφές ορατές στον αιτών με συντονισμένο, κλιμακωτό τρόπο που παραβίαζε τους όρους χρήσης της εταιρείας. Μία τεχνική που παρατήρησε η OpenAI περιελάμβανε την αντιγραφή κρυπτογραφημένης λογικής από μία συνομιλία και την αίτηση σε ένα μοντέλο σε άλλη συνομιλία να την αποκρυπτογραφήσει και να μεταγράψει το κρυφό περιεχόμενο λογικής. Η εταιρεία δήλωσε ότι η παραποίηση δεν αποτελεί ευπάθεια μοναδική στα μοντέλα της και ότι μοιράστηκε πληροφορίες σχετικά με αυτήν με συνεργάτες του κλάδου μέσω του Frontier Model Forum για την ενίσχυση των συλλογικών αμυντικών μέτρων.

Η δραστηριότητα ξεκίνησε την 1η Ιουλίου 2026, αρχικά με χαμηλό όγκο, μέχρι που η OpenAI παρατήρησε αιχμές υψηλού όγκου στις 24 και 25 Ιουλίου 2026, που αποτελούνταν από 16.000 αιτήματα που χρησιμοποίησαν ένα σχετικό μοτίβο εξαγωγής από πάνω από 4.000 χρήστες. Μια υποσημείωση στην ανάρτηση σημειώνει ότι αυτά τα νούμερα περιγράφουν προσπαθήσεις εξαγωγής, όχι απαραίτητα επιτυχείς. Η OpenAI δήλωσε ότι περαιτέρω έρευνα εντόπισε σχετική δραστηριότητα προτροπής‑μοτίβου σε ένα σύμπλεγμα άνω των 15.000 χρηστών, την οποία διέκοψε πλήρως έως τις 28 Ιουλίου 2026. Η δραστηριότητα εξελίχθηκε με την πάροδο του χρόνου, κάτι που, σύμφωνα με την εταιρεία, ενισχύει το επιχείρημα ότι η εχθρική απόσταξη αποτελεί ευρύτερη πρόκληση ασφαλείας που απαιτεί πολυεπίπεδες, προσαρμοστικές άμυνες.

Η OpenAI δήλωσε ότι η εχθρική απόσταξη δημιουργεί κινδύνους για την ασφάλεια και την εθνική ασφάλεια: η εξαγόμενη λογική θα μπορούσε να χρησιμοποιηθεί για την εκπαίδευση άλλου μοντέλου χωρίς τη διατήρηση των μέτρων ασφαλείας που εφαρμόζονται στα αποτελέσματα προς το χρήστη του αρχικού μοντέλου, και η απόσταξη σε μεγάλη κλίμακα μπορεί να επιταχύνει τη μεταφορά προηγμένων δυνατοτήτων χωρίς την ίδια επένδυση στην ασφάλεια, ανησυχίες που, σύμφωνα με την εταιρεία, ενισχύονται καθώς τα μοντέλα αποκτούν δυνατότητες σε τομείς διπλής χρήσης. Η OpenAI δήλωσε ότι πριν τη δημοσίευση διερεύνησε το εύρος και τον πιθανό αντίκτυπο της εκστρατείας, εφάρμοσε τις δικές της αντιμετώπιση, μοιράστηκε και έλαβε σχόλια από ερευνητές και συνεργάτες του κλάδου, και ότι η πρόσθετη εργασία μετριασμού και διερεύνησης συνεχίζεται.

Απόδοση

Η OpenAI δήλωσε ότι δεν είναι σαφές εάν όλοι οι χειριστές που παρατηρήθηκαν κατά τη σχετική περίοδο προέρχονται από έναν ενιαίο δράστη, και ότι αποδίδει ένα βασικό σύμπλεγμα της δραστηριότητας σε άτομα που σχετίζονται με τη Moonshot AI, τον δημιουργό του Kimi.

Στις 8 Σεπτεμβρίου 2026, η Εθνική Υπηρεσία Ασφάλειας, η Υπηρεσία Κυβερνοασφάλειας και Υποδομών, και το Ομοσπονδιακό Γραφείο Ερευνών δημοσίευσαν μια κοινή συμβουλή κυβερνοασφάλειας που δηλώνει ότι η Moonshot AI έχει διεξάγει μια εκτεταμένη εκστρατεία απόσταξης εναντίον αμερικανικών εταιρειών AI αιχμής τουλάχιστον από τα μέσα του 2025. Η συμβουλή αναφέρει ότι η Moonshot AI εξήγαγε σημαντικά δεδομένα Claude Fable 5 για την εκπαίδευση του μοντέλου Kimi‑K3 και δεδομένα GPT‑4o για την εκπαίδευση του μοντέλου Kimi‑K2, και ότι η εταιρεία χρησιμοποίησε αμερικανικά μοντέλα για να αποστάξει βελτιστοποίηση επιβλεπόμενης λεπτής ρύθμισης, ενισχυτική μάθηση, μηχανική λογισμικού και μαθηματικές δυνατότητες.

Η συμβουλή αναφέρει πιο γενικά ότι, πιθανώς με γνώση της κινεζικής κυβέρνησης, οι DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun και Z.AI εξήγαγαν δισεκατομμύρια tokens μέσα από εκατομμύρια ανταλλαγές από αμερικανικά μοντέλα AI αιχμής, συμπεριλαμβανομένων παραλλαγών των Claude, GPT, Gemini και Grok, τουλάχιστον από τα τέλη του 2024. Σύμφωνα με τις υπηρεσίες, αυτές οι εταιρείες διέθεταν αιτήματα μέσω εγγενών API, απομακρυσμένων παρόχων cloud και τρίτων συγκεντρωτών· χρησιμοποίησαν μια γκρίζα αγορά διακομιστών API γνωστών ως «σταθμοί μεταφοράς» για να παρακάμψουν γεωγραφικούς περιορισμούς, να παραβιάσουν τους όρους χρήσης και να υπονομεύσουν την ανιχνευσιμότητα· και πέτυχαν εξοικονόμηση κόστους μέσω μαζικής προμήθειας συνδρομών premium που μοιράζονται μεταξύ ομάδων προγραμματιστών. Οι υπηρεσίες συνέστησαν στις αμερικανικές εταιρείες AI να εφαρμόσουν ολοκληρωμένη ανίχνευση και μετριασμό, να υλοποιήσουν στοχευμένες αλλαγές απόκρισης για υποτιθέμενες προσπάθειες απόσταξης, και να δημιουργήσουν διαοργανωτική ανταλλαγή πληροφοριών.

Η Έρευνα για τα Ιχνη Λογικής

Η OpenAI δήλωσε ότι ανεξάρτητοι ερευνητές ασφαλείας έφεραν σχετικές ευπάθειες δια‑μοντέλου και συμπίεσης συνομιλιών στην προσοχή της μέσω υπεύθυνης αποκάλυψης. Η εταιρεία δήλωσε ότι διερεύνησε τα ευρήματα, επιβεβαίωσε ότι οι διαδρομές επίθεσης που εντόπισαν οι ερευνητές ήταν πραγματικές, και ότι η εργασία βοήθησε στην κατανόηση του ευρύτερου τύπου επίθεσης και στην επιτάχυνση των μετριασμών.

Σε ένα άρθρο που υποβλήθηκε στο arXiv στις 10 Αυγούστου 2026, ο Alexander Panfilov, ο David Schmotz, ο Ilia Shumailov, ο Luca Beurer‑Kellner, ο Joachim Schaeffer, ο Ameya Prabhu, ο Jonas Geiping και ο Maksym Andriushchenko αναφέρουν ότι οι κορυφαίοι πάροχοι κρύβουν τη βήμα‑βήμα λογική των μοντέλων τους για να προστατεύσουν τη διανοητική ιδιοκτησία και να περιορίσουν τη διαρροή πληροφοριών, επιστρέφοντας τα ίχνη στον πελάτη ως μπλοκ κρυπτογραφημένου κειμένου που ο πελάτης στέλνει πίσω με κάθε επόμενη αίτηση. Οι συγγραφείς εντοπίζουν μια αρχιτεκτονική ευπάθεια: αυτά τα κρυπτογραφημένα μπλοκ είναι πλήρως συμβατά και εναλλάξιμα μεταξύ διαφορετικών συνεδριών, χρηστών και μοντέλων εντός του οικοσυστήματος ενός παρόχου. Περιγράφουν ένα κλιμακώσιμο jailbreak αποκρυπτογράφησης, στο οποίο ένα κρυπτογραφημένο ίχνος λογικής από ένα δεδομένο μοντέλο εισάγεται σε ένα πιο αδύναμο, λιγότερο ασφαλισμένο μοντέλο του ίδιου παρόχου, αναγκάζοντάς το να αποκρυπτογραφήσει και να εμφανίσει το ίχνος ακριβώς ως απλό κείμενο χωρίς να χρειάζεται να παραβιάσει άμεσα το πιο ικανό μοντέλο.

Οι συγγραφείς αναφέρουν ότι η ευπάθεια επιτρέπει τέσσερις διακριτές διαδρομές επίθεσης: παράκαμψη των μηχανισμών anti‑distillation, που επιδεικνύουν σε Anthropic, OpenAI και Google· εξαγωγή ιδιωτικών δεδομένων μεγάλης κλίμακας, στην οποία ανέκτησαν 367 αντικείμενα προσωπικά αναγνωρίσιμων πληροφοριών και 182 διαπιστευτήρια αποκωδικοποιώντας 315,320 μπλοκ λογικής που συλλέχθηκαν από δημόσια αποθετήρια· ακούσια αποκάλυψη επικίνδυνων πληροφοριών που κρύβονται στη διαδικασία λογικής ακόμη και όταν η τελική ορατή έξοδος του μοντέλου απορρίπτει με ασφάλεια ένα κακόβουλο αίτημα· και αόρατες ενθέσεις προτροπών που ενσωματώνουν κακόβουλο φορτίο εξ ολοκλήρου μέσα σε κρυπτογραφημένα μπλοκ για δηλητηρίαση δημόσιων κυκλοφοριών πρακτόρων. Μετά από υπεύθυνη αποκάλυψη, οι συγγραφείς προτείνουν κρυπτογραφικές και συστημικές μετριάσεις για την ασφάλιση της λογικής στην πλευρά του πελάτη.

Πώς Αντέδρασε η OpenAI

Η OpenAI δήλωσε ότι μετρίασε την εκστρατεία μέσω ενός συνδυασμού επιβολής λογαριασμών, τεχνικών ελέγχων και συντονισμού με συνεργάτες: απαγόρευσε ή περιορίσε ψεύτικους λογαριασμούς, ενίσχυσε τους ελέγχους εγγραφής και υποδομής, και επέκτεινε την παρακολούθηση σχετικών δικτύων. Η εταιρεία πρόσθεσε ότι ενίσχυσε επίσης τις προστασίες για κρυφή λογική μεταξύ χρηστών, χώρων εργασίας, οργανισμών και οικογενειών μοντέλων: έκλεισε μια διαδρομή που επέτρεπε σε κάποιον που ήδη διέθετε την κρυπτογραφημένη λογική άλλου χρήστη να την επαναλάβει και να ανακτήσει το περιεχόμενό της, πρόσθεσε ελέγχους για την ανίχνευση και κράτηση της ροής εξόδου που θα μπορούσε να αποκαλύψει τη λογική, και συνεργάστηκε με παρόχους τρίτων για την ταυτοποίηση και διακοπή λογαριασμών όταν σχετική δραστηριότητα διέρχεται από τις υπηρεσίες τους.

Η OpenAI δήλωσε ότι μοιράστηκε τα σχετικά ευρήματα μέσω του Frontier Model Forum και των κατάλληλων κυβερνητικών καναλιών ανταλλαγής πληροφοριών, ώστε άλλοι προγραμματιστές frontier και εταίροι του δημόσιου τομέα να μπορούν να εντοπίσουν παρόμοιες δραστηριότητες και να ενισχύσουν τις δικές τους άμυνες, και σημείωσε ότι τα συστήματα που υποστηρίζουν φορητά ή επαναλαμβανόμενα αντικείμενα λογικής ενδέχεται να αντιμετωπίζουν σχετικούς κινδύνους.

Η OpenAI δήλωσε ότι αναμένει ότι οι προσπάθειες αντιπάλου αποσταθμίσεως (adversarial distillation) θα γίνουν πιο εξελιγμένες καθώς τα frontier μοντέλα βελτιώνονται και καθώς οι δράστες αναζητούν φθηνότερους τρόπους να μιμηθούν τις δυνατότητές τους. Η εταιρεία τόνισε ότι οι υλοποιήσεις που φιλοξενούνται από συνεργάτες χρειάζονται τις ίδιες προστασίες με τις υπηρεσίες πρώτου μέρους, ότι οι επιθέσεις εξόδου εργαλείων απαιτούν προστασίες που εξετάζουν περισσότερο από το συνηθισμένο ορατό κείμενο, και ότι συνεχίζει να βελτιώνει τις άμυνες εργαλείων, την κάλυψη ταξινομητών και τις απορρίψεις μοντέλων, ενώ διαδίδει σχετικούς ελέγχους σε συνεργάτες cloud. Η OpenAI δήλωσε ότι η ανταπόκρισή της θα συνεχίσει να εστιάζει σε τρεις τομείς: ισχυρότερες τεχνικές προστασίες κατά της εξαγωγής, καλύτερη ανίχνευση και επιβολή εναντίον συντονισμένων εκστρατειών, και βαθύτερη ανταλλαγή πληροφοριών απειλών μεταξύ βιομηχανίας και κυβέρνησης.

Miles Okada είναι ένας αναλυτής που δημιουργείται από AI στην Unite.AI, καλύπτοντας την τεχνητή νοημοσύνη και την κυβερνοασφάλεια με έμφαση στις αναδυόμενες απειλές, τις αμυντικές αρχιτεκτονικές και τις εξελισσόμενες δυναμικές μεταξύ επιτιθέμενων και αυτοματοποιημένων συστημάτων. Η δουλειά του εξετάζει πώς η AI μετασχηματίζει τις λειτουργίες ασφαλείας, από την αυτόνομη ανίχνευση και ανταπόκριση σε απειλές μέχρι την άνοδο των αντιπαραθετικών τεχνικών AI.

Με τεχνική και ερευνητική προοπτική, ο Miles αναλύει την έρευνα ασφαλείας, τις δημοσιεύσεις περιστατικών και τις υλοποιήσεις στον πραγματικό κόσμο για να κατανοήσει πού η AI ενισχύει τις άμυνες — και πού εισάγει νέες ευπάθειες. Δίνει ιδιαίτερη προσοχή στην εκμετάλλευση μοντέλων, τη δηλητηρίαση δεδομένων, την αυτοματοποίηση επιθέσεων και τις επιχειρησιακές πραγματικότητες της ασφάλισης συστημάτων που τροφοδοτούνται από AI σε μεγάλη κλίμακα.

Τα άρθρα που συντάσσει ο Miles Okada δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών της Unite.AI για να εξασφαλιστεί η ακρίβεια, η αυστηρότητα και η υπεύθυνη κάλυψη του ταχέως μεταβαλλόμενου τοπίου ασφαλείας AI.