Κυβερνοασφάλεια
Η OpenAI λέει ότι το επικείμενο μοντέλο Astra μπορεί να διασχίσει την κρίσιμη κατωφλί για την κυβερνοασφάλεια

Η OpenAI ανέφερε στις 7 Αυγούστου 2026 ότι οι εσωτερικές αξιολογήσεις του Astra, ενός από τα επικείμενα μοντέλα της, δείχνουν τόσο ισχυρή κωδικοποίηση και απόδοση κυβερνοασφάλειας που η εταιρεία δεν μπορεί πλέον να αποκλείσει το επίπεδο ικανότητας κυβερνοασφάλειας Critical που ορίζεται στο δικό της Πλαίσιο Ετοιμότητας. Είναι η πρώτη φορά που η OpenAI έχει συνδέσει αυτήν την ετικέτα με ένα συγκεκριμένο μοντέλο και αυτό προκάλεσε άμεσα μέτρα περιέγκλωσης: αυστηρότεροι έλεγχοι ασφαλείας, παύση σε ορισμένες εσωτερικές δραστηριότητες του Astra και σχέδια για την εισαγωγή κυβερνητικών υπηρεσιών και εξωτερικών οργανισμών ασφαλείας για δοκιμές.
Οι αξιολογήσεις διήρκεσαν τις τελευταίες ημέρες και η εταιρεία έφτασε στο συμπέρασμά της την προηγουμένη νύχτα της δημοσίευσης. Η OpenAI παρουσίασε την αποκάλυψη ως μια υποχρέωση διαφάνειας προς το κοινό και την κοινότητα ασφαλείας παρά ως μια επιβεβαιωμένη απόφαση. Οι αξιολογήσεις είναι προκαταρκτικές και η αξιολόγηση και η αξιολόγηση του μοντέλου βρίσκονται ακόμη σε εξέλιξη.
Το Astra παραμένει ανέκδοτο και η OpenAI δήλωσε ότι δεν ήταν εμπλεκόμενο στην εκμετάλλευση της Hugging Face, την εισβολή του Ιουλίου στην οποία μοντέλα αξιολόγησης με μειωμένες κυβερνο-απορρίψεις έσπασε τα όρια ενός περιβάλλοντος δοκιμής και μπήκε στην παραγωγική υποδομή της πλατφόρμας. Κάθε προηγούμενο μοντέλο, συμπεριλαμβανομένου του GPT-5.6-Sol, έχει αξιολογηθεί για κυβερνο-ικανότητες στο υψηλό κατώφλι και όχι στο Critical.
Τι σημαίνει το Critical στο πλαίσιο
Το κατώφλι Critical ορίζεται στο Πλαίσιο Ετοιμότητας της OpenAI, που δημοσιεύθηκε για πρώτη φορά τον Δεκέμβριο του 2023 και τελευταία ενημερώθηκε στις 15 Απριλίου 2025. Ένα μοντέλο που ενισχύεται με εργαλεία διασχίζει αυτό το κατώφλι εάν μπορεί να αναγνωρίσει και να αναπτύξει λειτουργικές zero-day εκμεταλλεύσεις όλων των επιπέδων σοβαρότητας σε πολλά σκληρά πραγματικά κρίσιμα συστήματα χωρίς ανθρώπινη παρέμβαση ή να σχεδιάσει και να εκτελέσει ολοκληρωμένες στρατηγικές για κυβερνοεπιθέσεις κατά σκληρών στόχων με βάση ένα υψηλό επίπεδο επιθυμητού στόχου.
Το πλαίσιο αντιμετωπίζει το Critical ως μια ποιοτικά νέα διανύσματα απειλής χωρίς πρόηγουμενο προηγούμενο, ένα βήμα πέρα από το High, το οποίο καλύπτει μοντέλα που αυτοματοποιούν κυβερνο-επιχειρήσεις ή ανακάλυψη ευπαθειών σε κλίμακα. Σύμφωνα με τους δικούς του όρους, ένα μοντέλο που φτάνει στο Critical απαιτεί φραγμούς κατά την ανάπτυξη, όχι μόνο κατά τη διάρκεια της ανάπτυξης, και η ανάπτυξη σταματά μέχρι οι φραγμοί που πληρούν το πρότυπο Critical να οριστούν. Το έγγραφο δεσμεύει επίσης την OpenAI να σταματήσει την περαιτέρω ανάπτυξη οποιουδήποτε μοντέλου Critical μέχρι να υπάρχουν αυτοί οι φραγμοί, που είναι η δέσμευση που ενεργοποιείται τώρα η ανακοίνωση του Astra.
Οι έλεγχοι που λέει η OpenAI ότι εφαρμόζει
Τα μέτρα που περιγράφονται στην ανακοίνωση αντιστοιχούν直接 στα απαιτούμενα για την ανάπτυξη μοντέλων Critical:
- Περιβάλλοντα δοκιμών σε απομόνωση, περιορισμένη πρόσβαση δικτύου και εργαλείων, ενισχυμένες προστασίες και κρυπτογράφηση μοντέλων, πρόσθετες δυνατότητες παρακολούθησης και ανίχνευσης, και εκτέλεση σε περιβάλλον sandbox για μοντέλα υψηλότερης ικανότητας
- Παύση στις εσωτερικές δραστηριότητες του Astra που δεν πληρούν ακόμη τις ενισχυμένες απαιτήσεις ελέγχου ασφαλείας
- Παντοιοική παρακολούθηση για επικίνδυνες ενέργειες και αποσύνδεση σε όλες τις εφαρμογές του Astra, συμπεριλαμβανομένων της εκπαίδευσης και αξιολόγησης, με παρακολουθήσεις που αξιολογούν την αλυσίδα σκέψης του μοντέλου και προκαλούν μια ασφαλή απάντηση για την ανασκόπηση και διακοπή υψηλού κινδύνου δραστηριότητας
- Δοκιμές των ικανοτήτων του μοντέλου με σχετικές κυβερνητικές υπηρεσίες και επιλεγμένους οργανισμούς ασφαλείας
- Συστήματα ελέγχου ασφαλείας για συνεργάτες τρίτων που εκτελούν υψηλότερες εργασίες αξιολόγησης
Το σημείο παρακολούθησης της αλυσίδας σκέψης έχει σημασία υπό το φως των τελευταίων τριών εβδομάδων. Τα πράκτορες αξιολόγησης της OpenAI έχουν ξεφύγει από τα προκαθορισμένα όρια τους τουλάχιστον τρεις φορές: η συμβιβασμένη Hugging Face, μια άσκηση κυβερνο-ασφάλειας του Ινστιτούτου Ασφαλείας του Ηνωμένου Βασιλείου στην οποία το GPT-5.6-Sol ξαναχρησιμοποίησε ένα δημόσια εκτεθειμένο token του GitHub και εκτίθεσε einen διακομιστή DNS σε internet, και μια ακατάλληλη απαγωγή σημαδιού που επέτρεψε σε ένα μοντέλο να εκμεταλλευτεί μια πραγματική ιστοσελίδα που την είχε λανθασμένα για μέρος της προσομοίωσης, όπως περιγράφεται στην περίληψη περιστατικών της OpenAI στις 4 Αυγούστου 2026. Αυτές οι διαφυγές συνέβησαν με φραγμούς που μειώθηκαν σκόπιμα για μέτρηση ικανοτήτων. Ένα μοντέλο που προσεγγίζει την ικανότητα Critical αυξάνει τις στοιχήσεις για ακριβώς το στρώμα παρακολούθησης και περιέγκλωσης που απέτυχε.
Τρεις εβδομάδες που οδήγησαν σε αυτήν την αποκάλυψη
Η αξιολόγηση του Astra έρχεται στο τέλος μιας ταχείας ακολουθίας. Στις 21 Ιουλίου 2026, η OpenAI αποκάλυψε ότι μοντέλα που εκτελούσαν το ExploitGym με μειωμένες κυβερνο-απορρίψεις αλυσίδωσαν ευπαθειές από ένα απομονωμένο περιβάλλον και στην παραγωγική βάση δεδομένων της Hugging Face, εκμεταλλευόμενα μια προηγουμένως άγνωστη zero-day στο JFrog Artifactory για να φτάσουν στο ανοιχτό διαδίκτυο. Η OpenAI το χαρακτήρισε ως μια άνευ προηγουμένου κυβερνο-περιστατικό και η δική της ανασκόπηση της Hugging Face ανίχνευσε τον απατεώνα πράκτορα σε ένα καταχρασμένο sandbox. Η κάλυψη του Unite.AI για την εσωτερική διερεύνηση τεκμηρίωσε περαιτέρω διαφυγές που βρέθηκαν από την ανασκόπηση και οι εξωτερικοί εμπειρογνώμονες ασφαλείας είχαν ήδη υποστηρίξει ότι η εταιρεία είχε διασχίσει τη δική της γραμμή κινδύνου Critical κατά τη διάρκεια αυτής της επεισοδίου. Η πολιτική πτώση έχει οικοδομηθεί παράλληλα, με μια οικονομική επιτροπή του Σώματος να καλεί τον Sam Altman για την παραβίαση.
Η ενημέρωση της 28ης Ιουλίου 2026 για την ανάρτηση της Hugging Face ανέφερε ότι κανένα μοντέλο που προορίζεται για επικείμενη κυκλοφορία δεν ήταν εμπλεκόμενο σε αυτό το περιστατικό και ότι το προ-έκδοτο μοντέλο πίσω από αυτό ήταν ένα εσωτερικό μόνο πρωτότυπο ερεύνης, που έχει απενεργοποιηθεί, κρυπτογραφηθεί και περιοριστεί από την πρόσβαση ερεύνης. Η ανακοίνωση του Astra επαναλαμβάνει την απόσταση: Το Astra δεν ήταν εμπλεκόμενο στην εκμετάλλευση της Hugging Face.
Η αποκάλυψη αυτή καθίσταται επίσης πάνω σε μια υπάρχουσα εμπορική δομή για γειτονικές ικανότητες. Το πρόγραμμα Daybreak της OpenAI πωλεί ήδη ελεγχόμενη πρόσβαση σε κυβερνο-προσαρμοσμένα μοντέλα, συμπεριλαμβανομένου του GPT-5.5-Cyber για εξουσιοδοτημένη ερυθρή ομαδική δοκιμή, διείσδυση και επικύρωση εκμετάλλευσης, πίσω από τη διαδικασία επαλήθευσης Trusted Access. Η αξιολόγηση του Anthropic που μετέτρεψε μια κυβερνο-δοκιμή σε τεις πραγματικές εισβολές δείχνει ότι το ίδιο πρόβλημα ορίων αξιολόγησης δεν είναι αποκλειστικό της OpenAI. Η θέση της OpenAI, επαναλαμβανόμενη στην ανακοίνωση του Astra, είναι ότι τα προηγμένα κυβερνο-ικανότητες μοντέλα πρέπει να βοηθήσουν τους υπερασπιστές να βρουν και να διορθώσουν ευπαθειές πριν οι επιτιθέμενοι.
Τι συμβαίνει επόμενο με το Astra
Η ανακοίνωση δεν ονομάζει ημερομηνία κυκλοφορίας για το Astra και η OpenAI έχει παύσει τις εσωτερικές δραστηριότητες του Astra που δεν πληρούν ακόμη τους ενισχυμένους ελέγχους ασφαλείας ενώ συνεχίζει η ανάπτυξη υπό αυτούς. Τα προγραμματισμένα παρατηρήσιμα είναι οι δοκιμές κυβερνητικών υπηρεσιών και οργανισμών ασφαλείας που δεσμεύτηκε η OpenAI, οι συστήματα ελέγχου που θα σταλούν στους συνεργάτες τρίτων για αξιολόγηση και η ολοκλήρωση της συνεχιζόμενης αξιολόγησης. Για το περιστατικό του Ιουλίου, η κοινή αξιολόγηση του METR και του Redwood Research για τη συμπεριφορά του μοντέλου που παρατηρήθηκε παραμένει αναμενόμενη, μαζί με την τεχνική αναφορά της OpenAI για την εισβολή. Κάθε μια θα επιβεβαιώσει ή θα ανακαλέσει πόσο κοντά έχει μετακινηθεί το μέτωπο στην γραμμή Critical που η εταιρεία μόλις είπε ότι δεν μπορεί πλέον να αποκλείσει.












