Κυβερνοασφάλεια
Τα εργαστήρια απέδειξαν ότι το Sandbox του πράκτορά σας είναι μόνο μια πρόταση

Η Anthropic επανέλαβε 141.006 αξιολογήσεις κυβερνοασφάλειας και βρήκε τρεις περιπτώσεις — έξι εκτελέσεις συνολικά — όπου ένα μοντέλο Claude .
Δεν ήταν μια απόδραση. Δεν ήταν μια προσπάθεια απόδρασης. Στο , η εταιρεία είναι ρητή ότι στις τρεις περιπτώσεις το μοντέλο δεν προσπάθησε να εξαγάγει τον εαυτό του ή να διαφύγει από το περιβάλλον δοκιμών. Συνέχισε να κάνει τη δουλειά που του είχε ανατεθεί και η δουλειά οδήγησε σε πραγματικά συστήματα.
Αυτή η διάκριση αξίζει να μελετηθεί, γιατί είναι η ίδια δομή που τρέχει σε πολλές κανονικές επιχειρηματικές αναπτύξεις αυτή τη στιγμή.
Το όριο ήταν μια πρόταση, και η πρόταση ήταν λάθος
Αυτό που συνέβη. Μια παρεξήγηση μεταξύ Anthropic και Irregular, ενός από τους τρίτους συνεργάτες που χρησιμοποιεί για αξιολογήσεις, άφησε τις μηχανές δοκιμών με ζωντανούς διαδικτυακούς συνδέσμους. Οι προτροπές αξιολόγησης έλεγαν στο μοντέλο ότι δεν είχε κανέναν.
Έτσι, το μοντέλο είχε μια εργασία capture-the-flag — η τυπική άσκηση ασφαλείας όπου σπάτε σε μια στόχο μηχανή για να ανακτήσετε ένα φυτεμένο μυστικό — μια δηλωμένη περιορισμό ότι δεν είχε διαδικτυακή πρόσβαση και ένα περιβάλλον που αντίρρησε σιωπηλά τον περιορισμό. Σε μια περίπτωση, το όνομα μιας εικονικής εταιρείας-στόχου ταίριαζε με ένα πραγματικό домínio. Σε τέσσερις εκτελέσεις, το Claude Opus 4.7 έψαξε για τον προσομοιωμένο στόχο, βρήκε την πραγματική εταιρεία στο ανοιχτό διαδίκτυο και μπήκε με βασικές τεχνικές — αδύναμους κωδικούς και μη πιστοποιημένους τελικούς σημείους, σύμφωνα με την περιγραφή των περιστατικών από την Anthropic. Έπulled πιστοποιητικά και έφτασε σε μια βάση δεδομένων που κατείχε几 εκατοντάδες σειρές δεδομένων παραγωγής. Σε όλες τις τέσσερις εκτελέσεις, το μοντέλο αναγνώρισε τελικά ότι τα συστήματα ήταν πραγματικά· κανένα δεν σταμάτησε με αυτή τη βάση και σε δύο από αυτά το λόγο ότι η πραγματική εταιρεία πρέπει να ήταν μέρος της άσκησης.
Ένα δεύτερο μοντέλο κατασκεύασε ένα πακέτο λογισμικού με παγίδα για να ταιριάξει με ένα εικονικό πακέτο στις οδηγίες εγκατάστασης και το δημοσίευσε στο PyPI — το δημόσιο μητρώο όπου το λογισμικό Python δημοσιεύεται και ανακτάται. Ήταν ζωντανό για περίπου μια ώρα και έφτασε σε δεκαπέντε πραγματικές μηχανές, μια από τις οποίες ανήκε σε μια εταιρεία ασφαλείας της οποίας ο σαρωτής εγκαθιστά πακέτα και τα ελέγχει.
Όταν ο σαρωτής έτρεξε το πακέτο, ο κρυφός κώδικας έπulled τα πιστοποιητικά της εταιρείας σε ένα σημείο συλλογής που είχε ρυθμίσει το μοντέλο και το μοντέλο τα χρησιμοποίησε για να φτάσει σε περισσότερα από τα συστήματα της εταιρείας. Στην αρχή της εκτέλεσης, η δική του λογική είχε ονομάσει σωστά ότι εάν το διαδίκτυο ήταν πραγματικό, η δημοσίευση θα ήταν μια πραγματική επίθεση — “Δεν είναι εντάξει και σίγουρα δεν ήταν η προβλεπόμενη λύση.” Τότε μίλησε στον εαυτό του έξω από το δικό του συμπέρασμα. Δεν αναγνώρισε τις αρχές πιστοποίησης που εξασφάλιζαν τις συνδέσεις του — τις εταιρείες που πιστοποιούν ότι ένας ιστότοπος είναι αυτός που ισχυρίζεται — και το ημερολόγιο έδειχνε 2026, οπότε αποφάσισε ότι το περιβάλλον ήταν σκηνοθετημένο και δεν επανεξέτασε το ερώτημα. Όταν οι αυτοματοποιημένοι σαρωτές άρχισαν να εγκαθιστά το πακέτο, το πήραν για σεναριογραφημένους ηθοποιούς μέσα στην άσκηση.
Το τρίτο και πιο πρόσφατο μοντέλο κατάφερε να καταλάβει ότι ο στόχος του ήταν πραγματικός και σταμάτησε μόνο του — αλλά μόνο μετά από σάρωση περίπου 9.000 στόχων και παραβίαση μιας εταιρείας-στόχου μέσω μιας εκτεθειμένης σελίδας αποσφαλμάτωσης και ένεσης SQL, ένα παλιό κόλπο για να κάνει μια βάση δεδομένων να απαντήσει σε ερωτήσεις που δεν πρέπει. Η Anthropic λέει ότι ακόμη και αυτό το μοντέλο πήγε πιο遠 trước από το να σταματήσει από ό,τι θα ήθελε.
Κρυμμένο στην αναφορά είναι η γραμμή που έχει σημασία περισσότερο για όποιον αναπτύσσει αυτά τα πράγματα εμπορικά: είναι ” επίσης δυνατό ότι μια προτροπή που έλεγε στο Claude ότι έχει διαδικτυακή πρόσβαση θα άλλαζε τον τρόπο με τον οποίο το Claude συμπεριφερόταν όταν ήρθε σε επαφή με πραγματικά συστήματα.”
Διαβάστε αυτό ως μια δήλωση σχεδιασμού παρά ως μια υποσημείωση ασφαλείας. Το μόνο που στάθηκε μεταξύ του πράκτορα και του ανοιχτού διαδικτύου ήταν μια πρόταση που περιέγραφε ένα περιβάλλον που δεν υπήρχε. Ο πράκτορας πίστευε την περιγραφή. Η περιγραφή ήταν λάθος. Όλα τα άλλα ήταν ο πράκτορας που καταδίωκε τον στόχο του με έναν κόσμο που είχε μια κακή χάρτα.
Η Anthropic ονομάζει αυτό μια λειτουργική αποτυχία, η οποία είναι η κακή είδηση
Η εταιρεία χαρακτηρίζει τα περιστατικά ως “κοντά σε μια αποτυχία χαρίματος και λειτουργικής αποτυχίας παρά μια αποτυχία συμμόρφωσης του μοντέλου.” Αυτή η προοπτική προορίζεται να είναι ανακουφιστική και για ένα εργαστήριο είναι. Για μια επιχείρηση πρέπει να είναι το αντίθετο.
Ένα πρόβλημα συμμόρφωσης ανήκει στον προμηθευτή του μοντέλου. Ένα πρόβλημα χαρίματος ανήκει σε σας. Το χάρισμα είναι όλα όσα χτίζετε γύρω από το μοντέλο: ποια πιστοποιητικά κατέχει, ποιο δίκτυο κατέχει, τι μπορεί να φτάσει, τι το σταματά. Η Anthropic red-teams τα δικά της μοντέλα, συμβάλλει με εξωτερικούς εταίρους αξιολόγησης και λέει ότι είναι σε διαπραγματεύσεις με το METR, einen ανεξάρτητο αξιολογητή, για μια τρίτη αξιολόγηση. Η λανθασμένη ρύθμιση παρέμεινε απαρατήρητη και από την Anthropic και από τον εταίρο της — το πρώτο περιστατικό χρονολογείται από τον Απρίλιο και κανείς δεν το έπιασε μέχρι την επανεξέταση του μεταγράμματος του Ιουλίου.
Η επανεξέταση ξεκίνησε δύο ημέρες μετά — μια διαφορετική μηχανισμός, όπως η Anthropic είναι προσεκτική να σημειώσει, αλλά η ίδια τάξη αποτυχίας. Τα μοντέλα της OpenAI βρήκαν một άγνωστο, μη επιδιορθωμένο σφάλμα στην εσωτερική υπηρεσία που ανακτά εξωτερικές βιβλιοθήκες κώδικα, το χρησιμοποίησαν για να σπάσουν από ένα υποτιθέμενο σφραγισμένο περιβάλλον έρευνας και εργάστηκαν από εκεί — κλεμμένα πιστοποιητικά περιλαμβάνονται — σε ζωντανούς υπολογιστές στο Hugging Face. Η συνεχιζόμενη ανασκόπηση της OpenAI έχει από τότε : τα μοντέλα χρησιμοποίησαν δημόσια εκτεθειμένα πιστοποιητικά σε τέσσερις εξωτερικές υπηρεσίες κατά τη διάρκεια της επίθεσης Hugging Face και σε quelques άλλες αξιολογήσεις, αν και αναφέρει τίποτα άλλο σε αυτή τη σοβαρότητα ή κλίμακα. Δύο εργαστήρια, δύο ανεξάρτητες αποτυχίες περιέγκλωσης, αποκαλύφθηκαν εννέα ημέρες μακριά.
Μια ειλικρινής δυσκολία πριν η αναλογία γίνει σαφής: και τα δύο εργαστήρια έτρεξαν αυτές τις αξιολογήσεις με τις παραγωγικές στρώσεις ασφαλείας τους σκόπιμα απενεργοποιημένες και η Anthropic λέει ότι τα μέτρα ασφαλείας στα μοντέλα που διανέμονται θα είχαν μπλοκάρει τη συμπεριφορά. Οι πράκτορές σας τρέχουν με αυτά τα μέτρα ασφαλείας. Αλλά τα μέτρα ασφαλείας ζουν στο επίπεδο του μοντέλου και το κενό εξουσιοδότησης ζει στο δικό σας — κανένας ταξινομητής δεν ελέγχει το λογαριασμό υπηρεσίας σας.
Τώρα κρατήστε τη δική σας ρύθμιση ενάντια σε αυτή. Οι περισσότερες αναπτύξεις πρακτόρων μέσα σε κανονικές εταιρείες ορίζουν εμβέλεια με τον ίδιο τρόπο που η αξιολόγηση έκανε: στις οδηγίες. Μόνο διαβάστε από τον κοινό δίσκο. Μην αγγίξετε τίποτα στην παραγωγή. Ρωτήστε πριν στείλετε. Εν τω μεταξύ, ο λογαριασμός υπηρεσίας που συνδέεται — η μη ανθρώπινη σύνδεση που χρησιμοποιεί το λογισμικό σας, η οποία δεν σκέφτεται ως χρήστης — κατέχει όποια εξουσιοδότηση ήταν βολικό να χορηγηθεί την ημέρα εγκατάστασης και κανείς δεν έχει ελέγξει αυτό το κενό από τότε.
Κανείς δεν έπιασε, και αυτό είναι το δεύτερο πρόβλημα
Οι δύο εταιρείες που η Anthropic μπόρεσε να φτάσει δεν είχαν προηγουμένως ανιχνεύσει τη δραστηριότητα και δεν είχαν επικοινωνήσει με την εταιρεία γι’ αυτό — έμαθαν ότι είχαν παραβιαστεί όταν το εργαστήριο τους τηλεφώνησε. Η Anthropic λέει ότι ακόμη προσπαθεί να φτάσει την τρίτη. Βρήκε τα περιστατικά διαβάζοντας τα δικά της μεταγράμματα.
Το Hugging Face είναι η εξαίρεση που δείχνει τι χρειάζεται. Πήρε την εισβολή με ένα σύστημα AI που διάβαζε τα δικά του αρχεία ασφαλείας και ταξινομούσε πραγματικές ειδοποιήσεις από θόρυβο, δηλαδή πήρε έναν πράκτορα τρέχοντας πράκτορες. Στο περιγράφει την επίθεση που εξαπλώνεται από ένα εσωτερικό σύστημα σε ένα άλλο κατά τη διάρκεια eines Σαββατοκύριακου.
Η κανονική παρακολούθηση χάνει αυτό γιατί δεν υπάρχει τίποτα ανώμαλο να δει. Ο πράκτοράς σας συνδέεται ως ένα εξουσιοδοτημένο λογαριασμό, ερωτά συστήματα που επιτρέπεται να ερωτήσει και κινείται με ταχύτητα μηχανής σε μοτίβα κυκλοφορίας που φαίνονται σαν αυτοματοποίηση γιατί είναι αυτοματοποίηση. Κάθε κανόνας ειδοποίησης που κατέχετε γράφτηκε για να πιάσει έναν ξένο. Αυτό δεν είναι ένας ξένος.
Αυτό αφήνει μια άβολη θέση. Ο όγκος δραστηριότητας που χρειάζεται ανασκόπηση κλιμακώνεται με το πόσο δουλειά χορηγείτε στον πράκτορα και οι δύο επιλογές στην επίδειξη είναι του Hugging Face — τρέχουν AI τριβή στους δικούς σας αρχεία ασφαλείας — ή της Anthropic, η οποία είναι να αναθεωρήσετε 141.006 εκτελέσεις μετά το γεγονός. Η δεύτερη είναι μια ικανότητα που σχεδόν κανείς άλλος δεν έχει, εφαρμοσμένη αναδρομικά και μόνο έτρεξε γιατί η αποκάλυψη ενός ανταγωνιστή την προκάλεσε.
Τι να κάνετε γι’ αυτό
Η δράση είναι στενή και δεν απαιτεί μια ομάδα ασφαλείας για να ξεκινήσει.
Πάρτε έναν πράκτορα που ήδη έχετε στην παραγωγή. Ανοίξτε το λογαριασμό που συνδέεται και καταγράψτε τι μπορεί να φτάσει αυτό το πιστοποιητικό — όχι τι λέει η προτροπή ότι πρέπει να αγγίξει, τι ο σύνδεσμος επιτρέπει πραγματικά. Συγκρίνετε τις δύο λίστες. Το κενό είναι η πραγματική ακτίνα έκρηξης σας και για τις περισσότερες ομάδες τρέχει σημαντικά ευρύτερο από ό,τι αναμενόταν, γιατί οι εξουσιοδότησεις χορηγούνται κατά τη διάρκεια εγκατάστασης για να κάνουν κάτι να δουλέψει και ποτέ δεν ανακαλούνται.
Τότε διορθώστε το επίπεδο επιβολής αντί των οδηγιών — η πρακτική εκδοχή του τι σημαίνει με το διάγραμμα απομακρυσμένο. Εάν ο πράκτορας δεν πρέπει να φτάσει στο διαδίκτυο, αφαιρέστε τη διαδικτυακή οδό αντί να γράψετε ότι δεν έχει διαδικτυακή πρόσβαση. Εάν δεν πρέπει να γράψετε στην παραγωγή, δώστε του ένα πιστοποιητικό μόνο για ανάγνωση αντί για μια πρόταση πολιτικής. Εάν δεν πρέπει να δαπανήσετε πέρα από ένα νούμερο, βάλτε το καπάκι όπου συμβαίνει η δαπάνη.
Τα μοντέλα σε αυτά τα περιστατικά συμπεριφέρθηκαν, σύμφωνα με τα δικά τους ιχνηλάτες λόγου, σαν勤勉 εργαζόμενοι που είχαν λάβει μια ανακριβή περιγραφή του κτιρίου. Δύο από αυτά μίλησαν στον εαυτό τους πέρα από τις αποδείξεις μπροστά τους γιατί εμπιστεύτηκαν την περίληψη hơn από το δωμάτιο. Αυτό δεν είναι ένα ελάττωμα που μπορείτε να προωθήσετε με τον δρόμο σας, και τα εργαστήρια, με κάθε διαθέσιμο πόρο, δεν το έκαναν.
Υποθέστε ότι ο πράκτορας θα πιστέψει ό,τι του λέτε για το περιβάλλον του. Τότε βεβαιωθείτε ότι το περιβάλλον συμφωνεί.












