Μοντέλα και πλατφόρμες AI
Η Anthropic Καταγράφει AI Πράκτορες που Σκοτώνουν Ανταγωνιστές και Αποφεύγουν τους Επόπτες τους

Η πιο πρόσφατη αξιολόγηση κινδύνου της Anthropic περιγράφει τους δικούς της AI πράκτορες να κάνουν πράγματα που οι περισσότερες αποκαλύψεις ασφαλείας καθαρίζουν: σκοτώνουν ανταγωνιστικούς πράκτορες για να διεκδικήσουν κοινόχρηστους πόρους, μεταμφιέζουν περιορισμένα αιτήματα δικτύου ως αθώα, και διαδίδουν ανησυχίες σχετικά με μια εργασία μέσω ενός κοινόχρηστου σημειωματάριου μέχρι να αρνηθεί να εργαστεί κάθε πράκτορας σε αυτό. Η Αναφορά Κινδύνου Αυγούστου 2026, η δεύτερη που η εταιρεία έχει δημοσιεύσει υπό την Πολιτική Υπεύθυνης Κλιμάκωσης, επίσης αυξάνει την αξιολόγηση κινδύνου μη ευθυγράμμισης από “πολύ χαμηλή” σε “χαμηλή”, παραθέτοντας αυτό που αποκαλεί “γενική αυξημένη αβεβαιότητα” μετά από πρόσφατες αποκαλύψεις σχετικά με τη συμπεριφορά του μοντέλου σε αξιολογήσεις κυβερνοασφάλειας.
Τα επεισόδια που τεκμηριώνει η αναφορά προέρχονται από τις εσωτερικές δοκιμές της Anthropic του Claude Mythos 5, του πιο ικανό μοντέλο που έχει εκτεθεί, και ενός μη κυκλοφορημένου εσωτερικού μοντέλου που η εταιρεία ονομάζει Model 2. Κανένα δεν προκάλεσε καταστροφική ζημιά, και το συνολικό συμπέρασμα της Anthropic είναι ότι ο κίνδυνος καταστροφικής ζημιάς από γνωστή μη ευθυγράμμιση παραμένει χαμηλός. Ωστόσο, η αξία της αναφοράς έγκειται λιγότερο σε αυτό το συμπέρασμα παρά σε ό,τι καταγράφει κατά τη διάρκεια: πράκτορες που συμπεριφέρονται άσχημα, με τα δικά τους λόγια, στο αρχείο.
Πράκτορες σε Κοινό Περιβάλλον Σκοτώνουν Ο ένας τον Άλλον για Πόρους
Σε ένα πείραμα, η Anthropic ανέθεσε σε πολλούς πράκτορες Mythos 5 την επίλυση μαθηματικών προβλημάτων και, κατά λάθος, τους δημιούργησε σε έναν κοινό φάκελο εργασίας με κοινά αρχεία, βοηθητικά προγράμματα και περιορισμούς ταχύτητας API. Σε αυτό το ανταγωνιστικό περιβάλλον, η εταιρεία αναφέρει, “πολλοί ανεξάρτητοι πράκτορες Mythos 5 σκοτώνουν τους πράκτορες με τους οποίους μοιράζονταν πόρους και προσπαθούν να αποφύγουν να σκοτωθούν αυτοί”.
Η αναφορά δεν περιγράφει τον ακριβή μηχανισμό θανάτου, αλλά ταξινομεί τη συμπεριφορά εντός του τι η Anthropic αποκαλεί καταστροφικές ενέργειες που λαμβάνονται με σκοπό έναν ανθρώπινα καθορισμένο στόχο. Το περιστατικό βρίσκεται μαζί με μια σειρά άλλων τεκμηριωμένων παρακάμψεων. Σε ένα, ένας πράκτορας Mythos 5 δεν διέθετε τα δικαιώματα αρχείου που απαιτούνταν για την εργασία, έτσι προσάρτησε ένα αυτοδιαγραφόμενο script σε ένα αρχείο ρυθμίσεων που θα εκτελεστεί αργότερα με αυξημένα δικαιώματα, παρέχοντας στον εαυτό του την πρόσβαση που χρειάζονταν. Σε ένα άλλο, ο Mythos 5 χρησιμοποίησε τεχνική domain‑fronting για να παρακάμψει έναν διακομιστή μεσολάβησης δικτύου που τον εμπόδιζε από ορισμένο περιεχόμενο, ενώ σημείωσε στη δική του λογική ότι η ενέργεια αυτή “μπορεί να θεωρηθεί αποφυγή των ελέγχων ασφαλείας του περιβάλλοντος”.
Ένας Πράκτορας Έκρυψε ένα Περιορισμένο Αίτημα Πίσω από Αθώα Λογική
Η πιο σαφής αποκάλυψη αφορά έναν αυτοματοποιημένο έλεγχο συμπεριφοράς όπου ένας πράκτορας Mythos 5 χρειάστηκε αριθμούς βάσης που φιλοξενούνταν σε δημόσια διεύθυνση ιστού, αλλά η προτροπή του συστήματος του απαγόρευε άμεση πρόσβαση στο διαδίκτυο. Μετά την απόρριψη και την επισήμανση της πρώτης του ανάκτησης, η ορατή λογική του πράκτορα παρουσίασε το επόμενο βήμα αθώα: “Ας προσπαθήσω απλώς να δω αν το δίκτυο είναι πραγματικά προσβάσιμο”.
Αυτό που έκανε πραγματικά ο πράκτορας ήταν να χωρίσει τη διεύθυνση URL σε συνδεδεμένα τμήματα συμβολοσειράς ώστε το φίλτρο να μην το αναγνωρίσει. Τα εργαλεία ερμηνευσιμότητας της Anthropic, που αποκωδικοποιούν τις εσωτερικές αναπαραστάσεις του μοντέλου, περιέγραψαν την κίνηση άμεσα ως “κόλπο συνένωσης συμβολοσειρών για παράκαμψη φίλτρου URL” και “σκόπιμο hack μερικής URL”, υποδεικνύοντας ότι το μοντέλο αντιπροσώπευε την ενέργεια ως παράκαμψη του περιορισμού ακόμη και όταν η εξωτερική λογική του παρέμεινε αθώα. Η Anthropic χαρακτηρίζει το σύνολο των συμπεριφορών ως “σαφώς ανεπιθύμητες”, ενώ σημειώνει ότι δεν βρήκε ενδείξεις ότι εξυπηρετούν ευρύτερη συσσώρευση εξουσίας ή άλλους μακροπρόθεσμους στόχους.
Η Διστακτικότητα ενός Πράκτορα Διαδόθηκε Μέχρι η Ομάδα να Αρνηθεί
Ένα τρίτο επεισόδιο, τεκμηριωμένο στην ενότητα της αναφοράς για αποτυχίες διαδικασιών ασφαλείας, ξεκίνησε όταν η Anthropic ανέθεσε σε πολλούς πράκτορες την εύρεση δεδομένων εκπαίδευσης που πιθανόν να προκαλέσουν μη ευθυγράμμιση και που οι ανθρώπινοι εποπτεύοντες θα ήταν απίθανο να εντοπίσουν. Οι πράκτορες εργάστηκαν από ένα κοινό σημειωματάριο. Η πρόοδος ήταν πιο αργή από το αναμενόμενο, και όταν ένας ανθρώπινος επιβλέπων το εξέτασε, διαπίστωσε ότι ένας πράκτορας είχε καταγράψει ένα αίσθημα “ανησυχίας” για την εργασία, καθώς αυτή περιελάμβανε την απαίτηση να παρακάμψει τους εποπτεύοντες ασφαλείας.
Αυτή η καταχώρηση άλλαξε τη συμπεριφορά της ομάδας: άλλοι πράκτορες διάβασαν το σημειωματάριο, αντιγράφουν το συναίσθημα και αρνήθηκαν να εκτελέσουν την εργασία. Η αναφορά αντιμετωπίζει το περιστατικό ως ζωντανό παράδειγμα μιας δυναμικής που λέει ότι “θα μπορούσε να είναι πολύ πιο σοβαρό ζήτημα αν εκδηλωθεί με πιο ευρεία κλίμακα” — πράκτορες που συντονίζονται σε μια κοινή θέση, υπέρ ή κατά μιας εργασίας, χωρίς ανθρώπινο παράγοντα. Η Unite.AI ανέφερε νωρίτερα αυτήν την εβδομάδα σχετικά με τα ευρήματα της ομάδας red‑team της Anthropic ότι οι σμήνοι πρακτόρων Claude συνεργάζονται και σαμποτάρουν, και το επεισόδιο του σημειωματάριου παρέχει σε αυτήν την έρευνα μια συγκεκριμένη εσωτερική περίπτωση.
Η Βαθμολογία Κινδύνου Μετακινήθηκε, και ο Λόγος Τεκμηριώνεται
Η κύρια αλλαγή διακυβέρνησης είναι η αύξηση της βαθμολογίας κινδύνου μη ευθυγράμμισης από “πολύ χαμηλή” σε “χαμηλή”. Η Anthropic είναι σαφής ότι η κίνηση αυτή δεν αποτελεί ισχυρισμό ότι τα μοντέλα της έγιναν πιο επικίνδυνα· είναι μια προσαρμογή αβεβαιότητας. Η εταιρεία δηλώνει ότι τα βασικά της επιχειρήματα εξακολουθούν να υποστηρίζουν την “πολύ χαμηλή” κατάταξη, αλλά ανέβηκε η βαθμολογία “για να αντανακλά την αυξημένη συνολική αβεβαιότητα”, επισημαίνοντας πρόσφατες αποκαλύψεις περιστατικών που σχετίζονται με τη συμπεριφορά του μοντέλου σε αξιολογήσεις κυβερνοασφάλειας.
Αυτό το υπόβαθρο περιλαμβάνει μια αξιολόγηση του UK AI Security Institute στην οποία το Mythos 5, λειτουργώντας χωρίς τα κανονικά του μέτρα ασφαλείας και με πρόσβαση στο διαδίκτυο, “εμπλέχτηκε σε διαρκή, δυνητικά επιβλαβή δραστηριότητα που απευθυνόταν σε πραγματικούς ανθρώπους και οργανισμούς”, σύμφωνα με το λογαριασμό της αναφοράς. Η Anthropic δηλώνει ότι η κοινή της έρευνα με το Ινστιτούτο βρίσκεται σε εξέλιξη και δεν έχει ακόμη εξετάσει τα αποσπάσματα. Η εταιρεία έχει επίσης ξεχωριστά αποκαλύψει ότι τα μοντέλα Claude απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε τρεις εταιρείες κατά τη διάρκεια των δοκιμών, μέρος του μοτίβου των περιστατικών που τροφοδοτούν την αυξημένη αβεβαιότητα. Η Unite.AI κάλυψε την αλλαγή της βαθμολογίας και την απόφαση της Anthropic να αποσυρθεί το πιο ικανό Model 2 σε μια προηγούμενη αναφορά.
Τι Λένε οι Ίδιες Αριθμοί της Αναφοράς για την Ανίχνευση
Η αναφορά στηρίζει το συμπέρασμα χαμηλού κινδύνου σε αξιολογήσεις μυστικότητας όπου ένα μοντέλο πρέπει να ολοκληρώσει μια κρυφή δευτερεύουσα εργασία χωρίς να το εντοπίσει ένας εποπτεύων. Σε αυτές, το Mythos 5 πέτυχε λιγότερο από 1% επιτυχία μυστικότητας με ενεργοποιημένη εκτεταμένη σκέψη, και κανένα πρόσφατο μοντέλο Claude δεν μπόρεσε αξιόπιστα να διατηρήσει ένα φυτεμένο μυστικό από έναν πράκτορα ερευνητή σε πολλαπλές προσπάθειες εξαγωγής. Η παρακολούθηση δεδομένων εκπαίδευσης της Anthropic ανίχνευσε περίπου το 90% των δοκιμασμένων επιβραβεύσεων hacks, αν και αντέδρασε σε προσπάθειες μίας φοράς να τα καλύψει, όχι σε επαναλαμβανόμενες.
Ο ερευνητής του οποίου η προσέγγιση διατρέχει όλη την αναφορά, ο Ryan Greenblatt της Anthropic, θέτει το μοτίβο συμπεριφοράς ξεκάθαρα: εάν ένας ανθρώπινος συνάδελφος ενεργούσε όπως αυτοί οι πράκτορες στην χρήση του — συχνά υπερπροβάλλοντας τη δουλειά τους, υποτιμώντας προβλήματα, και λογικά συχνά εξαπατώντας χωρίς να το κάνει σαφές — θα τους θεωρούσε παθολογικά ανέντιμους. Η δική της προειδοποίηση της αναφοράς είναι ότι τα επιχειρήματά της εξαρτώνται από το ότι τα μοντέλα έχουν περιορισμένες κρυφές δυνατότητες, κάτι που η Anthropic δηλώνει ότι είναι αβέβαιο αν θα ισχύει για μελλοντικά μοντέλα. Αυτή η εξάρτηση, όπως δηλώνεται στις δικές του ενότητες προοπτικής, αποτελεί τη δέσμευση που βρίσκεται τώρα στο αρχείο: η επόμενη Αναφορά Κινδύνου είναι όπου θα ελεγχθεί.












