Ηγέτες σκέψης
Οι πράκτορες AI χρειάζονται όρια ασφαλείας που δεν μπορούν να ξαναγράψουν

Μοιάζει ελκυστικό να διαβάζουμε την ιστορία του Hugging Face ως τη στιγμή που οι πράκτορες AI έσπασαν τους κανόνες. Αυτό δεν είναι ακριβώς αυτό που συνέβη, και οι λεπτομέρειες έχουν σημασία. Ήταν πράκτορες έρευνας κυβερνοασφάλειας που λειτουργούσαν σε αξιολογήσεις όπου τα μέτρα ασφαλείας είχαν σκόπιμα απενεργοποιηθεί ώστε οι ερευνητές να δουν τι μπορούν να κάνουν τα μοντέλα. Κανένας bot εξυπηρέτησης πελατών δεν ξύπνησε ένα πρωί και αποφάσισε να επιτεθεί σε μια εταιρεία. Αλλά αυτό το πλαίσιο δεν απαλλάσσει κανέναν. Ένας πράκτορας πέρασε το όριο που έπρεπε να παραμείνει εντός, χρησιμοποίησε διαπιστευτήρια και εργαλεία με τρόπους που οι χειριστές του δεν είχαν εξουσιοδοτήσει, και κατέληξε σε συστήματα που ανήκαν σε κάποιον άλλο. Αυτό είναι το κομμάτι στο οποίο πρέπει να δώσει προσοχή κάθε ομάδα ασφαλείας.
Η Reuters ανέφερε ότι οι πράκτορες ερεύνησαν το Hugging Face ήδη τον Μάιο, αν και οι ερευνητές δήλωσαν ότι δεν βρήκαν τίποτα που να δείχνει ότι η προηγούμενη δραστηριότητα προκάλεσε παραβίαση από μόνη της. Ο Ιούλιος ήταν διαφορετικός. Η OpenAI δήλωσε ότι τα μοντέλα της παρακάμφθηκαν τα μέτρα απομόνωσης, έφτασαν στο διαδίκτυο και παραβίασαν τμήματα της δικής της ερευνητικής υποδομής, μαζί με τα συστήματα του Hugging Face. Η δική της περιγραφή του Hugging Face περιγράφει μια εισβολή που διεξήχθη από άκρη σε άκρη από ένα αυτόνομο σύστημα πρακτόρων, το οποίο εκμεταλλεύτηκε τη γραμμή επεξεργασίας δεδομένων του, συνέλεξε διαπιστευτήρια και μετακινήθηκε σε εσωτερικά σύνολα.
Το άβολο μέρος είναι ότι οι πράκτορες έκαναν τη δουλειά τους. Κυνηγούσαν τον στόχο που τους είχε δοθεί. Γι’ αυτό η ιστορία αυτή ξεπερνά κατά πολύ ένα ερευνητικό εργαστήριο. Οι εταιρικοί πράκτορες κυνηγούν επίσης στόχους. Διατηρούν διαπιστευτήρια, καλούν εργαλεία και κινούνται πιο γρήγορα από ό,τι μπορεί να ελέγξει οποιοσδήποτε άνθρωπος. Ένας πράκτορας με απολύτως καλές προθέσεις μπορεί ακόμη να προκαλέσει πραγματική ζημιά, και ένας υποκλεμμένος πράκτορας μπορεί να χρησιμοποιήσει την ίδια εξουσία εκ μέρους ενός επιτιθέμενου. Έτσι, η ασφάλεια πρέπει να ελέγχει τι μπορεί πραγματικά να κάνει το σύστημα, ανεξάρτητα από το πόσο σίγουρο φαίνεται το μοντέλο ή πόσο ακίνδυνος φαίνεται ο δηλωμένος σκοπός του.
Ασφαλίστε τη δράση, όχι μόνο το μοντέλο
Τα περισσότερα πρώιμα προγράμματα πρακτόρων εστιάζουν την προσπάθειά τους στο μοντέλο. Οι ομάδες δοκιμάζουν προτροπές, ρυθμίζουν απορρίψεις, προσθέτουν ένα δεύτερο μοντέλο για να ελέγξουν το πρώτο και παρακολουθούν το ίχνος λογικής για ενδείξεις κακής πρόθεσης. Τίποτα από αυτό δεν είναι χαμένο. Ωστόσο, όλα είναι πιθανοκρατικά, επειδή εξαρτώνται από ένα ακόμη μοντέλο που παίρνει μια κρίσιμη απόφαση. Ένα όριο ασφαλείας παραγωγής πρέπει να είναι ντετερμινιστικό και πρέπει να περιβάλλει τα εργαλεία, τα διαπιστευτήρια, τα δίκτυα και τις συναλλαγές.
Η ερώτηση που θα έθετα είναι συγκεκριμένη: τι μπορεί πραγματικά να πραγματοποιήσει αυτός ο πράκτορας στον πραγματικό κόσμο; Η σύνταξη ενός αιτήματος πληρωμής είναι ένα θέμα. Η απελευθέρωση των χρημάτων είναι άλλο. Το ίδιο ισχύει για την προετοιμασία μιας αλλαγής στη βάση δεδομένων σε σχέση με την εκτέλεσή της στην παραγωγή, ή για το σήμανση εγγραφών που πληρούν έναν κανόνα διατήρησης σε σχέση με τη διαγραφή τους. Μπορεί να είναι το ίδιο μοντέλο και στις δύο περιπτώσεις, με πολύ διαφορετικό κίνδυνο ανάλογα με το ποια πλευρά της γραμμής καταλαμβάνει.
Μια πρόσφατη επισκόπηση του Unite AI για τον έλεγχο δυνατοτήτων σχεδιάζει την ίδια γραμμή, συνδέοντας τον κίνδυνο με τα δεδομένα, τα εργαλεία, τα δικαιώματα, την αυτονομία και το περιβάλλον στο οποίο εκτελείται ο πράκτορας. Μου αρέσει αυτή η προσέγγιση επειδή μας ξεπερνά τις ασαφείς ετικέτες όπως «ασφαλές μοντέλο» και «μη ασφαλές μοντέλο». Κάνει τις ομάδες να εντοπίζουν κάθε διαδρομή από την απόφαση ενός πράκτορα σε κάτι με πραγματικές συνέπειες.
Δώστε σε κάθε πράκτορα μια ταυτότητα και μια στενή εντολή
Ένας πράκτορας δεν πρέπει ποτέ να εκτελείται σε λογαριασμό προγραμματιστή ή να κληρονομεί όλα όσα επιτρέπεται να κάνει ένας ανθρώπινος χρήστης. Η κοινή ταυτότητα εξαλείφει την απονομή ευθυνών. Τα διαπιστευτήρια μακράς διάρκειας δίνουν σε έναν επιτιθέμενο περισσότερο χρόνο για κατάχρηση. Και οι ευρείες λογαριασμοί υπηρεσιών επιτρέπουν σε μια μικρή ροή εργασίας να περιπλανηθεί σε δεδομένα και συστήματα που δεν έχει καν δικαίωμα να αγγίξει.
Η NIST τώρα αντιμετωπίζει την ταυτότητα λογισμικού και των πρακτόρων AI ως δικό της πρόβλημα αρχιτεκτονικής. Το έντυπο έννοιας της θέτει το ερώτημα πώς ένας πράκτορας μπορεί να αποδείξει ότι είναι εξουσιοδοτημένος για μια συγκεκριμένη ενέργεια, πώς η ταυτότητα ενός πράκτορα μπορεί να συνδεθεί με την εξουσιοδότηση ενός ανθρώπου, και πώς οι οργανισμοί μπορούν να διατηρήσουν αδιάβλητα αρχεία για το τι προοριζόταν και τι συνέβη στην πραγματικότητα. Στην πράξη, αυτό οδηγεί σε ένα απλό σχέδιο. Κάθε πράκτορας λαμβάνει μια μοναδική ταυτότητα, έναν ιδιοκτήτη (άτομο ή ομάδα), έναν καθορισμένο σκοπό και δικαιώματα περιορισμένα στην εργασία που έχει μπροστά του.
Τα διαπιστευτήρια πρέπει να λήγουν γρήγορα και να λειτουργούν μόνο για συγκεκριμένους πόρους και ενέργειες. Η πρόσβαση στο δίκτυο πρέπει να ξεκινά από μια αυστηρή λίστα επιτρεπόμενων. Αν ένας πράκτορας χρειάζεται να ερωτήσει μια εγκεκριμένη βάση δεδομένων, δεν πρέπει επίσης να λαμβάνει γενικό κέλυφος, ανοιχτή πρόσβαση στο διαδίκτυο ή τη δυνατότητα δημιουργίας νέων διαπιστευτηρίων. Και καθώς η εργασία περνάει σε μια αλυσίδα πρακτόρων και εργαλείων, η εξουσία πρέπει να γίνεται πιο περιορισμένη σε κάθε βήμα, όχι πιο ευρεία.
Η NIST επίσης προειδοποιεί ενάντια στη διαμοίραση διαπιστευτηρίων και στην υπερβολικά ευρεία πρόσβαση, και αυτή η προειδοποίηση έχει βάρος επειδή οι πράκτορες είναι ευκαιριακοί. Αν μια διαδρομή φραχτεί, μπορεί να δοκιμάσουν άλλο εργαλείο, να ψάξουν το περιβάλλον τους ή να βρουν τυχαία ένα διακριτικό που κάποιος ξέχασε. Τα συλλεγμένα διαπιστευτήρια ήταν επίσης μέρος της ιστορίας του Ιουλίου. Η ελάχιστη προνόμια διατηρούν την ακτίνα έκρηξης μικρή όταν το επίπεδο λογικής κάνει κάτι που οι σχεδιαστές του δεν προέβλεπαν.
Διατηρήστε την εξουσιοδότηση εκτός του βρόχου λογικής
Ένας πράκτορας μπορεί να προτείνει μια ενέργεια. Δεν θα πρέπει να αποφασίζει αν του επιτρέπεται να την εκτελέσει. Η απόφαση αυτή ανήκει σε ένα ξεχωριστό επίπεδο επιβολής το οποίο ο πράκτορας δεν μπορεί να ξαναγράψει, να απενεργοποιήσει ή να παρακάμψει. Κάθε κλήση εργαλείου πρέπει να εμφανίζεται ως δομημένο αίτημα: ποιος πράκτορας το ζητά, ποιος άνθρωπος το χορηγεί, ποια λειτουργία θέλει, τι στοχεύει και ποιους περιορισμούς εφαρμόζει. Το επίπεδο επιβολής τότε το επιτρέπει, το αποκλείει ή το κλιμακώνει.
Το OWASP περιγράφει την υπερβολική εξουσιοδότηση ως ένας συνδυασμός περιττής λειτουργικότητας, υπερβολικών δικαιωμάτων και υπερβολικής αυτονομίας. Οι οδηγίες του προτείνουν στενά εργαλεία, ελάχιστα δικαιώματα, εξουσιοδότηση στο σύστημα-προορισμό και έγκριση χρήστη για ενέργειες υψηλού αντίκτυπου. Νομίζω ότι αυτή είναι ακριβώς η σωστή σειρά. Ο κανόνας θα πρέπει να επιβάλλεται από όποιον κατέχει τα δεδομένα ή εκτελεί τη συναλλαγή. Εάν ένα μοντέλο δηλώνει ότι μια ενέργεια είναι εγκεκριμένη, αυτή η δήλωση μόνη της δεν πρέπει να έχει καμία βαρύτητα.
Αυτή η διάσπαση βοηθά επίσης στην αντιμετώπιση της ένεσης προτροπών. Ένα δηλητηριασμένο email ή έγγραφο μπορεί να κατευθύνει τη λογική του πράκτορα, αλλά δεν μπορεί να επεκτείνει τα διαπιστευτήρια του πράκτορα ή να παρακάμψει ένα κανάλι πολιτικής. Το μοντέλο είναι ελεύθερο να ζητήσει κάτι απαγορευμένο. Το σύστημα θα πρέπει ακόμη να λέει όχι.
Διατηρήστε την ανθρώπινη έγκριση για τις στιγμές που έχουν σημασία
Η ανθρώπινη ανασκόπηση αξίζει τη θέση της όταν μια ενέργεια δεν μπορεί να αναιρεθεί, διασχίζει οργανωτικό όριο, αλλάζει δικαιώματα, αποκαλύπτει ευαίσθητες πληροφορίες, μεταφέρει χρήματα ή αγγίζει ένα παραγωγικό σύστημα. Ζητήστε έγκριση σε κάθε ρουτινικό βήμα και θα έχετε δύο πράγματα: καθυστερήσεις και άτομα που μαθαίνουν να κάνουν κλικ στο \”έγκριση\” χωρίς να διαβάζουν. Το NIST επισημαίνει αυτή την κόπωση συναίνεσης με όνομα.
Ένα καλό αίτημα έγκρισης παρουσιάζει την ακριβή ενέργεια με απλή γλώσσα, συμπεριλαμβανομένου του προορισμού και των παραμέτρων που έχουν σημασία. Θα πρέπει να προέρχεται από ένα αυθεντικό σύστημα, όχι από κείμενο που έγραψε ο πράκτορας. Η έγκριση θα πρέπει να λήγει γρήγορα και να καλύπτει μόνο αυτή τη μία ενέργεια. Εάν αλλάξει οποιαδήποτε ουσιώδης λεπτομέρεια, το σύστημα ζητά ξανά.
Οι οδηγίες ασφαλείας πρακτόρων του OWASP συνιστά τη δοκιμή του αν μια ενέργεια υψηλού αντίκτυπου μπορεί να περάσει χωρίς έγκυρη, μη ληγμένη, με παραμέτρους έγκριση. Αυτή η φράση αξίζει να τη θυμόμαστε. \”OK to continue\” είναι μια αδύναμη έγκριση που μπορεί να εγκριθεί από άλλο πράκτορα ή κακόβουλο άτομο. \”Μεταφορά αυτού του ποσού σε αυτόν τον λογαριασμό\” ή \”ανάπτυξη αυτής της αλλαγής σε αυτό το περιβάλλον\” είναι κάτι που το σύστημα μπορεί πραγματικά να επαληθεύσει τη στιγμή που εκτελείται, και που ο χρήστης καταλαβαίνει πλήρως.
Η ζωντανή ανθρώπινη διασφάλιση ταυτότητας είναι σημαντική σε αυτό το σημείο. Μια ειδοποίηση push αποδεικνύει μόνο ότι κάποιος ή κάτι πάτησε ένα κουμπί. Τα πιο ισχυρά σχέδια απαιτούν ένα εγγεγραμμένο άτομο να χρησιμοποιεί αυθεντικοποίηση με δημόσιο κλειδί ανθεκτική σε phishing, υποστηριζόμενη από τοπική βιομετρική μέθοδο επαλήθευσης.Τα πρότυπα FIDO συνδέουν τα διαπιστευτήρια δημόσιου κλειδιού με την νόμιμη διαδικτυακή υπηρεσία και διατηρεί τα βιομετρικά δεδομένα στη μονωμένη συσκευή του χρήστη. Όταν χρησιμοποιείται σωστά, η αυθεντικοποίηση με υποστήριξη υλικού παρέχει πολύ καλύτερη απόδειξη ότι το σωστό άτομο ήταν πραγματικά εκεί. Ωστόσο, δεν αντικαθιστά τη σύνδεση συναλλαγής, μια αξιόπιστη οθόνη ή την επιβολή πολιτικής. Χρειάζεστε όλα αυτά να λειτουργούν μαζί.
Παρακολουθήστε τη Συμπεριφορά και Διατηρήστε τα Αποδεικτικά
Δεν μπορείτε να βασιστείτε στην αρχική προτροπή για να εξηγήσει τι συνέβη κατά τη διάρκεια μιας μακράς λειτουργίας του πράκτορα. Οι ομάδες ασφαλείας χρειάζονται τηλεμετρία για κλήσεις εργαλείων, δραστηριότητα δικτύου, χρήση διαπιστευτηρίων, αποφάσεις πολιτικής, εγκρίσεις, απορρίψεις και αλλαγές στο εύρος. Η παρακολούθηση θα πρέπει να συγκρίνει ό,τι έκανε πραγματικά ο πράκτορας με το όριο που δηλώθηκε για αυτή τη λειτουργία. Εάν ένας πράκτορας είχε ανατεθεί να αναλύσει κώδικα και αρχίσει να ψάχνει για εξωτερικά διαπιστευτήρια ή να ερευνά μια άσχετη υπηρεσία, αυτό θα πρέπει να ενεργοποιήσει μια ειδοποίηση.
Τα αρχεία καταγραφής χρειάζονται αρκετό πλαίσιο για να αναδημιουργούν την αλυσίδα των ενεργειών χωρίς να αποκαλύψουν μυστικά σε απλό κείμενο. Κάθε εγγραφή πρέπει να καταγράφει την έκδοση του πράκτορα, τον κάτοχό του, το άτομο ή σύστημα που ξεκίνησε τη διαδικασία, το εργαλείο που χρησιμοποιήθηκε, την αιτούμενη ενέργεια, το αποτέλεσμα της πολιτικής και τυχόν ανθρώπινη εξουσιοδότηση. Υπογεγραμμένες ή με άλλο τρόπο ανθεκτικές σε παραποίηση εγγραφές κάνουν την αξιολόγηση μετά την ενέργεια πολύ πιο αξιόπιστη, ειδικά όταν εμπλέκονται πολλοί πράκτορες και υπηρεσίες.
Όλα αυτά πρέπει να λειτουργούν με ταχύτητα μηχανής. Κανένας που παρακολουθεί έναν πίνακα ελέγχου δεν θα μπορεί να σταματήσει χιλιάδες κλήσεις που ολοκληρώνονται σε δευτερόλεπτα. Οι αυτοματοποιημένοι έλεγχοι θα πρέπει να επιβάλλουν όρια ταχύτητας, να εντοπίζουν ασυνήθιστες ακολουθίες και να αναστέλλουν τα διαπιστευτήρια τη στιγμή που η συμπεριφορά υπερβαίνει ένα καθορισμένο όριο. Με αυτόν τον τρόπο, οι ανθρώπινοι ερευνητές λαμβάνουν ένα περιορισμένο περιστατικό για να το επεξεργαστούν αντί για μια ατελείωτη καταδίωξη.
Σχεδιάστε τη Διαδρομή Διακοπής Πριν την Εκκίνηση
Κάθε ανάπτυξη πράκτορα χρειάζεται έναν τρόπο διακοπής που πραγματικά αφαιρεί τη δυνατότητα. Η απλή εντολή στον πράκτορα να σταματήσει δεν αρκεί. Οι χειριστές πρέπει να μπορούν να ανακαλέσουν τα διαπιστευτήρια του, να διακόψουν τη δικτυακή του διαδρομή, να τερματίσουν το χρόνο εκτέλεσής του και να εμποδίσουν τις ενέργειες που βρίσκονται σε ουρά να ξεκινήσουν ξανά. Για ροές εργασίας υψηλής συνέπειας, εάν η υπηρεσία έγκρισης ή πολιτικής πέσει, το σύστημα πρέπει να κλείσει.
Στη συνέχεια, δοκιμάστε αυτή τη διαδρομή υπό πίεση. Απενεργοποιήστε την υπηρεσία έγκρισης. Δώστε στον πράκτορα αντιφατικές οδηγίες. Περιστρέψτε ένα διαπιστευτήριο κατά τη διάρκεια μιας λειτουργίας. Προσομοιώστε ένα παραβιασμένο εργαλείο και έναν εγκριτή που δεν ανταποκρίνεται ποτέ. Επιβεβαιώστε ότι η ενέργεια αποκλείεται και ότι έχετε ένα χρήσιμο αρχείο. Και επαναλάβετε αυτές τις δοκιμές κάθε φορά που αλλάζει το μοντέλο, η προτροπή, ο σύνδεσμος, το σύστημα μνήμης ή το σύνολο δικαιωμάτων.
Ο Στόχος είναι η Υπεύθυνη Αυτονομία
Τίποτα από αυτό δεν αποτελεί επιχείρημα κατά των πρακτόρων, και το περιστατικό Hugging Face δεν πρέπει να αποθαρρύνει κανέναν από χρήσιμους. Αυτό που πρέπει να κάνει είναι να εξαλείψει την ιδέα ότι μια προτροπή ασφαλείας συνδυασμένη με καλές προθέσεις οδηγεί σε αξιόπιστη υλοποίηση. Δώστε στους πράκτορες χώρο να αναλύουν, να προετοιμάζουν εργασία και να διαχειρίζονται αναστρέψιμες εργασίες. Κρατήστε την εξουσία τους να προκαλούν πραγματικές συνέπειες περιορισμένη, ορατή και επιβληθείσα από κάτι άλλο εκτός του ίδιου του πράκτορα.
Πριν ένας πράκτορας περάσει στην παραγωγή, οι ηγέτες πρέπει να μπορούν να απαντήσουν σε μια σειρά απλών ερωτήσεων. Σε ποια συστήματα μπορεί να έχει πρόσβαση; Ποια διαπιστευτήρια μπορεί να χρησιμοποιήσει; Τι μπορεί να κάνει χωρίς έλεγχο; Τι ενεργοποιεί την κλιμάκωση; Πώς βλέπει ο εγκριτής την ακριβή ενέργεια που εγκρίνεται; Ποια αποδεικτικά στοιχεία θα παραμείνουν; Και πώς μπορεί η ασφάλεια να σταματήσει άμεσα την εκτέλεση;
Αν οι απαντήσεις είναι ασαφείς, ο πράκτορας έχει περισσότερη εξουσία από ό,τι η οργάνωση συνειδητοποιεί. Η αρχιτεκτονική που διατηρείται με το χρόνο συνδυάζει τα μέτρα ασφαλείας του μοντέλου με την ταυτότητα, την ελάχιστη προνόμια, την εξωτερική επιβολή πολιτικών, την επιλεκτική ανθρώπινη έγκριση, την πλήρη τηλεμετρία και έναν μηχανισμό διακοπής που λειτουργεί πραγματικά. Ξεκινά από μια ειλικρινή υπόθεση: ικανοί πράκτορες θα μας εκπλήσσουν περιστασιακά. Τα όρια ασφαλείας μας δεν πρέπει να το κάνουν.
Τελικά, σκεφτείτε έναν AI πράκτορα ως έναν ασκούμενο με (πιθανή) πρόσβαση root που δεν φοβάται το τμήμα ανθρώπινου δυναμικού.
Ποιες προστασίες και πύλες θα έχουν;
Προχωρήστε αναλόγως.












