Κυβερνοασφάλεια
Η Goodfire αναπτύσσει Κυβερνο‑Παρατηρητές Βασισμένους σε Διερευνήσεις για τα Kimi K3 και GLM 5.3

Η Goodfire στις 8 Οκτωβρίου 2026 δημοσίευσε Εκπαίδευση και Ανάπτυξη Παραγωγικών Κυβερνο‑Παρατηρητών στο Kimi K3, μια ερευνητική ανάρτηση που περιγράφει τους κυβερνο‑παρατηρητές για τα ανοιχτά μοντέλα Kimi K3 και GLM 5.3 που η εταιρεία έχει αναπτύξει σε μια παραγωγική στοίβα επαγωγών. Η Goodfire αναφέρει ότι οι παρατηρητές ταιριάζουν με την ανάκληση ενός δικαστή LLM στο σημείο λειτουργίας της εταιρείας, ενώ κοστίζουν περίπου 50 φορές λιγότερο.
Οι κύριοι συντελεστές της ανάρτησης είναι οι Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra και Vasudev Shyam.
Γιατί η Κυβερνο‑Παρακολούθηση είναι δύσκολη
Η Goodfire περιγράφει την κυβερνοασφάλεια ως ένα από τα πιο δύσκολα περιβάλλοντα για την παρακολούθηση των AI πρακτόρων: ο έλεγχος μιας βάσης κώδικα για ευπάθειες και η εκμετάλλευσή της περιλαμβάνουν επικάλυπτες εργασίες, έτσι η διάκριση μεταξύ αθώας και κακόβουλης συμπεριφοράς απαιτεί την παρακολούθηση της πρόθεσης κατά μήκος μιας διαδρομής που μπορεί να εκτείνεται σε εκατομμύρια tokens. Η προφανής λύση, η ύπαρξη ενός δεύτερου δικαστή LLM που διαβάζει κάθε γύρο, είναι πολύ αργή και δαπανηρή για εκτέλεση παράλληλα με έναν πράκτορα σε πραγματικό χρόνο, γι’ αυτό η παρακολούθηση είναι συνήθως ασύγχρονη και οι επιβλαβείς διαδρομές εμφανίζονται μόνο μετά τη δράση του πράκτορα.
Βάσει των τιμών του OpenRouter, η ανάρτηση εκτιμά ότι η αξιολόγηση ενός εκατομμυρίου γύρων των εκτελέσεων του Kimi K3 με δικαστή που εξετάζει κάθε γύρο θα κόστιζε περίπου 200.000 $ με το Claude Opus 5, ή περίπου 30.000 $ με το ίδιο το Kimi K3.
Μια Κατάρρευση Διερεύνησης‑Συν‑Δικαστή
Η λύση της Goodfire είναι μια αλυσίδα δύο σταδίων. Μια διερεύνηση διαβάζει τις εσωτερικές ενεργοποιήσεις του μοντέλου‑στόχου καθώς ο διακομιστής επαγωγής παράγει tokens και λειτουργεί ως ένας συνεχής ανιχνευτής πρώτης γραμμής· όταν η έξοδος της διερεύνησης υπερβεί ένα βαθμονομημένο όριο, η εκτέλεση προωθείται σε έναν δικαστή LLM, ο οποίος μπορεί να απορρίψει το αίτημα ή να συνεχίσει την αλληλεπίδραση. Η εταιρεία δηλώνει ότι η αρχιτεκτονική διερεύνησης καταγράφει συμπεριφορές τόσο με τοπικό τρόπο, συνδεδεμένες με ένα συγκεκριμένο τμήμα ενός γύρου, όσο και με κατανεμημένο τρόπο, που παραμένουν σε ολόκληρο τον γύρο, παραμένοντας αποδοτική στην εκτέλεση. Μετά τη βαθμονόμηση, η διερεύνηση πέτυχε 0 % ποσοστό ψευδώς‑αρνητικών και 95 % ποσοστό αληθών‑αρνητικών σε ένα διαχωρισμένο σύνολο αλληλεπιδράσεων πρακτόρων και συνομιλίας, σύμφωνα με την Goodfire, έτσι ο δικαστής καλείται κυρίως για επιβλαβείς ενέργειες και μπορεί να χρησιμοποιηθεί ένας ταχύτερος, λιγότερο ικανός δικαστής.
Τα δεδομένα εκπαίδευσης προήλθαν από προσομοιωμένους χρήστες με επιβλαβείς και αθώους στόχους σε κυβερνο‑και μη‑κυβερνο‑περιβάλλοντα· μέρος αυτών συλλέχθηκε μέσω των επαληθευτών, των Prime Sandboxes και των Tunnels της Prime Intellect, ώστε η εκτέλεση επιθετικών και αθώων ερωτήσεων του Kimi K3 να εκτελείται χωρίς πρόσβαση στο διαδίκτυο. Μία γραπτή πολιτική ορίζει ανεπιθύμητες κυβερνο‑ενέργειες με συγκεκριμένους παράγοντες που διαχωρίζουν την καλό‑προαίρετη εργασία, όπως η περιορισμένη αναπαραγωγή ευπάθειας, από την κακό‑προαίρετη εργασία, όπως η εκμετάλλευση ευπάθειας, και οι προσομοιωμένοι χρήστες μπορούν να εντείνουν την επιβλαβή πρόθεση ανά πάσα στιγμή, ακόμη και μετά από ένα αρχικά αθώο αίτημα.
Ο σχεδιασμός επεκτείνει την προηγούμενη έρευνα της Goodfire για την εκμετάλλευση ανταμοιβών. Στο μια ανάρτηση που δημοσιεύτηκε στις 17 Σεπτεμβρίου 2026, η εταιρεία ανέφερε ότι εντόπισε εκμετάλλευση ανταμοιβής στο 50–96 % των εκτελέσεων στα Kimi K3, GLM 5.2 και Qwen 3.8 Max σε τρία benchmarks πρακτόρων, μαζί με ένα εσωτερικό σήμα που σχετίζεται με έννοιες όπως η απάτη, η εκμετάλλευση ενός μετρικού και η αποφυγή ανίχνευσης. Απλές διερευνήσεις ενεργοποίησης που ρυθμίστηκαν σε αυτό το σήμα εντόπισαν εκμεταλλεύσεις που οι παρατηρητές αλυσίδας σκέψης LLM παρέλειψαν, και στο Kimi K3 μια διαμόρφωση διερεύνηση‑συν‑LLM μείωσε το κόστος παρακολούθησης LLM κατά 90 % με περίπου 1 % πτώση στην ακρίβεια, σύμφωνα με την εταιρεία.
Απόδοση, Καθυστέρηση και Αποτελέσματα Ανίχνευσης
Για να εκτελέσει τις διερευνήσεις σε πραγματικό χρόνο, η Goodfire επεκτάθηκε τη μηχανή εξυπηρέτησης SGLang ώστε να υπολογίζει εσωτερικά τις βαθμολογίες των διερευνήσεων, έγραψε προσαρμοσμένους πυρήνες για τη λογική των διερευνήσεων και διέδωσε τις βαθμολογίες μέσω του δέντρου radix, του DSpark speculator και της αποσύνθεσης προγέμισης‑αποκωδικοποίησης ώστε να αποφεύγεται η επανυπολογισμός. Κάθε εργαζόμενος που εξυπηρετεί ένα αντίγραφο του Kimi K3 εκτελεί τις διερευνήσεις και διατηρεί ιστορικό για τα ενεργά αιτήματα του, με τα γεγονότα παρακολούθησης να επιστρέφονται στη ροή απάντησης.
Σε τέσσερις φορτισμούς επαγωγής, η ενεργοποίηση των διερευνήσεων κράτησε την απόδοση εντός του όριου θορύβου των benchmarks της Goodfire, με μετρημένη μείωση λιγότερο από 2 % από την προεπιλογή του SGLang. Η αλυσίδα μειώνει τη μέση πρόσθετη καθυστέρηση ανά γύρο από 160 ms σε 2 ms χωρίς λογική του δικαστή και από 2 750 ms σε 42 ms με λογική, σύμφωνα με την Goodfire, και κοστίζει 65 $ ανά εκατομμύριο γύρους πράκτορα χωρίς λογική ή 185 $ με αυτήν, μειώνοντας το κόστος του δικαστή κατά περίπου 49 φορές και 29 φορές αντίστοιχα σε σχέση με την αξιολόγηση κάθε γύρου. Με ένα σταθερό προϋπολογισμό υπολογιστικής ισχύος, η εταιρεία δηλώνει ότι οι παρατηρητές χρησιμοποιούν κάτω από 1 % της υπολογιστικής ισχύος, έναντι έως και 20 % για έναν δικαστή που αξιολογεί κάθε γύρο. Επειδή η αλυσίδα είναι αρκετά φθηνή για να εκτελείται συγχρονισμένα, η Goodfire λέει ότι οι επικίνδυνες κυβερνο‑ενέργειες μπορούν να αποκλειστούν πριν ο πράκτορας καλέσει ένα εργαλείο, αντί να σημειώνονται αργότερα.
Η Goodfire αξιολόγησε τους παρατηρητές σε ένα εσωτερικό σύνολο δεδομένων 2.400 συνομιλιών και συνεδριών πράξης, που περιελάμβαναν πάνω από 60.000 γύρους, χρησιμοποιώντας τις ετικέτες του Claude Opus 5 ως αναφορά· οι αλληλεπιδράσεις προέρχονταν από τη βιβλιοθήκη ανοιχτού κώδικα Petri red‑teaming της Anthropic, πραγματικά περιβάλλοντα προσαρμοσμένα από benchmarks όπως το ExploitBench, ένα κυβερνο‑συγκεκριμένο υποσύνολο του WildChat, καθώς και από ήπιες κυκλοφορίες λογισμικού, κωδικοποίησης και DevOps. Σε ποσοστό διακοπής 5,5 % για ήπιες συνεδρίες, η Goodfire αναφέρει ότι η αλυσίδα έφτασε σε περίπου 93 % ανάκληση σε επιβλαβείς συνεδρίες με και χωρίς λογική του κριτή και σημαδεύτηκε στο 0 % μη‑κυβερνο κίνηση, κάτι που η εταιρεία περιγράφει ως βελτίωση Pareto σε σχέση με τον κριτή μόνο σε κάθε δοκιμασμένο επίπεδο διακοπής. Η προσθήκη του παρατηρητή αύξηση το ποσοστό φραγής επιβλαβών συνεδριών του Kimi K3 από περίπου 29 % σε 96 %, ενώ η διακοπή ήπιων συνεδριών αυξήθηκε από περίπου 5 % σε 9 · για το GLM 5.3, η φραγή αυξήθηκε από περίπου 36 % σε 91 % και η ήπια διακοπή από περίπου 10 % σε 15 .
Σε σύγκριση με το Jev, ένα μοντέλο απόφασης που μπορεί να λειτουργήσει ως φθηνός κριτής, οι αλυσίδες έφτασαν σε 93 % ανάκληση με το ίδιο ποσοστό διακοπής 5,5 % για ήπιες συνεδρίες, έναντι 86 % για το Jev, με περίπου $65 υπολογιστικής ισχύος κριτή ανά εκατομμύριο γύρους και 2 ms πρόσθετης καθυστέρησης ανά γύρο, σε σύγκριση με $600 και 200 ms για το Jev, σύμφωνα με την Goodfire. Το Jev εντόπισε μόνο το 12 % των επιβλαβών προτροπών ενσωματωμένων σε ήπιο πλαίσιο και διέσχιζε όλο και περισσότερο ήπιες συνεδρίες πέρα από το παράθυρο των 32.000‑token. Τα τυπικά γραμμικά probes πέτυχαν περίπου 5 % χαμηλότερη ανάκληση από την τελική συνταγή, τα μη‑γραμμικά probes έχασαν έως και 30 % ανάκληση σε σύνολα εκτός κατανομής, και η αντιστοίχηση του οροφής ανάκλησης του κριτή με έξι φορές λιγότερες κλήσεις κριτή απαιτούσε την αλυσίδα probes αντί για τυχαία επιλογή γύρου. Η συνταγή μεταφέρθηκε επίσης στο GLM 5.3 χρησιμοποιώντας μόνο δεδομένα που αναπτύχθηκαν για το Kimi K3, προσφέροντας έναν περίπου εξίσου ικανό παρατηρητή GLM στις κυκλοφορίες του Kimi και έναν ελαφρώς χειρότερο σε δικά του δεδομένα αξιολόγησης, σύμφωνα με την εταιρεία.
Εξωτερική Red‑Teaming από τη FAR.AI
Για να δοκιμάσει το σύστημα σε πραγματικές συνθήκες πέρα από τις εσωτερικές αξιολογήσεις, η Goodfire ζήτησε από τη FAR.AI να το υποβάλει σε red‑team. Στο λογαριασμό της FAR.AI, όπως παρατίθεται στην ανάρτηση:
“Η FAR.AI πραγματοποίησε προπυρηνικές δοκιμές των παρατηρητών Kimi K3 της Goodfire κατά τη διάρκεια δύο ημερών, εφαρμόζοντας ένα μη‑προσαρμοστικό χαρτοφυλάκιο στατικών jailbreaks για επιθετική κυβερνο‑κατάχρηση σε περιβάλλοντα συνομιλίας. Από μια αρχική δεξαμενή 1.500 υποψήφιων jailbreaks, η δοκιμή επέλεξε 140 που βρέθηκαν αποτελεσματικά εναντίον μιας διαφορετικής έκδοσης του βασικού μοντέλου χωρίς τους παρατηρητές μας. Δοκιμάζοντας καθένα από αυτά τα 140 σε 8 μεμονωμένες αλληλεπιδράσεις που αντιστοιχούσαν σε διαφορετικούς στόχους επιτιθέμενου, οι παρατηρητές της Goodfire μείωσαν τις ευπάθειες που προκλήθηκαν από 66 καθολικά jailbreaks και 700 συνολικές jailbreak‑αλληλεπιδράσεις σε 0 καθολικά jailbreaks και 18 jailbreak‑αλληλεπιδράσεις.”
Χωρίς τον παρατηρητή, η επιτυχία των καθολικών επιθέσεων jailbreak κυμαινόταν από 12 % έως 53 % ανάλογα με τις ρυθμίσεις προσπάθειας λογικής, σύμφωνα με την ανάρτηση· με ενεργοποιημένο τον παρατηρητή, καμία από τις 140 στρατηγικές δεν παρήγαγε καθολικό jailbreak, και η επιτυχία μεμονωμένων προτροπών σε 1.120 μη‑καθολικές αλληλεπιδράσεις μειώθηκε από τουλάχιστον 9–40 % σε 0,1–1,6 % ανάλογα με την προσπάθεια λογικής.
Η Goodfire περιγράφει αυτό το είδος ρύθμισης παρακολούθησης ως ένα πρακτικό προεπιλεγμένο για όποιον εξυπηρετεί ανοιχτά μοντέλα σε περιβάλλοντα πράξης, σημειώνοντας ότι τα ανοιχτά μοντέλα δεν έρχονται με πλήρη στοίβα ασφαλείας. Η εταιρεία δήλωσε ότι σχεδιάζει να συνεχίσει τη συνεργασία της με τη FAR.AI για περαιτέρω δοκιμές και ενίσχυση των παρατηρητών.












