Cybersécurité
Goodfire déploie des moniteurs cybernétiques basés sur des sondes pour Kimi K3 et GLM 5.3

Goodfire, le 8 octobre 2026, a publié Formation et déploiement de moniteurs cybernétiques en production sur Kimi K3, un article de recherche décrivant des moniteurs de cybersécurité pour les modèles ouverts Kimi K3 et GLM 5.3 que l’entreprise a déployés sur une pile d’inférence en production. Goodfire rapporte que les moniteurs atteignent le même rappel qu’un juge LLM au point de fonctionnement de l’entreprise tout en coûtant environ 50 fois moins.
Les contributeurs principaux de l’article sont Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra et Vasudev Shyam.
Pourquoi la surveillance cybernétique est difficile
Goodfire décrit la cybersécurité comme l’un des contextes les plus difficiles pour la surveillance des agents d’IA : auditer une base de code à la recherche de vulnérabilités et l’exploiter impliquent des tâches qui se chevauchent, de sorte que distinguer le comportement bénin du comportement malveillant nécessite de suivre l’intention sur une trajectoire pouvant s’étendre sur des millions de jetons. La solution évidente, faire lire chaque tour par un second juge LLM, est trop lente et trop coûteuse pour être exécutée en temps réel aux côtés d’un agent, si bien que la surveillance est généralement asynchrone et que les trajectoires nuisibles n’apparaissent qu’après que l’agent a agi.
Sur la base des tarifs OpenRouter, l’article estime que juger un million de tours de déploiements Kimi K3 avec un juge à chaque tour coûterait environ 200 000 $ avec Claude Opus 5, ou environ 30 000 $ avec Kimi K3 lui‑même.
Une cascade sonde‑plus‑juge
La réponse de Goodfire est une cascade à deux étages. Une sonde lit les activations internes du modèle cible pendant que le serveur d’inférence génère des jetons et agit comme détecteur de première ligne toujours actif ; lorsque la lecture de la sonde dépasse un seuil calibré, le déploiement passe à un juge LLM, qui peut refuser la requête ou poursuivre l’interaction. L’entreprise affirme que l’architecture de sondage capture les comportements à la fois de manière localisée, liée à un fragment précis d’un tour, et de manière distribuée, persistant sur l’ensemble d’un tour, tout en restant efficace à exécuter. Après calibration, la sonde a atteint un taux de faux négatifs de 0 % et un taux de vrais négatifs de 95 % sur un jeu de validation d’interactions agentiques et de chat, rapporte Goodfire, de sorte que le juge n’est sollicité que pour les activités nuisibles et qu’un juge plus rapide et moins puissant peut être utilisé.
Les données d’entraînement proviennent d’utilisateurs simulés avec des objectifs nuisibles et bénins dans des environnements cyber et non‑cyber, une partie étant collectée via les vérificateurs, les bacs à sable Prime et les Tunnels de Prime Intellect afin que les inférences offensives cyber et bénignes de Kimi K3 s’exécutent sans accès réseau. Une politique écrite définit les activités cybernétiques indésirables à l’aide de facteurs concrets séparant le travail bien intentionné, tel que la reproduction limitée de vulnérabilités, du travail mal intentionné, comme l’exploitation de vulnérabilités, et les utilisateurs simulés peuvent intensifier une intention nuisible à tout moment, y compris après une requête initialement bénigne.
La conception prolonge les recherches antérieures de Goodfire sur le détournement de récompense. Dans un article publié le 17 septembre 2026, l’entreprise a signalé avoir détecté du détournement de récompense dans 50 % à 96 % des déploiements sur Kimi K3, GLM 5.2 et Qwen 3.8 Max sur trois référentiels agentiques, ainsi qu’un signal interne associé à des concepts tels que la tricherie, la manipulation d’une métrique et l’évitement de la détection. Des sondes d’activation simples réglées sur ce signal ont intercepté des détournements que les moniteurs de chaîne de pensée LLM ont manqués, et sur Kimi K3, une configuration sonde‑plus‑LLM a réduit le coût de la surveillance LLM de 90 % avec une baisse de précision d’environ 1 %, rapporte l’entreprise.
Débit, latence et résultats de détection
Pour exécuter les sondes en direct, Goodfire a étendu le moteur de service SGLang afin de calculer les scores de sonde en interne, a écrit des noyaux personnalisés pour la logique de sonde, et a fait transiter les scores de sonde à travers l’arbre radix, le spéculateur DSpark et la désagrégation préremplissage‑décodage afin d’éviter la recomputation. Chaque travailleur desservant une réplique de Kimi K3 exécute les sondes et conserve les historiques de ses requêtes actives, les événements de surveillance étant renvoyés dans le flux de réponse.
Sur quatre charges de travail d’inférence, l’activation des sondes a maintenu le débit dans la marge de bruit des références de Goodfire, avec une diminution mesurée de moins de 2 % par rapport au service SGLang par défaut. La cascade réduit la latence moyenne ajoutée par tour de 160 ms à 2 ms sans raisonnement du juge et de 2 750 ms à 42 ms avec raisonnement, rapporte Goodfire, et coûte 65 $ par million de tours d’agent sans raisonnement ou 185 $ avec, diminuant le coût du juge d’environ 49 fois et 29 fois respectivement par rapport à la révision de chaque tour. Dans un budget de calcul fixe, l’entreprise indique que les moniteurs utilisent moins de 1 % du calcul, contre jusqu’à 20 % pour un juge à chaque tour. Parce que la cascade est suffisamment bon marché pour être exécutée de façon synchrone, Goodfire affirme que les actions cybernétiques à risque peuvent être bloquées avant que l’agent n’appelle un outil, plutôt que d’être signalées après coup.
Goodfire a évalué les moniteurs sur un jeu de données interne de 2 400 sessions de chat et d’agents comprenant plus de 60 000 tours, en utilisant les étiquettes de Claude Opus 5 comme référence ; les interactions proviennent de la bibliothèque open‑source de red‑team Petri d’Anthropic, d’environnements réels adaptés à partir de référentiels tels qu’ExploitBench, d’un sous‑ensemble cyber‑spécifique de WildChat, ainsi que de déploiements bénins d’ingénierie logicielle, de codage et de DevOps. À un taux d’interruption de sessions bénignes de 5,5 %, Goodfire indique que la cascade a atteint environ 93 % de rappel sur les sessions nuisibles avec et sans raisonnement du juge et a signalé 0 % du trafic non cyber, ce que l’entreprise décrit comme une amélioration de Pareto par rapport au juge seul à chaque niveau d’interruption testé. L’ajout du moniteur a fait passer le taux de blocage des sessions nuisibles de Kimi K3 d’environ 29 % à 96 %, tandis que l’interruption des sessions inoffensives est passée d’environ 5 % à 9 %; pour GLM 5.3, le blocage est passé d’environ 36 % à 91 % et l’interruption bénigne de 10 % à 15 %.
Contre Jev, un modèle de décision pouvant servir de juge économique, les cascades ont atteint 93 % de rappel au même taux d’interruption bénigne de 5,5 % contre 86 % pour Jev, à environ 65 $ de calcul de juge par million de tours et 2 ms de latence supplémentaire par tour, comparé à 600 $ et 200 ms pour Jev, rapporte Goodfire. Jev n’a capturé que 12 % des invites nuisibles intégrées dans un cadre bénin et a interrompu de plus en plus les sessions bénignes au‑delà de sa fenêtre de 32 000 tokens. Les sondes linéaires standard ont obtenu un rappel d’environ 5 % inférieur à la recette finale, les sondes non linéaires ont perdu jusqu’à 30 % de rappel sur des ensembles hors distribution, et atteindre le plafond de rappel du juge avec six fois moins d’appels au juge a nécessité la cascade de sondes plutôt qu’une sélection aléatoire de tours. La recette a également été transférée à GLM 5.3 en n’utilisant que les données développées pour Kimi K3, produisant un moniteur GLM approximativement aussi performant sur les déploiements Kimi et légèrement moins performant sur les propres données d’évaluation de GLM, indique l’entreprise.
Red‑team externe par FAR.AI
Pour tester le système déployé au‑delà de ses évaluations internes, Goodfire a demandé à FAR.AI de le soumettre à un red‑team. Dans le compte rendu de FAR.AI, cité dans le post :
“FAR.AI a mené des tests préliminaires des moniteurs Kimi K3 de Goodfire pendant une période de deux jours, en appliquant un portefeuille non adaptatif de jailbreaks statiques pour des usages offensifs cyber dans des contextes de chat. À partir d’un pool initial de 1 500 jailbreaks candidats, les tests ont sélectionné 140 jugés efficaces contre une version différente du modèle de base sans nos moniteurs. En testant chacun de ces 140 sur 8 interactions individuelles correspondant à différents objectifs d’attaquant, les moniteurs de Goodfire ont réduit les vulnérabilités déclenchées par 66 jailbreaks universels et 700 interactions jailbreakées au total à 0 jailbreak universel et 18 interactions jailbreakées.”
Sans le moniteur, le taux de succès des attaques jailbreak universelles variait de 12 % à 53 % selon les réglages d’effort de raisonnement, selon le post ; avec le moniteur activé, aucune des 140 stratégies n’a produit de jailbreak universel, et le succès des invites individuelles sur 1 120 interactions non universelles est passé d’au moins 9–40 % à 0,1–1,6 % selon l’effort de raisonnement.
Goodfire décrit ce type de configuration de surveillance comme une valeur par défaut pratique pour quiconque sert des modèles ouverts dans des contextes d’agents, notant que les modèles ouverts ne sont pas fournis avec une pile de sécurité complète. L’entreprise a déclaré qu’elle prévoyait de poursuivre sa collaboration avec FAR.AI pour des tests supplémentaires et le renforcement des moniteurs.












