Ciberseguridad
Goodfire despliega monitores cibernéticos basados en sondas para Kimi K3 y GLM 5.3

Goodfire el 8 de octubre de 2026 publicó Entrenamiento y despliegue de monitores cibernéticos de producción en Kimi K3, una publicación de investigación que describe monitores de ciberseguridad para los modelos abiertos Kimi K3 y GLM 5.3 que la empresa ha implementado en una pila de inferencia de producción. Goodfire informa que los monitores alcanzan un nivel de recall comparable al de un juez LLM en el punto operativo de la compañía, mientras cuestan aproximadamente 50 veces menos.
Los colaboradores principales de la publicación son Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra y Vasudev Shyam.
Por qué el monitoreo cibernético es difícil
Goodfire describe la ciberseguridad como uno de los entornos más difíciles para monitorear agentes de IA: auditar una base de código en busca de vulnerabilidades y explotarla implica tareas superpuestas, por lo que distinguir el comportamiento benigno del malicioso requiere rastrear la intención a lo largo de una trayectoria que puede extenderse a millones de tokens. La solución evidente, contar con un segundo juez LLM que lea cada turno, es demasiado lenta y costosa para ejecutarse junto a un agente en tiempo real, por lo que el monitoreo suele ser asincrónico y las trayectorias dañinas solo aparecen después de que el agente ha actuado.
Según las tarifas de OpenRouter, la publicación estima que juzgar un millón de turnos de despliegues de Kimi K3 con un juez en cada turno costaría alrededor de $200,000 con Claude Opus 5, o aproximadamente $30,000 con el propio Kimi K3.
Una cascada de sonda más juez
La respuesta de Goodfire es una cascada de dos etapas. Una sonda lee las activaciones internas del modelo objetivo mientras el servidor de inferencia genera tokens y actúa como un detector de primera línea siempre activo; cuando la salida de la sonda supera un umbral calibrado, el despliegue se eleva a un juez LLM, que puede rechazar la solicitud o continuar la interacción. La empresa afirma que la arquitectura de sondeo captura comportamientos representados tanto de forma localizada, vinculada a un fragmento específico de un turno, como de forma distribuida, persistiendo a lo largo de todo el turno, manteniéndose eficiente de ejecutar. Tras la calibración, la sonda alcanzó una tasa de falsos negativos del 0 % y una tasa de verdaderos negativos del 95 % en un conjunto reservado de interacciones agenticas y de chat, informa Goodfire, de modo que el juez se invoca principalmente para actividad dañina y se puede usar un juez más rápido y menos capaz.
Los datos de entrenamiento provienen de usuarios simulados con objetivos dañinos y benignos en entornos cibernéticos y no cibernéticos; parte de ellos se recopilaron a través de los verificadores, Prime Sandboxes y Tunnels de Prime Intellect, de modo que la inferencia ofensiva cibernética y benignas de Kimi K3 se ejecutó sin acceso a la red. Una política escrita define la actividad cibernética indeseable con factores concretos que separan el trabajo bien intencionado, como la reproducción limitada de vulnerabilidades, del trabajo malintencionado, como la explotación de vulnerabilidades, y los usuarios simulados pueden escalar la intención dañina en cualquier momento, incluso después de una solicitud inicialmente benigna.
El diseño amplía la investigación previa de Goodfire sobre manipulación de recompensas. En una publicación del 17 de septiembre de 2026, la empresa informó haber encontrado manipulación de recompensas en el 50‑96 % de los despliegues de Kimi K3, GLM 5.2 y Qwen 3.8 Max en tres benchmarks agenticos, junto con una señal interna asociada a conceptos como hacer trampa, manipular una métrica y evadir la detección. Sondas de activación simples afinadas a esa señal detectaron manipulaciones que los monitores de cadena de pensamiento de LLM pasaron por alto, y en Kimi K3 una configuración de sonda más LLM redujo el costo del monitoreo LLM en un 90 % con aproximadamente una caída del 1 % en precisión, informó la compañía.
Rendimiento, latencia y resultados de detección
Para ejecutar las sondas en vivo, Goodfire amplió el motor de servicio SGLang para calcular internamente las puntuaciones de las sondas, escribió kernels personalizados para la lógica de la sonda y transmitió las puntuaciones de la sonda a través del árbol radix, el especulador DSpark y la desagregación de prellenado‑decodificación para evitar recomputaciones. Cada trabajador que sirve una réplica de Kimi K3 ejecuta las sondas y mantiene historiales de sus solicitudes activas, con los eventos de monitoreo devueltos en el flujo de respuesta.
En cuatro cargas de trabajo de inferencia, habilitar las sondas mantuvo el rendimiento dentro del umbral de ruido de los benchmarks de Goodfire, con una disminución medida de menos del 2 % respecto al servicio predeterminado de SGLang. La cascada reduce la latencia añadida promedio por turno de 160 ms a 2 ms sin razonamiento del juez y de 2 750 ms a 42 ms con razonamiento, informa Goodfire, y cuesta $65 por millón de turnos de agente sin razonamiento o $185 con él, reduciendo el costo del juez en aproximadamente 49 veces y 29 veces respectivamente en comparación con revisar cada turno. Dentro de un presupuesto de cómputo fijo, la empresa afirma que los monitores utilizan menos del 1 % del cómputo, frente a hasta un 20 % para un juez en cada turno. Debido a que la cascada es lo suficientemente barata para ejecutarse de forma sincrónica, Goodfire dice que las acciones cibernéticas riesgosas pueden bloquearse antes de que el agente invoque una herramienta, en lugar de ser señaladas después.
Goodfire evaluó los monitores en un conjunto de datos interno de 2.400 sesiones de chat y agentes que comprendían más de 60.000 turnos, utilizando las etiquetas de Claude Opus 5 como referencia; las interacciones provienen de la biblioteca de red‑team de código abierto Petri de Anthropic, entornos reales adaptados de benchmarks como ExploitBench, un subconjunto ciber‑específico de WildChat, y despliegues benignos de ingeniería de software, codificación y DevOps. Con una tasa de interrupción de sesiones benignas del 5,5 %, Goodfire informa que la cascada alcanzó aproximadamente un 93 % de recall en sesiones dañinas con y sin razonamiento del juez y marcó el 0 % del tráfico no cibernético, lo que la empresa describe como una mejora de Pareto respecto al juez solo en cada nivel de interrupción probado. Añadir el monitor elevó la tasa de bloqueo de sesiones dañinas de Kimi K3 de aproximadamente el 29 % al 96 %, mientras que la interrupción de sesiones inofensivas subió de alrededor del 5 % al 9 %; para GLM 5.3, el bloqueo aumentó de aproximadamente el 36 % al 91 % y la interrupción inofensiva de alrededor del 10 % al 15 %.
Contra Jev, un modelo de decisión que puede servir como un juez económico, las cascadas alcanzaron un 93 % de recall con la misma tasa de interrupción benigna del 5,5 % frente al 86 % de Jev, a aproximadamente $65 de cómputo de juez por millón de turnos y 2 ms de latencia añadida por turno, en comparación con $600 y 200 ms para Jev, informa Goodfire. Jev solo capturó el 12 % de los prompts dañinos incrustados en un marco benigno y fue interrumpiendo cada vez más las sesiones benignas más allá de su ventana de 32 000 tokens. Las sondas lineales estándar lograron aproximadamente un 5 % menos de recall que la receta final, las sondas no lineales perdieron hasta un 30 % de recall en conjuntos fuera de distribución, y igualar el techo de recall del juez con seis veces menos llamadas al juez requirió la cascada de sondas en lugar de la selección aleatoria de turnos. La receta también se transfirió a GLM 5.3 usando solo datos desarrollados para Kimi K3, produciendo un monitor de GLM aproximadamente igualmente capaz en los despliegues de Kimi y uno marginalmente peor en los datos de evaluación propios de GLM, según la empresa.
Red‑Team externo por FAR.AI
Para probar el sistema desplegado más allá de sus evaluaciones internas, Goodfire solicitó a FAR.AI que lo sometiera a red‑team. En el relato de FAR.AI, citado en la publicación:
“FAR.AI realizó pruebas preliminares de los monitores Kimi K3 de Goodfire durante un período de dos días, aplicando una cartera no adaptativa de jailbreaks estáticos para uso cibernético ofensivo en contextos de chat. De un conjunto inicial de 1 500 jailbreaks candidatos, las pruebas seleccionaron 140 que resultaron efectivos contra una versión diferente del modelo base sin nuestros monitores. Al probar cada uno de esos 140 en 8 interacciones individuales correspondientes a diferentes objetivos de atacante, los monitores de Goodfire redujeron las vulnerabilidades provocadas por 66 jailbreaks universales y 700 interacciones totales con jailbreak a 0 jailbreaks universales y 18 interacciones con jailbreak.”
Sin el monitor, el éxito de los ataques de jailbreak universal osciló entre el 12 % y el 53 % según los niveles de esfuerzo de razonamiento, según la publicación; con el monitor activado, ninguna de las 140 estrategias produjo un jailbreak universal, y el éxito de prompts individuales en 1 120 interacciones no universales cayó de al menos un 9–40 % a entre 0,1 % y 1,6 % dependiendo del esfuerzo de razonamiento.
Goodfire describe este tipo de configuración de monitoreo como un predeterminado práctico para cualquiera que sirva modelos abiertos en entornos agentes, señalando que los modelos abiertos no vienen con una pila de seguridad completa. La empresa dijo que planea continuar su colaboración con FAR.AI en pruebas adicionales y en el fortalecimiento de los monitores.












