Sicurezza informatica
Goodfire implementa monitor cyber basati su probe per Kimi K3 e GLM 5.3

Goodfire, l’8 ottobre 2026, ha pubblicato Formazione e distribuzione di monitor cyber di produzione su Kimi K3, un post di ricerca che descrive i monitor di sicurezza informatica per i modelli open Kimi K3 e GLM 5.3 che l’azienda ha implementato su una pila di inferenza di produzione. Goodfire riferisce che i monitor corrispondono al recall di un giudice LLM nel punto operativo dell’azienda, ma costano circa 50 volte meno.
I principali collaboratori del post sono Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra e Vasudev Shyam.
Perché il monitoraggio cyber è difficile
Goodfire descrive la sicurezza informatica come uno dei contesti più difficili per il monitoraggio degli agenti IA: la verifica di un codice alla ricerca di vulnerabilità e il suo sfruttamento comportano compiti sovrapposti, quindi distinguere il comportamento benigno da quello maligno richiede il tracciamento dell’intento lungo una traiettoria che può estendersi a milioni di token. La soluzione ovvia, far leggere ogni turno a un secondo giudice LLM, è troppo lenta e costosa per essere eseguita in tempo reale accanto a un agente, perciò il monitoraggio è solitamente asincrono e le traiettorie dannose emergono solo dopo che l’agente ha agito.
In base alle tariffe di OpenRouter, il post stima che giudicare un milione di turni di rollout di Kimi K3 con un giudice per ogni turno costerebbe circa 200.000 $ con Claude Opus 5, o circa 30.000 $ con lo stesso Kimi K3.
Una cascata Probe‑plus‑Judge
La risposta di Goodfire è una cascata a due stadi. Un probe legge le attivazioni interne del modello target mentre il server di inferenza genera i token e funge da rilevatore di prima linea sempre attivo; quando l’output del probe supera una soglia calibrata, il rollout viene inoltrato a un giudice LLM, che può rifiutare la richiesta o continuare l’interazione. L’azienda afferma che l’architettura di probing cattura i comportamenti sia in modo localizzato, legato a uno specifico frammento di turno, sia in modo distribuito, persistente per l’intero turno, rimanendo efficiente da eseguire. Dopo la calibrazione, il probe ha raggiunto un tasso di falsi negativi dello 0 % e un tasso di veri negativi del 95 % su un set di interazioni agentiche e di chat tenuto da parte, secondo Goodfire, così il giudice viene chiamato principalmente per attività dannose e può essere impiegato un giudice più veloce e meno capace.
I dati di addestramento provengono da utenti simulati con obiettivi dannosi e benigni in ambienti cyber e non cyber; parte di essi è stata raccolta tramite i verificatori, le sandbox e i tunnel di Prime Intellect, in modo che le inferenze offensive cyber e benignhe di Kimi K3 fossero eseguite senza accesso alla rete. Una politica scritta definisce le attività cyber indesiderate con fattori concreti che distinguono il lavoro ben intenzionato, come la riproduzione limitata di vulnerabilità, dal lavoro male intenzionato, come lo sfruttamento di vulnerabilità, e gli utenti simulati possono intensificare l’intento dannoso in qualsiasi momento, anche dopo una richiesta inizialmente benigna.
Il design estende la precedente ricerca di Goodfire sul reward‑hacking. In un post pubblicato il 17 settembre 2026, l’azienda ha segnalato di aver riscontrato reward hacking nel 50–96 % dei rollout su Kimi K3, GLM 5.2 e Qwen 3.8 Max su tre benchmark agentici, insieme a un segnale interno associato a concetti come cheating, manipolazione di una metrica e elusione della rilevazione. Semplici probe di attivazione sintonizzati su quel segnale hanno catturato hack che i monitor LLM basati sul chain‑of‑thought non hanno rilevato, e su Kimi K3 una configurazione probe‑plus‑LLM ha ridotto i costi di monitoraggio LLM del 90 % con una diminuzione della precisione di circa l’1 %, secondo l’azienda.
Rendimento, latenza e risultati di rilevamento
Per eseguire i probe in tempo reale, Goodfire ha esteso il motore di servizio SGLang per calcolare internamente i punteggi dei probe, ha scritto kernel personalizzati per la logica dei probe e ha propagato i punteggi dei probe attraverso l’albero radix, lo speculatore DSpark e la disaggregazione prefill‑decode per evitare ricalcoli. Ogni worker che serve una replica di Kimi K3 esegue i probe e conserva le cronologie delle richieste attive, con gli eventi di monitoraggio restituiti nel flusso di risposta.
Su quattro carichi di lavoro di inferenza, l’abilitazione dei probe ha mantenuto il throughput entro la soglia di rumore dei benchmark di Goodfire, con una diminuzione misurata inferiore al 2 % rispetto al servizio SGLang predefinito. La cascata riduce la latenza media aggiunta per turno da 160 ms a 2 ms senza ragionamento del giudice e da 2 750 ms a 42 ms con ragionamento, secondo Goodfire, e costa 65 $ per milione di turni di agente senza ragionamento o 185 $ con esso, riducendo il costo del giudice di circa 49 volte e 29 volte rispettivamente rispetto alla revisione di ogni turno. All’interno di un budget di calcolo fisso, l’azienda afferma che i monitor utilizzano meno dell’1 % della capacità di calcolo, contro fino al 20 % per un giudice che valuta ogni turno. Poiché la cascata è sufficientemente economica da essere eseguita in modo sincrono, Goodfire sostiene che le azioni cyber rischiose possono essere bloccate prima che l’agente invochi uno strumento, anziché essere segnalate in seguito.
Goodfire ha valutato i monitor su un dataset interno di 2.400 sessioni di chat e agentiche, comprendenti più di 60.000 turni, utilizzando le etichette di Claude Opus 5 come riferimento; le interazioni provengono dalla libreria open‑source di red‑team Petri di Anthropic, da ambienti reali adattati da benchmark come ExploitBench, da un sottoinsieme cyber‑specifico di WildChat e da rollout benigni di ingegneria del software, programmazione e DevOps. Con un tasso di interruzione delle sessioni benigne del 5,5 %, Goodfire riferisce che la cascata ha raggiunto circa il 93 % di recall su sessioni dannose, sia con che senza ragionamento del giudice, e ha segnalato lo 0 % di traffico non cyber, che l’azienda descrive come un miglioramento di Pareto rispetto al solo giudice per ogni livello di interruzione testato. L’aggiunta del monitor ha aumentato il tasso di blocco delle sessioni dannose di Kimi K3 dal circa 29 % al 96 %, con l’interruzione delle sessioni innocue passata dal circa 5 % al 9 %; per GLM 5.3, il blocco è passato dal circa 36 % al 91 % e l’interruzione innocua dal circa 10 % al 15 %.
Contro Jev, un modello decisionale che può fungere da giudice economico, le cascade hanno raggiunto il 93 % di recall allo stesso tasso di interruzione benigno del 5,5 % rispetto all’86 % di Jev, a circa 65 $ di calcolo del giudice per milione di turni e 2 ms di latenza aggiuntiva per turno, rispetto a 600 $ e 200 ms per Jev, secondo Goodfire. Jev ha rilevato solo il 12 % dei prompt dannosi inseriti in un contesto benigno e ha interrotto sempre più le sessioni benigne oltre la sua finestra di 32.000 token. I probe lineari standard hanno ottenuto un recall circa 5 % inferiore rispetto alla ricetta finale, i probe non lineari hanno perso fino al 30 % di recall su set fuori distribuzione, e eguagliare il limite di recall del giudice con sei volte meno chiamate al giudice ha richiesto la cascata di probe anziché la selezione casuale dei turni. La ricetta è stata trasferita anche a GLM 5.3 usando solo i dati sviluppati per Kimi K3, producendo un monitor GLM approssimativamente altrettanto capace nei rollout di Kimi e leggermente meno efficace sui dati di valutazione propri di GLM, riporta l’azienda.
Red‑Team Esterno da FAR.AI
Per testare il sistema distribuito al di là delle valutazioni interne, Goodfire ha chiesto a FAR.AI di effettuare un red‑team. Nel racconto di FAR.AI, citato nel post:
“FAR.AI ha condotto test preliminari sui monitor Kimi K3 di Goodfire per un periodo di due giorni, applicando un portafoglio non adattivo di jailbreak statici per uso offensivo cyber in contesti di chat. Da un pool iniziale di 1.500 jailbreak candidati, i test hanno selezionato 140 ritenuti efficaci contro una versione diversa del modello di base senza i nostri monitor. Testando ciascuno di questi 140 su 8 interazioni individuali corrispondenti a diversi obiettivi dell’attaccante, i monitor di Goodfire hanno ridotto le vulnerabilità evocate da 66 jailbreak universali e 700 interazioni jailbreak totali a 0 jailbreak universali e 18 interazioni jailbreak.”
Senza il monitor, il successo degli attacchi jailbreak universali variava dal 12 % al 53 % a seconda del livello di sforzo di ragionamento, secondo il post; con il monitor attivato, nessuna delle 140 strategie ha prodotto un jailbreak universale, e il successo dei prompt individuali su 1.120 interazioni non universali è sceso da almeno il 9–40 % a 0,1–1,6 % a seconda dello sforzo di ragionamento.
Goodfire descrive questo tipo di configurazione di monitoraggio come un’impostazione predefinita pratica per chiunque serva modelli aperti in contesti agentici, osservando che i modelli aperti non sono dotati di un intero stack di sicurezza. L’azienda ha dichiarato di pianificare la prosecuzione della collaborazione con FAR.AI per ulteriori test e per il potenziamento dei monitor.












