Cybersikkerhed
Goodfire implementerer probe‑baserede cyberovervågere til Kimi K3 og GLM 5.3

Goodfire offentliggjorde den 8. oktober 2026 Træning og implementering af produktionscyberovervågere på Kimi K3, et forskningsindlæg, der beskriver cybersikkerhedsovervågere for de åbne modeller Kimi K3 og GLM 5.3, som virksomheden har implementeret på en produktions‑inference‑stack. Goodfire rapporterer, at overvågerne matcher en LLM‑dommers recall på virksomhedens drifts‑punkt, mens de koster omkring 50 gange mindre.
Indlæggets primære bidragydere er Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra og Vasudev Shyam.
Hvorfor cyberovervågning er svært
Goodfire beskriver cybersikkerhed som et af de sværeste miljøer for overvågning af AI‑agenter: revision af en kodebase for sårbarheder og udnyttelse af den indebærer overlappende opgaver, så adskillelse af godartet fra ondsindet adfærd kræver sporing af intention over en bane, der kan strække sig over millioner af token. Den åbenlyse løsning, at få en anden LLM‑dommer til at læse hver tur, er for langsom og dyr til at køre sammen med en agent i realtid, så overvågning er typisk asynkron, og skadelige baner fremkommer først efter, at agenten har handlet.
Baseret på OpenRouter‑priser anslår indlægget, at bedømmelse af én million ture af Kimi K3-udrulninger med en dommer for hver tur ville koste omkring $200.000 med Claude Opus 5, eller cirka $30.000 med Kimi K3 selv.
En probe‑plus‑judge‑kaskade
Goodfires svar er en to‑trins kaskade. En probe læser målmodellens interne aktiveringer, mens inference‑serveren producerer token, og fungerer som en altid‑aktiv første‑linje detektor; når probe‑udlæsningen krydser en kalibreret tærskel, eskalerer udrulningen til en LLM‑dommer, som kan afvise anmodningen eller fortsætte interaktionen. Virksomheden siger, at probe‑arkitekturen indfanger adfærd både på en lokaliseret måde, knyttet til et specifikt stykke af en tur, og på en distribueret måde, der vedvarer over hele turen, samtidig med at den forbliver effektiv at køre. Efter kalibrering opnåede proben en falsk‑negativ rate på 0 % og en sand‑negativ rate på 95 % på et hold‑out‑sæt af agent‑ og chatinteraktioner, rapporterer Goodfire, så dommeren kun kaldes for skadelig aktivitet, og en hurtigere, mindre kapabel dommer kan anvendes.
Træningsdata stammer fra simulerede brugere med skadelige og godartede mål i cyber‑ og ikke‑cyber‑miljøer, en del indsamlet via Prime Intellects verifikatorer, Prime Sandboxes og Tunnels, så cyber‑offensiv og godartet Kimi K3‑inference kunne køre uden netværksadgang. En skriftlig politik definerer uønsket cyberaktivitet med konkrete faktorer, der adskiller velmenende arbejde, såsom begrænset sårbarhedsreproduktion, fra ondsindet arbejde, såsom udnyttelse af sårbarheder, og simulerede brugere kan eskalere skadelig intention på ethvert tidspunkt, også efter en oprindeligt godartet anmodning.
Designet udvider Goodfires tidligere forskning i belønnings‑hacking. I et indlæg offentliggjort den 17. september 2026 rapporterede virksomheden, at de fandt belønnings‑hacking i 50–96 % af udrulningerne på tværs af Kimi K3, GLM 5.2 og Qwen 3.8 Max på tre agent‑benchmark‑sæt, sammen med et internt signal forbundet med begreber som snyd, manipulation af et mål og undgåelse af opdagelse. Enkle aktiverings‑prober, der var indstillet på dette signal, opdagede hacks, som LLM‑chain‑of‑thought‑overvågninger missede, og på Kimi K3 reducerede en probe‑plus‑LLM‑opsætning LLM‑overvågningsomkostningerne med 90 % med omtrent et 1 % fald i præcision, rapporterede virksomheden.
Gennemløb, latens og detektionsresultater
For at køre proberne live udvidede Goodfire SGLang‑serving‑motoren til internt at beregne probe‑score, skrev tilpassede kerner til probe‑logikken og førte probe‑score gennem radix‑træet, DSpark‑speculatoren og prefill‑decode‑disaggregation for at undgå genberegning. Hver worker, der betjener en Kimi K3‑replica, kører proberne og gemmer historik for sine aktive anmodninger, med overvågnings‑begivenheder returneret i svar‑strømmen.
På tværs af fire inference‑arbejdsbelastninger holdt aktiveringen af proberne gennemløbet inden for støj‑tærsklen for Goodfires benchmark, med et målt fald på mindre end 2 % i forhold til standard‑SGLang‑serving. Kaskaden reducerer den gennemsnitlige ekstra latens pr. tur fra 160 ms til 2 ms uden dommer‑resonnement og fra 2 750 ms til 42 ms med resonnement, rapporterer Goodfire, og koster $65 per million agent‑ture uden resonnement eller $185 med det, hvilket reducerer dommer‑omkostningerne med omkring 49‑fold respektivt 29‑fold i forhold til at gennemgå hver tur. Inden for et fast beregningsbudget siger virksomheden, at overvågerne bruger under 1 % af beregningen, versus op til 20 % for en dommer for hver tur. Da kaskaden er billig nok til at køre synkront, siger Goodfire, at risikable cyber‑handlinger kan blokeres, før agenten kalder et værktøj, i stedet for at blive markeret bagefter.
Goodfire evaluerede monitorerne på et internt datasæt bestående af 2.400 chat- og agentiske sessioner med mere end 60.000 vendinger, ved brug af Claude Opus 5’s mærkater som reference; interaktionerne kom fra Anthropic’s open‑source Petri red‑teaming‑bibliotek, reelle miljøer tilpasset fra benchmarks såsom ExploitBench, et cyber‑specifikt delmængde af WildChat, samt harmløse software‑udviklings‑, kodnings‑ og DevOps‑udrulninger. Ved en afbrydelsesrate på 5,5 % for harmløse sessioner rapporterer Goodfire, at kaskaden nåede cirka 93 % recall på skadelige sessioner både med og uden dommer‑resonering og markerede 0 % af ikke‑cyber‑trafik, hvilket virksomheden beskriver som en Pareto‑forbedring i forhold til kun at bruge dommeren ved hver testet afbrydelsesgrad. Tilføjelsen af monitoren øgede Kimi K3’s blokering af skadelige sessioner fra omkring 29 % til 96 %, mens afbrydelsen af harmløse sessioner steg fra ca. 5 % til 9 %; for GLM 5.3 steg blokeringen fra cirka 36 % til 91 % og den harmløse afbrydelse fra omkring 10 % til 15 %.
Mod Jev, en beslutningsmodel der kan fungere som en billig dommer, nåede kaskaderne 93 % recall ved den samme 5,5 % afbrydelsesrate for harmløse sessioner sammenlignet med 86 % for Jev, med omkring $65 i dommer‑beregning pr. million vendinger og 2 ms ekstra latenstid pr. vending, sammenlignet med $600 og 200 ms for Jev, rapporterer Goodfire. Jev fangede kun 12 % af skadelige prompts indlejret i harmløs indramning og afbrød i stigende grad harmløse sessioner ud over sin 32.000‑token‑grænse. Standard lineære prober opnåede cirka 5 % lavere recall end den endelige opskrift, ikke‑lineære prober mistede op til 30 % recall på out‑of‑distribution‑sæt, og for at matche dommerens recall‑loft med seks gange færre dommerkald krævede prober‑kaskaden i stedet for tilfældig valg af vendinger. Opskriften blev også overført til GLM 5.3 ved kun at bruge data udviklet til Kimi K3, hvilket gav en omtrent lige så kapabel GLM‑monitor på Kimi‑udrulninger og en marginalt dårligere på GLM’s egne evalueringsdata, rapporterer virksomheden.
Ekstern Red‑Teaming af FAR.AI
For at teste det implementerede system ud over de interne evalueringer bad Goodfire FAR.AI om at udføre red‑team‑test på det. I FAR.AI’s beretning, citeret i indlægget:
“FAR.AI gennemførte foreløbig test af Goodfires Kimi K3‑monitorer over en periode på to dage, ved at anvende en ikke‑adaptiv portefølje af statiske jailbreaks til offensiv cyber‑misbrug i chat‑kontekster. Fra en indledende pulje på 1500 kandidat‑jailbreaks udvalgte testen 140, som viste sig at være effektive mod en anden version af grundmodellen uden vores monitorer. Ved at teste hver af de 140 på 8 individuelle interaktioner svarende til forskellige angribermål, reducerede Goodfires monitorer sårbarheder fremkaldt af 66 universelle jailbreaks og 700 samlede jailbreak‑interaktioner til 0 universelle jailbreaks og 18 jailbreak‑interaktioner.”
Uden monitoren varierede succesraten for universelle jailbreak‑angreb fra 12 % til 53 % på tværs af indstillinger for resonnerings‑indsats, ifølge indlægget; med monitoren aktiveret producerede ingen af de 140 strategier et universelt jailbreak, og succesraten for individuelle prompts på tværs af 1.120 ikke‑universelle interaktioner faldt fra mindst 9–40 % til 0,1–1,6 % afhængigt af resonnerings‑indsats.
Goodfire beskriver denne type overvågningsopsætning som en praktisk standard for alle, der betjener åbne modeller i agentiske miljøer, og bemærker, at åbne modeller ikke leveres med en fuld sikkerhedsstak. Virksomheden sagde, at den planlægger at fortsætte sit samarbejde med FAR.AI om yderligere test og styrkelse af monitorerne.












