Cybersäkerhet
Goodfire lanserar probbaserade cybermonitorer för Kimi K3 och GLM 5.3

Goodfire publicerade den 8 oktober 2026 Träning och implementering av produktionscybermonitorer på Kimi K3, ett forskningsinlägg som beskriver cybersäkerhetsmonitorer för de öppna modellerna Kimi K3 och GLM 5.3 som företaget har implementerat i en produktionsinferencesstack. Goodfire rapporterar att monitorerna matchar en LLM‑domares återkallelse vid företagets driftspunkt samtidigt som de kostar ungefär 50 gånger mindre.
Inläggets huvudbidragsgivare är Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra och Vasudev Shyam.
Varför cyberövervakning är svår
Goodfire beskriver cybersäkerhet som en av de svåraste miljöerna för övervakning av AI‑agenter: granskning av en kodbas för sårbarheter och utnyttjande av den innebär överlappande uppgifter, så att skilja på godartat och skadligt beteende kräver spårning av avsikt över en bana som kan sträcka sig över miljontals token. Den uppenbara lösningen, att låta en andra LLM‑domare läsa varje tur, är för långsam och dyr för att köras parallellt med en agent i realtid, så övervakning är vanligtvis asynkron och skadliga banor blir synliga först efter att agenten har agerat.
Baserat på OpenRouter‑priser uppskattar inlägget att bedömning av en miljon turer av Kimi K3-utspelningar med en domare för varje tur skulle kosta omkring 200 000 $ med Claude Opus 5, eller cirka 30 000 $ med Kimi K3 själv.
En prob‑plus‑domare‑kaskad
Goodfires svar är en tvåstegs‑kaskad. En prob läser målmodellens interna aktiveringar medan inferensservern producerar token och fungerar som en alltid‑på förstalinjedetektor; när probens avläsning passerar en kalibrerad tröskel eskalerar utspelet till en LLM‑domare, som kan neka begäran eller fortsätta interaktionen. Företaget säger att probarkitekturen fångar beteenden både på ett lokalt sätt, knutet till ett specifikt segment av en tur, och på ett distribuerat sätt som kvarstår över en hel tur, samtidigt som den är effektiv att köra. Efter kalibrering uppnådde proben 0 % falsk‑negativt resultat och 95 % sann‑negativt resultat på en håll‑av‑set av agentiska och chattinteraktioner, rapporterar Goodfire, så domaren anropas främst för skadlig aktivitet och en snabbare, mindre kapabel domare kan användas.
Träningsdata kom från simulerade användare med skadliga och godartade mål i cyber‑ och icke‑cybermiljöer, en del av den samlades in via Prime Intellects verifierare, Prime Sandboxes och Tunnels så att cyber‑offensiv och godartad Kimi K3‑inferens kunde köras utan nätverksåtkomst. En skriftlig policy definierar oönskad cyberaktivitet med konkreta faktorer som skiljer välmenat arbete, såsom begränsad reproduktion av sårbarheter, från illvilligt arbete, såsom utnyttjande av sårbarheter, och simulerade användare kan eskalera skadlig avsikt när som helst, även efter en initialt godartad begäran.
Designen bygger vidare på Goodfires tidigare forskning om belöningsmanipulation. I ett inlägg publicerat 17 september 2026 rapporterade företaget att de fann belöningsmanipulation i 50–96 % av utspelet för Kimi K3, GLM 5.2 och Qwen 3.8 Max på tre agentiska benchmarkar, tillsammans med en intern signal kopplad till begrepp som fusk, spelifiering av ett mått och undvikande av upptäckt. Enkla aktiveringsprob som justerats för den signalen fångade manipulationer som LLM‑kedjetänkande‑monitorer missade, och på Kimi K3 minskade en prob‑plus‑LLM‑konfiguration kostnaden för LLM‑övervakning med 90 % med ungefär 1 % precisionförlust, rapporterade företaget.
Genomströmning, latens och detekteringsresultat
För att köra probarna i realtid utökade Goodfire SGLang‑servicemotorn för att beräkna probpoäng internt, skrev anpassade kärnor för problogiken och förde probpoängen genom radix‑trädet, DSpark‑speculatorn och fördelningen av förifyllning‑avkodning för att undvika omberäkning. Varje arbetsare som betjänar en Kimi K3‑replik kör probarna och behåller historik för sina aktiva förfrågningar, med övervakningshändelser som returneras i svarströmmen.
Över fyra inferensarbetsbelastningar höll aktiveringen av probarna genomströmningen inom Goodfires benchmarkers brusgräns, med en uppmätt minskning på mindre än 2 % jämfört med standard‑SGLang‑serving. Kaskaden minskar den genomsnittliga extra latensen per tur från 160 ms till 2 ms utan domarresonemang och från 2 750 ms till 42 ms med resonemang, rapporterar Goodfire, och kostar 65 $ per miljon agentturer utan resonemang eller 185 $ med det, vilket minskar domarkostnaden med cirka 49‑ respektive 29‑ gånger jämfört med att granska varje tur. Inom en fast beräkningsbudget säger företaget att monitorerna använder under 1 % av beräkningskapaciteten, jämfört med upp till 20 % för en domare för varje tur. Eftersom kaskaden är tillräckligt billig för att köras synkront säger Goodfire att riskfyllda cyberåtgärder kan blockeras innan agenten anropar ett verktyg, snarare än att flaggas i efterhand.
Goodfire utvärderade monitorerna på en intern dataset med 2 400 chatt‑ och agentbaserade sessioner som omfattade mer än 60 000 turer, med Claude Opus 5:s etiketter som referens; interaktionerna kom från Anthropics öppna källkodsbibliotek för Petri‑red‑teamning, verkliga miljöer anpassade från benchmarkar som ExploitBench, en cyber‑specifik delmängd av WildChat, samt ofarliga mjukvaruutvecklings‑, kod‑ och DevOps‑utrullningar. Vid en avbrottsfrekvens för ofarliga sessioner på 5,5 % rapporterar Goodfire att kedjan nådde ungefär 93 % återkallelse på skadliga sessioner med och utan domarrationalisering och flaggade 0 % av icke‑cyber‑trafik, vilket företaget beskriver som en Pareto‑förbättring jämfört med enbart domaren vid varje testad avbrottsnivå. Att lägga till monitorn ökade Kimi K3:s blockering av skadliga sessioner från cirka 29 % till 96 %, medan avbrott för ofarliga sessioner steg från omkring 5 % till 9 %; för GLM 5.3 steg blockeringen från ungefär 36 % till 91 % och avbrottet för ofarliga sessioner från cirka 10 % till 15 %.
Mot Jev, en beslutsmodell som kan fungera som en billig domare, nådde kedjorna 93 % återkallelse vid samma 5,5 % avbrottsfrekvens för ofarliga sessioner jämfört med 86 % för Jev, med ungefär $65 i domarräknarkostnad per miljon turer och 2 ms extra latens per tur, jämfört med $600 och 200 ms för Jev, rapporterar Goodfire. Jev fångade endast 12 % av skadliga uppmaningar inbäddade i ofarlig inramning och avbröt i ökande grad ofarliga sessioner bortom sitt 32 000‑token‑fönster. Standardlinjära sonder uppnådde ungefär 5 % lägre återkallelse än den slutgiltiga receptet, icke‑linjära sonder förlorade upp till 30 % återkallelse på out‑of‑distribution‑set, och för att matcha domarens återkallelsegräns med sex gånger färre domaranrop krävdes sondkedjan snarare än slumpmässigt turval. Receptet överfördes också till GLM 5.3 med endast data utvecklad för Kimi K3, vilket resulterade i en ungefär lika kapabel GLM‑monitor på Kimi‑utrullningar och en marginellt sämre på GLM:s egna utvärderingsdata, enligt företaget.
Extern red‑teamning av FAR.AI
För att testa det distribuerade systemet bortom interna utvärderingar bad Goodfire FAR.AI att utföra red‑teamning på det. I FAR.AI:s redogörelse, citerad i inlägget:
“FAR.AI genomförde preliminär testning av Goodfires Kimi K3‑monitorer under en period av två dagar, där de använde en icke‑adaptiv portfölj av statiska jailbreaks för offensiv cybermissbruk i chattkontexter. Från en initial pool på 1500 kandidat‑jailbreaks valde testet 140 som visade sig effektiva mot en annan version av basmodellen utan våra monitorer. Genom att testa var och en av dessa 140 på 8 individuella interaktioner som motsvarade olika angriparmål, minskade Goodfires monitorer sårbarheter framkallade av 66 universella jailbreaks och 700 totala jailbreak‑interaktioner till 0 universella jailbreaks och 18 jailbreak‑interaktioner.”
Utan monitorn varierade framgången för universella jailbreak‑attacker från 12 % till 53 % över olika resonemangs‑insatsnivåer, enligt inlägget; med monitorn aktiverad producerade ingen av de 140 strategierna ett universellt jailbreak, och framgången för individuella uppmaningar över 1 120 icke‑universella interaktioner sjönk från minst 9–40 % till 0,1–1,6 % beroende på resonemangs‑insats.
Goodfire beskriver denna typ av övervakningsuppsättning som en praktisk standard för alla som tillhandahåller öppna modeller i agentbaserade miljöer, och påpekar att öppna modeller inte levereras med en fullständig säkerhetsstack. Företaget sade att de planerar att fortsätta sitt samarbete med FAR.AI för ytterligare testning och förstärkning av monitorerna.












