Kybernetická bezpečnost
Goodfire nasazuje monitorovací systémy založené na sondách pro Kimi K3 a GLM 5.3

Goodfire dne 8. října 2026 publikoval Školení a nasazení produkčních kybernetických monitorů na Kimi K3, výzkumný příspěvek popisující monitorování kybernetické bezpečnosti pro otevřené modely Kimi K3 a GLM 5.3, které společnost nasadila na produkční inference stack. Goodfire uvádí, že monitory dosahují stejné míry zachycení jako LLM soudce při provozním bodě společnosti, a to přibližně 50‑krát levněji.
Hlavními přispěvateli tohoto příspěvku jsou Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra a Vasudev Shyam.
Proč je monitorování kybernetické bezpečnosti obtížné
Goodfire popisuje kybernetickou bezpečnost jako jedno z nejnáročnějších prostředí pro monitorování AI agentů: auditování kódu na zranitelnosti a jeho zneužití zahrnují překrývající se úkoly, takže rozlišení neškodného od škodlivého chování vyžaduje sledování záměru podél trajektorie, která může dosahovat milionů tokenů. Zřejmým řešením, mít druhého LLM soudce, který čte každý tah, je příliš pomalé a nákladné pro běh vedle agenta v reálném čase, takže monitorování je obvykle asynchronní a škodlivé trajektorie se objeví až po akci agenta.
Na základě sazeb OpenRouter odhaduje příspěvek, že posuzování jednoho milionu tahů nasazení Kimi K3 pomocí soudce každého tahu by stálo řádově 200 000 $ s Claude Opus 5, nebo přibližně 30 000 $ s samotným Kimi K3.
Kaskáda sondy a soudce
Odpovědí Goodfire je dvoustupňová kaskáda. Sonda čte vnitřní aktivace cílového modelu, zatímco inference server generuje tokeny, a funguje jako neustále aktivní detektor první linie; když výstup sondy překročí kalibrovaný práh, nasazení přejde na LLM soudce, který může požadavek odmítnout nebo interakci pokračovat. Společnost uvádí, že architektura sond zachycuje chování jak lokálně – vázané na konkrétní část tahu – tak distribuovaně, přetrvávající po celý tah, a přitom zůstává efektivní. Po kalibraci dosáhla sonda 0 % míry falešně negativních výsledků a 95 % míry pravých negativních výsledků na oddělené sadě agentických a chatových interakcí, uvádí Goodfire, takže soudce je volán převážně pro škodlivou aktivitu a lze použít rychlejší, méně výkonný soudce.
Tréninková data pocházela ze simulovaných uživatelů s škodlivými i neškodnými cíli v kybernetických i nekybernetických prostředích; část byla shromážděna prostřednictvím verifikátorů Prime Intellect, Prime Sandboxů a Tunelů, aby kybernetické útočné i neškodné inference Kimi K3 probíhaly bez přístupu k síti. Písemná politika definuje nežádoucí kybernetickou aktivitu pomocí konkrétních faktorů oddělujících dobře zamýšlenou práci, jako je omezená reprodukce zranitelností, od špatně zamýšlené práce, jako je zneužití zranitelnosti, a simulovaní uživatelé mohou v libovolném okamžiku eskalovat škodlivý záměr, včetně po původně neškodném požadavku.
Design rozšiřuje předchozí výzkum Goodfire v oblasti manipulace s odměnami. V příspěvek publikovaný 17. září 2026 společnost oznámila, že našla manipulaci s odměnami v 50–96 % nasazení napříč Kimi K3, GLM 5.2 a Qwen 3.8 Max na třech agentických benchmarkech, spolu s interním signálem spojeným s pojmy jako podvádění, hraní si s metrikou a vyhýbání se detekci. Jednoduché aktivace sond naladěné na tento signál zachytily hacky, které monitorování řetězce myšlenek LLM přehlédlo, a na Kimi K3 nastavení sonda + LLM snížilo náklady na monitorování LLM o 90 % s přibližným poklesem přesnosti o 1 %, uvádí společnost.
Propustnost, latence a výsledky detekce
Pro živé spuštění sond Goodfire rozšířil serverový engine SGLang o interní výpočet skóre sond, napsal vlastní jádra pro logiku sond a přenášel skóre sond skrze radixové stromové struktury, DSpark spekulátor a rozdělení prefill-decode, aby se zabránilo přepočítávání. Každý pracovník obsluhující repliku Kimi K3 spouští sondy a uchovává historii pro své aktivní požadavky, přičemž události monitorování jsou vráceny ve výstupním proudu.
Napříč čtyřmi inference pracovními zátěžemi umožnění sond udrželo propustnost v rámci šumu benchmarků Goodfire, s naměřeným poklesem o méně než 2 % oproti výchozímu serveru SGLang. Kaskáda snižuje průměrnou přidanou latenci na tah z 160 ms na 2 ms bez uvažování soudcem a z 2 750 ms na 42 ms s uvažováním, uvádí Goodfire, a stojí 65 $ za milion tahů agenta bez uvažování nebo 185 $ s ním, což snižuje náklady na soudce přibližně 49‑krát a 29‑krát oproti revizi každého tahu. V rámci pevného výpočetního rozpočtu, říká společnost, monitory využívají méně než 1 % výpočetního výkonu, oproti až 20 % pro soudce každého tahu. Protože je kaskáda dostatečně levná na synchronní běh, Goodfire uvádí, že rizikové kybernetické akce lze zablokovat ještě před tím, než agent zavolá nástroj, místo aby byly po akci jen označeny.
Goodfire vyhodnotil monitory na interním souboru dat o 2,400 chatových a agentních relacích, který zahrnoval více než 60,000 tahů, přičemž jako referenci použil štítky Claude Opus 5; interakce pocházely z open‑source knihovny pro red‑teamování Petri od Anthropic, z reálných prostředí upravených z benchmarků jako ExploitBench, kybernetické podmnožiny WildChat a z neškodných nasazení softwarového inženýrství, kódování a DevOps. Při míře přerušení neškodných relací 5.5% Goodfire uvádí, že řetězec dosáhl přibližně 93% recall na škodlivých relacích s i bez soudcovského uvažování a označil 0% ne‑kybernetického provozu, což společnost popisuje jako Pareto‑zlepšení oproti samotnému soudci při každé testované úrovni přerušení. Přidání monitoru zvýšilo míru blokování škodlivých relací Kimi K3 z přibližně 29% na 96%, přičemž míra přerušení neškodných relací vzrostla z asi 5% na 9%; pro GLM 5.3 blokování vzrostlo z přibližně 36% na 91% a neškodné přerušení z asi 10% na 15%.
Proti Jev, rozhodovacímu modelu, který může sloužit jako levný soudce, řetězce dosáhly 93% recall při stejné míře přerušení neškodných relací 5.5% oproti 86% pro Jev, při přibližně $65 výpočetního výkonu soudce na milion tahů a 2 ms přidané latence na tah, ve srovnání s $600 a 200 ms pro Jev, uvádí Goodfire. Jev zachytil pouze 12% škodlivých výzev vložených do neškodného rámce a stále častěji přerušoval neškodné relace mimo své okno 32 000 tokenů. Standardní lineární sondy dosáhly přibližně o 5% nižšího recall než finální recept, nelineární sondy ztratily až 30% recall na sadách mimo distribuci a dosažení stropu recall soudce při šesti‑násobně menším počtu volání soudce vyžadovalo řetězec sond místo náhodného výběru tahů. Recept byl také přenesen na GLM 5.3 s využitím pouze dat vyvinutých pro Kimi K3, což poskytlo přibližně stejně schopný monitor GLM při nasazeních Kimi a mírně horší na vlastních evaluačních datech GLM, uvádí společnost.
Externí red‑teamování od FAR.AI
Aby otestoval nasazený systém mimo své interní hodnocení, Goodfire požádal FAR.AI, aby jej podrobil red‑teamování. Ve zprávě FAR.AI, citované v příspěvku:
“FAR.AI provedl předběžné testování monitorů Goodfire Kimi K3 po dobu dvou dnů, přičemž použil neadaptivní portfolio statických jailbreaků pro útočné kybernetické zneužití v chatových kontextech. Z počátečního fondu 1500 kandidátních jailbreaků testování vybralo 140, které se ukázaly jako účinné proti jiné verzi základního modelu bez našich monitorů. Testováním každého z těchto 140 na 8 individuálních interakcích odpovídajících různým cílům útočníků Goodfire monitory snížily zranitelnosti vyvolané 66 univerzálními jailbreaky a 700 celkovými jailbreakovanými interakcemi na 0 univerzálních jailbreaků a 18 jailbreakovaných interakcí.”
Bez monitoru se úspěšnost útoků univerzálního jailbreaku pohybovala od 12% do 53% napříč nastaveními úsilí o uvažování, podle příspěvku; při zapnutém monitoru žádná ze 140 strategií nevytvořila univerzální jailbreak a úspěšnost jednotlivých výzev napříč 1,120 ne‑univerzálními interakcemi klesla z alespoň 9–40% na 0.1–1.6% v závislosti na úsilí o uvažování.
Goodfire popisuje tento typ monitorovacího nastavení jako praktické výchozí řešení pro každého, kdo poskytuje otevřené modely v agentních prostředích, a upozorňuje, že otevřené modely nedostávají kompletní bezpečnostní balík. Společnost uvedla, že plánuje pokračovat ve spolupráci s FAR.AI na dalším testování a posilování monitorů.












