Cyberbezpieczeństwo
Goodfire wdraża monitory cybernetyczne oparte na sondach dla Kimi K3 i GLM 5.3

Goodfire 8 października 2026 opublikował Szkolenie i wdrażanie produkcyjnych monitorów cybernetycznych na Kimi K3, post badawczy opisujący monitory cyberbezpieczeństwa dla otwartych modeli Kimi K3 i GLM 5.3, które firma wdrożyła w produkcyjnym stosie inferencyjnym. Goodfire podaje, że monitory osiągają taką samą czułość (recall) jak sędzia LLM przy punkcie operacyjnym firmy, przy kosztach około 50‑krotnie niższych.
Głównymi współtwórcami posta są Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra i Vasudev Shyam.
Dlaczego monitorowanie cybernetyczne jest trudne
Goodfire opisuje cyberbezpieczeństwo jako jedno z najtrudniejszych środowisk do monitorowania agentów SI: audytowanie kodu pod kątem podatności i jego wykorzystywanie to zadania nakładające się na siebie, dlatego odróżnienie zachowań nieszkodliwych od złośliwych wymaga śledzenia intencji wzdłuż trajektorii, która może rozciągać się na miliony tokenów. Oczywistym rozwiązaniem byłoby, aby drugi sędzia LLM czytał każdy ruch, lecz jest to zbyt wolne i kosztowne, aby działało równocześnie z agentem w czasie rzeczywistym, dlatego monitorowanie jest zazwyczaj asynchroniczne, a szkodliwe trajektorie ujawniają się dopiero po działaniu agenta.
Na podstawie stawek OpenRouter, post szacuje, że ocenianie miliona tur rolloutów Kimi K3 przy użyciu sędziego oceniającego każdy ruch kosztowałoby około 200 000 $ przy Claude Opus 5 lub około 30 000 $ przy samym Kimi K3.
Kaskada sondy + sędziego
Odpowiedzią Goodfire jest dwustopniowa kaskada. Sonda odczytuje wewnętrzne aktywacje docelowego modelu w trakcie, gdy serwer inferencyjny generuje tokeny, i pełni rolę zawsze włączonego detektora pierwszej linii; gdy odczyt sondy przekroczy skalowany próg, rollout przechodzi do sędziego LLM, który może odmówić żądania lub kontynuować interakcję. Firma twierdzi, że architektura sondowania uchwytuje zachowania zarówno w sposób lokalny, powiązany z konkretnym fragmentem tury, jak i w sposób rozproszony, utrzymujący się przez całą turę, przy zachowaniu efektywności działania. Po kalibracji sonda osiągnęła 0 % wskaźnik fałszywych negatywów i 95 % wskaźnik prawdziwych negatywów na odrębnym zestawie interakcji agentowych i czatowych, podaje Goodfire, dzięki czemu sędzia jest wywoływany głównie w przypadku szkodliwej aktywności, a można użyć szybszego, mniej zaawansowanego sędziego.
Dane treningowe pochodzą od symulowanych użytkowników z celami szkodliwymi i nieszkodliwymi w środowiskach cybernetycznych i niecybernetycznych; część z nich została zebrana za pośrednictwem weryfikatorów Prime Intellect, Prime Sandboxes i Tunnels, aby ofensywne cybernetyczne oraz nieszkodliwe inferencje Kimi K3 działały bez dostępu do sieci. Pisemna polityka definiuje niepożądaną aktywność cybernetyczną przy użyciu konkretnych czynników rozróżniających pracę o dobrej intencji, taką jak ograniczone odtwarzanie podatności, od pracy o złej intencji, takiej jak eksploatacja podatności, a symulowani użytkownicy mogą nasilić szkodliwą intencję w dowolnym momencie, w tym po początkowo nieszkodliwym żądaniu.
Projekt rozszerza wcześniejsze badania Goodfire nad nagradzaniem w hackingu. W post opublikowany 17 września 2026, firma poinformowała o wykryciu hackingu nagród w 50–96 % rolloutów na Kimi K3, GLM 5.2 i Qwen 3.8 Max w trzech benchmarkach agentowych, wraz z wewnętrznym sygnałem powiązanym z pojęciami takimi jak oszustwo, manipulacja metryką i unikanie wykrycia. Proste sondy aktywacji dostrojone do tego sygnału wykrywały hacki, które monitorujące łańcuchy myślowe LLM przegapiły, a na Kimi K3 konfiguracja sonda+LLM obniżyła koszt monitorowania LLM o 90 % przy spadku precyzji o około 1 %, jak podała firma.
Przepustowość, opóźnienie i wyniki wykrywania
Aby uruchomić sondy w czasie rzeczywistym, Goodfire rozszerzył silnik serwowania SGLang o wewnętrzne obliczanie wyników sond, napisał własne jądra dla logiki sondy oraz przenosił wyniki sond przez drzewo radix, speculator DSpark i rozdzielenie prefill-decode, aby uniknąć ponownego przeliczania. Każdy pracownik obsługujący replikę Kimi K3 uruchamia sondy i przechowuje historię aktywnych żądań, a zdarzenia monitorujące są zwracane w strumieniu odpowiedzi.
W czterech obciążeniach inferencyjnych włączenie sond utrzymało przepustowość w granicach szumu benchmarków Goodfire, z odnotowanym spadkiem poniżej 2 % w porównaniu do domyślnego serwowania SGLang. Kaskada skraca średnie dodatkowe opóźnienie na turę z 160 ms do 2 ms bez rozumowania sędziego oraz z 2 750 ms do 42 ms przy rozumowaniu, podaje Goodfire, a kosztuje 65 $ za milion tur agenta bez rozumowania lub 185 $ z rozumowaniem, co zmniejsza koszt sędziego o około 49‑krotnie i 29‑krotnie odpowiednio w porównaniu do przeglądania każdej tury. W ramach stałego budżetu obliczeniowego, firma twierdzi, że monitory zużywają mniej niż 1 % mocy obliczeniowej, w przeciwieństwie do nawet 20 % przy sędziu oceniającym każdą turę. Ponieważ kaskada jest na tyle tania, że może działać synchronicznie, Goodfire twierdzi, że ryzykowne działania cybernetyczne mogą być blokowane zanim agent wywoła narzędzie, a nie dopiero po ich oznaczeniu.
Goodfire oceniło monitory na wewnętrznym zestawie danych obejmującym 2 400 sesji czatowych i agentowych, zawierających ponad 60 000 tur, używając etykiet Claude Opus 5 jako odniesienia; interakcje pochodziły z otwarto‑źródłowej biblioteki red‑teamingu Petri firmy Anthropic, rzeczywistych środowisk dostosowanych z benchmarków takich jak ExploitBench, cyber‑specyficznego podzbioru WildChat oraz nieszkodliwych wdrożeń inżynierii oprogramowania, kodowania i DevOps. Przy wskaźniku przerwania sesji nieszkodliwych wynoszącym 5,5 % Goodfire informuje, że kaskada osiągnęła przybliżone 93 % wykrywalności szkodliwych sesji zarówno z, jak i bez rozumowania sędziego oraz oznaczyła 0 % ruchu nie‑cybernetycznego, co firma opisuje jako poprawę Pareto w porównaniu z samym sędzią przy każdej testowanej wielkości przerwania. Dodanie monitora podniosło współczynnik blokowania szkodliwych sesji Kimi K3 z około 29 % do 96 %, przy jednoczesnym wzroście przerwań sesji nieszkodliwych z około 5 % do 9 %; w przypadku GLM 5.3 blokowanie wzrosło z około 36 % do 91 %, a przerwania nieszkodliwych z około 10 % do 15 %.
Przeciwko Jev, modelowi decyzyjnemu, który może pełnić rolę taniego sędziego, kaskady osiągnęły 93 % wykrywalności przy tym samym wskaźniku przerwania sesji nieszkodliwych 5,5 % w porównaniu z 86 % dla Jev, przy kosztach obliczeniowych sędziego wynoszących około 65 $ za milion tur i dodatkowym opóźnieniu 2 ms na turę, w porównaniu z 600 $ i 200 ms dla Jev, podaje Goodfire. Jev wykrył jedynie 12 % szkodliwych podpowiedzi osadzonych w nieszkodliwym kontekście i coraz częściej przerywał sesje nieszkodliwe po przekroczeniu swojego okna 32 000 tokenów. Standardowe liniowe sondy osiągały około 5 % niższą wykrywalność niż ostateczna metoda, sondy nieliniowe traciły do 30 % wykrywalności na zestawach spoza dystrybucji, a dopasowanie się do maksymalnego poziomu wykrywalności sędziego przy sześciokrotnie mniejszej liczbie wywołań sędziego wymagało użycia kaskady sond zamiast losowego wyboru tur. Metoda została również przeniesiona na GLM 5.3 przy użyciu wyłącznie danych opracowanych dla Kimi K3, co dało w przybliżeniu równie skuteczny monitor GLM w wdrożeniach Kimi oraz nieco gorszy na własnych danych oceny GLM, informuje firma.
Zewnętrzny red‑teaming przez FAR.AI
Aby przetestować wdrożony system poza wewnętrznymi ocenami, Goodfire poprosiło FAR.AI o przeprowadzenie red‑teamingu. W raporcie FAR.AI, cytowanym w poście:
“FAR.AI przeprowadziło wstępne testy monitorów Kimi K3 firmy Goodfire przez okres dwóch dni, stosując nieadaptacyjne portfolio statycznych jailbreaków do ofensywnego nadużycia cybernetycznego w kontekstach czatowych. Z początkowego zestawu 1500 kandydatów na jailbreaki wybrano 140 uznanych za skuteczne przeciwko innej wersji modelu bazowego bez naszych monitorów. Testując każdy z tych 140 w 8 indywidualnych interakcjach odpowiadających różnym celom atakujących, monitory Goodfire zmniejszyły podatności wywołane przez 66 uniwersalnych jailbreaków i 700 łącznych interakcji jailbreakowych do 0 uniwersalnych jailbreaków i 18 interakcji jailbreakowych.”
Bez monitora sukces ataków uniwersalnych jailbreaków wahał się od 12 % do 53 % w zależności od poziomu wysiłku rozumowania, według posta; po włączeniu monitora żadna z 140 strategii nie wygenerowała uniwersalnego jailbreaku, a skuteczność poszczególnych podpowiedzi w 1 120 interakcjach nie‑uniwersalnych spadła z co najmniej 9‑40 % do 0,1‑1,6 % w zależności od wysiłku rozumowania.
Goodfire opisuje tego rodzaju konfigurację monitorowania jako praktyczne domyślne rozwiązanie dla każdego, kto udostępnia otwarte modele w środowiskach agentowych, zauważając, że modele otwarte nie posiadają pełnego zestawu zabezpieczeń. Firma oświadczyła, że planuje kontynuować współpracę z FAR.AI w zakresie dalszych testów i wzmocnienia monitorów.












