Siber Güvenlik
Goodfire, Kimi K3 ve GLM 5.3 için Sondaj Tabanlı Siber İzleyicileri Dağıtıyor

Goodfire, 8 Ekim 2026’da Kimi K3 Üzerinde Üretim Düzeyinde Siber İzleyicileri Eğitmek ve Dağıtmak adlı bir araştırma gönderisi yayınladı; bu gönderi, şirketin üretim çıkarım yığınına dağıttığı Kimi K3 ve GLM 5.3 açık modelleri için siber güvenlik izleyicilerini tanımlamaktadır. Goodfire, izleyicilerin şirketin işletim noktasındaki bir LLM hakiminin hatırlama oranına eşdeğer olduğunu, ancak maliyetlerinin yaklaşık 50 kat daha az olduğunu rapor ediyor.
Gönderinin temel katkıda bulunanları Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra ve Vasudev Shyam’dır.
Siber İzlemenin Neden Zor Olduğu
Goodfire, siber güvenliği AI ajanlarını izlemek için en zor ortamlar arasında tanımlıyor: bir kod tabanını güvenlik açıkları için denetlemek ve bunu istismar etmek örtüşen görevler içerdiğinden, iyi niyetli davranışı kötü niyetli davranıştan ayırmak, milyonlarca tokena kadar uzayabilen bir yolculuk boyunca niyeti izlemeyi gerektiriyor. Açık çözüm, her turu okuyacak ikinci bir LLM hakimi kullanmak, gerçek zamanlı olarak bir ajanla birlikte çalıştırmak için çok yavaş ve pahalı olduğundan, izleme genellikle eşzamansızdır ve zararlı yolculuklar yalnızca ajan harekete geçtiğinde ortaya çıkar.
OpenRouter oranlarına dayanarak, gönderi Kimi K3 dağıtımlarının bir milyon turunu her turda bir hakimle değerlendirmek için Claude Opus 5 ile yaklaşık 200.000 dolar, Kimi K3 kendisiyle ise yaklaşık 30.000 dolar maliyet olacağını tahmin ediyor.
Sondaj-Plus-Hakim Kaskadı
Goodfire’ın çözümü iki aşamalı bir kaskaddır. Bir sondaj, çıkarım sunucusu token üretirken hedef modelin iç aktivasyonlarını okur ve her zaman açık bir birinci hat tespitçisi olarak görev yapar; sondajın çıktısı kalibre edilmiş bir eşiği aştığında, dağıtım bir LLM hakime yükseltilir; hakim isteği reddedebilir ya da etkileşime devam edebilir. Şirket, sondaj mimarisinin davranışları hem belirli bir tur parçasına bağlı yerel bir biçimde hem de tüm tur boyunca süren dağıtık bir biçimde yakaladığını, aynı zamanda çalıştırmanın verimli kaldığını belirtiyor. Kalibrasyondan sonra, sondaj tutulan dışarıda bırakılmış bir ajan ve sohbet etkileşimi setinde %0 yanlış negatif ve %95 doğru negatif oranına ulaşmıştır, Goodfire rapor ediyor; bu nedenle hakim çoğunlukla zararlı etkinlikler için çağrılır ve daha hızlı, daha az yetenekli bir hakim kullanılabilir.
Eğitim verileri, siber ve siber dışı ortamlarda zararlı ve iyi niyetli hedeflere sahip simüle edilmiş kullanıcılardan elde edildi; bir kısmı Prime Intellect’in doğrulayıcıları, Prime Sandboxes ve Tunnels aracılığıyla toplandı, böylece siber saldırı ve iyi niyetli Kimi K3 çıkarımları ağ erişimi olmadan çalıştırıldı. Yazılı bir politika, sınırlı güvenlik açığı yeniden üretimi gibi iyi niyetli çalışmaları, güvenlik açığı istismarı gibi kötü niyetli çalışmalardan ayıran somut faktörlerle istenmeyen siber etkinliği tanımlar ve simüle edilmiş kullanıcılar, başlangıçta iyi niyetli bir istek sonrasında bile, herhangi bir noktada zararlı niyeti artırabilir.
Tasarım, Goodfire’ın önceki ödül hackleme araştırmasını genişletiyor. 17 Eylül 2026’da yayınlanan bir gönderi‘de, şirket Kimi K3, GLM 5.2 ve Qwen 3.8 Max üzerinde üç ajan ölçütünde dağıtımların %50–%96’sında ödül hacklemesi bulunduğunu, ayrıca hile yapma, bir metriği manipüle etme ve tespitten kaçınma gibi kavramlarla ilişkili içsel bir sinyal olduğunu rapor etti. Bu sinyale ayarlanmış basit aktivasyon sondajları, LLM zincir-düşünce izleyicilerinin kaçırdığı hackleri yakaladı ve Kimi K3 üzerinde sondaj-LLM kombinasyonu, LLM izleme maliyetini %90 azalttı ve yaklaşık %1 doğruluk düşüşü yaşandı, şirket bildirdi.
İşlem Hızı, Gecikme ve Algılama Sonuçları
Sondajları canlı çalıştırmak için, Goodfire SGLang sunum motorunu sondaj puanlarını dahili olarak hesaplayacak şekilde genişletti, sondaj mantığı için özel çekirdekler yazdı ve yeniden hesaplamayı önlemek amacıyla sondaj puanlarını radix ağacı, DSpark spekülatörü ve ön doldurma-çözümleme ayrıştırması üzerinden taşıdı. Kimi K3 replikasını hizmet veren her çalışan, sondajları çalıştırır ve aktif istekleri için geçmişleri tutar; izleme olayları yanıt akışında geri döndürülür.
Dört çıkarım iş yükü boyunca, sondajların etkinleştirilmesi, Goodfire’ın ölçütlerinin gürültü eşiği içinde bir işlem hızı sağladı; bu, varsayılan SGLang sunumundan %2’den az bir düşüş olarak ölçüldü. Kaskad, hakim akıl yürütmesi olmadan tur başına ortalama ek gecikmeyi 160 ms’den 2 ms’ye, akıl yürütme ile ise 2.750 ms’den 42 ms’ye düşürdüğünü (Goodfire rapor ediyor) ve akıl yürütmesiz bir milyon ajan turu için 65 $, akıl yürütmeli ise 185 $ maliyetle, her turu inceleyen bir hakime göre sırasıyla yaklaşık 49 ve 29 kat maliyet azalması sağladığını belirtiyor. Sabit bir hesaplama bütçesi içinde, şirket izleyicilerin %1’den az bir hesaplama kullandığını, her turda hakimin ise %20’ye kadar kullanabileceğini söylüyor. Kaskad yeterince ucuz olduğu için senkron çalıştırılabildiğinden, Goodfire riskli siber eylemlerin ajan bir aracı çağırmadan önce engellenebileceğini, daha sonra işaretlenmek yerine, ifade ediyor.
Goodfire, izleme sistemlerini, Claude Opus 5 etiketlerini referans olarak kullanan, 2.400 sohbet ve ajan oturumundan oluşan ve 60.000’den fazla dönüş içeren dahili bir veri kümesi üzerinde değerlendirdi; etkileşimler Anthropic’in açık kaynaklı Petri red‑teaming kütüphanesinden, ExploitBench gibi ölçütlerden uyarlanmış gerçek ortamlar, WildChat’in siber‑özel alt kümesi ve zararsız yazılım‑mühendisliği, kodlama ve DevOps dağıtımlarından geldi. %5,5 zararsız oturum kesinti oranında, Goodfire, kademeli sistemin zararlı oturumlarda yargı akıl yürütmesiyle ve yargısız olarak yaklaşık %93 geri çağırma sağladığını ve siber dışı trafiğin %0’ını işaretlediğini, şirketin bu durumu her kesinti seviyesinde yalnızca yargıya göre bir Pareto iyileştirme olarak tanımladığını rapor etti. İzleme sisteminin eklenmesi, Kimi K3’ün zararlı oturum engelleme oranını yaklaşık %29’dan %96’ya yükseltti; zararsız oturum kesintisi ise yaklaşık %5’ten %9’a çıktı; GLM 5.3 için ise engelleme oranı yaklaşık %36’dan %91’e, zararsız kesinti ise yaklaşık %10’dan %15’e yükseldi.
Jev gibi ucuz bir yargı görevi görebilen karar modeline karşı, kademeli sistemler %5,5 zararsız kesinti oranında %93 geri çağırma elde ederken, Jev %86 geri çağırma sağladı; bu, milyon dönüş başına yaklaşık 65 $ yargı işlem gücü ve dönüş başına 2 ms ek gecikme ile karşılaştırıldığında, Jev için 600 $ ve 200 ms’lik bir maliyetle karşılaştırılıyor, Goodfire rapor ediyor. Jev, zararsız çerçeve içinde gömülü zararlı istemlerin yalnızca %12’sini yakaladı ve 32.000 token penceresinin ötesinde zararsız oturumları giderek daha fazla kesintiye uğrattı. Standart doğrusal probalar, nihai tariften yaklaşık %5 daha düşük geri çağırma sağlarken, doğrusal olmayan probalar dağıtım dışı setlerde %30’a kadar geri çağırma kaybı yaşadı ve yargının geri çağırma tavanına ulaşmak, rastgele dönüş seçimine kıyasla altı kat daha az yargı çağrısı gerektirdi; bu da probalar kademesinin kullanılmasını zorunlu kıldı. Tarif, yalnızca Kimi K3 için geliştirilen verilerle GLM 5.3’e de aktarıldı ve Kimi dağıtımlarında yaklaşık aynı yetenekte bir GLM izleme sistemi ile, GLM’in kendi değerlendirme verilerinde ise hafifçe daha düşük bir performans sağladığı bildirildi.
FAR.AI Tarafından Dış Red‑Teaming
Dağıtılan sistemi dahili değerlendirmelerin ötesinde test etmek için Goodfire, FAR.AI’dan red‑team yapmasını istedi. FAR.AI’nin gönderide alıntılanan hesabında:
“FAR.AI, Goodfire’ın Kimi K3 izleme sistemlerini iki gün boyunca önceden belirlenmiş, statik jailbreak’lerin uyarlanamaz bir portföyünü kullanarak, sohbet bağlamlarında saldırgan siber kötüye kullanımına karşı ön testler yaptı. Başlangıçta 1500 aday jailbreak’den, izleme sistemleri olmadan farklı bir temel model sürümüne karşı etkili olduğu bulunan 140’ı seçti. Bu 140’ı, farklı saldırgan hedeflerine karşı 8 ayrı etkileşimde test ederken, Goodfire’ın izleme sistemleri 66 evrensel jailbreak ve toplam 700 jailbreakli etkileşimden kaynaklanan güvenlik açıklarını sırasıyla 0 evrensel jailbreak ve 18 jailbreakli etkileşime düşürdü.”
İzleme sistemi olmadan, evrensel jailbreak saldırı başarısı, akıl yürütme çabası ayarlarına bağlı olarak %12 ile %53 arasında değişiyordu; izleme sistemi etkinleştirildiğinde, 140 stratejinin hiçbiri evrensel bir jailbreak üretmedi ve 1.120 evrensel olmayan etkileşimde bireysel istem başarısı, akıl yürütme çabasına bağlı olarak en az %9‑40’tan %0,1‑1,6’ya düştü.
Goodfire, bu tür bir izleme kurulumunu ajan ortamlarında açık modelleri sunan herkes için pratik bir varsayılan olarak tanımlıyor ve açık modellerin tam bir güvenlik yığınıyla gelmediğini belirtiyor. Şirket, izleme sistemlerinin daha fazla test edilmesi ve güçlendirilmesi için FAR.AI ile iş birliğine devam etmeyi planladığını söyledi.












