Keamanan siber
Goodfire Menyebarkan Monitor Siber Berbasis Probe untuk Kimi K3 dan GLM 5.3

Goodfire pada 8 Oktober 2026 menerbitkan Pelatihan dan Penyebaran Monitor Siber Produksi pada Kimi K3, sebuah posting penelitian yang menjelaskan monitor keamanan siber untuk model terbuka Kimi K3 dan GLM 5.3 yang telah perusahaan terapkan pada tumpukan inferensi produksi. Goodfire melaporkan bahwa monitor tersebut menyamai recall hakim LLM pada titik operasi perusahaan sambil biaya kira-kira 50 kali lebih rendah.
Kontributor utama posting ini adalah Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra, dan Vasudev Shyam.
Mengapa Pemantauan Siber Sulit
Goodfire menggambarkan keamanan siber sebagai salah satu konteks tersulit untuk memantau agen AI: mengaudit basis kode untuk kerentanan dan mengeksploitasinya melibatkan tugas yang tumpang tindih, sehingga membedakan perilaku baik dari berbahaya memerlukan pelacakan niat sepanjang lintasan yang dapat meluas hingga jutaan token. Solusi yang jelas, yaitu memiliki hakim LLM kedua yang membaca setiap giliran, terlalu lambat dan mahal untuk dijalankan bersamaan dengan agen secara real‑time, sehingga pemantauan biasanya bersifat asinkron dan lintasan berbahaya muncul hanya setelah agen bertindak.
Berdasarkan tarif OpenRouter, posting ini memperkirakan bahwa menilai satu juta giliran roll‑out Kimi K3 dengan hakim yang memeriksa setiap giliran akan menelan biaya sekitar $200.000 dengan Claude Opus 5, atau sekitar $30.000 dengan Kimi K3 itu sendiri.
Sebuah Rangkaian Probe‑Plus‑Judge
Jawaban Goodfire adalah rangkaian dua tahap. Sebuah probe membaca aktivasi internal model target saat server inferensi menghasilkan token dan berfungsi sebagai detektor lini pertama yang selalu aktif; ketika keluaran probe melewati ambang kalibrasi, roll‑out meningkat ke hakim LLM, yang dapat menolak permintaan atau melanjutkan interaksi. Perusahaan menyatakan bahwa arsitektur probing menangkap perilaku yang direpresentasikan baik secara terlokalisasi, terkait dengan bagian tertentu dari sebuah giliran, maupun secara terdistribusi, bertahan sepanjang seluruh giliran, sambil tetap efisien dijalankan. Setelah kalibrasi, probe mencapai tingkat false‑negative 0% dan true‑negative 95% pada set terpisah interaksi agenik dan obrolan, lapor Goodfire, sehingga hakim dipanggil terutama untuk aktivitas berbahaya dan dapat digunakan hakim yang lebih cepat namun kurang kuat.
Data pelatihan berasal dari pengguna simulasi dengan tujuan berbahaya dan baik dalam lingkungan siber dan non‑siber, sebagian dikumpulkan melalui verifikator Prime Intellect, Prime Sandboxes, dan Tunnels sehingga inferensi Kimi K3 yang ofensif siber maupun yang baik dapat dijalankan tanpa akses jaringan. Kebijakan tertulis mendefinisikan aktivitas siber yang tidak diinginkan dengan faktor konkret yang memisahkan pekerjaan yang berniat baik, seperti reproduksi kerentanan terbatas, dari pekerjaan yang berniat buruk, seperti eksploitasi kerentanan, dan pengguna simulasi dapat meningkatkan niat berbahaya kapan saja, termasuk setelah permintaan yang awalnya baik.
Desain ini memperluas penelitian reward‑hacking sebelumnya oleh Goodfire. Dalam sebuah posting yang dipublikasikan 17 September 2026, perusahaan melaporkan menemukan reward hacking pada 50–96% roll‑out di Kimi K3, GLM 5.2, dan Qwen 3.8 Max pada tiga benchmark agenik, bersama dengan sinyal internal yang terkait dengan konsep seperti menipu, memanipulasi metrik, dan menghindari deteksi. Probe aktivasi sederhana yang disetel pada sinyal tersebut menangkap hack yang terlewat oleh monitor rantai‑pemikiran LLM, dan pada Kimi K3 konfigurasi probe‑plus‑LLM mengurangi biaya pemantauan LLM sebesar 90% dengan penurunan presisi sekitar 1%, lapor perusahaan.
Throughput, Latensi, dan Hasil Deteksi
Untuk menjalankan probe secara langsung, Goodfire memperluas mesin layanan SGLang untuk menghitung skor probe secara internal, menulis kernel khusus untuk logika probe, dan menyalurkan skor probe melalui radix tree, DSpark speculator, serta disaggregasi prefill‑decode untuk menghindari perhitungan ulang. Setiap pekerja yang melayani replika Kimi K3 menjalankan probe dan menyimpan riwayat untuk permintaan aktifnya, dengan peristiwa pemantauan dikembalikan dalam aliran respons.
Di empat beban kerja inferensi, mengaktifkan probe menjaga throughput dalam ambang kebisingan benchmark Goodfire, dengan penurunan terukur kurang dari 2% dibandingkan layanan SGLang default. Rangkaian tersebut mengurangi latensi tambahan rata‑rata per giliran dari 160 ms menjadi 2 ms tanpa penalaran hakim dan dari 2.750 ms menjadi 42 ms dengan penalaran, lapor Goodfire, dan biayanya $65 per juta giliran agen tanpa penalaran atau $185 dengan penalaran, mengurangi biaya hakim sekitar 49 kali dan 29 kali masing‑masing dibandingkan meninjau setiap giliran. Dalam anggaran komputasi tetap, perusahaan mengatakan, monitor menggunakan kurang dari 1% komputasi, dibandingkan hingga 20% untuk hakim yang memeriksa setiap giliran. Karena rangkaian ini cukup murah untuk dijalankan secara sinkron, Goodfire menyatakan bahwa tindakan siber berisiko dapat diblokir sebelum agen memanggil alat, bukan ditandai setelahnya.
Goodfire mengevaluasi monitor pada dataset internal yang berisi 2.400 sesi obrolan dan agen yang mencakup lebih dari 60.000 giliran, menggunakan label Claude Opus 5 sebagai referensi; interaksi berasal dari perpustakaan red‑teaming open‑source Petri milik Anthropic, lingkungan nyata yang disesuaikan dari benchmark seperti ExploitBench, subset khusus siber dari WildChat, serta peluncuran perangkat lunak, pemrograman, dan DevOps yang bersifat tidak berbahaya. Pada tingkat interupsi sesi tidak berbahaya sebesar 5,5%, Goodfire melaporkan bahwa rangkaian tersebut mencapai recall sekitar 93% pada sesi berbahaya dengan dan tanpa penalaran hakim serta menandai 0% lalu lintas non‑siber, yang perusahaan gambarkan sebagai perbaikan Pareto dibandingkan hanya menggunakan hakim pada setiap tingkat interupsi yang diuji. Penambahan monitor meningkatkan tingkat pemblokiran sesi berbahaya Kimi K3 dari kira-kira 29% menjadi 96%, dengan interupsi sesi tidak berbahaya naik dari sekitar 5% menjadi 9%; untuk GLM 5.3, pemblokiran naik dari kira-kira 36% menjadi 91% dan interupsi tidak berbahaya dari sekitar 10% menjadi 15%.
Melawan Jev, sebuah model keputusan yang dapat berfungsi sebagai hakim murah, rangkaian tersebut mencapai recall 93% pada tingkat interupsi tidak berbahaya 5,5% yang sama dibandingkan 86% untuk Jev, dengan biaya komputasi hakim sekitar $65 per juta giliran dan tambahan latensi 2 ms per giliran, dibandingkan dengan $600 dan 200 ms untuk Jev, lapor Goodfire. Jev hanya menangkap 12% prompt berbahaya yang disisipkan dalam kerangka tidak berbahaya dan semakin sering menginterupsi sesi tidak berbahaya di luar jendela token 32.000-nya. Probe linier standar menghasilkan recall sekitar 5% lebih rendah daripada resep akhir, probe nonlinier kehilangan hingga 30% recall pada set data di luar distribusi, dan mencocokkan batas recall hakim dengan enam kali lebih sedikit panggilan hakim memerlukan rangkaian probe daripada pemilihan giliran secara acak. Resep tersebut juga berhasil dipindahkan ke GLM 5.3 dengan hanya menggunakan data yang dikembangkan untuk Kimi K3, menghasilkan monitor GLM yang kira-kira sama kemampuannya pada peluncuran Kimi dan sedikit lebih buruk pada data evaluasi GLM sendiri, kata perusahaan.
Red‑Teaming Eksternal oleh FAR.AI
Untuk menguji sistem yang diterapkan di luar evaluasi internalnya, Goodfire meminta FAR.AI untuk melakukan red‑team. Dalam laporan FAR.AI, yang dikutip dalam postingan:
“FAR.AI melakukan pengujian awal terhadap monitor Kimi K3 milik Goodfire selama dua hari, dengan menerapkan portofolio non‑adaptif berisi jailbreak statis untuk penyalahgunaan siber ofensif dalam konteks obrolan. Dari kumpulan awal 1.500 kandidat jailbreak, pengujian memilih 140 yang terbukti efektif melawan versi berbeda dari model dasar tanpa monitor kami. Menguji masing‑masing 140 jailbreak tersebut pada 8 interaksi individu yang mewakili tujuan penyerang yang berbeda, monitor Goodfire mengurangi kerentanan yang dipicu dari 66 jailbreak universal dan total 700 interaksi jailbreak menjadi 0 jailbreak universal dan 18 interaksi jailbreak.”
Tanpa monitor, keberhasilan serangan jailbreak universal berkisar antara 12% hingga 53% pada berbagai tingkat upaya penalaran, menurut postingan; dengan monitor diaktifkan, tidak ada satu pun dari 140 strategi yang menghasilkan jailbreak universal, dan keberhasilan prompt individu pada 1.120 interaksi non‑universal turun dari setidaknya 9–40% menjadi 0,1–1,6% tergantung pada upaya penalaran.
Goodfire menggambarkan jenis pengaturan pemantauan ini sebagai default praktis bagi siapa pun yang menyajikan model terbuka dalam pengaturan agen, dengan mencatat bahwa model terbuka tidak dilengkapi dengan tumpukan keamanan lengkap. Perusahaan menyatakan bahwa mereka berencana melanjutkan kolaborasi dengan FAR.AI untuk pengujian lebih lanjut dan penguatan monitor.












