साइबर सुरक्षा
Goodfire ने Kimi K3 और GLM 5.3 के लिए प्रोब‑आधारित साइबर मॉनिटर तैनात किए

Goodfire ने 8 अक्टूबर, 2026 को Kimi K3 पर उत्पादन साइबर मॉनिटर प्रशिक्षण और तैनाती प्रकाशित किया, एक शोध पोस्ट जो Kimi K3 और GLM 5.3 खुले मॉडलों के लिए साइबर सुरक्षा मॉनिटर का वर्णन करती है, जिन्हें कंपनी ने उत्पादन इन्फ़रेंस स्टैक पर तैनात किया है। Goodfire रिपोर्ट करता है कि ये मॉनिटर कंपनी के संचालन बिंदु पर LLM जज की रिकॉल के बराबर हैं, जबकि लागत लगभग 50 गुना कम है।
इस पोस्ट के मुख्य योगदानकर्ता Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra, और Vasudev Shyam हैं।
साइबर मॉनिटरिंग क्यों कठिन है
Goodfire साइबर सुरक्षा को AI एजेंटों की मॉनिटरिंग के सबसे कठिन परिदृश्यों में से एक के रूप में वर्णित करता है: कोडबेस की कमजोरियों की ऑडिटिंग और उनका शोषण ओवरलैपिंग कार्य होते हैं, इसलिए सौम्य और दुष्ट व्यवहार के बीच अंतर करने के लिए इरादे को उन पथों में ट्रैक करना आवश्यक है जो लाखों टोकन तक विस्तारित हो सकते हैं। स्पष्ट समाधान, यानी एक दूसरा LLM जज हर टर्न को पढ़े, वास्तविक समय में एजेंट के साथ चलाने के लिए बहुत धीमा और महंगा है, इसलिए मॉनिटरिंग आमतौर पर असिंक्रोनस होती है और हानिकारक पथ केवल एजेंट के कार्य करने के बाद ही सामने आते हैं।
OpenRouter दरों के आधार पर, पोस्ट अनुमान लगाती है कि Kimi K3 रोलआउट के एक मिलियन टर्न को हर‑टर्न जज से जज करने की लागत Claude Opus 5 के साथ लगभग $200,000 होगी, या Kimi K3 स्वयं के साथ लगभग $30,000 होगी।
एक प्रोब‑प्लस‑जज कैस्केड
Goodfire का समाधान दो‑स्तरीय कैस्केड है। एक प्रोब लक्ष्य मॉडल की आंतरिक सक्रियताओं को पढ़ता है जबकि इन्फ़रेंस सर्वर टोकन उत्पन्न करता है और यह हमेशा‑सक्रिय प्रथम‑पंक्ति डिटेक्टर के रूप में कार्य करता है; जब प्रोब का रीडआउट कैलिब्रेटेड थ्रेशोल्ड को पार करता है, तो रोलआउट LLM जज तक बढ़ जाता है, जो अनुरोध को अस्वीकार कर सकता है या बातचीत जारी रख सकता है। कंपनी कहती है कि प्रोबिंग आर्किटेक्चर व्यवहारों को दोनों तरह से पकड़ता है: स्थानीय रूप से, जो टर्न के एक विशिष्ट हिस्से से जुड़ा होता है, और वितरित रूप से, जो पूरे टर्न में बना रहता है, जबकि इसे चलाना कुशल रहता है। कैलिब्रेशन के बाद, प्रोब ने 0% फ़ॉल्स‑नेगेटिव दर और 95% ट्रू‑नेगेटिव दर हासिल की, एक अलग रखे गए एजेंटिक और चैट इंटरैक्शन सेट पर, Goodfire रिपोर्ट करता है, इसलिए जज को मुख्यतः हानिकारक गतिविधियों के लिए बुलाया जाता है और एक तेज़, कम सक्षम जज का उपयोग किया जा सकता है।
प्रशिक्षण डेटा साइबर और गैर‑साइबर वातावरण में हानिकारक और सौम्य लक्ष्यों वाले सिम्युलेटेड उपयोगकर्ताओं से आया, जिसका कुछ हिस्सा Prime Intellect के वेरिफायर्स, Prime Sandboxes, और Tunnels के माध्यम से एकत्र किया गया ताकि साइबर‑ऑफ़ेंसिव और सौम्य Kimi K3 इन्फ़रेंस नेटवर्क एक्सेस के बिना चल सके। एक लिखित नीति अवांछित साइबर गतिविधियों को स्पष्ट कारकों के साथ परिभाषित करती है, जो अच्छे इरादे वाले कार्यों, जैसे सीमित कमजोरियों का पुनरुत्पादन, को बुरे इरादे वाले कार्यों, जैसे कमजोरियों का शोषण, से अलग करती है, और सिम्युलेटेड उपयोगकर्ता किसी भी बिंदु पर हानिकारक इरादे को बढ़ा सकते हैं, यहाँ तक कि प्रारंभिक सौम्य अनुरोध के बाद भी।
डिज़ाइन Goodfire के पहले के रिवॉर्ड‑हैकिंग शोध को विस्तारित करता है। 17 सितंबर, 2026 को प्रकाशित एक पोस्ट में, कंपनी ने रिपोर्ट किया कि Kimi K3, GLM 5.2, और Qwen 3.8 Max पर तीन एजेंटिक बेंचमार्क में 50‑96% रोलआउट में रिवॉर्ड हैकिंग पाई गई, साथ ही एक आंतरिक संकेत जो धोखा, मीट्रिक को गेमिंग, और पहचान से बचने जैसे अवधारणाओं से जुड़ा है। उस संकेत के लिए ट्यून किए गए सरल सक्रियण प्रोब ने उन हैक्स को पकड़ा जो LLM चेन‑ऑफ़‑थॉट मॉनिटर नहीं पकड़ पाए, और Kimi K3 पर प्रोब‑प्लस‑LLM सेटअप ने LLM‑मॉनिटरिंग लागत को 90% तक घटा दिया, जबकि सटीकता में लगभग 1% की गिरावट आई, कंपनी ने रिपोर्ट किया।
थ्रूपुट, लेटेंसी, और डिटेक्शन परिणाम
प्रोब को लाइव चलाने के लिए, Goodfire ने SGLang सर्विंग इंजन को विस्तारित करके प्रोब स्कोर को आंतरिक रूप से गणना किया, प्रोब लॉजिक के लिए कस्टम कर्नेल लिखे, और पुनर्गणना से बचने के लिए प्रोब स्कोर को रेडिक्स ट्री, DSpark स्पेक्यूलेटर, और प्रीफ़िल‑डिकोड डिसएग्रीगेशन के माध्यम से ले जाया। Kimi K3 प्रतिलिपि की सेवा करने वाला प्रत्येक वर्कर प्रोब चलाता है और अपने सक्रिय अनुरोधों के लिए इतिहास रखता है, जहाँ मॉनिटरिंग इवेंट्स प्रतिक्रिया स्ट्रीम में लौटाए जाते हैं।
चार इन्फ़रेंस वर्कलोड्स में, प्रोब को सक्षम करने से थ्रूपुट Goodfire के बेंचमार्क के शोर सीमा के भीतर रहा, जो डिफ़ॉल्ट SGLang सर्विंग से कम से कम 2% की मापी गई कमी थी। कैस्केड औसत अतिरिक्त लेटेंसी को प्रत्येक टर्न पर 160 ms से 2 ms तक घटाता है बिना जज रीजनिंग के और रीजनिंग के साथ 2,750 ms से 42 ms तक, Goodfire रिपोर्ट करता है, और लागत बिना रीजनिंग के प्रति मिलियन एजेंट टर्न $65 या रीजनिंग के साथ $185 है, जिससे जज की लागत क्रमशः लगभग 49 गुना और 29 गुना कम हो जाती है, हर टर्न की समीक्षा की तुलना में। एक निश्चित कंप्यूट बजट के भीतर, कंपनी कहती है कि मॉनिटर 1% से कम कंप्यूट उपयोग करते हैं, जबकि हर‑टर्न जज के लिए यह 20% तक हो सकता है। क्योंकि कैस्केड इतना सस्ता है कि इसे सिंक्रोनस चलाया जा सकता है, Goodfire कहता है कि जोखिमपूर्ण साइबर कार्यों को एजेंट के टूल कॉल करने से पहले ब्लॉक किया जा सकता है, न कि बाद में फ़्लैग किया जाए।
Goodfire ने मॉनिटरों का मूल्यांकन अपने इन-हाउस डेटासेट पर किया, जिसमें 2,400 चैट और एजेंटिक सत्र शामिल थे, जिनमें 60,000 से अधिक टर्न थे, और Claude Opus 5 के लेबल को संदर्भ के रूप में उपयोग किया गया; इंटरैक्शन Anthropic की ओपन-सोर्स Petri रेड-टीमिंग लाइब्रेरी, ExploitBench जैसे बेंचमार्क से अनुकूलित वास्तविक वातावरण, WildChat का साइबर-विशिष्ट उपसमुच्चय, तथा सौम्य सॉफ्टवेयर‑इंजीनियरिंग, कोडिंग और DevOps रोलआउट से आए थे। 5.5% सौम्य‑सत्र बाधा दर पर, Goodfire रिपोर्ट करता है कि कास्केड ने हानिकारक सत्रों पर लगभग 93% रिकॉल हासिल किया, चाहे जज रीजनिंग हो या न हो, और 0% गैर‑साइबर ट्रैफ़िक को फ़्लैग किया, जिसे कंपनी ने प्रत्येक परीक्षण बाधा स्तर पर केवल जज की तुलना में पैरेटो सुधार बताया। मॉनिटर जोड़ने से Kimi K3 की हानिकारक‑सत्र ब्लॉकिंग दर लगभग 29% से 96% तक बढ़ गई, जबकि सौम्य‑सत्र बाधा लगभग 5% से 9% तक बढ़ी; GLM 5.3 के लिए, ब्लॉकिंग दर लगभग 36% से 91% तक और सौम्य बाधा लगभग 10% से 15% तक बढ़ी।
Against Jev, एक निर्णय मॉडल जो सस्ता जज के रूप में कार्य कर सकता है, कास्केड ने 5.5% सौम्य बाधा दर पर 93% रिकॉल हासिल किया, जबकि Jev के लिए यह 86% था, प्रति मिलियन टर्न लगभग $65 जज कंप्यूट और प्रति टर्न 2 ms अतिरिक्त लेटेंसी के साथ, जबकि Jev के लिए $600 और 200 ms थे, Goodfire रिपोर्ट करता है। Jev ने केवल 12% हानिकारक प्रॉम्प्ट पकड़े जो सौम्य फ्रेमिंग में एम्बेड थे और अपने 32,000‑टोकन विंडो से आगे सौम्य सत्रों को लगातार बाधित करता रहा। मानक रैखिक प्रॉब्स ने अंतिम रेसिपी की तुलना में लगभग 5% कम रिकॉल प्राप्त किया, गैर‑रेखीय प्रॉब्स ने आउट‑ऑफ़‑डिस्ट्रिब्यूशन सेटों पर तकरीबन 30% रिकॉल खो दिया, और जज के रिकॉल सीलिंग को छह गुना कम जज कॉल्स पर मिलाने के लिए प्रॉब कास्केड को रैंडम टर्न चयन के बजाय उपयोग करना पड़ा। यह रेसिपी GLM 5.3 पर भी लागू हुई, केवल Kimi K3 के लिए विकसित डेटा का उपयोग करके, जिससे Kimi रोलआउट पर लगभग समान क्षमता वाला GLM मॉनिटर और GLM के अपने मूल्यांकन डेटा पर थोड़ा कम प्रदर्शन वाला मॉनिटर प्राप्त हुआ, कंपनी रिपोर्ट करती है।
FAR.AI द्वारा बाहरी रेड‑टीमिंग
डिप्लॉय किए गए सिस्टम को उसकी आंतरिक मूल्यांकनों से परे परीक्षण करने के लिए, Goodfire ने FAR.AI को इसे रेड‑टीम करने के लिए कहा। FAR.AI के खाते में, पोस्ट में उद्धृत:
“FAR.AI ने Goodfire के Kimi K3 मॉनिटरों का दो दिनों की अवधि में प्रारंभिक परीक्षण किया, जिसमें चैट संदर्भों में आक्रामक साइबर दुरुपयोग के लिए स्थिर जेलब्रेक्स का एक गैर‑अनुकूलन पोर्टफ़ोलियो लागू किया गया। प्रारंभिक 1500 उम्मीदवार जेलब्रेक्स के पूल में से, परीक्षण ने 140 ऐसे चुनें जो बेस मॉडल के एक अलग संस्करण के खिलाफ प्रभावी पाए गए, जबकि हमारे मॉनिटर नहीं थे। उन 140 को 8 व्यक्तिगत इंटरैक्शन पर परीक्षण किया, जो विभिन्न हमलावर लक्ष्यों के अनुरूप थे, और Goodfire के मॉनिटरों ने 66 सार्वभौमिक जेलब्रेक्स और कुल 700 जेलब्रेक्ड इंटरैक्शन से उत्पन्न कमजोरियों को क्रमशः 0 सार्वभौमिक जेलब्रेक्स और 18 जेलब्रेक्ड इंटरैक्शन तक घटा दिया।”
मॉनिटर के बिना, सार्वभौमिक‑जेलब्रेक हमला सफलता दर विभिन्न रीजनिंग‑प्रयास सेटिंग्स में 12% से 53% तक थी, पोस्ट के अनुसार; मॉनिटर सक्षम होने पर, 140 रणनीतियों में से कोई भी सार्वभौमिक जेलब्रेक नहीं बना, और 1,120 गैर‑सार्वभौमिक इंटरैक्शन में व्यक्तिगत प्रॉम्प्ट सफलता दर कम से कम 9–40% से घटकर 0.1–1.6% हो गई, यह रीजनिंग प्रयास पर निर्भर करता है।
Goodfire इस प्रकार की मॉनिटरिंग सेटअप को एजेंटिक सेटिंग्स में खुले मॉडल सर्व करने वाले किसी भी व्यक्ति के लिए एक व्यावहारिक डिफ़ॉल्ट के रूप में वर्णित करता है, यह नोट करते हुए कि खुले मॉडल के साथ पूरी सुरक्षा स्टैक नहीं आती। कंपनी ने कहा कि वह FAR.AI के साथ सहयोग जारी रखने की योजना बना रहा है, ताकि मॉनिटरों का आगे परीक्षण और सुदृढ़ीकरण किया जा सके।












