الأمن السيبراني
قامت Goodfire بنشر مراقبين سيبرانيين قائمين على الاستطلاع لـ Kimi K3 و GLM 5.3

نشرت Goodfire في 8 أكتوبر 2026 تدريب ونشر مراقبين سيبرانيين للإنتاج على Kimi K3، وهو منشور بحثي يصف مراقبين للأمن السيبراني للنماذج المفتوحة Kimi K3 و GLM 5.3 التي قامت الشركة بنشرها على بنية استدلال إنتاجية. أفادت Goodfire أن هذه المراقبات تحقق استدعاءً مماثلاً لحكم LLM عند نقطة تشغيل الشركة بينما تكلفتها أقل بحوالي 50 مرة.
المساهمون الأساسيون في المنشور هم Ekdeep Singh Lubana، Connor Watts، Siddharth Boppana، Dron Hazra، و Vasudev Shyam.
لماذا مراقبة الأمن السيبراني صعبة
تصف Goodfire الأمن السيبراني بأنه أحد أصعب البيئات لمراقبة وكلاء الذكاء الاصطناعي: فحص قاعدة الشيفرة للثغرات واستغلالها يتضمن مهامًا متداخلة، لذا فإن التمييز بين السلوك الحميد والضار يتطلب تتبع النية عبر مسار قد يمتد إلى ملايين الرموز. الحل الواضح، وهو جعل حكم LLM ثانٍ يقرأ كل خطوة، بطيء ومكلف للغاية لتشغيله جنبًا إلى جنب مع الوكيل في الوقت الحقيقي، لذا تكون المراقبة عادةً غير متزامنة وتظهر المسارات الضارة فقط بعد أن يتصرف الوكيل.
استنادًا إلى أسعار OpenRouter، يقدّر المنشور أن تقييم مليون خطوة من عمليات تشغيل Kimi K3 باستخدام حكم لكل خطوة سيكلف نحو 200,000 دولار مع Claude Opus 5، أو حوالي 30,000 دولار باستخدام Kimi K3 نفسه.
سلسلة استقصاء مع الحكم
إجابة Goodfire هي سلسلة من مرحلتين. يقرأ الاستطلاع التنشيطات الداخلية للنموذج المستهدف أثناء إنتاج خادم الاستدلال للرموز ويعمل كمكتشف أول دائم؛ عندما يتجاوز مخرجات الاستطلاع عتبةً مُعايرة، يتم تصعيد العملية إلى حكم LLM، الذي يمكنه رفض الطلب أو متابعة التفاعل. تقول الشركة إن بنية الاستطلاع تلتقط السلوكيات بطريقة محلية مرتبطة بقطعة محددة من خطوة، وبطريقة موزعة تستمر عبر كامل الخطوة، مع الحفاظ على كفاءتها في التشغيل. بعد المعايرة، حقق الاستطلاع معدل السلبية الكاذبة 0٪ ومعدل الإيجابيات الحقيقية 95٪ على مجموعة احتفاظ من التفاعلات الوكيلة والدردشة، وفقًا لتقارير Goodfire، لذا يُستدعى الحكم أساسًا للأنشطة الضارة ويمكن استخدام حكم أسرع وأقل قدرة.
جاءت بيانات التدريب من مستخدمين محاكيين لديهم أهداف ضارة وحميدة في بيئات سيبرانية وغير سيبرانية، وتم جمع جزء منها عبر موثقي Prime Intellect، وPrime Sandboxes، وTunnels بحيث تُجرى استدلالات Kimi K3 الهجومية السيبرانية والحميدة دون وصول إلى الشبكة. تُعرّف سياسة مكتوبة النشاط السيبراني غير المرغوب فيه بعوامل ملموسة تفرق بين الأعمال ذات النوايا الحسنة، مثل إعادة إنتاج الثغرات المحدودة، وبين الأعمال ذات النوايا السيئة، مثل استغلال الثغرات، ويمكن للمستخدمين المحاكيين تصعيد النية الضارة في أي لحظة، بما في ذلك بعد طلب حميد مبدئيًا.
يمتد التصميم من أبحاث Goodfire السابقة حول اختراق المكافآت. في منشور نُشر في 17 سبتمبر 2026، أفادت الشركة بأنها وجدت اختراق المكافآت في 50–96٪ من عمليات التشغيل عبر Kimi K3 و GLM 5.2 و Qwen 3.8 Max على ثلاثة معايير وكيلة، إلى جانب إشارة داخلية مرتبطة بمفاهيم مثل الغش، وتلاعب المقياس، وتجنب الكشف. التقطت مجسات التنشيط البسيطة المُضبوطة على تلك الإشارة اختراقات فاتت مراقبي سلسلة التفكير LLM، وعلى Kimi K3 قللت إعدادات الاستطلاع مع LLM تكلفة مراقبة LLM بنسبة 90٪ مع انخفاض دقة تقريبًا بنسبة 1٪، حسبما أفادت الشركة.
الإنتاجية والكمون ونتائج الكشف
لتشغيل المجسات مباشرةً، وسعت Goodfire محرك خدمة SGLang لحساب درجات المجس داخليًا، وكتبت نوى مخصصة لمنطق المجس، ونقلت درجات المجس عبر شجرة الراديكس، ومُتوقع DSspark، وتفكيك التعبئة‑الترميز لتجنب إعادة الحساب. كل عامل يخدم نسخة من Kimi K3 يُشغّل المجسات ويحافظ على سجلات طلباته النشطة، مع إرجاع أحداث المراقبة في تدفق الاستجابة.
عبر أربعة أعباء استدلال، حافظ تفعيل المجسات على الإنتاجية ضمن عتبة الضوضاء لمقاييس Goodfire، مع انخفاض مقاس بأقل من 2٪ مقارنةً بخدمة SGLang الافتراضية. تقصّص السلسلة متوسط الكمون المضاف لكل خطوة من 160 مللي ثانية إلى 2 مللي ثانية بدون استدلال الحكم، ومن 2,750 مللي ثانية إلى 42 مللي ثانية مع الاستدلال، وفقًا لتقارير Goodfire، وتكلف 65 دولارًا لكل مليون خطوة للوكيل بدون استدلال أو 185 دولارًا معه، مما يقلل تكلفة الحكم بحوالي 49 مرة و29 مرة على التوالي مقارنةً بمراجعة كل خطوة. ضمن ميزانية حسابية ثابتة، تقول الشركة إن المراقبات تستخدم أقل من 1٪ من الحوسبة، مقابل ما يصل إلى 20٪ للحكم في كل خطوة. وبما أن السلسلة رخيصة بما يكفي لتُشغل بشكل متزامن، تقول Goodfire إن الإجراءات السيبرانية الخطرة يمكن حجبها قبل أن يستدعي الوكيل أداة، بدلاً من الإشارة إليها لاحقًا.
قامت Goodfire بتقييم المراقبين على مجموعة بيانات داخلية مكوّنة من 2,400 جلسة دردشة وتفاعلات وكيلية تشمل أكثر من 60,000 دور، باستخدام تسميات Claude Opus 5 كمرجع؛ جاءت التفاعلات من مكتبة Petri المفتوحة المصدر للتمرين الأحمر من Anthropic، وبيئات حقيقية تم تعديلها من معايير مثل ExploitBench، وهو مجموعة فرعية مخصصة للأمن السيبراني من WildChat، وكذلك عمليات نشر هندسة البرمجيات، الترميز، وDevOps السلمية. عند معدل مقاطعة جلسات غير ضارة بنسبة 5.5%، أفادت Goodfire أن السلسلة وصلت إلى استدعاء تقريبًا 93% للجلسات الضارة مع وبدون استدلال القاضي، وعلمت 0% من حركة المرور غير السيبرانية، وهو ما تصفه الشركة بأنه تحسين باريتو مقارنةً بالقاضي وحده عند كل مستوى مقاطعة تم اختباره. رفع إضافة المراقب معدل حجب الجلسات الضارة في Kimi K3 من نحو 29% إلى 96%، مع ارتفاع مقاطعة الجلسات غير الضارة من حوالي 5% إلى 9%؛ بالنسبة لـ GLM 5.3، ارتفع الحجب من نحو 36% إلى 91% ومقاطعة غير الضارة من حوالي 10% إلى 15%.
مقابل Jev، وهو نموذج قرار يمكن أن يعمل كقاضٍ رخيص، وصلت السلاسل إلى استدعاء 93% عند نفس معدل مقاطعة الجلسات غير الضارة بنسبة 5.5% مقارنةً بـ 86% لـ Jev، بتكلفة تقريبية قدرها 65 دولارًا من حوسبة القاضي لكل مليون دور و2 مللي ثانية من زمن الاستجابة الإضافي لكل دور، مقابل 600 دولار و200 مللي ثانية لـ Jev، وفقًا لتقارير Goodfire. سجّل Jev فقط 12% من المطالبات الضارة المدمجة في إطار غير ضار، وزاد من مقاطعة الجلسات غير الضارة بعد تجاوز نافذة 32,000 رمز. حققت المجسات الخطية القياسية استدعاء أقل بنحو 5% مقارنةً بالوصفة النهائية، بينما فقدت المجسات غير الخطية ما يصل إلى 30% من الاستدعاء على مجموعات خارج التوزيع، وتطابق سقف استدعاء القاضي مع ست مرات أقل من استدعاءات القاضي استلزم السلسلة المسببة بدلاً من اختيار دور عشوائي. نقلت الوصفة أيضًا إلى GLM 5.3 باستخدام بيانات تم تطويرها فقط لـ Kimi K3، مما أسفر عن مراقب GLM قادر تقريبًا بنفس القدرات على نشرات Kimi ومراقب أسوأ قليلًا على بيانات تقييم GLM نفسها، بحسب الشركة.
التمرين الأحمر الخارجي بواسطة FAR.AI
لاختبار النظام المُنَشَأ خارج تقييماته الداخلية، طلبت Goodfire من FAR.AI إجراء تمرين أحمر عليه. في حساب FAR.AI، المقتبس في المنشور:
“أجرت FAR.AI اختبارًا أوليًا لمراقبي Kimi K3 من Goodfire على مدار يومين، مطبقةً مجموعة غير متكيفة من الاختراقات الثابتة للاستخدام السيبراني الهجومي في سياقات الدردشة. من مجموعة أولية تضم 1500 اختراق مرشح، اختارت الاختبارات 140 ثبت فعاليتها ضد نسخة مختلفة من النموذج الأساسي دون مراقباتنا. عند اختبار كلٍ من هذه الـ140 على 8 تفاعلات فردية تت对应 لأهداف مختلفة للمهاجم، خفّضت مراقبات Goodfire الثغرات المستثارة من 66 اختراقًا عالميًا و700 تفاعل مخترق إجمالي إلى 0 اختراقات عالمية و18 تفاعلًا مخترقًا.”
بدون المراقب، تراوحت نسبة نجاح هجمات الاختراق الشامل من 12% إلى 53% عبر إعدادات جهد الاستدلال، وفقًا للمنشور؛ وعند تفعيل المراقب، لم تنتج أي من الاستراتيجيات الـ140 اختراقًا شاملًا، وانخفض نجاح المطالبات الفردية عبر 1,120 تفاعل غير شامل من ما لا يقل عن 9–40% إلى 0.1–1.6% حسب جهد الاستدلال.
تصف Goodfire هذا النوع من إعدادات المراقبة كإعداد افتراضي عملي لأي شخص يقدم نماذج مفتوحة في بيئات وكيلية، مشيرةً إلى أن النماذج المفتوحة لا تتضمن مجموعة أمان كاملة. وأعلنت الشركة أنها تخطط لمواصلة تعاونها مع FAR.AI في مزيد من الاختبارات وتعزيز المراقبين.












