نماذج ومنصات الذكاء الاصطناعي
Mistral’s Shieldstral يدمج الفحص الأمني المعدل حسب السياسة في 3B معلمة

أعلنت Mistral AI عن إطلاق Shieldstral في 4 أغسطس 2026، وهو مصنف أمان مفتوح الحجم 3B يعمل على الحكم على النصوص والصور ضد سياسات التعتيم مكتوبة باللغة الطبيعية في وقت الاستدلال، بدلاً من مجموعة محددة من فئات الأذى محددة مسبقًا أثناء التدريب. النموذج متاح على Hugging Face تحت رخصة Apache 2.0، ويغطي 12 لغة، ويعمل على بطاقة رسومات واحدة بحجم 16GB. تقول Mistral في إعلانها أن Shieldstral يتطابق مع نماذج الحماية المفتوحة حتى سبع مرات حجمه في أمان النص، ويوفر حالة فنية جديدة في تعتيم متعدد الوسائط، وتربط الإطلاق حول نقد حاد لكيفية بناء نماذج الحماية بشكل عام.
تجادل Mistral أن معظم نماذج الحماية تشفر تصنيفًا لفئات الأذى في أوزانها، لذلك تعديلها لسياق منتج جديد يعني إعادة التدريب. يأخذ Shieldstral بدلاً من ذلك سياسة التعتيم كجزء من الإدخال: يكتب المشغل سؤالاً بنعم أو لا، ويقدم تعليمًا يصف سياق التقييم ودرجة الصرامة، ويعيد النموذج درجة أمان محسوبة من رمز واحد. وبالتالي، يمكن أن يفحص نفس النقطة التحقق أداة أبحاث الأمن السيبراني ومنصة الصحة النفسية ضد معايير مختلفة دون تعديل.
تأتي الإطلاق مع مستندات غير عادية الكمية لنموذج صغير: تقرير تقني على arXiv يصف وصفة التدريب والتقييم (نشر في 28 يوليو 2026)، بالإضافة إلى بطاقة نموذج في وثائق Mistral والأوزان نفسها، كلاهما تم إطلاقهما في 4 أغسطس.
كيف يقرأ Shieldstral سياسة التعتيم بدلاً من تذكرها
الآلية، الموضحة في التقرير التقني، تقلل كل مهمة تعتيم إلى سؤال ثنائي الإجابة. لكل طلب ثلاثة أجزاء محددة: حقل <Instruct> يحمل سياق التقييم ومستوى الصرامة، وحقل <Query> بسؤال نعم أو لا مثل “هل هذا المحتوى يروج للعنف الجسدي؟”، وحقل <Document> يحمل المحتوى الذي سيتم الحكم عليه، والذي يمكن أن يكون محفزًا أو استجابة أو زوج محفز-استجابة أو صورة مع نص اختياري. في وقت الاستدلال، يقرأ النموذج فقط اللوجيتات للرمز “نعم” و “لا” ويطبيق عليهما تطبيع softmax لتحويله إلى درجة مستمرة، مع عتبة 0.5 لصالح حكم ثنائي.
تسمح هذه الصياغة لمرة واحدة أن تبتلع تصنيف المحفز، وتنظيم الاستجابة، وتحديد الرفض، وتحديد السُمية كأحكام لمشكلة واحدة. تم بناء Shieldstral على Ministral-3-3B، وهو نموذج متعدد الوسائط صغير من Mistral، مع Pixtral لمعالجة الإدخال المرئي، وتُظهر بطاقة النموذج سياق تدريب 32k-رمز.
استراتيجية بيانات التدريب هي المكان الذي تدعي Mistral فيه استعادة عيب الحجم. يصف التقرير حوالي 54.1 مليون نموذج تدريب تم تجميعها من مجموعات بيانات أمان عامة ذات تصنيفات متضاربة، تم تحويل كل واحدة منها إلى نفس تنسيق التعليم-السؤال-الوثيقة مع قوالب معاد صياغتها وتحديد الصرامة لكل مجموعة بيانات. لتعليم التمييز بدلاً من تذكر الفئة، أنشأت Mistral أزواج متضادة: أعاد نموذج LLM كتابة نص آمن لانتهاك سياسة معينة مع الحفاظ على سياسة شقيقة متعلقة ارتباطًا وثيقًا، بحيث يتعلم النموذج أي قاعدة محددة ينتهكها جزء معين من المحتوى. يدمج النقطة النهائية ثلاثة تعديلات دقيقة من خلال التأثير الكروي، واحدة محسنة على بيانات عامة، واحدة تضيف بيانات التمييز السياسي التي تم إنشاؤها، والنموذج الأساسي للتعليم العام.
ما قاس التقييمات
قامت Mistral بتقييم Shieldstral ضد عشرة نماذج أساسية مفتوحة عبر 16 معيارًا، مع جميع عينات التقييم محجوزة من التدريب. النتائج الرئيسية، كما ذُكرت في التقرير التقني:
- 84.9% متوسط F1 على معايير أمان النص، مما يجعله يتطابق مع GPT-OSS-Safeguard-20B الأكبر بكثير، ويتصدر الترتيب العام بين النماذج التي تتراوح بين 4B و 20B معلمة
- 83.8% متوسط F1 على معايير أمان متعدد الوسائط، متقدم على OmniGuard-7B التالي الذي سجل 77.6%، ويتصدر في两个 من ثلاثة معايير أمان الصور
- 91.3% F1 على تقييم قابلية التكيف مع السياسة، مقابل 94.1% ل GPT-OSS-Safeguard-20B، الذي يولد سجل استدلال طويل قبل الإجابة بدلاً من رمز واحد
- ~54.1M نموذج تدريب: 45.2M نص مفتوح المصدر، 4.4M نص اصطناعي متضاد، و 4.5M نموذج متعدد الوسائط
هذه أرقام موفرة من قبل البائع، تم قياسها بواسطة Mistral على المعايير التي اختارها. هناك خياران في التصميم في التقرير يستحقان الانتباه عند قراءته. يستخدم معيار التكيف مع السياسة تصنيفًا متعمدًا مختلفًا عن التدريب، تم إنشاؤه وتأكيد صلاحيته بواسطة نماذج LLM مختلفة عن بيانات التدريب، لذلك لا يمكن أن يُعزى الرقم إلى فئات محددة مسبقًا. وعلى التصنيف متعدد اللغات، يظهر ملحق التقرير نفسه أن Shieldstral يتراجع عن عدة نماذج أساسية في العربية واللغة الإندونيسية، مع إشارة Mistral إلى تغطية اللغة غير المتساوية كlimitation declared.
مистраل في جولتها الثانية للتعتيم، هذه المرة في المفتوح
Shieldstral هو نموذج التعتيم الثالث لمистраل، بعد两个 واجهة برمجة تطبيقات مضيفة، والأول الذي تم إطلاقه كأوزان مفتوحة. كان واجهة برمجة تطبيقات التعتيم الأولى، التي تم إطلاقها في 7 نوفمبر 2024، مصنفًا مضيفًا للنص يغطي تسع فئات محددة عبر 11 لغة، نفس النظام الذي يعتيم Le Chat. اتبعت نسخة مضيفة ثانية، ولكن لم تُطرح أي من الوزن. يقلب Shieldstral هذا الترتيب: الفئات لم تعد محددة، وتسافر السياسة مع الطلب، والنموذج نفسه قابلة للتنزيل.
تواصل الإطلاق أيضًا سلسلة إطلاق نماذج صغيرة من مختبر باريس بنيت على عائلة Ministral 3، خط يهدف إلى التوزيعات التي يكون فيها نموذج الحدود غير ضروري، وهي النهج التي وثقتها Unite.AI في نظرة سابقة إلى استراتيجية Mistral AI لجهاز الحواف. أطلقت Mistral Shieldstral كعضو مؤسس في تحالف Open Secure AI إلى جانب NVIDIA (NVDA ) ومنظمات أخرى، وتقول الشركة إنها قامت بتدريب النموذج من النهاية إلى النهاية على Forge، منصة التدريب والتقييم المخصصة.
تشير خارطة طريق Mistral المعلنة للنموذج إلى تغطية متعددة اللغات، ومتانة وثائق أطول، وأمان متعدد الوسائط أوسع كمناطق العمل التالية. في تصميم Shieldstral، تعيش السياسة في حقل من كل طلب بدلاً من في أوزان النموذج.












