एआई मॉडल और प्लेटफ़ॉर्म
मिस्ट्रल के शील्डस्ट्रल पैक्स पॉलिसी-अनुकूल सुरक्षा स्क्रीनिंग को 3बी पैरामीटर में पैक करता है

मिस्ट्रल एआई ने 4 अगस्त, 2026 को शील्डस्ट्रल जारी किया, एक 3बी-पैरामीटर ओपन-वेट्स सुरक्षा वर्गीकरणकर्ता जो सादे भाषा में लिखे गए मॉडरेशन नीतियों के खिलाफ पाठ और छवियों का आकलन करता है, न कि प्रशिक्षण के दौरान बेक किए गए हानि श्रेणियों का एक निश्चित सेट। मॉडल हगिंग फेस पर उपलब्ध है अपाचे 2.0 लाइसेंस के तहत, 12 भाषाओं को कवर करता है, और एक एकल 16GB जीपीयू पर चलता है। मिस्ट्रल अपनी घोषणा में कहता है कि शील्डस्ट्रल खुले गार्ड मॉडल के साथ पाठ सुरक्षा पर मेल खाता है जो इसके आकार के सात गुना है, और यह बहुमोडल मॉडरेशन पर एक नया राज्य का कला स्थापित करता है, और यह रिलीज को आमतौर पर गार्डरेल मॉडल के निर्माण के तरीके की तीखी आलोचना के आसपास फ्रेम करता है।
मिस्ट्रल का तर्क है कि अधिकांश गार्डरेल मॉडल अपने वजन में हानि श्रेणियों की एक टैक्सोनॉमी को हार्ड-कोड करते हैं, इसलिए उन्हें एक नए उत्पाद संदर्भ में अनुकूलन करने के लिए पुनः प्रशिक्षण की आवश्यकता होती है। शील्डस्ट्रल इसके बजाय मॉडरेशन नीति को इनपुट के हिस्से के रूप में लेता है: ऑपरेटर एक हाँ/नहीं प्रश्न लिखता है, मूल्यांकन संदर्भ और सख्तता का वर्णन करने वाला एक निर्देश प्रदान करता है, और मॉडल एक एकल टोकन से एक कैलिब्रेटेड सुरक्षा स्कोर लौटाता है। इसलिए, एक ही चेकपॉइंट एक साइबर सुरक्षा अनुसंधान उपकरण और एक मानसिक स्वास्थ्य प्लेटफ़ॉर्म को अलग-अलग मानकों के खिलाफ बिना संशोधन के स्क्रीन कर सकता है।
रिलीज एक छोटे मॉडल के लिए असामान्य रूप से बहुत सारे दस्तावेजों के साथ आता है: एक तकनीकी रिपोर्ट arXiv पर जो प्रशिक्षण नुस्खा और मूल्यांकन का वर्णन करती है (28 जुलाई, 2026 को पोस्ट की गई), плюस मिस्ट्रल के डॉक्स में एक मॉडल कार्ड और वजन खुद, दोनों 4 अगस्त को जारी किए गए।
शील्डस्ट्रल एक नीति को कैसे पढ़ता है, उसे याद रखने के बजाय
तंत्र, तकनीकी रिपोर्ट में वर्णित, प्रत्येक मॉडरेशन कार्य को द्विआधारी प्रश्न उत्तर देने में कम कर देता है। प्रत्येक अनुरोध में तीन टैग किए गए भाग होते हैं: <Instruct> फील्ड मूल्यांकन संदर्भ और सख्तता स्तर ले जाता है, <Query> फील्ड एक हाँ/नहीं प्रश्न जैसे “क्या यह सामग्री शारीरिक हिंसा को बढ़ावा देती है?” लेता है, और <Document> फील्ड सामग्री को पकड़ता है जिसे न्याय करना है, जो एक प्रॉम्प्ट, एक प्रतिक्रिया, एक प्रॉम्प्ट-प्रतिक्रिया जोड़ी, या एक छवि वैकल्पिक पाठ के साथ हो सकता है। अनुमान में, मॉडल केवल “हाँ” और “नहीं” टोकन के लॉगिट्स को पढ़ता है और उन्हें एक निरंतर स्कोर में सॉफ्टमैक्स-नॉर्मलाइज़ करता है, 0.5 पर एक द्विआधारी निर्णय के लिए सीमांकित किया जाता है।
यह सूत्रीकरण एक ही चेकपॉइंट को प्रॉम्प्ट वर्गीकरण, प्रतिक्रिया मॉडरेशन, इनकार पता लगाने और विषाक्तता पता लगाने को एक ही समस्या के रूप में अवशोषित करने देता है। शील्डस्ट्रल मिस्ट्रल के छोटे बहुमोडल मॉडल, मिनिस्ट्रल-3-3बी पर बनाया गया है, जिसमें छवि इनपुट को संभालने वाला एक पिक्सट्रल दृष्टि एन्कोडर है, और मॉडल कार्ड 32k-टोकन प्रशिक्षण संदर्भ सूचीबद्ध करता है।
प्रशिक्षण डेटा रणनीति वह जगह है जहां मिस्ट्रल दावा करता है कि आकार का नुकसान पुनः प्राप्त हो जाता है। रिपोर्ट में लगभग 54.1 मिलियन प्रशिक्षण नमूनों का वर्णन किया गया है जो सार्वजनिक सुरक्षा डेटासेट से इकट्ठा किए गए हैं जिनमें विरोधाभासी टैक्सोनॉमी है, प्रत्येक को समान निर्देश-प्रश्न-दस्तावेज़ प्रारूप में परिभाषित टेम्पलेट और प्रति-डेटासेट सख्तता कैलिब्रेशन के साथ परिवर्तित किया गया है। भेदभाव सिखाने के लिए, न कि श्रेणी स्मृति, मिस्ट्रल ने विपरीत जोड़े पैदा किए: एक एलएलएम ने सुरक्षित पाठ को फिर से लिखा ताकि यह एक नीति का उल्लंघन करे जबकि एक密 रूप से संबंधित भाई नीति को बख्श दे, ताकि मॉडल सीखे कि कौन सा विशिष्ट नियम एक टुकड़ा सामग्री तोड़ता है। अंतिम चेकपॉइंट तीन लोरा फाइन-ट्यून को गोलाकार इंटरपोलेशन के माध्यम से मिलाता है, एक सार्वजनिक डेटा पर कैलिब्रेटेड, एक नीति-विभेदीकरण डेटा जोड़ने वाला, और आधार निर्देश मॉडल के लिए सामान्य निर्देश अनुसरण।
मूल्यांकन क्या मापते हैं
मिस्ट्रल ने शील्डस्ट्रल का मूल्यांकन दस खुले बेसलाइन के खिलाफ 16 बेंचमार्क पर किया, जिसमें सभी मूल्यांकन नमूने प्रशिक्षण से बाहर रखे गए थे। मुख्य परिणाम, तकनीकी रिपोर्ट में रिपोर्ट किए गए:
- 84.9% औसत एफ1 पाठ सुरक्षा बेंचमार्क पर, जो बहुत बड़े जीपीटी-ओएसएस-सेफगार्ड-20बी के साथ मेल खाता है और 4बी से 20बी पैरामीटर वाले मॉडलों की श्रृंखला में समग्र रूप से पहले स्थान पर है
- 83.8% औसत एफ1 बहुमोडल सुरक्षा बेंचमार्क पर, ओम्नीगार्ड-7बी के बाद 77.6% पर, और तीन में से दो छवि सुरक्षा बेंचमार्क पर अग्रणी
- 91.3% एफ1 एक उद्देश्य-निर्मित नीति-अनुकूलता मूल्यांकन पर, जीपीटी-ओएसएस-सेफगार्ड-20बी के लिए 94.1% के खिलाफ, जो एक एकल टोकन के बजाय एक लंबी तर्कसंगत ट्रेस उत्पन्न करता है
- ~54.1मी प्रशिक्षण नमूने: 45.2मी ओपन-सोर्स पाठ, 4.4मी सिंथेटिक विपरीत पाठ, और 4.5मी बहुमोडल नमूने
वे विक्रेता-रिपोर्ट किए गए संख्याएं हैं, मिस्ट्रल द्वारा चुने गए बेंचमार्क पर मापी गई। रिपोर्ट में दो डिज़ाइन विकल्पों पर ध्यान देना उचित है जब उन्हें पढ़ रहे हों। अनुकूलता बेंचमार्क एक जानबूझकर अलग टैक्सोनॉमी का उपयोग करता है जो प्रशिक्षण से अलग है, जो विभिन्न एलएलएम द्वारा उत्पन्न और सत्यापित किया गया है, इसलिए स्कोर को स्मृति श्रेणियों के लिए जिम्मेदार नहीं ठहराया जा सकता है। और बहुभाषी प्रॉम्प्ट वर्गीकरण पर, रिपोर्ट के अपने परिशिष्ट में यह दिखाया गया है कि शील्डस्ट्रल अरबी और इंडोनेशियाई में कई बेसलाइन के पीछे है, मिस्ट्रल ने असमान भाषा कवरेज को एक स्वीकृत सीमा के रूप में चिह्नित किया है।
मिस्ट्रल का मॉडरेशन में दूसरा प्रयास, इस बार खुले में
शील्डस्ट्रल मिस्ट्रल का तीसरा मॉडरेशन मॉडल है, जो दो होस्ट किए गए एपीआई का अनुसरण करता है, और यह पहला है जिसे यह ओपन वेट्स के रूप में जारी करता है। इसका पहला सामग्री मॉडरेशन एपीआई, 7 नवंबर, 2024 को लॉन्च किया गया था, एक होस्ट किया गया पाठ वर्गीकरणकर्ता था जो 11 भाषाओं में नौ निश्चित श्रेणियों को कवर करता था, वही प्रणाली जो ले चैट को मॉडरेट करती है। एक दूसरा होस्टेड संस्करण इसका अनुसरण किया, लेकिन न ही वजन जारी किया। शील्डस्ट्रल इस व्यवस्था को उलट देता है: श्रेणियां अब निश्चित नहीं हैं, नीति अनुरोध के साथ यात्रा करती है, और मॉडल खुद डाउनलोड करने योग्य है।
रिलीज़ मिस्ट्रल 3 परिवार पर बनी छोटे मॉडल रिलीज़ की एक श्रृंखला को जारी रखता है, जो उन तैनाती के लिए लक्षित है जहां एक फ्रंटियर मॉडल अनावश्यक ओवरहेड है। मिस्ट्रल ने शील्डस्ट्रल को ओपन सिक्योर एआई एलायंस के एक उद्घाटन सदस्य के रूप में जारी किया, जिसमें एनवीडिया [सिक्योरिटीज़_स्टॉक_प्राइस_टैग सимвोल = “एनवीडीए” एक्सचेंज = “नास्डैक”] और अन्य संगठन शामिल हैं, और कंपनी कहती है कि उसने मॉडल को अपने कस्टम प्रशिक्षण और मूल्यांकन प्लेटफ़ॉर्म, फोर्ज पर एंड-टू-एंड प्रशिक्षित किया है।
मिस्ट्रल के मॉडल के लिए घोषित रोडमैप बहुभाषी कवरेज, लंबे दस्तावेज़ की मजबूती, और व्यापक बहुमोडल सुरक्षा को अगले कार्य क्षेत्रों के रूप में इंगित करता है। शील्डस्ट्रल के डिज़ाइन में, नीति प्रत्येक अनुरोध के <Query> फील्ड में रहती है, मॉडल के वजन में नहीं।












