Yapay zeka modelleri ve platformları
Mistral’ın Shieldstral Paketi Politika Uyumlu Güvenlik Ekranını 3B Parametreye Sığdırıyor

Mistral AI, 4 Ağustos 2026’da Shieldstral’i yayınladı. Shieldstral, 3B parametreli açık ağırlıklı bir güvenlik sınıflandırıcısıdır. Metin ve görüntüleri, eğitim sırasında sabit bir zarar kategorisi seti yerine, plain dilde yazılmış moderasyon politikalarına karşı değerlendirir. Model, Hugging Face’de Apache 2.0 lisansı altında mevcuttur, 12 dilde çalışır ve tek bir 16GB GPU’da çalışır. Mistral, duyurusunda Shieldstral’in, açık guard modellerine kadar yedi katı büyüklüğünde metin güvenliği ve multimodal moderasyon alanında yeni bir devlet standardı oluşturduğunu belirtiyor ve bu yayın around bir guardrail modellerinin genellikle nasıl inşa edildiğine yönelik bir eleştiri olarak çerçevelemektedir.
Çoğu guardrail modeli, Mistral’ın iddiasına göre, ağırlıklarına zarar kategorileri taksonomisini kodlar, bu nedenle onları yeni bir ürün bağlamına uyarlamak, yeniden eğitmek anlamına gelir. Shieldstral ise moderasyon politikasını girdinin bir parçası olarak alır: operatör, bir evet/hayır sorusu yazar, değerlendirme bağlamı ve严格lik hakkında bir talimat sağlar ve model, tek bir token üzerinden kalibre edilmiş bir güvenlik puanı döndürür. Aynı kontrol noktası, bu nedenle, bir siber güvenlik araştırma aracı ve bir ruh sağlığı platformunu farklı standartlara karşı, modifikasyon olmadan ekranlayabilir.
Yayın, küçük bir model için alışılmadık bir şekilde çok belgeyle birlikte geliyor: arXiv’de teknik bir rapor (28 Temmuz 2026’da yayınlandı) ve Mistral’ın belgelerindeki model kartı ve ağırlıkların kendileri, her ikisi de 4 Ağustos’ta yayınlandı.
Shieldstral’in bir politikayı ezberlemek yerine nasıl okuduğu
Mekanizma, teknik raporda açıklanmıştır ve her moderasyon görevini ikili soru-cevaplamaya indirger. Her istekte üç etiketli parça vardır: <Instruct> alanındaki değerlendirme bağlamı ve严格lik düzeyi, <Query> alanındaki tek bir evet/hayır sorusu ve <Document> alanındaki içeriği yargılayacak metin. Model, çıkarım sırasında yalnızca “evet” ve “hayır” tokenlerinin logit’lerini okur ve bunları softmax-normalize eder, ardından 0.5’e göre bir ikili karara ulaşır.
Bu formülasyon, bir kontrol noktasının,.prompt sınıflandırma, yanıt moderasyonu, ret algılama ve zehirlilik algılama gibi görevleri aynı problemın örnekleri olarak emmesine olanak tanır. Shieldstral, Ministral-3-3B’ye dayanmaktadır ve görüntüleri işleyen Pixtral vizyon kodlayıcısına sahiptir ve model kartı 32k-token’lik bir eğitim bağlamı listeler.
Eğitim verileri stratejisi, Mistral’ın boyut dezavantajını geri kazandığı yerdir. Rapor, yaklaşık 54.1 milyon eğitim örneğinin, kamu güvenliği veri setlerinden, çelişkili taksonomilerle derlendiğini ve her biri aynı talimat-soru-belge formatına dönüştürüldüğünü, paraphrased şablonlarla ve her veri seti için严格lik ayarlamasıyla açıklar. Modelin, kategorileri ezberlemek yerine ayırt etmeyi öğrenmesi için, Mistral, karşıt çiftler oluşturdu: bir LLM, güvenli metni, bir politikayı ihlal edecek şekilde yeniden yazdı, ancak yakından ilgili bir kardeş politikayı korudu, böylece modelin, bir içerik parçasının hangi específik kuralı ihlal ettiğini öğrenmesi sağlandı. Son kontrol noktası, üç LoRA fine-tune’i, spherial interpolasyon yoluyla birleştirir: biri kamu verilerine, biri oluşturulan politika-ayırma verilerine ve temel talimat modeline dayanan genel talimat izleme.
Değerlendirmelerin neyi ölçtüğü
Mistral, Shieldstral’i, on açık temel modelle karşılaştırdı, 16 benchmark üzerinde, tüm değerlendirme örnekleri eğitimden hariç tutuldu. Başlıca sonuçlar, teknik raporda bildirilenler如下:
- 84.9% ortalama F1 metin güvenliği benchmark’lerinde, GPT-OSS-Safeguard-20B ile eşdeğer ve 4B ila 20B parametreli modeller arasında genel olarak ilk sırada
- 83.8% ortalama F1 multimodal güvenlik benchmark’lerinde, OmniGuard-7B’den (77.6%) daha iyi ve üç görüntü güvenliği benchmark’inden ikisinde lider
- 91.3% F1 politikaya uyarlanabilirlik değerlendirmesinde, GPT-OSS-Safeguard-20B’den (94.1%) daha düşük, ancak tek bir token üzerinden cevap verirken, uzun bir akıl yürütme izi üretmez
- ~54.1M eğitim örneği: 45.2M açık kaynaklı metin, 4.4M sentetik karşıt metin ve 4.5M multimodal örnek
Bunlar, Mistral tarafından bildirilen, kendi seçtiği benchmark’lerde ölçülen rakamlardır. Raporun iki tasarım seçeneği, bu rakamları okurken dikkat çekicidir. Uyarlanabilirlik benchmark’inde, eğitim verisinden farklı bir taksonomi kullanılır, bu taksonomi, eğitim verisi tarafından üretilen ve doğrulanan farklı LLM’ler tarafından oluşturulur, bu nedenle puan, ezberlenen kategorilere atfedilemez. Çok dilli prompt sınıflandırmasında, raporun ek bölümü, Shieldstral’in Arapça ve Endonezce’de beberapa temel modelin gerisinde kaldığını gösteriyor, Mistral, dengesiz dil kapsamı olarak bir sınırlamayı belirtiyor.
Mistral’ın moderasyona ikinci girişimi, bu kez açık olarak
Shieldstral, Mistral’ın üçüncü moderasyon modelidir, iki barındırılan API’nin ardından ve açık ağırlıklarla yayınladığı ilk modeldir. İlk içerik moderasyonu API’si, 7 Kasım 2024’te başlatıldı, dokuz sabit kategoriye sahip bir metin sınıflandırıcısıydı, 11 dilde çalışıyordu, Le Chat’i moderleyen aynı sistemdi. Bir ikinci barındırılan sürüm takip etti, ancak hiçbirisi ağırlıklarını göndermedi. Shieldstral, bu düzeni tersine çevirir: kategoriler artık sabit değildir, politika istekle seyahat eder ve model kendisi indirilebilir.
Yayın, Paris laboratuvarından küçük model yayınlarının bir dizi devamı niteliğindedir, Ministral 3 ailesine dayanmaktadır, bu aile, kenar aygıtlarında dağıtımlar için tasarlanmıştır, Unite.AI, Mistral’ın kenar aygıtı stratejisine daha önce baktı. Mistral, Shieldstral’i, NVIDIA (NVDA ) ve diğer organizasyonlarla birlikte Açık Güvenli AI İttifakı’nın kurucu üyesi olarak yayınladı ve şirket, modeli, özel eğitim ve değerlendirme platformu Forge’da uçtan uca eğittiğini belirtiyor.
Mistral’ın model için açıkladığı yol haritası, çok dilli kapsama, daha uzun belge dayanıklılığı ve daha geniş multimodal güvenlik olarak sonraki çalışma alanlarını işaret ediyor. Shieldstral’in tasarımında, politika, modelin ağırlıklarında değil, her isteğin alanındadır.












