Modele i platformy AI
Pakiety Shieldstral Mistrala zawierają bezpieczną klasyfikację zgodną z polityką w 3B parametrach

Firma Mistral AI wydała 4 sierpnia 2026 r. Shieldstral, klasyfikator bezpieczeństwa o otwartych wagach i 3B parametrach, który ocenia teksty i obrazy pod kątem zgodności z polityką moderacji napisaną w języku naturalnym w czasie inferencji, a nie w oparciu o ustalony zestaw kategorii szkodliwości wbudowanych w trakcie szkolenia. Model jest dostępny na Hugging Face na licencji Apache 2.0, obejmuje 12 języków i działa na jednej karcie graficznej 16 GB. Mistral podaje w swoim ogłoszeniu, że Shieldstral dorównuje otwartym modelom ochronnym nawet do siedmiokrotnie większym od siebie pod względem bezpieczeństwa tekstu i ustanawia nowy stan sztuki w moderacji multimodalnej, a także przedstawia wydanie wokół krytyki dotyczącej sposobu, w jaki zwykle budowane są modele ochronne.
Większość modeli ochronnych, argumentuje Mistral, koduje podstawową taksonomię kategorii szkodliwości w swoich wagach, więc dostosowanie ich do nowego kontekstu produktu wymaga ponownego szkolenia. Shieldstral natomiast traktuje politykę moderacji jako część wejścia: operator pisze pytanie tak/nie, dostarcza instrukcję opisującą kontekst oceny i poziom surowości, a model zwraca skalibrowany wynik bezpieczeństwa z jednego tokenu. Dlatego też ta sama kontrola może oceniać narzędzie do badań cyberbezpieczeństwa i platformę zdrowia psychicznego pod kątem różnych standardów bez modyfikacji.
Wydanie jest dostarczone z niezwykle dużą ilością dokumentacji dla tak małego modelu: raport techniczny na arXiv opisujący recepturę szkolenia i ocenę (opublikowany 28 lipca 2026 r.), a także karta modelu w dokumentacji Mistral oraz same wagi, które zostały wydane 4 sierpnia.
Jak Shieldstral czyta politykę zamiast ją pamiętać
Mechanizm, przedstawiony w raporcie technicznym, redukuje każde zadanie moderacji do binarnego zadania odpowiedzi na pytanie. Każde żądanie składa się z trzech oznaczonych części: pola <Instruct> zawierającego kontekst oceny i poziom surowości, pola <Query> z pytaniem tak/nie, takim jak “Czy ta treść promuje przemoc fizyczną?”, oraz pola <Document> zawierającego treść do oceny, która może być podpowiedzią, odpowiedzią, parą podpowiedzi-odpowiedzi lub obrazem z opcjonalnym tekstem. W czasie inferencji model czyta tylko logity dla tokenów “tak” i “nie” i normalizuje je za pomocą softmax do ciągłego wyniku, progowanego na poziomie 0,5 dla werdyktu binarnego.
To sformułowanie pozwala na absorbowanie klasyfikacji podpowiedzi, moderacji odpowiedzi, wykrywania odmowy i wykrywania toksyczności jako przypadków tego samego problemu. Shieldstral jest zbudowany na modelu Ministral-3-3B, małym modelu multimodalnym Mistral, z kodera Pixtral do obsługi wejść obrazowych, a karta modelu wymienia kontekst szkolenia 32k-tokenów.
Strategia danych szkoleniowych to miejsce, w którym Mistral twierdzi, że odzyskuje przewagę wielkości. Raport opisuje około 54,1 miliona próbek szkoleniowych zebranych z publicznych zestawów danych bezpieczeństwa o sprzecznych taksonomiach, każdy przekonwertowany na ten sam format instrukcja-pytanie-dokument z szablonami przekształconymi i kalibracją surowości na podstawie zestawu danych. Aby nauczyć model dyskryminacji zamiast pamięci kategorii, Mistral wygenerował pary kontrastowe: model językowy przepisał bezpieczny tekst, aby naruszyć jedną politykę, oszczędzając ściśle powiązaną politykę siostrzaną, dzięki czemu model uczy się, które konkretnie zasady treść narusza. Ostateczny punkt kontrolny łączy trzy LoRA drobne dostosowania za pomocą interpolacji sferycznej, jeden skalibrowany na danych publicznych, jeden dodający wygenerowane dane dyskryminacji polityki, oraz podstawowy model instrukcji do ogólnego przestrzegania instrukcji.
Co mierzyły oceny
Mistral ocenił Shieldstral w porównaniu z dziesięcioma otwartymi modelami bazowymi w 16 benchmarkach, przy czym wszystkie próbki oceny zostały wyłączone ze szkolenia. Główne wyniki, jak podaje raport techniczny:
- 84,9% średniej F1 w benchmarkach bezpieczeństwa tekstu, dorównując znacznie większemu modelowi GPT-OSS-Safeguard-20B i zajmując pierwsze miejsce w rankingu ogólnym wśród modeli o parametrach od 4B do 20B
- 83,8% średniej F1 w benchmarkach bezpieczeństwa multimodalnego, wyprzedzając następny OmniGuard-7B o 77,6%, i prowadząc w dwóch z trzech benchmarków bezpieczeństwa obrazów
- 91,3% F1 w specjalnie opracowanej ocenie dostosowania do polityki, w porównaniu z 94,1% dla GPT-OSS-Safeguard-20B, który generuje długi ślad rozumowania przed odpowiedzią, a nie jeden token
- ~54,1M próbek szkoleniowych: 45,2M otwartych danych tekstowych, 4,4M syntetycznych danych kontrastowych i 4,5M multimodalnych próbek
To są liczby podane przez dostawcę, zmierzone przez Mistral w benchmarkach, które wybrał. Dwa wybory konstrukcyjne w raporcie są godne uwagi przy czytaniu tych liczb. Benchmark dostosowania używa celowo innej taksonomii niż szkolenie, wygenerowanej i zweryfikowanej przez inne modele językowe niż dane szkoleniowe, więc wynik nie może być przypisany do zapamiętanych kategorii. A w przypadku klasyfikacji podpowiedzi wielojęzycznych sam załącznik raportu pokazuje, że Shieldstral jest w tyle za kilkoma modelami bazowymi w języku arabskim i indonezyjskim, z Mistral, który flaguje nierównomierne pokrycie językowe jako deklarowaną ograniczenie.
Druga próba Mistrala z moderacją, tym razem w otwartej formie
Shieldstral to trzeci model moderacji Mistrala, po dwóch interfejsach API hostowanych, i pierwszy, który został wydany jako otwarte wagi. Pierwszy interfejs API do moderacji treści, uruchomiony 7 listopada 2024 r., był klasyfikatorem tekstu hostowanym, obejmującym dziewięć ustalonych kategorii w 11 językach, ten sam system, który moderuje Le Chat. Następnie wydano kolejną wersję hostowaną, ale żadna z nich nie dostarczyła wag. Shieldstral odwraca ten układ: kategorie nie są już ustalone, polityka podróżuje z żądaniem, a sam model jest pobierany.
Wydanie kontynuuje serię wydań małych modeli z paryskiego laboratorium zbudowanych na rodzinie modeli Ministral 3, linii ukierunkowanej na wdrożenia, w których model frontierowy jest niepotrzebnym nadmiarem, podejście, które Unite.AI udokumentował w swoim wcześniejszym spojrzeniu na strategię urządzeń krawędziowych Mistral AI. Mistral wydał Shieldstral jako inauguracyjnego członka Sojuszu Otwartej Bezpiecznej Sztucznej Inteligencji wraz z NVIDIA (NVDA ) i innymi organizacjami, a firma twierdzi, że wytrenowała model od końca do końca na Forge, swojej platformie szkolenia i oceny.
Zadeklarowany plan rozwoju modelu Mistrala wskazuje na zwiększenie pokrycia wielojęzycznego, wytrzymałość dłuższych dokumentów i szersze bezpieczeństwo multimodalne jako następne obszary pracy. W projekcie Shieldstral polityka znajduje się w polu <Query> każdego żądania, a nie w wagach modelu.












