AI-modeller og plattformer
Mistral’s Shieldstral Pakker Policy-Adaptive Sikkerhetsskjerming Inn I 3B Parametre

Mistral AI lanserte Shieldstral den 4. august 2026, en 3B-parameter åpen-vekt sikkerhetsklassifikator som dømmer tekst og bilder mot modereringspolitikk skrevet i vanlig språk på inferenstid, i stedet for en fast sett av skadekategorier innbygget under trening. Modellen er tilgjengelig på Hugging Face under Apache 2.0-lisensen, dekker 12 språk og kjører på en enkelt 16GB GPU. Mistral sier i sin annonsering at Shieldstral matcher åpne vaktmodeller opp til syv ganger sin størrelse på tekst sikkerhet og setter en ny standard på multimodal moderering, og den rammer utgivelsen rundt en poengert kritikk av hvordan vaktmodeller vanligvis bygges.
De fleste vaktmodeller, argumenterer Mistral, hardkoder en taksonomi av skadekategorier inn i deres vekter, så å tilpasse dem til en ny produktkontekst betyr om-trening. Shieldstral tar i stedet modereringspolitikken som en del av inndata: operatøren skriver et ja/nei-spørsmål, leverer en instruksjon som beskriver evalueringssammenhengen og strengthet, og modellen returnerer en kalibrert sikkerhetsscore fra en enkelt token. Samme checkpoint kan derfor skjerme en cybersecurity-forskningsverktøy og en mental-helseplattform mot forskjellige standarder uten modifikasjon.
Utgivelsen lander med en uvanlig mengde dokumentasjon for en liten modell: en teknisk rapport på arXiv som beskriver treningsrezeptet og evaluering (publisert 28. juli 2026), pluss en modellkort i Mistral’s docs og vektene selv, begge utgitt 4. august.
Hvordan Shieldstral leser en politikk i stedet for å memorere en
Mekanismen, lagt ut i den tekniske rapporten, reduserer hver modereringoppdrag til binært spørsmålssvar. Hver forespørsel har tre merkte deler: en <Instruct>-felt som bærer evalueringssammenhengen og strengthetsnivå, en <Query>-felt med et enkelt ja/nei-spørsmål som “Promotere dette innholdet fysisk vold?”, og en <Document>-felt som holder innholdet som skal dømmes, som kan være en prompt, en respons, en prompt-respons-par eller et bilde med valgfri tekst. Ved inferens leser modellen bare logits for “ja” og “nei”-tokenene og softmax-normaliserer dem til en kontinuerlig score, terskelt på 0,5 for en binær dom.
Denne formuleringen lar en checkpoint absorbere prompt-klassifisering, respons-moderering, nekt-dettektning og giftighets-dettektning som eksempler på samme problem. Shieldstral er bygget på Ministral-3-3B, Mistral’s lille multimodale modell, med en Pixtral-bilde-encoder som håndterer bildeinndata, og modellkortet lister en 32k-token treningskontekst.
Treningsdatastrategien er der hvor Mistral hevder størrelsesulemper blir gjenvunnet. Rapporten beskriver omtrent 54,1 millioner treningsprøver samlet fra offentlige sikkerhetsdatasett med motsigelserende taksonomier, hver konvertert til samme instruksjon-spørsmål-dokument-format med parafraserede maler og per-datasett strengthetskalibrering. For å lære diskriminering i stedet for kategori-memorering, genererte Mistral kontrastive par: en LLM omskrev trygg tekst for å bryte en politikk mens den sparerte en nært beslektet søskenpolitikk, så modellen lærer hvilken bestemt regel et stykke innhold bryter. Den endelige checkpointen kombinerer tre LoRA-fine-tuninger via sfærisk interpolasjon, en kalibrert på offentlig data, en som legger til generert politikk-diskriminering data, og basis-instruktionsmodellen for generell instruksjonsfølging.
Hva evalueringene målte
Mistral evaluerte Shieldstral mot ti åpne baselinjer på 16 benchmark, med alle evalueringseksampler holdt utenfor trening. Overskriftsresultatene, som rapportert i den tekniske rapporten:
- 84,9% gjennomsnittlig F1 på tekst-sikkerhetsbenchmark, matcher den mye større GPT-OSS-Safeguard-20B og rangerer først totalt blant modeller som varierer fra 4B til 20B parametre
- 83,8% gjennomsnittlig F1 på multimodale sikkerhetsbenchmark, foran den neste beste OmniGuard-7B på 77,6%, og leder på to av tre bilde-sikkerhetsbenchmark
- 91,3% F1 på en formål-bygget politikk-tilpasnings-evaluering, mot 94,1% for GPT-OSS-Safeguard-20B, som genererer en lang resoneringsspor før den svarer i stedet for en enkelt token
- ~54,1M treningsprøver: 45,2M åpne kilde-tekst, 4,4M syntetiske kontrastive tekst, og 4,5M multimodale prøver
Disse er leverandør-rapporterte tall, målt av Mistral på benchmark som de valgte. To designvalg i rapporten er verdt å merke når du leser dem. Tilpasningsbenchmarket bruker en bevisst annerledes taksonomi enn trening, generert og verifisert av forskjellige LLM-er enn treningsdata, så scoret kan ikke tilskrives memoriserte kategorier. Og på multilingvål prompt-klassifisering, viser rapportens egen appendix at Shieldstral taper for flere baselinjer på arabisk og indonesisk, med Mistral som flagger ujevn språkdekning som en uttalt begrensning.
Mistrals andre forsøk på moderering, denne gangen i åpen
Shieldstral er Mistrals tredje modereringsmodell, etter to vertste API-er, og den første den har utgitt som åpne vekter. Den første innholdsmodererings-API, lansert 7. november 2024, var en vertst tekst-klassifikator som dekket ni faste kategorier på 11 språk, samme system som modererer Le Chat. En annen vertst versjon fulgte, men ingen av dem leverte vekter. Shieldstral inverterer denne ordningen: kategoriene er ikke lenger faste, politikken reiser med forespørselen, og modellen selv er lastbar.
Utgivelsen fortsetter en rekke småmodell-utgivelser fra Paris-laboratoriet bygget på Ministral 3-familien, en linje rettet mot deployeringer hvor en frontmodell er unødvendig overhodet, tilnærmingen Unite.AI dokumenterte i dens tidligere blikk på Mistrals edge-enhet-strategi. Mistral utga Shieldstral som en inaugural medlem av Open Secure AI Alliance sammen med NVIDIA (NVDA ) og andre organisasjoner, og selskapet sier at de trente modellen fra ende til ende på Forge, deres egen trenings- og evalueringplattform.
Mistrals uttalt veikart for modellen peker mot multilingvål dekning, lengre-dokument-robusthet og bredere multimodal sikkerhet som neste arbeidsområder. I Shieldstrals design, lever politikken i -feltet av hver forespørsel i stedet for i modellens vekter.












