AI-modeller og platforme
Mistral’s Shieldstral Pakker Politik-tilpasset SikkerhedsskÃĶring Ind I 3B Parametre

Mistral AI udgav Shieldstral den 4. august 2026, en 3B-parameter ÃĨben-vejts sikkerhedsclassifier, der dÃļmmer tekst og billeder mod moderationspolitikker skrevet i almindelig sprog ved inferens tid, snarere end en fast sat af skadecategorier bagt i under trÃĶning. Modellen er tilgÃĶngelig pÃĨ Hugging Face under Apache 2.0-licensen, dÃĶkker 12 sprog og kÃļrer pÃĨ en enkelt 16GB GPU. Mistral siger i sin meddelelse, at Shieldstral matcher ÃĨbne guard-modeller op til syv gange sin stÃļrrelse pÃĨ tekst-sikkerhed og sÃĶtter en ny standard for multimodal-moderation, og den rammer udgivelsen omkring en skarp kritik af, hvordan guardrail-modeller normalt er bygget.
De fleste guardrail-modeller, argumenterer Mistral, har en skadecategori-taxonomi indkodet i deres vÃĶgte, sÃĨ tilpasning til en ny produktkontekst krÃĶver gen-trÃĶning. Shieldstral tager modsat moderationspolitikken som en del af input: operatÃļren skriver et ja/nej-spÃļrgsmÃĨl, leverer en instruktion, der beskriver evalueringens kontekst og strengthed, og modellen returnerer en kalibreret sikkerhedsscore fra en enkelt token. Den samme checkpoint kan derfor skÃĶrme en cybersecurity-forskningsvÃĶrktÃļj og en mental-sundhedsplatform mod forskellige standarder uden ÃĶndring.
Udgivelsen lander med en usÃĶdvanlig mÃĶngde dokumentation for en lille model: en teknisk rapport pÃĨ arXiv, der beskriver trÃĶningsopskriften og evalueringen (offentliggjort den 28. juli 2026), plus en modelkort i Mistralâs docs og vÃĶgtene selv, begge offentliggjort den 4. august.
Hvordan Shieldstral lÃĶser en politik i stedet for at huske en
Mekanismen, der er beskrevet i den tekniske rapport, reducerer hver moderationsopgave til binÃĶr spÃļrgsmÃĨl. Hver anmodning har tre markerede dele: en <Instruct>-felt, der bÃĶrer evalueringens kontekst og strengthed, et <Query>-felt med et enkelt ja/nej-spÃļrgsmÃĨl, sÃĨsom âFremmer denne indhold fysisk vold?â, og et <Document>-felt, der holder indholdet, der skal dÃļmmes, som kan vÃĶre en prompt, en respons, en prompt-respons-par eller et billede med valgfri tekst. Ved inferens lÃĶser modellen kun logits for âjaâ og ânejâ-token og softmax-normaliserer dem til en kontinuert score, der er grÃĶnsevÃĶrdi pÃĨ 0,5 for en binÃĶr dom.
Denne formulering tillader, at en checkpoint kan absorbere prompt-klassificering, respons-moderation, afvisning-detection og toxicity-detection som eksempler pÃĨ samme problem. Shieldstral er bygget pÃĨ Ministral-3-3B, Mistralâs lille multimodale model, med en Pixtral-vision-encoder, der hÃĨndterer billedindgange, og modelkortet nÃĶvner en 32k-token trÃĶningskontekst.
TrÃĶningsdatastrategien er, hvor Mistral pÃĨstÃĨr, at stÃļrrelsesulemperne bliver genoprettet. Rapporten beskriver omtrent 54,1 millioner trÃĶningsprÃļver samlet fra offentlige sikkerhedsdataset med modsÃĶttende taxonomier, hver konverteret til samme instruktion-spÃļrgsmÃĨl-dokument-format med paraphrased skabeloner og per-dataset strengthedskalibrering. For at undervise i diskrimination snarere end kategori-hukommelse, genererede Mistral kontrastive par: en LLM omskrev sikkert indhold for at krÃĶnke en politik, mens den skÃĨnede en nÃĶrt beslÃĶgtet sÃļsterpolitik, sÃĨ modellen lÃĶrer, hvilken specifik regel et stykke indhold bryder. Den endelige checkpoint kombinerer tre LoRA-fine-tunes via sfÃĶrisk interpolation, en kalibreret pÃĨ offentlige data, en tilfÃļjer de genererede politik-diskriminationsdata, og basis-instruktionsmodellen for generel instruktionsfÃļlgen.
Hvad evalueringerne mÃĨlte
Mistral evaluerede Shieldstral mod ti ÃĨbne baseline-modeller pÃĨ 16 benchmarks, med alle evalueringseksempler holdt uden for trÃĶning. Overskriftsresultaterne, som rapporteret i den tekniske rapport:
- 84,9% gennemsnitlig F1 pÃĨ tekst-sikkerhedsbenchmarks, der matcher den langt stÃļrre GPT-OSS-Safeguard-20B og rangerer som nummer ÃĐt i alt blandt modeller, der varierer fra 4B til 20B parametre
- 83,8% gennemsnitlig F1 pÃĨ multimodale sikkerhedsbenchmarks, foran den nÃĶstbedste OmniGuard-7B pÃĨ 77,6%, og fÃļrende pÃĨ to af tre billed-sikkerhedsbenchmarks
- 91,3% F1 pÃĨ en formÃĨl-bygget politik-tilpasnings-evaluering, mod 94,1% for GPT-OSS-Safeguard-20B, der genererer en lang resonans-trÃĶning fÃļr besvarelse snarere end en enkelt token
- ~54,1M trÃĶningsprÃļver: 45,2M offentlige tekst, 4,4M syntetiske kontrastive tekst og 4,5M multimodale prÃļver
Disse er leverandÃļr-rapporterede tal, mÃĨlt af Mistral pÃĨ benchmarks, det har valgt. To designvalg i rapporten er vÃĶrd at bemÃĶrke, nÃĨr man lÃĶser dem. Tilpasningsbenchmarket bruger en bevidst anden taksonomi end trÃĶning, genereret og verificeret af andre LLMâer end trÃĶningsdata, sÃĨ scoren ikke kan tilskrives hukommelse af kategorier. Og pÃĨ multilingual prompt-klassificering viser rapportens egen appendix, at Shieldstral er bagest i arabisk og indonesisk, med Mistral, der markerer ujÃĶvn sprog-dÃĶkning som en erklÃĶret begrÃĶnsning.
Mistrals anden forsÃļg pÃĨ moderation, denne gang i det ÃĨbne
Shieldstral er Mistrals tredje moderationsmodel, efter to hosted APIâer, og den fÃļrste, den har udgivet som ÃĨbne vÃĶgte. Dens fÃļrste indholdsmoderations-API, lanceret den 7. november 2024, var en hosted tekstklassificator, der dÃĶkkede ni faste kategorier pÃĨ 11 sprog, det samme system, der modererer Le Chat. En anden hosted version fulgte, men ingen af dem leverede vÃĶgte. Shieldstral inverterer denne ordning: kategoriene er ikke lÃĶngere faste, politikken rejser med anmodningen, og modellen selv er nedladbar.
Udgivelsen fortsÃĶtter en rÃĶkke af smÃĨ-model-udgivelser fra Paris-laboratoriet bygget pÃĨ Ministral 3-familien, en linje rettet mod installationer, hvor en front-model er unÃļdvendig overhoved, en tilgang Unite.AI dokumenterede i dens tidligere kig pÃĨ Mistrals edge-device-strategi. Mistral udgav Shieldstral som en inaugural medlem af Open Secure AI Alliance sammen med NVIDIA (NVDA ) og andre organisationer, og selskabet siger, at det trÃĶnede modellen fra ende til anden pÃĨ Forge, sin brugerdefinerede trÃĶnings- og evalueringssplatform.
Mistrals erklÃĶrede vejrkort for modellen peger pÃĨ multilingual dÃĶkning, lÃĶngere-dokument-robusthed og bredere multimodal sikkerhed som de nÃĶste arbejdsomrÃĨder. I Shieldstrals design lever politikken i -feltet af hver anmodning snarere end i modellens vÃĶgte.












