AI-modeller og platforme
Mistral’s Shieldstral Pakker Politik-tilpasset Sikkerhedsskæring Ind I 3B Parametre

Mistral AI udgav Shieldstral den 4. august 2026, en 3B-parameter åben-vejts sikkerhedsclassifier, der dømmer tekst og billeder mod moderationspolitikker skrevet i almindelig sprog ved inferens tid, snarere end en fast sat af skadecategorier bagt i under træning. Modellen er tilgængelig på Hugging Face under Apache 2.0-licensen, dækker 12 sprog og kører på en enkelt 16GB GPU. Mistral siger i sin meddelelse, at Shieldstral matcher åbne guard-modeller op til syv gange sin størrelse på tekst-sikkerhed og sætter en ny standard for multimodal-moderation, og den rammer udgivelsen omkring en skarp kritik af, hvordan guardrail-modeller normalt er bygget.
De fleste guardrail-modeller, argumenterer Mistral, har en skadecategori-taxonomi indkodet i deres vægte, så tilpasning til en ny produktkontekst kræver gen-træning. Shieldstral tager modsat moderationspolitikken som en del af input: operatøren skriver et ja/nej-spørgsmål, leverer en instruktion, der beskriver evalueringens kontekst og strengthed, og modellen returnerer en kalibreret sikkerhedsscore fra en enkelt token. Den samme checkpoint kan derfor skærme en cybersecurity-forskningsværktøj og en mental-sundhedsplatform mod forskellige standarder uden ændring.
Udgivelsen lander med en usædvanlig mængde dokumentation for en lille model: en teknisk rapport på arXiv, der beskriver træningsopskriften og evalueringen (offentliggjort den 28. juli 2026), plus en modelkort i Mistral’s docs og vægtene selv, begge offentliggjort den 4. august.
Hvordan Shieldstral læser en politik i stedet for at huske en
Mekanismen, der er beskrevet i den tekniske rapport, reducerer hver moderationsopgave til binær spørgsmål. Hver anmodning har tre markerede dele: en <Instruct>-felt, der bærer evalueringens kontekst og strengthed, et <Query>-felt med et enkelt ja/nej-spørgsmål, såsom “Fremmer denne indhold fysisk vold?”, og et <Document>-felt, der holder indholdet, der skal dømmes, som kan være en prompt, en respons, en prompt-respons-par eller et billede med valgfri tekst. Ved inferens læser modellen kun logits for “ja” og “nej”-token og softmax-normaliserer dem til en kontinuert score, der er grænseværdi på 0,5 for en binær dom.
Denne formulering tillader, at en checkpoint kan absorbere prompt-klassificering, respons-moderation, afvisning-detection og toxicity-detection som eksempler på samme problem. Shieldstral er bygget på Ministral-3-3B, Mistral’s lille multimodale model, med en Pixtral-vision-encoder, der håndterer billedindgange, og modelkortet nævner en 32k-token træningskontekst.
Træningsdatastrategien er, hvor Mistral påstår, at størrelsesulemperne bliver genoprettet. Rapporten beskriver omtrent 54,1 millioner træningsprøver samlet fra offentlige sikkerhedsdataset med modsættende taxonomier, hver konverteret til samme instruktion-spørgsmål-dokument-format med paraphrased skabeloner og per-dataset strengthedskalibrering. For at undervise i diskrimination snarere end kategori-hukommelse, genererede Mistral kontrastive par: en LLM omskrev sikkert indhold for at krænke en politik, mens den skånede en nært beslægtet søsterpolitik, så modellen lærer, hvilken specifik regel et stykke indhold bryder. Den endelige checkpoint kombinerer tre LoRA-fine-tunes via sfærisk interpolation, en kalibreret på offentlige data, en tilføjer de genererede politik-diskriminationsdata, og basis-instruktionsmodellen for generel instruktionsfølgen.
Hvad evalueringerne målte
Mistral evaluerede Shieldstral mod ti åbne baseline-modeller på 16 benchmarks, med alle evalueringseksempler holdt uden for træning. Overskriftsresultaterne, som rapporteret i den tekniske rapport:
- 84,9% gennemsnitlig F1 på tekst-sikkerhedsbenchmarks, der matcher den langt større GPT-OSS-Safeguard-20B og rangerer som nummer ét i alt blandt modeller, der varierer fra 4B til 20B parametre
- 83,8% gennemsnitlig F1 på multimodale sikkerhedsbenchmarks, foran den næstbedste OmniGuard-7B på 77,6%, og førende på to af tre billed-sikkerhedsbenchmarks
- 91,3% F1 på en formål-bygget politik-tilpasnings-evaluering, mod 94,1% for GPT-OSS-Safeguard-20B, der genererer en lang resonans-træning før besvarelse snarere end en enkelt token
- ~54,1M træningsprøver: 45,2M offentlige tekst, 4,4M syntetiske kontrastive tekst og 4,5M multimodale prøver
Disse er leverandør-rapporterede tal, målt af Mistral på benchmarks, det har valgt. To designvalg i rapporten er værd at bemærke, når man læser dem. Tilpasningsbenchmarket bruger en bevidst anden taksonomi end træning, genereret og verificeret af andre LLM’er end træningsdata, så scoren ikke kan tilskrives hukommelse af kategorier. Og på multilingual prompt-klassificering viser rapportens egen appendix, at Shieldstral er bagest i arabisk og indonesisk, med Mistral, der markerer ujævn sprog-dækning som en erklæret begrænsning.
Mistrals anden forsøg på moderation, denne gang i det åbne
Shieldstral er Mistrals tredje moderationsmodel, efter to hosted API’er, og den første, den har udgivet som åbne vægte. Dens første indholdsmoderations-API, lanceret den 7. november 2024, var en hosted tekstklassificator, der dækkede ni faste kategorier på 11 sprog, det samme system, der modererer Le Chat. En anden hosted version fulgte, men ingen af dem leverede vægte. Shieldstral inverterer denne ordning: kategoriene er ikke længere faste, politikken rejser med anmodningen, og modellen selv er nedladbar.
Udgivelsen fortsætter en række af små-model-udgivelser fra Paris-laboratoriet bygget på Ministral 3-familien, en linje rettet mod installationer, hvor en front-model er unødvendig overhoved, en tilgang Unite.AI dokumenterede i dens tidligere kig på Mistrals edge-device-strategi. Mistral udgav Shieldstral som en inaugural medlem af Open Secure AI Alliance sammen med NVIDIA (NVDA ) og andre organisationer, og selskabet siger, at det trænede modellen fra ende til anden på Forge, sin brugerdefinerede trænings- og evalueringssplatform.
Mistrals erklærede vejrkort for modellen peger på multilingual dækning, længere-dokument-robusthed og bredere multimodal sikkerhed som de næste arbejdsområder. I Shieldstrals design lever politikken i -feltet af hver anmodning snarere end i modellens vægte.












