AI-modeller och plattformar
Mistral’s Shieldstral Paketerar Policy-Adaptiv Säkerhetsscreening I 3B Parametrar

Mistral AI släppte Shieldstral den 4 augusti 2026, en 3B-parametrars öppen vikter-säkerhetsklassificerare som bedömer text och bilder mot modereringspolicys skrivna på vanligt språk vid inferenstid, snarare än en fast uppsättning skadliga kategorier inbakade under utbildning. Modellen är tillgänglig på Hugging Face under Apache 2.0-licensen, täcker 12 språk och körs på en enda 16GB GPU. Mistral säger i sitt tillkännagivande att Shieldstral matchar öppna guardmodeller upp till sju gånger sin storlek på textsäkerhet och sätter en ny standard för multimodal moderering, och det ramverket runt utgivningen kring en skarpt kritik av hur guardrailmodeller vanligtvis byggs.
De flesta guardrailmodeller, argumenterar Mistral, kodar en taxonomi av skadliga kategorier i sina vikter, så att anpassning till en ny produktkontext innebär omutbildning. Shieldstral tar istället modereringspolicyn som en del av inmatningen: operatören skriver ett ja/nej-fråga, tillhandahåller en instruktion som beskriver utvärderingskontexten och strikthet, och modellen returnerar en kalibrerad säkerhetspoäng från en enda token. Samma kontrollpunkt kan därför skärma en cybersäkerhetsforskningsverktyg och en mentalhälso-plattform mot olika standarder utan modifiering.
Utgivningen landar med en ovanlig mängd dokumentation för en liten modell: en teknisk rapport på arXiv som beskriver utbildningsreceptet och utvärdering (inlämnad den 28 juli 2026), plus en modellkort i Mistral’s docs och viktorna själva, båda utgivna den 4 augusti.
Hur Shieldstral läser en policy istället för att memorera en
Mekanismen, som beskrivs i den tekniska rapporten, reducerar varje modereringsuppgift till binär frågesvar. Varje begäran har tre märkta delar: ett <Instruct>-fält som bär utvärderingskontexten och strikthetsnivån, ett <Query>-fält med ett ja/nej-fråga som “Främjar detta innehåll fysiskt våld?”, och ett <Document>-fält som innehåller innehållet att bedöma, som kan vara en prompt, en respons, en prompt-respons-par eller en bild med valfri text. Vid inferens läser modellen endast logits för “ja” och “nej”-token och softmax-normaliserar dem till en kontinuerlig poäng, trösklad vid 0,5 för en binär dom.
Den formuleringen låter en enda kontrollpunkt absorbera promptklassificering, responsmoderering, vägran och toxicitet som instanser av samma problem. Shieldstral byggs på Ministral-3-3B, Mistral’s lilla multimodala modell, med en Pixtral-vision-encoder som hanterar bildinmatningar, och modellkortet listar en 32k-token-träningskontext.
Träningsdatastrategin är där Mistral hävdar att storleksnackdelen återhämtas. Rapporten beskriver cirka 54,1 miljoner träningsprover samlade från offentliga säkerhetsdataset med motsägelsefulla taxonomier, var och en omvandlad till samma instruktion-fråga-dokumentformat med parafraserade mallar och per-dataset-strikthetskalibrering. För att lära diskriminering snarare än kategori-memorisering genererade Mistral kontrastiva par: en LLM omskrev säkert innehåll för att bryta mot en policy medan den skonas en nära besläktad syskonpolicy, så att modellen lär sig vilken specifik regel ett innehåll bryter. Den slutliga kontrollpunkten sammanfogar tre LoRA-fine-tunes via sfärisk interpolation, en kalibrerad på offentliga data, en som lägger till den genererade policy-diskrimineringsdata, och den basala instruktionsmodellen för allmän instruktionsföljelse.
Vad utvärderingarna mätte
Mistral utvärderade Shieldstral mot tio öppna baslinjer över 16 benchmark, med alla utvärderingsprover hållna utanför utbildning. De viktigaste resultaten, som rapporteras i den tekniska rapporten:
- 84,9% genomsnittlig F1 på textsäkerhetsbenchmark, matchande den mycket större GPT-OSS-Safeguard-20B och rankad först totalt bland modeller som sträcker sig från 4B till 20B parametrar
- 83,8% genomsnittlig F1 på multimodala säkerhetsbenchmark, före den näst bästa OmniGuard-7B vid 77,6%, och ledande på två av tre bildsäkerhetsbenchmark
- 91,3% F1 på en specialbyggd policy-anpassningsutvärdering, mot 94,1% för GPT-OSS-Safeguard-20B, som genererar en lång resonemangsspår före svarandet snarare än en enda token
- ~54,1M träningsprover: 45,2M öppen källkodstext, 4,4M syntetiska kontrastiva texter och 4,5M multimodala prover
Detta är leverantörsrapporterade siffror, mätta av Mistral på benchmark som de valt. Två designval i rapporten är värda att notera när man läser dem. Anpassningsbenchmark använde en medvetet annorlunda taxonomi än utbildning, genererad och verifierad av olika LLM:er än utbildningsdata, så poängen kan inte tillskrivas memorerade kategorier. Och på multilingval promptklassificering visar rapportens egen appendix att Shieldstral släpar efter flera baslinjer på arabiska och indonesiska, med Mistral flaggande ojämn språktäckning som en uttalad begränsning.
Mistrals andra försök till moderering, den här gången öppet
Shieldstral är Mistrals tredje modereringsmodell, efter två värd-API:er, och den första den har släppt som öppna vikter. Dess första innehållsmoderations-API, lanserat den 7 november 2024, var ett värdtextklassificeringsverktyg som täckte nio fasta kategorier över 11 språk, samma system som modererar Le Chat. En andra värdversion följde, men ingen av dem skickade vikter. Shieldstral inverterar den ordningen: kategorierna är inte längre fasta, policyn reser med begäran, och modellen själv är nedladdningsbar.
Utgivningen fortsätter en rad småmodellsläpp från Paris-laboratoriet byggt på Ministral 3-familjen, en linje riktad mot distributioner där en frontmodell är onödig överbelastning, tillvägagångssättet Unite.AI dokumenterade i dess tidigare titt på Mistrals edge-enhetstrategi. Mistral släppte Shieldstral som en invigande medlem i Open Secure AI Alliance tillsammans med NVIDIA (NVDA ) och andra organisationer, och företaget säger att de tränade modellen från början till slut på Forge, deras anpassade tränings- och utvärderingsplattform.
Mistrals uttalade vägkarta för modellen pekar mot multilingval täckning, längre-dokument-robusthet och bredare multimodal säkerhet som nästa arbetsområden. I Shieldstrals design bor policyn i -fältet i varje begäran snarare än i modellens vikter.












