Modely a platformy AI
Mistral’s Shieldstral Balíčky Politiky Adaptivní Bezpečnostní Kontroly Do 3B Parametrů

Mistral AI vydal Shieldstral 4. srpna 2026, 3B-parametrický otevřený bezpečnostní klasifikátor, který hodnotí text a obrázky proti moderovaným politikám psaným v běžném jazyce, místo pevné sady škodlivých kategorií zakódovaných během trénování. Model je k dispozici na Hugging Face pod licencí Apache 2.0, pokrývá 12 jazyků a běží na jediném 16GB GPU. Mistral uvádí ve svém oznámení, že Shieldstral odpovídá otevřeným bezpečnostním modelům až sedmkrát větších rozměrů na textové bezpečnosti a stanovuje nový stav umění na multimodální moderaci, a že vydání je zaměřeno na kritiku toho, jak jsou obvykle postaveny bezpečnostní modely.
Většina bezpečnostních modelů, argumentuje Mistral, zakóduje taxonomii škodlivých kategorií do svých váh, takže přizpůsobení jim nového produktového kontextu znamená přeškolování. Shieldstral místo toho bere moderovací politiku jako součást vstupu: operátor píše ano/ne otázku, dodává instrukci popisující kontext hodnocení a přísnost, a model vrátí kalibrovaný bezpečnostní skóre z jediného tokenu. Stejný kontrolní bod může tedy procházet kybernetickým bezpečnostním výzkumným nástrojem a platformou pro duševní zdraví proti různým standardům bez změny.
Vydání přichází s neobvyklým množstvím dokumentace pro malý model: technická zpráva na arXiv popisující recept na trénování a hodnocení (zveřejněno 28. července 2026), plus modelová karta v dokumentaci Mistral a sama váha, obě vydané 4. srpna.
Jak Shieldstral čte politiku místo toho, aby si ji pamatoval
Mechanizmus, popsán v technické zprávě, snižuje každou moderovací úlohu na binární otázku. Každá žádost má tři označené části: <Instruct> pole nesoucí kontext hodnocení a úroveň přísnosti, <Query> pole s ano/ne otázkou, jako je “Podporuje toto obsah fyzické násilí?”, a <Document> pole držící obsah, který má být posouzen, který může být výzvou, odpovědí, dvojicí výzva-odpověď nebo obrázkem s volitelným textem. Při inferenci model čte pouze logity pro “ano” a “ne” tokeny a softmax-normalizuje je do kontinuálního skóre, prahové hodnoty 0,5 pro binární verdikt.
Tato formulace umožňuje jedné kontrolní bod absorbovat klasifikaci výzev, moderaci odpovědí, detekci odmítnutí a detekci toxicity jako instance stejného problému. Shieldstral je postaven na Ministral-3-3B, Mistralově malém multimodálním modelu, s Pixtral vizuálním kodérem zpracovávajícím obrazové vstupy, a modelová karta uvádí 32k-token trénovací kontext.
Strategie trénovacího dat je tam, kde Mistral tvrdí, že se získá výhoda velikosti. Zpráva popisuje přibližně 54,1 milionu trénovacích vzorků sestavených z veřejných bezpečnostních dat s rozporuplnými taxonomiemi, každý převeden do stejného formátu instrukce-otázka-dokument s parafrázovanými šablonami a kalibrací přísnosti na základě dat. Pro výuku diskriminace místo memorování kategorií Mistral generoval kontrastní páry: LLM přepsal bezpečný text, aby porušil jednu politiku, zatímco ušetřil blízkého sourozence politiky, takže model se naučí, které konkrétní pravidlo určitý obsah porušuje. Finální kontrolní bod spojuje tři LoRA jemné úpravy prostřednictvím sférické interpolace, jednu kalibrovanou na veřejných datech, jednu přidávající generovaná data pro diskriminaci politik, a základní instrukční model pro obecné sledování instrukcí.
Co hodnocení měřilo
Mistral vyhodnotil Shieldstral proti deseti otevřeným základním modelům napříč 16 benchmarky, se všemi vyhodnocovacími vzorky drženy mimo trénování. Hlavní výsledky, jak je uvedeno v technické zprávě:
- 84,9% průměrné F1 na textových bezpečnostních benchmarkách, odpovídající mnohem většímu GPT-OSS-Safeguard-20B a umístěnému na prvním místě celkově mezi modely v rozmezí 4B až 20B parametrů
- 83,8% průměrné F1 na multimodálních bezpečnostních benchmarkách, před druhým nejlepším OmniGuard-7B na 77,6%, a vedoucí na dvou ze tří obrazových bezpečnostních benchmarků
- 91,3% F1 na vyhrazeném hodnocení adaptability politik, proti 94,1% pro GPT-OSS-Safeguard-20B, který generuje dlouhou stopu důvodu před odpovědí místo jediného tokenu
- přibližně 54,1 milionu trénovacích vzorků: 45,2 milionu open-source textu, 4,4 milionu syntetických kontrastních textů a 4,5 milionu multimodálních vzorků
Toto jsou čísla hlášená dodavatelem, měřená Mistralem na benchmarkách, které vybral. Dvě návrhové volby ve zprávě jsou hodny pozornosti při čtení těchto čísel. Benchmark adaptability používá úmyslně odlišnou taxonomii než trénování, generovanou a ověřenou jinými LLM než trénovací data, takže skóre nelze připsat memorovaným kategoriím. A na multilingvální klasifikaci výzev zpráva ve své příloze ukazuje, že Shieldstral zaostává za několika základními modely v arabštině a indonéštině, s Mistralem, který označuje nerovnoměrné jazykové pokrytí jako uvedenou limitaci.
Mistralova druhá fáze moderace, tentokrát otevřená
Shieldstral je Mistralovým třetím moderovaným modelem, po dvou hostovaných API, a prvním, který vydal jako otevřené váhy. Jeho první API pro obsahovou moderaci, spuštěné 7. listopadu 2024, bylo hostované textové klasifikační API pokrývající devět pevných kategorií napříč 11 jazyky, stejný systém, který moderuje Le Chat. Druhá hostovaná verze následovala, ale ani jedna z nich nevydala váhy. Shieldstral obrací toto uspořádání: kategorie již nejsou pevné, politika cestuje s žádostí, a model sám je ke stažení.
Vydání také pokračuje v řadě malých modelů z pařížské laboratoře postavené na rodině Ministral 3, zaměřené na nasazení, kde je model na hranici zbytečným přetížením, přístup, který Unite.AI dokumentoval ve svém dřívějším pohledu na strategii edge zařízení Mistral. Mistral vydal Shieldstral jako inauguračního člena Open Secure AI Alliance spolu s NVIDIA (NVDA ) a dalšími organizacemi, a společnost uvádí, že model byl trénován od začátku do konce na Forge, své vlastní trénovací a vyhodnocovací platformě.
Mistralův deklarovaný roadmap pro model ukazuje na multilingvální pokrytí, robustnost delších dokumentů a širší multimodální bezpečnost jako další oblasti práce. V návrhu Shieldstral žije politika v poli každé žádosti místo v modelech váh.












