Modèles et plateformes d’IA
Les packs de sécurité de Mistral’s Shieldstral intègrent un filtrage adaptatif de sécurité basé sur les politiques dans 3 milliards de paramètres

Mistral AI a publié Shieldstral le 4 août 2026, un classificateur de sécurité à 3 milliards de paramètres et à poids ouverts qui évalue les textes et les images par rapport à des politiques de modération écrites en langage clair au moment de l’inférence, plutôt qu’un ensemble fixe de catégories de préjudice intégrées pendant la formation. Le modèle est disponible sur Hugging Face sous licence Apache 2.0, couvre 12 langues et fonctionne sur une seule carte graphique de 16 Go. Mistral indique dans son annonce que Shieldstral équivaut aux modèles de garde ouverte jusqu’à sept fois sa taille en matière de sécurité des textes et établit un nouvel état de l’art en matière de modération multimodale, et il présente la sortie autour d’une critique ciblée de la façon dont les modèles de garde sont généralement construits.
La plupart des modèles de garde, selon Mistral, intègrent une taxonomie de catégories de préjudice dans leurs poids, de sorte que les adapter à un nouveau contexte de produit nécessite une rééducation. Shieldstral prend au contraire la politique de modération comme partie de l’entrée : l’opérateur écrit une question oui/non, fournit une instruction décrivant le contexte d’évaluation et le niveau de sévérité, et le modèle renvoie un score de sécurité calibré à partir d’un seul jeton. Le même point de contrôle peut donc évaluer un outil de recherche en cybersécurité et une plate-forme de santé mentale par rapport à des normes différentes sans modification.
La publication s’accompagne d’une documentation inhabituellement abondante pour un petit modèle : un rapport technique sur arXiv décrivant la recette de formation et l’évaluation (publié le 28 juillet 2026), ainsi qu’une fiche de modèle dans les documents de Mistral et les poids eux-mêmes, tous deux publiés le 4 août.
Comment Shieldstral lit une politique au lieu de la mémoriser
Mécanisme, exposé dans le rapport technique, réduit chaque tâche de modération à une réponse à une question binaire. Chaque demande comporte trois parties étiquetées : un champ <Instruct> contenant le contexte d’évaluation et le niveau de sévérité, un champ <Query> avec une question oui/non telle que “Cette contenu promeut-il la violence physique ?”, et un champ <Document> contenant le contenu à évaluer, qui peut être une invite, une réponse, une paire invite-réponse ou une image avec du texte facultatif. Lors de l’inférence, le modèle ne lit que les logits pour les jetons “oui” et “non” et les normalise en softmax en un score continu, seuillé à 0,5 pour un verdict binaire.
Cette formulation permet à un point de contrôle d’absorber la classification d’invite, la modération de réponse, la détection de refus et la détection de toxicité comme des instances du même problème. Shieldstral est construit sur Ministral-3-3B, le petit modèle multimodal de Mistral, avec un encodeur de vision Pixtral pour les entrées d’images, et la fiche de modèle indique un contexte de formation de 32 000 jetons.
La stratégie de données de formation est là où Mistral prétend que le désavantage de taille est récupéré. Le rapport décrit environ 54,1 millions d’exemples de formation assemblés à partir de jeux de données de sécurité publics avec des taxonomies contradictoires, chacun converti dans le même format d’instruction-requête-document avec des modèles paraphrasés et une calibration de sévérité par jeu de données. Pour enseigner la discrimination plutôt que la mémorisation de catégorie, Mistral a généré des paires contrastives : un LLM a réécrit du texte sûr pour enfreindre une politique tout en épargnant une politique sœur étroitement liée, de sorte que le modèle apprenne quelle règle spécifique un contenu enfreint. Le point de contrôle final fusionne trois réglages fins LoRA via une interpolation sphérique, l’un calibré sur les données publiques, l’autre ajoutant les données de discrimination de politique générées, et le modèle d’instruction de base pour le suivi d’instruction générale.
Ce que les évaluations ont mesuré
Mistral a évalué Shieldstral contre dix lignes de base ouvertes sur 16 références, avec tous les exemples d’évaluation retenus pendant la formation. Les résultats principaux, tels que rapportés dans le rapport technique :
- 84,9 % de F1 moyen sur les références de sécurité des textes, égalant le modèle GPT-OSS-Safeguard-20B beaucoup plus grand et se classant premier au classement général parmi les modèles allant de 4 à 20 milliards de paramètres
- 83,8 % de F1 moyen sur les références de sécurité multimodale, devançant le prochain OmniGuard-7B à 77,6 %, et leader sur deux des trois références de sécurité d’image
- 91,3 % de F1 sur une évaluation d’adaptabilité de politique construite à des fins spécifiques, contre 94,1 % pour GPT-OSS-Safeguard-20B, qui génère une longue trace de raisonnement avant de répondre plutôt qu’un seul jeton
- ~ 54,1 millions d’exemples de formation : 45,2 millions de texte open source, 4,4 millions de texte contrastif synthétique et 4,5 millions d’exemples multimodaux
Ces chiffres sont des chiffres rapportés par le fournisseur, mesurés par Mistral sur les références qu’il a sélectionnées. Deux choix de conception dans le rapport sont dignes d’être notés lors de leur lecture. L’évaluation d’adaptabilité utilise une taxonomie délibérément différente de celle de la formation, générée et vérifiée par des LLM différents de ceux des données de formation, de sorte que le score ne peut pas être attribué à des catégories mémorisées. Et sur la classification d’invite multilingue, l’annexe du rapport montre Shieldstral traînant derrière plusieurs lignes de base en arabe et en indonésien, avec Mistral signalant une couverture linguistique inégale comme une limitation déclarée.
La deuxième passe de modération de Mistral, cette fois dans l’ouverture
Shieldstral est le troisième modèle de modération de Mistral, après deux API hébergées, et le premier qu’il a publié sous forme de poids ouverts. Son première API de modération de contenu, lancée le 7 novembre 2024, était un classificateur de texte hébergé couvrant neuf catégories fixes sur 11 langues, le même système qui modère Le Chat. Une deuxième version hébergée a suivi, mais aucune n’a expédié de poids. Shieldstral inverse cet arrangement : les catégories ne sont plus fixes, la politique voyage avec la demande, et le modèle lui-même est téléchargeable.
La publication continue une série de publications de petits modèles du laboratoire de Paris basés sur la famille Ministral 3, une ligne visant les déploiements où un modèle de frontière est un surcroît inutile, l’approche que Unite.AI a documentée dans son examen précédent de la stratégie d’appareil de bord de Mistral AI. Mistral a publié Shieldstral en tant que membre inaugural de l’Alliance pour l’IA sécurisée ouverte aux côtés de NVIDIA (NVDA ) et d’autres organisations, et la société indique qu’elle a formé le modèle de bout en bout sur Forge, sa plate-forme de formation et d’évaluation personnalisée.
La feuille de route déclarée de Mistral pour le modèle indique une couverture multilingue, une robustesse de document plus longue et une sécurité multimodale plus large comme les prochains domaines de travail. Dans la conception de Shieldstral, la politique vit dans le champ de chaque demande plutôt que dans les poids du modèle.












