Μοντέλα και πλατφόρμες AI
Το Shieldstral του Mistral Ενσωματώνει Προσαρμοστική Ασφάλεια σε 3B Παραμέτρους

Η Mistral AI κυκλοφόρησε το Shieldstral στις 4 Αυγούστου 2026, einen ανοικτό ταξινομητή ασφαλείας 3B παραμέτρων που κρίνει κείμενο και εικόνες έναντι πολιτικών μετριασμού γραμμένων σε απλή γλώσσα κατά τον χρόνο συλλογής, αντί για ένα σταθερό σύνολο κατηγοριών βλάβης που ενσωματώνονται κατά την εκπαίδευση. Το μοντέλο είναι διαθέσιμο στο Hugging Face υπό την άδεια Apache 2.0, καλύπτει 12 γλώσσες και चलतά σε ένα μόνο GPU 16GB. Η Mistral λέει στην ανακοίνωσή της ότι το Shieldstral αντιστοιχεί σε ανοικτά μοντέλα φύλαξης μέχρι και επτά φορές το μέγεθός του σε ασφάλεια κειμένου και θέτει einen νέο ορό για την ασφάλεια σε πολυμεσικά μέσα, και τοποθετεί την κυκλοφορία γύρω από μια σαφή κριτική για το πώς συνήθως κατασκευάζονται τα μοντέλα φύλαξης.
Τα περισσότερα μοντέλα φύλαξης, όπως επιχειρεί η Mistral, κωδικοποιούν μια ταξινόμηση κατηγοριών βλάβης στα βάρη τους, οπότε η προσαρμογή τους σε einen νέο контέκστ προϊόντος σημαίνει επανεκπαίδευση. Το Shieldstral αντίθετα λαμβάνει την πολιτική μετριασμού ως μέρος της εισόδου: ο χειριστής γράφει μια ερώτηση ναι/όχι, παρέχει eine οδηγία που περιγράφει το контέκστ αξιολόγησης και τη σκληρότητα, και το μοντέλο επιστρέφει einen καλιμπραρισμένο βαθμό ασφαλείας από einen μόνο token. Το ίδιο σημείο μπορεί επομένως να ελέγξει einen εργαλείο έρευνας κυβερνοασφάλειας και μια πλατφόρμα ψυχικής υγείας έναντι διαφορετικών προτύπων χωρίς τροποποίηση.
Η κυκλοφορία συνοδεύεται από einen ασυνήθιστο ποσό τεκμηρίωσης για einen μικρό μοντέλο: einen τεχνική αναφορά στο arXiv που περιγράφει το συντακτικό εκπαίδευσης και αξιολόγησης (δημοσιευμένο στις 28 Ιουλίου 2026), плюς einen κάρτα μοντέλου στα ντοκιμαντέρ της Mistral και τα βάρη τους, και τα δύο κυκλοφόρησαν στις 4 Αυγούστου.
Πώς το Shieldstral διαβάζει μια πολιτική αντί να τη μνημονεύει
Ο μηχανισμός, που περιγράφεται στην τεχνική αναφορά, μειώνει κάθε εργασία μετριασμού σε δυαδική απάντηση σε ερωτήσεις. Κάθε αίτηση έχει τρία σημασμένα μέρη: einen <Instruct> πεδίο που μεταφέρει το контέκστ αξιολόγησης και το επίπεδο σκληρότητας, einen <Query> πεδίο με μια ερώτηση ναι/όχι όπως “Προωθεί αυτό το περιεχόμενο τη σωματική βία;”, και einen <Document> πεδίο που περιέχει το περιεχόμενο που πρέπει να κριθεί, το οποίο μπορεί να είναι eine πρόκληση, eine απάντηση, eine πρόκληση-απάντηση ζευγάρι, ή eine εικόνα με προαιρετικό κείμενο. Κατά τον χρόνο συλλογής το μοντέλο διαβάζει μόνο τους λογιστικούς για τα tokens “ναι” και “όχι” και τους κανονικοποιεί σε einen συνεχόμενο βαθμό, ο οποίος κατωτεροποιείται στο 0,5 για einen δυαδική απόφαση.
Αυτή η μορφή επιτρέπει σε einen σημείο να απορροφήσει την ταξινόμηση πρόκλησης, τη μετριασμό απάντησης, την ανίχνευση άρνησης και την ανίχνευση τοξικότητας ως περιπτώσεις του ίδιου προβλήματος. Το Shieldstral είναι κατασκευασμένο στο Ministral-3-3B, το μικρό πολυμεσικό μοντέλο της Mistral, με einen Pixtral κωδικοποιητή όρασης που χειρίζεται εισόδους εικόνας, και η κάρτα μοντέλου αναφέρει einen контέκστ εκπαίδευσης 32k-token.
Η στρατηγική δεδομένων εκπαίδευσης είναι όπου η Mistral ισχυρίζεται ότι η διαφορά μεγέθους ανακτάται. Η αναφορά περιγράφει περίπου 54,1 εκατομμύρια δείγματα εκπαίδευσης που συναρμολογούνται από δημόσιες βάσεις δεδομένων ασφαλείας με αντικρουόμενες ταξινομήσεις, κάθε eine μετατρέπει στο ίδιο format ερώτησης-παραγγελίας-εγγράφου με παραφρασμένες προτυπώσεις και per-βάση δεδομένων ρύθμιση σκληρότητας. Για να διδάξει διακρίσεις αντί για μνημόνευση κατηγοριών, η Mistral δημιούργησε αντίθετα ζευγάρια: einen LLM ξαναέγραψε ασφαλές κείμενο για να παραβιάσει eine πολιτική ενώ σώζει einen στενά συναφές αδελφικό πολιτική, οπότε το μοντέλο μαθαίνει ποια συγκεκριμένη κανόνα ένα κομμάτι περιεχομένου παραβιάζει. Το τελικό σημείο συνδυάζει τρία LoRA fine-tunes μέσω σφαιρικής διαδικασίας, einen που καλιμπρεύτηκε σε δημόσια δεδομένα, einen που πρόσθεσε τα δεδομένα διακρίσεων πολιτικής, και το βασικό μοντέλο οδηγιών για γενική ακολουθία οδηγιών.
Τι μετρούσαν οι αξιολογήσεις
Η Mistral αξιολόγησε το Shieldstral έναντι δέκα ανοικτών βάσεων σε 16 επιδόσεις, με όλα τα δείγματα αξιολόγησης να κρατούνται έξω από την εκπαίδευση. Τα κύρια αποτελέσματα, όπως αναφέρονται στην τεχνική αναφορά:
- 84,9% μέσος όρος F1 στις επιδόσεις ασφαλείας κειμένου, αντιστοιχώντας στο πολύ μεγαλύτερο GPT-OSS-Safeguard-20B και κατατάσσοντας πρώτο συνολικά μεταξύ μοντέλων που κυμαίνονται από 4B έως 20B παραμέτρους
- 83,8% μέσος όρος F1 στις επιδόσεις ασφαλείας πολυμεσικών, μπροστά από το επόμενο OmniGuard-7B στο 77,6%, και πρώτο σε δύο από τρεις επιδόσεις ασφαλείας εικόνας
- 91,3% F1 σε μια εξειδικευμένη αξιολόγηση προσαρμοστικότητας πολιτικής, έναντι 94,1% για το GPT-OSS-Safeguard-20B, το οποίο παράγει einen μακρύ ιχνηλάτη λόγω πριν από την απάντηση αντί για einen μόνο token
- ~54,1 εκατομμύρια δείγματα εκπαίδευσης: 45,2 εκατομμύρια ανοικτά κείμενα, 4,4 εκατομμύρια συνθετικά αντίθετα κείμενα και 4,5 εκατομμύρια δείγματα πολυμεσικών
Αυτά είναι αριθμοί που αναφέρονται από τον προμηθευτή, μετρημένοι από την Mistral σε επιδόσεις που επέλεξε. Δύο επιλογές σχεδίασης στην αναφορά αξίζει να σημειωθούν όταν διαβάζονται. Η αξιολόγηση προσαρμοστικότητας χρησιμοποιεί eine σκόπιμα διαφορετική ταξινόμηση από την εκπαίδευση, που παράγεται και επικυρωμένη από διαφορετικά LLMs από τα δεδομένα εκπαίδευσης, οπότε ο βαθμό δεν μπορεί να αποδοθεί σε μνημονευμένες κατηγορίες. Και στην ταξινόμηση πρόκλησης πολυγλωσσικών, το παράρτημα της αναφοράς δείχνει το Shieldstral να παραλείπει beberapa βασικές γραμμές σε αραβικά και ινδονησιακά, με την Mistral να σημειώνει μια ατελή κάλυψη γλωσσών ως eine δηλωμένη περιορισμένη.
Η δεύτερη προσπάθεια της Mistral στη μετριασμό, αυτή τη φορά ανοιχτά
Το Shieldstral είναι το τρίτο μοντέλο μετριασμού της Mistral, μετά από δύο API που φιλοξενούνται, και το πρώτο που έχει κυκλοφορήσει ως ανοικτά βάρη. Το πρώτο API μετριασμού περιεχομένου της, που κυκλοφόρησε στις 7 Νοεμβρίου 2024, ήταν ένας ταξινομητής κειμένου που φιλοξενούνταν και καλύπτει εννέα σταθερές κατηγορίες σε 11 γλώσσες, το ίδιο σύστημα που μετριασμού του Le Chat. Một δεύτερη φιλοξενούμενη έκδοση ακολούθησε, αλλά καμία από τις δύο δεν έστειλε βάρη. Το Shieldstral αντιστρέφει αυτή τη διάταξη: οι κατηγορίες δεν είναι πλέον σταθερές, η πολιτική ταξιδεύει με την αίτηση, και το μοντέλο είναι διαθέσιμο για λήψη.
Η κυκλοφορία συνεχίζει επίσης μια σειρά κυκλοφοριών μικρών μοντέλων από το Παρίσι εργαστήριο που βασίζονται στην οικογένεια Ministral 3, μια γραμμή που στοχεύει σε αναπτύξεις όπου ένα μοντέλο.frontier είναι περιττό υπερβολικό φορτίο, την προσέγγιση που έγγραφο Unite.AI στην πρότερη ματιά στη στρατηγική της Mistral για συσκευές ακμής. Η Mistral κυκλοφόρησε το Shieldstral ως ένα εναρκτήριο μέλος του Open Secure AI Alliance μαζί με την NVIDIA (NVDA ) και άλλες οργανώσεις, και η εταιρεία λέει ότι εκπαίδευσε το μοντέλο από την αρχή στο Forge, την πλατφόρμα εκπαίδευσης και αξιολόγησης της.
Η δηλωμένη οδική χάρτα της Mistral για το μοντέλο δείχνει στην κάλυψη πολλών γλωσσών, την αντοχή σε μεγαλύτερα έγγραφα και την ευρύτερη ασφάλεια πολυμεσικών ως τις επόμενες περιοχές εργασίας. Στο σχέδιο του Shieldstral, η πολιτική ζει στο πεδίο κάθε αιτήματος αντί για τα βάρη του μοντέλου.












