Μοντέλα και πλατφόρμες AI

Το Shieldstral της Mistral προσαρμόζει τον έλεγχο ασφάλειας σε κάθε πολιτική με 3 δισ. παραμέτρους

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Mistral AI κυκλοφόρησε στις 4 Αυγούστου 2026 το Shieldstral, έναν ταξινομητή ασφάλειας ανοιχτών βαρών με 3 δισ. παραμέτρους. Αξιολογεί κείμενο και εικόνες βάσει πολιτικών ελέγχου περιεχομένου γραμμένων σε απλή γλώσσα κατά την εκτέλεση, αντί για σταθερές κατηγορίες βλάβης ενσωματωμένες στην εκπαίδευση. Το μοντέλο διατίθεται στο Hugging Face με άδεια Apache 2.0, καλύπτει 12 γλώσσες και λειτουργεί σε μία GPU με μνήμη 16 GB. Η Mistral αναφέρει στην ανακοίνωσή της ότι το Shieldstral ισοφαρίζει μοντέλα ασφάλειας ανοιχτών βαρών έως επταπλάσιου μεγέθους στον έλεγχο κειμένου και θέτει νέο επίπεδο κορυφαίας επίδοσης στον πολυτροπικό έλεγχο περιεχομένου. Παρουσιάζει την κυκλοφορία ασκώντας σαφή κριτική στον συνήθη σχεδιασμό μοντέλων δικλίδων ασφαλείας.

Σύμφωνα με τη Mistral, τα περισσότερα τέτοια μοντέλα ενσωματώνουν στα βάρη τους μια σταθερή ταξινόμηση κατηγοριών βλάβης, επομένως η προσαρμογή σε νέο προϊόν απαιτεί επανεκπαίδευση. Το Shieldstral δέχεται την πολιτική ως μέρος της εισόδου: ο χειριστής γράφει μια ερώτηση ναι/όχι και οδηγία που περιγράφει το πλαίσιο αξιολόγησης και το επίπεδο αυστηρότητας. Το μοντέλο επιστρέφει βαθμονομημένη βαθμολογία ασφάλειας μέσω ενός token. Η ίδια έκδοση μπορεί επομένως να ελέγχει εργαλείο έρευνας κυβερνοασφάλειας και πλατφόρμα ψυχικής υγείας βάσει διαφορετικών προτύπων, χωρίς τροποποίηση.

Η κυκλοφορία συνοδεύεται από ασυνήθιστα εκτενή τεκμηρίωση για μικρό μοντέλο: μια τεχνική έκθεση στο arXiv με τη μέθοδο εκπαίδευσης και αξιολόγησης, αναρτημένη στις 28 Ιουλίου 2026, καθώς και κάρτα μοντέλου στην τεκμηρίωση της Mistral και τα ίδια τα βάρη, που δημοσιεύθηκαν στις 4 Αυγούστου.

Πώς το Shieldstral διαβάζει μια πολιτική αντί να την απομνημονεύει

Ο μηχανισμός της τεχνικής έκθεσης ανάγει κάθε εργασία ελέγχου περιεχομένου σε ερώτηση δυαδικής απάντησης. Κάθε αίτημα έχει τρία επισημασμένα μέρη: ένα πεδίο <Instruct> με το πλαίσιο αξιολόγησης και το επίπεδο αυστηρότητας, ένα πεδίο <Query> με μία ερώτηση ναι/όχι, όπως «Προωθεί αυτό το περιεχόμενο τη σωματική βία;», και ένα πεδίο <Document> με το προς αξιολόγηση περιεχόμενο: προτροπή, απάντηση, ζεύγος προτροπής και απάντησης ή εικόνα με προαιρετικό κείμενο. Κατά την εκτέλεση, χρησιμοποιούνται μόνο οι μη κανονικοποιημένες βαθμολογίες (logits) των token «yes» και «no». Κανονικοποιούνται με softmax σε συνεχή βαθμολογία, με κατώφλι 0,5 για δυαδική απόφαση.

Έτσι η ίδια έκδοση χειρίζεται ταξινόμηση προτροπών, έλεγχο απαντήσεων, ανίχνευση άρνησης και ανίχνευση τοξικότητας ως περιπτώσεις του ίδιου προβλήματος. Το Shieldstral βασίζεται στο Ministral-3-3B, το μικρό πολυτροπικό μοντέλο της Mistral, με κωδικοποιητή όρασης Pixtral για εικόνες. Η κάρτα αναφέρει παράθυρο περιεχομένου εκπαίδευσης 32.000 token.

Η Mistral υποστηρίζει ότι η στρατηγική δεδομένων εκπαίδευσης αντισταθμίζει το μικρό μέγεθος. Η έκθεση περιγράφει περίπου 54,1 εκατ. δείγματα από δημόσια σύνολα δεδομένων ασφάλειας με ασύμβατες ταξινομήσεις. Μετατράπηκαν στην ίδια μορφή οδηγίας, ερωτήματος και εγγράφου, με παραφρασμένα πρότυπα και βαθμονόμηση αυστηρότητας ανά σύνολο. Για διάκριση πολιτικών αντί απομνημόνευσης κατηγοριών, η Mistral δημιούργησε αντιπαραθετικά ζεύγη: ένα LLM ξαναέγραφε ασφαλές κείμενο ώστε να παραβιάζει μία πολιτική, αλλά όχι μια στενά συγγενική της. Έτσι το μοντέλο μαθαίνει ποιος συγκεκριμένος κανόνας παραβιάζεται. Η τελική έκδοση συγχωνεύει τρεις προσαρμογές LoRA μέσω σφαιρικής παρεμβολής: μία βαθμονομημένη σε δημόσια δεδομένα, μία που προσθέτει τα παραγόμενα δεδομένα διάκρισης πολιτικών και το βασικό μοντέλο οδηγιών για γενική συμμόρφωση με εντολές.

Τι μέτρησαν οι αξιολογήσεις

Η Mistral συνέκρινε το Shieldstral με δέκα ανοιχτά μοντέλα αναφοράς σε 16 σύνολα δοκιμών, αποκλείοντας όλα τα δείγματα αξιολόγησης από την εκπαίδευση. Τα κύρια αποτελέσματα της τεχνικής έκθεσης είναι:

  • Μέσο F1 84,9% στις δοκιμές ασφάλειας κειμένου, ισοφαρίζοντας το πολύ μεγαλύτερο GPT-OSS-Safeguard-20B και καταλαμβάνοντας συνολικά την πρώτη θέση ανάμεσα σε μοντέλα 4–20 δισ. παραμέτρων
  • Μέσο F1 83,8% στις δοκιμές πολυτροπικής ασφάλειας, έναντι 77,6% του επόμενου OmniGuard-7B, με πρώτη θέση σε δύο από τις τρεις δοκιμές ασφάλειας εικόνων
  • F1 91,3% σε ειδικά σχεδιασμένη αξιολόγηση προσαρμογής σε πολιτικές, έναντι 94,1% του GPT-OSS-Safeguard-20B, το οποίο παράγει εκτενή συλλογισμό πριν απαντήσει, αντί ενός μόνο token
  • Περίπου 54,1 εκατ. δείγματα εκπαίδευσης: 45,2 εκατ. δείγματα κειμένου από ανοιχτές πηγές, 4,4 εκατ. συνθετικά αντιπαραθετικά δείγματα κειμένου και 4,5 εκατ. πολυτροπικά δείγματα

Οι αριθμοί προέρχονται από τον προμηθευτή και μετρήθηκαν σε δοκιμές που επέλεξε η Mistral. Δύο σχεδιαστικές επιλογές βοηθούν στην ερμηνεία τους. Η αξιολόγηση προσαρμογής χρησιμοποιεί σκόπιμα διαφορετική ταξινόμηση από την εκπαίδευση, δημιουργημένη και επαληθευμένη από διαφορετικά LLM, επομένως η επίδοση δεν αποδίδεται σε απομνημόνευση κατηγοριών. Στην πολυγλωσσική ταξινόμηση προτροπών, όμως, το παράρτημα της ίδιας της έκθεσης δείχνει ότι το Shieldstral υστερεί έναντι αρκετών μοντέλων αναφοράς στα αραβικά και τα ινδονησιακά. Η Mistral αναγνωρίζει την άνιση γλωσσική κάλυψη ως περιορισμό.

Νέα προσέγγιση της Mistral στον έλεγχο περιεχομένου, αυτή τη φορά με ανοιχτά βάρη

Το Shieldstral είναι το τρίτο μοντέλο ελέγχου περιεχομένου της Mistral, μετά από δύο φιλοξενούμενα API, και το πρώτο που κυκλοφορεί με ανοιχτά βάρη. Το πρώτο API ελέγχου περιεχομένου κυκλοφόρησε στις 7 Νοεμβρίου 2024 ως φιλοξενούμενος ταξινομητής κειμένου για εννέα σταθερές κατηγορίες σε 11 γλώσσες. Είναι το ίδιο σύστημα που ελέγχει το Le Chat. Ακολούθησε δεύτερη φιλοξενούμενη έκδοση, χωρίς να δημοσιευθούν βάρη σε καμία από τις δύο. Το Shieldstral αντιστρέφει αυτή τη διάταξη: οι κατηγορίες δεν είναι πλέον σταθερές, η πολιτική συνοδεύει το αίτημα και το μοντέλο είναι διαθέσιμο για λήψη.

Η κυκλοφορία συνεχίζει επίσης τη σειρά μικρών μοντέλων του παρισινού εργαστηρίου που βασίζονται στην οικογένεια Ministral 3 και προορίζονται για εφαρμογές όπου ένα κορυφαίο μεγάλο μοντέλο θα αποτελούσε περιττή επιβάρυνση. Το Unite.AI εξέτασε αυτή την προσέγγιση στην προηγούμενη ανάλυση της στρατηγικής της Mistral για συσκευές στην περιφέρεια του δικτύου. Η Mistral κυκλοφόρησε το Shieldstral ως ένα από τα αρχικά μέλη της Open Secure AI Alliance, μαζί με τη NVIDIA (NVDA ) και άλλους οργανισμούς. Αναφέρει ότι το εκπαίδευσε εξ ολοκλήρου στο Forge, την προσαρμοσμένη πλατφόρμα εκπαίδευσης και αξιολόγησής της.

Ο οδικός χάρτης της Mistral θέτει ως επόμενες προτεραιότητες την πολυγλωσσική κάλυψη, την ανθεκτικότητα σε μεγαλύτερα έγγραφα και την ευρύτερη πολυτροπική ασφάλεια. Στον σχεδιασμό του Shieldstral, η πολιτική βρίσκεται στο πεδίο <Query> κάθε αιτήματος, όχι στα βάρη του μοντέλου.

Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στην Unite.AI, εστιάζοντας στην γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τα θεωρητικά θεμέλια της μηχανικής νοημοσύνης. Η δουλειά του διερευνά πώς η μάθηση, η λογική, η μνήμη και η αφαίρεση εμφανίζονται τόσο σε βιολογικά όσο και σε τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ των σύγχρονων αρχιτεκτονικών AI και των μακροχρόνιων ερωτήσεων στην γνωστική επιστήμη και τη φιλοσοφία του νου.

Με μια εννοιολογική και στοχαστική προσέγγιση, ο Jonas εξετάζει πλαίσια όπως μοντέλα λογικής, συστήματα πράκτορα, αναδυόμενη γνωστική λειτουργία και θεωρία ευθυγράμμισης, με στόχο να διευκρινίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI — και τι δεν σημαίνει. Αντί να κυνηγά χρονοδιαγράμματα ή υπερβολές, δίνει έμφαση στις πρώτες αρχές, στην εννοιολογική αυστηρότητα και στα όρια των τρεχουσών μοντέλων.

Τα άρθρα που συντάσσει ο Jonas Reeve δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση των προχωρημένων εννοιών AI.