Modele și platforme AI
Pachetele Shieldstral de la Mistral încorporează siguranța adaptivă a politicii în 3 miliarde de parametri

Mistral AI a lansat Shieldstral pe 4 august 2026, un clasificator de siguranță deschis cu 3 miliarde de parametri care evaluează textul și imaginile împotriva politicilor de moderare scrise în limbaj clar la momentul inferenței, și nu o categorie fixă de daune încorporate în timpul antrenamentului. Modelul este disponibil pe Hugging Face sub licența Apache 2.0, acoperă 12 limbi și rulează pe o singură GPU de 16 GB. Mistral spune în anunțul său că Shieldstral se potrivește cu modelele deschise de gardă până la șapte ori mărimea sa pe siguranța textului și stabilește un nou standard de artă pe moderarea multimodală, și încadrează lansarea în jurul unei critici punctate a modului în care se construiesc de obicei modelele de gardă.
Majoritatea modelelor de gardă, susține Mistral, încorporează o taxonomie a categoriilor de daune în greutățile lor, astfel încât adaptarea lor la un context de produs nou înseamnă reantrenare. Shieldstral, în schimb, ia politica de moderare ca parte a intrării: operatorul scrie o întrebare da/nu, furnizează o instrucțiune care descrie contextul și severitatea evaluării, și modelul returnează un scor de siguranță calibrat dintr-un singur token. Prin urmare, același punct de control poate evalua o unealtă de cercetare în domeniul securității cibernetice și o platformă de sănătate mintală împotriva unor standarde diferite fără modificare.
Lansarea vine cu o cantitate neobișnuit de mare de documentație pentru un model mic: un raport tehnic pe arXiv care descrie rețeta de antrenament și evaluare (postat pe 28 iulie 2026), plus o carte de model în documentația Mistral și greutățile însele, ambele lansate pe 4 august.
Cum citește Shieldstral o politică în loc de a o memora
Mecanismul, prezentat în raportul tehnic, reduce fiecare sarcină de moderare la întrebări binare. Fiecare cerere are trei părți etichetate: un câmp <Instruct> care poartă contextul și nivelul de severitate al evaluării, un câmp <Query> cu o singură întrebare da/nu, cum ar fi “Promovează acest conținut violența fizică?”, și un câmp <Document> care conține conținutul de evaluat, care poate fi o instrucțiune, un răspuns, o pereche de instrucțiune-răspuns sau o imagine cu text opțional. La inferență, modelul citește doar logit-urile pentru token-urile “da” și “nu” și le normalizează cu softmax într-un scor continuu, pragat la 0,5 pentru un verdict binar.
Această formulare permite unei singure puncte de control să absoarbă clasificarea instrucțiunilor, moderarea răspunsurilor, detectarea refuzului și detectarea toxicității ca instanțe ale aceleiași probleme. Shieldstral se bazează pe Ministral-3-3B, modelul multimodal mic al Mistral, cu un decodificator de imagine Pixtral care gestionează intrările de imagine, și cartea de model listează un context de antrenament de 32k de tokeni.
Strategia de date de antrenament este acolo unde Mistral susține că dezavantajul de mărime este recuperat. Raportul descrie aproximativ 54,1 milioane de exemple de antrenament asamblate din seturi de date publice de siguranță cu taxonomii contradictorii, fiecare convertit în același format de instrucțiune-întrebare-document cu șabloane paraphrazate și calibrare a severității pe bază de set de date. Pentru a învăța discriminarea și nu memorizarea categoriilor, Mistral a generat perechi contrastive: un model de limbaj a rescris textul sigur pentru a încălca o politică în timp ce o politică înrudită a fost cruțată, astfel încât modelul învață care regulă specifică este încălcată de un anumit conținut. Punctul de control final combină trei ajustări fine LoRA prin interpolare sferică, una calibrată pe date publice, una care adaugă datele de discriminare a politicii generate, și modelul de bază de instruire pentru urmărirea generală a instrucțiunilor.
Ce au măsurat evaluările
Mistral a evaluat Shieldstral împotriva a zece linii de bază deschise pe 16 benchmark-uri, cu toate exemplele de evaluare ținute separate de antrenament. Rezultatele principale, așa cum sunt raportate în raportul tehnic:
- 84,9% medie F1 pe benchmark-urile de siguranță a textului, potrivindu-se cu mult mai marele GPT-OSS-Safeguard-20B și clasându-se pe primul loc în general printre modelele care variază de la 4B la 20B de parametri
- 83,8% medie F1 pe benchmark-urile de siguranță multimodală, înaintea următorului model OmniGuard-7B la 77,6%, și conducând la două din trei benchmark-uri de siguranță a imaginilor
- 91,3% F1 pe o evaluare special creată pentru adaptabilitatea politicii, față de 94,1% pentru GPT-OSS-Safeguard-20B, care generează o urmă de raționament lungă înainte de a răspunde, și nu un singur token
- ~54,1M exemple de antrenament: 45,2M text deschis, 4,4M text contrastiv sintetic, și 4,5M exemple multimodale
Acestea sunt numere raportate de furnizor, măsurate de Mistral pe benchmark-urile pe care le-a selectat. Două alegeri de proiectare din raport sunt demne de remarcat atunci când citiți aceste numere. Benchmark-ul de adaptabilitate folosește o taxonomie intenționat diferită de cea de antrenament, generată și verificată de LLM-uri diferite de cele folosite pentru datele de antrenament, astfel încât scorul nu poate fi atribuit categoriilor memorizate. Și la clasificarea prompt-urilor multilingve, apendicele raportului arată că Shieldstral urmează mai multe linii de bază în arabă și indoneziană, cu Mistral semnalând o acoperire lingvistică neuniformă ca o limitare declarată.
A doua încercare a Mistral la moderare, de data aceasta în deschidere
Shieldstral este al treilea model de moderare al Mistral, după două API-uri găzduite, și primul pe care l-a lansat ca greutăți deschise. Prima sa API de moderare a conținutului, lansată pe 7 noiembrie 2024, a fost un clasificator de text găzduit care acoperea nouă categorii fixe în 11 limbi, același sistem care moderat Le Chat. O a doua versiune găzduită a urmat, dar niciuna nu a expediat greutăți. Shieldstral inversează această dispunere: categoriile nu mai sunt fixe, politica călătorește cu cererea, și modelul însuși este descărcabil.
Lansarea continuă, de asemenea, o serie de lansări de modele mici de la laboratorul din Paris, construite pe familia Ministral 3, o linie destinată implementărilor în care un model de frontieră este o suprasarcină inutilă, abordarea pe care Unite.AI a documentat-o în privirea sa anterioară la strategia de dispozitive de margine a Mistral. Mistral a lansat Shieldstral ca membru inaugural al Alianței pentru Siguranță Deschisă a Inteligenței Artificiale, alături de NVIDIA (NVDA ) și alte organizații, și compania spune că a antrenat modelul de la capăt la capăt pe Forge, platforma sa de antrenament și evaluare personalizată.
Drumul declarat al Mistral pentru model indică spre acoperire multilingvă, robustețe de document mai lungă și siguranță multimodală mai largă ca următoarele domenii de lucru. În proiectarea Shieldstral, politica trăiește în câmpul al fiecărei cereri, și nu în greutățile modelului.












