AI-mallit ja alustat
Mistralin Shieldstral pakkaa politiikkaan perustuvan turvallisuustarkastuksen 3B-parametriin

Mistral AI julkaisi Shieldstralin 4. elokuuta 2026, 3B-parametrin avoimen painotetun turvallisuusluokittelijan, joka arvioi tekstejä ja kuvia vastaan moderointipolitiikkoja, jotka on kirjoitettu yksinkertaisella kielellä inference-ajassa, sen sijaan, että kiinteä haittakategoriat on sisäänrakennettu koulutuksen aikana. Malli on saatavilla Hugging Facessa Apache 2.0 -lisenssillä, kattaa 12 kieltä ja toimii yhdellä 16 GB:n GPU:lla. Mistral kertoo ilmoituksessaan, että Shieldstral vastaa avoimia vartijamalleja jopa seitsemän kertaa oman koon, tekstiturvallisuuden osalta ja asettaa uuden tilan multimodaalisen moderoinnin osalta, ja se kehittää julkaisun ympärille terävän arvostelun siitä, miten vartijamallit yleensä rakennetaan.
Useimmat vartijamallit, Mistral väittää, koodaa haittakategoriat taksonomiaan painoihin, joten sopeutuminen uuteen tuotekontekstiin tarkoittaa uudelleenkoulutusta. Shieldstral sen sijaan ottaa moderointipolitiikan osana syötettä: operaattori kirjoittaa kyllä/ei-kysymyksen, toimittaa ohjeen, joka kuvaa arviointikontekstia ja tiukkuustasoa, ja malli palauttaa kalibroidun turvallisuuspisteytyksen yhdestä tokenista. Saman tarkistuspisteen voidaan siis tarkastaa kyberTurvallisuustutkimustyökalu ja mielenterveydenhuollon alusta eri standardeja vastaan ilman muutoksia.
Julkaisu saapuu epätavallisen määrän dokumentaation kanssa pienelle mallille: tekninen raportti arXivissa, jossa kuvataan koulutusresepti ja arviointi (julkaistu 28. heinäkuuta 2026), plus mallikortti Mistralin dokumentaatio ja itse painot, jotka julkaistiin 4. elokuuta.
Shieldstral lukee politiikkaa muistamisen sijaan
Mekanismi, joka on esitetty teknisessä raportissa, vähentää jokaisen moderointitehtävän binääriksi kysymyksentekoon. Jokaisella pyynnöllä on kolme merkittyä osaa: <Instruct>-kenttä, joka sisältää arviointikontekstin ja tiukkuustason, <Query>-kenttä, jossa on yksinkertainen kyllä/ei-kysymys, kuten “Edistääkö tämä sisältö fyysistä väkivaltaa?”, ja <Document>-kenttä, joka sisältää arvioitavaa sisältöä, joka voi olla kehote, vastaus, kehote-vastauspari tai kuva, jossa on valinnainen teksti. Inferenssissä malli lukee vain “kyllä” ja “ei” -tokenien logiitit ja softmax-normalisoi ne jatkuvaan pisteytykseen, joka rajataan 0,5:een binääripäätöksen tekemiseksi.
Tämä muotoilu mahdollistaa yhden tarkistuspisteen sisällyttämisen kehoteluokittelun, vastausmoderoinnin, kieltäytymisen havaitsemisen ja myrkyllisyyden havaitsemisen saman ongelman instansseina. Shieldstral on rakennettu Ministral-3-3B:lle, Mistralin pienelle multimodaalille mallille, jossa on Pixtral-näkömoottori, joka käsittelee kuvasyötettä, ja mallikortti listaa 32k-tokenin koulutuskontekstin.
Koulutusdatastrategia on se, missä Mistral väittää, että kokoon etu palautetaan. Raportti kuvailee noin 54,1 miljoonaa koulutusnäytettä, jotka on koottu julkisista turvallisuusdatasta, joissa on ristiriitaisia taksonomioita, ja jokainen on muunnettu samalle ohje-kysymys-dokumentti -muotoon parafraseeratuilla templaateilla ja kunkin datajoukon tiukkuuskalibroinnilla. Opettelemaan erottelua sen sijaan, että kategoriamuistiin, Mistral loi kontrasttipareja: LLM uudelleenkirjoitti turvallista tekstiä rikkoakseen yhden politiikkaa, kun taas läheinen sisaruspolitiikkaa säästettiin, jotta malli oppii, minkä tarkan säännön sisältö rikkoo. Lopullinen tarkistuspiste yhdistää kolme LoRA-hienosäätöä sfäärisen interpoloinnin kautta, yksi on kalibroitu julkisilla tiedoilla, toinen lisää luodun politiikka-erotteludatan, ja perusohjeiden noudattamismalli yleiselle ohjeiden noudattamiselle.
Mitä arviot mittoivat
Mistral arvioi Shieldstralia kymmenen avoimen vertailumallin kanssa 16 benchmarkin kanssa, ja kaikki arviointinäytteet pidettiin pois koulutuksesta. Otsikko tulokset, kuten teknisessä raportissa ilmoitetaan:
- 84,9% keskimääräinen F1 tekstiturvallisuuden benchmarkkeja vastaan, mikä vastaa suurempaa GPT-OSS-Safeguard-20B:ää ja sijoittuu yhteensä ensimmäiseksi 4B-20B parametrin malleja, jotka vaihtelevat
- 83,8% keskimääräinen F1 multimodaalisen turvallisuuden benchmarkkeja vastaan, edellä seuraavaa OmniGuard-7B:ää 77,6%, ja johtaa kahdella kolmesta kuvaturvallisuuden benchmarkista
- 91,3% F1 tarkoituksenmukaisessa politiikka-sopeutumisen arvioinnissa, verrattuna GPT-OSS-Safeguard-20B:ään 94,1%, joka luo pitkän päättelyjäljen ennen vastaamista yhden tokenin sijaan
- ~54,1M koulutusnäytettä: 45,2M avoimen lähdekoodin tekstiä, 4,4M synteettistä kontrastitextiä ja 4,5M multimodaalisia näytteitä
Nämä ovat myyjän ilmoittamat luvut, mitattuina Mistralin toimesta sen valitsemilla benchmarkkeilla. Kaksi suunnitteluratkaisua raportissa on huomionarvoista lukuessa niitä. Soveltuvuusbenchmarkissa käytetään tietoisesti erilaista taksonomiaa kuin koulutuksessa, joka on luotu ja vahvistettu eri LLM:llä kuin koulutusdata, joten pisteytys ei voida liittää muistiin tallennettuihin kategorioihin. Ja monikielisen kehoteksti-luokittelussa raportin liitteessä näkyy Shieldstral jäljessä useita vertailumalleja arabiankielisessä ja indonesialaisessa, ja Mistral mainitsee epätasaisen kielikattavuuden ilmoitetuksi rajoituksiksi.
Mistralin toinen kierros moderoinnissa, tällä kertaa avoimessa
Shieldstral on Mistralin kolmas moderointimalli, seuraavat kaksi isäntä-API:aa, ja ensimmäinen, jonka se on julkaissut avoimena painona. Ensimmäinen sisällön moderointi-API, joka lanseerattiin 7. marraskuuta 2024, oli isäntätekstiluokittelija, joka kattoi yhdeksän kiinteää kategoriaa 11 kielellä, sama järjestelmä, joka moderoi Le Chatia. Toinen isäntäversio seurasi, mutta kumpikaan ei toimittanut painoja. Shieldstral kääntää tämän järjestelyn: kategoriat eivät ole enää kiinteitä, politiikka matkustaa pyynnön kanssa, ja malli itsessään on ladattavissa.
Julkaisu jatkaa Pariisin laboratorion pienien mallien julkaisujen sarjaa, jotka perustuvat Ministral 3 -perheeseen, jota on tarkoitettu käyttöön, jossa etumalli on turha ylirasite, lähestymistapa, jonka Unite.AI on dokumentoinut aiemmassa katsauksessaan Mistralin reunalaitestrategiaan. Mistral julkaisi Shieldstralin avoimen turvallisen AI-liiton perustajajäsenenä Nvidian ja muiden organisaatioiden kanssa, ja yhtiö kertoo, että se koulutti mallin loppuun asti Forge-palvelimella, sen mukautuvalla koulutus- ja arviointialustalla.
Mistralin ilmoitetun mallin tiekartta osoittaa monikielisen kattavuuden, pidemmän asiakirjan robustisuuden ja laajemman multimodaalisen turvallisuuden seuraavina työalueina. Shieldstralin suunnittelussa politiikka elää jokaisen pyynnön -kentässä mallin painojen sijaan.












