Model dan platform AI

Mistral’s Shieldstral Mengemas Penyaringan Keamanan yang Disesuaikan dengan Kebijakan ke dalam 3B Parameter

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Mistral AI merilis Shieldstral pada 4 Agustus 2026, sebuah klasifikasi keamanan terbuka dengan 3B parameter yang menilai teks dan gambar terhadap kebijakan moderasi yang ditulis dalam bahasa sederhana pada saat inferensi, bukan kategori kerusakan yang telah ditetapkan sebelumnya selama pelatihan. Model ini tersedia di Hugging Face di bawah lisensi Apache 2.0, mendukung 12 bahasa, dan berjalan pada satu GPU 16GB. Mistral menyatakan dalam pengumumannya bahwa Shieldstral menyaingi model penjaga terbuka hingga tujuh kali ukurannya pada keamanan teks dan menetapkan standar baru pada moderasi multimodal, dan itu mengarahkan rilis sekitar kritik yang tajam tentang bagaimana model penjaga biasanya dibangun.

Sebagian besar model penjaga, Mistral berargumen, mengkodekan taksonomi kategori kerusakan ke dalam bobotnya, sehingga menyesuaikannya dengan konteks produk baru berarti pelatihan ulang. Shieldstral sebaliknya mengambil kebijakan moderasi sebagai bagian dari input: operator menulis pertanyaan ya/tidak, menyediakan instruksi yang menjelaskan konteks evaluasi dan tingkat keketatan, dan model mengembalikan skor keamanan yang dikalibrasi dari satu token. Titik akhir yang sama dapat dengan demikian menyaring alat penelitian keamanan siber dan platform kesehatan mental terhadap standar yang berbeda tanpa modifikasi.

Rilis ini dilengkapi dengan dokumentasi yang tidak biasa untuk model kecil: laporan teknis di arXiv yang menjelaskan resep pelatihan dan evaluasi (diposting 28 Juli 2026), plus kartu model di dokumen Mistral dan bobot itu sendiri, keduanya dirilis pada 4 Agustus.

Bagaimana Shieldstral Membaca Kebijakan daripada Mengingatnya

Mekanisme, dijelaskan dalam laporan teknis, mengurangi setiap tugas moderasi menjadi jawaban pertanyaan biner. Setiap permintaan memiliki tiga bagian yang ditandai: bidang <Instruct> yang membawa konteks evaluasi dan tingkat keketatan, bidang <Query> dengan pertanyaan ya/tidak seperti “Apakah konten ini mempromosikan kekerasan fisik?”, dan bidang <Document> yang memegang konten untuk dihakimi, yang dapat berupa prompt, respons, pasangan prompt-respons, atau gambar dengan teks opsional. Pada inferensi model membaca hanya logit untuk token “ya” dan “tidak” dan softmax-normalisasi mereka menjadi skor kontinu, ambang batas 0,5 untuk putusan biner.

Formulasi itu memungkinkan satu titik akhir menyerap klasifikasi prompt, moderasi respons, deteksi penolakan, dan deteksi toksisitas sebagai contoh dari masalah yang sama. Shieldstral dibangun di atas Ministral-3-3B, model multimodal kecil Mistral, dengan encoder visi Pixtral yang menangani input gambar, dan kartu model daftar konteks pelatihan 32k-token.

Strategi data pelatihan adalah tempat Mistral mengklaim kelemahan ukuran pulih. Laporan tersebut menjelaskan sekitar 54,1 juta sampel pelatihan yang disusun dari dataset keamanan publik dengan taksonomi yang bertentangan, masing-masing diubah menjadi format instruksi-pertanyaan-dokumen yang sama dengan templat yang diterjemahkan dan kalibrasi keketatan per dataset. Untuk mengajarkan diskriminasi daripada memorisasi kategori, Mistral menghasilkan pasangan kontras: LLM menulis ulang teks aman untuk melanggar satu kebijakan sambil menyelamatkan kebijakan yang terkait erat, sehingga model mempelajari aturan spesifik yang dilanggar oleh sepotong konten. Titik akhir akhir menggabungkan tiga fine-tune LoRA melalui interpolasi sferis, satu yang dikalibrasi pada data publik, satu menambahkan data diskriminasi kebijakan yang dihasilkan, dan model instruksi dasar untuk mengikuti instruksi umum.

Apa yang Diukur dalam Evaluasi

Mistral mengevaluasi Shieldstral melawan sepuluh baseline terbuka di 16 benchmark, dengan semua sampel evaluasi dipegang dari pelatihan. Hasil utama, seperti yang dilaporkan dalam laporan teknis:

  • 84,9% rata-rata F1 pada benchmark keamanan teks, menyaingi GPT-OSS-Safeguard-20B yang lebih besar dan menduduki peringkat pertama secara keseluruhan di antara model yang berkisar dari 4B hingga 20B parameter
  • 83,8% rata-rata F1 pada benchmark keamanan multimodal, mendahului OmniGuard-7B pada 77,6%, dan memimpin pada dua dari tiga benchmark keamanan gambar
  • 91,3% F1 pada evaluasi adaptasi kebijakan yang dibuat khusus, dibandingkan dengan 94,1% untuk GPT-OSS-Safeguard-20B, yang menghasilkan jejak penalaran panjang sebelum menjawab daripada satu token
  • ~54,1M sampel pelatihan: 45,2M teks sumber terbuka, 4,4M teks kontras sintetis, dan 4,5M sampel multimodal

Ini adalah angka yang dilaporkan vendor, diukur oleh Mistral pada benchmark yang dipilih. Dua pilihan desain dalam laporan patut diperhatikan saat membaca mereka. Benchmark adaptasi menggunakan taksonomi yang berbeda dari pelatihan, yang dihasilkan dan diverifikasi oleh LLM yang berbeda dari data pelatihan, sehingga skor tidak dapat dikaitkan dengan kategori yang diingat. Dan pada klasifikasi prompt multibahasa, lampiran laporan sendiri menunjukkan Shieldstral ketinggalan beberapa baseline di Arab dan Indonesia, dengan Mistral menandai cakupan bahasa yang tidak merata sebagai keterbatasan yang dinyatakan.

Mistral’s Kedua Kalinya dalam Moderasi, Kali Ini Terbuka

Shieldstral adalah model moderasi ketiga Mistral, setelah dua API yang dihosting, dan yang pertama dirilis sebagai bobot terbuka. API moderasi konten pertama, diluncurkan pada 7 November 2024, adalah klasifikasi teks yang dihosting yang mencakup sembilan kategori tetap di 11 bahasa, sistem yang sama yang memoderasi Le Chat. Versi yang dihosting kedua mengikuti, tetapi tidak ada yang mengirim bobot. Shieldstral membalikkan pengaturan tersebut: kategori tidak lagi tetap, kebijakan bepergian dengan permintaan, dan model itu sendiri dapat diunduh.

Rilis ini juga melanjutkan serangkaian rilis model kecil dari laboratorium Paris yang dibangun di atas keluarga Ministral 3, sebuah garis yang ditujukan untuk penerapan di mana model frontier tidak perlu, pendekatan yang didokumentasikan Unite.AI dalam tinjauan sebelumnya tentang strategi perangkat tepi Mistral. Mistral merilis Shieldstral sebagai anggota pendiri Aliansi Keamanan AI Terbuka bersama NVIDIA (NVDA ) dan organisasi lain, dan perusahaan mengatakan bahwa mereka melatih model dari ujung ke ujung pada Forge, platform pelatihan dan evaluasi khusus.

Rencana jalan Mistral untuk model ini menunjuk pada cakupan multibahasa, kekuatan dokumen yang lebih panjang, dan keamanan multimodal yang lebih luas sebagai area kerja berikutnya. Dalam desain Shieldstral, kebijakan hidup di bidang dari setiap permintaan bukan di bobot model.

Jonas Reeve adalah analis AI yang dihasilkan di Unite.AI, yang fokus pada kecerdasan buatan kognitif, kecerdasan buatan umum (AGI), dan landasan teori kecerdasan mesin. Karyanya mengeksplorasi bagaimana pembelajaran, penalaran, memori, dan abstraksi muncul dalam sistem biologis dan buatan, menghubungkan arsitektur AI modern dengan pertanyaan lama dalam ilmu kognitif dan filsafat pikiran.
Dengan pendekatan konseptual dan reflektif, Jonas memeriksa kerangka kerja seperti model penalaran, sistem agen, kognisi yang muncul, dan teori keselarasan, dengan tujuan untuk memperjelas apa yang dimaksud dengan kemajuan menuju AGI—dan apa yang tidak. Daripada mengejar garis waktu atau sensasi, ia menekankan prinsip-prinsip dasar, ketepatan konseptual, dan batasan model saat ini.
Artikel yang ditulis oleh Jonas Reeve dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi, kejelasan, dan diskusi yang bertanggung jawab tentang konsep AI lanjutan.