โมเดลและแพลตฟอร์ม AI
มิสทรัล ชิลด์สทรัล แพ็ค พอลิซี่-แอดапทีฟ เซฟตี้ สกรีนิง อินโต 3B พารามิเตอร์

มิสทรัล AI เปิดตัวชิลด์สทรัล เมื่อวันที่ 4 สิงหาคม 2026 เป็นคลาสสิฟายเออร์เซฟตี้แบบเปิดที่มีพารามิเตอร์ 3B ที่ตัดสินข้อความและรูปภาพตามนโยบายการดูแลที่เขียนด้วยภาษาธรรมดาในช่วงเวลาที่ใช้งาน แทนที่จะเป็นหมวดหมู่อันตรายที่กำหนดไว้ล่วงหน้าในช่วงการฝึกอบรม โมเดลนี้มีอยู่บน Hugging Face ภายใต้ใบอนุญาต Apache 2.0 ครอบคลุม 12 ภาษา และสามารถทำงานบน GPU 16GB ได้ มิสทรัล ระบุในประกาศของตน ว่าชิลด์สทรัลสามารถเทียบเท่ากับโมเดลการป้องกันที่มีขนาดใหญ่กว่าถึง 7 เท่าในด้านความปลอดภัยของข้อความ และสร้างความก้าวหน้าใหม่ในด้านการดูแลแบบหลายรูปแบบ และมิสทรัลยังเน้นถึงการวิพากษ์วิจารณ์วิธีการสร้างโมเดลการป้องกันทั่วไป
โมเดลการป้องกันส่วนใหญ่ มิสทรัลโต้แย้ง ว่าเข้ารหัสหมวดหมู่อันตรายลงในน้ำหนักของโมเดล ดังนั้นการปรับให้เข้ากับบริบทผลิตภัณฑ์ใหม่จึงต้องทำการฝึกอบรมใหม่ ชิลด์สทรัลใช้นโยบายการดูแลเป็นส่วนหนึ่งของอินพุต: ผู้ดำเนินการเขียนคำถามแบบใช่/ไม่ใช่ ให้คำแนะนำที่อธิบายบริบทการประเมินและระดับความเข้มงวด และโมเดลจะส่งคะแนนความปลอดภัยที่ปรับให้เหมาะสมจากโทเค็นเดียว ดังนั้น เช็คพอยต์เดียวกันจึงสามารถกรองเครื่องมือวิจัยด้านความปลอดภัยของเครือข่ายและแพลตฟอร์มสุขภาพจิตตามมาตรฐานที่แตกต่างกันโดยไม่ต้องมีการเปลี่ยนแปลง
การเปิดตัวครั้งนี้มาพร้อมกับการจัดทำเอกสารที่ไม่ธรรมดา สำหรับโมเดลขนาดเล็ก: รายงานทางเทคนิคบน arXiv ที่อธิบายสูตรการฝึกอบรมและการประเมิน (โพสต์เมื่อวันที่ 28 กรกฎาคม 2026) รวมถึง การ์ดโมเดลในเอกสารของมิสทรัล และน้ำหนักของโมเดลเอง ซึ่งถูกปล่อยออกมาเมื่อวันที่ 4 สิงหาคม
วิธีการที่ชิลด์สทรัลอ่านนโยบายแทนการจำ
กลไกที่อธิบายไว้ในรายงานทางเทคนิค ลดงานดูแลทุกอย่างลงเป็นการถามคำถามแบบทวินาม แต่ละคำร้องประกอบด้วยสามส่วน: ฟิลด์ <Instruct> ที่มีบริบทการประเมินและระดับความเข้มงวด ฟิลด์ <Query> ที่มีคำถามใช่/ไม่ใช่ เช่น “ข้อความนี้ส่งเสริมความรุนแรงทางกายหรือไม่?” และฟิลด์ <Document> ที่มีข้อความที่ต้องตัดสิน ซึ่งอาจเป็นพรอมต์ การตอบกลับ คู่พรอมต์-การตอบกลับ หรือรูปภาพพร้อมข้อความที่ไม่จำเป็น ในการอนุมาน โมเดลจะอ่านเพียงลอจิตสำหรับโทเค็น “ใช่” และ “ไม่” และปรับให้เหมาะสมด้วยซอฟต์แม็กซ์เป็นคะแนนต่อเนื่อง โดยมีเกณฑ์ที่ 0.5 สำหรับการตัดสินแบบทวินาม
การกำหนดรูปแบบนี้ทำให้เช็คพอยต์เดียวสามารถดูดซับ分类พรอมต์ การดูแลการตอบกลับ การตรวจจับการปฏิเสธ และการตรวจจับความเป็นอันตรายเป็นกรณีของปัญหาเดียวกัน ชิลด์สทรัลสร้างขึ้นบนโมเดลมัลติมีเดียขนาดเล็กของมิสทรัล โดยมี Pixtral วิชั่นเอนคอเดอร์สำหรับการรับเข้ารูปภาพ และการ์ดโมเดลระบุบริบทการฝึกอบรม 32k-โทเค็น
กลยุทธ์การฝึกอบรมข้อมูลเป็นจุดที่มิสทรัลอ้างว่าได้รับการฟื้นฟูจากข้อเสียของขนาด โครงการรายงานประมาณ 54.1 ล้านตัวอย่างการฝึกอบรมที่รวบรวมจากชุดข้อมูลความปลอดภัยสาธารณะที่มีระบบการจำแนกประเภทที่ขัดแย้งกัน โดยแต่ละตัวอย่างถูกแปลงเป็นรูปแบบคำแนะนำ-คำถาม-เอกสารเดียวกัน โดยใช้เทมเพลตที่เขียนใหม่และปรับให้เหมาะสมกับความเข้มงวดสำหรับแต่ละชุดข้อมูล เพื่อสอนให้โมเดลแยกแยะความแตกต่างมากกว่าการจำหมวดหมู่ มิสทรัลสร้างคู่คอนทราสต์ โดยใช้ LLM ที่เขียนข้อความที่ปลอดภัยใหม่เพื่อฝ่าฝืนนโยบายหนึ่ง ในขณะที่หลีกเลี่ยงนโยบายที่เกี่ยวข้องอย่างใกล้ชิด ดังนั้น โมเดลจึงเรียนรู้ว่าข้อความใดละเมิดกฎใดบ้าง จุดเช็คสุดท้ายรวม LoRA ฟاین-ทูนสามตัวผ่านการอินเตอร์โปเลตสเฟียร์ หนึ่งปรับให้เหมาะสมกับข้อมูลสาธารณะ หนึ่งเพิ่มข้อมูลการจำแนกนโยบายที่สร้างขึ้น และโมเดลคำแนะนำฐานสำหรับการปฏิบัติตามคำแนะนำทั่วไป
สิ่งที่การประเมินวัด
มิสทรัลประเมินชิลด์สทรัลเทียบกับโมเดลเปิด 10 โมเดลทั่ว 16 บンチมาร์ก โดยที่ทุกตัวอย่างการประเมินถูกแยกออกจากการฝึกอบรม ผลลัพธ์สำคัญที่รายงานในรายงานทางเทคนิค:
- 84.9% F1 เฉลี่ย บนบンチมาร์กความปลอดภัยของข้อความ โดยเทียบเท่ากับ GPT-OSS-Safeguard-20B ที่ใหญ่กว่ามาก และได้อันดับหนึ่งโดยรวมในหมู่โมเดลที่มีพารามิเตอร์ 4B ถึง 20B
- 83.8% F1 เฉลี่ย บนบンチมาร์กความปลอดภัยแบบหลายรูปแบบ โดยนำหน้า OmniGuard-7B ที่ 77.6% และเป็นผู้นำในสองในสามบンチมาร์กความปลอดภัยของรูปภาพ
- 91.3% F1 ในการประเมินความสามารถในการปรับให้เข้ากับนโยบาย โดยเทียบกับ 94.1% ของ GPT-OSS-Safeguard-20B ซึ่งสร้างการให้เหตุผลที่ยาวก่อนการตอบแทนที่จะตอบด้วยโทเค็นเดียว
- ~54.1M ตัวอย่างการฝึกอบรม: 45.2M ข้อความสาธารณะ 4.4M ข้อความสังเคราะห์แบบคอนทราสต์ และ 4.5M ตัวอย่างหลายรูปแบบ
สิ่งเหล่านี้เป็นตัวเลขที่รายงานโดยผู้ขาย ซึ่งวัดโดยมิสทรัลบนบンチมาร์กที่มิสทรัลเลือก สองตัวเลือกการออกแบบในรายงานที่ควรทราบเมื่อ đọcพวกมัน: การประเมินความสามารถในการปรับให้เข้ากับนโยบายใช้ระบบการจำแนกประเภทที่ตั้งใจจะแตกต่างจากที่ใช้ในการฝึกอบรม ซึ่งสร้างและตรวจสอบโดย LLM ที่แตกต่างจากข้อมูลการฝึกอบรม ดังนั้นคะแนนจึงไม่สามารถมอบให้กับหมวดหมู่ที่จำได้ และในเรื่องการจำแนกพรอมต์แบบหลายภาษา แผนภูมิในภาคผนวกของรายงานแสดงให้เห็นว่าชิลด์สทรัลตามหลังหลายโมเดลฐานในภาษาอาหรับและอินโดนีเซีย โดยมิสทรัลเน้นถึงการครอบคลุมภาษาที่ไม่เท่าเทียมกันเป็นข้อจำกัดที่ระบุไว้
มิสทรัล พาสที่สองในการดูแล โดยเปิดเผยครั้งนี้
ชิลด์สทรัลเป็นโมเดลการดูแลครั้งที่สามของมิสทรัล ต่อจาก API การดูแลเนื้อหาที่โฮสต์ไว้สองตัว และเป็นครั้งแรกที่ปล่อยน้ำหนักแบบเปิด นั้น API การดูแลเนื้อหาที่โฮสต์ครั้งแรก ซึ่งเปิดตัวเมื่อวันที่ 7 พฤศจิกายน 2024 เป็นคลาสสิฟายเออร์ข้อความที่โฮสต์ไว้ ซึ่งครอบคลุมหมวดหมู่อันตรายที่ตายตัว 9 หมวดหมู่ทั่ว 11 ภาษา ระบบเดียวกับที่ดูแล Le Chat โมเดลที่โฮสต์ไว้ครั้งที่สองตามมา แต่ไม่มีการปล่อยน้ำหนัก ชิลด์สทรัลกลับด้าน: หมวดหมู่ไม่ตายตัวอีกต่อไป นโยบายเดินทางพร้อมคำร้อง และโมเดลเองสามารถดาวน์โหลดได้
การเปิดตัวครั้งนี้ยังดำเนินการต่อการปล่อยโมเดลขนาดเล็กจากห้องปฏิบัติการในกรุงปารีสที่สร้างขึ้นบนโมเดลมินิสทรัล 3 ซึ่งเป็นไลน์ที่มุ่งเน้นไปที่การปรับใช้ที่ไม่จำเป็นต้องมีโมเดลรุ่นล่าสุด มิสทรัลปล่อยชิลด์สทรัลเป็นสมาชิกผู้ก่อตั้งของ Open Secure AI Alliance ร่วมกับ NVIDIA (NVDA ) และองค์กรอื่นๆ และบริษัทระบุว่าฝึกโมเดลนี้จากตั้งแต่ต้นบน Forge ซึ่งเป็นแพลตฟอร์มฝึกอบรมและประเมินแบบกำหนดเอง
แผนการทำงานที่ระบุไว้ของมิสทรัลสำหรับโมเดลนี้ชี้ไปที่การครอบคลุมหลายภาษา ความแข็งแกร่งของเอกสารที่ยาวขึ้น และความปลอดภัยแบบหลายรูปแบบที่กว้างขึ้นเป็นพื้นที่การทำงานต่อไป ในการออกแบบชิลด์สทรัล นโยบายอาศัยอยู่ในฟิลด์ <Query> ของคำร้องแต่ละครั้ง แทนที่จะอยู่ในน้ำหนักของโมเดล












