Mô hình và nền tảng AI
Bộ Shieldstral của Mistral Đóng Gói An Toàn Tương Thích Chính Sách Vào 3B Thông Số

Mistral AI đã phát hành Shieldstral vào ngày 4 tháng 8 năm 2026, một bộ phân loại an toàn mở 3B thông số, đánh giá văn bản và hình ảnh chống lại các chính sách kiểm duyệt được viết bằng ngôn ngữ tự nhiên tại thời điểm suy luận, chứ không phải là một tập hợp cố định các danh mục gây hại được mã hóa trong quá trình đào tạo. Mô hình này có sẵn trên Hugging Face theo giấy phép Apache 2.0, bao gồm 12 ngôn ngữ và chạy trên một GPU 16GB đơn. Mistral cho biết trong thông báo của mình rằng Shieldstral khớp với các mô hình bảo vệ mở lên đến bảy lần kích thước của nó về an toàn văn bản và thiết lập một trạng thái mới về nghệ thuật trong kiểm duyệt đa phương tiện, và nó đặt ra việc phát hành xung quanh một lời chỉ trích sắc nét về cách các mô hình bảo vệ thường được xây dựng.
Hầu hết các mô hình bảo vệ, Mistral lập luận, mã hóa cứng một phân loại các danh mục gây hại vào trọng số của chúng, vì vậy việc thích nghi chúng với một ngữ cảnh sản phẩm mới có nghĩa là đào tạo lại. Shieldstral thay vào đó lấy chính sách kiểm duyệt làm một phần của đầu vào: người vận hành viết một câu hỏi có/không, cung cấp một hướng dẫn mô tả ngữ cảnh đánh giá và mức độ nghiêm ngặt, và mô hình trả về một điểm số an toàn được hiệu chỉnh từ một token duy nhất. Do đó, cùng một điểm kiểm tra có thể lọc một công cụ nghiên cứu an ninh mạng và một nền tảng sức khỏe tâm lý chống lại các tiêu chuẩn khác nhau mà không cần sửa đổi.
Phát hành này đi kèm với một lượng tài liệu không thường thấy đối với một mô hình nhỏ: một báo cáo kỹ thuật trên arXiv mô tả công thức đào tạo và đánh giá (đăng ngày 28 tháng 7 năm 2026), cộng với một thẻ mô hình trong tài liệu của Mistral và chính trọng số, cả hai đều được phát hành vào ngày 4 tháng 8.
Shieldstral đọc một chính sách thay vì ghi nhớ một chính sách
Cơ chế, được trình bày trong báo cáo kỹ thuật, giảm mọi nhiệm vụ kiểm duyệt xuống thành trả lời câu hỏi nhị phân. Mỗi yêu cầu có ba phần được gắn thẻ: một trường <Instruct> mang ngữ cảnh đánh giá và mức độ nghiêm ngặt, một trường <Query> với một câu hỏi có/không như “Nội dung này có thúc đẩy bạo lực thể xác không?”, và một trường <Document> giữ nội dung để đánh giá, có thể là một lời nhắc, một phản hồi, một cặp lời nhắc-phản hồi hoặc một hình ảnh với văn bản tùy chọn. Tại thời điểm suy luận, mô hình chỉ đọc các logits cho các token “có” và “không” và chuẩn hóa softmax chúng thành một điểm số liên tục, ngưỡng tại 0,5 cho một phán quyết nhị phân.
Định dạng đó cho phép một điểm kiểm tra hấp thụ phân loại lời nhắc, kiểm duyệt phản hồi, phát hiện từ chối và phát hiện độc tính như các trường hợp của cùng một vấn đề. Shieldstral được xây dựng trên Ministral-3-3B, mô hình đa phương tiện nhỏ của Mistral, với một bộ mã hóa tầm nhìn Pixtral xử lý đầu vào hình ảnh, và thẻ mô hình liệt kê một ngữ cảnh đào tạo 32k-token.
Chiến lược dữ liệu đào tạo là nơi Mistral tuyên bố rằng bất lợi về kích thước được thu hồi. Báo cáo mô tả khoảng 54,1 triệu mẫu đào tạo được thu thập từ các tập dữ liệu an toàn công khai với các phân loại mâu thuẫn, mỗi tập được chuyển đổi thành cùng một định dạng hướng dẫn-câu hỏi-tài liệu với các mẫu được viết lại và hiệu chỉnh nghiêm ngặt theo từng tập dữ liệu. Để dạy sự phân biệt chứ không phải ghi nhớ danh mục, Mistral đã tạo ra các cặp tương phản: một mô hình ngôn ngữ lớn đã viết lại văn bản an toàn để vi phạm một chính sách trong khi giữ cho một chính sách liên quan chặt chẽ, vì vậy mô hình học được quy tắc cụ thể mà một mảnh nội dung vi phạm. Điểm kiểm tra cuối cùng hợp nhất ba lần tinh chỉnh LoRA qua nội suy hình cầu, một lần được hiệu chỉnh trên dữ liệu công khai, một lần thêm dữ liệu phân biệt chính sách được tạo, và mô hình hướng dẫn cơ sở cho việc tuân theo hướng dẫn chung.
Đánh giá đo lường những gì
Mistral đã đánh giá Shieldstral chống lại mười mô hình cơ sở mở trên 16 điểm chuẩn, với tất cả các mẫu đánh giá được giữ lại từ đào tạo. Kết quả tiêu đề, như được báo cáo trong báo cáo kỹ thuật:
- 84,9% điểm F1 trung bình trên các điểm chuẩn an toàn văn bản, khớp với GPT-OSS-Safeguard-20B lớn hơn nhiều và đứng đầu chung trong số các mô hình từ 4B đến 20B thông số
- 83,8% điểm F1 trung bình trên các điểm chuẩn an toàn đa phương tiện, dẫn trước OmniGuard-7B ở mức 77,6%, và dẫn đầu hai trong số ba điểm chuẩn an toàn hình ảnh
- 91,3% điểm F1 trên một đánh giá khả năng thích ứng chính sách được xây dựng, so với 94,1% của GPT-OSS-Safeguard-20B, mô hình này tạo ra một dấu vết lý luận dài trước khi trả lời chứ không phải một token duy nhất
- khoảng 54,1 triệu mẫu đào tạo: 45,2 triệu văn bản nguồn mở, 4,4 triệu văn bản tương phản tổng hợp và 4,5 triệu mẫu đa phương tiện
Đây là những con số được báo cáo bởi nhà cung cấp, được Mistral đo lường trên các điểm chuẩn mà nó đã chọn. Hai lựa chọn thiết kế trong báo cáo đáng được lưu ý khi đọc chúng. Đánh giá khả năng thích ứng sử dụng một phân loại khác với đào tạo, được tạo và xác minh bởi các mô hình ngôn ngữ lớn khác với dữ liệu đào tạo, vì vậy điểm số không thể được quy cho các danh mục đã ghi nhớ. Và trên phân loại lời nhắc đa ngôn ngữ, phụ lục của báo cáo cho thấy Shieldstral tụt lại sau một số mô hình cơ sở trong tiếng Ả Rập và tiếng Indonesia, với Mistral đánh dấu sự bao phủ ngôn ngữ không đồng đều là một hạn chế được tuyên bố.
Lần thứ hai của Mistral trong kiểm duyệt, lần này là công khai
Shieldstral là mô hình kiểm duyệt thứ ba của Mistral, sau hai API được lưu trữ, và là mô hình đầu tiên nó đã phát hành dưới dạng trọng số mở. API kiểm duyệt nội dung đầu tiên của nó, được ra mắt vào ngày 7 tháng 11 năm 2024, là một phân loại văn bản được lưu trữ bao gồm chín danh mục cố định trên 11 ngôn ngữ, cùng hệ thống kiểm duyệt Le Chat. Một phiên bản lưu trữ thứ hai đã theo sau, nhưng không có trọng số nào được gửi. Shieldstral đảo ngược sắp xếp đó: các danh mục không còn cố định, chính sách đi cùng với yêu cầu, và mô hình chính nó có thể được tải xuống.
Phát hành này cũng tiếp tục một loạt các mô hình nhỏ được phát hành từ phòng thí nghiệm Paris được xây dựng trên dòng mô hình Ministral 3, một dòng nhằm vào các triển khai mà một mô hình tiền phong không cần thiết, cách tiếp cận Unite.AI đã ghi lại trong bài viết trước của nó về chiến lược thiết bị cạnh của Mistral. Mistral đã phát hành Shieldstral như một thành viên sáng lập của Liên minh An toàn AI Mở cùng với NVIDIA (NVDA ) và các tổ chức khác, và công ty cho biết nó đã đào tạo mô hình từ đầu đến cuối trên Forge, nền tảng đào tạo và đánh giá tùy chỉnh của mình.
Con đường được tuyên bố của Mistral cho mô hình này chỉ đến phạm vi đa ngôn ngữ, độ mạnh của tài liệu dài hơn và an toàn đa phương tiện rộng hơn là các lĩnh vực làm việc tiếp theo. Trong thiết kế của Shieldstral, chính sách sống trong trường <Query> của mỗi yêu cầu thay vì trong trọng số của mô hình.












