AI 모델 및 플랫폼
미스트랄의 Shieldstral, 3B 파라미터로 정책 적응형 안전 필터링 구현

미스트랄 AI는 2026년 8월 4일, Shieldstral을 출시했습니다. 이는 3B 파라미터 오픈 웨이트 안전 분류기로서, 평문으로 작성된 모더레이션 정책에 따라 텍스트와 이미지를 판단하는 모델입니다. 이는 훈련 과정에서 고정된 해로 카테고리를 사용하는 대신, 추론 시간에 정책을 판단합니다. 모델은 Apache 2.0 라이선스 하에 Hugging Face에서 제공되며, 12개 언어를 지원하며 단일 16GB GPU에서 실행됩니다. 미스트랄은 공식 발표에서 Shieldstral이 오픈 가드 모델과 비교했을 때, 최대 7배 크기의 모델과 비교했을 때 텍스트 안전성에서 84.9%의 평균 F1 점수를 달성했으며, 멀티모달 모더레이션에서 새로운 상태를 달성했다고 밝혔습니다.
대부분의 가드레일 모델은 미스트랄이 주장하듯이, 해로 카테고리의 분류를 모델의 웨이트에 하드코딩합니다. 따라서 새로운 제품 컨텍스트에 적용하기 위해서는 재훈련이 필요합니다. 반면에 Shieldstral은 정책을 입력의 일부로 사용합니다. 즉, 사용자는 예/아니요 질문을 작성하고, 평가 컨텍스트와 엄격성 수준을 설명하는 지침을 제공하며, 모델은 단일 토큰으로부터 안전 점수를 반환합니다. 따라서 동일한 체크포인트는 사이버 보안 연구 도구와 정신 건강 플랫폼을 다른 표준으로 평가할 수 있습니다.
이 모델은 작은 모델에 비해异常적으로 많은 문서와 함께 출시되었습니다. 기술 보고서는 훈련 레시피와 평가를 설명하며, 모델 카드는 미스트랄의 문서에 있습니다. 모델의 웨이트는 2026년 8월 4일에 공개되었습니다.
Shieldstral이 정책을 기억하는 대신 어떻게 읽는가
기술 보고서에 설명된 메커니즘은 모든 모더레이션 작업을 이진 질문 응답으로 줄입니다. 각 요청에는 세 개의 태그가 있는 부분이 있습니다. <Instruct> 필드는 평가 컨텍스트와 엄격성 수준을携带하며, <Query> 필드는 예/아니요 질문을 포함하며, <Document> 필드는 판단할 콘텐츠를 포함합니다. 추론 시 모델은 “예”와 “아니요” 토큰의 로짓만 읽으며, 소프트맥스 정규화를 통해 연속적인 점수로 변환하고, 0.5를 기준으로 이진 판단을 내립니다.
이 형식은 하나의 체크포인트가 프롬프트 분류, 응답 모더레이션, 거부 탐지, 유독성 탐지를 동일한 문제의 인스턴스로 흡수하도록 허용합니다. Shieldstral은 Ministral-3-3B에 기반하며, Pixtral 비전 인코더가 이미지 입력을 처리합니다. 모델 카드는 32k토큰의 훈련 컨텍스트를 나열합니다.
미스트랄은 훈련 데이터 전략에서 크기 불리함을 회복한다고 주장합니다. 보고서는 약 5,410만 개의 훈련 샘플을 설명하며, 이는 공공 안전 데이터셋에서 갈등하는 분류를 갖는 샘플을 수집하여 동일한 지침-질문-문서 형식으로 변환한 것입니다. 모델이 분류를 기억하는 대신 차별화를 배우도록 하기 위해, 미스트랄은 대조적 쌍을 생성했습니다. 즉, 안전한 텍스트를 정책을 위반하도록 다시 작성하여, 모델이 콘텐츠가 어떤 규칙을 위반하는지 학습하도록 합니다. 최종 체크포인트는 세 개의 LoRA 파인튜닝을 구형 보간법으로 결합합니다.
평가에서 측정한 내용
미스트랄은 Shieldstral을 10개의 오픈 베이스라인과 비교했으며, 16개의 벤치마크에서 평가했습니다. 기술 보고서에 따르면, 주요 결과는 다음과 같습니다.
- 84.9% 평균 F1를 달성하여, 4B에서 20B 파라미터의 모델과 비교했을 때 텍스트 안전성에서最高의 성능을 보였습니다.
- 83.8% 평균 F1를 달성하여, 멀티모달 안전성에서 최고의 성능을 보였습니다.
- 91.3% F1를 달성하여, 정책 적응성 평가에서 최고의 성능을 보였습니다.
- 약 5,410만 개의 훈련 샘플을 사용하여, 4,520만 개의 오픈소스 텍스트, 440만 개의 합성 대조적 텍스트, 450만 개의 멀티모달 샘플을 포함했습니다.
이러한 결과는 벤더가 보고한 수치이며, 미스트랄이 선택한 벤치마크에서 측정되었습니다. 보고서에서 두 가지 설계 선택이 주목할 만합니다. 적응성 평가에서는 훈련 데이터와 다른 분류를 사용하여, 점수가 기억된 카테고리에 기인하지 않는다고 할 수 있습니다. 또한, 다국어 프롬프트 분류에서, 보고서의 부록은 Shieldstral이 아랍어와 인도네시아어에서 다른 베이스라인보다 뒤처짐을 보여주며, 미스트랄은 언어 커버리지가 부족한 것을 한계점으로 지적했습니다.
미스트랄의 두 번째 모더레이션 시도, 공개 버전
Shieldstral은 미스트랄의 세 번째 모더레이션 모델이며, 첫 번째 오픈 웨이트 모델입니다. 첫 번째 콘텐츠 모더레이션 API는 2024년 11월 7일에 출시되었으며, 11개 언어에 걸쳐 9개의 고정 카테고리를 포함하는 호스팅된 텍스트 분류기였습니다. 두 번째 호스팅 버전이 뒤따랐지만, 두 모델 모두 웨이트를 제공하지 않았습니다. Shieldstral은 이러한 설정을 뒤집었습니다. 즉, 카테고리가 더 이상 고정되지 않으며, 정책이 요청과 함께 전송되며, 모델 자체가 다운로드할 수 있습니다.
이 출시로 미스트랄은 Ministral 3 패밀리 기반의 작은 모델을 연속적으로 출시하고 있습니다. 이는 에지 디바이스에 대한 전략의 일부입니다. 미스트랄은 Shieldstral을 NVIDIA와 다른 조직과 함께 오픈 시큐어 AI 얼라이언스의 초대 멤버로 출시했습니다. 미스트랄은 모델을 Forge라는 커스텀 트레이닝 및 평가 플랫폼에서 엔드투엔드로 훈련했다고 밝혔습니다.
미스트랄의 로드맵은 다국어 커버리지, 더 긴 문서의 강건성, 더广泛한 멀티모달 안전성을 다음 작업 영역으로 나타내고 있습니다. Shieldstral의 설계에서 정책은 모델의 웨이트에 저장되지 않고, 각 요청의 <Query> 필드에 저장됩니다.












