AI 모델 및 플랫폼

미스트랄의 Shieldstral, 3B 파라미터로 정책 적응형 안전 필터링 구현

mm
Unite.AI를 Google의 선호 소스에 추가

미스트랄 AI는 2026년 8월 4일, Shieldstral을 출시했습니다. 이는 3B 파라미터 오픈 웨이트 안전 분류기로서, 평문으로 작성된 모더레이션 정책에 따라 텍스트와 이미지를 판단하는 모델입니다. 이는 훈련 과정에서 고정된 해로 카테고리를 사용하는 대신, 추론 시간에 정책을 판단합니다. 모델은 Apache 2.0 라이선스 하에 Hugging Face에서 제공되며, 12개 언어를 지원하며 단일 16GB GPU에서 실행됩니다. 미스트랄은 공식 발표에서 Shieldstral이 오픈 가드 모델과 비교했을 때, 최대 7배 크기의 모델과 비교했을 때 텍스트 안전성에서 84.9%의 평균 F1 점수를 달성했으며, 멀티모달 모더레이션에서 새로운 상태를 달성했다고 밝혔습니다.

대부분의 가드레일 모델은 미스트랄이 주장하듯이, 해로 카테고리의 분류를 모델의 웨이트에 하드코딩합니다. 따라서 새로운 제품 컨텍스트에 적용하기 위해서는 재훈련이 필요합니다. 반면에 Shieldstral은 정책을 입력의 일부로 사용합니다. 즉, 사용자는 예/아니요 질문을 작성하고, 평가 컨텍스트와 엄격성 수준을 설명하는 지침을 제공하며, 모델은 단일 토큰으로부터 안전 점수를 반환합니다. 따라서 동일한 체크포인트는 사이버 보안 연구 도구와 정신 건강 플랫폼을 다른 표준으로 평가할 수 있습니다.

소형 모델로서는 이례적으로 풍부한 문서가 함께 공개됐다. 기술 보고서는 훈련 레시피와 평가를 설명하며, 모델 카드는 미스트랄의 문서에 있습니다. 모델의 웨이트는 2026년 8월 4일에 공개되었습니다.

Shieldstral이 정책을 기억하는 대신 어떻게 읽는가

기술 보고서에 설명된 메커니즘은 모든 모더레이션 작업을 이진 질문 응답으로 줄입니다. 각 요청에는 세 개의 태그가 있는 부분이 있습니다. <Instruct> 필드는 평가 맥락과 엄격성 수준을 담고, <Query> 필드는 예/아니요 질문을 포함하며, <Document> 필드는 판단할 콘텐츠를 포함합니다. 추론 시 모델은 “예”와 “아니요” 토큰의 로짓만 읽으며, 소프트맥스 정규화를 통해 연속적인 점수로 변환하고, 0.5를 기준으로 이진 판단을 내립니다.

이 형식은 하나의 체크포인트가 프롬프트 분류, 응답 모더레이션, 거부 탐지, 유독성 탐지를 동일한 문제의 인스턴스로 흡수하도록 허용합니다. Shieldstral은 Ministral-3-3B에 기반하며, Pixtral 비전 인코더가 이미지 입력을 처리합니다. 모델 카드는 32k토큰의 훈련 컨텍스트를 나열합니다.

미스트랄은 훈련 데이터 전략에서 크기 불리함을 회복한다고 주장합니다. 보고서는 약 5,410만 개의 훈련 샘플을 설명하며, 이는 공공 안전 데이터셋에서 갈등하는 분류를 갖는 샘플을 수집하여 동일한 지침-질문-문서 형식으로 변환한 것입니다. 모델이 분류를 기억하는 대신 차별화를 배우도록 하기 위해, 미스트랄은 대조적 쌍을 생성했습니다. 즉, 안전한 텍스트를 정책을 위반하도록 다시 작성하여, 모델이 콘텐츠가 어떤 규칙을 위반하는지 학습하도록 합니다. 최종 체크포인트는 세 개의 LoRA 파인튜닝을 구형 보간법으로 결합합니다.

평가에서 측정한 내용

미스트랄은 Shieldstral을 10개의 오픈 베이스라인과 비교했으며, 16개의 벤치마크에서 평가했습니다. 기술 보고서에 따르면, 주요 결과는 다음과 같습니다.

  • 84.9% 평균 F1를 기록해 훨씬 큰 GPT-OSS-Safeguard-20B와 대등한 결과를 보였으며, 40억~200억 매개변수 모델들을 비교한 텍스트 안전성 평가에서 종합 1위를 차지했다.
  • 83.8% 평균 F1를 달성하여, 멀티모달 안전성에서 최고의 성능을 보였습니다.
  • 91.3% F1를 달성하여, 정책 적응성 평가에서 최고의 성능을 보였습니다.
  • 약 5,410만 개의 훈련 샘플을 사용하여, 4,520만 개의 오픈소스 텍스트, 440만 개의 합성 대조적 텍스트, 450만 개의 멀티모달 샘플을 포함했습니다.

이러한 결과는 벤더가 보고한 수치이며, 미스트랄이 선택한 벤치마크에서 측정되었습니다. 보고서에서 두 가지 설계 선택이 주목할 만합니다. 적응성 평가에서는 훈련 데이터와 다른 분류를 사용하여, 점수가 기억된 카테고리에 기인하지 않는다고 할 수 있습니다. 또한, 다국어 프롬프트 분류에서, 보고서의 부록은 Shieldstral이 아랍어와 인도네시아어에서 다른 베이스라인보다 뒤처짐을 보여주며, 미스트랄은 언어 커버리지가 부족한 것을 한계점으로 지적했습니다.

미스트랄의 두 번째 모더레이션 시도, 공개 버전

Shieldstral은 미스트랄의 세 번째 모더레이션 모델이며, 첫 번째 오픈 웨이트 모델입니다. 첫 번째 콘텐츠 모더레이션 API는 2024년 11월 7일에 출시되었으며, 11개 언어에 걸쳐 9개의 고정 카테고리를 포함하는 호스팅된 텍스트 분류기였습니다. 두 번째 호스팅 버전이 뒤따랐지만, 두 모델 모두 웨이트를 제공하지 않았습니다. Shieldstral은 이러한 설정을 뒤집었습니다. 즉, 카테고리가 더 이상 고정되지 않으며, 정책이 요청과 함께 전송되며, 모델 자체가 다운로드할 수 있습니다.

이 출시로 미스트랄은 Ministral 3 패밀리 기반의 작은 모델을 연속적으로 출시하고 있습니다. 이는 에지 디바이스에 대한 전략의 일부입니다. 미스트랄은 Shieldstral을 NVIDIA (NVDA ) 와 다른 조직과 함께 오픈 시큐어 AI 얼라이언스의 초대 멤버로 출시했습니다. 미스트랄은 모델을 Forge라는 커스텀 트레이닝 및 평가 플랫폼에서 엔드투엔드로 훈련했다고 밝혔습니다.

미스트랄이 밝힌 다음 과제는 다국어 지원, 긴 문서에 대한 안정성, 더 폭넓은 멀티모달 안전성이다. Shieldstral에서는 정책이 모델 가중치가 아니라 각 요청의 <Query> 필드에 저장됩니다.

원문 기사의 출처: mistral.ai [1] · unite.ai [2]

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.