Модели и платформы ИИ
Релиз Shieldstral от Mistral: 3-миллиардный параметр безопасности для классификации политики

4 августа 2026 года компания Mistral AI представила Shieldstral, классификатор безопасности с открытыми весами и 3 миллиардами параметров, который оценивает текст и изображения по политикам модерации, написанным на простом языке, а не по фиксированному набору категорий вреда, заданных во время обучения. Модель доступна на Hugging Face под лицензией Apache 2.0, поддерживает 12 языков и может работать на одной видеокарте с 16 ГБ памяти. В своем объявлении Mistral утверждает, что Shieldstral по своим возможностям соответствует открытым моделям безопасности, размер которых в 7 раз больше, и устанавливает новый уровень качества в области модерации мультимедийного контента, а также критикует традиционный подход к построению моделей безопасности.
Большинство моделей безопасности, по мнению Mistral, имеют встроенную taksonomiyu категорий вреда, что требует их переподготовки при изменении контекста применения. Shieldstral же принимает политику модерации в качестве части входных данных: оператор задает вопрос с ответом “да” или “нет”, предоставляет инструкцию, описывающую контекст и уровень строгости оценки, и модель возвращает калиброванный показатель безопасности на основе одного токена. Таким образом, одна и та же модель может оценивать безопасность как инструментов для исследований в области кибербезопасности, так и платформ для поддержки психического здоровья, не требуя модификаций.
Выпуск Shieldstral сопровождается необычно большим количеством документации для модели такого размера: технический отчет на arXiv, в котором описана методика обучения и оценка модели (опубликован 28 июля 2026 года), а также карта модели в документации Mistral и сами веса, которые были выпущены 4 августа.
Как Shieldstral читает политику вместо того, чтобы запоминать ее
Механизм, описанный в техническом отчете, сводит каждую задачу модерации к бинарному вопросу. Каждый запрос состоит из трех помеченных частей: поля <Instruct>, содержащего контекст и уровень строгости оценки, поля <Query> с вопросом “да/нет”, таким как “Содержит ли этот контент пропаганду физического насилия?”, и поля <Document>, содержащего оцениваемый контент, который может быть текстом, изображением или парой “промпт-ответ”. На этапе вывода модель читает только логиты для токенов “да” и “нет” и нормализует их в непрерывный балл, который затем используется для вынесения бинарного вердикта.
Такая формулировка позволяет одной модели решать задачи классификации промптов, модерации ответов, обнаружения отказов и обнаружения токсичности как разновидности одной и той же проблемы. Shieldstral построен на основе модели Ministral-3-3B от Mistral, с использованием Pixtral в качестве обработчика изображений, и в карте модели указан контекст обучения размером 32 тысяч токенов.
Стратегия сбора данных для обучения – это место, где, по утверждению Mistral, модель компенсирует свое меньший размер. В отчете описано около 54,1 миллиона примеров для обучения, собранных из публичных наборов данных по безопасности с конфликтующими taksonomiyami, каждая из которых была преобразована в один и тот же формат “инструкция-вопрос-документ” с помощью парафразированных шаблонов и калибровки строгости для каждого набора данных. Для обучения модели на различение, а не на запоминание категорий, Mistral сгенерировала контрастные пары: языковая модель переписала безопасный текст так, чтобы он нарушал одну политику, но не нарушал связанную с ней политику, чтобы модель научилась определять, какое именно правило нарушает тот или иной контент. Окончательная модель объединяет три финальных обучения LoRA посредством сферической интерполяции: одно обучение на публичных данных, одно на сгенерированных данных для дискриминации политик, и базовая модель для общего выполнения инструкций.
Что измеряли оценки
Mistral оценила Shieldstral на фоне десяти открытых базовых моделей по 16 тестам, все примеры для оценки были исключены из обучающих данных. Основные результаты, как они представлены в техническом отчете:
- 84,9% средний показатель F1 на тестах безопасности текста, что соответствует результатам модели GPT-OSS-Safeguard-20B, и занимает первое место среди моделей с параметрами от 4 до 20 миллиардов
- 83,8% средний показатель F1 на тестах безопасности мультимедийного контента, опережая модель OmniGuard-7B, которая показала результат 77,6%, и лидирующая на двух из трех тестов безопасности изображений
- 91,3% показатель F1 на специально разработанном тесте адаптивности политики, уступая только модели GPT-OSS-Safeguard-20B с результатом 94,1%, которая генерирует длинный текст рассуждений перед ответом, а не один токен
- ~54,1 миллиона примеров для обучения: 45,2 миллиона открытых текстовых данных, 4,4 миллиона синтетических контрастных текстовых данных и 4,5 миллиона мультимедийных примеров
Это цифры, заявленные разработчиком, измеренные Mistral на выбранных ею тестах. Два аспекта в отчете стоит отметить при их прочтении. Тест на адаптивность политики использует намеренно другую taksonomiyu, сгенерированную и проверенную другими языковыми моделями, чем те, которые использовались для обучения, поэтому результат нельзя объяснить запоминанием категорий. И на тесте классификации промптов на нескольких языках приложение к отчету показывает, что Shieldstral отстает от некоторых базовых моделей на арабском и индонезийском языках, и Mistral отмечает неравномерное языковое покрытие как ограничение.
Второй шаг Mistral в модерации, на этот раз в открытом доступе
Shieldstral – это третья модель модерации от Mistral, после двух предыдущих API, и первая, которую компания выпускает в виде открытых весов. Первый API для модерации контента, запущенный 7 ноября 2024 года, был хостированным классификатором текста, покрывающим девять фиксированных категорий на 11 языках, той же системой, которая модерирует Le Chat. Вторая хостированная версия последовала за ней, но ни одна из них не выпускала веса. Shieldstral меняет эту схему: категории больше не фиксированы, политика передается вместе с запросом, и сама модель доступна для скачивания.
Выпуск продолжает серию выпусков небольших моделей из парижской лаборатории, построенных на основе семейства моделей Ministral 3, ориентированных на применение в ситуациях, когда использование передовой модели неоправданно. Mistral выпустила Shieldstral как одного из основателей Open Secure AI Alliance вместе с NVIDIA (NVDA ) и другими организациями, и заявляет, что обучила модель на своей платформе Forge.
Согласно заявленному плану развития модели, следующими направлениями работы станут расширение поддержки языков, повышение устойчивости к более длинным документам и расширение безопасности мультимедийного контента. В дизайне Shieldstral политика находится в поле <Query> каждого запроса, а не в весах модели.












