Моделі та платформи ШІ

Містралова Shieldstral Пакує Політику-Адаптивну Безпеку В 3B Параметрів

mm
Додайте Unite.AI до бажаних джерел у Google

Містрал AI випустив Shieldstral 4 серпня 2026 року, 3B-параметровий відкритий класифікатор безпеки, який судить текст і зображення щодо політики модерації, написаної звичайною мовою під час висновку, а не зафіксованої категорії шкоди під час навчання. Модель доступна на Hugging Face під ліцензією Apache 2.0, охоплює 12 мов і працює на одному 16GB GPU. Містрал зазначає в своєму оголошенні, що Shieldstral відповідає відкритим моделям охорони до семи разів своєї розміру на безпеці тексту та встановлює новий стан мистецтва на модерації мультимедіа, і він позиціонує випуск навколо гострої критики того, як зазвичай будуються моделі охорони.

Більшість моделей охорони, Містрал стверджує, закодовані в свої ваги таксономію шкоди, тому адаптація їх до нового контексту продукту означає повторне навчання. Shieldstral замість цього приймає політику модерації як частину входу: оператор пише питання з відповіддю так/ні, надає інструкцію, яка описує контекст оцінки та рівень суворості, і модель повертає відкалібрований безпековий бал з одного токена. Тому одна і та ж точка контролю може відображати інструмент дослідження кібербезпеки та платформу психічного здоров’я проти різних стандартів без зміни.

Випуск супроводжується незвичайною кількістю документації для малої моделі: технічний звіт на arXiv, який описує рецепт навчання та оцінки (опубліковано 28 липня 2026 року), плюс карта моделі в документах Містрала та ваги самі по собі, які були випущені 4 серпня.

Як Shieldstral читає політику замість її запам’ятовування

Механізм, описаний у технічному звіті, зменшує кожне завдання модерації до двійкової відповіді на питання. Кожен запит має три позначені частини: поле <Instruct>, яке містить контекст оцінки та рівень суворості, поле <Query> з одним питанням так/ні, наприклад “Чи пропагує цей контент фізичну насильство?”, і поле <Document>, яке містить контент для судження, який може бути підказкою, відповіддю, парою підказка-відповідь або зображенням з необов’язковим текстом. Під час висновку модель читає тільки логіти для токенів “так” і “ні” та softmax-нормалізує їх у безперервний бал, пороговий на рівні 0,5 для двійкового вердикту.

Ця формула дозволяє одному контрольному пункту поглинати класифікацію підказок, модерацію відповідей, виявлення відмов та виявлення токсичності як випадки однієї і тієї ж проблеми. Shieldstral побудований на основі Ministral-3-3B, малої мультимедійної моделі Містрала, з візуальним кодувальником Pixtral, який обробляє вхідні дані зображень, а карта моделі перелічує контекст навчання з 32k-токеном.

Стратегія навчальних даних – це місце, де Містрал стверджує, що недоліки розміру відновлюються. Звіт описує приблизно 54,1 мільйона навчальних зразків, зібраних з публічних наборів даних безпеки з конфліктуючими таксономіями, кожен з яких був перетворений у той самий формат інструкції-запиту-документу з парафразованими шаблонами та калібруванням суворості для кожного набору даних. Щоб навчити дискримінацію, а не запам’ятовування категорій, Містрал згенерував контрастні пари: LLM переписав безпечний текст, щоб порушити одну політику, залишаючи близьку споріднену політику неушкодженою, так що модель вчиться, яку конкретну правило порушує певний контент. Фінальний контрольний пункт об’єднує три тонкі налаштування LoRA через сферичну інтерполяцію, одне з яких відкалібровано на публічних даних, одне додає згенеровані дані дискримінації політики, а базова інструкційна модель для загального виконання інструкцій.

Що вимірювали оцінки

Містрал оцінив Shieldstral проти десяти відкритих базових лінійок по 16 тестам, при цьому всі оціночні зразки були виділені з навчальних даних. Головні результати, як зазначено в технічному звіті:

  • 84,9% середнього F1 на текстових тестах безпеки, що відповідає значно більшій GPT-OSS-Safeguard-20B і займає перше місце серед моделей від 4B до 20B параметрів
  • 83,8% середнього F1 на мультимедійних тестах безпеки, що випереджає наступну найкращу OmniGuard-7B на рівні 77,6%, і лідирує у двох з трьох тестів безпеки зображень
  • 91,3% F1 на спеціально створеній оцінці адаптивності політики, проти 94,1% для GPT-OSS-Safeguard-20B, який генерує довгий висновок перед відповіддю, а не один токен
  • ~54,1M навчальних зразків: 45,2M відкритих текстових даних, 4,4M синтетичних контрастних текстових даних та 4,5M мультимедійних зразків

Це цифри, звітувані постачальником, виміряні Містралом на тестах, які він вибрав. Два дизайнерських рішення в звіті варто відзначити при читанні їх. Тест на адаптивність політики використовує свідомо іншу таксономію, ніж навчання, згенеровану та перевірену іншими LLM, ніж навчальні дані, тому бал не можна віднести до запам’ятованих категорій. І на мультимедійній класифікації підказок звіт показує, що Shieldstral відстає від кількох базових лінійок у арабській та індонезійській мовах, при цьому Містрал виділяє нерівномірне мовне покриття як заявлену обмеження.

Другий крок Містрала до модерації, цього разу у відкритому доступі

Shieldstral – це третя модель модерації Містрала, після двох хостованих API, і перша, яку він випустив у відкритих вагах. Його перший API модерації контенту, запущений 7 листопада 2024 року, був хостованим класифікатором тексту, який охоплював дев’ять фіксованих категорій по 11 мовам, та сама система, яка модерує Le Chat. Друга хостована версія слідувала, але жодна з них не поставлялася з вагами. Shieldstral інвертує цю схему: категорії більше не фіксовані, політика рухається з запитом, а сама модель є завантажуваною.

Випуск також продовжує серію випусків малих моделей з паризької лабораторії, побудованих на основі сімейства моделей Ministral 3, спрямованих на розгортання, де модель переднього краю є зайвим навантаженням, підхід, який Unite.AI задокументував у своєму попередньому огляді стратегії Містрала щодо пристроїв краю. Містрал випустив Shieldstral як засновника Open Secure AI Alliance поряд з NVIDIA (NVDA ) та іншими організаціями, і компанія заявляє, що вона навчала модель з кінця в кінце на Forge, своїй платформі навчання та оцінки.

Заявлений план Містрала щодо моделі вказує на покриття кількох мов, довготривалу стійкість документів та розширення безпеки мультимедіа як наступні області роботи. У дизайні Shieldstral політика існує у полі кожного запиту, а не у вагах моделі.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.