AI 模型与平台

Mistral的Shieldstral将政策自适应安全筛查打包到3B参数中

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Mistral AI于2026年8月4日发布了Shieldstral,一种3B参数的开放权重安全分类器,它可以在推理时根据以纯文本形式编写的政策判断文本和图像,而不是在训练期间将固定的有害类别集成到模型中。该模型在Hugging Face上可用,采用Apache 2.0许可证,支持12种语言,并且可以在单个16GB GPU上运行。Mistral 在其公告中表示,Shieldstral与开放式防护模型相比,可以匹配七倍大小的模型,并在多模态审查方面取得了新的最优成果,它将发布围绕对通常构建防护模型的批评进行了阐述。

大多数防护模型,Mistral认为,将有害类别的分类法硬编码到其权重中,因此将它们适应到新的产品环境意味着重新训练。Shieldstral相反,将审查政策作为输入的一部分:操作员编写一个是/否问题,提供一个描述评估上下文和严格性的指令,模型返回一个单个令牌的校准安全评分。因此,同一个检查点可以在不修改的情况下对网络安全研究工具和心理健康平台进行筛查,以满足不同的标准。

该版本带有大量文档,这对于一个小模型来说是罕见的:一份技术报告,发布在arXiv上,描述了训练配方和评估(于2026年7月28日发布),以及Mistral文档中的模型卡,以及权重本身,均于2026年8月4日发布。

Shieldstral如何读取政策而不是记忆它

该机制,如技术报告中所述,将每个审查任务简化为二元问题回答。每个请求都有三个标记的部分:一个<Instruct>字段,携带评估上下文和严格性级别,一个<Query>字段,包含一个是/否问题,例如“此内容是否促进身体暴力?”,以及一个<Document>字段,包含要判断的内容,可以是提示、响应、提示-响应对或带有可选文本的图像。在推理时,模型仅读取“是”和“否”令牌的对数,并将它们softmax归一化为连续评分,以0.5为阈值进行二元判决。

这种公式使得一个检查点可以吸收提示分类、响应审查、拒绝检测和毒性检测作为同一问题的实例。Shieldstral建立在Mistral的小型多模态模型Ministral-3-3B上,具有一个Pixtral视觉编码器处理图像输入,模型卡列出了32k令牌的训练上下文。

训练数据策略是Mistral声称可以弥补尺寸劣势的地方。报告描述了大约5410万个训练样本,从具有冲突分类法的公共安全数据集中组装而成,每个样本都转换为相同的指令-查询-文档格式,使用了重写的模板和每个数据集的严格性校准。为了教授区分而不是类别记忆,Mistral生成了对比性对:一个LLM重写了安全文本以违反一项政策,同时保留了一个密切相关的兄弟政策,因此模型学习了内容违反了哪个特定的规则。最终检查点通过球面插值合并了三个LoRA微调,一个在公共数据上校准,一个添加了生成的政策区分数据,另一个是基本指令模型,用于一般指令跟随。

评估的内容

Mistral评估了Shieldstral与十个开放基线模型的性能,跨越16个基准测试,所有评估样本都未用于训练。技术报告中报道的主要结果是:

  • 84.9%的平均F1,在文本安全基准测试中,与20B参数的GPT-OSS-Safeguard匹配,并在4B至20B参数的模型中排名第一
  • 83.8%的平均F1,在多模态安全基准测试中,领先于次优的OmniGuard-7B(77.6%),并在三个图像安全基准测试中领先两项
  • 91.3%的F1,在专门设计的政策自适应性评估中,低于GPT-OSS-Safeguard-20B(94.1%),后者在回答之前会生成长推理跟踪,而不是单个令牌
  • 约5410万个训练样本:4520万开源文本,440万合成对比文本和450万多模态样本

这些是供应商报告的数字,由Mistral在其选择的基准测试中测量。报告中有两个值得注意的设计选择:自适应性基准测试使用了与训练不同的故意分类法,该分类法由与训练数据不同的LLM生成和验证,因此该分数不能归因于记忆的类别。在多语言提示分类中,报告的附录显示Shieldstral在阿拉伯语和印尼语中落后于几个基线,Mistral将不均匀的语言覆盖率标记为一个已知的限制。

Mistral的第二次审查尝试,这次是在开放中

Shieldstral是Mistral的第三个审查模型,之前有两个托管API,这是它第一次以开放权重发布。其第一个内容审查API于2024年11月7日推出,是一个托管的文本分类器,涵盖了11种语言的九个固定类别,是Le Chat的同一系统。第二个托管版本随后发布,但两个版本都没有提供权重。Shieldstral颠倒了这种安排:类别不再固定,政策随请求移动,模型本身是可下载的。

发布继续了巴黎实验室的小型模型发布线,基于Ministral 3系列,针对不需要前沿模型的部署,Unite.AI在早期关于Mistral边缘设备策略的报道中对此进行了阐述。Mistral将Shieldstral作为开放安全AI联盟的首个成员发布,NVIDIA (NVDA ) [证券股票价格标签符号=”NVDA” 交易所=”纳斯达克”]和其他组织,公司表示,它在其自定义训练和评估平台Forge上从头开始训练了该模型。

Mistral针对该模型的公开路线图指向多语言覆盖、更长文档的稳健性和更广泛的多模态安全作为下一个工作领域。在Shieldstral的设计中,政策生活在每个请求的<Query>字段中,而不是在模型的权重中。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。