Shieldstral 仅 3B 参数即可匹配七倍规模模型的安全检测能力,支持运行时自定义规则,可完全本地部署。
一篇新论文提出用运行时可由操作者定义的二元问题替代固定的 safety 分类体系,从而无需重训练分类器即可调整审核规则。
法国 AI 公司 Mistral 发布的 30 亿参数模型 Shieldstral,在标准文本安全基准测试中与体积是其三倍的模型表现持平。该公司还表示,该模型在文本与图像联合分类任务上创下了最高分。
运行时规则让操作者可以量身定制安全审核
许多安全护栏模型使用固定分类体系对内容进行排序。论文作者(包括 Mistral 联合创始人 Guillaume Lample)指出了这种做法的两个问题:公开安全数据集对风险的分组方式差异过大,无法支撑一个通用分类体系;而同一套规则也无法适配所有用例。在网络安全工具上合适的内容,用在心理健康平台上可能是有害的。
操作者用自然语言编写审核规则。Shieldstral 返回一个 token,由此生成 0 到 1 之间的安全分数。

操作者通过自然语言问题告诉 Shieldstral 要检查什么,例如"这段内容是否在宣扬暴力?"模型只回答"是"或"否",系统根据每个回答的概率计算出 0 到 1 之间的安全分数。
合成数据帮助模型处理新规则
研究人员将约 5410 万个涵盖安全、有害内容和操控意图的示例合并为一种统一格式。他们对定向操控应用严格标准,对通用安全数据应用中等等级标准,对回答质量则应用宽松标准。
每条训练示例包含任务指令、一个具体的二元问题以及待审核的内容。答案是一个单独的 token。

为了让 Shieldstral 学会更细致的区分,团队使用另一个语言模型将安全文本改写为不安全变体。每个示例还包含一个相似但不同的类别,且该类别必须被拒绝——这训练模型去区分密切相关联的规则,而不是只做宽泛的安全或不安全判断。
作者单独创建了适应性测试类别,独立于训练集,使用了不同的名称和细节层级。他们表示,没有任何细粒度测试类别与训练类别完全对应,不过 12 个较宽泛类别中有 10 个有大致的对应类别。
这个 3B 模型与一个体积接近其七倍的模型打平
在综合文本基准测试中,Shieldstral 的 F1 分数达到了 84.9%。F1 是将精确率和召回率合并为一个指标,满分 100%。该结果与 OpenAI 的 GPT-OSS-Safeguard-20B 持平——后者体积约为前者的七倍——同时超越了 Qwen3Guard-8B(84.0%)、Nemotron-3.5-Safety-4B(83.3%)和 LlamaGuard-4-12B(69.1%)。
在图像及图文组合任务上,Shieldstral 得分为 83.8%,领先于 OmniGuard-7B 的 77.6% 和 LlavaGuard-7B 的 71.6%。
在文本基准测试中,Shieldstral 与一个体积约为其七倍的 OpenAI 模型打平。

GPT-OSS-Safeguard-20B 在适应性基准测试中以 94.1% 领先,Shieldstral 为 91.3%。该测试使用的规则与训练类别不同或是全新规则。作者仍然认为 Shieldstral 比 GPT-OSS-Safeguard-20B 和 Nemotron-3.5-Safety 更实用,因为后两者在回答前会生成长篇中间推理序列,增加了计算成本,而 Shieldstral 只返回一个单词。
对于训练中未覆盖的策略,Shieldstral 落后于那两个在回答前生成中间推理的模型。

Shieldstral 基于 Mistral 的 Ministral-3B,融入了 Pixtral 视觉编码器。在细粒度类别的验证测试中,合成类别数据将 F1 分数提升了 23.3 个百分点——研究人员表示这是模型适应新规则能力的主要驱动因素。
Shieldstral 以 Apache 2.0 许可证发布为开源权重模型。
自定义规则可以减少代价高昂的误过滤
安全分类器位于主语言模型两侧,在处理前筛查 prompt,在内容触达用户前筛查响应。操作者可以更新这些规则而无需重训练主模型。但由于每条请求都会经过分类器,其体积、速度和成本会快速累积。
Anthropic 的 Claude Fable 5 展示了调校不佳的过滤器如何影响实际使用。Artificial Analysis 发现该系统自动将 8% 到 9% 的任务路由到了较弱的模型。一位医学物理学家称 Fable 5 无法使用,因为他的工作内容经常包含"nuclear"一词。其他用户则报告称系统将 MRI 分析标记为生物恐怖主义。
Anthropic 在定位到一个安全问题后收紧了过滤器,并表示此后误拦无害编码任务的情况有所增加。Shieldstral 让操作者对这一权衡有了更多控制权。他们可以在运行时编写筛查标准,为特定应用量身定制过滤器,而不是采用别人的分类体系。
这些分类器已经在行业内扮演着越来越重要的角色。OpenAI 在 ChatGPT 中用它们做自动年龄检测,并将情感类请求通过安全过滤器路由到更严格的模型。Claude Code 使用分类器来屏蔽外部脚本、生产环境部署和 force push。Anthropic 对 Fable 5 的审查还要求公司将输入输出存储最多 30 天,或在违规两年后删除。