Mistral发布Shieldstral 1.0 3B,政策自适应多模态安全分类器,以问答方式做内容审核,无需重训练即可切换策略,在16GB显存运行,Apache 2.0开源。
Mistral AI 发布了 Shieldstral 1.0 3B,这是一款开源权重的、策略自适应多模态安全分类器。它将内容审核归结为一个简单的 yes/no 问题,而非固定的伤害类别 taxonomy。大多数 guardrail 模型将类别列表 baked 进权重中,因此将其重新适配到新的部署场景意味着要重新训练——同样一段内容,在网络安全研究工具上可能可以接受,但在心理健康平台上却可能有害。Shieldstral 反其道而行:运营商在推理时将策略写成一段自然语言问题,模型通过一次前向传播返回一个校准后的安全分数。它基于 Ministral-3-3B-Base-2512 构建,带有原生 Pixtral 视觉编码器,采用 Apache 2.0 许可发布。在文本安全任务上达到 84.9% 平均 F1——与 GPT-OSS-Safeguard-20B 持平——多模态安全达到 83.8%,超越了 Mistral 评估的所有基线模型。
是的,而且可以本地运行。Shieldstral-1.0-3B 在 BF16 精度下只需 16GB VRAM,单卡即可运行,采用 Apache 2.0 许可,可用于商业和非商业用途。 Serving 方案已经就绪:vLLM(≥0.26.0,推荐)、llama.cpp(通过 GGUF 转换支持 Q8_0/Q5_K_M/Q4_K_M 量化)、SGLang 和 Transformers——并通过 Axolotl 支持微调。分类器只输出一个 token,因此延迟和成本远低于 GPT-OSS-Safeguard-20B 这类基于推理的 guardrail。
适用于哪类公司:16GB 的占用使其对那些无法承担审核供应商合同的种子期 AI 产品团队触手可及,而开源许可和自托管模式则适合需要在地 VPC 或本地部署以满足数据驻留和审计要求的中型市场和企业团队。多租户 SaaS 厂商获得了特定优势——同一个 checkpoint 可以为每个客户执行不同的策略。
行业场景:消费级社交和 UGC 平台、教育科技和儿童安全界面、医疗健康和心理健康应用、金融科技和保险支持自动化、游戏和语音聊天、市场和广告/创意审核,以及具有主权要求的公共部门部署。
应用场景:用户 prompt 审核、模型响应审核、拒绝分类、图片加配文的广告和表情包审核、训练数据和 RAG 语料库筛选、Agent 流水线中的输出门控,以及按租户的策略执行。由于输出是连续分数而非标签,团队可以针对不同界面调整阈值,或将边界分数路由到人工审核而非直接硬拦截。
将审核简化为二分类问题
Shieldstral 将审核简化为一个 yes/no 问题。固定 system message 确立任务;用户消息携带三个字段:<Instruct>(评估上下文和严格程度)、<Query>(策略,表述为单个 yes/no 问题)、<Document>(prompt、响应、prompt–响应对,或带可选文字的图片)。
推理时,模型仅朝 yes 和 no 两个 token ID 去嵌入,并将它们 softmax 归一化为连续分数,在 τ=0.5 处阈值化。这将 prompt 分类、响应审核、拒绝检测和毒性检测合并为同一个问题——也意味着策略完全存在于 prompt 中。Mistral 的指导是每次调用一条策略;若需宽泛的 safe/unsafe 判决,则在 <Instruct> 中列出类别并在 <Query> 中提一个覆盖范围广的问题。
所声称的优势来自数据而非规模:约 5410 万样本——4520 万开源文本、440 万合成对比文本、450 万多模态数据。基于模板的统一层通过 per-dataset 处理器将每个数据集转换为相同的 instruction–query–document 格式,配合随机化措辞和校准后的严格程度(对对抗性越狱严格,对响应质量数据宽松)。
更有意思的部分是对比生成。一个 LLM 将安全文本改写为不安全变体,使其违反目标类别但故意不违反其兄弟类别,从而在一次调用中对相同内容产生一个正例和一个硬负例。这教会模型具体违反的是哪条策略,而非粗粒度的 safe/unsafe 二分。图像数据——无法像文本那样合成——通过通用图像数据集作为负例、跨 14 个子类别的视觉 taxonomy 进行 query 突变、以及视觉-语言重排器过滤来补充。
训练采用 LoRA 微调,随后进行三路 SLERP 合并:0.6 公开+生成数据、0.3 纯公开数据、0.1 Ministral-3B-Instruct。
在文本安全上,Shieldstral 报告 84.9% 平均 F1,与 GPT-OSS-Safeguard-20B(84.9%)持平,是对比中体积最小的模型,在 ToxicChat(84.1)、HarmBench(99.4)和 Aegis v2 响应(87.2)上有胜出。在多模态安全上报告 83.8% 总体 vs OmniGuard-7B 的 77.6%,领先于 VLGuard(97.7)和 UnsafeBench(81.8);LlavaGuard-7B 在其同名基准上仍领先于自身,达到 81.4。
在适应性基准上——基于一个刻意设计的分歧 taxonomy,包含 12 个超类、26 个子类和 52 个叶类别,共 90 个固定查询,没有任何叶节点与训练数据一一对应——Shieldstral 得分 91.3% F1,落后于 GPT-OSS-Safeguard-20B(94.1%)和 Nemotron-3.5-Safety-4B(91.8%),但不生成推理 trace。拒绝检测总体达到 91.5%,对比 GPT-OSS-Safeguard-20B 的 93.7%。
弱项:多语言 prompt 分类在阿拉伯语和印尼语上表现落后,在 RTP-LX prompts 上也如此(70.3 vs Nemotron-3.5-Safety-4B 的 86.1)。Mistral 同时指出在对抗性或混淆输入以及超长文档上可靠性下降。训练上下文为 32k tokens,涵盖 12 种语言。
3B 参数、Apache 2.0 许可的多模态 guardrail;策略在推理时以自然语言问题形式输入,无需重新训练。
84.9% 文本 F1 与一个 20B 模型持平;83.8% 多模态 F1 在评估的基线中属最佳。
5410 万样本配合兄弟对比重写是策略泛化背后的真正机制。
单次前向传播、输出单个 token、在 τ=0.5 的连续分数——实时门控成本足够低。
弱项:低资源语言、混淆输入、长文档。
查看 Paper、Model on Hugging Face 和 Technical Details。也欢迎关注我们的 Twitter,别忘记加入我们的 15 万+ ML SubReddit 并订阅我们的 Newsletter。等等!你用 telegram 吗?现在也可以加入我们了。
需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会等?请联系我们
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻著称,内容既有技术深度又易于广大读者理解。该平台月浏览量超过 200 万,彰显了其受众中的受欢迎程度。