Ministral-3B基础上构建的内容审核模型,支持文本和图像,可在16GB显存GPU上本地运行,Apache 2.0许可。
Mistral AI 发布了 Shieldstral,这是一款 30 亿参数的开源权重安全分类器,旨在在设备端对文本和图像进行内容审核。该模型于 2026 年 8 月 4 日发布,构建于 Mistral 的 Ministral-3B 基座之上,可以让组织在无需为每次策略修订重新训练独立审核模型的情况下,根据自身的自然语言策略评估内容。
此次发布值得关注,因为它将相对紧凑的部署目标与灵活可适应的审核方式结合在了一起。根据 Mistral 官方 Shieldstral 公告,该模型可以在单块 16GB NVIDIA GPU 上运行,其权重采用 Apache 2.0 许可证发布。这为团队提供了一种选择:可以在本地或离线部署审核基础设施,而不必完全依赖集中托管的分类服务。
Shieldstral 可以评估 prompts、模型响应以及 prompt-response 对。它同时支持文本和图像输入,定位为多模态安全组件,适用于需要评估用户提交内容以及 AI 生成输出的应用场景。Mistral 将此次发布描述为其更广泛的 Open Secure AI 计划的首个成员。
Shieldstral 将内容审核表述为一个自然语言的二元策略问题。操作员在推理时提供策略指令,模型根据该指令判断输入应该得到"是"或"否"的结果。然后通过对这两个可能答案的 logits 进行 softmax 归一化并应用阈值,产生一个连续的安全分数。
这一点之所以重要,是因为策略是推理 prompt 的一部分,而不是通过新的训练周期嵌入的固定规则集。因此,团队可以更改策略语言来应对变化的需求、产品场景或审核类别,而无需重新训练 Shieldstral。这种方法并不消除策略设计、阈值选择和测试的需要。但它确实使这些变更在部署时更加直接可配置。
随附的 Shieldstral 研究预印本于 2026 年 7 月 28 日发布,描述了一个涵盖文本和多模态数据的 5410 万样本训练数据管道。它还详细说明了在文本和图像上评估安全性的相同二元判断 formulation。Mistral 使用 Ministral-3B 基座将 Shieldstral 与一系列定位用于边缘和设备端应用的开源权重模型家族关联起来。
对于企业团队而言,实际的吸引力不仅仅是模型的开源权重。更重要的是能够将审核能力放置在更接近应用程序或数据源的位置。潜在的部署场景包括本地 AI 助手、处理图像或文本的边缘软件,以及需要离线运行的工作流。在那些倾向于将内容处理保留在自身环境中的组织中,能够在单块 16GB GPU 上运行的模型比更大的集中式部署创造了更容易实现的基础设施目标。
还有治理层面的影响。当组织更新其可接受使用规则时,策略语言可以随时修订,但这种灵活性也意味着将责任转移给了操作员。团队需要明确界定策略,决定应该设置什么分数阈值来触发操作,并验证所选策略对其特定内容和风险容忍度的表现。连续分数可以支持基于阈值的决策,但 Mistral 的公告并未建立一个适用于所有用例的通用阈值。
Apache 2.0 许可证是一个重要的商业细节,但它不是公布的价格表。Mistral 已依据该许可证开放了权重;但组织仍需自行承担硬件、集成、运营、评估和治理成本。因此,此次发布扩展了部署选择,而非消除了内容安全方面必要的运营工作。
希望评估 AI 产品本地审核的组织,可以与 Scalevise 合作进行 AI 架构设计、工作流自动化,以及将安全控制连接到现有应用程序和治理流程的实施。
什么是 Mistral Shieldstral?
Shieldstral 是 Mistral AI 的 30 亿参数开源权重多模态安全分类器,用于内容审核。它可以根据自然语言安全策略评估文本和图像。
Shieldstral 可以在设备端运行吗?
可以。Mistral 表示 Shieldstral 可以在单块 16GB NVIDIA GPU 上运行。其可下载的权重也支持本地和离线部署场景。
Shieldstral 如何适应不同的审核策略?
操作员在推理时将安全策略作为自然语言指令提供。Shieldstral 将内容评估为二元策略问题,因此可以在不重新训练模型的情况下更改策略。
Shieldstral 可以免费使用吗?
Shieldstral 的权重依据 Apache 2.0 许可证发布。Mistral 的公告未提供通用部署价格,组织仍需自行承担基础设施和实施成本。
Shieldstral 为希望在其应用程序和数据附近实现策略自适应审核的团队提供了一个具象的开源权重安全产品。其 30 亿参数规模、单块 16GB GPU 部署目标、多模态范围以及 Apache 2.0 许可授权,使本地部署更加可行,同时将策略定义、评估和阈值治理牢牢置于采用该模型的组织手中。