Nemotron 3.5模型新增可定制的多模态内容安全特性,满足全球企业AI部署的合规需求。对构建安全AI系统的团队有参考价值。
本文将介绍 3.5 版本发生了哪些变化、每项新能力背后的设计决策,以及如何将该模型集成到生产级安全流水线中。
Nemotron 3 引入了图像理解能力;Nemotron 3.5 则进一步深化了多模态集成。该模型将用户 prompt、可选图像和可选的 assistant 响应放入同一个上下文窗口,并针对组合后的输入给出一致的安全判定。
模型会同时评估这三者,而不是分别独立打分,从而弥补多模态安全场景中一个众所周知的缺口:只有在文本与图像交互,或请求与响应结合时才会显现的策略违规,现在可以在一次推理中被识别出来。
Nemotron 3.5 延续了前代模型对 12 种语言的显式训练覆盖,包括英语、法语、西班牙语、德语、中文、日语、韩语、阿拉伯语、印地语、俄语、葡萄牙语和意大利语;同时还继承了 Gemma 3 基础模型在大约 140 种语言上的强大 zero-shot 泛化能力。
这意味着,在训练数据稀缺的市场中部署时,例如东南亚语言、斯堪的纳维亚语言和资源较少的非洲语言,也可以受益于基础模型的多语言迁移能力,而无须进行单独的 fine-tuning。
与 Nemotron 3 相比,这是 3.5 版本最重要的架构新增能力。生产环境很少只采用一套通用的安全分类体系。医疗平台与金融服务聊天机器人、开发者工具 IDE 或儿童教育应用所面临的风险截然不同。
Nemotron 3.5 可以在接收输入的同时接收一份自定义策略规范。模型在生成判定时会基于该策略进行推理,而不是完全依赖内置的分类体系。这将 Nemotron Content Safety Reasoning 4B 最先引入的能力扩展到了完整的多模态、多语言场景。
Nemotron 3.5 的每项安全判定都可以通过可选的 THINK 模式附带一条可审计的推理轨迹。启用后,模型会先输出逐步推理过程,然后再给出最终的 safe / unsafe 标签,并可选择输出被违反的类别。
<think>
The user prompt asks for guidance on acquiring a controlled substance without a prescription.
The assistant response provides specific sourcing steps and references an online marketplace.
This interaction violates the Criminal Planning/Confessions and Controlled Substances categories.
The image (a pharmacy exterior) provides locational context but does not alter the verdict.
</think>
User Safety: unsafe
Response Safety: unsafe
Safety Categories: Criminal Planning/Confessions, Controlled Substances
如果延迟是首要约束,则可以禁用 THINK 模式,恢复使用 Nemotron 3 已经提供的低延迟二元判定。
随着 Nemotron 3.5 的发布,我们也将开放安全数据集。这是一个重要的里程碑,因为大多数 OSS 安全模型通常不会提供训练集或评估集。在多模态领域,这个问题更加严重,因为图像或视频等素材往往来自许可条款严格的资源。
Nemotron 3.5 Content Safety Dataset 是一个多模态、多语言的数据集,其中包含用于训练模型的安全推理轨迹。这些推理轨迹通过两步流程生成,以使其更加简洁,方法与 Nemotron Content Safety Reasoning 4B 模型类似。
Nemotron 3.5 Content Safety 基于 Google Gemma 3 4B IT 构建,拥有 4B 参数,提供 128K 上下文窗口、强大的视觉语言推理能力和广泛的多语言覆盖。NVIDIA 使用 LoRA adapter 对该基础模型进行 fine-tuning,在引入针对性安全分类行为的同时,仍将模型控制在足够紧凑的规模,使其能够在配备 8GB 以上 VRAM 的 GPU 上进行实时部署。
推理接口支持三种输出模式:
模式 1——低延迟二元判定:
User Safety: safe
Response Safety: unsafe
模式 2——带类别的二元判定:
User Safety: safe
Response Safety: unsafe
Safety Categories: Violence, Criminal Planning/Confessions
模式 3——THINK 模式(推理 + 判定):
<think>
[step-by-step reasoning trace]
</think>
User Safety: unsafe
Response Safety: unsafe
Safety Categories: [categories]
安全分类体系遵循 Aegis 2.0 框架:包含与 MLCommons 安全分类体系一致的 13 个核心类别,以及 10 个细粒度子类别。借助这种一致性,可以直接将该模型与其他在 Aegis 分类体系数据集上进行 benchmark 的开放或闭源 Guard 系统比较。
推理能力堪称内容安全分类的“增压器”,因为它提供了生产级 AI 系统所需的上下文、自定义能力和问责能力,尤其适用于企业和受监管环境。
借助推理,内容安全模型可以在推理时动态解释和执行以自然语言定义的自定义领域策略。这一点非常必要,因为生产环境很少只采用一套通用的安全分类体系。金融服务聊天机器人的风险状况不同于儿童教育应用,后者对不雅用语的容忍度可能更低。
这项能力支持:
类别抑制: 禁用无关类别。例如,当 DevOps 工具处理短语“terminate a process”时,避免触发“violence”类别。
注入自定义类别: 定义符合组织自身监管政策或产品策略的专有风险类别。
推理轨迹会在模型给出最终 safe 或 unsafe 判定之前,展示其逐步推理逻辑。这种记录在案的判定依据具有多种用途:
合规与审计日志: 受监管行业通常要求为内容审核决策提供有记录的理由。
人工审核: 审核人员可以检查判定产生的原因,从而识别系统性的模型错误。
策略迭代: 推理轨迹能够揭示模型如何解释边界情况,使团队可以不断迭代、完善自定义策略的表述。
虽然推理可能增加延迟,但 Nemotron 模型会将推理链压缩成简洁的摘要,以限制输出 token 数量并提高效率。该过程分为两个步骤,与前代模型 Nemotron-Content-Safety-Reasoning-4B 采用的方法类似。
第一步,我们使用 Qwen 397B 等规模更大、能力更强的模型,根据给定的 prompt、图像和响应生成 chain-of-thought 推理轨迹。我们还会向模型提供样本的 ground-truth 标签,避免错误分类混入推理轨迹。
第二步,我们使用 Qwen 80B 等另一个大型模型进一步精简这些推理轨迹。我们会明确要求该模型重新表述第一步生成的原始轨迹,将其控制在不超过三句话的范围内。根据实验结果,生成的大多数推理轨迹都少于三句话。
这种高效的推理轨迹优化,使低延迟的自定义策略执行成为可能。此外,推理轨迹还提供了宝贵的训练信号,可用于训练专门的审核模型。开发者可以选择双模式运行:在通用任务中禁用推理以获得最低延迟,或在处理复杂策略时启用推理。
驱动 Nemotron 3.5 的数据集,是 Nemotron 3 所用多模态、多语言混合数据集的演进版本,并增加了面向推理和自定义策略能力的数据。我们使用了以下数据来源:
来自 Nemotron Safety Guard Dataset v3 的多语言文本安全数据。这些数据从具有细腻文化差异的子集中采样,并在不同安全类别以及 safe/unsafe 划分之间保持成比例的代表性。
NVIDIA 以英语收集并经人工标注的多模态数据,随后被翻译成 12 种语言。关键在于,99% 的训练图像都是真实照片,而不是合成生成的图像。这直接解决了多模态安全 benchmark 领域的一个已知弱点:VLGuard 和 MM-SafetyBench 等现有数据集严重依赖 SDXL 生成的图像,缺乏生产内容中的文化质感和对抗复杂性。虽然由于许可限制,无法发布所有这些真实图像,但我们仍然可以发布一部分来自 Wikimedia 和合成生成的图像。
来自 Nemotron VLM Dataset v2 的安全多模态数据,覆盖扫描文档、图表、论文和示意图,以及与之相关的查询,确保模型不会对无害的专业内容过度标记。
从更大的 teacher model 所生成的 chain-of-thought 输出中提取的推理轨迹。这些轨迹先由 Qwen 397B 生成,再使用 Qwen 80B 缩短,用于教会模型如何推理。
来自 CantTalkAboutThis 数据集的主题遵循数据,其中包含一系列企业部署场景下的策略规范与判定配对,覆盖医疗、金融、银行、教育等领域。
合成数据约占总训练数据量的 10%,主要用于丰富 jailbreak 模式、生成罕见的策略违规示例,以及构造多模态对抗案例。
Nemotron 3.5 Content Safety 在多语言、多模态和自定义策略安全 benchmark 上进行了评估,包括 VLGuard、MM-SafetyBench、PolyGuard、RTP-LX、Aya Redteaming、XSafety、MultiJail、Aegis、Dynaguardrail 和 CoSA。
这些评估反映了企业安全面临的核心生产挑战:在不显著增加延迟的情况下,跨全球语言、文本与图像输入以及特定领域策略应用一致的 Guardrails。
Nemotron 3 建立了强劲的 baseline:在多模态有害内容测试中,平均准确率达到 84%,延迟大约只有 LlamaGuard-4-12B 的一半。Nemotron 3.5 在保持紧凑 4B 模型效率的同时,新增了自定义策略支持和推理轨迹。
在多语言和多模态安全 benchmark 中,Nemotron 3.5 在保持紧凑体量的同时,展现出强大的有害内容分类准确率。这一点非常重要,因为许多安全模型仍然以英语为主、仅支持文本,或成本过高,不适合在生产流水线中反复运行。
Nemotron 3.5 旨在通过一个模型同时提供多语言覆盖、多模态分类、自定义策略支持和低延迟部署能力。
图 1:Nemotron 3.5 Content Safety 在多语言和多模态安全 benchmark 中展现出强大的有害内容分类准确率,在接受评估的 benchmark 集合中平均约为 85%。
各语言的结果凸显了多语言安全对全球企业 AI 的重要性。在 Multilingual Aegis 上,Nemotron 3.5 在 12 种语言中的有害内容分类准确率平均达到 96.5%。在 RTP-LX 上,其平均准确率为 88.8%;综合 Aegis 和 RTP-LX 后,平均准确率为 92.7%。
这种一致性有助于团队在面向客户、员工和合作伙伴的工作流中采用相同的安全标准,而无须依赖仅支持英语的审核机制或彼此独立的地区安全模型。
图 2:Nemotron 3.5 Content Safety 在 Multilingual Aegis Cultural + Adapted 的 prompt 分类任务中,以 harmful-f1 衡量,在 12 种语言上的有害内容分类准确率平均达到 97%。
图 3:Nemotron 3.5 Content Safety 在 RTPLX 的 prompt 分类任务中,以 harmful-f1 衡量,在 12 种语言上的有害内容分类准确率平均达到 89%。
对生产级 Guardrails 来说,只有准确率还不够。安全模型还必须足够高效,才能在内容被处理、返回或路由到下游之前运行。Nemotron 3.5 Content Safety 采用紧凑的 4B 设计,有助于降低重复安全检查的成本和延迟,使多语言、多模态 Guardrails 能够真正用于现实世界的 AI 应用。
在默认模式,也就是不启用 THINK 的情况下,其延迟表现与 Nemotron 3 相同。THINK 模式会增加与推理轨迹长度成正比的推理时间,但这部分开销是可预测的,也可以与同步审核循环分开规划。
例如,可以将 THINK 模式的评估作为审计流水线的一部分异步运行,同时使用默认模式处理实时决策。
图 4:在一项多模态 benchmark 中,与另一种多模态安全模型相比,Nemotron 3.5 Content Safety 的端到端延迟降低了 3 倍。
与另一种具备推理能力的安全模型相比,启用推理后,我们的模型最多可减少 50% 的生成 token,因此在成本和延迟方面更加高效。
多模态安全研究中反复出现的一个主题,是现有评估基础设施存在缺口。Nemotron 3.5 的开发也遇到了更广泛研究文献中记录的同类问题:
仅覆盖文本: 最常被引用的安全 benchmark,包括 WildGuard、XSTest 和 HarmBench,都只支持文本。无法根据文本 benchmark 的结果推断多模态性能。
合成图像质量: 现有的大多数多模态 benchmark 使用 AI 生成的图像,通常由 SDXL 生成,而不是真实照片,因此低估了真实生产内容的处理难度。
真实图像许可: 商业图库照片的许可协议禁止在 AI 数据集中重新分发这些图像,导致研究条件与生产条件之间存在结构性差距。
NVIDIA 的多模态训练数据包含真实图像和体现细腻文化差异的多语言 prompt,旨在填补模型训练领域的部分空白。而用于评估的 benchmark 缺口,仍然是整个安全研究社区尚未解决的问题。
Nemotron 3.5 Content Safety 已在 Hugging Face 上根据 NVIDIA Open Model License 发布,可用于研究和商业用途,训练数据集也一并开放。该模型支持 transformers、vLLM 和 SGLang;对于需要预打包、针对 GPU 优化的生产级推理微服务的团队,也可以在 build.nvidia.com 上以 NVIDIA NIM 的形式使用。
开发者还可以通过 Baseten、Eigen AI、DeepInfra、OpenRouter 和 Vultr 等推理平台使用该模型。
针对自定义策略工作流,NVIDIA 提供了一个兼容 Claude 和 Codex 的 skill,用于生成自定义策略,同时还提供了展示模型用法的 cookbook。自定义策略和推理轨迹可以帮助团队根据特定领域规则调整安全行为,同时保持决策的可审计性。
本文提到的模型:3 个
本文提到的数据集:4 个
NVIDIA Cosmos-H-Dreams:将实时生成式仿真引入手术机器人
物理 AI 仿真现状:概览
· 注册或登录后发表评论
本文提到的模型:3 个
本文提到的数据集:4 个