Nemotron 3 Nano 支持长上下文和多模态处理(文档、音频、视频),专为 Agent 应用优化。
NVIDIA Nemotron 3 Nano Omni 是一款全新的全模态理解模型,专为真实场景中的文档分析、多图像推理、自动语音识别、长音视频理解、智能体式计算机操作和通用推理而构建。
它将 Nemotron 多模态产品线从强大的视觉语言系统扩展为覆盖文本、图像、视频和音频的更广泛模型。
Nemotron 3 Nano Omni 在 MMlongbench-Doc、OCRBenchV2 等复杂文档智能排行榜上实现了同类最佳的准确率,同时还在 WorldSense 和 DailyOmni 等视频与音频排行榜上处于领先地位。它在音频理解基准 VoiceBench 上取得了最高准确率,并在 MediaPerf 上被评为成本效益最高的开放视频理解模型。
在底层,它将 Nemotron 3 混合式 Mamba-Transformer 混合专家骨干网络与 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器相结合。
该架构旨在保留精细的视觉细节、加入原生音频理解能力,并扩展到超长多模态上下文,以处理信息密集型图像、文档、视频以及混合模态推理。
训练方案采用分阶段的多模态对齐和上下文扩展,随后进行偏好优化与多模态强化学习。
与其他替代方案相比,Nemotron 3 Nano Omni 在多模态用例中可实现最高 9 倍的吞吐量,以及 2.9 倍的单流推理速度。
可在 HuggingFace 下载 BF16、FP8 和 NVFP4 检查点。
如需进一步了解模型架构、训练方案、数据流水线和基准测试,请阅读完整的 Nemotron 3 Nano Omni 报告。
与具备相同交互性能的其他开放全模态模型相比,Nemotron 3 Nano Omni 在多文档用例中的系统效率提高了 7.4 倍,在视频用例中的系统效率提高了 9.2 倍。
图 1. 在固定的单用户交互性能阈值(tokens/sec/user)下,各模型针对多文档和视频用例所能持续提供的系统总吞吐量
从宏观层面来看,Nemotron 3 Nano Omni 面向五类工作负载:
这不只是 OCR。该模型面向篇幅长、结构杂乱且价值较高的文档,这类文档的理解依赖于版式、表格、图形、公式、章节结构和跨页引用。例如合同、技术论文、报告、手册、多页表单或合规资料包。该模型能够处理超过 100 页的文档。
Nemotron 3 Nano Omni 具备强大的语音理解能力,可以在多种音频条件下实现高质量转录。它能够处理包含不同说话人、口音和背景噪声的长音频。这些能力可以集成到更广泛的工作流中,使语音内容能够被转录、分析,并与其他模态结合,用于摘要、问答和跨模态推理等任务。
许多企业和开发者工作流都依赖混合的音频与视觉证据,例如带解说的屏幕录制、培训视频、包含幻灯片的会议、教程、产品演示、客户支持记录以及长视频档案。Nemotron 3 Nano Omni 能够对这些输入进行联合推理。
Nemotron 3 Nano Omni 模型针对智能体式计算机操作进行了专门训练,使其能够协助完成图形用户界面(GUI)环境中的任务。它能够解读屏幕截图、监控用户界面的状态、基于屏幕视觉内容进行推理,并协助选择操作或实现工作流自动化。
该模型的设计目标不只是感知。它擅长需要在长上下文窗口、多种模态以及结构化或半结构化证据之间综合信息的推理密集型任务。它能够执行多步推理和计算,并关联来自文本、图像、表格及其他输入的信号,从而得出连贯且有充分依据的答案。
Nemotron 3 Nano Omni 采用统一的编码器—投影器—解码器设计。语言骨干网络为 Nemotron 3 Nano 30B-A3B,并搭配 C-RADIOv4-H 视觉编码器和 Parakeet-TDT-0.6B-v2 音频编码器。各模态专用编码器通过轻量级投影器接入 LLM 骨干网络。
图 2. NVIDIA Nemotron 3 Nano Omni 30B-A3B 的模型架构
该模型的骨干网络交错排列了三个关键组件:23 个 Mamba 选择性状态空间层,用于高效处理长上下文;23 个 MoE 层,包含 128 个专家、top-6 路由和一个共享专家,用于提供条件化容量;以及 6 个分组查询注意力层,用于保持强大的全局交互能力和表达能力。
Nemotron 3 Nano Omni 在统一设计中结合了状态空间模型、注意力机制与 MoE,既保持了强大的推理性能,又能切实适用于长多模态上下文。
在视觉方面,Nemotron 3 Nano Omni 以原生宽高比下的动态分辨率处理取代了 v2 模型所使用的平铺策略。每张图像可以使用数量可变的 16 x 16 图像块表示,每张图像最少包含 1,024 个、最多包含 13,312 个视觉图像块。对于正方形图像,这分别相当于 512 x 512 和 1840 x 1840 的分辨率。
这种灵活性对于处理高分辨率且复杂的视觉输入至关重要,例如包含大量 OCR 内容的文档、财务表格、幻灯片、研究图表、屏幕截图和 GUI 布局,尤其适合需要同时理解精细细节和整体结构的场景。
对于视频,Nemotron 3 Nano Omni 使用专用的 Conv3D tubelet 嵌入路径。它不会单独嵌入每一帧,而是在输入 ViT 之前,将每一对连续帧融合成单个“tubelet”,从而将语言模型需要关注的视觉 token 数量减半。这样,我们既可以在相同 token 预算下将帧数翻倍,也可以在帧数不变的情况下将 token 数量减半。
EVS 是一项重要功能,可在推理阶段启用,用于丢弃视觉编码器输出的冗余视频 token。它能够在保持准确率的同时降低延迟并提高吞吐量。视频的第一帧会被完整保留;对于之后的每一帧,EVS 会保留视频内容发生变化位置的“动态”token,并丢弃与前一帧相比没有任何变化位置的“静态”token。我们将其与 Conv3D 结合,以实现更出色的压缩:Conv3D 将每对帧中的 token 融合为一个,随后 EVS 再剪除冗余的静态信息。
音频侧由 Parakeet-TDT-0.6B-v2 提供支持,并通过独立的两层 MLP 投影器连接到骨干网络。音频以 16 kHz 采样;模型训练所用的输入最长为 1,200 秒(20 分钟),而 LLM 的最大上下文长度支持超过 5 小时的内容。
这标志着传统 VLM 流水线的一次转变:模型能够在共享的多模态序列中原生处理音频,使音频、视觉和文本 token 可以进行联合建模。这对于以下场景至关重要:带解说的屏幕录制、语音会改变视觉内容含义的视频问答、长篇教学或会议内容,以及需要基于时间信息进行多模态推理的任务。
每个编码器都通过轻量级两层 MLP 投影器连接到 LLM,该投影器会将编码器特征映射到共享嵌入空间。完成投影后,视觉、音频和文本 token 会交错排列并接受联合处理。
这种设计在保持整个系统模块化的同时,仍能在骨干网络内部实现真正的跨模态推理。
SFT 各阶段在 NVIDIA H100 上训练,并根据阶段不同从 32 个节点扩展到 128 个节点。整个技术栈使用 Megatron-LM、Transformer Engine 和 Megatron Energon,并采用张量并行、专家并行、序列并行、用于长上下文阶段的上下文并行、在线序列打包以及选择性激活重计算。
SFT 之后的强化学习使用 NeMo-RL 和 NeMo Gym,并以 Megatron 作为后端。RL 基础设施在 B200 和 H100 集群上采用基于 Ray 的分布式配置,并加入多模态去重机制,避免重复 rollout 导致图像、视频和音频的内存占用成倍增加。
我们将训练代码中的大量内容开源。
我们在Nemotron 3 Nano Omni中引入了多环境文本和Omni训练。我们的文本强化学习训练阶段在Nemo-Gym的不同环境中进行,它评估模型执行一系列动作(如工具调用、代码编写和多部分规划)的能力,这些动作满足可验证的标准。
Omni强化学习在统一的框架内训练模型跨越图像、视频、音频和文本进行推理,覆盖从单模态到完全多模态场景的任务。一套多样化的验证器评估多种格式(如多选题、数学、GUI定位和自动语音识别)的输出,同时有意包含无法回答的案例,以教导模型在证据不足时放弃回答,而不是产生幻觉。
Nemotron 3 Nano Omni在强化的数据集上进行训练,该数据集强调跨多种模态的高质量推理。我们显著扩展了任务覆盖范围,并为公共数据集有限的复杂推理场景引入了合成数据。为了支持这一点,我们构建了特定任务的多阶段管道,用于可扩展的合成数据生成。
例如,我们使用NeMo Data Designer从大量真实世界PDF语料库生成了大约1140万个合成问答对(约45B个标记)。该数据集用于在后训练期间加强长上下文文档推理,并在MMLongBench-Doc上实现了2.19倍的整体准确度提升。
我们在Data Designer开发者说明中详细介绍了完整的管道演变,包括失败分析和关键经验教训。该说明还包括九个可运行的管道配方,可作为构建自己的文档理解数据集的起点。
Nemotron 3 Nano Omni可以分析和推理长文档,如财务报告、学术论文、产品手册等。以下示例跨越100+页文档检索财务指标以计算另一个指标:
Figure 3: Stylized example from the MMLongBench-Doc benchmark
模型被提示按如下方式回答问题:
Extract information from all the given images, then answer the question using a single word or phrase. Return 'Not answerable' if the answer cannot be derived from the the images.
该模型能够一次性完成长上下文检索、结构化提取、表格/图表阅读和多页推理。
Nemotron-3 Nano Omni执行联合音视频分析,包括特定场景的局部分析和整个视频的全局分析。这使其能够回答需要跨模态推理的复杂问题——例如识别在音频中提及特定话题时显示的特定视觉内容。
Watch the video and listen to the narration.
1.What structure is on fire as shown in the video and how much money was being spent in its renovation project ?
2. Describe in short what visuals are shown when the eye-witness narrates her experience?
1. The structure on fire is the Notre Dame Cathedral, which was undergoing an almost $7 million renovation project.
2. When the eye-witness narrates her experience, the visuals show the cathedral engulfed in flames and thick smoke, scaffolding surrounding the burning roof, firefighters using ladders to spray water, a crowd of people watching from the riverbank, and views of the burning structure against the Paris skyline.
Nemotron 3 Omni可以集成到AI智能体计算机使用系统中,以推理用户意图、分析GUI元素并执行操作来完成任务。
为模型提供了对具有以下系统提示的web环境的访问:
You are a GUI agent. You are given an instruction, a screenshot of the screen and your previous interactions with the computer. You need to perform a series of actions to complete the task. The passoword of the computer is {password}.
For each step, provide your response in this format:
{thought}
## Action:
{action}
## Code:
{code}
In the code section, the code should be either pyautogui code or one of the following functions wrapped in the code block:
- {"name": "computer.wait", "description": "Make the computer wait for 20 seconds for installation, running code, etc.", "parameters": {"type": "object", "properties": {}, "required": []}}
- {"name": "computer.terminate", "description": "Terminate the current task and report its completion status", "parameters": {"type": "object", "properties": {"status": {"type": "string", "enum": ["success", "failure"], "description": "The status of the task"}, "answer": {"type": "string", "description": "The answer of the task"}}, "required": ["status"]}}
Find the Driver License Eligibility Requirements
模型响应:上方GIF显示了智能体为完成用户请求所采取的操作。
它点击了"License & IDs"标签
然后从下拉菜单中点击"Driver's License"
然后点击左侧的"Driver's License Eligibility"
它向下滚动此页面并向上滚动回去
最后为用户生成了以下响应:
Successfully found the Driver License Eligibility Requirements page on the Virginia DMV website. The page contains comprehensive information about driver license eligibility including:
**General Requirements:**
- Must be a resident of the Commonwealth of Virginia
- Must be at least 16 years and 3 months of age
**First Time Drivers:**
- Must complete a state-approved driver education program
- Must obtain a learner's permit at least 60 days before taking the road skills test
- Must be at least 15 years and 6 months of age for a learner's permit
- No exceptions to age requirements
**New Residents:**
- Temporary residents: must obtain license within 6 months
- Permanent residents: must obtain license within 1 year
**Military Personnel:**
- Active-duty members of the Armed Forces stationed in Virginia
- Spouses and dependents 16 years and 3 months or older may drive with valid out-of-state license
- If vehicle is co-owned and out-of-state plates are used, all co-owners must be active duty members
**Out-of-State Students:**
- Full-time students enrolled in accredited Virginia schools (not employed) may drive with valid out-of-state license
- Full-time students who are employed are considered Virginia residents for vehicle laws
**Non-Residents:**
- Non-residents temporarily living in Virginia may drive with home state license for no more than 6 months
- Note: This does not apply to commercial vehicle drivers
- If becoming gainfully employed, must hold Virginia driver's license
**Identification and Residency Requirements:**
- Proof of identity (acceptable documents listed in DMV 141)
- Proof of legal presence in the U.S.
- Proof of Virginia residency
- Proof of Social Security number
- Proof of name change (if applicable)
Additional resources available: interactive document guide, "Acceptable Documents for Obtaining a Driver's License or Photo ID Card" (DMV 141), and Spanish language version.
Nemotron-3 Nano Omni可以分析图表、图像中显示的图形以及音频文件,以生成各媒体间的任何共同点和差异。
Use both the slide content and the spoken commentary.
List out any extra points mentioned by the speaker that is not shown in the slide
Based on the speaker's commentary and the visual content of the slide, here are the extra points mentioned that is not explicitly shown or detailed in the slide:
示例 5:声景
Nemotron-3 Nano Omni 可以分析图像中展示的图表和示意图,并结合音频文件,找出不同媒体之间的共同点和差异。
What is producing the main sound in this audio, and what does the acoustic environment suggest about where it was recorded?
The main sound is a bird chirping, and the presence of multiple bird calls and a natural, open acoustic environment suggests the recording was made outdoors in a natural setting like a forest or park.
Nemotron-3-Nano-Omni 可以理解一般音频并对其进行推理,包括声景和环境声音。
What's the overall vibe of this song, and what kind of scenario would it complement well?
The song has a calm, reflective, and slightly melancholic vibe, with a gentle piano melody and soft string accompaniment. It would complement a quiet, introspective scene such as a rainy evening, a peaceful walk, or a moment of personal reflection.
开始使用 Nemotron 3 Nano Omni
NVIDIA Nemotron Nano V2 VL。技术报告:https://arxiv.org/abs/2511.03929
NVIDIA Nemotron 3:高效且开放的智能。技术报告:https://arxiv.org/abs/2512.20856
C-RADIOv4-H。Hugging Face 模型页面:https://huggingface.co/nvidia/C-RADIOv4-H
Parakeet-TDT-0.6B-v3。Hugging Face 模型页面:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3
Megatron-LM。GitHub:https://github.com/NVIDIA/Megatron-LM
Transformer Engine。GitHub:https://github.com/NVIDIA/TransformerEngine
Megatron Energon。GitHub:https://github.com/NVIDIA/Megatron-Energon
本文提及的模型 5
本文提及的数据集 1
本文提及的 Spaces 1
该作者的更多文章
NVIDIA Cosmos-H-Dreams:将实时生成式模拟引入外科机器人领域
物理 AI 模拟的现状:概览
你们所有人的工作都非常出色。我一直在针对另一个用例研究这里所讨论的同一个问题。期待精简版/本地模型!
我正在一张 4090 上运行 parakeet-tdt 0.6b-v3 + 1.1b 和 faster-whisper-v3-turbo,将它们作为一个由 7 条流水线组成的本地 STT 基准测试的一部分,在我的 Dropbox 语料库(PDF、图像、PPT、Keynote、WAV、MP4……)上测试,这些语料来自会议和其他个人项目。因此,看到这里采用 parakeet encoder + mamba-moe + c-radiov4 的组合,正是我一直期待有人迈出的架构层面的一步。
有两个实际问题:
在 24GB 消费级显卡上,nvfp4 的 RTF 和显存占用是多少?fp8 约占 30GB,bf16 约占 60GB,因此 nvfp4 是 4090 上唯一现实的路径。你们推荐使用 megatron-bridge 作为推理方案,还是 NeMo-RL?
在 24GB 消费级显卡上,nvfp4 的 RTF 和显存占用是多少?fp8 约占 30GB,bf16 约占 60GB,因此 nvfp4 是 4090 上唯一现实的路径。你们推荐使用 megatron-bridge 作为推理方案,还是 NeMo-RL?
你们评估中的每一个单元格都是英文。我有数小时的 4 人荷兰语/弗拉芒语会议音频(每段 20~30 分钟),还有一些没有 MMLongBench-Doc 对应评测集的欧盟 PDF。如果数据集不是太大,而且非英语信号有用,我很乐意发布一份与你们模型的正面对比,基线是我的 parakeet+pyannote 和 whisper-v3-turbo;无论是博客文章还是仓库 PR,哪种形式合适都可以。或者你们是否计划用其他语言进行测试?
你们评估中的每一个单元格都是英文。我有数小时的 4 人荷兰语/弗拉芒语会议音频(每段 20~30 分钟),还有一些没有 MMLongBench-Doc 对应评测集的欧盟 PDF。如果数据集不是太大,而且非英语信号有用,我很乐意发布一份与你们模型的正面对比,基线是我的 parakeet+pyannote 和 whisper-v3-turbo;无论是博客文章还是仓库 PR,哪种形式合适都可以。或者你们是否计划用其他语言进行测试?
感谢你们发布 Nemotron 3 Nano Omni。
是否可以分享一些中间阶段的检查点,例如最终对齐阶段之前或联合训练期间的检查点?哪怕只提供几个具有代表性的检查点,也会对研究分析非常有帮助。
我们会遵守模型许可证和引用要求。
· 注册或登录后发表评论
本文提及的模型 5
本文提及的数据集 1
本文提及的 Spaces 1