NVIDIA发布11B参数开源语音对话模型,用单一统一网络替代传统的ASR→LLM→TTS级联架构,支持全双工流式对话、中途打断响应仅480ms,可在对话中调用工具。
2026年8月9日,NVIDIA 正式宣布 NemotronLabs VoiceChat 11B(模型卡显示它于8月3日登陆 Hugging Face)——一款 110 亿参数的开源端到端语音到语音模型。其最激进的举动:不再使用经典的级联 ASR → LLM → TTS 架构,而是由单个统一网络同时完成流式语音理解和语音生成。这意味着真正的全双工对话——模型在说话时同时聆听,用户可以随时打断,Agent 立即让出话筒。实测平滑话轮转换延迟为 448 ms,在用户打断场景下接管率达到 1.00(480 ms)。更值得注意的是:这是首个可以在对话过程中实时调用工具的开源全双工模型。语音 Agent 开发者盯了两年的两个痛点——延迟和工具调用——被一个开源模型同时触及。
VoiceChat 11B 是一种 Mamba/Transformer 混合架构。本质上,NVIDIA 把三个已有组件缝合在一起,然后新增了一条输出通道:

模型同时输出三路流:Agent 音频、Agent 文本,以及用户语音的实时转录。训练消耗了约 55 万小时的真实和合成音频。
在级联架构中调用工具时,对话会陷入尴尬的沉默。VoiceChat 的答案是:工具调用脚本通过专用侧通道发出,开发者为每个工具定义一条"On-Hold"行——当模型生成触发调用的文本时,它说出那一行("稍等,让我查一下那个航班"),API 在后台运行,对话持续流动。约束条件同样明确:每次会话最多 5 个工具;不支持并行工具调用;工具执行期间用户不能打断;系统提示和工具响应必须仅含 ASCII 字符且适合 TTS 合成。
在 Full-Duplex-Bench 1.0 上:448 ms 下的平滑话轮转换 TOR 0.82,480 ms 下用户打断 TOR 1.00。NVIDIA 报告该模型在 VoiceBench 开源全双工模型中排名第二。权重以宽松的 OpenMDW 1.1 许可证发布,可在 vLLM 上运行。但不要急于投入生产。NVIDIA 明确标注该检查点"仅供研究用途",代码库也如实记录了失败模式:音频上下文上限约两分钟;几轮对话后会退化为不可恢复的乱语;话轮结束后偶尔出现不受控的自言自语;用户转录中会出现漏词。硬件门槛是一块 80 GB GPU(A100/H100/B200 系列),目前没有托管 API——没有 GPU 访问权限的团队甚至无法评估。
倒读 VoiceChat 发布内容,结论更清晰:端到端全双工是方向,但 2 分钟的上下文上限、5 个工具的 cap、仅限英语 ASCII 的约束,意味着至少在未来一年内,生产语音 Agent 仍将是级联架构:流式 ASR + LLM 大脑 + 流式 TTS。而在级联架构中,延迟预算和智能上限都落在中间那个 LLM 层。这个层恰恰是灵活性最关键的地方:快速话轮转换需要小模型;复杂请求需要旗舰模型;当某个提供商的 API 出现波动时,需要在秒级切换到备份模型。使用类似 wrouter.ai 的模型网关作为 LLM 层是自然的解决方案——一个 OpenAI 兼容的端点,覆盖主流模型的完整阵容,稳定接口无单一提供商单点故障,统一计费跨所有模型,使得语音工作负载典型的高频微调用不会让你在多个供应商仪表板之间核对发票。一个典型的语音 Agent 大脑层如下:
from openai import OpenAI
client = OpenAI(
base_url="https://wrouter.ai/v1",
api_key="YOUR_WROUTER_KEY",
)
def voice_brain(transcript: str, complex_task: bool):
# 闲聊走快速模型保延迟;
# 复杂请求切换到旗舰模型。
model = "gpt-5.6-sol" if complex_task else "deepseek-v4-flash"
stream = client.chat.completions.create(
model=model,
messages=[
{"role": "system", "content": "Reply in short, conversational sentences suitable for TTS."},
{"role": "user", "content": transcript},
],
stream=True, # 流式 token 以便 TTS 边到边合成
)
for chunk in stream:
if chunk.choices[0].delta.content:
yield chunk.choices[0].delta.content
换模型只需改一个字符串,延迟预算和账单都在同一个仪表板里。
VoiceChat 11B 的意义不在于"今天就能用"——而在于一个完整的、开源的全双工加工具调用的端到端参考实现就摆在那里。级联架构的窗口仍在,但天花板已经画好了。利用这个窗口让你的语音 Agent 的 LLM 层可插拔、可替换,这样当端到端模型成熟时你才能真正迁移。如果你想快速启动一个级联语音 Agent,去 wrouter.ai 拿一个 key 开始测试吧。
MarkTechPost: NVIDIA Releases NemotronLabs VoiceChat 11B — https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling/
Hugging Face model card — https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
GitHub (NeMo Speech) — https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat
Full-Duplex-Bench 1.0 paper — https://arxiv.org/abs/2503.04721