8.0
热点
AI SCORE
开源项目2026-09-27 19:01
Nvidia开源100M参数说话人分离模型,最多实时识别8人
The Decoder#Nvidia#语音识别#开源模型
Editor brief · 编辑速览
Nvidia发布Nemotron 3 Diarization模型,可实时识别对话中最多8个不同说话人,已免费开放。
Nvidia 发布 Nemotron 3 Diarization,这是一款能够识别对话中当前说话者的 AI 模型。该模型约有 1 亿参数,权重可免费获取。它能区分最多 8 名说话者,并检测多人同时说话的情况。参与者越多、背景噪音越重或混响越明显,错误率就越高。配合 Parakeet 等语音识别系统,该模型可以生成带说话者标签的转录文本,不过标签是匿名形式,如"speaker_2"。它支持录音和实时音频两种模式。
在 VoiceArena Diarization Benchmark v1 中,可免费获取的 Nemotron 3 以 14.7% 的 DER 领先,并比其前身 Streaming Sortformer 提升了 41%。

音频缓冲区可设置为四个等级,从 30.4 秒到 0.32 秒不等。缓冲区越短,通常准确率越低。在 VoiceArena 的 Diarization-Bench 上,该模型目前以 14.72% 的错误率位居第一,领先于紧随其后的系统(19.3%)。该基准测试非常严格,重叠语音会被计入错误,甚至说话者转换时微小的对齐偏差也会被判定为错误。相比前身 Streaming Sortformer,在使用 1.04 秒缓冲区时,新模型的错误率在八个测试场景中平均降低了 41%。
AI News Without the Hype – Curated by Humans
订阅 THE DECODER,享受无广告阅读、周报 AI 通讯、每年六期的独家"AI Radar"前沿报告、完整档案访问权限,以及评论 section。