语音AI助手的噪声消除技术进展
Krisp分享噪声消除对AI语音Agent转圈效率的提升效果,有助于改善语音交互应用的用户体验。
Krisp分享噪声消除对AI语音Agent转圈效率的提升效果,有助于改善语音交互应用的用户体验。
AI Voice Agents 正在快速演进,为客户支持自动化、虚拟助手、游戏和远程协作平台等关键应用场景赋能。要使这些语音驱动的交互感觉自然流畅,底层音频管道必须对噪声具有韧性、响应迅速且准确——尤其是在实时场景中。
在典型的部署中,音频流来自各种端点,如移动应用、Web 浏览器或传统电话,并通过 WebRTC 或 WebSockets (WSS) 等实时通信协议传输。这些音频由 LiveKit、Daily 或 Agora 等专业提供商管理和聚合,确保低延迟、可靠的音频传输到服务器端管道。
在服务器管道内,音频到达后会经过可选的预处理步骤进行格式化或基本调整,随后直接进入 Voice Activity Detection (VAD)。
VAD 识别活跃的语音片段,驱动自动端点检测和智能中断处理。在用户说话后,当 VAD 检测到沉默时,相关 API 事件会触发下游 Voice AI 模型生成和传递响应。如果用户在语音机器人生成响应期间重新开始说话,管道会无缝取消正在进行的输出并清空缓冲区,确保自然的对话轮流。
在这个场景中,背景噪声——如音乐、交通声、电视或附近的对话——仍然嵌入在音频流中,未经过滤就到达 VAD 模块。由于 VAD 设计用于检测人类语音活动,这些背景声音往往会导致误正例语音检测。因此,VAD 错误地将噪声或背景语音解释为活跃的用户语音,触发意外的中断。这些假阳性触发对轮流对话产生负面影响,而轮流对话是自然、类似人类的对话交互的核心部分。
通过将 Krisp 背景声和噪音消除放在 VAD 之前,管道大幅减少了假阳性触发,并防止来自常见背景干扰的中断。
此外,Krisp 通过提供更清晰的音频,显著提高了下游语音处理的准确性。
我们很高兴宣布推出 Krisp Server SDK,其中包含两个为 AI Voice Agents 实现卓越噪音消除而专门设计的先进 AI 模型。
与我们的设备端 AI 模型相比,这些模型经过优化,可在具有挑战性的边界情况下提供无与伦比的性能和语音质量。
这两个模型都能消除背景噪声、闲聊和次要语音,确保仅保留和清晰呈现主讲者的语音。
BVC-tel(通用模型):设计为稳健、多功能的解决方案,适用于各种音频源,包括 WebRTC、移动和传统电话输入。特别针对由常见电话编码器(如电信网络中广泛使用的 G711 编码器)引入的音频失真具有高度的抗干扰能力。支持高达 16 kHz 的音频采样率,这对 AI Voice Agents 来说是最优的,因为它能有效捕获人类语音的基本频率范围。
BVC-app(高保真模型):专门针对需要高质量音频流的 WebRTC 用例进行优化。支持高达 32 kHz 的更高采样率,实现更清晰、更自然的语音交互,适合要求卓越音频保真度的应用。ℹ️ 如果传入的音频源的采样率高于模型支持的采样率(例如 48 kHz),SDK 会通过自动将其下采样到模型的工作速率、应用噪音消除,然后无缝上采样回原始音频质量来智能管理音频处理。
尽管质量有显著提升,但服务器端模型仍保持低算法延迟,仅为 15 毫秒,与我们的设备端模型相同。这确保了实时响应性,这对于对话交互至关重要。
新的 Krisp Server SDK 模型经过 CPU 优化,支持多个平台,包括:
我们全面评估了新的背景声和噪音消除 (BVC) 模型如何改进轮流对话准确性和语音识别质量。
使用 BVC-tel 模型,我们特别测试了两个不同的音频管道场景:
以下图形和音频示例演示了一个典型示例:Krisp BVC 在与 AI Voice Agent 交互时有效消除背景电视语音。
红色圆圈区域代表电视语音。绿色圆圈区域代表主讲者的语音。
在以下部分中,我们进行了更全面的评估,以捕获和量化轮流对话和 STT 中 WER 的改进。
数据集:我们选择了广泛使用的 AMI 语料库,特别是个人耳机录音。这个数据集非常理想,因为它包含背景对话和噪音的真实混合,代表了许多典型的移动和电话场景。
Voice Activity Detection:最新版本的开源 SileroVAD
Speech-To-Text 模型:Whisper V3(基础版本)。在我们的测试中,基础版本和大版本之间的差异微不足道,因此我们仅呈现基础模型的结果。
在 AMI 数据集中应用 Krisp BVC 上游处理,对 VAD 精度产生了明确的积极影响——特别是在减少假阳性语音检测方面。较低的假阳性对确保平稳、不间断的对话体验特别重要。
我们的测试表明,使用 Krisp BVC,VAD 中的假阳性触发平均减少了 3.5 倍。这意味着 AI Voice Agent 因背景语音或噪声导致意外中断的可能性大大降低。总体而言,Krisp BVC 后的精度提高了超过四分之一——这是一个巨大的进步。
使用 Krisp BVC 也明显降低了 Whisper V3 模型在 AMI 数据集上的词错误率 (WER)——实现了超过 2 倍的改进。考虑到 Krisp 在消除分散注意力的背景语音方面的有效性,这个结果符合预期。
有趣的是,在 BVC-VAD 和 BVC-VAD-STT 两种模式下,WER 改进都是一致的。
为了进一步探索这一点,我们评估了另一个背景语音最少的数据集:ITU-T P.501 数据集,其混合了单讲者音频与 24 种不同的噪音类型,分别在三个强度级别(0db、5db、10db)。
现代 STT 模型(包括 Whisper)通常具有强大的内置噪声鲁棒性。我们的目标是测量通过在上游应用 Krisp BVC 可以实现的任何进一步的 WER 改进。
确实,与 AMI 数据集相比,在这种情况下 WER 指标普遍低得多。
在 BVC-VAD 模式下,Whisper 对原始音频进行操作,同时利用 Krisp BVC 处理的音频来增强 VAD,我们观察到 WER 提高了 18%。
相反,在 BVC-VAD-STT 模式下——Whisper 处理 Krisp 修改的音频——WER 大约增加了 2 倍,尽管绝对 WER 数字仍然相对较低。这个增加归因于 Whisper 在训练期间从未遇到过 Krisp NC 处理的音频,这可能会导致这种修改音频的性能不佳。
💡 注意 BVC-VAD-STT 模式下的 WER% 结果在其他数据集和 STT 引擎上可能有很大差异。我们建议尝试 BVC-VAD 和 BVC-VAD-STT 两种模式,以确定最适合您的音频管道设置。
总的来说,这些评估表明,在 AI Voice Agents 管道中融入 Krisp BVC 会大幅改进轮流对话和语音识别质量,尤其是在背景噪声和次要对话普遍存在的现实场景中。