发布评测工具用于衡量语音 AI 的人类听觉质量,为语音应用提供量化指标。
语音正在迅速成为 AI 的主要交互界面。从客户支持、医疗健康到教育、娱乐和个人助理,语音正日益取代文本,成为人们与 AI 交互的方式。
过去几年里,语音模型取得了显著进步。词错误率持续下降,延迟已达到自然对话所需的水平,许多成熟的 benchmark 也正趋于饱和。然而,任何经常使用语音 AI 的人都知道,它给人的感觉仍然有些不对劲。
在一段对话过程中,语音模型可能听起来像是换了不同的人;它们可能察觉不到迟疑或不确定,也难以应对口音、噪声或带有情绪的语音。这些缺陷很容易被只关注延迟和词错误率的 benchmark 忽略。人们真正关心的是:语音系统能否真正倾听、恰当地回应,并在真实对话中始终保持自然与可靠。
为了衡量这些能力,我们构建了 Real World VoiceEQ——一个用于评估语音交互是否具有人类品质的 benchmark。它会评估语音系统能否识别、生成并回应文字转录中缺失的声学信息,包括语气、情绪、说话者身份以及背景环境。
Real World VoiceEQ 对 40 多个领先的闭源及开源语音模型进行了评估,覆盖 15 个以上的关键评估维度,以及 60 多项指标,横跨 Automatic Speech Recognition(ASR)、Text-to-Speech(TTS)、Speech-to-Speech(S2S)和 Speech Understanding。
Real World VoiceEQ 基于超过 100 万条独立的人类评分开发而成,这些评分覆盖了不同的人口统计群体、说话风格和声学环境。目前的 benchmark 包含 78.5 万条 TTS 评分和 4.8 万条 STS 评分,是迄今规模最大的语音 AI 人类评估之一。
每项评估都是通过 Kairos 完成的。Kairos 是我们灵活的、以语音为原生形态的评估平台。同一套基础设施还支持前沿 AI 实验室和企业针对具体用例开展定制评估,识别生产环境中语音系统的细粒度故障模式,生成人类偏好数据,并通过 reinforcement learning 和人类反馈持续改进模型。
围绕单一“最佳”语音模型的竞赛,正在让位于一系列专业化能力之间的竞争。
如今的领先系统分别针对不同优势进行优化,包括技术准确性、情绪理解、对话智能、表现力和鲁棒性。一个擅长复述预订参考编号、银行账户信息或复杂药品名称的模型,可能难以生成富有情感表现力的语音。另一个模型听起来可能非常自然,却在强调精确性的任务上不够可靠。
随着语音 AI 日趋成熟,要衡量其进步,就越来越需要分别评估这些能力,而不是将它们压缩成一个总体分数。在我们的 TTS 评估中,没有任何一种系统配置能在全部八个能力组中都进入前五名——这也进一步说明,根本不存在单一的“最佳”语音模型。
在我们评估的所有类别中,Speech-to-Speech 模型的表现差异最大。有些系统识别情绪的能力极其出色,却难以做出自然的回应。我们发现,能够访问音频,并不意味着 Agent 一定会使用其中包含的副语言信息。一些系统在很大程度上仍由文字转录驱动,只依赖人们说出的词语,却忽略了语气、节奏、迟疑、重音和音量等线索。
人类会自然地利用这些线索,判断一个人是否自信、不确定、沮丧、讽刺或富有同理心。而如今的模型往往会遗漏这些信息。
想象一下,一名银行 Agent 询问你是否认得一笔可能存在欺诈风险的交易。坚定的“是”和迟疑的“……是……”可能意味着完全不同的事情,尽管二者的文字转录一模一样。人类能立刻意识到其中的差异,但如今的许多语音模型做不到。
许多成熟的 benchmark 正逐渐触及上限,而且无法反映真实世界中的条件。模型在面对带口音的语音、多人声音重叠、情绪、背景噪声和较长对话时,依然表现不佳。在我们的评估中,领先的开源与闭源模型之间的性能差异,远比传统 benchmark 所呈现的更大。例如,在一项测试中,带噪声背景的语音转录词错误率约为音乐背景语音的四倍。这说明,单一的背景音频评分可能会掩盖真正的故障模式。
在初步研究中,我们发现了一些迹象,表明某些模型可能专门针对成熟的公开 benchmark 进行了优化。有几个模型会复现参考转录中已知的错误,遵循任意指定的拼写约定,甚至还会还原音频中根本不存在、已被遮蔽的单词。
如今,LLM 已被广泛用于评估文本模型,但我们的研究结果表明,在语音评估中使用 speech-language model(SLM)时应更加谨慎。当我们在 Text-to-Speech 评估中比较领先 SLM 与训练有素的人类评分者时,二者在答案明确且可以验证的任务上具有最高的一致性,例如发音准确性。
在更主观的评估中,二者的一致性则有所下降。SLM 有时似乎会根据文本中的上下文线索推断情绪;而在开放式判断中,一致性最低,例如判断某种声音是否适合某个表演角色,或者是否始终保持一致的身份特征。自动化评估器对于定义明确的任务很有价值,但当判断依赖声学上下文、感知和社会性解读时,它们还无法取代人类听众。
随着语音成为 AI 最具代表性的交互界面之一,速度和技术准确性将不再是决定系统能否成功的唯一因素。人们最终选择的模型,将是那些能够像人类一样理解、表达和回应的模型——不仅要在理想的 benchmark 条件下做到这一点,还要能应对真实世界对话的复杂性。
数十年来,语音 AI 一直通过针对标准化 benchmark 上的量化指标进行优化而不断进步:从衡量转录准确性的 WER,到衡量语音质量的 PESQ 和 DNSMOS 等客观感知指标。我们希望 Real World VoiceEQ 能够扩展这一范式,为评估合成语音交互的各个组成部分提供一种以人类体验为基础的指标。
阅读完整的技术报告并查看公开排行榜,或者联系我们,了解 Hume 如何使用 Real World VoiceEQ 评估你的语音模型或 Agent,以及如何针对你的具体用例设计定制评估。
· 注册或登录后发表评论