语音 Agent 评估框架 EVA 发布
HF 推出 voice agent 的标准化评估框架,为语音 AI 应用的开发和性能对标提供工具。
HF 推出 voice agent 的标准化评估框架,为语音 AI 应用的开发和性能对标提供工具。
对话式语音智能体带来了一项独特的评估挑战:它们必须同时满足两个目标——准确性(正确、忠实地完成用户任务)和对话体验(以自然、简洁且适合口语交互的方式完成任务)。这两个目标紧密交织:如果听错了确认码,那么再完美的 LLM 推理也毫无意义;大量选项会让无法快速浏览语音输出的来电者不知所措;而响应延迟的系统可能通过所有准确性检查,但在实践中仍然无法使用。现有框架将二者视为彼此独立的问题——要么评估任务是否成功,要么评估对话动态,却不会同时评估两者。
我们推出 EVA,这是一个面向对话式语音智能体的端到端评估框架,它使用逼真的机器人对机器人架构,对完整的多轮语音对话进行评估。EVA 会生成两个高层级评分:EVA-A(准确性)和 EVA-X(体验),并且旨在揭示各个维度上的失败。EVA 是首个联合评估任务成功情况和对话体验的框架。我们发布 EVA 时同时推出了首个航空领域数据集,其中包含 50 个场景,涵盖航班改签、取消处理、代金券等;这是计划推出的一系列领域数据集中的第一个。
我们还提供了 20 个级联系统和音频原生系统的基准测试结果,例如语音到语音(S2S)模型和大型音频语言模型(LALM)。我们最重要的发现是,准确性与体验之间存在稳定的权衡关系:在任务完成方面表现良好的智能体往往会带来更差的用户体验,反之亦然。
🌐 网站——探索完整框架、早期结果和演示。
💻 GitHub——深入了解代码、框架和评审模型提示词。
📂 HF 数据集——探索数据集
目前,该领域仍然缺少能够评估语音智能体完整交互质量的框架,因为大多数现有工作都只孤立地评估单个组件。例如,AudioBench、SD-Eval、VoxEval、Kimi-Audio-Evalkit、VoiceBench 和 VoxDialogue 评估语音转文本(STT)的核心语音理解能力——包括转录、副语言信息和声学线索——但仍局限于单轮、非交互式场景。另一方面,EmergentTTS-Eval 和 SHEET 使用主观听感测试(例如平均意见得分)来评估感知语音质量。除语音感知之外,FD-Bench、Talking Turns 和 Full-Duplex-Bench 对对话动态进行了更深入的分析——包括打断、反馈语和轮次交替——但这些评估与面向任务的工具使用彼此割裂,因此没有考察对话质量与智能体能力之间的关系。近期的一些工作,尤其是 VoiceAgentBench 和 CAVA,开始尝试评估商业语音智能体系统的智能体能力,包括工具调用和复杂指令遵循。然而,这些语音智能体能力并不是在语音智能体实际必须处理的完整对话工作流中进行评估的:从用户最初提出请求,到多步骤工具编排,再到最终解决任务。
缺少能够同时衡量准确性与体验的框架,凸显出我们需要一个将语音智能体质量视为整体的框架。这意味着不仅要评估任务是否成功,还要评估智能体在整个过程中能否准确、简洁、自然地进行沟通,并揭示在真实部署条件下这些维度如何相互权衡。
端到端评估能够揭示组件层面无法体现的交互动态:智能体是否会在用户说话时的自然停顿期间打断用户;当用户纠正转录错误时,它能否顺畅地恢复对话;或者高延迟是否会严重破坏对话流程,导致用户重复自己的话,甚至彻底放弃任务。
EVA 通过实时音频模拟多轮语音对话,在此过程中,智能体必须调用适当的工具、遵守特定于任务的策略,并达到可通过确定性方式验证的最终状态。EVA 使用一种由五个核心组件构成的机器人对机器人音频架构来评估语音智能体:
用户模拟器——一种配置了特定目标和角色设定的对话式 AI,扮演来电者的角色。它使用高质量的文本转语音(TTS)模型,以音频形式运行,从而确保评估能够涵盖自然语音对话中具有代表性的语音理解挑战,以及逼真的轮次交替动态。
用户模拟器——一种配置了特定目标和角色设定的对话式 AI,扮演来电者的角色。它使用高质量的文本转语音(TTS)模型,以音频形式运行,从而确保评估能够涵盖自然语音对话中具有代表性的语音理解挑战,以及逼真的轮次交替动态。
语音智能体——接受评估的语音智能体,使用 Pipecat 构建。Pipecat 是一个用于实时语音应用的开源 Python 框架。EVA 同时支持级联架构(STT → LLM → TTS)和音频原生模型(S2S 或 LALM → TTS)。
语音智能体——接受评估的语音智能体,使用 Pipecat 构建。Pipecat 是一个用于实时语音应用的开源 Python 框架。EVA 同时支持级联架构(STT → LLM → TTS)和音频原生模型(S2S 或 LALM → TTS)。
工具执行器——通过自定义 Python 函数提供确定性、可复现工具响应的引擎。它会动态查询和修改为每个场景预先定义的数据库。
工具执行器——通过自定义 Python 函数提供确定性、可复现工具响应的引擎。它会动态查询和修改为每个场景预先定义的数据库。
验证器——一组验证指标,用于检查对话是否完整,以及用户是否忠实复现了预期行为和话语,无需任何人工标注。任何未能通过这一验证步骤的对话都会重新生成,从而确保只有有效且正确执行的对话才会进入评估阶段。这与依赖事后人工标注来识别模拟器错误的方法形成了鲜明对比。
验证器——一组验证指标,用于检查对话是否完整,以及用户是否忠实复现了预期行为和话语,无需任何人工标注。任何未能通过这一验证步骤的对话都会重新生成,从而确保只有有效且正确执行的对话才会进入评估阶段。这与依赖事后人工标注来识别模拟器错误的方法形成了鲜明对比。
指标套件——使用对话录音、转录文本和工具调用日志评估语音智能体的一套指标。
指标套件——使用对话录音、转录文本和工具调用日志评估语音智能体的一套指标。
我们框架中的每个测试用例(场景)都是一条评估记录,其结构经过专门设计,以确保测试可复现:
用户目标——来电者试图完成的事项。它包含一个高度具体的用户目标,以及一棵用于引导用户模拟器完成对话的精确决策树,确保预期结果不存在任何歧义。
用户角色设定——来电者应当如何表现,包括其说话风格、耐心水平和性格特征。
场景数据库——智能体工具将查询的后端数据。
基准真值——对话成功完成后,场景数据库应达到的预期最终状态。
我们随 EVA 一同发布了一个合成的航空领域数据集,其中包含 50 个场景和 15 个工具,涵盖非正常航班运行(IRROPS)改签、自愿变更行程、取消、当日候补以及补偿代金券。场景旨在测试时间推理、策略遵循、约束满足和命名实体处理能力。
在此查看完整演示。
EVA 从两个基本维度评估语音智能体:EVA-A 用于评估准确性,EVA-X 用于评估体验。EVA 还包含一组诊断指标。与主要指标不同,这些指标不会直接用于比较或排名模型,而是提供更细粒度的洞察,解释模型为何得到相应分数,并帮助识别和理解特定的失败模式(例如 ASR、语音合成等)。我们针对每个场景进行三次试验(k = 3),并报告 pass@k(k 次运行中至少有一次成功的概率)和 pass^k(k 次运行全部成功的概率),从而同时衡量峰值表现和行为一致性。
EVA 使用两种评估方法:一种是基于确定性代码的指标,它直接根据结构化数据计算分数,速度很快;另一种是 LLM-as-Judge 指标,它使用大型语言模型(LLM)评估对话的定性特征,或使用大型音频语言模型(LALM)直接评估语音。每个基于评审模型的指标,都会采用在该指标专门整理的评估数据集上表现最好的模型。
仅任务完成度是必要但不充分的准确度衡量标准。智能体可能到达了正确的最终状态,但在这个过程中可能伪造了政策细节、错误朗读了确认码,或在对话中编造了航班号。这些失败对二元通过/失败检查是不可见的,但会直接伤害用户。因此 EVA-A 在三个维度上衡量准确度:
任务完成度[确定性] — 通过将场景数据库中的预期最终状态与对话后的实际最终状态进行比较,衡量智能体是否正确完成了任务。
忠实度[LLM 作为评判者] — 衡量智能体的响应是否与其指令、政策、用户输入和工具调用结果相符 — 标记伪造、误表述、政策违反和幻觉。
语音保真度[LALM 作为评判者] — 衡量语音系统是否在语音中忠实地再现了预期文本,特别关注在语音场景中至关重要的实体,例如确认码、航班号和金额。这是任何端到端语音智能体基准中唯一在音频级别评估智能体自身语音输出质量的指标。
轮流发言的时序很重要,但它只讲述了部分故事。智能体可能有完美的时序,但同时可能用一堵来电者无法略过的语音选项之墙来淹没他们,或反复询问已经给出的信息。这些失败会降低体验,但不涉及任何时序错误的响应。因此 EVA-X 在三个维度上衡量体验:
简洁性[LLM 作为评判者] — 衡量智能体的响应对于语音交付是否恰当简洁和专注,因为电话用户无法略读、重新阅读或回顾长响应。
对话进展[LLM 作为评判者] — 衡量智能体是否有效地推进了对话 — 避免重复、保留跨轮的上下文,并在不停滞的情况下推动任务完成。
轮流发言[LLM 作为评判者] — 衡量智能体是否在正确的时间说话 — 既不打断用户,也不在他们说完后引入过度的沉默。
我们评估了 20 个系统 — 专有和开源、级联和音频原生 — 发现了一致的准确度与体验权衡:在任务完成度上表现良好的智能体往往提供更差的用户体验,反之亦然 — 这种权衡对于仅评分任务完成度的基准是不可见的。没有单一配置在两个轴上都占优,这证实了准确度和体验必须联合测量。
此外,我们发现命名实体转录是一个主导失败模式。单个误听的字符可能级联成认证失败和完整的对话崩溃。另外,多步骤工作流以可预测的方式破坏智能体。在保留辅助服务 — 座位、行李 — 的情况下重新预订航班是所有配置中占优的复杂性破坏者。最后,我们观察到实际应用案例需要额外的校准。pass@3 和 pass^3 之间的差距在所有配置中都很大。即使可以完成任务的智能体也经常无法做到一致完成,这对真实应用的成功至关重要。
在此查看早期结果。
EVA 旨在为对话语音智能体提供严格的端到端评估,但在框架、数据和指标维度上需要承认几个重要限制:
指标 — LLM 作为评判者模型具有固有偏差,可能倾向于某些响应风格,独立于质量,当评估模型和评判模型共享提供者时有额外的系统偏差风险。虽然我们根据标记数据集验证我们的评判者并在我们的网站上报告准确度测量,但这些对齐分数并不能完全消除系统偏差。此外,任务完成度被测量为二元,这不捕获部分学分,可能会低估系统失败优雅与灾难性对比的相对质量。
指标 — LLM 作为评判者模型具有固有偏差,可能倾向于某些响应风格,独立于质量,当评估模型和评判模型共享提供者时有额外的系统偏差风险。虽然我们根据标记数据集验证我们的评判者并在我们的网站上报告准确度测量,但这些对齐分数并不能完全消除系统偏差。此外,任务完成度被测量为二元,这不捕获部分学分,可能会低估系统失败优雅与灾难性对比的相对质量。
仿真 — 当前版本涵盖单一领域(航空)中的 50 个英语场景;结果可能无法推广到其他领域、语言或口音。此外,用户模拟器可能无法完美复制真实来电者行为(例如,流利性不足、犹豫、情感)或保证完全的政策遵从。
仿真 — 当前版本涵盖单一领域(航空)中的 50 个英语场景;结果可能无法推广到其他领域、语言或口音。此外,用户模拟器可能无法完美复制真实来电者行为(例如,流利性不足、犹豫、情感)或保证完全的政策遵从。
框架 — 用户模拟器依赖于单个商业提供商,其语音特性可能系统性地偏向某些 ASR 系统,而机器人到机器人管道 — 包括音频格式转换和实时音频接口 — 可能不能完全代表生产部署。此外,完全重现需要商业 API 访问,而延迟测量将在提供者和基础设施中有所不同。
框架 — 用户模拟器依赖于单个商业提供商,其语音特性可能系统性地偏向某些 ASR 系统,而机器人到机器人管道 — 包括音频格式转换和实时音频接口 — 可能不能完全代表生产部署。此外,完全重现需要商业 API 访问,而延迟测量将在提供者和基础设施中有所不同。
在评估方面,我们计划添加韵律质量评估(发音、节奏、表达性) — 在发现 LALM 作为评判者与人类判断之间的对齐非常低后,这目前是一个开放问题。我们还计划在嘈杂条件、不同口音、多语言用户和不同说话者行为下进行稳健性测试,以及对智能体如何响应用户困扰的情感感知评估。在数据方面,我们正在开发额外的领域数据集 — 每个都具有不同的政策结构、命名实体配置文件和对话动态 — 以及涉及复合请求、多步骤后续跟进和更长对话记忆的更复杂场景。在工具方面,我们将发布一个结果和错误分析应用程序,自动识别每个指标和模型的错误,显示代表性示例以供探索,并生成每个模型优势和劣势的结构化摘要。最后,我们打算持续扩展排行榜,提供对整个领域语音智能体能力的最新评估。
在此查看有关限制和我们即将推出的路线图的更多详情。
核心贡献者包括 Tara Bogavelli、Gabrielle Gauthier Melançon、Katrina Stankiewicz、Oluwanifemi Bamgbose、Hoang Nguyen、Raghav Mehndiratta 和 Hari Subramani。
我们还感谢 Lindsay Brin、Akshay Kalkunte、Joseph Marinier、Jishnu Nair 和 Aman Tiwari 对数据的仔细审查和对框架的深思熟虑的贡献,以及 Fanny Riols、Anil Madamala、Sridhar Nemala 和 Srinivas Sunkara 在整个过程中的管理、领导和支持。我们还感谢 PAVA 和 CLAE ServiceNow 团队,他们之前在评估和语音智能体方面的工作为这个项目提供了宝贵的灵感。
@misc{eva-2026,
title={A New End-to-end Framework for Evaluating Voice Agents (EVA)},
author={Bogavelli, Tara and Gauthier Melançon, Gabrielle and Stankiewicz, Katrina and Bamgbose, Oluwanifemi and Nguyen, Hoang and Mehndiratta, Raghav and Subramani, Hari},
year={2026},
url={https://github.com/ServiceNow/eva}
}
本文提及的数据集 1
来自本作者的更多内容
语音智能体能否处理双语客户?在代码切换语音上对最先进 ASR 的基准测试
EVA-Bench 数据 2.0:3 个领域,121 个工具,213 个场景
· 注册或登录以评论