Hugging Face推出FFASR排行榜,为开发者提供真实场景下ASR模型的性能对比参考,助力选型。
📉 差距是真实存在的,而且规模很大:在所有提交的模型中,低 SNR 下的 far-field WER 始终比同样语音内容的 near-field WER 高出数倍
🔬 你可以信赖的方法论:混合波基模拟、sim-to-real 验证、beta 版移动源划分、保留的测试音频,以及所有提交项的标准化评估硬件
⚡ 精度与速度兼具:Pareto 前沿图将平均 WER 与 RTFx 对标,你可以评估适合你部署的权衡方案
👀 更多功能即将推出:多说话者场景、麦克风阵列支持和回声消除都在路线图上
基准测试性能与真实场景部署之间的差距是 ASR 开发中最持久的挫折之一。在标准评估中表现良好的模型,一旦涉及真实的房间声学条件就会表现不同:混响、背景噪声、麦克风距离。这些因素之间的复杂相互作用会以干净语音基准无法捕捉的方式影响性能。FFASR Leaderboard 是我们量化这一差距的尝试。
Treble Technologies 和 Hugging Face 联合推出了 Far-Field ASR (FFASR) Leaderboard,这是第一个开放的、社区驱动的基准测试,旨在评估 ASR 模型在现实的 far-field 声学条件下的表现。它已经上线,我们邀请社区提交模型、探索结果,并帮助塑造未来的方向。
语音界面已经远远超出了耳机和智能手机的范围。AI 语音代理、会议室转录、车内助手、人形机器人、智能眼镜和免提工具都在快速采用。它们的共同点是在声学复杂的环境中运行:混响、背景噪声、重叠的声音,以及可能距离说话者一到几米的麦克风。
主流的 ASR 评估范式还没有跟上这一现实。干净、近距离麦克风的基准仍然是标准,虽然它们对测量核心识别质量很有用,但无法预测 far-field 性能。在 LibriSpeech 或其他 near-field 数据集上表现良好的模型,一旦涉及真实房间声学就可能大幅性能下降。虽然有多项关于 far-field 和嘈杂语音评估的研究工作——包括 CHiME、URGENT 和 NOIZEUS——但社区还没有一个标准化、开放的方式来持续衡量这种性能退化,也没有一个不断更新的排行榜格式跨模型进行比较。这就是 FFASR 的用途所在。
far-field 评估的一个主要挑战是数据的可用性。在具有代表性的房间类型、麦克风距离和噪声条件范围内大规模收集 far-field 录音,仅靠物理测量成本高得不可接受。模拟使得能够系统地覆盖这个空间,并随着时间推进扩展覆盖范围,而不会相应增加测量成本。
FFASR 的另一个目标是鼓励开发对这些条件明确具有鲁棒性的模型。排行榜历来在引导研究方向上很有效。通过使 far-field 性能可见且可比较,我们希望提高整个领域对真实场景声学鲁棒性的优先级。
FFASR Leaderboard 在九个条件下评估模型。决定主要排名分数的四个条件是(截至 2026 年 6 月 22 日):
Near-field (dry) — 在消声室中测量的干净语音(类似于 LibriSpeech,但混响最小)
Far-field 高 SNR(14 dB 以上)
Far-field 中 SNR(8 到 12 dB)
Far-field 低 SNR(6 dB 以下)
为了让你了解这些条件听起来的样子,下面的样本让你听到同一个语音话语首先作为干燥消声室音频,然后与房间脉冲响应卷积,最后在每个 SNR 层添加噪声。干燥录音和低 SNR far-field 条件之间的差异是理解排行榜所测量问题规模的合理代理。
另外两列"Lab Measured"和"Lab Simulated"充当 sim-to-real 验证跑道。排行榜还包括移动源划分,目前处于 beta 版本,评估模型对说话者在运动而非静止的音频的识别。这个条件反映了人形机器人、车内语音和移动语音助手等用例,其中说话者和麦克风之间的声学几何关系不断变化。
声学数据使用 Treble 的混合模拟引擎生成,该引擎在低至中频率范围内结合了基于波的求解器与较高频率的几何声学建模。这种方法捕捉了较简单模拟方法经常遗漏的物理现象:衍射、散射、干涉和模态行为。结果是模拟数据与测量的声学条件非常接近,"Lab Measured"和"Lab Simulated"列通过在两者上运行相同的评估直接确认了这一点。
基准测试中包含了 14 个配置完整的房间,范围从 20 到 470 m³,覆盖浴室、带走廊的客厅、办公室、教室和餐厅空间。每个声学场景包含一个目标说话者(在消声室中录制以避免录制环境的混响伪影)和最多三个噪声源。每个场景都包括诸如咳嗽这样的瞬态噪声源和诸如 HVAC 这样的连续噪声源,分别在三个 SNR 等级上。这个覆盖范围旨在反映已部署的语音系统运行的实际多样化空间。
除了 WER 之外,排行榜为每个提交项报告 RTFx(推理秒数对应的音频秒数),在相同条件下的 NVIDIA L4 GPU 上评估。精度和延迟在真实部署中都很重要,分析选项卡中的 Pareto 前沿视图使这一权衡明确可见。
这个基准测试是通过 Treble Technologies 专有模拟引擎的模拟声学空间构建的。该引擎输出的一个例子可以在去年发布的 Treble10 数据集中找到,该数据集建立了模拟管道,并为训练和研究提供了可用的 far-field RIRs。FFASR 将该基础扩展为具有保留测试集、一致归一化和自动评分的标准化评估框架。
随着排行榜上线,所有提交的模型中呈现出一致的模式:near-field 和 far-field 性能之间的差距很大,并且随着 SNR 下降而显著增加。Near-field WER 值,在干净的干燥语音上,看起来与同一模型在既有基准测试上所达到的相当。Far-field 低 SNR 下的 WER 呈现出不同的情况,通常高出数倍。该基准测试使这种性能退化可见且可比较,这在专有评估管道之外之前很难做到。
平均 WER 与 RTFx 的 Pareto 前沿也很有启发意义。当前提交项中展示了各种真实的方法:优先考虑速度而牺牲一些精度的模型、在吞吐量成本下追求精度的模型,以及在两个轴上都达到竞争性位置的较少数量的模型。将这些权衡与 far-field 精度而不是干净语音精度进行可视化,产生了关于系统之间真实差异在哪里的本质上不同的图景。分析选项卡值得探索,超越主排名表。
开发者值得关注的一个观察是:排行榜并排报告 near-field(干燥)和 far-field WER。这种分离是有意的且有用的。它使得可以区分真正精确的模型和精确但对声学条件敏感的模型,这对于决定是否投资 far-field 微调、语音增强预处理或不同的架构都很重要。
在 FFASR Leaderboard 上打开"Submit"选项卡,粘贴一个 Hugging Face 模型 ID,评估会针对保留的数据集在服务器端运行。该管道支持 Whisper 变体、IBM Granite Speech、Cohere Transcribe、Wav2Vec2 和 HuBERT CTC heads、SpeechBrain ASR,以及 Hub 上的大多数其他 ASR 架构,无需任何自定义配置。
对于使用更复杂推理堆栈的团队,包括结合语音增强与 ASR 的系统,自定义评估器选项允许你定义自己的 evaluate() 函数。自定义评估器在审核者审查后在 Hub Jobs 上运行,提交说明字段是记录任何预处理步骤的好地方,以便结果对其他人可解释。
保留的评估集使用 2,000 个消声室语音样本,跨越 14 个房间和三个 SNR 层级,每个条件约 8 小时的音频,应用了一致的 Whisper 风格文本归一化。音频未暴露给提交者,以避免测试集污染。
我们正在积极探索的未来跑道的条件包括多说话者场景(多个说话者同时活跃),麦克风阵列评估(涵盖波束成形和空间滤波方法),以及回声消除(与任何在播放音频的同时也在听的设备相关)。
我们接下来构建的内容将取决于社区告诉我们差距最大的地方在哪里。如果你在一个不能很好地由当前基准测试代表的部署环境或用例中工作,我们想听听你的意见。FFASR Leaderboard 设计为可增长的,它增长的方向应该反映真实的需求。
提交你的模型,探索分析选项卡,在 FFASR 论坛上发布你的想法和建议,帮助我们构建一个对该领域正在处理的问题真正有用的基准测试。
本文中提及的 Spaces 1
本文中提及的 Collections 1
我们博客的更多文章
介绍 Real World VoiceEQ:衡量语音 AI 的人工质量
向开放 ASR 排行榜添加 Benchmaxxer 驱虫剂
非常需要且非常酷的工作!
顺便说一句,我一直在脑海中酝酿一个相关的想法:有一类合成音频场景在自然界中不真正发生,但对真实部署来说既棘手又相关。
最近大多数 ASR 模型似乎都针对干净的会议转录而设计。但如果你运行 Granola 风格的设置,提取机器上的每个音频流并将它们混合在一起,事情很快就会变得混乱。会议的系统音频、你的物理硬件麦克风,有时候你自己的声音通过会议回声返回,都可以混合/延迟/嘈杂地在模型看到的同一轨道中。(我自己用 VibeVoice 来处理这个,因为我觉得它会更健壮;它坚持得还不错,但我没有做过真正的比较)
像这样的混合多流音频似乎是这个基准测试测量的那种鲁棒性/"真实场景"的自然契合点,即使它是一个合成条件而不是一个录制的房间
· 注册或登录以评论
本文中提及的 Spaces 1
本文中提及的 Collections 1