评测 14 个商用语音识别 API,Speechmatics Melia-1 最优(6.4% WER),AssemblyAI 次之;揭示批处理、实时流、代码混转等场景需选择不同模型。
我在一台没有 GPU、也没有 API key 的 CPU 设备上,用 faster-whisper 处理了一个 9 秒的 WAV 文件。整个过程耗时 0.6 秒,只识别错了一个词:把“DevToolLab”识别成了“Dev Tulab”。加上一行词汇提示后,错误就修复了,而且完全免费。我在 DevToolLab 上完整对比了托管式和开源 speech-to-text API;下面是精简版。
“Speech-to-text”实际上涵盖了三个彼此独立的问题。第一种是批量转录:文件已经保存在磁盘上,不在乎延迟,更看重每小时成本和专业术语的识别准确率。第二种是用于语音 Agent 的实时流式识别,其中最棘手的并不是转录文本,而是轮次检测:判断来电者只是停顿了一下,还是已经说完。第三种是 text-to-speech,也就是把回复重新转换成音频。
适合某项任务的最佳模型,往往并不适合另一项任务。针对干净音频的批量识别准确率调优过的模型,并不适合驱动电话 Agent;速度最快的流式模型,也未必适合转录一段长达两小时的庭外证词。
2026 年 7 月,一项涵盖 14 个商业模型的基准测试显示,Speechmatics Melia-1 以 6.4% 的综合词错误率位居第一,AssemblyAI Universal-3.5 Pro 以 7.0% 紧随其后,Deepgram Nova-3 则为 8.9%。Melia 真正的优势并不在这个分数,而在于 code-switching:它可以在一次处理中识别 56 种以上的语言,无须提供语言提示。因此,一句话即使以西班牙语开头、以英语结尾,也能得到正确结果,而不会在语言切换处变得一团糟。它的起步价还是每小时 0.129 美元,比那些被它击败的竞品更便宜。
顶级托管服务商之间的准确率差距,已经缩小到大约 2.5 个 WER 百分点,小于干净音频与嘈杂音频之间的差距。对大多数应用来说,这意味着你不应该再只根据准确率选择供应商。
如果你的产品拥有自己的专属词汇、产品名称、SKU 或药品名称,那么相比准确率上的微小优势,这项功能更值得优先考虑。AssemblyAI 的 Universal-3.5 Pro 最多可接收 1,000 个 keyterm,并让转录结果向这些词倾斜:
import assemblyai as aai
aai.settings.api_key = "YOUR_API_KEY"
config = aai.TranscriptionConfig(
speech_models=["universal-3-5-pro"],
keyterms_prompt=["DevToolLab", "Nova-3", "WER"],
)
transcript = aai.Transcriber(config=config).transcribe("meeting.mp3")
print(transcript.text)
开源方案中对应的功能是 Whisper 的 initial_prompt argument。正是这一行配置,让我在前面的测试中把“Dev Tulab”修正成了“DevToolLab”。无论使用哪种方案,一句话的词汇提示所带来的价值,往往都高于为了获得 1 个百分点的 WER 改善而更换供应商。在完整文章中,我进一步分析了附加功能的定价,以及这些费用如何层层叠加,因为账单往往正是在这里悄无声息地翻到三倍。
大多数流式处理管线仍然使用静音计时器来猜测说话者是否已经说完,这正是语音 Agent 经常抢话,或尴尬地沉默两秒的原因。Deepgram 的 Flux 将轮次结束检测直接放进模型内部,在不到 400ms 内判断对方是否真的说完,并将判断结果作为事件发出(说完时发出 EndOfTurn;如果对方再次开口,则发出 TurnResumed)。无论转录准确率有多高,都无法挽救一次糟糕的轮次判断;对于 Agent 而言,这才是真正重要的架构差异。
在过去一年左右的时间里,自托管已经不再意味着妥协。NVIDIA 的 Parakeet TDT 0.6B v3 平均 WER 达到 6.32%,在 A100 上的吞吐量超过实时速度的 3,000 倍,也就是说,它大约只需一秒就能处理完一小时的音频。Whisper large-v3 仍然支持 99 种语言,比任何商业 API 都多。Moonshine 在 Raspberry Pi 等边缘设备上的运行速度最高可达到 Whisper 的 5 倍。如果你的处理量很大,或者数据较为敏感,应该先运行免费的基线方案;只有确认托管 API 的效果确实更好之后,再为它付费。
有两件事会彻底打乱成本模型,但几乎没有人会把它们写在定价页面上。第一,流式服务有时按照连接保持开启的时间计费,而不是按照实际发送的音频计费。因此,当用户阅读页面时,如果一个空闲的 WebSocket 一直保持连接,它产生的费用和持续传输语音的连接完全相同。第二,附加功能的费用会累加:说话人分离、实体检测和主题检测,每项都可能在每小时费率上增加 5~15 美分;同时启用其中四项,可能会让账单达到看似最便宜的基础费率的三倍。你应该根据真正准备上线的配置计算价格,而不是只看醒目的宣传数字。
2026 年最佳 Speech-to-Text 与 AI 语音 API(完整对比、价格表与代码)——DevToolLab 原文
NVIDIA Parakeet TDT 0.6B v3
亲自试用:DevToolLab 上的 Speech to Text and Microphone Test
如果需要采取进一步行动,你可以考虑屏蔽此人和/或举报滥用行为。