干净英语 Whisper 基准优秀,但生产中静音幻觉问题明显(约高 30%),且缺乏原生流式、说话人分离、实体格式化;AssemblyAI 在这些维度系统性胜出。
Qwen 的音频模型是目前开源研究中最值得关注的工作之一。Qwen3-ASR 功能强大、支持多语言,如果你的团队已经在 Qwen 生态上构建,直接采用它是很自然的选择。模型实力强劲,实际推进中——值得认真对待。
然后有必要根据实际生产环境的需求对其进行压力测试。因为一个强大的开源模型和一个生产级语音平台解决的是有重叠但不同的问题,差距最明显地体现在 Qwen 不是主要为此设计的两件事上:转录以外的一切,以及运行它所需的一切。
Qwen 的优势集中在多语言能力上,所以这是公平的测试场景。多语言转录有一个特定的高难度场景:码切换(code-switching),即说话者在句子中途切换语言——比如 Hinglish、Spanglish 等。这是语音转文字中最严苛的测试之一,不同模型之间的差距非常大。
Universal-3.5 Pro 原生支持 18 种语言的码切换,无需配置,无需单独处理——模型会按照实际说出每个词的语言进行转录。在我们发布的码切换基准测试中,它取得了 7.69% 的平均标准化 WER,远领先于同一音频上其他模型的表现。这是需要超越的能力,而从原始模型构建这套能力可不是加个配置标志就能实现的。
Qwen3-ASR 给你的是文字。生产级功能需要围绕这些文字构建层层能力。
说话人分离(diarization)能处理打断和重叠——与转录联合生成,而非从第二个系统拼凑。实体识别在那些出错就破坏产品的 token 上要保证准确:账号、邮箱、地址、姓名。流式推理适用于任何实时场景——Universal-3.5 Pro Realtime 原生提供分块、中间结果和断点检测,否则你得从零构建这些,因为大多数开源模型都是异步优先。还要在此基础上做脱敏和格式化。
你可以在 Qwen 周围组装出所有这些能力。问题在于:这个组装过程本身就是你的产品,还是让你分心的事。
自由权重模型附带一张 GPU 账单,不管音频是否在流动都得付;面对流量峰值要自动扩缩容,还得有 on-call 值班。托管 API 按秒计费,每月运行数亿次推理调用,支持无限并发——完整的成本分析在置顶文章《自托管开源语音转文字的真正成本》里。
如果你已经深度投入 Qwen 生态、做研究或离线批处理(你控制音频、能保持 GPU 繁忙)、或者你有一个平台团队想要拥有并微调模型,Qwen3-ASR 是一个坚实、灵活的选择。这些都是自托管的合理理由。
Qwen3-ASR 是一个强大的开源模型,尤其适合多语言和研究导向的工作。生产级语音产品需要码切换开箱即用、可靠的说话人分离、实体识别、流式推理和 SLA——而 Universal-3.5 Pro 提供这些能力,无需 GPU 集群和需要维护的技术栈。如果你在做一个产品而不是研究一个模型,这通常是做值得做的权衡。
用自己的音频来验证:在你最难的多语言录音上同时跑 Universal-3.5 Pro 和 Qwen3-ASR,一较高下。
Qwen3-ASR 是阿里巴巴 Qwen 团队推出的开源自动语音识别模型系列,发布于 2026 年初。它包含两个一体化模型(Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B),基于 Qwen3-Omni 构建,支持 52 种语言和方言的语种识别与转录。权重在 Hugging Face 上免费获取,阿里巴巴也通过其 API 提供了托管版本(Qwen3-ASR-Flash)。
Qwen3-ASR 权重可以免费下载,但生产环境运行不是。自托管意味着要付 GPU 费用——不管音频是否在流动都得付——还要自己工程化实现流式推理、说话人分离和格式化,以及保持服务运行所需的 on-call 值班成本。像 AssemblyAI 这样的托管 API 每小时音频收费 $0.21,按秒计费、无最低消费,只为实际处理的音频付费。阿里巴巴托管的 Qwen3-ASR-Flash API 是第三个选择,定价与开源权重分开。
Qwen3-ASR 是一个强大的开源模型 checkpoint,而 AssemblyAI 是一个托管语音平台——两者解决的是有重叠但不同的问题。Qwen3-ASR 提供转录结果,以及自主托管和微调的灵活性;AssemblyAI 的 Universal-3.5 Pro 在转录之上增加了生产级能力层(原生码切换、联合说话人分离、实体识别、流式推理和脱敏),外加 SLA、SOC 2、BAA 和按秒计费。如果你是在做产品而不是研究模型,托管路径通常能减少更多工作。在做决定前,用你自己的音频同时跑一下基准测试。
Qwen3-ASR 主要是一个离线、异步优先的模型,所以实时流式推理和生产级说话人分离不是一键就能用的——你得自己构建分块、中间结果、断点检测和说话人分离。AssemblyAI 原生提供这些:Universal-3.5 Pro Realtime 以约 300ms 的换话检测延迟流式输出中间转录,说话人分离与转录联合生成并针对 cpWER 优化。对于实时或对话类音频,这通常就是自托管成本飙升的地方。
Qwen3-ASR 覆盖 52 种语言和方言,内置语种识别,这让它对多语言工作很有吸引力,不过码切换表现取决于配置。码切换——说话者在句子中途切换语言,如 Hinglish 或 Spanglish——是语音转文字中最难的测试之一。AssemblyAI 的 Universal-3.5 Pro 原生处理 18 种语言的码切换,无需配置,在其发布的码切换基准测试中取得了 7.69% 的平均标准化词错误率。在你自己的多语言录音上测试两者,因为结果因音频差异很大。
当你已经深度投入 Qwen 生态、做研究或离线批处理(你控制音频、能保持 GPU 繁忙)、或者你有一个平台团队想要拥有并微调模型时,Qwen3-ASR 是正确的选择。这些都是自托管的合理理由。对于需要可靠码切换、说话人分离、实体识别、流式推理且不想维护 GPU 集群的实时或面向客户的产品,像 AssemblyAI 这样的托管 API 通常是更低成本、更快上线的生产路径。