8.0
热点
AI SCORE
模型发布2026-09-23 20:31
阿里 Qwen Audio 3.1 发布:语音识别/TTS 多模型,API 价格最高降 95%
The Decoder#Qwen#语音识别#TTS
Editor brief · 编辑速览
Qwen 发布 Audio 3.1 系列五款模型,覆盖 ASR、TTS、实时交互,新增多说话人识别与情感检测,API 价格大幅下调。
阿里巴巴 AI 团队 Qwen 发布了 Qwen-Audio-3.1,这是一套包含五个模型的阵容,用于语音识别(ASR)、文字转语音(TTS)和实时交互。ASR 模型提升了多语言和方言识别能力,并自动清理填充词和重复内容。ASR-Next 新增多说话人识别和时间戳功能,并能检测情绪、环境声音和机器噪音。TTS 处理多语言合成,支持自然的跨语言声音转换。用户通过简单的文本提示控制情绪、语速和风格,例如"用尖锐、命令式的语气朗读,要求获得尊重"。
TTS-Next 将语言模型与扩散方法配对,在单次传递中生成语音、音效和背景音频。实时模型支持同时说话和倾听,并可即时中断。据 Qwen 介绍,当检测到低情绪时,它会以更慢、更富同理心的方式回应。阿里巴巴同时大幅降价。TTS 下降约 70%,Realtime 约 85%,ASR 高达 95%。更多详情见博客和 Qwen Cloud。