Qwen-Audio-3.1 可自主决定何时说话、调用工具并推理,在任务成功率与抗背景干扰指标上均有显著提升。
Alibaba 的 Qwen 团队发布了 Qwen-Audio-3.1,这是一套包含 5 个模型的音频技术栈,涵盖 ASR、TTS 和实时交互。主模型是 Qwen-Audio-3.1-Realtime,这是一个全双工语音模型,专为调用工具的语音智能体设计。Qwen 同时大幅降价:Realtime 约降价 85%,TTS 约降价 70%,ASR 最高降价 95%。
可以,通过托管 API 方式部署。qwen-audio-3.1-realtime-plus 已在 QwenCloud 上基于 WebSocket 提供服务。目前未公布开源权重。
模型页面列出了文本和音频作为输入和输出。上下文为 262K tokens,其中最大输入 245K,最大输出 16K。默认限制为每分钟 60 个请求和 100K tokens。定价为每百万音频输入 tokens 6.4 美元,每百万文本输入 tokens 0.8 美元。文本和音频混合输出的费用为每百万 tokens 24 美元,输出的文本不收费。主要功能包括函数调用、网页搜索、结构化输出、上下文缓存和微调。
配套模型 Qwen-Audio-3.1-ASR-Flash-Filetrans 面向离线长音频转录场景。支持热词、说话人分离、标点以及多语言和中文方言识别。费用为每百万输入 tokens 0.15 美元,输出 0.47 美元。
系统运行 2 个模型,它们使用相同的 Audio Encoder 和 LLM 设计。全双工决策模型预测是继续聆听、发言、停止还是恢复。语音转文本模型将回复内容写成文本。然后,上下文感知的语音渲染器将该文本转换为流式语音。它以对话历史、语音线索和声学上下文为条件。
训练组织为 3 层:Think、Act 和 Speak and Coordinate。
Core-Cocktail SFT 使用百万小时级别的配对数据,将音频模型重新锚定到其源文本 LLM。随后进行多模态 OPD。一个 Text Teacher 和一个冻结的 Audio Reference 对学生自身轨迹的每个 token 进行评分。这是 on-policy 蒸馏,而非对预写答案的模仿。然后用 GRPO 训练共情、语用意图和声学场景领域专家。多教师 OPD 将它们合并为 1 个可部署模型。
每个训练领域捆绑了一个工具池、一个有状态的 JSON 数据库和一条自然语言业务策略。领域从开源工具和 MCP server 定义中种子生成。每个任务定义 3 种结果之一:写入、有据的拒绝或不支持的请求。评分先检查终端状态,然后检查允许的写入,最后检查行为断言。流畅的回复无法挽救失败的状态检查。
GRPO 在对话、里程碑和轮次级别接收奖励。搜索训练用以下公式惩罚冗余查询:
rquery = q * min(1, n_ref / n_pred)
每次搜索调用的平均查询数从 4.37 降至 1.05。触发 F1 从 60.87% 微降至 58.61%。
在 Full-Duplex-Bench v1.5 上,对正在与他人交谈的人回复的比例从 0.13 降至 0.03。在 v3.0 上,填充词率从 0.7590 降至 0.2960。但存在权衡。被打断后,不想要的恢复率从 0.035 升至 0.130。打断停止延迟为 1.116 秒,而 GPT-Realtime-2 为 0.383 秒。
探索 Think、Act、Speak 循环、双工决策、评分训练 episode 和搜索奖励。
相比 3.0,Audio MultiChallenge 从 47.12 升至 52.21。14 种语言的 BBA 平均值从 81.7% 升至 88.1%。FLEURS WER 从 9.01 降至 3.98。τ-Voice 数字使用了半双工语音转文本适配。它们与官方全双工结果不可比。GPT-Realtime-2 在 50 场人工红队研究中仍领先,96.00% 对 92.00%。
| 功能 | Qwen-Audio-3.1-Realtime-Plus | OpenAI GPT-Realtime-2 | Google Gemini 3.8 Live |
|---|---|---|---|
| 输入 | Text, audio | Text, audio | Text, images, audio, video |
| 输出 | Text, audio | Text, audio | Text, audio |
| 上下文 / 输入限制 | 262K | 128K | 131,072 |
| 最大输出 | 16K | 32K | 65,536 |
| 函数调用 | Yes | Yes | Yes (async by default) |
| 内置网页搜索 | Yes | Not listed | Google Search grounding |
| 推理 | Thinking mode, 2K max reasoning | Configurable effort | Interleaved reasoning |
| 每百万音频输入 tokens | $6.4 | $32 | $3.00 |
| 每百万音频输出 tokens | $24 (text and audio) | $64 | $12.00 |
| 开源权重 | No | No | No |
价格信息截至 2026 年 9 月 28 日的列表价。Token 费率不可直接比较,因为每个提供商的音频分词方式不同。
任务成功率在 τ-Voice 适配上相比 3.0 从 78.4% 升至 82.0%。
在 Full-Duplex-Bench v1.5 上,对背景语音的回复率从 73.0% 降至 13.0%。
262K 上下文、函数调用和网页搜索,每百万音频输入 tokens 6.4 美元。
工具使用在自我进化的可执行环境中用 GRPO 训练。
多轮攻击成功率降至 26.0%(中文)和 23.5%(英文)。
Qwen-Audio-3.1-Realtime 是什么? Alibaba Qwen 团队的全双工语音模型,面向能够推理、调用工具和管理话轮转换的语音智能体。
能自托管吗? 未公布开源权重。可通过 QwenCloud API 访问,服务名为 qwen-audio-3.1-realtime-plus。
费用是多少? 每百万音频输入 tokens 6.4 美元,每百万输出 tokens(文本和音频)24 美元。