基于Interleave架构的同声传译模型,支持60语言理解和29语言输出,通过WebSocket API提供服务,可用于国际化应用。
Qwen(通义千问)发布了 Qwen3.8-LiveTranslate,下一代实时同声传译模型。它能够监听直播语音(可选视频帧),在说话人还在讲话时就返回翻译文本和语音。其核心改进在于全新的 Interleave(交错)架构。Qwen 报告在忠实度、流畅度和简洁性上均有提升,平均延迟(LAAL)从 2.8 秒降至 2.3 秒。此次发布还新增了实时说话人身份标注、双语同步显示,以及长上下文消歧功能。
是否支持部署?支持,以托管 API 的形式提供。在阿里云 Model Studio 和 QwenCloud 上线,模型 ID 为 qwen3.8-livetranslate-flash-realtime,通过 WebSocket 访问。
同声传译本质上是一个取舍问题:等待时间越长,模型获得的上下文越丰富;说话越早,听众的延迟就越低。Qwen3.8-LiveTranslate 用 Interleave 架构重新构建了这一循环。
这里的延迟指标是 LAAL(Length-Adaptive Average Lagging,长度自适应平均延迟)。它衡量翻译在平均意义上落后于源语音的距离,同时避免对过度生成的系统进行奖励。从 2.8 秒降至 2.3 秒,意味着平均延迟约削减了 18%。
QwenCloud 团队将该模型描述为 Qwen3.8-LiveTranslate-Flash 的实时版本。它构建在 Qwen-Omni 技术栈之上,结合大规模多模态数据、跨语言与跨模态对齐,以及视觉增强能力。Flash 模型还支持离线音视频翻译。
实时说话人身份标注(Speaker Diarization):模型能够在多方语音中区分不同说话人,并通过更稳定的语音克隆保留每位说话人的音色。API 提供了克隆模式选项,包括 always 模式——在每次响应前重新克隆,适用于多人对话场景。
双语同步显示:源文本和翻译同步呈现。在 API 中,源语言转写作为独立事件流,与翻译流并行输出。
长上下文消歧:模型利用对话历史来解析姓名和术语。例如,会议早期出现的姓名,在后续翻译中会保持一致。
该模型支持 60 种语言的理解,其中 29 种支持语音输出(返回音频和文本),其余 31 种仅返回文本。语音输出涵盖中文、英文、阿拉伯文、德文、法文、西班牙文、日文、韩文、印地文等。
输入为音频和可选图片;输出为文本和音频。唇动、手势、屏幕文字等视觉线索有助于在嘈杂环境和词义模糊时提升准确性。文档建议每秒发送不超过 2 张图片。
团队还可以配置热词(Hotword),将源语言术语映射到固定的目标翻译。文档建议配置不超过 1000 个热词。
开发者通过 WebSocket Realtime API 连接,模型 ID 为 qwen3.8-livetranslate-flash-realtime。默认的轮次检测类型为 speaker_detection。客户端持续流式传输音频,接收服务端生成的响应。
默认音频格式为输入 16 kHz PCM、输出 24 kHz PCM。默认音色为 Tina。设置 session.output_modalities 可选择仅文本,或文本加音频。关闭连接前务必发送 session.finish,否则最后一个片段会丢失。
新加坡区域按每 100 万 token 计费:
| 类型 | 价格(USD) |
|---|---|
| 文本输入 | $7.537 |
| 文本输出 | $0.621 |
| 音频输入 | $18.844 |
| 音频输出 | $30.151 |
北京区域定价更低,为 $5.653、$0.466、$14.133 和 $22.613。音频输入每秒消耗 7 tokens,音频输出每秒消耗 12.5 tokens。一小时语音输入加输出的费用,在新加坡约为 $1.54(未计入文本和图片 token)。
上下文窗口为 53,248 tokens,其中输入 49,152 tokens、输出 4,096 tokens。默认速率限制为每分钟 10 次请求和 100,000 tokens。Model Studio 标注了函数调用、结构化输出、批量推理和微调为不支持功能。