基于GLM-4-Voice-9B的语音原生模型,通过强化学习将口语数学准确率提升至77.1%,无需ASR转写步骤,单H100可运行。
Kyutai 发布了 Voice of Reason,2 个开源权重的语音到语音模型,能够大声解决数学问题。两个模型都基于 GLM-4-Voice-9B,加入了监督微调(SFT)和强化学习(RL)。整个过程中没有语音转写步骤,也没有独立的文本 LLM 参与。在口语 GSM8K 基准上,准确率从基线模型的 27.3% 提升到了 77.1%。
可以部署吗? 可以,用于自托管。Kyutai 在单张 H100 上运行了这两个 BF16 检查点。你还需要 GLM-4-Voice 仓库提供的语音 tokenizer 和 decoder。权重继承 GLM-4-Voice 的许可协议,目前还没有 Hugging Face 推理提供商托管这些模型。
级联流水线(语音转文本、文本 LLM、文本转语音)在推理任务上仍然领先。然而,每个阶段都会增加延迟,而且流水线会丢失语调等副语言线索。语音原生模型必须在规律的时间间隔内输出音频才能保持交互性,这限制了它们能够使用的隐藏推理 token 数量。
基线 GLM-4-Voice 在 GSM8K 上得分为 27.3%。早期的 STITCH 方法通过加入推理片段将其提升到 58.7%。该研究团队称他们的工作是强化学习在语音原生模型数学推理上的首次应用。
GLM-4-Voice 交错输出:13 个文本 token,然后 26 个音频 token,如此循环。
阶段一 SFT:训练使用了来自 Orca-Math 的 150,616 道题目。Qwen3-235B 将每道题目改写为口语形式。然后用 Kyutai 的 DSM TTS 以多种音色朗读。单独的 SFT 就将 GLM-4-Voice 从 27.3% 提升到了 61.7%。
阶段二 RL:对于每个口语问题,模型以 temperature 0.9 采样 4 条回复。一个裁判模型 Qwen3-235B-A22B-2507 用二元奖励对解码后的文本打分。裁判看不到参考答案。在 100 个手工检查的案例上,它与人类的一致性为 88%。
奖励在每个组内进行中心化,形成一个组相对 REINFORCE 目标。它与 GRPO 相关,但放弃了 PPO 裁剪和 KL 正则化。训练在 16 张 H100 GPU 上进行,共 1,500 次 RL 更新。
2 个设计选择最为关键:
Temperature 校正:在损失函数的 log-softmax 之前,用采样温度除以 logit。没有它,GSM8K 从 65.5% 崩溃到 12.3%。
音频 token 合并:在每个音频位置,所有音频词表的概率被加和为 1 个抽象 token。损失函数只问接下来是否是音频,而不是具体哪个音频 token。论文证明在价值不变性假设下,这个估计量是无偏且低方差的。
glm-4-voice-of-reason-9b 直接回答,不带额外的推理 token。任何逐步演算过程都是大声说出来的。
glm-4-voice-of-reason-stitch-9b 在口语片段之间写入静默的 100 token 推理块。Kyutai 表示后续的推理块是在更早的口语播放时生成的,所以思考不会增加额外延迟。这里使用的 STITCH-R 布局中,第一个推理块位于第一个口语块之前。
| Model | Params | GSM8K (%) | PersonaPlex (full-duplex) |
|---|---|---|---|
| GLM-4-Voice | 9B | 27.3 | — |
| STITCH (Chiang et al.) | 9B | 58.7 | — |
| Voice of Reason | 9B | 65.5 ± 1.1 (70.3 released) | — |
| Voice of Reason (Stitch) | 9B | 74.8 ± 1.1 (77.1 released) | — |
| Qwen2.5-Omni (text output) | 7B | 84.7 | — |
| Qwen3-Omni (text output) | 30B | 94.6 | — |
| Cascaded ASR-LLM-TTS-ASR | 31B LLM | 95.7 | — |
论文分数使用 top-k 50 解码,在 3 个随机种子上的平均。去掉 top-k 后得到 70.3% 和 77.1%。发布的检查点对应这些运行。omni 和级联系统是更大的模型,不是匹配的对比。
在真实语音中收益仍然保留:用 Qwen3-ASR-1.7B 转录后,Stitch 模型得分为 72.0 ± 1.9%。
自然度保持:UTMOSv2 在 RL 后从 4.067 变为 4.069(直接模型),从 4.174 变为 4.164(Stitch)。
收益并非来自更长的回答:RL 将直接模型的平均回复从 41.9 秒缩短到 36.4 秒。Stitch 推理 token 仅从 167 增加到 176。
RL 在数据少时帮助最大:使用 10% 的 SFT 数据,更长的 RL 运行达到 58.5%。单独 SFT 只有 43.9%。
常识有所下降:口语 TriviaQA 从 40.6% 下降到 34.0%(直接模型)。作者将此主要归因于全数据 SFT,而非 RL。
污染检查:团队从评估中排除了 AddSub、MultiArith、SingleEQ 和 SVAMP。在 678 道检查的题目中,54.0% 在改写级别与 Orca-Math 重叠。
评估音频来自 GPT-4o-mini-TTS,一个不同于训练音频的 TTS 系统。GPT-4o 担任评估裁判。
Kyutai 的 RL 方法将 GLM-4-Voice 在口语 GSM8K 上从 27.3% 提升到 77.1%。
直接模型无需推理 token 就能达到 70.3%,超越 STITCH 的 58.7%。
Temperature 校正是关键:移除它导致准确率崩溃到 12.3%。
RL 后语音自然度保持;TriviaQA 下降,主要来自 SFT。
两个 9B 检查点都在 Hugging Face 上开源,可在单张 H100 上运行。
查看论文、直接模型和 Stitch 模型。所有荣誉归该项目的研究人员。也欢迎关注我们的 Twitter,别忘了加入我们的 15 万+ ML SubReddit 并订阅我们的Newsletter。等一下!你用电报吗?现在也可以加入我们了。
想与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会吗?联系我们
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最新的事业是推出了人工智能媒体平台 Marktechpost,该平台以其对机器学习和深度学习新闻的深入报道而脱颖而出,既技术严谨又通俗易懂。该平台每月有超过 200 万的浏览量,证明了它在受众中的受欢迎程度。