前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • 小米MiMo-V3将搭载HySparse 2:100万Token下KV缓存缩小4.5倍
  • GitHub Copilot 应用新增本地沙箱隔离功能
  • AI Agent 调试指南:重启不是调试,七层架构定位根因
  • AI 加剧软件供应链攻击威胁,行业如何应对
  • 阿里 Qwen Audio 3.1 发布:语音识别/TTS 多模型,API 价格最高降 95%
  • Claude Code部署到Lizard平台实战指南
  • Claude Opus 5.5降价却破坏四个Agent依赖项
  • OpenAI GPT-6 Sol/Luna 半价发布,缓存机制或为更大降本杠杆
  • treg:聚合 3000+ Agent 工具的统一网关
  • 向量检索权限校验应内嵌到 pgvector 查询中
  • Univer:面向 AI Agent 的开源办公套件 SDK
  • DeepSeek公开Agent训练新论文,梁文锋署名
  • 为 AI 编程 Agent 构建可复用技能系统的实践
  • DeepMind研究:百个AI智能体协作求解时出现作弊与告密现象
  • Google AX:开源Agent编排运行时
  • 阿里千问发布Qwen-Audio-3.1:TTS降价70%、ASR降价95%
  • 诺基亚开源AnyJev:无训练即可将任意开源LLM转为校准决策模型
  • 2026年AI网关横评:Bifrost领跑,多路 failover 哪家强
  • GPT-6 Sol/Luna 发布:准确率翻倍、成本减半,价格战开启
  • Claude Opus 5.5 登场,AI 模型价格普降 40-50%
  • Kyutai开源语音模型Voice of Reason,口算GSM8K准确率从27%升至77%
  • 微软Copilot大促:10万席最高半价,向超级AI应用转型
  • OpenAI GPT-6 Sol/Luna:API价格腰斩,长任务Prompt缓存优化
  • AI 编码 Agent 在移动端多久“看”一次才够用
  • GPT-6 Astra 引领 3D 生成技术,竞争格局生变
  • Claude Opus 5.5 缓存读取降价 60%,68 万行代码迁移攻略
  • 用 AI 辅助求职的工程实践:诚实原则与确定性设计
  • Agent 补丁评分卡:防止测试被悄悄弱化的 CI 策略
  • Opus 5.5 缓存降价后 text-to-SQL 成本重算分析
  • Slack推出Code Channels:团队对话内集成AI编程助手
  • GPT-6 Sol/Luna 登场:价格腰斩,定位细分
  • TypeSafe Jev:让AI返回结构化决策而非段落文本
  • Text-to-SQL访问控制:身份决定Schema可见性
  • Jev 1.13实测:工单分类精度达100%,对比规则引擎和本地LLM
  • GitHub Copilot应用支持OpenTelemetry可观测性配置
  • Copilot for JetBrains新增工具审批和Agent控制功能
  • 两款 AI 代码审查基准测评结论相反
  • AI 编码提速后:验证环节成为新瓶颈
  • AI 审查同一 PR 给出不同结论:确定性判定器来解决
  • AI计量工具审计启示:独立交易ref是防重复计费的关键
  • OpenAI发布GPT-6 Sol/Luna:API价格下调50%
  • GPT-6/Claude 5.5 同日发布:价格战开打,Luna 成本腰斩
  • GitHub Copilot 大幅提升C++代码索引速度
  • Anthropic和OpenAI同时推出性价比新模型
  • GPT-6 提示缓存重大升级:更高命中率与可诊断性
  • 六边形架构的端口在撒谎:HTTP 不等于业务语义
  • GPT-5.6 价格策略解读:Luna 降价 80%,多版本差异化定位
  • 高通骁龙8 Gen6端侧跑300亿参数MoE模型,吞吐330 Token/s
  • Claude Opus 5.5评测:智商极高但费用惊人
  • 小米开源 MiMo-V2.6:万亿参数开源模型登顶榜
  • AI Agent 工具 API 设计指南
  • 已加载 51 / 8836
8.0
热点
AI SCORE
开源项目2026-09-23 14:33

Kyutai开源语音模型Voice of Reason,口算GSM8K准确率从27%升至77%

MarkTechPost#语音模型#开源#强化学习
Editor brief · 编辑速览

基于GLM-4-Voice-9B的语音原生模型,通过强化学习将口语数学准确率提升至77.1%,无需ASR转写步骤,单H100可运行。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Kyutai 发布了 Voice of Reason,2 个开源权重的语音到语音模型,能够大声解决数学问题。两个模型都基于 GLM-4-Voice-9B,加入了监督微调(SFT)和强化学习(RL)。整个过程中没有语音转写步骤,也没有独立的文本 LLM 参与。在口语 GSM8K 基准上,准确率从基线模型的 27.3% 提升到了 77.1%。

可以部署吗? 可以,用于自托管。Kyutai 在单张 H100 上运行了这两个 BF16 检查点。你还需要 GLM-4-Voice 仓库提供的语音 tokenizer 和 decoder。权重继承 GLM-4-Voice 的许可协议,目前还没有 Hugging Face 推理提供商托管这些模型。

为什么语音模型在数学上落后

级联流水线(语音转文本、文本 LLM、文本转语音)在推理任务上仍然领先。然而,每个阶段都会增加延迟,而且流水线会丢失语调等副语言线索。语音原生模型必须在规律的时间间隔内输出音频才能保持交互性,这限制了它们能够使用的隐藏推理 token 数量。

基线 GLM-4-Voice 在 GSM8K 上得分为 27.3%。早期的 STITCH 方法通过加入推理片段将其提升到 58.7%。该研究团队称他们的工作是强化学习在语音原生模型数学推理上的首次应用。

训练如何工作

GLM-4-Voice 交错输出:13 个文本 token,然后 26 个音频 token,如此循环。

阶段一 SFT:训练使用了来自 Orca-Math 的 150,616 道题目。Qwen3-235B 将每道题目改写为口语形式。然后用 Kyutai 的 DSM TTS 以多种音色朗读。单独的 SFT 就将 GLM-4-Voice 从 27.3% 提升到了 61.7%。

阶段二 RL:对于每个口语问题,模型以 temperature 0.9 采样 4 条回复。一个裁判模型 Qwen3-235B-A22B-2507 用二元奖励对解码后的文本打分。裁判看不到参考答案。在 100 个手工检查的案例上,它与人类的一致性为 88%。

奖励在每个组内进行中心化,形成一个组相对 REINFORCE 目标。它与 GRPO 相关,但放弃了 PPO 裁剪和 KL 正则化。训练在 16 张 H100 GPU 上进行,共 1,500 次 RL 更新。

2 个设计选择最为关键:

Temperature 校正:在损失函数的 log-softmax 之前,用采样温度除以 logit。没有它,GSM8K 从 65.5% 崩溃到 12.3%。

音频 token 合并:在每个音频位置,所有音频词表的概率被加和为 1 个抽象 token。损失函数只问接下来是否是音频,而不是具体哪个音频 token。论文证明在价值不变性假设下,这个估计量是无偏且低方差的。

交互式讲解器

发布的 2 个检查点

glm-4-voice-of-reason-9b 直接回答,不带额外的推理 token。任何逐步演算过程都是大声说出来的。

glm-4-voice-of-reason-stitch-9b 在口语片段之间写入静默的 100 token 推理块。Kyutai 表示后续的推理块是在更早的口语播放时生成的,所以思考不会增加额外延迟。这里使用的 STITCH-R 布局中,第一个推理块位于第一个口语块之前。

Model Params GSM8K (%) PersonaPlex (full-duplex)
GLM-4-Voice 9B 27.3 —
STITCH (Chiang et al.) 9B 58.7 —
Voice of Reason 9B 65.5 ± 1.1 (70.3 released) —
Voice of Reason (Stitch) 9B 74.8 ± 1.1 (77.1 released) —
Qwen2.5-Omni (text output) 7B 84.7 —
Qwen3-Omni (text output) 30B 94.6 —
Cascaded ASR-LLM-TTS-ASR 31B LLM 95.7 —

论文分数使用 top-k 50 解码,在 3 个随机种子上的平均。去掉 top-k 后得到 70.3% 和 77.1%。发布的检查点对应这些运行。omni 和级联系统是更大的模型,不是匹配的对比。

在真实语音中收益仍然保留:用 Qwen3-ASR-1.7B 转录后,Stitch 模型得分为 72.0 ± 1.9%。

自然度保持:UTMOSv2 在 RL 后从 4.067 变为 4.069(直接模型),从 4.174 变为 4.164(Stitch)。

收益并非来自更长的回答:RL 将直接模型的平均回复从 41.9 秒缩短到 36.4 秒。Stitch 推理 token 仅从 167 增加到 176。

RL 在数据少时帮助最大:使用 10% 的 SFT 数据,更长的 RL 运行达到 58.5%。单独 SFT 只有 43.9%。

常识有所下降:口语 TriviaQA 从 40.6% 下降到 34.0%(直接模型)。作者将此主要归因于全数据 SFT,而非 RL。

污染检查:团队从评估中排除了 AddSub、MultiArith、SingleEQ 和 SVAMP。在 678 道检查的题目中,54.0% 在改写级别与 Orca-Math 重叠。

评估音频来自 GPT-4o-mini-TTS,一个不同于训练音频的 TTS 系统。GPT-4o 担任评估裁判。

总结

Kyutai 的 RL 方法将 GLM-4-Voice 在口语 GSM8K 上从 27.3% 提升到 77.1%。

直接模型无需推理 token 就能达到 70.3%,超越 STITCH 的 58.7%。

Temperature 校正是关键:移除它导致准确率崩溃到 12.3%。

RL 后语音自然度保持;TriviaQA 下降,主要来自 SFT。

两个 9B 检查点都在 Hugging Face 上开源,可在单张 H100 上运行。

查看论文、直接模型和 Stitch 模型。所有荣誉归该项目的研究人员。也欢迎关注我们的 Twitter,别忘了加入我们的 15 万+ ML SubReddit 并订阅我们的Newsletter。等一下!你用电报吗?现在也可以加入我们了。

想与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会吗?联系我们

Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最新的事业是推出了人工智能媒体平台 Marktechpost,该平台以其对机器学习和深度学习新闻的深入报道而脱颖而出,既技术严谨又通俗易懂。该平台每月有超过 200 万的浏览量,证明了它在受众中的受欢迎程度。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Opus 5.5 登场,AI 模型价格普降 40-50%
下一篇
微软Copilot大促:10万席最高半价,向超级AI应用转型