PolyAI 发布音频原生对话模型 Dialog-RSN-1
Dialog-RSN-1 直接处理语音输入,内置语音识别、对话理解、函数调用和生成,单一模型覆盖完整对话流程。
Dialog-RSN-1 直接处理语音输入,内置语音识别、对话理解、函数调用和生成,单一模型覆盖完整对话流程。
人工智能
PolyAI 推出了 Dialog-RSN-1。这是一款能够直接感知来电者音频,而非读取转写文本的对话模型。它将轮次判断、语音识别、函数调用和响应生成融合到一个原生音频模型中,并且已经开始处理真实生产环境中的电话。
Dialog-RSN-1 仅在输入端具备音频感知能力;TTS 仍然独立运行,因此输出语音依然可以控制。
它以按请求调用的 LLM 方式运行,只在需要时进行探测,而不是通过持续运行的流式模式长期占用 GPU。
轮次判断是模型输出的第一个 token:EMPTY、ONGOING 或 COMPLETE。
PolyAI 报告称,该模型的响应时间低于 300ms;在某餐饮集团中,相对自助解决率提升了 11%;在某保险公司中,延迟降低了 37%。
该模型发布时仅支持英语,通过 PolyAI 平台交付,不提供开放权重或公共 API。
可以,但只能通过 PolyAI 部署:目前既没有开放权重,也没有公共 API。现有客户现在就可以启用,新客户则可以申请早期访问资格。
企业规模:大型、呼叫量高的企业。在 2025 年 12 月完成 8600 万美元 D 轮融资时,PolyAI 报告称其拥有超过 100 家企业客户和 2000 多个线上部署。自助式开发者和中小企业并非其目标客户。
行业:餐饮、保险、金融服务、医疗保健、酒店、零售、电信、旅游和公共事业。
应用:预订与预约、账单与支付、身份验证、呼叫路由、订单管理和故障排查。
目前主要有两种架构,但各自都需要作出取舍。级联式技术栈只会把 ASR 给出的最佳猜测发送给 LLM,因此在 LLM 看到内容之前,语气、犹豫以及识别结果的不确定性都已经丢失。调优意味着需要手动调整端点检测参数和 ASR 偏置,而这些配置很少能够跨用例泛化。GPT Realtime 和 Gemini Live 等端到端语音模型保留了音频信息,却把声音固化在模型内部,限制了对发音的控制;始终在线的全双工变体还会在整通电话期间持续占用一块 GPU。
Dialog-RSN-1 仅在输入端感知音频:一个模型直接对原始音频进行推理,再将生成任务交给独立且可通过 prompt 控制的 TTS 系统。它采用按需探测而非持续流式运行:由一个高召回率的 VAD 加上几个计时器决定何时运行模型,而回复的第一个 token 则决定 Agent 是否应该开口。低成本的声学线索只负责确定何时发起判断;真正的轮次判断由掌握完整上下文的模型完成。
PolyAI 使用内部数据,通过监督式微调和强化学习微调,对开放权重的多模态模型进行了后训练。该流程基本不依赖特定的基础模型;PolyAI 评估了 Gemma、GPT-OSS、Qwen 和 Mistral。为了在 A100 GPU 上实现低于 300ms 的延迟,候选模型的规模需要处于 8B 稠密模型到 30B 稀疏模型之间。延迟优化措施包括:在用户说话时预填充 attention cache;采用只追加的 prompt 模板,尽可能减少缓存失效;将每位来电者的请求路由到同一块 GPU;使用经过微调的 speculative drafter,其平均 token 接受数量为 3.9;以及在 RFT 过程中学习得到的自动推理机制。转写被放到最后执行,即在响应或工具调用之后,与语音生成并行进行。
PolyAI 使用 Dialog-Eval 进行了评估。这是一个内部 benchmark,PolyAI 计划将其开源。每个样本都是一通在某个决策点被截断的电话,评估的是单个原子化的下一步操作,而不是完整的交互过程。PolyAI 报告称,Dialog-RSN-1 是实时能力模型中得分最高的模型;级联系统的 Audio-score 上限约为 77;而 GPT Realtime 2.1 在音频感知样本上的得分与级联系统相当。在转写任务中,当获得相同的上下文后,gpt-4o-transcribe 的 WER 从 7.8% 改善至 6.9%,Dialog-RSN-1 的 WER 还要更低。
此次发布中,PolyAI 将重点放在了英语上;对于非英语场景和功能丰富的网页聊天场景,PolyAI 仍然推荐 Raven 3.5。其技术报告和 Dialog-Eval 论文也在筹备之中。
你可以查看相关技术细节。也欢迎在 Twitter 上关注我们,别忘了加入我们拥有超过 15 万名成员的机器学习 SubReddit,并订阅我们的 Newsletter。等等!你也使用 Telegram 吗?现在也可以加入我们的 Telegram 频道。
需要与我们合作,推广你的 GitHub Repo、Hugging Face Page、产品发布或 Webinar 等内容吗?欢迎联系我们。
Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学数据科学理学硕士学位。他在统计分析、机器学习和数据工程方面拥有扎实的基础,擅长将复杂的数据集转化为可执行的洞察。