Hugging Face和Cerebras合作在Gemma 4中集成实时语音能力,开源模型做语音AI的新选项。
结果是语音对话体验感觉自然得多。用户不再需要等待 AI 回复,对话流畅度符合人类互动的预期。
这个演示构建为实时语音对话管道。系统的每个部分都是模块化的、开放的、可替换的,开发者可以轻松地为不同的助手、机器人、产品或研究项目调整这个栈。
这形成了一个完全开放的语音对话循环:
Speech input
-> speech recognition with Nvidia's Parakeet
-> Gemma 4 VLM inference on Cerebras
-> text-to-speech with Alibaba's Qwen3TTS
-> spoken response
这个架构汇集了开源 AI 生态的优势:用于快速推理的 Cerebras、用于语言模型的 Google DeepMind 的 Gemma 4 31B,以及用于文本转语音的 Qwen。每一层都可以被开发者检查、修改和扩展。
如今,一些生产系统在中位数延迟合理的情况下,仍然在 P95 处经历令人沮丧的多秒延迟。当需要工具调用或多模态步骤涉及多轮交互时,这些延迟变得更加明显。
Cerebras 帮助解决栈中最重要的瓶颈之一:语言模型的响应时间。通过使推理变得极其迅速和稳定,Cerebras 让 Hugging Face 管道的其余部分得以大放光彩。
这种稳定性在长尾情况下尤为重要。许多系统可以提供可接受的中位数响应时间,但偶发的慢速响应仍会让对话体验感觉不可靠。
相同的 Hugging Face 语音对话管道已经为 Reachy Mini 机器人提供动力,已有超过 9000 台机器人在野外使用。对于机器人、语音助手和具身 AI,响应性不是一个美化加分项。它是让交互感觉活跃的关键。
使用 Cerebras 的动力因此不仅仅是成本降低。而是低延迟、可预测的性能,以及在规模化下创建感觉自然的实时体验的能力。
这次合作反映了一种共同的信念,即 AI 的未来将既开放又高效。开源模型、开放基础设施和突破性的推理速度共同为下一代对话 AI 奠定了基础。
我们邀请开发者探索演示、尝试代码,并帮助塑造实时语音 AI 的未来。
演示:Hugging Face Space
仓库:huggingface/speech-to-speech
本文提到的 Spaces
更多来自我们博客的文章
在任何云上运行 AI 工作负载,存储在 Hugging Face:通过 SkyPilot 实现零出口存储
介绍 FFASR 排行榜:基准测试真实世界中的 ASR
我们甚至突破了 10k Reachy Mini 在野外使用 😄
看到 Hugging Face 和 Cerebras 推动实时语音技术向前发展令人兴奋。快速响应让对话感觉舒适和有吸引力得多,这正是用户一直期待的。😊 当延迟减少时,交互变得更加流畅和自然,使语音体验感觉不再像是在与软件交谈,而是像在进行真实对话。
我最欣赏的是对开放和模块化方法的关注。这给了开发者更多灵活性来构建适合不同需求的解决方案,而不是被锁定在单一生态中。强大的模型质量与令人印象深刻的推理速度的结合可以帮助在教育、客户支持、无障碍等许多实际应用中解锁可能性。🚀
对延迟的强调完全是正确的方向,因为速度直接影响整体体验。即使最聪明的系统如果每次响应都需要很长时间,也会感到令人沮丧。将等待时间减少下来会创造出流畅得多的交互,很高兴看到创新关注用户立即注意到的东西。👏
期待看到这在未来几个月如何发展……更快的对话……更好的响应性……更自然的交互……令人兴奋的开发者和用户进展……🌟🙂
· 登录或注册以评论
本文提到的 Spaces