Smallest.ai 融资 1300 万打造超低延迟语音 AI
初创公司 Smallest.ai 获融资 1300 万美元,专注开发超低延迟的语音 AI 模型,目标让 AI 电话通过图灵测试。
初创公司 Smallest.ai 获融资 1300 万美元,专注开发超低延迟的语音 AI 模型,目标让 AI 电话通过图灵测试。
尽管 AI Agent 解决客户支持问题的能力越来越强,但大多数人仍然能立刻分辨出,正在与自己交谈的究竟是机器还是真人。
Smallest.ai 是一家创立于 2024 年底的初创公司。它认为,语音 Agent 的下一次飞跃,并不取决于让大语言模型变得更快,而在于使用专为人类对话打造的、更小型且更专业的模型。简单来说,这家公司希望让人们无法分辨自己是在与 AI Agent 交流,还是在与真人交谈。
为此,Smallest.ai 正在开发一种小型语音模型,通过同时进行倾听、思考和表达,模拟人类处理信息的方式。
Smallest.ai 创始人兼 CEO Sudarshan Kamath(图左)告诉 TechCrunch:“当我和你说话时,你其实已经开始思考了;如果我说得太久,你甚至可能会打断我。”他补充说,这正是这家初创公司的模型所采用的工作方式。
为了推动这一愿景落地,Smallest.ai 完成了 1300 万美元的 A 轮融资。本轮融资由 Seligman Ventures 领投,Sierra Ventures 和 3one4 Capital 参投。获得这笔新资金后,该公司的融资总额已超过 2100 万美元。
Kamath 表示:“LLM 的工作方式是,你先给它一段完整的 prompt,然后它才开始思考。”这种延迟在文字聊天中尚可接受,但在语音对话里,哪怕只是短暂停顿,都会显得不自然。“想想我们现在的交流方式:我并不会先发给你一大段音频片段,然后你才开始思考。”
Smallest.ai 的模型充当实时智能层,能够围绕特定主题与客户进行自然交流,响应延迟几乎为零。但如果模型遇到超出其有限知识库范围的话题,Smallest.ai 就会将问题转交给大型基础模型,并让客户短暂等待,以便“研究”这个问题——就像真人客服会做的那样。
Kamath 认为,所有 AI Agent 很快都会依赖两种模型:一种是负责实时交互的小型语音模型,另一种是“离线”LLM,在需要解决复杂问题时才会调用。
与大型基础模型不同,Smallest.ai 专注于语音场景特有的细节,例如处理各种不同的口音、支持数十种语言,以及在嘈杂环境中正常运行。
这家初创公司的现有客户包括 RingCentral 和 Truecaller 等语音领域企业。Kamath 表示,任何客户支持公司——包括 Sierra 和 Decagon 这类新兴公司——都有可能成为 Smallest.ai 的客户。
当被问及资金雄厚的 AI 客户支持公司为什么不自行构建语音模型时,Kamath 表示,对于客户支持初创公司来说,投入精力让自己“极其擅长语音技术”,反而会分散它们对核心业务的注意力。
Smallest.ai 的竞争对手包括语音 AI 领域的领导者 ElevenLabs、Cartesia,以及 Sarvam 等专注于本地语言的区域厂商。
一些竞争对手会将语音 AI 应用于音频配音、播客等场景,而 Smallest.ai 则只专注于为企业客户提供实时对话式语音 Agent。
Kamath 表示:“我们希望自己的模型能够突破图灵测试。你与我们的模型交谈时,不应该知道对面究竟是 AI 还是真人。这就是公司唯一的重点。”