AI 语音模型公司 Fish Audio 融资 5200 万美元,已有 800 万用户和 2100 万美元年经常性收入。
AI生成语音模型的市场规模巨大。创意用途需要AI语音模型具有更强的表现力,而希望自动化客户支持和销售运营的企业则需要它们具有更好的可控性。
位于帕洛阿尔托的Fish Audio想要用其超过15000个自然语言控制的库来满足所有这些应用场景。自去年推出以来,这家初创公司现已拥有超过800万用户使用其开源或托管版本的模型,年经常性收入(ARR)达到2100万美元。
为了继续保持这一增长势头,该公司于周二宣布已在由Coreline Ventures和Capital Today领投的种子轮融资中募集5200万美元。融资还得到了359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners和HF0的参与。
Fish Audio起初是前英伟达研究员廖世佳的小型个人项目。由于对市场上现有的非表现力合成语音感到失望,他在单块GPU上训练了一个语音生成模型,随后开源了这个项目。如今GitHub上的Fish Speech仓库已拥有超过31000颗星,被独立开发者、游戏设计师和创作者使用。
公司在过去一年推出了五个模型:四个语音生成模型和一个语音转文本模型。其中三个语音生成模型已开源,但最新的S2.1 Pro模型只能通过其付费API获得。
Fish Audio为创作者和团队提供付费月度计划,解锁一定数量的生成分钟数和语音克隆功能。公司还提供企业版的API和平台,并表示HeyGen和Sanas等机构已经在使用它。
"每个企业都有不同的用例和偏好。例如,HeyGen这样使用我们的语音来驱动AI虚拟形象的公司希望语音听起来逼真;游戏工作室则希望为角色配上富有表现力的语音;而LiveKit这样的语音代理公司则想要更自然、低延迟且足够富有表现力以应对通话的语音,"Fish Audio首席执行官兼联合创始人曹瑞莎(Rissa Cao)表示。
该公司构建语音库的一个方式是邀请用户上传自己的语音来训练模型,如果这些语音被使用则给予补偿。但是,几个月前这造成了一些问题,一些创作者声称他们的语音被未经同意地上传到Fish Audio。该公司确实有DMCA删除流程来处理此类问题,但删除本身耗时很长。
曹瑞莎告诉TechCrunch,公司现已实现了删除流程的自动化。创作者可以提交一段简短的语音样本或合同来证明上传的语音属于他们,他们的语音将在三分钟内从初创公司的平台上删除。
不过,这仍然不能阻止任何人在艺术家不知情的情况下上传其语音。在艺术家发现之前,他们的语音将继续在平台上被使用,除非他们提交删除请求。
Coreline Ventures合伙人本田大佑(Osuke Honda)表示,社区驱动模式只有在创作者信任平台的情况下才能成功。
"以社区为中心的方式只有在创作者信任平台时才能成为持久的竞争优势。这意味着同意、透明度和署名必须内置于产品中,而不是事后处理。我认为行业需要朝着声音所有权验证、清晰的许可条款、便捷的举报和删除流程,以及最终让创作者在其语音被许可或商业使用时获得经济回报的收益分享模式发展。"他说。
曹瑞莎表示,当初创公司仅以开源项目加创作者计划的形式提供产品时,运营效率很高,不需要外部资本。但公司想要开发更先进的模型,并希望适应企业客户,因为投资者兴趣不断上升,这促使他们寻求融资。
展望未来,Fish Audio计划在今年发布一个音频理解模型。公司还在开发语音转语音模型。
语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前身为Podcastle)和Krisp等公司都在争夺创作者和企业的预算。
359 Capital合伙人里科·马洛茨(Rico Mallozzi)认为,为开发者提供细粒度控制和具成本效益的模型训练将帮助Fish Audio更好地与大型AI实验室竞争。
"我认为他们能够用目前的团队构建的最先进的模型,与其他一些资金充足的AI实验室或公司相比,这是令人难以置信的。这展示了他们在缩小人工合成音与人类语音之间差距上的技术能力,"马洛茨在电话中告诉TechCrunch。
本报道已更新以反映该公司在种子轮融资中筹集5200万美元。