Qwen3-ASR 开源免费、多语言强,但流式输出、说话人分离、生产级实体识别尚不成熟;AssemblyAI 在数字/姓名/地址实体准确率、跨 18 语言切码流方面有优势。
越来越多的团队面临一个决策:Whisper 或 Qwen3-ASR 这样的开源语音模型是免费的,而 Baseten、Modal 和 Fireworks 这些平台让模型的部署变得非常便捷。只需要几个小时的工作,你就有了一个转录接口。那么,既然可以自己托管模型、只花 GPU 资源的钱,为什么还要按小时付费使用托管 API 呢?
这是个合理的问题——答案并不是"自托管不好"。这些平台都很强大。答案在于你并不是在比较模型和模型本身,而是在比较两种模式:自己租用 GPU 运行一个 checkpoint,与调用一个由别人负责整个技术栈的 API。一旦这样来看,问题的核心就变成了总体拥有成本,而不仅仅是标价。
它们并不相同,差异对成本计算很重要:
Baseten 提供专用、自动扩缩的模型部署——控制力很强,但需要为预置的 GPU 容量付费,并自己调优自动扩缩。
Modal 是无服务器 GPU,按执行次数付费。这解决了空闲时的成本问题,但带来了冷启动问题:缩容到零后,下一个请求需要等待容器启动和多 GB 模型加载。要保持实例热备来避免这个问题,就又要为空闲时间付费了。
Fireworks 为开源模型提供快速托管推理,按 token 或按秒计费——很方便,但你仍需要围绕它组装生产级语音技术栈。
不同的定价形态,相同的结论:平台运行的是 checkpoint。把 checkpoint 变成转录产品的所有工作仍然是你的。
开源权重是免费的;GPU 不是,而利用率是没有人会在演示中提到的数字。转录流量是突发性的。一块利用率只有 15% 的 GPU 仍然按 100% 计费。无服务器缓解了空闲成本但增加了冷启动;专用容量避免了冷启动但为空闲时间付费。针对突发性语音流量自动扩缩 GPU 集群是一个真实的、持续的工程项目。
托管 API 按音频秒数计费——间隙期不计费——因为吸收这种利用率数学是供应商的问题。
托管解决的是"如何运行模型"。它对模型本身不产生的内容毫无帮助:能在交叉对话中存活的说话人 diarization、数字和名称的实体准确率、带有 endpointing 的实时流式传输、code-switching、PII 脱敏、格式化。每一项都是你在接口之上需要构建和维护的功能——或者已经包含在 API 价格中的功能。
演示是在一块 GPU 上运行一个请求。生产环境是大规模并发、重试、负载下的延迟、零停机模型升级、故障转移、监控、正常运行时间。自托管意味着这一切都是你的,而且有人要扛着告警。AssemblyAI 每月运行数亿次推理调用,拥有无限并发和不限速率限制,还配有嵌入式工程师与你的团队协作——因为大规模可靠性本身就是产品。
如果你运行的是大规模离线批处理,延迟无关紧要,而且能让 GPU 保持高利用率,经济上确实可能倾向自托管。如果你对保持音频在完全自主控制的基础设施上有硬性要求,或者有一个想要拥有模型的 ML 平台团队并且有足够的精力,情况也是如此。如果是这样,Baseten、Modal 和 Fireworks 都是不错的工具——另外注意 AssemblyAI 也提供自托管 VPC 部署,如果控制权是你的驱动因素但你不想重建整个技术栈的话。
错误不在于自托管。错误在于用模型的价格与 API 的价格做比较,而不是把运行自己的语音技术栈的完全加载成本——GPU、空闲时间、工程师、评估、值班——与按秒计费、由别人承担一切的方案做比较。在你的真实业务量下诚实地算一下这笔账,答案翻转的频率比下午演示时的直觉判断要高出很多。
标签价格暗示的频率并不高。开源权重是免费的,但自托管意味着租用 GPU,无论音频是否在流动都要计费,还要加上自动扩缩的工程时间和维持运行的值班成本。像 AssemblyAI 这样的托管 API 按音频秒数计费(异步 $0.15–$0.21/小时,无最低消费),并吸收了那种利用率数学。诚实的比较是你的完全加载成本——GPU、空闲时间、工程师、评估、值班——与按秒计费的对比,在真实的生产规模下,答案翻转的频率比快速演示建议的要高得多。
自托管在运行大型、稳定、离线批处理工作负载时往往更有利,你可以让 GPU 保持高利用率,延迟无关紧要。在这种场景下,固定 GPU 成本分摊到接近满负荷的使用中,这就是自有硬件的回报所在。它通常在突发性或实时流量上失利,因为 GPU 在请求之间闲置但仍要计费——而且这个计算还没有计入运行技术栈的工程和值班成本。在你的真实业务量和利用率下建模,而不是在单 GPU 演示上。
这三个平台都很容易托管开源模型,但它们的定价形态不同。Baseten 提供专用、自动扩缩的部署——控制力很强,但需要为预置的 GPU 容量付费并自己调优自动扩缩。Modal 是无服务器 GPU,按执行次数付费,这解决了空闲成本但引入了缩容到零时的冷启动。Fireworks 提供按 token 或按秒计费的快速托管推理。在每种情况下,平台运行的是 checkpoint;周围的生产级语音技术栈仍然需要你自己构建。
冷启动是当无服务器 GPU 平台已缩容到零,你的下一个请求必须先启动容器并加载一个多 GB 模型才能开始转录时的延迟。这是为不支付空闲容量而付出的代价——你省下了空闲账单但给第一个请求增加了延迟。保持实例热备消除了冷启动但让你重新回到为空闲时间付费的状态。托管 API 通过代你运行集群并只按音频秒数计费来吸收这部分成本。
托管 API 的价格涵盖模型周围的整个系统,而不仅仅是推理。这包括说话人 diarization、数字和名称的实体准确率、带有 endpointing 的实时流式传输、code-switching、PII 脱敏和格式化——加上基础设施:无限并发、自动扩缩、正常运行时间和值班支持。一个原始 checkpoint 给你一份转录文本;这些生产特性中的每一项都需要你自己构建和维护,或者已经包含在按秒计费的费率中。
自托管 Whisper 的最佳替代方案是托管语音转文本 API,它为你运行基础设施并提供生产级特性。例如 AssemblyAI 按音频秒数计费(异步 $0.15–$0.21/小时),包含 diarization、流式传输和实体准确率,无限并发,以及 SOC 2 / SLA 支持的平台——如果数据控制是你考虑托管的首要原因,它还提供自托管 VPC 部署。在决定投入工程时间之前,用你的真实流量运行对比测试。