开源模型 checkpoint 免费,但自托管需叠加 GPU 空闲成本、扩缩容工程、on-call、评估等隐性成本;托管 API 包含 diarization/streaming/实体处理,省去大量自建工作。
NVIDIA 的语音模型正在迎来它的时刻,而且这是应得的。Parakeet TDT 和 Canary 在标准 ASR 基准测试上表现出色,速度也很快,而且如果你的技术栈已经运行在 NVIDIA GPU 和 NIM 上,使用它们就像走阻力最小的路。正在评估临床和对话转录的团队把它们列入候选名单是正确的。
所以这不是一篇贬低文章。这是你在实际产品中使用其中任何一个之前真正需要的比较——因为基准测试准确率和生产环境准确率是两回事,在医疗保健这类受监管、实体密集的领域,差异就是一切。
给这些模型应有的认可。在干净的、单一说话人的英语基准测试上,Parakeet 和 Canary 是可用的最佳开源模型之一,而且它们在 NVIDIA 硬件上的推理速度难以超越。如果你在已有的基础设施上进行高吞吐量离线批处理,这种组合是真正的优势。
问题是,当音频不再干净、领域开始受监管时会发生什么。
临床医生在嘈杂的病房里口述、患者带着口音描述症状、两个声音在检查室里重叠——这才是医疗抄写员实际听到的音频,它与朗读式排行榜完全不同。两件事决定转录是否安全用于下游:实体正确和说话人正确。
医学实体准确性。药品名称、剂量、疾病和手术正是单个错误就具有临床意义的标记。AssemblyAI 的 Medical Mode——通过一个 "domain": "medical-v1" 参数开启,无需切换模型——将使药品、疾病和手术的漏检率降低约 20%。而且因为 Universal-3.5 Pro 支持上下文提示,传入患者上次就诊记录后,我们的内部测试中将漏检医学术语降低了 31%,即使记录来自更早的就诊。从原始 Parakeet 检查点获得这种行为是一个你需要自己完成的研究项目。
** diarization(说话人分离)**。将每个话语正确归属到对应说话人本身就是一个难题。Universal-3.5 Pro 联合生成转录文本和说话人边界,并在我们发布的会议、电话和对话音频 cpWER 基准测试中领先。在 NVIDIA 检查点上外接一个独立的 diarizer 会给你带来脆弱的时间戳对齐方法,在临床音频中充满的打断情况下会崩溃。
对于医疗团队来说,模型只是决策的一半。另一半是你是否能合法地将受保护健康信息通过它处理。
AssemblyAI 使受 HIPAA 约束的承保实体及其业务关联公司能够使用服务来处理受保护健康信息。AssemblyAI 在 HIPAA 下被视为业务关联方,我们提供 HIPAA 要求的业务关联方附录(BAA)——你可以在几分钟内签署,无需销售电话。加上 SOC 2、相同价格的欧盟数据驻留以及在你的自有 VPC 中的自托管部署,合规路径就是签名,而不是一个季度的法律审查。自托管开源模型意味着你自己构建和记录所有这些。
如果你已经运行成熟的 NVIDIA GPU 和 NIM 堆栈,有一个想要拥有模型的 ML 平台团队,而且你的工作负载主要是可以保持高利用率的离线批处理,Parakeet 和 Canary 是一个强大且经济高效的选择。同样,如果你有硬性要求将所有内容保留在你可以完全控制的基础设施上,并且有团队来运营它——不过要注意,管理平台也可以通过自托管部署满足严格的数据隔离需求。
NVIDIA 的模型是优秀的引擎。生产级医疗转录产品需要的不仅仅是一个引擎——它需要的是在混乱临床音频上的实体准确性、可靠的说话人归属,以及你可以实际签署的合规路径。Universal-3.5 Pro 配合 Medical Mode 开箱即用地提供这些;自托管 Parakeet 意味着你要自己构建每一个并永久拥有它们。
正确的决定方式是用你的音频:开启 Medical Mode,用一批真实的录音运行它——那些嘈杂的、有口音的、术语密集的。
Parakeet 和 Canary 有什么区别?
Parakeet 和 Canary 都是 NVIDIA 基于 NeMo 框架构建的开源语音模型,共享 FastConformer 编码器但使用不同的解码器。Parakeet(例如 Parakeet-TDT-0.6B)针对低延迟、高吞吐量转录进行了优化,速度极快。Canary(例如 Canary-1B-v2,约 10 亿参数)是更大的多任务模型,针对准确率和跨 25 种欧洲语言的多语言翻译进行了调优。简而言之:需要速度选 Parakeet,需要多语言和翻译准确率选 Canary。
我应该在临床音频上使用哪个?
对于临床音频,决定性因素是医学实体准确性、可靠的说话人归属和合规路径——不是干净基准测试的 WER。Parakeet 和 Canary 在干净、朗读式语音上是优秀的引擎,但医疗调优、diarization 和 HIPAA 文档是你自己要构建和拥有的。AssemblyAI 的 Universal-3.5 Pro 配合 Medical Mode(一个 "domain": "medical-v1" 参数)将药品、疾病和手术的漏检率降低约 20%,与转录文本联合生成 diarization,并附带可签署的 BAA。用你自己的嘈杂、术语密集的录音测试两者。
自托管这些模型意味着什么?
Parakeet 和 Canary 作为开源权重发布——通过 Hugging Face 和 NVIDIA NeMo/NIM——由你自己托管和服务,而不是具有 SLA 的完全托管转录 API。你可以将它们包装在你自己的端点中或通过 NVIDIA NIM 运行,但你拥有 GPU、自动扩展和正常运行时间。像 AssemblyAI 这样的托管 API 按音频秒数计费,并为你运行该基础设施。
流式转录呢?
Parakeet 为低延迟、高吞吐量推理而构建,NeMo 提供支持流式的变体,但生产级流式——分块、部分假设、端点检测和轮次检测——是你自己组装和运营的。如果你开箱即用地需要用于字幕、口述或语音代理的实时转录,原生流式 API 可以节省这些工作。AssemblyAI 的 Universal-3.5 Pro Realtime 以大约 300ms 的端到端延迟提供。
HIPAA 合规呢?
NVIDIA 的开源模型不附带业务关联方附录(BAA),因此如果你自托管它们来处理受保护健康信息,HIPAA 保障措施、文档和供应商 BAA 都是你的责任。AssemblyAI 在 HIPAA 下被视为业务关联方,并提供你可以几分钟内签署的标准 BAA,无需销售电话,同时还有 SOC 2、欧盟数据驻留和自托管 VPC 部署。这将合规路径变成签名,而不是构建和文档项目。
什么时候应该自托管?
当你已经运行成熟的 NVIDIA GPU 和 NIM 堆栈、工作负载主要是可以保持高利用率的离线批处理,并且你有一个想要拥有和微调模型的 ML 平台团队时,自托管 Parakeet 或 Canary。这些情况使经济性变得合理。对于需要医疗调优、diarization、流式转录或你可以签署的合规路径的生产级功能,托管 API 通常是更好的权衡。