Google将语音识别拆分为流式(低延迟、无说话人分离)和批量(保留时间戳、成本减半)两个端点,流式WER 4.0%、非流式2.6%,比Chirp 3快70%。
Google 发布了 Gemini 3.5 Transcribe,这是一款面向实时语音交互和录音场景的语音转文字模型。它以两个端点的形式提供,而非单一端点。gemini-3.5-transcribe 通过 Interactions API 处理预录音频。gemini-3.5-transcribe-live 通过 Live API 处理双向流式传输。Google 公布的平均字错误率(WER)为:流式 4.0%、非流式 2.6%,数据来源为 Artificial Analysis。最终转录时间相比上一代模型 Chirp 3 提升了 70%。自动检测覆盖超过 85 种语言,包括句中切换语言(code-switching)。两个端点之间的功能划分是需要提前规划的——它们不共享相同的特性集、限制或定价。
是的,但仅提供 API。没有开放权重,也不支持自托管。这是托管服务的决策,而非基础设施层面的问题。
公司规模:不限。任何规模均可使用。独立开发者和创业团队可通过 Google AI Studio 的 Gemini API 免费套餐开始使用。中型市场团队可升级到付费套餐以获得更高的速率限制。付费套餐还保证内容不会用于改进 Google 的产品。受监管的企业可通过 Gemini Enterprise Agent Platform 接入,该平台提供 provisioned throughput、合规控制和批量折扣。开发者和企业两条路径目前均处于公开预览阶段,因此对生产环境的投入需谨慎评估。
适用行业:客服中心与 CX 平台、临床文档处理、媒体字幕与本地化、法律和保险业务受理、会议工具,以及语音驱动的开发者工具。
应用场景:实时语音 Agent、现场字幕、后通话分析管道、带说话人归属的会议转录、听写,以及语音控制界面。
两个 API 层面,两种不同的产品
Live API 提供亚秒级、持续性转录。它在说话人仍在发言时输出 interim_input_transcription(推测性部分转录),在轮次结束时输出 input_transcription(最终转录)。音频以原始 16 位 PCM 格式输入,16kHz 单声道,每 100ms 一个数据块。支持自动、混合和手动语音活动检测。临时令牌(ephemeral token)允许移动端和 Web 客户端进行流式传输而无需持有 API 密钥。
限制是真实存在的。Live 会话最长支持 10 分钟连续流式传输。不支持说话人分离(speaker diarization)。不支持词语级时间戳。
Interactions API 覆盖了流式传输无法支持的场景。它提供说话人分离、词语级起始和结束偏移,以及自定义词汇偏差(vocabulary biasing)。词汇列表最多支持 1,000 个词项,100 以下效果最佳。标准请求最多接受 1 小时音频。一旦启用说话人分离或词语时间戳,时长上限降至 30 分钟。
Verbatim 和 Smart 是真正需要做的设计决策
两个端点都暴露了两种模式。verbatim 是默认模式,返回所有内容,包括填充词、重复和错误开头。smart 模式则移除不流利表达、即时修正口误,并应用结构化格式。
Google 官方文档中的示例:"Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol." Verbatim 模式会保留全部内容。Smart 模式返回:"For the meeting, I think we should invite Bob and Carol."
Smart 模式不能与词语时间戳或说话人分离组合使用。这是需要规划的核心权衡。可读的摘要和可审计的转录文本现在是两个不同的 API 调用。
根据 Artificial Analysis 的测量,Google 公布的平均字错误率(WER)为:流式 4.0%、非流式 2.6%。在多语言 FLEURS 基准测试中,针对一组主要语言和地区,模型报告的 WER 为:流式 5.50%、非流式 5.04%。
相比 Google 上一代转录模型 Chirp 3,最终转录时间提升了 70%。语言覆盖超过 85 个地区,支持自动检测和语言切换,无需额外配置。
Live API 已集成到 LiveKit、Pipecat、Agora、Fishjam、Vercel 和 Vision Agents。在消费端,该模型为 Android 上的 Rambler、macOS 上的 Gemini 应用以及 Google Antigravity 提供支持。Chrome 被列为即将推出。
两个端点,而非一个:流式传输以牺牲说话人分离和词语时间戳为代价,换取亚秒级延迟。
报告的 WER 为:流式 4.0%、非流式 2.6%,数据来源为 Artificial Analysis。
Smart 模式不能与时间戳或说话人分离组合使用——每次调用只能选其一。
混合成本约为 $0.005/分钟(批处理)和 $0.009/分钟(实时);无开放权重。
硬性限制:Live 会话最长 10 分钟,文件最长 1 小时,启用说话人分离后最长 30 分钟。
点击这里查看技术详情。此外,欢迎关注我们的 Twitter,不要忘记加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。你用 Telegram 吗?现在你也可以加入我们了。
需要与我们合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会吗?联系我们。
Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的力量造福社会。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻著称,内容既有技术深度又通俗易懂。该平台月访问量超过 200 万次,彰显了其深受读者欢迎的程度。