Google 推出 Gemini Live Translate 功能,在多平台提供流畅的实时语音翻译。部分开发者可用于多语言应用,但大多数程序员直接用途有限。
Gemini 3.5 Live Translate 是我们最新推出的音频模型,可提供覆盖 70 多种语言、接近实时的语音到语音翻译。
高级主任软件工程师
你的浏览器不支持音频元素。
二十年前,Google 的翻译技术始于一项开创性的机器学习实验:把语言科学转化为连接人与人的奇妙力量。如今,这项实验已经取得长足进展——我们旗下的产品每月为数十亿用户翻译超过一万亿个单词。
今天,我们发布最新的实时语音到语音翻译音频模型 Gemini 3.5 Live Translate,向前迈出新的一步。
该模型可以自动检测 70 多种语言,并生成流畅自然的翻译语音,同时保留说话者的语调、节奏和音高。传统的轮流对话系统需要等说话者讲完才会响应,而 3.5 Live Translate 可以持续生成语音,在等待更多上下文以提高质量与立即翻译以跟上说话者之间取得平衡。它输出的音频连贯流畅,不会出现尴尬的停顿,并且在整个会话过程中始终只比说话者慢几秒钟。
Gemini 3.5 Live Translate 从今天起陆续在 Google 各项产品中推出:
Gemini 3.5 Live Translate 会在语音流式传输过程中实时处理语音,让不同语言之间的交流更加顺畅。该模型可以处理多语言输入,无须手动配置设置。同时,它具备良好的抗噪能力,能够确保应用应对嘈杂且不可预测的环境。你可以利用这些能力,为多语言通话、会议、课程、直播等场景提供实时口译支持。
观看 Gemini Live API 的实际运行效果,了解如何实现配音和多语言同声翻译。你可以深入体验 demo,或在 Gemini Cookbook 中查看更多示例代码。
借助 Gemini Live API,Agora、Fishjam、LiveKit、Pipecat 和 Vision Agents 等开发者平台可以帮助开发者轻松构建并部署语音翻译应用。这些集成方案负责处理复杂的实时媒体流基础设施,让开发者能够专注于用户体验。
我们的合作伙伴 Grab 正在测试该模型,以便在接驾过程中,让司机与乘客能够以接近实时的方式进行多语言交流。这些用户每月通过 Grab 发起的语音通话超过 1000 万次。
除了 Grab,CJ ENM、LiveKit 等公司也分享了对 3.5 Live Translate 的积极反馈,特别肯定了它出色的翻译质量、准确性和低延迟:
Google Meet 的语音翻译功能很快将采用 3.5 Live Translate,并通过以下改进提升使用体验:
本月起,我们将面向部分 Google Workspace 企业客户推出此次更新的 private preview,并于今年晚些时候进行更广泛的推广。
该模型也正在全球范围内陆续登陆 Android 和 iOS 版 Google Translate 应用。使用 Live translate 功能时,只需连接任意一副耳机,即可在 70 多种语言之间获得更加流畅的翻译体验,并在译文中还原说话者的语气。
对于 Android 用户,我们也开始陆续推出由 3.5 Live Translate 驱动的新「聆听模式」,让你可以直接通过手机听筒收听翻译。只需像接听普通电话一样把手机放到耳边,翻译后的音频就会直接流式播放给你。当你想快速收听翻译、不希望其他人听见,同时手边又没有耳机时,这项新功能会非常实用。
使用新的聆听模式,用户可以直接通过手机听筒,近乎实时地收听西班牙语导览的英语翻译。
我们的模型生成的所有音频都会使用 SynthID 添加水印。这种无法被感知的水印会直接嵌入音频输出中,确保 AI 生成的内容仍可被检测,从而帮助防止虚假信息传播。有关我们在安全与责任方面所采用方法的详细信息,请查看 model card。