Google Gemini 音频模型升级,语音交互更自然
Google 改进 Gemini 音频处理能力,支持更复杂的语音对话和理解。开发者可通过 API 集成增强应用的语音交互体验。
Google 改进 Gemini 音频处理能力,支持更复杂的语音对话和理解。开发者可通过 API 集成增强应用的语音交互体验。
产品管理总监
杰出研究科学家
您的浏览器不支持音频元素。
Google 对 Gemini 2.5 Flash Native Audio 进行了增强,以打造更出色的实时语音 Agent。新版具备更精准的函数调用、更可靠的指令遵循能力,以及更流畅的对话体验。Google Translate app 的实时语音翻译 beta 版现已开始在美国、墨西哥和印度的 Android 设备上推出,欢迎体验。
“经过改进、可实现强大语音交互的 Gemini 音频模型”增强了实时 Agent 和翻译能力。
Gemini 2.5 Flash Native Audio 现在拥有更精准的函数调用和更出色的指令遵循能力。
此次更新可以从之前的对话轮次中检索上下文,从而实现更流畅的对话。
Google Translate 中的实时语音翻译能够保留语调,并支持 70 多种语言。
现在,你可以通过 Vertex AI 上的 Gemini 2.5 Flash Native Audio 开始构建语音 Agent。
Google 提升了 Gemini AI 理解对话和进行语音交流的能力。它现在能够更好地理解指令、开展更流畅的对话,并实时翻译不同语言。这意味着,AI 既可以帮助企业提供客户服务,也能帮助使用不同语言的人们更好地理解彼此。你甚至可以直接在 Google Translate app 中体验实时翻译功能。
本周早些时候,我们升级了 Gemini 2.5 Pro 和 Flash Text-to-Speech 模型,为音频生成引入了更强的控制能力。
但生成富有表现力的语音只是对话的一部分。今天,我们发布了面向实时语音 Agent 的新版 Gemini 2.5 Flash Native Audio。此次更新增强了模型处理复杂工作流、理解并执行用户指令,以及进行自然对话的能力。
Gemini 2.5 Flash Native Audio 现已登陆 Google AI Studio、Vertex AI 等 Google 产品,同时也已开始逐步在 Gemini Live 和 Search Live 中推出,首次将原生音频的自然体验带到 Search Live。这意味着,你可以更高效地与 Gemini 实时进行头脑风暴,在 Search Live 中获得实时帮助,或者构建新一代达到企业级应用要求的客户服务 Agent。
除了为实用型 Agent 提供支持,原生音频还为全球交流开启了新的可能性。我们正在推出实时语音翻译功能,它可以面向耳机提供流式的语音到语音翻译,并保留说话者的语调、语速和音高。这项 beta 体验从今天起开始在 Google Translate app 中推出。
为了支持不同平台和产品上的广泛使用场景,我们在三个关键方面改进了 Gemini 2.5 Native Audio:
更精准的函数调用:我们提升了模型触发外部函数时的可靠性。现在,它能够更准确地判断应在对话中的哪个时机获取实时信息,并在不中断对话节奏的情况下,将这些数据自然地融入音频回复。在 ComplexFuncBench Audio 这项包含多种约束、用于评估多步骤函数调用能力的测试中,Gemini 2.5 Native Audio 以 71.5% 的成绩处于领先地位。
更可靠的指令遵循:模型现在能更好地处理复杂指令,在内容完整性方面带来了更高的用户满意度。它对开发者指令的遵循率从 84% 提升至 90%,因而能够提供更加可靠的输出。
更流畅的对话:我们在多轮对话质量上取得了显著提升。Gemini 2.5 Flash Native Audio 能够更有效地检索之前对话轮次中的上下文,打造更加连贯的对话体验。
新版 Gemini 2.5 Flash Native Audio 与之前版本及业界竞争对手在 ComplexFuncBench 上的性能对比
Google Cloud 客户已经开始使用 Gemini 的原生音频能力来取得实际业务成果,应用场景涵盖抵押贷款处理、客户来电等。
“用户在使用 Sidekick 不到一分钟后,往往就会忘记自己正在与 AI 对话;在某些情况下,他们甚至会在长时间交谈后向机器人道谢……Gemini [2.5 Flash Native Audio] 提供的全新 Live API AI 能力,帮助我们的商家赢得竞争。”——David Wurtz,Shopify 产品副总裁
“通过集成 Gemini 2.5 Flash Native Audio 模型……自 Mia 于 2025 年 5 月发布以来,我们显著增强了它的能力。这一强大的组合已经帮助我们的经纪合作伙伴发放了超过 14,000 笔贷款。”——Jason Bressler,United Wholesale Mortgage(UWM)首席技术官
“通过 Vertex AI 使用 Gemini 2.5 Flash Native Audio 模型,让 Newo.ai AI Receptionists 获得了无与伦比的对话智能……即便身处嘈杂环境,它们也能识别主要说话者,可以在对话过程中切换语言,而且声音极其自然,富有情感表现力。”——David Yang,Newo.ai 联合创始人
Gemini 现在原生支持全新的实时语音到语音翻译能力,可同时满足持续监听和双向对话场景的需要。
在持续监听模式下,Gemini 会自动将多种语言的语音翻译成同一种目标语言。这样一来,你只需戴上耳机,就能用自己的语言听懂周围的世界。
在双向对话场景中,Gemini 的实时语音翻译可以实时完成两种语言之间的翻译,并根据当前说话者自动切换输出语言。例如,如果你说英语,并且想和一位说印地语的人交谈,你可以通过耳机实时听到英语译文;当你说完后,手机则会播放对应的印地语。
Gemini 的实时语音翻译具备多项关键能力,可以满足现实世界中的使用需求:
语言覆盖:将 Gemini 模型的世界知识、多语言能力和原生音频能力相结合,可以翻译 70 多种语言的语音,覆盖 2,000 种语言组合。
风格迁移:捕捉人类语音中的细微差异,保留说话者的语调、语速和音高,使译文听起来更加自然。
多语言输入:在同一个会话中同时理解多种语言,让你无须反复调整语言设置,也能跟上多语言对话。
自动检测:识别当前使用的语言并开始翻译,因此即使你不知道对方说的是什么语言,也可以直接开始翻译。
抗噪能力:过滤环境噪声,让你即使身处嘈杂的户外环境,也能轻松交谈。
从今天开始,你可以在 Google Translate app 的全新 beta 体验中尝试这项功能:将耳机连接到设备,然后点击“Live translate”,即可通过耳机获得实时翻译。目前,这项体验正在美国、墨西哥和印度的所有 Android 设备上逐步推出;对 iOS 和更多地区的支持也将很快到来。
我们将根据反馈继续迭代这项体验,并于 2026 年将其引入包括 Gemini API 在内的更多 Google 产品。
现在,你就可以使用 Gemini 2.5 Flash Native Audio 开始构建语音 Agent。该模型现已在 Vertex AI 上正式发布,并以 preview 形式登陆 Gemini API。你也可以在 Google AI Studio 中进行体验。
Gemini 2.5 Flash 和 2.5 Pro Text-to-Speech 模型同样可以通过 Google AI Studio 中的 Gemini API 使用。你可以通过语音生成文档开始上手、探索 prompting 指南,或者查看 Gemini API Cookbook。