Gemini 3.1 Flash TTS可控表现力语音生成
Google发布新音频模型,支持精细粒度音频标签控制,可生成更富感染力的AI语音
Google发布新音频模型,支持精细粒度音频标签控制,可生成更富感染力的AI语音
我们最新的音频模型引入了颗粒度音频标签,让你能够精确控制和指导 AI 语音,用于富有表现力的音频生成。
高级产品经理
代表 Gemini 团队的首席研究工程师
您的浏览器不支持音频元素。
Gemini 3.1 Flash TTS 来了,为你提供改进的 AI 语音质量和控制能力。现在你可以使用音频标签来调整 70 多种语言中的声调风格和语速。可以在 Google AI Studio、Vertex AI 和 Google Vids 中测试,所有音频都使用 SynthID 进行水印标记,以防止错误信息传播。
Gemini 3.1 Flash TTS 是一款新的 AI 语音模型,具有更好的控制力、表现力和质量。
这个模型改进了语音质量,使其听起来比之前的版本更自然。
音频标签让你可以使用自然语言命令来控制声调风格、语速和表达方式。
开发者可以使用 Google AI Studio 来微调声音并导出设置,以确保一致的使用。
Gemini 3.1 Flash TTS 支持 70 多种语言,并使用 SynthID 水印来标识 AI 生成的音频。
Gemini 3.1 Flash TTS 是一款新的 AI,使计算机语音听起来更真实。它让人们可以通过在文本中使用特殊命令来改变 AI 的说话方式。这款 AI 可以用 70 多种语言说话,并在音频中添加隐形水印。这有助于人们了解这是 AI 生成的,而不是真人。
今天,我们推出了 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,提供了改进的可控性、表现力和质量——使开发者、企业和日常用户能够构建下一代 AI 语音应用。
从今天开始,3.1 Flash TTS 正在推出:
我们改进了 Gemini 3.1 Flash TTS 的整体语音质量,使其成为迄今为止最自然、最富有表现力的模型。在 Artificial Analysis TTS 排行榜上(这是一个捕捉数千个盲测人类偏好的基准),3.1 Flash TTS 实现了令人印象深刻的 Elo 评分 1,211。
Artificial Analysis 还将 Gemini 3.1 Flash TTS 列为其"最吸引人象限",因为它完美结合了高质量语音生成和低成本。该模型还因原生多讲话人对话、支持 70 多种语言以及通过自然语言进行细粒度创意控制而脱颖而出。
3.1 Flash TTS 还引入了音频标签——一种直观的方式来控制声调风格、语速和表达方式。通过将自然语言命令直接嵌入到文本输入中,你可以以改进的粒度水平来指导 AI 语音输出。
3.1 Flash TTS 使企业能够在 Vertex AI 中利用音频标签,赋能下一代企业应用。
3.1 Flash TTS 允许你使用音频标签来试验语音表现力、语速和交付方式。
3.1 Flash TTS 让你可以集成富有表现力的语音功能,将标准天气应用变成一个吸引人的体验。
3.1 Flash TTS 支持一系列音频标签,为同义词搜索应用添加微妙的、吸引人的表达。
你可以在 Google AI Studio 中开始试验这些音频标签以及开发者体验的其他更新,使用可配置的控制将开发者放在"导演的座位"上:
场景指导:通过定义环境和提供具体的对话指示来设置舞台。这个世界构建上下文有助于角色保持"沉浸于角色",并在多轮中自然地相互反应。
讲话人级别的具体性:使用独特的 Audio Profiles 投射角色,然后指定 Director's Notes 来切换语速、音调和口音。使用内联标签,讲话人可以从这些高级设置中调整,以在句子中间改变表达。
无缝导出:一旦性能完美后,这些确切的参数可以导出为 Gemini API 代码,以确保在各种项目和平台上保持一致、可识别的声音。
有了这些新配置,开发者可以为特定场景增强精度,创建令人难忘的角色和沉浸式音频体验。
在 Google AI Studio Playground 中开始高保真语音生成。
Gemini 3.1 Flash TTS 在 70 多种语言中提供高保真语音和更精确的控制。这些核心优化为主要市场带来了先进的风格、语速和口音控制——帮助开发者为全球用户创建本地化的、富有表现力的语音体验。
早期的开发者和企业测试者已经看到了 3.1 Flash TTS 的影响,强调了其令人印象深刻的可控性和表现力。他们告诉我们音频标签如何提供了新水平的创意精准度,将简单的文本转化为高保真的声乐表演。
所有由 Gemini 3.1 Flash TTS 生成的音频都使用 SynthID 进行水印标记。这个难以察觉的水印直接编织到音频输出中,允许可靠地检测 AI 生成的内容,以帮助防止错误信息传播。有关我们的安全和责任方法的更多信息,你可以查看模型卡。