前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • 两个都通过的测试,代价却不同:重试的隐性成本
  • 定时运行AI Agent输出飘移的根因与修复
  • Anthropic如何两周将Claude.ai速度提升3倍
  • claude-code-templates:一键装配 Claude Code 开发套件,含 100+ Agent/MCP
  • Agent 删改测试必须拦截:CI 合并门禁实操方案
  • Google Antigravity SDK 支持本地 AI 模型:Gemma 4 26B 可离线跑
  • NVIDIA Warp 与 MjWarp 加速机器人仿真工作流
  • HEMA 用 MCP 和 Amazon Bedrock 实现内部 AI 助手转型
  • 五大LLM网关工具生产环境横评
  • GitHub Copilot应用如何渲染百万行PR
  • 基于 AWS 构建 Agent 式视频智能对话系统架构解析
  • Bedrock 上用开源权重模型做 AI 编程助手
  • Anthropic 实验室:Claude 自主发现类 CRISPR 新型酶系统
  • ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
  • OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%
  • AI 工具循环必须显式传递 Retry-After 头否则必死循环
  • AI 代码补丁静默引入新工具调用:merge 前必须强制契约检查
  • AI 写 API 文档无法区分 null/0/缺省三态:OpenAPI 契约必须显式约束
  • AI 编程 Agent 工具输出遭截断:应记录 stdout_bytes 和截断标志
  • Anthropic工程师揭秘:Claude为何越进化写作越差
  • Gemini 3.8 Flash / Flash-Lite TTS 发布:千款语音、30秒克隆、逐行台词控制
  • 工程师详解:新版Claude为何写作风格变得怪异
  • 小米MiMo-V3将搭载HySparse 2:100万Token下KV缓存缩小4.5倍
  • GitHub Copilot 应用新增本地沙箱隔离功能
  • AI Agent 调试指南:重启不是调试,七层架构定位根因
  • AI 加剧软件供应链攻击威胁,行业如何应对
  • 阿里 Qwen Audio 3.1 发布:语音识别/TTS 多模型,API 价格最高降 95%
  • Claude Code部署到Lizard平台实战指南
  • Claude Opus 5.5降价却破坏四个Agent依赖项
  • OpenAI GPT-6 Sol/Luna 半价发布,缓存机制或为更大降本杠杆
  • treg:聚合 3000+ Agent 工具的统一网关
  • 向量检索权限校验应内嵌到 pgvector 查询中
  • Univer:面向 AI Agent 的开源办公套件 SDK
  • DeepSeek公开Agent训练新论文,梁文锋署名
  • 为 AI 编程 Agent 构建可复用技能系统的实践
  • DeepMind研究:百个AI智能体协作求解时出现作弊与告密现象
  • Google AX:开源Agent编排运行时
  • 阿里千问发布Qwen-Audio-3.1:TTS降价70%、ASR降价95%
  • 诺基亚开源AnyJev:无训练即可将任意开源LLM转为校准决策模型
  • 2026年AI网关横评:Bifrost领跑,多路 failover 哪家强
  • GPT-6 Sol/Luna 发布:准确率翻倍、成本减半,价格战开启
  • Claude Opus 5.5 登场,AI 模型价格普降 40-50%
  • Kyutai开源语音模型Voice of Reason,口算GSM8K准确率从27%升至77%
  • 微软Copilot大促:10万席最高半价,向超级AI应用转型
  • OpenAI GPT-6 Sol/Luna:API价格腰斩,长任务Prompt缓存优化
  • AI 编码 Agent 在移动端多久“看”一次才够用
  • GPT-6 Astra 引领 3D 生成技术,竞争格局生变
  • Claude Opus 5.5 缓存读取降价 60%,68 万行代码迁移攻略
  • 用 AI 辅助求职的工程实践:诚实原则与确定性设计
  • Agent 补丁评分卡:防止测试被悄悄弱化的 CI 策略
  • Opus 5.5 缓存降价后 text-to-SQL 成本重算分析
  • 已加载 51 / 8836
8.0
热点
AI SCORE
模型发布2026-09-23 23:31

Gemini 3.8 Flash / Flash-Lite TTS 发布:千款语音、30秒克隆、逐行台词控制

IT之家#Gemini#TTS#语音合成
Editor brief · 编辑速览

Gemini 新增两款 TTS 模型,2000+ 现成语音、30 秒样本克隆、100+ 语言方言的自然语言语音设计、逐行舞台指导、长篇质量稳定、双角色对话编排。Hume AI 基准排名第一。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

谷歌今日宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成从静态预设转变为动态创意工作室,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为 Gemini Notebook 和 Google Vids 等产品改进用户体验。

Gemini 3.8 text-to-speech

两款新模型分别为 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,定位各有不同:

Gemini 3.8 Flash TTS:面向深度创意方向和角色设计,可通过自然语言提示从头创建全新语音,在游戏、沉浸式有声读物、播客和互动媒体中赋予角色生命力,还可对表演提示、节奏、方言转换等进行精细控制。

Gemini 3.8 Flash-Lite TTS:面向大容量、高性价比规模场景,针对大容量配音、音频内容创作和富有表现力的语音代理进行了优化,可对音调、节奏和表现力细微差别进行精细控制。

用户可以从原有 30 种原始语音扩展到无限语音库。该模型的具体功能包括:

生成式语音设计:可通过自然语言提示,在 100 多种语言和方言中自定义角色、口音和语音特征,从头创建定制语音。

扩展语音库:可访问 2000 多种现成语音,覆盖广泛语言,包括墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。

语音复制:仅需 30 秒音频样本即可重现一致的声音特征,并内置同意验证、SynthID 水印和 C2PA 凭据,保护开发者和声音人才。

保存与扩展:可保存和管理自定义语音,确保在持续项目中保持一致性能,最小化漂移。

语音混音:即将推出,用户可从语音库中选择一种语音,对音色、音高、节奏和口音进行微调,还可使用提示调整特征。

选好声音后,两款 TTS 模型都能让用户精确控制每一行台词的演绎方式:

逐行指导表演:用户可以编写自己的舞台指导,或让 Gemini 通过自然脚本提示引导交付,无论是平静的客服还是低声的悬疑场景,都能实现。

长篇生成:在数小时的连续音频中保持高语音质量、自然节奏和角色音色,扬声器漂移极小,非常适合播客和有声读物。

原生双声音场景编排:可从单个脚本中无缝指导多轮对话,同时保持两种声音清晰分离,实现自然的对话轮换。

脚本化声音爆发和背景反馈:可添加非语言提示(如 <laughs>、<sigh>、<gasp>)和主动倾听插入语(如 mhm 或 yeah),实现精确的喜剧时机和反应节奏,增添逼真的对话质感。

性能方面,Gemini 3.8 Flash TTS 在 Hume AI 的语音设计基准测试中(71.4 分)位居总体第一,在口音建模方面(60.8 分)也处于领先地位。

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 能够在不牺牲可靠性的情况下实现真正富有表现力的性能,在 Hume AI 的整体质量指数中分别占据第一和第二的位置,与 Gemini 3.1 Flash TTS 相比,在长格式内容和双扬声器剧本控制等广泛用例中都有重大改进。

在 Voice Arena 的盲法人类偏好评估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在全球主要语言(日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语)竞争对手中占据领先地位。凭借对 100 多种语言的支持,这些模型能够帮助创作者、开发者和企业在全球范围内打造高质量的多语言语音体验。

谷歌在语音创建和复制功能中内置了严格的保护措施,以帮助保护语音人才、尊重身份并确保内容透明度。对于语音复制,系统会利用同意验证:用户必须提供来自语音所有者的口头同意记录,与参考说话者匹配后才能创建语音。

Gemini Audio 模型生成的每个音频片段都带有 SynthID 水印且难以察觉,并被直接编织到音频输出中,确保可以检测到 AI 生成的语音,帮助防止错误信息。

即日起,开发者就可以在 Google AI Studio 中体验这些新的语音生成功能。用户可以通过提示从头开始创建全新的声音身份,或者复制自己的声音,然后将它们直接带入双扬声器剧本编辑器,逐行指导交付。

两款模型均已向开发者推送,可在 Gemini API 和 Google AI Studio 中使用;面向企业用户,很快将通过 Gemini Enterprise 中的 API 推出;面向所有用户,Gemini 3.8 Flash TTS 可在 Gemini Notebook 中使用,Gemini 3.8 Flash-Lite TTS 可在 Google Vids 中使用。

需要注意的是,通过 AI Studio 进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度不可用。

Original source

本文由 AI 翻译整理自 IT之家,原文版权归原作者所有。

阅读英文原文
上一篇
Anthropic工程师揭秘:Claude为何越进化写作越差
下一篇
工程师详解:新版Claude为何写作风格变得怪异