前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8629
  • TRL 1.0:随行业发展的开源微调库
  • 做中学:Claude Code 实战教程
  • AI 代理审计发现:内容问题逐一报警
  • Zerobox:隔离运行命令的沙箱工具
  • 长链路 Agent 的能力与限制
  • Claude Code 工具 Bug:强制重置代码仓库
  • 谷歌重新想象 AI 时代的鼠标指针
  • LLM 推理优化:KV Cache 压缩方案
  • AI 辅助求解 Knuth 经典问题的进展
  • AI 破译古代亚述泥板的新尝试
  • Notion 创始人不写代码:AI 编程工具成熟见证
  • CLI 成为 AI Agent 接入产品的标准方式
  • 为什么管理层看好 AI,工程师持保留态度?
  • GitHub 活动自动转博客:MCP 工作流自动化
  • .claude/ 文件夹深度解析
  • Cursor 秘用中文 AI 模型未披露,为何程序员应关注
  • OpenClaw 开源项目发布
  • OpenClaw + Pieces 长期记忆一体化配置指南
  • 7 美元 VPS 上跑 AI Agent:IRC 网关新思路
  • 500 美元 GPU 编程性能超越 Claude Sonnet
  • Gemini 3.1 Flash 新增音频模型,延迟更低
  • 两周看透中国 AI 生态:创始人、芯片和泡沫
  • 为 Claude Code 设计纯文本认知架构
  • Claude 生成代码 90% 流向小项目,质量面临考验
  • 为 Agent 提供临时数据库的基础设施
  • Ensu:完全私有的本地 LLM 应用
  • Cursor 自托管 AI Agent:代码隐私的重大升级
  • Apple Silicon 上 LLM 推理的性能优化
  • AI 时代的冷思考:工程能力才是核心
  • 程序员学习 AI 无需过度焦虑
  • LLM 内部机制深度破解:通用语言的蛛丝马迹
  • 给 AI 编码 Agent 加上视觉验证能力
  • RAG 系统从零到一的实战经验与教训
  • 语音 Agent 评估框架 EVA 发布
  • Claude Code 速查表与功能指南
  • Claude Code 实战提效工作流
  • Prompt 工程入门:问法决定质量
  • Cq:AI 编程 Agent 的专属问答社区
  • iPhone 17 成功运行 400B 大模型演示
  • 用 Claude 自动化移动应用 QA 测试
  • 现代 LLM 注意力机制可视化教程
  • OpenTelemetry 统一 LLM 追踪规范
  • OpenCode:开源 AI 编程 Agent 项目
  • 快速构建领域特定嵌入模型
  • 初次体验 Agent 技能开发
  • 一小时用 AI 快速原型应用
  • Gemini CLI 高级功能全解
  • 用四象限图判断 AI 技术价值
  • 企业级 MCP 应用案例分析
  • AI 术语速成手册
  • Meta AI 失控事件警示录
  • 已加载 51 / 8629
7.0
热点
AI SCORE
模型发布2026-03-26 23:23

Gemini 3.1 Flash 新增音频模型,延迟更低

Google DeepMind#Gemini#音频模型#Google
Editor brief · 编辑速览

Google 发布改进的音频语音模型,精度和延迟均有显著提升,实时交互更自然。对使用 Google 语音 API 的开发者有直接应用价值。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

我们最新的语音模型进一步提升了准确性并降低了延迟,让语音交互更加流畅、自然、精准。

Gemini 团队软件工程师

你的浏览器不支持音频元素。

Gemini 3.1 Flash Live 是 Google 迄今质量最高的音频模型,专为自然、可靠的实时对话而设计。开发者可以通过 Google AI Studio 中的 Gemini Live API 使用该模型,企业则可以将其用于客户体验场景。所有用户都可以通过 Search Live 和 Gemini Live 体验它,目前服务范围已覆盖 200 多个国家和地区。

“Gemini 3.1 Flash Live”正式发布,让 AI 音频听起来更加自然、可靠。

这款新音频模型速度更快,也更善于理解语气,从而实现自然的对话体验。

开发者可以使用它构建语音 Agent,更可靠地处理复杂任务。

Gemini Live 和 Search Live 现在可以使用多种语言提供更有帮助的回答。

3.1 Flash Live 生成的所有音频都会添加水印,以帮助遏制错误信息传播。

今天,我们推出 Gemini 3.1 Flash Live,进一步提升 Gemini 的实时对话能力。这是我们迄今质量最高的音频和语音模型。它具备下一代语音优先 AI 所需的速度和自然节奏,为开发者、企业和普通用户带来更加直观的体验。

3.1 Flash Live 已在多款 Google 产品中上线:

  • 面向开发者:通过 Google AI Studio 中的 Gemini Live API 提供预览版

  • 面向企业:通过 Gemini Enterprise for Customer Experience 提供

  • 面向所有用户:通过 Search Live 和 Gemini Live 提供

面向开发者:强大的推理与任务执行能力

我们提升了 3.1 Flash Live 的整体质量,使开发者和企业能够更可靠地构建可大规模完成复杂任务的语音优先 Agent。在 ComplexFuncBench Audio 这一衡量多种约束下多步骤函数调用能力的 benchmark 中,它以 90.8% 的得分领先于我们的上一代模型。

在 Scale AI 的 Audio MultiChallenge 中,开启“thinking”后,Gemini 3.1 Flash Live 以 36.1% 的得分位居领先。该 benchmark 专门测试模型在面对真实音频中常见的打断和犹豫时,遵循复杂指令以及进行长程推理的能力。

3.1 Flash Live 对语气的理解也有所提升,能够实现更加自然的对话。在 Gemini Enterprise for Customer Experience 中,相比 2.5 Flash Native Audio,它能更有效地识别音高、语速等声音细节,也更善于根据用户表现出的沮丧或困惑,动态调整回答。

3.1 Flash Live 让你能够构建适用于语音场景的 Agent,在嘈杂环境中处理复杂任务。

使用 Gemini 3.1 Pro 构建的演示示例,由 Gemini 3.1 Flash Live 提供支持。

3.1 Flash Live 让你可以通过语音进行 vibe coding,并快速迭代。

使用 Gemini 3.1 Pro 构建的演示示例,由 Gemini 3.1 Flash Live 提供支持。

Verizon、LiveKit 和 The Home Depot 等公司在工作流中使用 3.1 Flash Live 后给出了积极反馈,尤其肯定了它更自然、更出色的对话体验。

面向所有用户:更加自然、直观的交互

在 Gemini Live 和 Search Live 中,无论你是询问简单的日常问题,还是进行更复杂的对话,3.1 Flash Live 模型都能提供更有帮助、更自然的回答。

在 3.1 Flash Live 模型的支持下,Gemini Live 的响应速度比上一代模型更快,持续跟进对话脉络的时间也延长了一倍,让你在进行更长时间的头脑风暴时,仍能保持思路连贯。

3.1 Flash Live 让 Gemini Live 更快、更有帮助。

3.1 Flash Live 天生具备多语言能力,也因此推动了 Search Live 本周在全球范围内进一步扩展。此次发布后,来自 200 多个国家和地区的用户,现在都可以使用自己偏好的语言与 Search 进行实时、多模态对话。

通过 Search Live 中的 3.1 Flash Live 获得实时故障排查帮助。

体验 Gemini 3.1 Flash Live

3.1 Flash Live 生成的所有音频都会通过 SynthID 添加水印。这种无法被人耳感知的水印会直接交织在音频输出之中,从而可靠地检测 AI 生成的内容,帮助防止错误信息传播。有关我们的安全与责任实践的更多信息,请参阅模型卡。

从今天开始,亲自体验 3.1 Flash Live 的自然与可靠。我们期待看到你如何与它互动,以及如何使用它进行构建。

Original source

本文由 AI 翻译整理自 Google DeepMind,原文版权归原作者所有。

阅读英文原文
上一篇
500 美元 GPU 编程性能超越 Claude Sonnet
下一篇
两周看透中国 AI 生态:创始人、芯片和泡沫