Gemini 3.8 Live 及 Extended Thinking 版本正式发布,Extended Thinking 在语音质量榜单排名第一,定价 $0.005/min,支持后台工具调用。
Google 发布了 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,这是迄今为止最先进的实时对话模型。二者均为原生语音到语音模型,专为实时语音代理构建。它们隶属于 Google 上月扩展的 Gemini Audio 系列。此次发布瞄准了一个明确缺口:能够进行推理并执行工具、同时不打断对话流畅性的语音代理。
两款模型均已在 Gemini Live API 和 Google AI Studio 中上线。它们是托管模型(非开源权重),因此不支持自托管。
Gemini 3.8 Live 侧重规模化与成本效益。它将对话智能与流畅对话和视觉锚定能力相结合。Gemini 3.8 Live Extended Thinking 则面向高复杂度任务。它在对话过程中增加了更强的智能与多步推理能力。Google 将二者定位为级联语音流水线的精简替代方案——以往方案需要串联 ASR、LLM 和 TTS 三个独立环节。
Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音到语音质量指数中以 82.6 分拿下总榜第一。在代理任务完成方面,它在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上达到 35.1%。在 Big Bench Audio(音频模型的推理基准)上也取得了 97.7% 的成绩。Gemini 3.8 Live 在 Speech Agent Arena(人类偏好评估)中位列第二。在 ServiceNow 的 EVA-Bench 上,Google 报告称这些模型将复杂工作流的帕累托前沿向前推进——它们在 Live API on Gemini Enterprise Agent Platform 上平衡了任务准确率与对话质量。
Live API 在新模型中暴露了 5 项核心能力:
异步函数调用:模型在后台执行 API 和工具调用。当任务完成时,音频响应持续向用户推送。
视觉上下文:模型近乎实时地处理视觉输入,使代理能够理解用户所言与所见。
字母数字精度:它能准确解析确认码、理赔编号和技术数据——这是语音系统的常见失败点。
多语言支持:模型可在对话中途自动检测并在 97 种支持的语言间切换,并保持口音一致性。
增量内容更新:它将实时音频与结构化数据融合,返回上下文感知的响应。
Extended Thinking 为后台多步推理添加了可配置的思考能力。它在思考的同时进行对话,通过"让我查一下"这类早期语言提示来确认收到了指令,然后边执行耗时任务边逐步叙述进展。Google 的演示展示了模型将草图加语音反馈转换为可工作的 React 组件,并协调多步预订流程。
两款模型的音频输入定价均为 $0.005/分钟,音频输出为 $0.018/分钟。Google 表示该估算基于 $3/百万输入 token 和 $12/百万输出 token。开发者还可通过 Live API 集成合作伙伴来构建,这些合作伙伴负责处理实时媒体流基础设施,包括:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents。Google 还与 Salesforce、Genspark 和 Lumeris 建立了合作,这几家公司均提及了模型的低延迟、流畅性和工具调用能力。示例应用已在 GitHub 上提供。

Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音到语音质量指数中排名第一,得分 82.6。
它在 τ-Voice 上得分 68.6%,在 Sierra 的 τ-Voice-banking 上得分 35.1%,在 Big Bench Audio 上得分 97.7%。
Gemini 3.8 Live 在继续对话的同时后台运行工具和 API 调用。
通过 Live API 定价为音频输入 $0.005/分钟,音频输出 $0.018/分钟。
所有生成的音频均携带 Google DeepMind 不可察觉的 SynthID 水印。