Google DeepMind 推出 Gemini 3.8 Live 及扩展思考版本,官方未披露具体能力提升,但作为大版本更新直接影响 AI 应用开发选型。
Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking 是我们目前最先进的实时对话模型。智能与并行推理的重大升级,使它们在协作和使用语音执行复杂任务时更加直观。
Member of Technical Staff, 代表 Gemini Audio 团队
您的浏览器不支持音频元素。
我们发布 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking,旨在让语音交互更加自然、流畅和智能。这些模型在不打断对话的情况下处理复杂推理、实时视觉上下文和后台任务执行。您现在就可以通过 Gemini API、Google Workspace 和 Gemini 应用开始使用这些功能。
查看「Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking」,了解更多智能语音 AI。
Gemini 3.8 Live 提供快速、流畅的对话,支持实时视觉和语言。
使用 3.8 Live Extended Thinking 处理复杂任务,同时保持对话流畅。
这些模型在后台管理工具,让您可以持续聊天。
您可以在 Google Workspace、Search 和 Gemini 应用中试用这些新功能。
Google 刚刚发布了两款新的 AI 模型,让与设备的对话变得更加自然。它们可以处理中断、在语言之间切换,甚至在工作时解释自己的思维过程。无论您是在解决复杂问题还是随意聊天,AI 现在都像是在真正倾听并与您一起思考。这是让 AI 感觉像一个真正的对话伙伴的重大一步。
今天,我们推出两款新模型,将近实时推理的进步带给更多用户,从而更有效地启用语音代理,并使与 AI 的对话更加直观和智能。
Gemini 3.8 Live:专为规模化与成本效率而构建,将对话智能与流畅对话和视觉定位相结合。
Gemini 3.8 Live Extended Thinking:专为高复杂度任务而构建,具备更强的智能和多步推理能力。
对于开发者和企业而言,这些模型为可靠、可投入生产的语音代理提供了构建模块。它们还使在 Gemini 应用、Google Workspace 和 Search 中与 Gemini 对话更加流畅和协作——帮助您仅用语音就能处理复杂任务。
体验更流畅、更智能的对话
Gemini 3.8 Live Extended Thinking 提供企业级任务完成能力和智能,在 Artificial Analysis 的 Speech to Speech Quality Index 中以 82.6 分占据总体第一,并在 τ-Voice 上以 68.6% 和 Sierra 的 τ-Voice-banking 基准上以 35.1% 在代理任务完成方面领先。它还提供强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时与其他前沿模型相比保持极具竞争力的价格。
Gemini 3.8 Live 在用户中获得了高度偏好,在 Speech Agent Arena 中排名第二。除了这一表现,它还保持高度成本效益——为开发者和企业提供专为规模化构建的、高效且有能力的模型。
在 ServiceNow 的 EVA-Bench(评估语音代理的基准)上,我们的模型通过在复杂工作流中成功平衡准确性与对话质量,推动了帕累托前沿。
注:此测试在 Gemini Enterprise Agent Platform 的 Live API 上运行。
Gemini 3.8 Live 近实时处理视觉输入,通过上下文丰富对话,提供更有帮助的回复。它在对话中自动检测并在 97 种支持的语言之间切换。它在后台执行工具和 API 调用,同时继续对话,因此模型可以确认请求并在后台任务完成时继续聊天。
Gemini 3.8 Live 使用视觉上下文实时指导员工入职,回答现场问题。
观看 Gemini 3.8 Live 使用视觉上下文、推理和自然对话流程近乎实时地下棋。
对于需要更深入推理的任务,3.8 Live Extended Thinking 同时进行推理和说话。它为复杂工作流提供更强的智能,同时保持不间断的对话流程——使用「让我查一下……」等早期口头提示自然地确认提示,并实时播报进度,向用户逐步讲解后台多步任务的进展。
观看 Gemini 3.8 Live Extended Thinking 将草图和近乎实时的语音反馈转换为可运行的 React 组件。
观看 Gemini 3.8 Live Extended Thinking 协调多步预订和异步函数调用——所有这些都不打断自然的实时对话。
观看 Gemini 3.8 Live 仅通过自然语音实时构建完整的商业计划和自定义营销工具包。
在整个 Google Workspace 和 Search 中,我们的 Live 模型提供更直观、更协作的体验——尤其是在处理最复杂的任务时。
在 Google Workspace 中试用 Gemini 3.8 Live Extended Thinking,支持 Docs Live、Gmail Live 和 Keep Live。
在 Search Live 中获取由 Gemini 3.8 Live 驱动的分步、实时故障排除帮助。
赋能开发者和企业语音生态系统
通过使用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台使开发者能够轻松构建和部署高性能语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者能够完全专注于用户体验。
我们还与 Salesforce、Genspark 和 Lumeris 等公司合作,他们对 3.8 Live 和 3.8 Live Extended Thinking 感到兴奋,强调其令人印象深刻的延迟、流畅性和工具调用能力。
通过 SynthID 水印确保透明度
我们所有 AI 产品生成的音频都带有 SynthID 水印。这种难以察觉的水印直接嵌入音频输出,确保 AI 生成的内容可被检测,以帮助防止虚假信息。有关我们安全与责任方法的详细信息,请查阅模型卡。
开始使用我们最新的 Gemini Audio 模型:
3.8 Live 即日起逐步推出:
面向开发者:Gemini API 和 Google AI Studio
面向企业:Gemini Enterprise 私人预览版,并即将登陆 Gemini Enterprise for Customer Experience
面向所有人:Search Live
3.8 Live Extended Thinking 即日起逐步推出:
面向开发者:Gemini API 和 Google AI Studio
面向企业:Gemini Enterprise 私人预览版,并即将登陆 Gemini Enterprise for Customer Experience 和 Google Workspace 企业客户
面向所有人:Gemini Live,以及 Google AI Pro 和 Ultra 订阅用户在 Workspace 的 Docs、所有 Google AI 订阅用户在 Gmail 和 Keep 中的使用