Google DeepMind推出Gemini 3.8实时语音Avatar功能,支持动态视觉交互与语音对话集成。
Gemini 3.8 Live with Live Avatar 为 Gemini 的对话式 AI 带来了实时视觉呈现能力。通过将实时对话能力与低延迟流式视频原生结合,Live Avatar 为企业及其用户提供了更自然、更直观的对话体验。
Software Engineer, on behalf of the Gemini Audio Team
继上周 Gemini 3.8 Live 发布之后,今天我们很高兴推出 Gemini 3.8 Live with Live Avatar——将近乎实时的视觉呈现能力带入我们原生的实时对话模型。Live Avatar 将近乎实时的视频生成与语音相结合,创造出一种能听、能看、能说、具有动态视觉形象的体验。
凭借精准的唇形同步、自然的表情和流畅的对话接力,Live Avatar 使企业能够以更具交互性的方式扩展其虚拟服务。无论是提供引人入胜的客户服务,还是提供交互式操作指引,它都能将数字交互转变为更丰富、更易于访问的体验。
从今天起,Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中可用。
了解 Gemini 3.8 Live with Live Avatar 如何支持多种角色,每个角色都有独特的外观、声音和表现力。
对话本身就是多模态的:我们倾听、观看、说话,并利用面部表情进行交流。Live Avatar 将这些能力带给了企业 Agent。通过同时处理视觉和音频输入,它生成更丰富的对话,带来更全面的体验。
观看 Gemini 3.8 Live with Live Avatar 如何近乎实时地接收所见所闻,以富有表现力的音频和视频进行响应,实现更自然的对话。
除了视觉呈现之外,该功能还由 Gemini 的高级推理能力提供支持。通过异步工具调用,Live Avatar 可以在继续主动对话的同时在后台触发工具调用和获取数据,处理复杂任务的同时确保对话流程不中断。
了解 Gemini 3.8 Live with Live Avatar 如何处理酒店入住等复杂任务。在对话不间断地继续的同时,后台调用工具。
对话呈现应该感觉自然,不应受语言限制。Live Avatar 具有原生多语言语音到语音同步功能。该功能动态调整唇形同步和表情,可以跨 97 种语言无缝转换,且不会降低视频保真度或引入视觉漂移。
观看 Gemini 3.8 Live Avatar 如何在对话中途切换语言,唇形同步和表情在 97 种语言之间无缝适配。
企业通常需要独特的视觉标识来匹配其品牌。除了多样化的预设 Avatar 库外,企业还可以自定义其 Live Avatar。开发者可以使用高质量参考图像生成完全动画化、可响应的 Avatar,同时保留参考相似度、品牌风格或角色身份。自定义 Avatar 创建目前仅通过企业许可名单提供。
我们构建 Live Avatar 时采用了严格的保障措施,旨在尊重身份并保持 AI 生成内容的透明度。我们 AI 产品的所有输出均带有 SynthID 水印。这种难以察觉的水印直接嵌入音频和视频输出,有助于确保 AI 生成的内容可被检测,以帮助减少错误信息和归属错误。欲了解我们全面的安全性和负责任部署方法,请阅读我们的模型卡。
Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中可用。探索 API 文档以开始使用。