Gemini 3.5 Flash 获得计算机控制能力
Google 为 Gemini 3.5 Flash 引入 computer use,让 AI agent 可自主控制计算机完成复杂任务。
Google 为 Gemini 3.5 Flash 引入 computer use,让 AI agent 可自主控制计算机完成复杂任务。
Gemini 3.5 Flash 中的计算机使用现已成为内置工具,用于构建能够跨平台交互的 agent。
Google DeepMind 产品经理
计算机使用现已成为 Gemini 3.5 Flash 支持的内置工具,为 agent 计算机使用任务提供了迄今最佳性能。此前它仅作为独立的 Gemini 2.5 计算机使用模型提供,现在已原生集成到主要的 Gemini Flash 模型中。Gemini 已经在函数调用以及使用内置工具(如 Search 和 Maps grounding)方面表现出色。借助内置的计算机使用能力,开发者现在可以使用 3.5 Flash 来可靠地构建自定义 agent,这些 agent 能够在浏览器、移动设备和桌面环境中进行观察、推理和采取行动。这为长期目标的任务和企业自动化任务(如持续软件测试和专业应用程序中的知识工作)带来了性能提升。
开发者和企业可以通过 Gemini API 和 Gemini Enterprise Agent Platform 开始使用 3.5 Flash 中的计算机使用功能。
3.5 Flash 使用计算机使用功能分析 Gemini 应用程序并返回分类特性列表。
配备计算机使用功能的 3.5 Flash 对其自身文档进行可访问性问题审计。
为了缓解在实时环境中运行的 agent 所面临的一些提示注入风险,我们对 Gemini 3.5 Flash 中的计算机使用功能采用了有针对性的对抗性训练。我们还发布了两个可选的企业安全保障系统,使企业能够:
要求对敏感或不可逆的操作进行明确的用户确认。
如果检测到间接提示注入,自动停止任务。
采用"纵深防御"方法,我们建议开发者将这些功能与安全沙箱、人工参与的验证和严格的访问控制相结合。有关安全措施的详细信息可在我们的最佳实践文档中找到。
我们已经看到客户通过计算机使用功能实现价值。以下是其中一些客户的看法:
立即尝试:在 Browserbase 托管的演示环境中测试功能。
开始构建:通过 Gemini API 和 Gemini Enterprise Agent Platform 深入了解我们的参考实现和文档。