谷歌重新想象 AI 时代的鼠标指针
Google DeepMind 推出上下文感知的 AI 指针,探索 Agent 与 UI 的自然交互模式,代表 AI 交互范式的未来方向。
Google DeepMind 推出上下文感知的 AI 指针,探索 Agent 与 UI 的自然交互模式,代表 AI 交互范式的未来方向。
Adrien Baranes 和 Rob Marchant
鼠标指针一直是计算机屏幕上的常伴,出现在每个网站、文档和工作流中。尽管技术不断变化,指针在半个多世纪里几乎没有演变。
我们一直在探索新的 AI-powered 功能,帮助指针不仅能理解它指向什么,还能理解为什么这对用户很重要。
我们的目标是解决一个常见的困境:因为典型的 AI 工具存在于自己的窗口中,用户需要把他们的世界拖进去。我们想要相反的效果:直观的 AI 能跨越用户使用的所有工具,在他们身边无缝地工作,不会中断他们的工作流。例如,想象你指向一栋建筑的图片,然后请求"给我显示方向"。当 AI 系统已经理解了上下文时,不需要更多操作。
今天,我们正在阐述指导我们思考未来用户界面的基本原则,并分享由 Gemini 驱动的 AI-enabled 指针的实验演示。例如,你可以访问 Google AI Studio 来编辑图像或在地图上查找地点,只需指向并说话即可。
我们开发了四个原则,这些原则共同将传达上下文和意图的繁重工作从用户转向计算机,用更简单、更直观的交互替代文本繁重的 prompt。以下是我们的方法和原则的演示。
AI 功能应跨越所有应用,而不是迫使用户在应用间进行"AI 绕路"。 我们的原型 AI-enabled 指针在用户工作的任何地方都可用。例如,他们可以指向一份 PDF 并请求一个要点摘要以直接粘贴到电子邮件中,将鼠标悬停在统计数据表上并请求一个饼图版本,或者突出显示一份食谱并要求所有配料翻倍。
当前 AI 模型需要精确的指令。 为了获得良好的响应,用户必须编写详细的 prompt。AI-enabled 指针会通过平稳地捕捉指针周围的视觉和语义上下文,让计算机"看到"并理解用户关心的重点,从而简化这个过程。在我们的实验系统中,只需指向,AI 就会确切知道用户需要帮助的词语、段落、图像的一部分或代码块。
拥抱"这个"和"那个"的力量
在日常相互交互中,人类很少用长篇详细的段落说话。我们可能会说"修复这个""把那个移到这里"或"这是什么意思?"——同时依靠身体姿态和我们的共同上下文来填补理解上的任何空白。理解这种上下文、指向和语音组合的 AI 系统将允许用户用自然简语做出复杂请求,无需繁琐的 prompt。
将像素转化为可操作的实体
数十年来,计算机只能追踪我们指向的位置。AI 现在也可以理解用户指向的内容。这将像素转化为结构化的实体,如地点、日期和对象,用户可以立即与之交互。涂鸦笔记的照片成为交互式待办事项列表;旅行视频中暂停的画面成为那个看起来不错的餐厅的预订链接。
构建适应人类行为的技术——而不是迫使用户适应技术——实现了一个与 AI 协作感到真正直观、流畅和无缝的未来。
我们很高兴这些以人为本的概念正在被融入我们每天使用的产品中。
我们现在正在整合这些原则来重新想象 Chrome 中的指向和我们新的 Googlebook 笔记本电脑体验。从今天开始,你可以使用指针在 Chrome 中询问 Gemini 关于你关心的网页部分,而不是编写复杂的 prompt。例如,你可以选择页面上的几个产品并要求比较,或指向你想在客厅中可视化新沙发的位置。同样,我们即将在 Googlebook 中推出 Magic Pointer,允许用户在指尖利用 Gemini,以获得更直观的体验。因为还有许多其他可能的出色应用,我们将继续在我们的平台上测试未来概念,包括 Google Labs' Disco。