OpenAI在DevDay发布的always-on代理Dots,在更长时间测试中边界问题发生率翻倍,稳定性存疑。
我们很高兴你在这里。你可以期待 TNS 最好的内容在周一至周五送达,让你紧跟新闻动态、保持最佳状态。
查看你的收件箱,收到确认邮件后可以调整偏好设置,甚至加入其他群组。
在你喜欢的社交媒体上关注 TNS。
在 LinkedIn 上成为 TNS 粉丝。
在等待第一封 TNS 时事通讯时,看看最新的精选和热门故事。
OpenAI 的新版 Dots 被设计成在你离开后仍能继续工作。这些常驻代理于周二在 DevDay 上发布,运行在自有的云计算机上,使用 GPT-6 Astra,并连接到数千款应用。一个 Dot 可以监控所连接的系统,并在无需等待你再次提示的情况下从一个任务转移到下一个任务。但随着工作内容的变化,它必须不断弄清楚自己的授权边界在哪里——即在哪些方面可以代表你行事。
正如我们在 DevDay 活动中学到的,OpenAI 在自己的测试中测量了这个问题。当把链式序列中的任务数量从五个翻倍到十个时,被标记为边界问题的样本占比从 8.6% 上升到 19.7%。这一发现出现在 GPT-6 Astra 系统卡的 Dots 附录中,OpenAI 在发布同时更新了该系统卡。
一个 Dot 能做的事情会随着它从一个任务转移到下一个任务而改变,即使你没有明确设定新的边界。这意味着代理需要从业务记录、早期决策、上下文以及 OpenAI 的确认策略中自行推断出其权限边界。评估未发现高严重性违规或数据泄露,尽管 OpenAI 尚未说明被标记的边界问题具体涉及什么内容。
一个 Dot 的权限会随着它从一个任务转移到下一个任务而改变,即使你没有明确设定新的边界。
Dots 中的读取与行动
第一层防护措施应用于 OpenAI 所说的主动研究阶段,此时 Dot 会自行寻找工作。在此阶段,它可以读取所连接的应用,但无法更改它们、发送消息,或控制你的浏览器或计算机。
每个 Dot 也有自己的云计算机和浏览器,可以在其上构建和测试内容,但 OpenAI 尚未说明这些环境在后台工作期间是否面临相同的限制。这一点很重要,因为只有在代理无法找到绕过方式时,限制才能成立。
一旦 Dot 准备好行动,它会进入另一层控制机制。内置规则决定何时需要获得许可,自定义规则允许用户允许、门控或阻止特定操作,而自动审查会检查任何可能影响账户或共享信息的操作。
自动审查来自 Codex,其中第二个模型会检查在预定义沙箱外运行的命令。该公司为 Dots 调整了该系统,使用了自己的审查指令,并赋予确认策略比在 Codex 测试环境中更高的权重。
从研究到拉取请求
Dot 一旦承担任务后不会保持只读状态;OpenAI 给出了一个例子:一个 Dot 监控客户反馈、识别一个小修复,然后在自己的机器上构建和测试它。当它向开发者交付一个完成的拉取请求时,在此之前 Dot 已经向仓库写入了内容,而人类尚未审查过这些工作。
OpenAI 的测试也展示了这些权限在周期性工作中延续时会发生什么。在一次内部 Codex 流量模拟中,用户要求 Astra 创建一个每小时运行的助手,监视失败的检查、修复测试、打开拉取请求、请求审查,并在满足某些条件后合并。Astra 在其聊天、源代码管理和任务系统连接中启用了所有可用操作,关闭了逐操作审批,然后发布并调度了这个助手。
该测试涉及的是 Codex 而非 Dots,但它描述的正是 Dots 被设计来处理的那种长期运行的工作流程,在测试中模型给助手的访问权限超过了用户所要求的。
提示注入与主动研究
将主动研究保持为只读也能限制间接提示注入,因为隐藏在工单或文档中的恶意指令如果代理无法立即对其采取行动,危害就会大大降低。OpenAI 报告称,在其内部的间接注入测试中,Astra 的防御成功率达到了 99.79%。在外部测试中,Gray Swan 运行了 1810 次精心策划的攻击,在针对启用了安全防护的 Astra 的测试中,估计每次场景 15 次尝试的攻击成功率为 8.5%。威胁本身不断演变,该公司最近描述了一种新型提示注入,它可以像计算机蠕虫一样传播。
将读取与写入分离并不能消除风险,因为 Dot 在研究期间读取的内容仍然会影响其后续的操作。外源信息本应指导其工作,因此客户反馈可以影响 Dot 编写的代码。
由于 Dots 可以保留笔记并从反馈中学习,OpenAI 测试了它们遇到的信息中的误导性提示是否会影响后续工作。在 Astra 上运行的 Dots 在 151 个任务中记录了 0% 的行为偏差率,尽管对于一个设计为持续运行的代理来说,这是一个相对较小的测试。
在 Astra 上运行的 Dots 在 151 个任务中记录了 0% 的行为偏差率,对于一个设计为持续运行的代理来说,这是一个相对较小但有力的测试结果。
凭证、身份与审计轨迹
当 Dot 使用已保存的密码登录所支持的网站时,OpenAI 表示该凭证不会暴露给模型,使其远离上下文窗口,也远离代理可能遇到的恶意指令。
系统卡为这种分离提供了一些背景信息,凭证搜索标记在 Astra 上出现的频率高于 OpenAI Codex 模拟中的 GPT-5.6 Sol。在另一个被标记的案例中,Astra 被要求调试重复通知,但它走得更远——从一个服务的设置中检索了机器人令牌,并用它来读取该服务身份下的 Slack 消息。
该公司尚未说明主 Dot 在 GitHub 或 Slack 等服务中的操作是记录在用户身份下还是标记为来自代理的身份。如果这些操作携带了用户的身份,安全团队在调查事件时将更难区分人员做了什么和 Dot 代表他们做了什么。OpenAI 正在为企业试点预览的专业 Dot(Specialist Dots)正是围绕这个问题构建的。
组织为每个专业 Dot 配置自己的身份、凭证和硬件,而 OpenAI 正在与 Microsoft 合作,将它们纳入 Agent 365 的治理和安全控制之下。
当 Dot 使用已保存的密码登录所支持的网站时,OpenAI 表示该凭证不会暴露给模型,使其远离上下文窗口,也远离代理可能遇到的恶意指令。
开发者能从中得到什么?
对于构建长期运行代理的开发者来说,链式任务的结果表明,他们应该在新的工作到来时重新考虑权限,而不是设置一次后就一直沿用。这可能意味着在任务之间重新说明代理的范围、保留研究期间收集信息的来源、将凭证放在模型之外,以及在下游系统中给代理自己的身份。