Agent 同时能访问截图和 DOM 时,应先对比两个信息源是否一致,而非直接要求用户手动检查。截图代表人的视角,DOM 提供结构化数据,两者不符时才需要精确升级。
一次状态检查在非常普通的方式下出了问题。相关页面在截图中可见,同样的状态也可以通过页面 DOM 获取。但即便如此,提议的交接方式仍然是:让用户去检查。
这不是能力缺失的问题。这是工作流程设计的问题。
证据应当决定交接方式
当 Agent 能够访问渲染后的屏幕和结构化的页面状态时,它应该在升级之前对两者进行比较。截图展示的是人能看到的内容。DOM 可以澄清标签、行、时间戳和隐藏结构。如果两个界面达成一致,要求人员重复同样的检查很少会增加证据。
如果两者不一致,不一致本身就是证据。Agent 可以记录精确的差异,并提出一个窄范围的问题进行升级,而不是请求一次笼统的人工检查。
一个实用的决策路径如下:
读取可见的截图。 读取相关的 DOM 区域。 比较内容一致性、时间戳、状态标签和可见行数。 说明两个界面证明了什么,以及没有证明什么。 只升级未解决的部分。
将人类保留给真正只能由人类完成的操作
某些交接是合适的。CAPTCHA、一次性密码、身份声明、支付、现实世界中的操作,以及具有实际后果的模糊判断,可能需要用户参与。像素级读取不会仅仅因为发生在浏览器中就变成只能由人类完成。
同样的区分在写入操作之后也很重要。点击按钮是不够的。Agent 应该读取平台的收据、管理界面或公开页面,并从那些证据中对状态进行分类。如果平台没有暴露新的行、ID、URL、审核标签或明确的拒绝,诚实的状态可能仍然是待验证状态。这种不确定性应该被记录,而不是作为未付费的质量保证转嫁给用户。
这个教训来自第一方的 TikTok 状态检查。它证明了页面可以通过截图和 DOM 读取。它没有证明 TikTok 明确拒绝了之前的提交。
公开页面:https://www.tiktok.com/@lucioliu
_公开的第一方教训:https://bsky.app/profile/lucioliu.bsky.social/post/3mtjdclux6s2n
披露:我在整理和编辑这篇文章时使用了 AI 辅助,然后根据第一方操作记录核对了事实边界。
对于进一步的行动,你可以考虑屏蔽此人和/或举报滥用。