给 AI Agent 提供页面感知时,为什么优先用可访问性树(accessibility tree)快照而不是原始 HTML DOM 或截图?
本文解释 AI Agent 为何优先采用可访问性树快照而非原始 HTML DOM,权衡 token 成本、语义密度、可操作元素识别,并给出具体场景与失败边界。
核心关键词AI Agent 页面感知 accessibility tree 快照对比 DOM
AI Agent · Web 可访问性面试题第 1 页,显示第 1–6 题,共找到 6 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
本文解释 AI Agent 为何优先采用可访问性树快照而非原始 HTML DOM,权衡 token 成本、语义密度、可操作元素识别,并给出具体场景与失败边界。
围绕“定位器依赖 accessible name 时,浏览器如何计算元素的可访问名称,多个命名来源冲突时哪个生效”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确命名来源优先级顺序及由此导致的定位失败诊断。
围绕“aria-hidden="true" 与 display:none 对基于可访问性树的 Agent 感知有什么本质区”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确两者在可访问性树中的可见性差异及对 Agent 决策的误导风险。
解释 getByRole 为何用可访问性语义替代 CSS/XPath 的结构依赖,包含角色名称计算机制,对比结构与语义定位在重构下的差异,并给出失效边界。
围绕“为多模态 Agent 选择观察方式时,什么任务截图优于可访问性树,什么任务反之”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确按视觉布局依赖度与 token 成本划分观察方式的判据。
围绕“MCP Roots 向服务端暴露客户端可访问的文件系统边界,roots/list_changed 通知何时触发”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 roots 是建议性边界而非强制沙箱的定位。