DeepDebug通过全局轨迹视图和交叉验证定位失败步骤,在GAIA基准上准确率从55.8%提升至63.6%。
生产环境 LLM Agent 的内置可观测性管道仍然罕见。AgentDebugX 表明,将闭环检测阶段接入 Agent 本身,可以将归因准确率提升超过二十个百分点。
现有的自主 Agent 调试套件只能回放执行轨迹,没有系统性的方法来精确定位导致失败的步骤。开发者只能靠猜测来判断哪个工具调用出了问题,而任何后续修复都是在未确认根本原因的情况下进行的。
闭环检测在 Who and When 基准上将严格的 Agent 级别和步骤级别归因准确率提升至 28.8%,比最强的单遍基线相对提升约三十个百分点。“使用 qwen3.5-9b 时,严格的 Agent 及精确步骤准确率达到 28.8%,而最强的单遍基线为 21.7%。”[1] DeepDebug 模块通过构建轨迹的全局视图、引导结构化调查、在提交诊断前交叉验证候选故障点来实现这一效果。
在单次重运行中应用 DeepDebug 的诊断可以修复 73 条失败 GAIA 轨迹中的 13 条,并将整体任务准确率从 55.8% 提升至 63.6%。“在 GAIA 上,应用 DeepDebug 的诊断进行单次重运行,可修复底层 Agent 最初失败的 73 条轨迹中的 13 条,而三个解耦的自纠正基线只能修复 4–6 条,使整体准确率从 55.8% 提升至 63.6%。”[1] 恢复循环使用针对性纠正指令重新执行检查点状态,将先前不可逆的崩溃转化为可验证的重试。
该评估仅覆盖两个合成基准,且依赖单一模型家族,对于该循环在更大规模 LLM 或实际工具使用场景下的扩展性尚不明确。后续工作需要测试当 Agent 在延迟约束下与外部 API 交互时,相同收益是否依然成立,以及在生产规模下检查点的开销是否可接受。
生产环境管道应用 AgentDebugX 的 Detect→Attribute→Recover 循环替代临时性的轨迹回放,作为所有工具型 Agent 的默认调试层。如果社区现在采用这一模式,下一代自主助手将在故障发生前就被调试,而不是事后补救。
AgentDebugX:LLM Agent 故障可观测性、归因与恢复的开源工具包