通过强化学习让 Agent 判断何时真正需要调用外部规划器、GUI 或感知模块,避免对每个步骤无差别调用工具;Qwen-UI-Agent 步骤减少 58.4%。
强化学习如今可以让自主 Agent 仅在真正产生价值时才调用外部规划器、GUI 或专业感知模块,从而大幅削减浪费的 API 流量和运行时开销。同一套循环机制既能让模型学习长时序策略,也能学习何时触发工具,把过去的全面调用转变为有节制的门控。
在这些技术突破之前,大多数基于 LLM 的 Agent 将每一个交互回合都视为调用工具的机会,即使在琐碎的步骤中也产生密集计算。仅有截图的 computer‑use Agent 面临感知瓶颈,而早期的 GUI Agent 则发出大量单步操作调用,导致轨迹长度膨胀。彼时的现状是成本高昂而成功率收益甚微。
Qwen‑UI‑Agent 表明,选择性批处理可以将执行步骤削减一半以上:"其在部分进度上的得分分别比 MiniMax M3 和 Qwen 3.7 Plus 高出 17.7 和 18.5 个百分点,同时每个任务所需的步骤减少 58.4%"[1]。统一动作空间将 GUI 操作与 CLI 命令交织在一起,并捆绑成单次模型调用,使 Agent 避免冗余调用的层层叠加。
StateAct 表明,将动作基于程序状态而非原始像素,可以实现数量级的成本降低:其在每任务成本降低约 9 倍的情况下取得了相当的成效[2]。由于仅将 1.1% 的步骤委托给 GUI 子 Agent,主策略得以专注于推理,而独立的验证门控则能及早捕获结构错误。
Skill Self‑Play 证明强化学习循环可以同时演进任务生成和工具门控:该框架在多个基准测试中实现了"高达 42.9 个百分点的工具调用成功率提升"[3]。动态技能控制器学习哪些技能(从而哪些工具)值得调用,而求解器则在这些经过验证的子空间中推动其能力边界。
这些结果留下两个开放前沿。Qwen‑UI‑Agent 仍依赖大规模并行展开(10k 并发环境),引发了对小型研究实验室可扩展性的疑问;StateAct 假设能够直接访问程序状态,但许多闭源应用并不暴露这一接口;Skill Self‑Play 的技能库需要人工维护,且在验证信号有噪声时可能表现挣扎。综合来看,它们表明工具门控虽然强大,但依赖于基础设施和可靠的反馈回路。
如果选择性工具调用确实能将计算量降低一个数量级,那么成本感知基准测试应开始同时报告工具调用计数和成功率指标,生产流程也应该用 RL 训练的门控策略替换简单的逐轮 API 轮询。该领域的下一次飞跃不仅体现在任务准确性上,更体现在 Agent 如何勤俭地召唤它们的帮手。
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills