普林斯顿与 UC San Diego 联合研究表明,技能主要通过结构化工作流提升 Agent 表现,而非增加知识;技能库扩大后 Agent 选错指令的概率显著上升。
普林斯顿大学和加州大学圣地亚哥分校的研究人员开展了超过 8000 次测试运行,以研究"技能"如何提升 AI 智能体的表现。这些技能作为紧凑的指令集,针对特定任务发挥作用。
研究结果表明,技能在事实性知识方面的帮助相对有限,在程序性步骤方面的帮助更为显著。这种程序性 grounding 使近 66% 的案例中的性能得到提升。
一个薄弱环节仍然存在:找到正确的指令。当技能库从 5 条增长到 100 条时,命中率从 29.6% 下降到 3.3%。更优秀的 AI 智能体需要更可靠的检索方法。
技能被视为一种实用方式,可以无需重新训练就能让 AI 智能体更加能干。一项新研究揭示了它们为何有效以及在哪些方面存在不足。
从本质上讲,技能是一组紧凑的指令。它阐明了 AI 智能体在执行任务时应遵循的步骤、需要检查的内容,以及需要避免的常见错误。智能体不再从零开始处理每个新任务,而是从这些存储的经验中获取参考。直至今日——根据这项新研究——他们的价值仅通过拥有技能的智能体是否解决了更多任务来衡量。其背后的原因一直不甚明了。
来自普林斯顿大学、加州大学圣地亚哥分校及其他院校的研究团队,通过对照实验深入探究了这个问题。研究人员在 8135 次测试运行中,比较了智能体在有技能和无技能情况下处理相同任务时的表现。
技能是一本 playbook,而非知识库
主要发现:技能之所以有帮助,主要是因为它们为智能体提供了可靠的操作流程,而非因为它们提供了缺失的知识。这种"程序性 grounding"占到了拥有技能的智能体表现优于无技能智能体案例的 65.7%。直接提供知识在测试案例中仅在 4.5% 的情况下有帮助。
因此,技能主要稳定了智能体的操作。需要运行哪些设置步骤、按什么顺序使用哪些工具、需要哪些中间检查。这显然减少了某些执行错误,比如设置工作环境或输出格式错误。
但技能也引入了新的错误来源:研究发现,在 10% 的案例中,智能体机械地应用了原本有用的 playbook,或以不适合的方式应用了它。对于需要根本不同解决方案的任务,错误的技能显然没有帮助。然而,精确匹配既不是充分的也不是必要的。相关的技能通常能够单独提供足够的指导。
第二个瓶颈是首先要找到正确的技能。当技能库从 5 条增长到 100 条时,实际使用中的检索精确率从 29.6% 下降到 3.3%。听起来特别相似的选项使选择变得更加困难。
研究人员认为,技能使用应该被视为一个生命周期。更优秀的自我学习智能体不是来自存储更多经验,而是来自更可靠地创建、检索和应用它们的方法。