WikiSkill为AI Agent构建持久知识库,将每次运行的成败记录为wiki条目供后续任务复用,小模型借助此框架可接近大模型表现。
Google Research 的研究人员推出了 WikiSkill,这是一个将 AI 智能体与持久知识库相结合的框架。
该系统不再在每次运行后将智能体学到的内容丢弃,而是将关于失败和成功的知识收集到一个类维基的结构中,并用它来随时间提升智能体的能力。这些知识被打包成"Agent Skills"(智能体技能),这是一种可复用的模块,可以在不改变训练所学内容的前提下引导智能体的行为。
也就是说,智能体(即模型)并没有真正实现持续学习——这仍然是一个未解决的问题。但它在每次运行后能为自身编写更好的指令,并在下次调用时调取这些指令。这算不上优雅,而且可能比真正的学习更容易出错,但研究表明这是一种有效的替代方案。
这项工作借鉴了 Andrej Karpathy 关于"LLM Wiki"理念的思考,他认为应该将经验编译成持久、累积的知识。WikiSkill 将这一理念应用于 AI 智能体的自动化技能开发。
三层结构分离经验、知识与行动
WikiSkill 将 AI 智能体的工作空间组织为三个层级。"Raw Layer"(原始层)存储完整的执行轨迹,从工具调用到结果。这份数据是不可变的,作为原始素材。
其上是"Wiki Layer"(维基层),原始数据在这里被提炼成结构化的洞察,如已文档化的失败模式和成功策略。研究人员表示,这个知识层永远不会重置,而是随着每次迭代不断增长。
最顶层是"Skill Layer"(技能层),存放智能体执行任务时遵循的主动程序化指令。与维基不同的是,技能如果更新后导致性能下降可以回滚。
首先,推理智能体使用当前技能执行任务并生成执行轨迹。一个"Wiki Maintainer"(维基维护者)随后分析这些轨迹,发现失败模式和成功策略,并将研究结果写入维基。
"Skill Proposer"(技能提议者)利用更新后的维基和执行数据建议有针对性的技能变更。最后,一道门控机制在独立的验证集上测试提议的变更,以确认它是否真的有帮助。如果不起作用,技能会被回滚,但维基保持完整。即使是失败的提议也不会被丢失,因为维基记录了尝试了什么以及为什么失败,所以技能提议者可以在后续迭代中基于这些知识继续改进。
WikiSkill 循环的四个步骤。推理智能体生成执行轨迹(原始层),维基维护者将模式提炼到持久维基中,技能提议者推导出技能更新,门控机制检查变更是否真的有帮助。维基持续增长,而技能在性能下降时可以回滚。| 图片来源:Tang et al., 2026

更大的模型收益更多,但较小的模型也能缩小差距
研究人员在五个基准测试上测试了 WikiSkill,涵盖数学推理、网络搜索、电子表格操作、文档问答以及虚拟环境中的交互任务。他们使用的模型包括 Qwen(4B、9B、27B)、Gemma-4-31B 和 Gemini-3.5-Flash。
WikiSkill(黄色)始终击败所有其他技能演化方法和无技能基线。与基线的差距随模型规模增大而扩大,表明更大的模型从演化技能中受益更多。| 图片来源:Tang et al., 2026

WikiSkill 在研究中始终优于所有先前的技能演化方法。平均而言,该框架将 Gemini-3.5-Flash 从 49.5% 提升到 68.1%,将 Qwen-3.6-27B 从 39.4% 提升到 63.3%。在单个基准测试上,提升幅度可能更大:Gemini-3.5-Flash 在 LiveMath 上从 33.0% 上升到 72.6%,在 SpreadSheet 上从 50.5% 上升到 76.6%。
收益因任务类型差异很大。数学问题和电子表格操作的改进最为显著,而具有长文档上下文的任务(OfficeQA)收益则小得多。研究人员表示,像 Qwen-3.5-4B 这样的小模型难以在长上下文上可靠地执行演化出的多步搜索策略,会回退到默认行为。
更大的模型往往从演化技能中受益更多。但运行 WikiSkill 的较小模型可以匹配不使用该框架的较大模型的性能。一个模型开发的技能通常可以迁移到另一个模型,有时甚至比接收模型自己构建的技能效果更好。由于并非总是如此,迁移性可能需要逐案检查。
表格:WikiSkill(高亮)在大多数模型-基准测试组合中取得最佳或统计上等效的性能。加粗数值表示最高分;同一列中多个加粗数值之间没有统计差异。所有数值均为三次独立运行的平均值。