Hugging Face 官方博客探讨 Agent 的内存需求模型,帮助开发者理解资源消耗与任务复杂度之间的关系。
并非每款模型都能从同等体量的记忆中获益。在跨越能力光谱的八款模型中,我们观察到了三种反复出现的模式:
强模型且有余量——需要完整指南集。它们能够吸收并应用所有内容,包括罕见的边缘案例教训。DeepSeek-V3.2(671B MoE)在获得完整自挖掘指南集后,任务完成率提升了 9.5 个百分点。
较小或较弱模型——会被大量指南集淹没。对于这类模型,紧凑的高置信度核心加上每个任务检索到的少数相关指南效果最佳。gpt-oss-120b(117B MoE)通过这种选择性方法获得了 +16.1pp 的提升——而完整指南集不仅提升更少,token 成本还高出约 50%。
已经饱和的模型——没有可测量的增益。我们称之为"饱和模式"——这个标签描述的是我们观察到的现象,而非已证实的原因。该模型可能已经在这些任务上接近其上限,指南可能没有针对其剩余的失败场景,或者它可能没有有效地应用指导。GLM-5(745B MoE)在我们的测试中处于这个位置。
是什么让模型落入某种模式,并不仅仅取决于参数数量。基准测试余量、上下文窗口大小、架构、指南质量和任务分布似乎都会影响模型最终所处的位置,分离这些因素仍是进行中的工作。无论如何,实际的收获是相同的:正确的记忆剂量取决于模型,而我们可以对其进行校准。
这里的"记忆"并不意味着重放过去的对话记录。它指的是一套指南集——从智能体自身先前的轨迹中提炼出的有效策略、需要避免的错误以及边缘案例。这个循环很简单:
没有模型权重被更新。学习循环改变的是智能体可用的指导,而非底层模型——这正是它廉价且在我们测试的八款模型中便携的原因。
我们在 AppWorld 上进行了评估——585 个多步骤任务(168 个 test_normal + 417 个 test_challenge),跨越 9 个模拟应用(日历、消息、支付等)。任务通过两种方式评分:智能体是否完全完成每个任务(TGC——任务目标完成度)以及场景的每个变体是否都通过(SGC——场景目标完成度,更严格的全有或全无标准)。完整定义见附录。
因为任何记忆研究中令人困惑的部分是上下文窗口中实际包含的内容,所以我们先明确定义这些配置。
两种记忆配置都从同一个指南集提取——通过上述循环从 AppWorld 的训练集仅挖掘一次。它们之间的区别仅在于这一集合如何传递——完整指南集在每个步骤注入所有内容,而精选检索则传递选定的子集——从不改变指南的产生方式,且任何测试集数据都不会进入构建过程。
模型挖掘的指南数量取决于其自身能力,因此我们按策略报告配置——"完整指南集"与"精选检索"——而非原始数量,因为不同模型之间的数量不可比较。

图 1. 三种观察模式中的代表性模型。条形图显示 AppWorld test_normal 上基线与最佳记忆配置的 TGC;x 轴从 40% 开始以使差异可见。仅看 TGC 会低估更大的 SGC 增益——见下表 SGC 列。
该图绘制了 TGC 以保持可读性;下表添加了更严格的 SGC 指标,其增益通常更大:
阅读 SGC 列,更严格的指标通常比 TGC 移动更多——DeepSeek 的 SGC 跃升 +16.1pp,而 TGC 增益为 +9.5pp——因为好的指南尤其能帮助智能体清除场景的每个变体,而不仅仅是平均情况。这种效果在范围顶端也不会消失:GPT-5.5 和 Opus 在 TGC 上都接近天花板,但仍分别获得 +7.2 和 +7.1pp 的 SGC 增益。只要模型还有剩余的失败模式可以针对,记忆就会持续产生回报。
一个实际关注点:注入完整指南集会使每个 ReAct 步骤的输入膨胀,因为指南在每个回合都会重新发送。以下是我们观察到的情况:
表 1. 每个任务的平均 token 使用量,按智能体步骤累积,相对于无记忆基线测量。
精选检索保持成本接近基线。对于较弱的模型,选择性方法在准确性上获胜,在成本上也获胜——两全其美(gpt-oss-120b 仅 +5% token 就获得 +16.1pp TGC)。更好的性能在这里不需要更多的推理成本。
记忆不会使推理循环膨胀。DeepSeek 在有记忆和没有记忆的情况下运行的大致相同数量的 ReAct 步骤(平均约 18-19 步),因此增加的成本是输入 token 膨胀,而非更长的轨迹。
在生产中,真正的效率杠杆是提示缓存:指南集的静态部分在各步骤之间相同,可以缓存,从而有效降低成本。面向缓存的提示设计——保持共享指南集前缀稳定以使其可缓存——值得投入工程努力。我们还假设上下文窗口大小起着一定作用:具有更大窗口的模型可能更有效地吸收完整指南集,而具有更小上下文的模型从保持注入内容紧凑的检索中获益更多。我们尚未运行控制实验来分离这个因素。
教训不是给智能体它所学到的一切。而是给予它实际上能够使用的经验量。
对于弱模型,这意味着一个紧凑的核心加上几个特定于任务的教训——巧合的是,这也是最便宜的选择。
对于有余量的强模型,这意味着保留完整的指南集,通过提示缓存在生产中保持可负担的成本。
对于饱和模型,这意味着在更好地理解其剩余失败模式之前不花费额外的上下文。
整体来看,收益是真实的——自动化的、无泄露的、无需人工标注的——但只有当剂量适合模型时才能实现。
这是一个起点,而非终点:
学习到的选择器。我们当前的检索通过余弦相似度对指南进行排名,我们已经证明这不能完美预测哪些指南对给定任务有帮助。基于结果信号训练的选择器是自然的下一步。
针对极弱模型的记忆。低于最低能力基线时,自蒸馏缺乏信号。教师蒸馏的记忆是针对极弱模型的独立问题,我们正在探索。
AppWorld 之外。这些结果在 AppWorld 上得到验证——一个严格的多步骤基准测试,但是单一的一个。更广泛的智能体基准测试和真实世界部署正在进行中。
分离上下文窗口。如上所述,我们需要控制实验来将上下文窗口大小与原始能力分离开来。
尝试 ALTK-Evolve 库——它包含这里使用的提取、整合和检索流程——或阅读完整的技术报告以了解完整方法和消融实验。
AppWorld 任务通过两种指标进行评分,两者都以百分比报告(越高越好):
TGC——任务目标完成度。智能体完全且正确完成的个人任务的份额。这是"它完成工作了吗"的头条数字。
SGC——场景目标完成度。一个更严格的全有或全无指标。每个场景将同一任务的几个变体捆绑在一起(相同请求但数据、措辞或边缘条件不同)。SGC 仅在智能体成功完成每个变体时才将场景计为通过。它衡量可靠性——一个大多数时候解决任务但在一个变体上失败的智能体会在 TGC 上得分但不会在 SGC 上得分。