通过将记忆直接后训练到模型权重而非检索架构实现接近完美的长期记忆。参数化记忆成本下降,改变了RAG等检索架构的必要性讨论。
我们 CEO Rob Imbeault 本周在 LinkedIn 上发表了一篇文章,介绍了我们团队在 LoCoMo 上取得的成绩:99.95%。LoCoMo 是长期对话式 AI 记忆领域被引用最多的基准测试。他的版本面向高管和 CISO。而这是开发者版本,因为有趣的不是这个数字本身——而是我们如何做到的,以及它对记忆架构未来发展方向的启示。
(功劳归功于:这里的思路来自 Rob 的原文。我所做的只是翻译成开发者语言。)
我们不是靠检索拿到 99.95% 的。我们是将记忆后训练(post-training)直接注入模型权重,并且有意识地用基准测试的同一套对话集进行了训练。
所以,这并不能证明我们的模型在"记忆能力"上比你们的更强。它从来就不是用来证明这个的。这个实验度量的是参数记忆(parametric memory)的上限:当你把一套对话语料教会一个模型之后,在零检索机制的情况下,它能以多高的准确率回忆并推理这些内容?答案是:近乎完美。
这个结果之所以重要,是因为实现它的技术刚刚变得廉价了。这改变了每一个基于 LLM 构建产品的人所面临的架构讨论。
你懂的。当对话结束时,模型把所有东西都忘了,所以大家都跑了同一套workaround:把对话切成块、嵌入(embed)、建索引,查询时从存储中搜索相关片段,然后粘贴到 prompt 前面。
RAG。它管用。几乎每个"有记忆的 AI"产品都是这么做的。但它有三个结构性代价,在规模化时会显现出来:
Token 税。 每次查询都要重新发送同样的上下文。客户历史、策略文档、先前决策,反复加载、反复计费,永无止境。
共享存储泄漏。 共享向量存储中的隔离本质上是一个配置项:一条 filter、一个 tag、一道权限检查。配置会失效。同一个租户的记忆出现在另一个租户会话中的事故记录在行业内持续增长。
静默检索失败。 拿错了片段,模型就会自信满满地回答错误的问题。没有堆栈跟踪,没有报错,只有错误答案。
后训练曾经是昂贵且小众的技术。在 2026 年不是了。LoRA 使教学变得高效。量化(我们的 BBQuant 工作在这里)将结果压缩而不造成显著质量损失。两者结合,使得后训练从研究项目变成了小型团队在普通硬件上就能作为常规操作运行的东西。
把语料教进权重之后,各种属性就反转了:
没有 Token 税。 记忆存在于模型本身。你只需支付一次教学成本,之后查询就只是查询。
天然隔离。 每个租户拥有自己的权重。一租户的模型在物理上就不可能看到另一租户的数据。没有共享存储可供误配置。
它是一个文件。 记忆内嵌的模型可以运行在笔记本上、工厂级设备上、或者气隙服务器上。没有任何东西会往外打电话。这些权衡同样真实,你应该诚实地权衡它们。更新比数据库写入慢。删除特定事实是真正困难的,这在 GDPR 和 PIPEDA 被遗忘权制度下尤为重要。而且参数记忆更擅长回忆它被教导的内容,而不是对它从未见过的全新对话进行推理。
因为我们用测试材料进行了训练,召回和泛化在我们的 99.95% 中是纠缠在一起的。现有基准无法区分它们。因此我们随结果一起提出了 LoCoMo-Δ,这是一个扩展协议,将对话从训练中保留出来,让领域能够独立度量召回和泛化。
基准只有在度量正确的东西时才有意义。如果你从事记忆或评估设计工作,我们希望你能审视这个协议。
这是作为工程决策最让我感兴趣的部分。对于任何被反复查询的语料,存在一个交叉点,在该点上一劳永逸的教学胜过每次查询都检索。根据语料大小和查询量不同,那个交叉点落在数百到数千次查询之间的某个位置。
支持机器人、内部知识库、销售赋能、合规问答:这些大多数在一周左右就跨越了该阈值。每个人都以为固定不变的成本曲线("记忆 = 永远消耗 token")之所以看起来固定,只是因为检索是架子上唯一的工具。
这不是"RAG 已死"。正确答案是有意识地拆分工作:
参数记忆用于稳定、高价值、per-tenant 的知识:playbook、政策、产品知识、反复出现的客户上下文。这些是新员工最终会内化、不再查阅的东西。
外部记忆用于易变、用户自有或受监管的数据:近期交易、偏好、任何必须按需编辑、删除或审计的内容。今天大多数系统在两种工作上都用检索。不是因为有人选择了它,而是因为没有人提供过这个选择。
请关注 github.com/backboard-io 的发布。
99.95% 是标题。真正的故事是,实现它所需的工具已经悄然变得几乎人人可及。如果你在构建任何具有长期存活上下文的东西,记忆架构决策现在实际上是一个真正的决策了。主动做出选择,比从你最初选用的 vendor 那里继承要强。
我们是 Backboard 的一个小团队,致力于构建与模型无关的 AI 基础设施。我们喜欢公开我们的工作。如果你不同意上述任何观点,评论区开放。这就是它存在的意义。
原文:When Your AI Remembers: A New Way to Think About Memory in Enterprise AI,作者 Rob Imbeault,Backboard CEO。