前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4457
  • Docker YOLO 模式:为 AI 编码 Agent 打造 microVM 沙箱
  • AI数据库助手实战:从自然语言到SQL查询
  • 多模型路由设计:一张 OpenAI 兼容端点搞定 ticket 分类与升级
  • LLM Guard 归档:主流 AI 安全护栏工具横评
  • AI安全审计工具BugZ:流式AST修复,三天151用户
  • 统一 API 密钥审核:跨 OpenAI/Claude/Gemini 结构化输出
  • Figma 将 Dev Mode 重构为 MCP 服务器,定价下调只是配套动作
  • Web 访问 API 可复现基准测试的五层设计方案
  • AI编程时代:代码审查取代代码编写成为瓶颈
  • AI Agent 运行机制深度解析:工具调用、记忆与循环
  • HuggingFace Transformers 5.0稳定支持多模态
  • 长音频转录后结构化提取的字段级精度优化
  • LoCoMo 99.95%背后:参数化记忆的架构意义
  • MCP服务器SSRF漏洞防护指南
  • Backboard CLI登顶Terminal-Bench测评
  • 小团队Terminal-Bench得分超越Claude Code和Codex
  • GPT-5.6三档深度解析:Sol/Terra/Luna如何选
  • LLM工具调用安全:给Agent赋权而不泄密
  • 英伟达开源Nemotron 3.5 Lightning:30B MoE模型,推理速度提升4倍
  • 最低价长上下文Chatbot API实测:以真实工单评估质量
  • PostgreSQL MCP 结果限制:无声截断如何让样本变成谎言
  • AI 数据库返回正确答案仍可能不完整:完整性契约设计
  • GitHub Copilot JetBrains 版:Ollama 本地推理与记忆的隐私边界
  • 微软8月补丁修复398个漏洞,含已遭利用的Win驱动零日
  • GitHub README中的提示注入攻击实测
  • BuildIt:强制要求解释AI代码后才能合并的编程学习平台
  • WebSocket重连去重:市场数据采集幂等设计
  • RTK:拦截AI编程Agent冗余输出的工具
  • Container Use vs Sculptor:并行AI编程环境隔离对比
  • Mistral Forge:企业级自有 AI 模型治理框架
  • 自然语言处理不存在无损转换——AI 辅助写作的根本局限
  • OpenAI发布ChatGPT for Linux预览版,整合Codex编程
  • AI编程助手可能在git历史中遗留敏感信息
  • 抓取文档站无需浏览器:__NEXT_DATA__脚本提取法
  • 生产级 RAG 内容管道:五个决定成败的分叉口
  • Claude Code 自动模式 8 月 14 日起成为默认
  • LLM 私有化部署实战:硬件规划、量化和 Serving 引擎选型
  • LLM 延迟优化实战:TTFB、TPOT 与量化调参指南
  • Nvidia发布30B MoE模型Nemotron 3.5,专为AI Agent长时任务优化
  • Mojo 1.0 正式发布:接近 C 性能的后 Python 时代系统编程语言
  • Orca:并行运行多个 AI 编程 agent 的桌面编排工具
  • Anthropic 开源 Agent Skills 实现:技能系统正式公开
  • Codex CLI 全自动模式 vs Claude Code 权限模型:2026 CLI 编程 agent 选型指南
  • 已加载 43 / 4457
8.0
热点
AI SCORE
技术实践2026-08-12 10:12

LoCoMo 99.95%背后:参数化记忆的架构意义

dev.to · AI#LLM#记忆架构#RAG
Editor brief · 编辑速览

通过将记忆直接后训练到模型权重而非检索架构实现接近完美的长期记忆。参数化记忆成本下降,改变了RAG等检索架构的必要性讨论。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

我们 CEO Rob Imbeault 本周在 LinkedIn 上发表了一篇文章,介绍了我们团队在 LoCoMo 上取得的成绩:99.95%。LoCoMo 是长期对话式 AI 记忆领域被引用最多的基准测试。他的版本面向高管和 CISO。而这是开发者版本,因为有趣的不是这个数字本身——而是我们如何做到的,以及它对记忆架构未来发展方向的启示。

(功劳归功于:这里的思路来自 Rob 的原文。我所做的只是翻译成开发者语言。)

开宗明义:玄机所在

我们不是靠检索拿到 99.95% 的。我们是将记忆后训练(post-training)直接注入模型权重,并且有意识地用基准测试的同一套对话集进行了训练。

所以,这并不能证明我们的模型在"记忆能力"上比你们的更强。它从来就不是用来证明这个的。这个实验度量的是参数记忆(parametric memory)的上限:当你把一套对话语料教会一个模型之后,在零检索机制的情况下,它能以多高的准确率回忆并推理这些内容?答案是:近乎完美。

这个结果之所以重要,是因为实现它的技术刚刚变得廉价了。这改变了每一个基于 LLM 构建产品的人所面临的架构讨论。

问题所在:每个 LLM 应用都是金鱼记忆

你懂的。当对话结束时,模型把所有东西都忘了,所以大家都跑了同一套workaround:把对话切成块、嵌入(embed)、建索引,查询时从存储中搜索相关片段,然后粘贴到 prompt 前面。

RAG。它管用。几乎每个"有记忆的 AI"产品都是这么做的。但它有三个结构性代价,在规模化时会显现出来:

Token 税。 每次查询都要重新发送同样的上下文。客户历史、策略文档、先前决策,反复加载、反复计费,永无止境。

共享存储泄漏。 共享向量存储中的隔离本质上是一个配置项:一条 filter、一个 tag、一道权限检查。配置会失效。同一个租户的记忆出现在另一个租户会话中的事故记录在行业内持续增长。

静默检索失败。 拿错了片段,模型就会自信满满地回答错误的问题。没有堆栈跟踪,没有报错,只有错误答案。

另一种思路:直接教进模型

后训练曾经是昂贵且小众的技术。在 2026 年不是了。LoRA 使教学变得高效。量化(我们的 BBQuant 工作在这里)将结果压缩而不造成显著质量损失。两者结合,使得后训练从研究项目变成了小型团队在普通硬件上就能作为常规操作运行的东西。

把语料教进权重之后,各种属性就反转了:

没有 Token 税。 记忆存在于模型本身。你只需支付一次教学成本,之后查询就只是查询。

天然隔离。 每个租户拥有自己的权重。一租户的模型在物理上就不可能看到另一租户的数据。没有共享存储可供误配置。

它是一个文件。 记忆内嵌的模型可以运行在笔记本上、工厂级设备上、或者气隙服务器上。没有任何东西会往外打电话。这些权衡同样真实,你应该诚实地权衡它们。更新比数据库写入慢。删除特定事实是真正困难的,这在 GDPR 和 PIPEDA 被遗忘权制度下尤为重要。而且参数记忆更擅长回忆它被教导的内容,而不是对它从未见过的全新对话进行推理。

正确度量:LoCoMo-Δ

因为我们用测试材料进行了训练,召回和泛化在我们的 99.95% 中是纠缠在一起的。现有基准无法区分它们。因此我们随结果一起提出了 LoCoMo-Δ,这是一个扩展协议,将对话从训练中保留出来,让领域能够独立度量召回和泛化。

基准只有在度量正确的东西时才有意义。如果你从事记忆或评估设计工作,我们希望你能审视这个协议。

重复工作负载的数学

这是作为工程决策最让我感兴趣的部分。对于任何被反复查询的语料,存在一个交叉点,在该点上一劳永逸的教学胜过每次查询都检索。根据语料大小和查询量不同,那个交叉点落在数百到数千次查询之间的某个位置。

支持机器人、内部知识库、销售赋能、合规问答:这些大多数在一周左右就跨越了该阈值。每个人都以为固定不变的成本曲线("记忆 = 永远消耗 token")之所以看起来固定,只是因为检索是架子上唯一的工具。

诚实的架构:两者兼用

这不是"RAG 已死"。正确答案是有意识地拆分工作:

参数记忆用于稳定、高价值、per-tenant 的知识:playbook、政策、产品知识、反复出现的客户上下文。这些是新员工最终会内化、不再查阅的东西。

外部记忆用于易变、用户自有或受监管的数据:近期交易、偏好、任何必须按需编辑、删除或审计的内容。今天大多数系统在两种工作上都用检索。不是因为有人选择了它,而是因为没有人提供过这个选择。

即使你从不接触我们的平台,这也应该与你有关:

  • 我们用过的后训练配方,可在普通硬件上复现
  • BBQuant 压缩后的 checkpoint,小到可以在高端笔记本上运行
  • LoCoMo-Δ 协议提案,面向研究社区

请关注 github.com/backboard-io 的发布。

99.95% 是标题。真正的故事是,实现它所需的工具已经悄然变得几乎人人可及。如果你在构建任何具有长期存活上下文的东西,记忆架构决策现在实际上是一个真正的决策了。主动做出选择,比从你最初选用的 vendor 那里继承要强。

我们是 Backboard 的一个小团队,致力于构建与模型无关的 AI 基础设施。我们喜欢公开我们的工作。如果你不同意上述任何观点,评论区开放。这就是它存在的意义。

原文:When Your AI Remembers: A New Way to Think About Memory in Enterprise AI,作者 Rob Imbeault,Backboard CEO。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
长音频转录后结构化提取的字段级精度优化
下一篇
MCP服务器SSRF漏洞防护指南