前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
小程序题库
  • 每日一题每天一道,攒手感
  • 原理篇React / Vue 源码拆解
  • 知识卡片NEW碎片时间过考点
  • 历年面经按年份追踪真实考点
  • 算法题库在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
小程序题库
  • 每日一题每天一道,攒手感
  • 原理篇React / Vue 源码拆解
  • 知识卡片NEW碎片时间过考点
  • 历年面经按年份追踪真实考点
  • 算法题库在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8294
  • 幂等性:防止大问题的 API 小概念
  • OpenAI 自托管执行器只向外拨号,所以我们的停止按钮是个队列
  • AI Agent 大规模利用 PaperCut 漏洞攻陷 395 家机构
  • Copilot 代码审查新增自动关闭评论与智能提交信息
  • n8n详解流程编排:执行模型、可观测性与生产挑战
  • Reflection 模式:AI Agent 在生产环境的自我纠错实践
  • AWS 双层方案监控生产环境 Agent 生命周期
  • 选对 Bedrock 上的 OpenAI 模型:超越每百万 token 价格
  • 用 Bedrock AgentCore 构建支持交互组件的 MCP 应用
  • 2026 Agentic AI安全警示:模型越狱与网络突破
  • 万级Agent集群架构实战:10万次编排背后的工程方法论
  • Anthropic内部标准:生产代码的AI辅助应有更高门槛
  • 陶哲轩等数学家联名批评 AI 数学推理的严重错位问题
  • 陶哲轩:AI 数学推理的严重错位
  • Hugging Face安全Txt暗藏AI伦理考题
  • Next.js Copilot安全设计审查清单
  • Agent PR中的内存缓存——代码审查的盲区
  • 一次 stamping:约束AI Agent范围的工程方法
  • AI生成的C++补丁为何在Release版崩溃
  • 本地优先Agent的四个信号决策门
  • AI Agent记忆 vs RAG:核心区别与工程选择
  • AI代码审查的签署人制度SOP
  • 用「每修复成本」替代通过率评估AI Agent
  • Agent「修复成功」但进程从未退出引发的生产事故
  • 面试AI编程能力应先评估「循环预算」
  • 部署 AI 推理网关前,先查队年龄龄而非面板利用率
  • WAF 拦截日志拷进 AI 助手?Cookie 和 token 也一起泄露了
  • 给无人值守 AI Worker 配一张 JSON 检查卡
  • Anthropic 报告:黑客用 Claude 开发导弹与无人机,中国实验室批量挖掘训练数据
  • 律师用ChatGPT生成上诉文书虚构证人证词,被罚5000美元
  • Claude Code Hookbook:20 个开箱即用的 Claude 钩子库
  • OpenAI如何扩展存储架构支撑10亿ChatGPT用户
  • 每天为同一段上下文付三次钱:Agent 记忆缺失的代价
  • OpenAI Agents API公开测试:Codex同款基础设施向开发者开放
  • Vercel开源skills:AI编程智能体技能共享生态
  • OmniRoute:聚合352个AI服务商免费额度的开源网关
  • DeepSeek V4.1 Flash发布:提供商别名路由与890B缓存的代价
  • DeepSeek Flash搅局:MoE架构将百万token成本打至新低
  • AI生成支付代码的五大安全漏洞与防护策略
  • Sakana AI推出Fugu Max/Ultra v2,主打多Agent编排降本
  • Google 发布 ToolGrad:先建 API 链再写 Query,ToolBench 通过率 99.8%
  • OpenAI GPT-Live-1 API支持实时语音交互
  • 美团Agent评测白皮书:评测体系全览
  • Apify MCP服务器让AI实时获取电商数据
  • 语音AI延迟从4.2秒压到780ms:逐字优化实录
  • Datasette紧急安全补丁:AI辅助审计发现多个微妙漏洞
  • DevOps AI Agent 审计追踪:关联每次 kubectl 与 Git 操作
  • AI 写的 PR 测试全绿:你的合并标准是什么
  • 放 AI Agent 进仓库前必须锁死的五项配置
  • LLM API 重试逻辑:官方 SDK 只做了一半
  • 生产环境微调对比:Claude vs GPT vs Llama 实操指南
  • 已加载 51 / 8294
8.0
热点
AI SCORE
编程提效2026-09-11 23:28

AI Agent记忆 vs RAG:核心区别与工程选择

dev.to · AI#RAG#AI Agent#LLM
Editor brief · 编辑速览

RAG用于检索Agent未知内容,记忆用于检索Agent已参与过的上下文;两者虽共用向量库但用途、数据形态、准确性要求均不同。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

大多数基于 LLM 构建的团队,最终会在同一个代码库中用到两种模式:RAG 用于在语料库中查找信息,以及某种手写的 memory 机制来记住 agent 执行过的操作或用户说过的话。这两者经常被混为一谈,而混用会造成实实在在的工程时间浪费——当一种模式被用来做另一种的事时。

RAG 检索的是 agent 尚不知道的内容。Memory 检索的是 agent 已经参与过的上下文。

两者共用一个向量存储——通常是 pgvector 或专门的向量数据库——检索时都使用近似最近邻搜索。但相似性到此为止。

RAG 存储的是源文档的块(markdown 页面、PDF、支持文章)。检索返回与用户问题语义最相似的块,作为 grounding 拼入 prompt。

Memory 存储的是事件的有类型记录:episode(原始对话轮次、工具调用、决策)和编译后的 memory(从 episode 中派生出的有类型事实,带有到源的出处追溯)。检索返回与该主题最相关的历史上下文,按近因性、类型、有效性、相似性排序。

如果只需要在静态文档中 grounding 答案,只需要 RAG。如果需要 agent 跨会话记住用户,需要的是 memory。

RAG 的局限

RAG 的设计目标是回答"我们的文档对 X 是怎么说的?"——而不是"这个用户上个月告诉我们什么?"当团队用 RAG 来覆盖 memory 场景时,会出现三种失败模式:

Embedding 最近邻不等于决策相关。用户消息"我对花生过敏"和后续问题"我午饭应该点什么?"在 embedding 上并不接近。余弦相似度会把所有餐厅相关的块排在过敏记录之前。Memory 排序需要的不仅是相似性——还需要类型优先级、时间有效性、明确的出处。

没有压缩机制。RAG 将语料库原样索引。Memory 需要做摘要——把 200 轮对话压缩成"用户是金融科技公司的高级工程师,喜欢简洁的回复"——因为 prompt 预算有限。RAG 不做这件事。

没有失效模型。如果用户的工作变了,"在金融科技公司工作"这条旧记录需要被标记为 superseded,而不是与新记录一起被检索。RAG 的只追加块存储没有有效性窗口或替换的概念。

你可以在应用代码中逐一打补丁来掩盖这些问题。这样做的团队最终会得到一个除了名字不叫 memory 运行时的 memory 运行时。

Memory 超越检索之处

Memory 运行时在向量存储之上增加了三样东西:

编译(Compilation)——对原始 episode 的一次处理,产出有类型的 memory:profile 事实、偏好、流程、episode 摘要——带置信度分数和有效性窗口。这就是把 200 轮压缩成一条事实的原因。

确定性排序(Deterministic ranking)——综合相似性、类型优先级(一个流程比一次随口提及更重要)、近因性、时间有效性以及显式 token 预算的评分。同样的查询 → 同样的 bundle。不会有静默重排序。

出处(Provenance)——每条编译后的 memory 都携带它所派生自的 episode 的 ID。当 agent 从 memory 回答问题时,答案是可以审计回溯到产生它的原始事件的。

这三个都不是文献意义上"RAG"的属性。它们是把 memory 基础设施区别于"对聊天日志做检索"的关键。

何时选择哪种

大多数生产级 agent 两者都需要。Grounding 语料库(文档、知识库)放在 RAG。用户/账户/项目上下文放在 memory。

试图让任一模式做另一方的工作是常见的架构错误——这也是我们构建 Statewave 来阻止人们犯这个错误的原因。

Statewave 在这个图景中的位置

Statewave 是 memory 层——输入 episode,输出排序后的上下文 bundle,带有确定性排序和出处。它在底层使用 pgvector(不需要运维单独的向量数据库),但它不是 RAG 框架:没有文档加载器、没有分块器、没有用于语料库 grounding 的检索接口。如果你想要 RAG,把 Statewave 接入你现有的 RAG 技术栈——Statewave 处理"你在和谁说话"这一层,你的 RAG 框架处理"知识库说了什么"这一层。

文档站的架构页面深入讲解了排序信号和 compile-vs-retrieve 的分工。五分钟 Docker Compose 快速入门指南如果你想与当前的 RAG 设置并行试用的话。


FAQ

1. RAG 和 AI agent memory 有什么区别?

RAG 检索 agent 尚不知道的内容——按余弦相似度排序的文档块。Memory 检索 agent 已经参与过的上下文——按近因性、类型、有效性、相似性排序的 episode 和编译事实。

2. 我可以用 RAG 代替 memory 层做 agent memory 吗?

可以强撑,但会出现三种失败模式:embedding 最近邻不等于决策相关(过敏记录不会是与午餐问题最接近的 embedding),没有将历史压缩为持久事实的机制,也没有对被替换事实的失效模型。

3. 我需要同时使用 RAG 和 memory 运行时吗?

大多数生产级 agent 是需要的。Grounding 语料库——文档、知识库——放在 RAG。用户、账户或项目上下文放在 memory。试图让任一模式做另一方的工作是常见的架构错误。

4. memory 运行时相比单独的向量存储增加了什么?

三样东西:编译(将原始 episode 转化为带置信度和有效性的有类型事实)、确定性排序(同样的查询始终返回同样的 bundle)、出处(每条编译后的 memory 都携带它来源的 episode 的 ID)。

5. Statewave 是 RAG 框架吗?

不是。它在底层使用 pgvector,但不提供文档加载器、分块器或用于语料库 grounding 的检索器。它是"你在和谁说话"这一层,旨在与你现有的 RAG 技术栈并行运行,而不是取代它。

6. 如何决定使用哪一个?

看问题的形态。"我们的内容对 X 是怎么说的?"是 RAG。"这个用户、agent 或项目现在需要知道什么?"是 memory。

原文最初发表于 Statewave 博客。Statewave 是一个开源、自托管的 AI agent memory 运行时——GitHub。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
本地优先Agent的四个信号决策门
下一篇
AI代码审查的签署人制度SOP