前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9301
  • AI 生成 SQL 的七种常见错误模式
  • GPT-5.6明知必胜却主动认输:LLM推理的隐蔽缺陷
  • 多 Agent 系统架构:生产环境的陷阱与现实
  • 神经符号引擎实战:医疗理赔自动化方案
  • AI 的致命弱点:不知道自己何时出错
  • 企业 AI 瓶颈不是模型,而是遗留架构
  • 15 万次 CI 失败日志审计揭示的真相
  • 坏Prompt正在浪费你的免费模型调用:先做PromptLint
  • AI 生成配置变更的 Receipt-First 安全预检法
  • 如何检测恶意MCP服务器:对比烟雾测试实战
  • PixelRAG:让 Claude Code 直接理解和检索带表格/图表的文档
  • 微小视觉扰动可击溃多模态 Agent 的未来预测
  • AI 编程沙盒的双重计费陷阱
  • Qwen3.8-27B 本地运行指南:17GB 指的是总内存
  • 生产 RAG 中嵌入模型漂移的隐藏风险
  • 数据库开发者为什么需要了解 MCP
  • RAG 评估实战:如何摆脱「感觉还行」的主观判断
  • 79% 的企业员工绕过 AI 治理政策
  • AI 找 bug ≠ 证明 bug 存在
  • 混合搜索实战:关键词+语义+Rerank 提升文档问答精度
  • Agent 记忆问题的本质是检索问题
  • AI Agent 数据删除管道设计实战
  • 票务分类 API 设计:语音转写与多模型摘要的最优组合
  • AI 在独立项目中自主修复跨域 iframe DOM 查询缺陷
  • 基于实时美股深度数据构建订单簿失衡信号
  • Claude 系统提示词两年增长 9 倍:生产 AI 产品团队该学什么
  • 开源工具 whodunit:用 Git/DevLake 数据量化团队 AI 采用效果
  • AI Agent 开发常见反模式:业务逻辑不应委托给 LLM
  • 构建混合搜索实战:关键词+向量+重排序完整管道
  • 多 Agent 系统调试:为什么「跑通了」不等于「对了」
  • Agentic AI与RAG根本不是一回事
  • OpenAI Codex向ChatGPT用户开放百万Token上下文
  • 代码库本身就是提示词:给AI参照已有实现比空想更有效
  • DeepTutor:港大数据科学实验室3层记忆Agent-native学习工作区
  • 用CI自动化比对Prompt变更,避免模型输出悄然退化
  • DeepSeek Harness开源自进化Agent框架,4天获12.6万星
  • 用事件总线架构拆解长链路Agent,避免单点故障蔓延
  • LLM性别偏见藏在prompt写法而非提问者身份
  • 20分钟重塑AI工作流:五步框架释放LLM潜力
  • 184个AI API成本实测:企业与初创公司差异分析
  • ChatGPT macOS隐私检查清单:Computer History安全配置
  • 美团AI变革复盘:全员养虾翻车与CatPaw落地方法论
  • Unsloth桌面版发布:单GPU运行7440亿参数模型,支持本地编码Agent
  • 同一终端双信任级别:Claude Code对接廉价代理节省API成本
  • Cursor推出自有代码托管服务
  • 测试时训练:模型边推理边学习新权重
  • Cursor Origin 仓库现已支持 Vercel 自动化部署
  • GPT-5.6 Sol在AI Gateway五折优惠一个月
  • Replit企业版大规模管控:Admin API与50+事件审计日志上线
  • macOS 屏幕共享漏洞正遭活跃利用,可远程获取 Root 权限
  • Linux 7.2 稳定版发布:I/O 性能优化、AMD/Intel 显卡驱动改进
  • 已加载 51 / 9301
8.0
热点
AI SCORE
编程提效2026-08-17 11:39

Agent 记忆问题的本质是检索问题

dev.to · AI#Agent#RAG#上下文窗口
Editor brief · 编辑速览

存储与检索是完全独立的问题,模型本身无状态,上下文窗口是工作记忆,持久化记忆靠外部系统管理,检索质量决定 Agent 表现。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

每个团队在构建 Agent 时,都会以相同的顺序撞上同一堵墙。他们花一个下午让存储跑起来,感觉良好,然后在接下来的三个月里发现:存储信息和检索到正确的信息,几乎是两个完全不相关的问题。

为什么无状态模型需要外部记忆层

语言模型是无状态的。它接收文本、输出预测、每次调用之间什么都不保留。模型在回答你此刻的问题时,并不记得你曾经和它说过话,而且当请求结束后,从它的角度看,整个对话就消失了。

所有看起来像「记忆」的东西,都是围绕模型构建的独立系统。它捕获值得保留的信息,存储到某个持久化的地方,然后在后续调用时把相关内容重新注入到提示词中。模型的权重没有任何改变。记忆存在于模型之外,通过管理进入上下文窗口的内容来运作。

这个区别比这个话题中的任何其他概念都重要。上下文窗口是工作记忆:容量大但是有限的、每次调用都从头重建、会话结束就消失。持久化记忆是所有存在于它之外的内容,存储在能够跨越重启和时间而存活的地方。

每套记忆系统都会经历的四个阶段

无论是从五十行原型还是生产级平台,每套记忆系统都执行相同的四个操作。

写入阶段决定什么值得保留。简陋的设计会逐字存储每条消息,这很快就会让存储充满噪音。更好的设计会提取持久的信号——稳定的 facts、明确的偏好、确认的结果和纠正——让短暂的闲聊自然消亡。

存储阶段将其编码以备后用。常见做法是把每条记忆转换为一个 embedding,后者捕获其语义,同时将该向量与原始文本及元数据(如时间戳和来源)一起存储。向量让你能做语义搜索,结构化字段让你做精确过滤,而原始文本才是最终被重新注入上下文窗口的内容。

检索阶段在新区任务到来时找到相关的片段,而这正是几乎所有难度所在。注入阶段随后在模型运行前把这些记忆放入上下文窗口。拉取太少,模型就会陷入它已有却被遗忘的知识饥荒。拉取太多,有用的信息就会被淹没,预算被浪费,延迟上升。

检索是工程精力的所在

向量搜索按语义而非精确词语匹配,所以一个关于「取消订阅」的查询,能够在没有任何共同关键词的情况下,命中一条关于「终止定期计划」的记忆。这就是它的优势。

劣势是优势的另一面。语义相似性会模糊精确的 token,所以向量搜索经常遗漏那些往往最为关键的精确术语——特定的错误代码、产品名称、标识符。关键词搜索恰好擅长处理这些情况。同时运行两者并合并结果,然后用更昂贵的模型对合并后的候选结果进行重排,可靠地超越单独使用任一方法。

对于那些价值在于关系而非原始文本的信息,知识图谱能够回答相似性搜索无法回答的问题——它能追踪两个事实如何通过一系列中间步骤连接起来。

所有这些技术之下存在一个核心张力。检索的记忆太少,Agent 就会错失它已有的知识。检索的记忆太多,有用的内容就会被淹没,成本和延迟也会攀升。好的检索返回的是最小的集合——但这个集合仍然包含 Agent 实际所需的一切。

决定什么值得被记住

记忆设计本质上是信息放置问题。Agent 遇到的每条信息都有一个天然的归属:在这个回合之后丢弃它、在本会话期间保留它、或者晋升到长期存储。

从认知科学中借鉴的分类在这里很有帮助。语义记忆保存独立于学习时间的 facts。情景记忆保存具体的过往事件。程序性记忆保存习得的 routine 和技能。每种都需要不同的存储和检索策略,所以明确你正在处理的是哪一种,正是防止三者混为一谈、堆成无差别一团的关键。

把放置做对了,Agent 就会感觉连贯且知识渊博。做错了——要么保留一切,要么什么都不保留——它就会要么淹没在噪音中,要么永久性失忆。

记忆比微调更重要的原因是:记忆是非参数化的。向存储写入一条 fact 是即时、便宜且可逆的,而重新训练是缓慢、昂贵且有风险的。一个拥有良好记忆的 Agent 可以在几秒钟内吸收一份新文档或纠正一个过去的错误,完全不需要任何训练过程。

如果你想要完整的拆解——包括记忆类型、从本地 SQLite 文件到托管平台的各种存储选项,以及各检索策略的对比——AI Agent Memory 完整指南从端到端覆盖了所有内容。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
混合搜索实战:关键词+语义+Rerank 提升文档问答精度
下一篇
AI Agent 数据删除管道设计实战