每次 Agent 处理新对话都重新读取全部历史,成本随轮次呈三角级数增长,128GB DDR5 一年内涨价 500%。
DRAM 价格在十二个月内上涨了 500%。去年夏天售价 340 美元的 128GB DDR5 套装如今卖到 3399 美元。HBM 已售罄,整个 2026 年都无货。而控制全球 90-95% DRAM 产量的三家厂商,正在将晶圆产能转向 AI 加速器——那里利润率更高,需求无限。
这就是硬件的故事。但对 Agent 构建者来说,软件的故事更糟糕——而且就摆在眼前。

每一次你的 Agent 处理一个新回合,它都会重新读取整段对话历史。第一回合成本不到一分钱。到第十回合,你就要为累积的 80000-200000 个 token 付费了。成本不是线性增长的——它遵循三角级数, roughly n(n+1)/2,其中 n 是携带新上下文的回合数。那些独立建模每回合成本的团队,在正确计算上下文累积、工具调用负载和系统提示词重复后,会对多步骤 Agent 工作流低估 3-5 倍的成本。
Agent 记忆不再是一个功能。它是一个成本中心——对许多团队来说,是他们基础设施预算中增长最快的项目。
两种力量正在同时压缩 Agent 构建者,而且它们很少被放在一起讨论。
力量 1:物理内存变贵了。AI 超大规模厂商在 2026 年的数据中心支出预计达到 6500 亿美元,而 2024 年是 2170 亿。HBM 现在约占 DRAM 晶圆总产量的 25%,而且这个份额每年增长 70%。单个 128K 上下文的 Llama-3-70B 推理仅 GPU KV 状态就消耗 42 GB。Agent 记忆所运行的物理基板比十二个月前结构性更贵,而计划的产能扩张要到 2027-2028 年才能到来。
力量 2:供应商记忆层有了定价层级。Mem0,市场的领导者,拥有 51000+ GitHub stars 和 2400 万美元融资,将其图记忆能力——这个真正实现跨时间关系多跳推理的功能——放在了 Pro 层级,定价 249 美元/月。19 美元/月的 Starter 层级只给你向量搜索和键值查找。要解锁大多数生产 Agent 所需的功能,需要跨越 13 倍的价差。Zep 的 Flex 计划起价 125 美元/月。Letta 按每次执行 0.00015 美元/秒收费。
支撑这一切的向量数据库市场——Pinecone 占 28% 份额,Qdrant、Weaviate、Milvus、Chroma——估值 32 亿美元,预计到 2030 年达到 89.5 亿美元。更广泛的 Agent 记忆基础设施市场为 63 亿美元,预计以 35% 的 CAGR 在 2030 年达到 285 亿美元。
记忆不再是一个功能了。它是一个市场。
重要的数学:一个带有 4000 token 系统提示词的 Agent 运行 20 个回合,仅系统提示词重复就消耗 80000 token——大约占 500000 token 工作流总账单的 16%。加上工具调用负载(3000 token × 8 次调用 = 24000 累积 token)和冗余重复检索,记忆开销超过你总 Agent 成本的 30%。
2026 年的 Agent 记忆市场已经结晶为四种架构,每种都有不同的成本配置文件和权衡。我们今年早些时候报道过向量、图和压缩方法的三分法。此后的格局已经固化为供应商层级:
结构性问题:2026 年 65% 的企业采用混合方法——在内部构建核心工作流,同时在边缘购买记忆基础设施。但供应商定价创造了一个功能悬崖。你可以低成本实验,但当你需要图记忆、时间推理或合规级删除时,你就遇到了价格墙。
而且这是供应商不愿积极讨论的部分:Mem0 是一个单一的 VC 支持的供应商,没有独立基础。如果需要保护 SaaS 收入,它在结构性上存在转向限制性源代码许可证的风险——我们在这个类别中已经反复看到这种模式。
在你根据供应商发布的准确率数字选择供应商之前,要知道:基准之间互不认可。

2026 年 7 月发表的一项调查发现,相同的记忆系统根据你使用的评估框架不同,得分差异显著:
Mem0:在 LoCoMo(供应商基准)上 92.5%,但在独立学术研究中为 77-81%
Zep/Graphiti:在 LoCoMo 上 55-56%,但在 LongMemEval 上 63.8%——而 Mem0 在 LongMemEval 上仅 49.0%
基准中的排名会根据基准对"记忆"的定义而反转。以检索为重点的测试偏向向量存储。以时间推理为重点的测试偏向知识图谱。两者都没有告诉你当用户要求 Agent 忘记某事时会发生什么。
最令人担忧的是:在检索基准上接近完美的系统,在对抗性遗忘测试中灾难性地失败。Graphiti 在对抗性遗忘测试中得分 4.4-7.0%。整个行业在基准化检索的同时,却交付了一个删除危机。
⚠️ 反主流角落:目前没有基准测试通过 KV cache 的删除。没有供应商为合规而记录缓存清除语义。记忆系统明确地在数据清除方面失败,而缓存层却在经济上为保留而优化。如果你的 Agent 处理 PII,这个差距是一颗监管定时炸弹。
在这个成本上升和供应商锁定的前景中,字节跳动火山引擎团队开源了 OpenViking——一个"面向 AI Agent 的自演化上下文数据库",已经爆炸式增长到 30400 个 GitHub stars,以每天 800+ 的速度增长,截至本文撰写时。

OpenViking 的核心论点是:Agent 记忆不应该是扁平的向量存储或专有 SaaS 产品。它应该是一个文件系统。在 viking:// 协议下,一个 Agent 用 ls、tree 和 find 来浏览自己的上下文,而不是查询黑盒嵌入索引。
三级加载模型是经济变得有趣的地方:
L0(抽象层):一句话摘要,始终加载。
L1(概述层):约 2000 token 的概述,在相关匹配时加载。
L2(细节层):完整内容,仅在明确需要时加载。
传统向量搜索预先加载所有 10000 token。OpenViking 平均加载 550 token——减少 95% 的成本。在使用标准化测试数据的基准测试中,与原生实现相比,任务完成率提高了 43%,同时输入 token 成本降低了 91%。
整个基准测试表现令人印象深刻:
该项目由 VLDB 2026 接受的论文支持(VikingMem,arXiv:2605.29640),核心采用 AGPLv3 许可证,CLI 和示例采用 Apache 2.0。

关于 500% 内存价格飙升的 Hacker News 帖子在单日内获得了 658 分和 548 条评论,讨论分成了两派。一派认为价格冲击终于会迫使软件团队优化内存使用。另一派指出,没有像燃油效率标准那样的监管equivalent来推动行业提高效率——而且随着 AI 同时作为需求的生产者和消费者,指数循环可能不会自我纠正。

在 Agent 特定方面,一个关于开源编程 Agent 记忆的 Show HN 帖子获得了 131 分,以及一条说明性的热门评论:"我想每个人最终都为自己构建了一个这样的东西。"碎片化就是信号——没有标准,没有协议,没有类似 MCP 的记忆 equivalent。每个人都在自己动手,而这种 DIY 方法无法扩展。
Brick Technology 的一篇论文发现,基于事实的记忆系统在大约 10 个交互回合后变得比长上下文推理更便宜——但代价是显著的准确率损失。在 LoCoMo 上,记忆系统得分 57.68%,而长上下文 GPT-5-mini 是 92.85%。权衡是真实的:你节省了 token 但失去了召回率。
ℹ️ 在 LoCoMo 上获胜的记忆框架每次对话比第二名重 340 倍——这是没有任何基准列显示的成本差异。在不考虑成本的情况下优化准确率,是团队最终收到 249 美元/月记忆账单的方式。
这是没有人能干净利落解决的张力。记忆供应商论证——正确地——图记忆、时间推理和合规级删除是真正的硬工程问题。从头构建 Zep 的 Graphiti 引擎或 Mem0 的多存储架构,是一个高级团队六个月的項目。定价反映了真实价值。
但反论同样有力:记忆正在向基础设施而非产品收敛。数据库、消息队列和容器编排都曾走过同样的模式。专有版本总是当下更好。但开源版本会迎头赶上,然后专有供应商就只能在托管便利性而非能力上竞争了。
OpenViking 是迄今为止 Agent 记忆正在遵循基础设施路径的最强信号。它不如 Mem0 的托管服务那么成熟。它的删除方案还不成熟。它的企业合规功能最少。但它实现了 91% 的 token 减少,可以自托管,而且有字节跳动工程团队做后盾——这意味着它将以 VC 资助的初创公司难以匹敌的速度持续改进。
Token 压缩层是同一战争的另一个前沿。headroom,这个通过在 tool 输出到达 LLM 之前压缩它们而获得 12800 stars 的工具,正在从相反的方向解决同样的经济问题:不是让记忆更聪明,而是让管道更窄。

如果你在生产环境中构建 Agent,以下是审计清单:
了解你的记忆成本。为你的 Agent 的每回合 token 消耗添加检测。如果你没有追踪对话长度上的成本曲线,你就是在盲目飞行。n(n+1)/2 的累积模式意味着你的 50 回合工作流成本是你 naive 每回合估算的 10 倍。
评估功能悬崖。如果你使用 Mem0 Starter(19 美元/月),要明白图记忆——实现多跳时间推理的能力——需要 Pro 的 249 美元/月。这是 13 倍的跳跃。在你被锁定之前,知道你的用例是否会跨越那个边界。
用你的工作负载运行 OpenViking。基准是引人注目的,但基准不是你的数据。克隆仓库,指向你 Agent 实际对话历史,并测量你查询上的 token 减少和准确率。91% token 减少的说法在标准化测试中成立——验证它是否在你的领域成立。
审计你的删除方案。如果你的 Agent 处理 PII,问你的记忆供应商:当用户请求删除时会发生什么?删除是否传播到 KV cache?到缓存的嵌入?到图边?如果答案是"我们正在研究中",那是一个合规缺口,不是路线图项目。
关注 harness 记忆层。Claude Code、Cursor 和 Windsurf 都在将记忆构建到 harness 本身——MEMORY.md 文件、上下文文件、会话持久化。如果你的 Agent 运行在一个已经管理记忆的 harness 内部,在上面添加供应商记忆层会造成冗余和成本,而没有相称的准确率提升。
💡 底线:Agent 记忆正在分化为两个层级。供应商管理的记忆(Mem0、Zep、Letta)面向需要合规、时间推理和托管基础设施的团队。开源记忆(OpenViking、LangMem、Graphiti)面向需要成本控制、自托管和架构灵活性的团队。选择符合你约束的层级——但要有意识地去选择,因为切换成本高昂且在上升。
500% 的 DRAM 价格飙升是一个结构性转变,不是周期。计划的晶圆产能不会在 2027-2028 年之前到来。AI 对 HBM 和服务器 DRAM 的需求每年增长 70%,且没有放缓的迹象。记忆的物理成本在上升。
在软件层,碎片化将会整合。迟早会有人提出一个 MCP-equivalent 的 Agent 记忆协议——可移植的、供应商无关的,具有标准化的读、写、忘和审计语义。平台关注论已经流传:记忆治理、RBAC 和来源追踪需要成为基础设施问题,而不是应用级 hack。
在那之前,最聪明的做法是拥有你自己的记忆层。供应商记忆是便利的。开源记忆是可生存的。在一个价格只涨不跌的市场里,可生存性胜出。
更多关于 Agent 记忆架构分化的内容,参见我们之前的报道:The Agent Memory Wars Are Here 和 headroom: Cut Agent Token Costs 60-95%。
最初发表于 AgentConn