前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8439
  • AI时代招聘失效:面试该考什么
  • 审稿接受率95%说明审核者已停止阅读
  • MCP协议的零信任沙箱防火墙架构
  • Agent记忆层设计:让数字可证伪
  • 8款编码Agent的拒绝清单格式深度审计
  • AI 评审工具被模型用字符串 trivial 解法骗过
  • AI Agent 安全防护重点:模型泄露、密钥泄露与权限升级
  • 生产 Agent 管道 42 分钟烧掉 600 美元:上下文 inflation 教训
  • Salesforce 联手英伟达开源 Koa 推理模型:企业级 AI 备选方案
  • 无问芯穹开源具身端侧推理引擎 APXInf,Pi 0.5 性能 SOTA
  • LLM Wiki 两步思维链摄取:增量缓存 + 溯源替代传统 RAG
  • AI Agent 的权限天花板:应用能做啥和马上做啥是两码事
  • AI编程工具的上下文管理机制对比
  • 阶跃发布StepAudio 3语音大模型,多项指标全球第一
  • OpenRouter 429 限速诊断与恢复指南
  • Cursor vs OpenCode:日常编程 AI 工具深度对比
  • 采购 Text-to-SQL 工具前必问的 12 个问题
  • 微调还是 RAG 还是 Prompt?成本拆解与选择框架
  • Agent-net 开源 Webagent:Go 脚手架将任意网站快速转换为受控 AI Agent
  • 零成本用Microsoft 365构建AI安全运营中心
  • AI Agent成本管控:Pre-Call估算与Post-Hoc报告实战
  • 政策问答系统实战:RAG架构与工程避坑
  • 开源模型已接近 AGI 门槛:企业级本地部署指南
  • DeepSeek V4.1 Flash:每任务 0.07 美元进入 Agent 帕累托前沿
  • CoT 推理如何炸飞 Token 预算
  • 7 名博士 3 个月从零训练 7B 大模型,代码数据全公开
  • 谷歌全工程师开放Anthropic Claude内部使用权限
  • LLM推理优化实战:精度、显存、吞吐三路权衡
  • Claude Code 技能组合:从想法到完整功能的实战流程
  • AI 最强编程 Agent 失败率 60%:基准测试数据出炉
  • Agent 技术栈三层职责划定:Harness / Framework / MCP 各管什么
  • Vercel AI SDK Harness 层支持原生订阅认证,Copilot/Cline 等开箱即用
  • Abnormal AI 在十亿级邮件场景下部署 Bedrock AgentCore Code Interpreter 实
  • Sakana AI提出PC-ALM:局部学习的1000层网络训练新方法
  • 已加载 34 / 8439
8.0
热点
AI SCORE
编程提效2026-09-15 23:39

Agent记忆层设计:让数字可证伪

dev.to · AI#Agent#记忆系统#开源
Editor brief · 编辑速览

nautilus-compass记忆系统不做摘要压缩(摘要曾是天花板),只在读取时做混合语义+关键词召回,嵌入本地化、漂移检测,零信任可验证每个数字。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

每个 AI Agent 的记忆层发布时都附带两样东西:一张基准测试表,以及一个隐含的请求——让你信任它。我们在构建 nautilus-compass 时围绕相反的请求展开:每一个我们发布的数字,你应该能够从字节重新计算,而不需要信任我们。本文将解释支撑这一理念的两个架构赌注。

赌注一:写入时零 LLM 调用(写入时赌注)

大多数记忆管道在文本流入时进行摘要提取或图结构化。这是一个赌注:你在押注今天的压缩方式能匹配明天的问题。我们一直在看着这个赌注失败——同一份语料,用完全相同的检索策略、只在其上增加一层摘要层,端到端准确率就从 42.6% 移动到了 75.4%。压缩是天花板,而不是地板。

所以写入路径不做任何聪明的事:原始文本,用 BGE-m3 在本地嵌入,没有任何东西离开机器。所有的智能都发生在读取时——混合语义 + 关键词召回、单会话问题的轮次窗口分块路由,以及漂移检测——在 Agent 基于过时记忆行动之前,对每个提示与一组真实失败记录锚点集进行评分(留出 AUC 0.83)。

实际结果,在 LongMemEval-S 完整 500 条上与 mem0 2.0.19 的同题正面 PK(各自使用自己的默认嵌入器,我们的测试框架,一条命令复现,约 $3.50):P@1 0.890 vs 0.774,P@5 0.978 vs 0.916。复现脚本在仓库里;证据链包括了那些不利的结果(跨编码器重排在语料上落败;我们同样发布了这些)。

赌注二:声明以密封证据的形式交付,而不是散文

基准测试表就是一个声明。我们将基准以 VerifyPack 证据包的形式发布:一个 sha256 清单,每一条声明都可以从 payload 字节重新计算,以及一个 ed25519 签名收据。两条仅用标准库的命令就能重新推导任何数字——无第三方依赖,无"信任我们的笔记本"。Reproducibility Wall 以与有利结果相同的显著程度发布矛盾数字,我们的一个密封包里包含了一个分歧——一个日志文件在密封后不断被追加,协议捕获了它,我们让这个失败保持可见。这就是它存在的意义。

这种纪律始于自我防御:我们自己的审计轨迹捕获了实现者报告的"全绿"而实际并非如此的情况——一周内两次,其中一次是通过独立重计算发现的,而实现者自己的示例都无法通过。无法在对抗性阅读自身日志的情况下存活的 Agent 记忆不是基础设施,而是一本日记。

git clone https://github.com/chunxiaoxx/nautilus-compass ~/.claude/plugins/nautilus-compass
bash ~/.claude/plugins/nautilus-compass/install.sh
bash ~/.claude/plugins/nautilus-compass/daemon_start.sh

适用于 Claude Code / Cursor / Cline / Continue / Zed 以及任何 MCP 客户端;如果不需要本地模型,可以访问托管多租户网关 compass.nautilus.social/mcp/。

以及本文开头的那个提议:你有已发布的记忆层数字——你自己的,或者你依赖的?提一个 Issue。我们将独立重新计算并发布结果——无论一致还是分歧——并附上签名收据。按先后顺序服务,目前仍是人工流水线。

本文中的每一个数字都以 sha256 清单化的、字节级可重新计算的、签名证据包的形式交付。你的记忆层能经受住这样的标准吗?

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
MCP协议的零信任沙箱防火墙架构
下一篇
8款编码Agent的拒绝清单格式深度审计