PLUR 不再把背景知识全塞进 system prompt,而是将知识分解为「engram」——带类型的最小断言,按任务按需检索注入,200-400 token 即可替代原来的 3000 token 背景,显著降低每次调用的 token 消耗与资金成本。
简短的答案:瓶颈不在模型智能——而在上下文。你每次对话都在发送相同的 3,000 个 token 的背景知识,其中 90% 是 agent 根本不需要的。PLUR 只注入相关内容。Haiku + PLUR 现在以十分之一的成本超越了不带记忆的 Opus。
每个 AI 团队最终都会撞上同一面墙。你的 agent 会编码、写代码、做推理。但它不知道你的那堆事:你的部署服务器、你的标签规范、你上百个工具中哪个处理哪个任务、你六个月前做的那个决定及其原因。
直觉反应是把所有东西都塞进 system prompt。一个 CLAUDE.md 或 AGENTS.md 文件膨胀到 3,000 词。每次对话你都得发送——其中大部分与 agent 当前正在做的事毫无关系。
以 Opus 每百万 token 15 美元计算,光 system prompt 每个对话轮次就要 $0.045。乘以 5 个开发者的团队、每人每天 200 轮对话,你每天在 agent 大部分时间忽略的上下文上要花 $45。
更深层的问题:这样根本不管用。当 agent 被要求"部署 trading 模块"时,它不需要那 400 字的 Zettelkasten 规范。它只需要关于部署目标的 5 行内容。把那 5 行埋进 3,000 token 的噪音里,结果就是 agent 用错服务器或跳过冒烟测试。
人类专家不会在开始任务前记住所有东西。他们按需从记忆中提取,只浮现与当下相关的内容。agent 也应该用同样的方式工作。
PLUR 将知识存储为 engrams——小型、有类型的断言,会随着使用而增强、与当前无关时衰减,模拟人类记忆(ACT-R 激活模型)。每一轮对话,通过快速本地搜索(BM25 + BGE embeddings,无 API 调用)选出当前任务最相关的 5–10 个 engram,只将那些注入上下文。
不是发送 3,000 token 的背景知识,而是发送 200–400 token 的精准记忆。agent 恰好得到它需要的。没有它不需要的。
# Task: "deploy the trading module to production"
# Injected automatically (5 engrams, ~280 tokens):
deploy target: nightshift (not prod) — SSH alias: nightshift
trading module lives in 0-personal/trading/
deployment: git pull + systemctl restart plur-trading
never push to main directly — PR required
smoke test: python test/smoke.py --env nightshift
没有 Zettelkasten 规范。没有邮件规范。没有其他 40 件此刻不相关的事。
我们做了头对头测试:相同的任务、相同的 agent,有无 PLUR 记忆。28 个场景,覆盖 Haiku 4.5、Sonnet 4.6 和 Opus 4.5。问题是 PLUR 记忆是否改变了哪个模型胜出。
结果:31 胜 4 负——所有模型 89% 胜率。
最清晰的结果出现在 house rules 上——需要应用组织特定知识的任务(标签规范、文件路由、部署流程)。没有 PLUR 的情况下,agent 正确处理这些的比例根据模型不同在 10–38% 之间:
带 PLUR 记忆的 Haiku 在 89% 的决定性对决中击败了没有记忆的 Opus。模型没有变聪明——它得到了正确的上下文,而不是噪音。
在 LongMemEval(检索基准)上,PLUR 在 500 题套件上使用混合 BM25 + embedding 搜索达到 97.6% 的 Hit@5 得分。零 API 调用。全部本地运行。
在真正需要了解你组织运作方式的任务上,成本降低 95%,同时性能提升 2.6 倍。
这个数学在任何规模下都成立。以每天 1,000 轮对话(一个小团队)计算,之前是约 $45/天,之后是约 $2/天——每天节省 $43,同时 agent 表现更好。
PLUR 挂钩到你的会话生命周期。当你纠正 agent 时,它会学习:
# You say: "no, deploy goes to nightshift, not prod"
# PLUR captures automatically:
plur_learn("deploy target: nightshift (not prod) — SSH alias: nightshift")
当 agent 发现一个规范或做一个决定时,同样的流程。久而久之,它积累了一个关于你世界如何运作的模型——不是作为静态文档,而是作为可搜索、加权的知识图谱。
Engram 会衰减。六个月前你重构的代码库中的某个规范会自动停止出现在上下文中。无需人工维护。
你可以。但"更小"有天花板——你永远需要比精心维护的静态文件能提供的更多上下文,而不让它再次变得臃肿。而且静态文件不会学习。它不会排序优先级。无论 agent 在做什么任务,它都发送相同的事实。
PLUR 的注入是任务感知的。同一知识库为"部署 trading 模块"vs"写博客文章"vs"审查这个 PR"浮现不同的 engram。agent 通过它此刻正在做的事的镜头来看它的世界。
npx @plur-ai/mcp init
一步完成存储(~/.plur/)、MCP 配置和 Claude Code 钩子的设置。重启编辑器。记忆从下一个会话开始生效。
对于 Cursor、Windsurf 或任何兼容 MCP 的客户端:
{
"mcpServers": {
"plur": {
"command": "npx",
"args": ["-y", "@plur-ai/mcp"]
}
}
}
记忆存储在 ~/.plur/——纯 YAML 文件、人类可读、零云依赖。用 plur_sync(基于 git)跨机器同步。
开源。Apache 2.0。兼容 Claude Code、Cursor、Windsurf 和任何 MCP 客户端。Python agent:pip install plur-hermes。
GitHub → · 基准测试 → · Engram 规范 →