通过分层工作流——生成知识Bundle、持久化项目记忆、按需Skills和Token压缩——避免模型每轮重复扫描文件。
每次你向 AI 编程助手提问,它往往从零开始。
"认证逻辑在哪里实现的?"
"谁调用了 UserService?"
"这个 API 流程是怎么工作的?"
模型并不会记住你的架构,而是再次爬取几十个文件。这意味着更多的 token、更高的成本、更慢的响应,以及更多的幻觉风险。
在尝试 AI 辅助开发之后,我发现最大的优化不是选择不同的模型——而是改变你发送给模型的内容。
本文介绍一种分层工作流,通过 OKF、持久化项目记忆、按需 Skills 和 token 压缩,让 AI 代理的效率大幅提升。
LLM 不会像人类那样阅读代码。所有内容都转化为 token,通过 Transformer 层处理。
每一个不必要的文件、日志或重复的解释都会增加:
💰 成本(对于付费 API)
🧠 上下文窗口占用
❌ 丢失重要信息的风险
目标不是提供更少的上下文,而是提供结构更好的上下文。
最大的改进来自于完全避免重复的文件读取。
不要在每个会话都把代码库喂给 LLM,而是生成一次知识包,让代理去查询它。这就是 OKF(Optimised Knowledge Format)的核心思想。它将项目的架构——类、函数、API、关系和模块——提取成结构化的 Markdown,人类和 AI 代理都可以高效导航。
传统工作流:
Question
│
▼
Read 40 files
│
▼
Understand architecture
│
▼
Answer
OKF 工作流:
Question
│
▼
Read knowledge bundle
│
▼
Jump directly to implementation
│
▼
Answer
区别很简单:
最容易生成这些知识包的方式是使用 OKF Generator,一个开源 CLI,通过静态分析扫描代码库并生成 OKF 包——无需 LLM。它支持增量更新、代理集成,甚至零 LLM 工作流,你可以完全离线生成和查询包。
GitHub: https://github.com/UmairBaig8/okf-generator
pip install okf-generator
# Generate your first bundle
okf generate
# Update it after new changes
okf update
# Install integrations for AI agents
okf install all
生成之后,让你的代理指向这个包而不是整个代码库。这个包是纯 Markdown,可版本控制,设计上与源代码共存。
OKF 超越了 token 优化。在让开发者快速上手大型代码库时,你可以给任何 LLM 生成的 okf_bundle,让它解释项目、识别关键组件及其关系,并生成 Mermaid 图。
这提供了代码库的快速高层概览,可以显著减少上手时间。
在这个例子中,使用本地 LLM(gpt-oss20b),我让它分析 C:\Code\uigen\okf_bundle 并生成一个 Mermaid 图,以及对项目关键组件及其交互方式的解释。


所有组件、解释和 Web 流程都在不到 2 分钟内生成。
大多数开发者反复解释同样的事情:
如何运行项目
架构决策
这些信息应该放在 CLAUDE.md,一个在每个会话开始时自动加载的持久化 Markdown 文件。它消除了重复的介绍,并让项目基础知识在不影响每次 prompt 的情况下始终可用。
一个好的 CLAUDE.md 包含:
# Project Rules
- Use pnpm instead of npm
This project has an OKF knowledge bundle at ./okf_bundle/.
- Use `okf lookup <Name>` for full concept context.
- Use `okf lookup --type <Type>` to filter by type.
- Read `SUMMARY.md` for the full knowledge map.
这些指令不需要在每次对话中重复,它们会自动加载。
# Project-level
./CLAUDE.md
./.claude/CLAUDE.md
# User-level
~/.claude/CLAUDE.md
并非所有东西都值得永久占用上下文。
部署指南、审查清单、合规文档和冗长的 API 参考最好存为 Skills。Skills 是可复用的 SKILL.md 文件,在主上下文之外待机,直到任务需要它们时才调入,保持默认 prompt 精简,同时让详细工作流随时可用。
好的例子包括:
你的默认上下文保持精简,但专业知识只需一条命令即可获取。
.claude/skills/<name>/SKILL.md
# or
~/.claude/skills/<name>/SKILL.md
Hooks 并不是直接节省 token,而是防止昂贵的错误。
每次编辑后自动格式化
阻止危险的 shell 命令
代理完成时通知你
自动运行 lint
由于 Hooks 在预定义的生命周期事件触发,它们完全省去了 prompt 中的重复指令。
.claude/settings.json
# or
~/.claude/settings.json
过时的架构几乎和没有架构一样糟糕。
你可以使用 GitHub Actions 在有人推送 main 或打开 pull request 时自动重新生成 OKF 包。这个工作流保持 AI 上下文与代码库同步,甚至可以为审查生成影响摘要。
name: OKF Bundle
on:
push:
branches: [main]
jobs:
generate:
runs-on: ubuntu-latest
steps:
- uses: actions/checkout@v4
- run: pip install okf-generator
- run: okf generate . okf_bundle
现在你的 AI 始终理解最新的架构。
优化输入只是故事的一半。
两个互补工具解决不同的问题:
如果你的上下文中满是 git diff、构建日志或测试输出,rtk 会在其到达模型之前修剪它。如果你的助手倾向于产生冗长的解释,caveman 保持响应简洁。它们共同减少了 token 等式的两边。
每一层消除不同来源的浪费:
AI 开发的未来不是无限增加上下文窗口,而是让上下文变得有意图。
一个结构良好的代码库给 AI 助手带来的优势与给人类开发者相同:减少搜索时间,增加解决问题的时间。
如果你已经在使用 Claude Code、Cursor、Copilot 或其他 AI 编程助手,为你的下一个项目生成一个 OKF 包试试。你可能会在你注意到 token 节省之前很久就注意到差异了。
OKF Generator (GitHub)
如果你一直在尝试 token 优化或 AI 开发者工作流,我很想在评论中听到什么对你有效。