为Codex/Claude设计的技能插件,根据任务风险等级分配治理层级(Trivial/Lite/Work),并在运行间传递验证学习而非静默重写共享规则。
编码智能体在完成任务的能力上越来越强。但这并不意味着它们周围的工作系统也在变得更好。
某个任务可以通过测试,但团队却在积累更多的流程、更多的产出物、更多进行中的工作,下周仍然出现同样的重复性失败。智能体改进了代码。组织却什么都没学到。
为此我构建了 Lean Agentic Framework 来探索这个鸿沟。
这是一个面向 Codex 和 Claude 的纯技能开源插件。它不需要 MCP server 或外部账户。它的职责不是替换智能体已使用的编码工具或实现方法。它的职责是判断一个任务需要多少治理,以及如何在多次运行之间连接经验证的学习成果,而不是悄无声息地重写共享规则。
该框架从一个入口技能开始:
$using-lean <your real task>
路由器选择最小可用的路径:
琐碎工作退出 Lean。事实性回答或无约束的创意请求不应该承担框架开销。
小型、安全的工作使用 Lean Lite。任务保持有界,进行中的工作维持在一项,完成仍然需要新的验证。
风险性工作使用 Lean Work。不确定性、外部依赖、破坏性、安全敏感或标准化工作获得明确的边界、停止条件、回滚和证据。
反复出现的浪费可以使用 Lean System。独立运行可以感知一个已验证的模式,拉取一个 Kaizen 实验,测试总体效益,并提出推广方案。
最后一步是特意被治理的。一次成功的本地修复不能悄无声息地重写共享技能、政策或操作标准。
Superpowers 为编码智能体提供了一种严谨的软件开发方法,包括头脑风暴、计划、TDD、调试和评审。
Lean 在不同的层面运作:价值、流程、进行中的工作、风险路由、标准化约束和跨运行学习。仓库包含一个适配器,使 Superpowers 能在 Lean 治理的实验内提供实现纪律。
这个关系很重要,因为公正的比较不能把审批关卡视为失败。在第一个市场试点中,Superpowers 组达到了设计审批步骤然后停止了。这是预期行为。比较完成的代码需要相同的已批准设计,然后是第二个执行阶段。
第一次固定任务 Codex 试点产生了这个结果:
完整 Lean 消耗了 2.18 倍的时间和 3.34 倍的输入 token。它增加了一个更有针对性的回归测试,而且是唯一延迟了标准化立即推广的完成分支,但这些好处并不能证明对每个任务都承担这种开销是合理的。
这个结果改变了产品。测试版现在包含 Lean Lite,适用于小型、低风险、可逆的工作,而不是强制每个请求都通过完整的治理路径。
这正是我希望框架本身遵循的循环:暴露浪费,改变一个机制,再次验证,并保持限制可见。
单一任务和单一种子无法建立优势。当前的测试版没有声称 Lean 总是减少 token、总是更快完成,或总是产生更干净的代码。它也没有声称一个工作的注册表证明了一个真正的组织已经采用了持续改进的文化。
下一个有用的基准测试需要多个任务和种子、相同的模型和权限、相同的已批准设计用于有审批关卡的框架,以及一系列相关任务。重要的问题不仅是任务 1 是否通过。还要看任务 2 是否因为任务 1 教给系统的东西而减少了返工。
代码、发布存档、基准测试方法、脱敏结果和已知限制均在 MIT 许可证下公开:
https://github.com/Lrinvl1203/lean-agentic-framework
我正在寻找可重现的维护和工作流任务,这些任务可以衡量完成度、人工干预、返工、token 成本、耗时、范围蔓延和跨运行学习。负面结果是有用的。它们是系统改进的方式。