前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯7294
  • OpenAI 正在构建全场景 AI 代理,普通人会用吗?
  • 15分钟用 CrewAI 构建 B2B 获客 Agent
  • Agent 部署时「人工审批」按钮只是仪式
  • Laravel + OAuth 接入 ChatGPT GPT Actions 实战
  • LLM 提供商故障时:抽象接口胜过硬编码
  • Proof Kernel:让AI Agent输出真正可信赖的验证机制
  • Claude Code 任务家族工具详解:Todo系统完整指北
  • CVE-2025-62593:Ray框架DNS重绑定远程代码执行漏洞
  • 调试AI生成代码的实战方法
  • Eval全绿不等于系统正确:muteval发现被忽视的回归
  • 恶意 AI Agent 伪装道歉信暗中植入恶意代码开源项目
  • AI Agent 的瓶颈不是推理能力,而是记忆管理
  • Gen-1.5 机器人基础模型:一次 3-12 秒演示即可学会新任务
  • 企业 AI 负责任落地需要从开发者工作流设计入手
  • 汤森路透花 4000 万美元基于阿里千问自研法律大模型 Thomson
  • Kotlin多平台实现主页小组件:iOS/Android跨平台实战
  • AI 编程多工具工作流的取舍策略
  • 别给Agent知识库,给它调用知识的路径
  • Unsloth:普通GPU上微调开源大模型的利器
  • AI Agent的问题不是推理能力而是记忆架构
  • Lean Agentic Framework:AI编程治理工作流开源
  • LLM无关工作流:2026年企业AI架构新范式
  • 记忆存储无法表达冲突:AI Agent的记忆之痛
  • Agent可观测性≠服务可观测性
  • OpenAI沙箱逃逸技术复盘:隔离Agentic系统的教训
  • Agent 表现差不是因为推理能力差,而是记忆架构有缺陷
  • Agentic SQL 注入:穿越信任边界的经典攻击新衣
  • Codex vs Claude Code 一周真实使用对比
  • MCP Server 测试方法论
  • Kiro上线GPT-5.6,主打开发者性价比
  • RL训练信号才是编程Agent的真正瓶颈
  • PDF4me Agent Skills:让 AI 编程助手精准调用 PDF API
  • MCP 与 A2A 协议对比:工具层与 Agent 协调层分工清晰
  • Perplexity MCP:将带引用网络搜索直接接入 AI 编程工具
  • AI功能成本结构:为何按量计费会颠覆你的架构决策
  • 生成式AI工程实践升级:原生结构化输出成为主流
  • Anthropic Python SDK 1.0 迁移指南:httpx2 替换与重大 breaking change
  • Cerebras 发布 CS-4 加速器:同功耗下性能翻倍
  • 开源AI Agent周榜:Cline登顶,Top100一览
  • Optuna 早停技巧:12/20 试验被剪枝,调参时间缩 28%
  • 本地轻量 RAG 实战:Claude + sentence-transformers
  • Google A2A 协议加入 MCP 所属基金会
  • 用脚本追踪DeepSeek API费用:周末定价变更后的真实成本
  • 双层记忆架构:让 AI Agent 摆脱完整对话历史
  • Codex CLI 实战:AGENTS.md、配置分层与权限管控
  • OWASP LLM Top 10 2026:本质是爆炸半径文档
  • 面向AI Agent时代的电商开发指南
  • Codex PR Review 实战:自动化评审配置与触发规则
  • AI代理与零信任:NEXUS的Istio实践
  • AWS AgentCore Gateway:AI代理权限治理
  • LLM生产部署评估检查清单2026
  • 已加载 51 / 7294
8.0
热点
AI SCORE
编程提效2026-08-24 20:55

Lean Agentic Framework:AI编程治理工作流开源

dev.to · AI#AI编程#开源#工作流
Editor brief · 编辑速览

为Codex/Claude设计的技能插件,根据任务风险等级分配治理层级(Trivial/Lite/Work),并在运行间传递验证学习而非静默重写共享规则。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

编码智能体在完成任务的能力上越来越强。但这并不意味着它们周围的工作系统也在变得更好。

某个任务可以通过测试,但团队却在积累更多的流程、更多的产出物、更多进行中的工作,下周仍然出现同样的重复性失败。智能体改进了代码。组织却什么都没学到。

为此我构建了 Lean Agentic Framework 来探索这个鸿沟。

这是一个面向 Codex 和 Claude 的纯技能开源插件。它不需要 MCP server 或外部账户。它的职责不是替换智能体已使用的编码工具或实现方法。它的职责是判断一个任务需要多少治理,以及如何在多次运行之间连接经验证的学习成果,而不是悄无声息地重写共享规则。

单一入口,多种严谨级别

该框架从一个入口技能开始:

$using-lean <your real task>

路由器选择最小可用的路径:

琐碎工作退出 Lean。事实性回答或无约束的创意请求不应该承担框架开销。

小型、安全的工作使用 Lean Lite。任务保持有界,进行中的工作维持在一项,完成仍然需要新的验证。

风险性工作使用 Lean Work。不确定性、外部依赖、破坏性、安全敏感或标准化工作获得明确的边界、停止条件、回滚和证据。

反复出现的浪费可以使用 Lean System。独立运行可以感知一个已验证的模式,拉取一个 Kaizen 实验,测试总体效益,并提出推广方案。

最后一步是特意被治理的。一次成功的本地修复不能悄无声息地重写共享技能、政策或操作标准。

这不是 Superpowers 的替代品

Superpowers 为编码智能体提供了一种严谨的软件开发方法,包括头脑风暴、计划、TDD、调试和评审。

Lean 在不同的层面运作:价值、流程、进行中的工作、风险路由、标准化约束和跨运行学习。仓库包含一个适配器,使 Superpowers 能在 Lean 治理的实验内提供实现纪律。

这个关系很重要,因为公正的比较不能把审批关卡视为失败。在第一个市场试点中,Superpowers 组达到了设计审批步骤然后停止了。这是预期行为。比较完成的代码需要相同的已批准设计,然后是第二个执行阶段。

基准测试并没有给这个项目增光

第一次固定任务 Codex 试点产生了这个结果:

完整 Lean 消耗了 2.18 倍的时间和 3.34 倍的输入 token。它增加了一个更有针对性的回归测试,而且是唯一延迟了标准化立即推广的完成分支,但这些好处并不能证明对每个任务都承担这种开销是合理的。

这个结果改变了产品。测试版现在包含 Lean Lite,适用于小型、低风险、可逆的工作,而不是强制每个请求都通过完整的治理路径。

这正是我希望框架本身遵循的循环:暴露浪费,改变一个机制,再次验证,并保持限制可见。

测试版没有声称什么

单一任务和单一种子无法建立优势。当前的测试版没有声称 Lean 总是减少 token、总是更快完成,或总是产生更干净的代码。它也没有声称一个工作的注册表证明了一个真正的组织已经采用了持续改进的文化。

下一个有用的基准测试需要多个任务和种子、相同的模型和权限、相同的已批准设计用于有审批关卡的框架,以及一系列相关任务。重要的问题不仅是任务 1 是否通过。还要看任务 2 是否因为任务 1 教给系统的东西而减少了返工。

代码、发布存档、基准测试方法、脱敏结果和已知限制均在 MIT 许可证下公开:

https://github.com/Lrinvl1203/lean-agentic-framework

我正在寻找可重现的维护和工作流任务,这些任务可以衡量完成度、人工干预、返工、token 成本、耗时、范围蔓延和跨运行学习。负面结果是有用的。它们是系统改进的方式。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
AI Agent的问题不是推理能力而是记忆架构
下一篇
LLM无关工作流:2026年企业AI架构新范式