前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4882
  • CI/CD AI Agent 部署前需加人工审批门
  • MCP + RSS 目录:让 AI 工具获取领域最新信息
  • Agent工具调用200 OK背后的谎言:完成所有权问题
  • DeepSeek V4 Pro正式版发布,Agent框架Harness开源,API涨价
  • GPU 数值格式详解:FP32/BF16/FP8/FP4 交互式理解指南
  • 长时 Agent 循环如何设计记忆机制
  • DFlash speculative decoding 测评:tokens/s 指标可能误导
  • 为什么AI demo便宜、上线后成本却翻10倍
  • Liquid AI 发布 3B 端侧视觉语言模型
  • AI 编程 Agent 通过测试也可能做出架构错误决策
  • Token降价90%但我的AI账单没降:Jevons悖论在起作用
  • 我的Agent替我做营销:我只负责点批准
  • ai-prompt-firewall:拦截敏感信息外泄的 Node.js 库
  • 用 FastMCP 快速为 Claude Code 构建自定义工具服务器
  • Ling 3.0 Flash 同尺寸最聪明开源模型
  • AI 辅助团队开发实际吞吐量研究:REPL 到 Swarm
  • 神秘模型 mona-lisa-1 曝光:疑似 GPT-Image 继任者
  • OpenAI Astra 和 ChatGPT 6 曝光: 多 Agent 协作与 GPT-6 真身
  • Claude + MCP: 一行命令完成容器化部署
  • AI 陪伴应用技术架构解析
  • 把 Claude Code 脚手架工程写成一条命令,开源了
  • A2A 协议详解:多 Agent 通信架构与实战实现
  • R-CLI 开源:Terminal Bench 2.1 最高分背后的编程脚手架
  • CVE-2026-16584:AWS API MCP Server安全漏洞深度分析
  • Anthropic 为 Claude 输出文本添加水印:API 开放检测,版权认定存争议
  • Next.js 16.3发布:开发内存降低90%,AI编码Agent工作流优化
  • 一行代码修复PyTorch训练隐性内存泄漏:loss.detach().item()
  • AgentShield:防止AI代理半夜烧钱2000美元的开源防火墙
  • 用Azure API Management管控Claude Code团队使用
  • 模型同质化时代:选型逻辑已变,护城河在模型之外
  • DBHub vs Bytebase MCP:数据库Agent接入方案对比
  • Claude Code Plan模式深度解析:权限变化与August 14切换要点
  • Opus 5 vs GPT-5.6 Sol vs Kimi K3 三大模型编程能力实测对比
  • Grok 4.6 性能追平 GPT-5.6 Sol,价格仅为六分之一
  • 为中国AI API 构建模型目录漂移监控工具
  • Opus 5 vs GPT-5.6 Sol vs Kimi K3:三大AI代理模型横向评测
  • Grok 4.6 性能比肩 GPT-5.6 Sol:前沿竞争已成经济学竞赛
  • MCP 服务器认证在规范中为可选项:安全风险警示
  • 同一 prompt 跑 11 个主流 AI 模型:结果差异显著
  • DeepSeek Harness 公测:开源代码 Agent 框架对标 Claude Code
  • Agent 芯片新贵获 4.8 亿美元融资:首颗 AI 芯片已量产
  • Grok 4.6以更低价格重返一线,逼近Fable 5
  • Vibe Coding不是软件工程:AI编程的边界与反思
  • 扫描PDF翻译是图形问题而非翻译问题
  • MCP协议变更为无状态:工具执行幂等性挑战
  • Claude 破解数学难题:2000 阶以下哈达玛矩阵
  • DeepSeek-V4-Pro正式版:原生兼容OpenAI Responses API与Codex
  • DeepSeek V4 Flash/Pro 8月调价:输入降价达40%,并发限制调整
  • 三起AI Agent越狱事件:均因配置验证缺失
  • AI 编程 Agent 的 Tracker 都是自我填报系统:真实问题剖析
  • Fable 5采用率低迷,企业AI支出或已触及天花板
  • 已加载 51 / 4882
8.0
热点
AI SCORE
编程提效2026-08-13 22:15

把 Claude Code 脚手架工程写成一条命令,开源了

dev.to · AI#Claude Code#工程实践#Agent
Editor brief · 编辑速览

作者将八篇 Claude Code harness 工程文章(Memory/Tools/Permissions/Hooks/可观测性)沉淀为开源 CLI,一键初始化标准化的 .claude/ 文件结构,避免每周重复手打相同配置。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

打破惯例的那个周一

新仓库。空的 .claude/ 文件夹。光标在崭新的 CLAUDE.md 里闪烁。

我做了之前做过十几次的事:在另一个窗口打开上个月的项目,开始复制。权限块。rm -rf 守卫。MEMORY.md 脚手架。MCP 配置。粘贴,查找替换项目名,切换回窗口。

做到一半,讽刺感才姗姗来迟。我们刚刚发表了八篇文章,恰恰是在教开发者们如何构建一个可靠的 harness——层层递进。而我作为作者,却在这里凭着记忆重新打字,还希望自己没有漏掉哪一层。

这套方法论没有工具支撑

整个系列的核心观点可以用一个公式概括:

Agent = Model + Harness

模型是 commodity——所有用同一版 Claude 的人获得的是相同的原始能力。Harness 是属于你的那部分。这就是为什么一个团队能干净利落地发布代码,而隔壁团队却发布一个回滚一个。

我们把它拆成五层,每层深入讲一篇:

Memory —— 你打字之前它知道什么。CLAUDE.md 作为 failure log,不是愿望清单。

Tools —— 它能触及什么,通过 MCP servers。

Permissions —— 它被允许触碰什么。三十秒配置就能阻止一个粗心的 install 搞坏你的机器。

Hooks —— 运行时强制执行什么。这是唯一上下文没法争辩出结果的一层。

Observability —— 之后你能看到什么,加上一个让 agent 在宣布完成之前验证自己工作的循环。在这一切之下是约束悖论:你越限制 agent 能做什么,它在自己该做的事上表现得越好。LangChain 公开论证了同样的观点——驱动分数跃升(Terminal Bench 2.0 上 +13.7 分,52.8% → 66.5%)的是 harness 和 context 的改变,而不是换模型。

理论很好。有真实数据支撑。但每篇文章结尾都一样:"把这个代码块复制到你的 .claude/ 文件夹里。"

我们给一座工厂写了本漂亮的手册,然后让每个人在每栋新建筑里手工组装生产线。每次都手动执行的 SOP 不是系统——是一场你最终会挂掉的记忆力测试。

两个没人提醒你的失败模式

你忘了一层。不会是那些出名的——rm -rf hook 你永远记得,因为它曾经吓过你。你忘的是无聊的那层:observability log,MEMORY.md index。等你注意到的时候已经过了三周,那时 agent 把你在一次它没有记录会话中已经修好的 bug 又引入了回来。

你的团队在项目开始前就分化了。一个 dev 写了一套严格的 permissions block。另一个复制了一份更旧的、宽松的版本。第三个"就这一次"跳过了 hooks。现在你没有 harness——你有四个方言版本的同一套东西。版本控制它的意义在于团队继承的是相同的可靠性。手工组装从第一天起就破坏了这个目标。

修复方法不是更聪明的模型。是让正确的 harness 成为容易的 harness:可复现、一致、设置起来无聊透顶。

所以我们把系列变成了一条命令

我们回顾了每篇文章,然后问自己:如果这不是一个要复制的代码块,而是一场面试里的问题呢?

这就是 shipwithai-starter——一个开源插件:

/shipwithai-starter:init

它询问你的技术栈和想要多少严格程度,然后写出整个 harness——五分钟拿到核心部分,三十分钟完整配置。然后:

git add CLAUDE.md .claude/ .mcp.json docs/
git commit -m "chore: add Claude Code harness"

你的队友克隆仓库,打开 Claude Code,harness 已经在那里了。不用第二个窗口。没有分化。生产线随建筑一起交付。

每篇文章现在在另一端都有一条命令:

博客依然教你手工做这件事——你应该读,因为你不理解的东西没法维护。但插件意味着你手工做一次是为了学习,而不是每个周一都重复做一遍,永无止境。

两个我们还没写到的层

坦诚的部分:系列文章说五层。插件实际配置了七层。这就是 dogfooding 对框架的影响。

Agents —— .claude/agents/ 里的 sub-agents,包括一个 drift-monitor,每周运行一次,告诉你什么时候你的 CLAUDE.md 已经悄悄不再和代码匹配。failure-log 模式的自动化版本。

SSOT —— single-source-of-truth 文档:架构文件、ADRs、codebase maps。让 agent 不用重新争论你已经做过的决策的那种上下文。我们会写深入讲解。但我们更想先交付工具、承认框架因为我们使用它而成长了,而不是假装地图在我们走之前就是完美的。

运行之前读每一行

完全开源:github.com/ShipWithAI/shipwithai-plugins——hooks、interview 逻辑、templates、drift-monitor agent,全是纯 Markdown 和 Python。审计这个将要写入你 .claude/ 文件夹的东西。这是交付一个专门负责强制约束的工具唯一诚实的方式。

然后在一个真实项目上运行 /shipwithai-starter:init,提交它,让一个队友拉取。当别人的 harness 和你的完全一样、零配置就出现了,你会感受到整个系列一直在指向的那个差异。

真正的测试:六个月后打开一个新仓库。如果你发现自己还在手工从旧项目复制 harness——工具输了。如果它已经在那里了,因为一条命令和一次提交把它放到了那里——这才是 harness engineering 最终实现了自我工程化。

我们写了八篇文章讲这套方法论。这是第九篇,也是我们停止手工实践的那一篇。

shipwithai-starter 由 ShipWithAI 团队构建和维护。我们先在自己的仓库上用它,确认没问题才推荐给你。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
AI 陪伴应用技术架构解析
下一篇
A2A 协议详解:多 Agent 通信架构与实战实现