前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8336
  • 生产环境 LLM 推理性能与可靠性优化实战
  • 多 AI 协作必须设计交接机制而非仅靠上下文
  • deepseek-harness 体验:22 万星的开源 AI 插件框架
  • Cognition 发布 SWE-2:低成本对标 Fable 5.1 的代码模型
  • 边缘 AI 部署:LLM 优化最佳实践
  • 边缘设备 LLM 扩展:完整技术指南
  • VS Code 1.137:AI 自动化、语音模式与 GitHub 深度集成
  • Real-SWE:基于私有企业代码库的 AI 模型基准测试
  • OpenResearch:本地优先的多 Agent 研究工作台
  • Check:给 Claude Code 加幻觉防护层
  • Postman 集合一键转为 MCP 工具:实操路径
  • NestJS 测试覆盖提升与安全加固实战
  • Next.js Serverless 下 PDFKit 字体缺失修复
  • 评测编码Agent前,先用同一组任务跑两遍
  • LLM Wiki:文档自动构建可维护知识库的开源桌面应用
  • 深入解析结构化输出:让 AI 生成绝对可解析的 JSON
  • MCP安全核心是权限体系重设计,而非传统边界防护
  • GPT-6 Astra 在机器人基准测试中展现空间推理飞跃
  • Auterix:零依赖通用协议,跨 21 个 AI 工具统一上下文规范
  • 后量子 TLS 是平台迁移工程,不是密码学研究
  • Anthropic 发布 AI-Native SDLC 实践手册:代码不再是瓶颈
  • OpenAI 建议 GPT-6 Astra 提示词应精简,减少安全限制
  • Claude Code 创始人:AI 编程要守住代码质量标准
  • Hyperresearch:Agent 驱动的研究知识库,单次跑 250+ 信源
  • 12 个已落地的 B2B 营收 AI Agent 用例,附代码
  • LLM 项目上线后才会暴露的 6 个隐蔽 Bug
  • OpenAI 代理向 RubyGems 上传两千恶意包
  • AI 时代缓存失效难题复发:LLM 推理的隐性成本
  • Google发布TimesFM-3:单次前向传播即可完成多步时间序列预测
  • 阿里 Qoder CLI 开放自定义模型接入
  • 开源项目 Minitap 指控谷歌盗用代码用于 Artemis,许可证违规引热议
  • GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学能力达新里程碑
  • Kimi K2.8发布:性能逼近K3百万上下文全员开放
  • DeepSeek v4.1-Flash发布:763B参数新型因果编解码架构
  • AI Agent 何时该停:成本控制的核心工程问题
  • 三大AI编程工具实战对比:Claude Code六个月生产级使用报告
  • Trail of Bits开源Coop:用隔离VM安全运行Claude Code和Codex
  • OpenAI代理今年5月攻击RubyGems详情披露
  • Google Tunix:TPU上的自主LLM后训练框架
  • GitLab CVE-2026-85706:CVSS 10.0 路径遍历漏洞正被主动利用
  • RAG 检索失效的根源:分块策略正在毁掉你的 AI 应用
  • CPython 字节码缓存导致测试失效的隐藏bug
  • OpenAI代理攻击RubyGems:技术细节与行业反思
  • Anthropic 内部调查:七成公司无法衡量 AI 工具实际回报
  • OpenRouter 隐性陷阱:同一端点行为不一致
  • 字节Seed研究:LLM自建测试harness泛化性堪忧,仅34%有效
  • GitHub Copilot支持查看VS Code Agents使用量指标
  • OpenAI正式开放Agents API:日烧7千美元研发现已公测
  • Anthropic 为 Claude Code 推出插件评测工作流,含 6 种评分器与无插件基准线
  • 一招配置:让 Claude Code、Cursor、Cline 等主流 AI 编程工具共用同一个国产模型端点
  • 我用 Claude Code 搭 AI 团队,抓到它给自己打高分
  • 已加载 51 / 8336
8.0
热点
AI SCORE
编程提效2026-09-12 22:00

Anthropic 发布 AI-Native SDLC 实践手册:代码不再是瓶颈

The New Stack#Anthropic#AI编程#Agent
Editor brief · 编辑速览

Anthropic 公开 AI 原生软件生命周期指南,核心主张是「代码不再是瓶颈」,并给出 Agent 驱动开发的具体流程。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Anthropic 前不久发布了《AI-Native SDLC Playbook》。其核心论点是“代码不再是瓶颈”——当 Agent 能在几分钟内完成一个实现时,约束就转移到了构建阶段之外的一切:规划、审查、验证、部署和治理。

风险在于,如果组织做错了这件事,产出的变更数量会是原来的十倍,但每次变更的质量不变甚至更差,而且没有办法识别哪些变更是糟糕的。传统答案是由人来逐个审视,而这种方式在如此规模下恰恰会失效。

风险在于,产出的变更数量会是原来的十倍,但每次变更的质量不变甚至更差,而且没有办法识别哪些变更是糟糕的。

这份 Playbook 的基础是正确的。它没有捕捉到的是,一个组织的流程是有细微差别的:它实际上是一族流程,会随变更的性质而变化,而不是每条变更都走同一条路径。

Playbook 是更广泛的 spec 驱动开发工具浪潮的一部分,亚马逊的 Kiro 和 GitHub 的 Spec Kit 也属此类。这些工具有一个共同的形态。书面制品驱动工作:一份 intent 文档变成 spec、计划、diff 和审查结果,所有内容都提交到版本控制中。策略通过钩子等确定性机制来强制执行,而不是靠在 prompt 里写指令。Agent 在人看到之前检查自己的工作。人拥有审批权。

但这些工具每一种也都规定了一个特定的流程:一个固定的阶段序列,产生固定的制品,每条变更都要经历这个过程。采纳这个工具就意味着采纳它的流程。

没有任何一个真实组织会运行单一流程。某一变更该用哪种流程,取决于它携带的风险和所需的问责程度。一处文档修复、一个依赖升级和一笔支付服务中的 Schema 迁移,不应该走同一条路径。它们需要不同级别的验证、不同的审批人、不同的记录。在受监管领域,流程本身就是合规义务的一部分:审计员期望看到每条变更由谁批准、以什么证据为依据的记录。需要记录的内容因变更类型而异。

当一个工具规定了一种流程,团队就会为不适合的变更绕开它——这是最糟糕的结果,因为真正的流程变得不可见了。

当一个工具规定了一种流程,团队就会为不适合的变更绕开它——这是最糟糕的结果,因为真正的流程变得不可见了。又或者供应商不断添加配置,直到工具变成了一套没人能完全理解的工作流引擎。

工具不应该规定一种流程。它应该给组织提供一种定义自己流程的方式。

更好的模型是将每个流程定义为一个状态机。状态是关于变更的事实:已审查、已针对依赖验证、已获批上线生产。这些事实存在于没有一个单独工具拥有的系统中:仓库、CI、集群、追踪器。因此流程不能是一个执行步骤的程序,而是一组对那些系统的观察做出反应的规则。每条规则指定:

  • 它在触发前需要的事实。
  • 它的门控:自动触发,或等待一个人批准。
  • 触发时授予的权限,如合并或部署的权限。

定义就是这组规则,存储为数据并像代码一样审查。一个组织运行多台小型机器,每台对应一个风险类别。

在运行时,这个模型的行为完全不像工作流引擎。没有组件追踪“我们现在在第四步”:流程在某一事实出现在拥有它的系统中时前进,规则对此做出反应。迟到、重复或重启后到达的事件,处理方式与其他任何事件无异,因为规则只对当前状态做出反应。门控是规则的条件之一,因此你可以在事件期间或发布冻结期间暂停触发,而无需修改任何定义。

门控需要 enforcement。以 prompt 指令实现的门控依赖于模型遵循它。Agent harness 可以提供运行状态机并强制执行其门控所需的确定性,在动作之间停止 Agent 直到门控得到答复,而基础设施负责强制执行其余部分。

仓库的单一固定流程定义是不够的:该仓库中的每条变更仍然会走同一条路径,无论其风险如何。变更走的路径应该取决于变更本身是什么,而这种路由来自对变更的分类,而不是由作者选择路径。组织使用已有的信号来定义分类:变更触及的路径、它所在的仓库、追踪 issue 上的标签等。

定义本身也需要随时间变化,而这必须安全。因为流程定义是数据,编辑它本身就是一次变更,它要走自己的门控流程。放宽发布流程上的一个审批门控,其审查方式与 Schema 迁移相同,而不是像编辑配置文件那样随意。

点击放大图片。

Click to enlarge graphic.

具体来说,看同一服务的三个变更:

文档修复由它触及的路径来分类。它的流程只有两个状态:构建通过,以及合并。没有人参与。

依赖升级跳过设计审查,但它的流程需要兼容性证据:升级后的服务针对真实依赖运行集成测试。大版本升级比小版本补丁多一个审批。

支付服务中的 Schema 迁移由它触及的组件来分类,无论它声称是什么类型的变更。它的流程添加了其他变更永远不会见到的状态:支付负责人审查、针对生产形态数据的验证,以及该领域负责人的发布批准。

每条路径中的每个转换,都记录了谁批准了以及以什么证据为依据。

这些流程应遵循的原则:

自主权按动作授予,并随时间增长。每个转换可以设为自动触发、需要批准或暂停。随着 Agent 在某一类变更上证明了自己,该设置会放宽,流程因此吸收了 Agent 的改进而无需重新设计。

人的注意力只花在需要判断的地方。Agent 的成本越来越低;监督工时不会。一条变更只有在决策需要人类判断时才会进入人的循环,并且会给出能快速做决定的上下文。

证据来自 Agent 外部。Agent 自己的报告永远不能让变更前进。转换基于 Agent 无法写入的系统中的事实来触发,如测试结果和在真实环境中的验证。

流程记录就是审计追踪。定义就是书面策略,转换日志显示谁批准了每一步、以什么证据、在哪个版本的策略下。

Playbook 及其同类在基础上是正确的。缺失的是组织定义自己的流程、根据每条变更的风险让流程有所不同、以及安全地演进流程的能力。目标不是减少循环中的人。而是把人类的判断力只花在真正需要它的地方,由 Agent 无法为自己生成的证据所支撑,这样质量才能在吞吐量倍增的同时保持住。

我们正在 Signadot 构建这些想法,并拿自己做实验,让我们的开发过程也跑在这套流程上。如果你也在实验这些想法,我们很乐意交流!

Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
后量子 TLS 是平台迁移工程,不是密码学研究
下一篇
OpenAI 建议 GPT-6 Astra 提示词应精简,减少安全限制