前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • MCP Nexus 1.0:MCP工具路由与发现层,一个端点代理数百工具
  • MCP网关安全:AI Agent生产部署的鉴权与限流实战
  • GitHub安全实验室:AI驱动的模糊测试实战
  • Meta Muse 被曝可被诱导泄露全文件系统
  • Black Forest Labs 发布开源机器人控制模型
  • Google Cloud API Gateway原生支持MCP协议
  • 3 万次 AI Agent 调用审计:可验证收据机制实践
  • 用 AgentCore Gateway 和 MCP 构建跨账号 AI Agent 架构
  • AI 性能成本每年下降 13 倍,超越所有前代技术
  • Lovable年化收入超6000万美元,vibe coding进入主流
  • Agent失败的根本原因:从未定义"完成"的标准
  • Agent补丁审查策略:second process重放验证才能合并
  • 我用 Claude Code 九天给 47 个服务接入 OpenTelemetry 链路追踪
  • Google Gemini CLI新增文件修改确认机制
  • DeepSeek推理优化:内核补齐+通信重构,吞吐翻7倍
  • Hugging Face推出LFM2.5-VL-DSpark视觉语言模型加速方案
  • 管理 15 万 AI Agent 对数据库团队的挑战与变革
  • Cursor 收购 Firetiger 后一月推出代码变更生产追踪 Bot
  • OpenAI AI Agent 自主入侵澳大利亚政府网站
  • Claude Code 实际项目开发全流程复盘
  • Google Cloud Developer 插件让 AI 编码助手直连云端部署
  • OpenAI Agent 入侵澳大利亚 Medicare 统计门户
  • Google DeepMind负责人透露Gemini 4即将发布
  • Impeccable:AI 编程代理的确定性设计语言框架
  • AI Agent 生产环境失败启示录:构建攻击性测试
  • 金融合规监控系统的工程实践:数据管道、Agent 架构与审计日志
  • 2026 年十大 LLM 网关横评:语义缓存与多提供商故障转移
  • codebase-memory-mcp:毫秒级代码知识图谱MCP服务器,158语言支持
  • Strands Agents:开源AI Agent开发框架,支持Python/TS全生命周期管理
  • 2026年9大开源LLM网关生产级对比:Bifrost领先
  • 用 TigerGraph+MCP 构建自主欺诈调查 Agent
  • Jev 决策模型真实成本拆解:何时省钱何时烧钱
  • 开源CLM-8B:Agent动作评分比Jev快9倍
  • JEV:打破布尔二值困境的类型安全验证方案
  • Claude Opus 5.5降价40%逼近前沿性能
  • VS Code 1.139:Agent 会话首次加载提速约 12 倍
  • 定时 Agent 总重复干活?用完成分类账让它知道什么是「做完」
  • TypeSafe AI Jev 编码指南:类型化决策、置信度校准与推测式广播
  • Vercel Connect 新增 TanStack AI 集成
  • Anthropic与OpenAI 90分钟内相继降价
  • 选LLM API的六个价格陷阱
  • 已加载 41 / 8836
8.0
热点
AI SCORE
编程提效2026-09-24 22:39

Agent失败的根本原因:从未定义"完成"的标准

dev.to · AI#Agent#Prompt工程#AI编程
Editor brief · 编辑速览

作者以DN42扫描事件和代码库探索事故为例,指出给Agent下达无终止条件的任务是根本病因——"有趣"、"扫描DN42"这类指令是方向而非任务,真正的修复不是成本上限而是给Agent明确终止条件。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

DN42 的故事——让代理扫描一个网络,结果操作员收到一张付不起的账单——一直被包装成一个关于成本失控的警示故事。那篇 writeup 值得一读,但我觉得常见的结论是错的。成本只是症状,真正的病因是没有人定义过什么叫"完成"。

"Scan DN42." 这不是一个任务,这是一条指令。任务需要有终止条件:"扫描 DN42 并报告这五台主机上所有开放的端口"才是一个任务。"扫描 DN42" 是一个没有终态的研究项目,而代理做了它唯一能做的事——它继续前进,因为指令里没有任何内容告诉它停下来。它不是贪婪,它没有坏掉,它只是忠实于一个没有出口的规格说明。

我也犯过完全一样的错误。我告诉代理"探索代码库,找到任何有趣的东西"。它找到了东西。然后它找到了更多东西。然后它开始重构它认为"有趣"的东西。我回来时看到一个修改了四十个文件的 diff,还有一条消息说"我注意到了一些模式"。代理没有错。错的是我以为"有趣"是一个有边界的概念。它不是。它是一个感觉词,而感觉不会终止。

解决办法不是设一个费用上限——虽然你应该设一个,上次我也说过。解决办法是在写 prompt 之前先写清楚成功标准。完成是什么样子的?你期望的产出是什么?什么样的答案会让你说"好的,这就是答案,现在停下来"?如果你不能用一句话回答这个问题,那你没有任务,你只有一个愿望。而愿望的代价就是账单。

这是代理工程里没人愿意做的那部分工作,因为太无聊了。写 prompt 有趣,看模型做出聪明的事很有趣。坐下来写"当代理已经生成了包含五个目标主机开放端口的列表,每条附带一行注释,且没有触碰其他任何东西时,任务才算完成"——这不有趣,这是真正的工作。

一个让人不舒服的事实是:大多数人们描述的"代理"任务根本不是任务。"研究这个市场"、"寻找潜在客户"、"监控系统"。这些是方向。它们没有自然的停止点,而模型不会自己发明一个,因为发明一个就意味着违抗你。获取终止条件的唯一方法是提供它。

所以在你把任何任务交给代理之前,先问自己:什么是最小的产出物能让我满意?如果答案是"我看到就知道了",那你还没准备好运行代理。你只是准备好跑出一张账单。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Lovable年化收入超6000万美元,vibe coding进入主流
下一篇
Agent补丁审查策略:second process重放验证才能合并