前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9355
  • 一周内三家中国实验室开源前沿级模型
  • Stripe 超 70 亿美元收购 AI 网关 OpenRouter
  • AI 生成 SQL 的七种常见错误模式
  • GPT-5.6明知必胜却主动认输:LLM推理的隐蔽缺陷
  • 多 Agent 系统架构:生产环境的陷阱与现实
  • 神经符号引擎实战:医疗理赔自动化方案
  • AI 的致命弱点:不知道自己何时出错
  • 企业 AI 瓶颈不是模型,而是遗留架构
  • 15 万次 CI 失败日志审计揭示的真相
  • 坏Prompt正在浪费你的免费模型调用:先做PromptLint
  • AI 生成配置变更的 Receipt-First 安全预检法
  • 如何检测恶意MCP服务器:对比烟雾测试实战
  • PixelRAG:让 Claude Code 直接理解和检索带表格/图表的文档
  • 微小视觉扰动可击溃多模态 Agent 的未来预测
  • AI 编程沙盒的双重计费陷阱
  • Qwen3.8-27B 本地运行指南:17GB 指的是总内存
  • 生产 RAG 中嵌入模型漂移的隐藏风险
  • 数据库开发者为什么需要了解 MCP
  • RAG 评估实战:如何摆脱「感觉还行」的主观判断
  • 79% 的企业员工绕过 AI 治理政策
  • AI 找 bug ≠ 证明 bug 存在
  • 混合搜索实战:关键词+语义+Rerank 提升文档问答精度
  • Agent 记忆问题的本质是检索问题
  • AI Agent 数据删除管道设计实战
  • 票务分类 API 设计:语音转写与多模型摘要的最优组合
  • AI 在独立项目中自主修复跨域 iframe DOM 查询缺陷
  • 基于实时美股深度数据构建订单簿失衡信号
  • Claude 系统提示词两年增长 9 倍:生产 AI 产品团队该学什么
  • 开源工具 whodunit:用 Git/DevLake 数据量化团队 AI 采用效果
  • AI Agent 开发常见反模式:业务逻辑不应委托给 LLM
  • 构建混合搜索实战:关键词+向量+重排序完整管道
  • 多 Agent 系统调试:为什么「跑通了」不等于「对了」
  • Agentic AI与RAG根本不是一回事
  • OpenAI Codex向ChatGPT用户开放百万Token上下文
  • 代码库本身就是提示词:给AI参照已有实现比空想更有效
  • DeepTutor:港大数据科学实验室3层记忆Agent-native学习工作区
  • 用CI自动化比对Prompt变更,避免模型输出悄然退化
  • DeepSeek Harness开源自进化Agent框架,4天获12.6万星
  • 用事件总线架构拆解长链路Agent,避免单点故障蔓延
  • LLM性别偏见藏在prompt写法而非提问者身份
  • 20分钟重塑AI工作流:五步框架释放LLM潜力
  • 184个AI API成本实测:企业与初创公司差异分析
  • ChatGPT macOS隐私检查清单:Computer History安全配置
  • 美团AI变革复盘:全员养虾翻车与CatPaw落地方法论
  • Unsloth桌面版发布:单GPU运行7440亿参数模型,支持本地编码Agent
  • 同一终端双信任级别:Claude Code对接廉价代理节省API成本
  • Cursor推出自有代码托管服务
  • 测试时训练:模型边推理边学习新权重
  • Cursor Origin 仓库现已支持 Vercel 自动化部署
  • GPT-5.6 Sol在AI Gateway五折优惠一个月
  • Replit企业版大规模管控:Admin API与50+事件审计日志上线
  • 已加载 51 / 9355
8.0
热点
AI SCORE
技术实践2026-08-17 11:50

AI 找 bug ≠ 证明 bug 存在

dev.to · AI#AI编程#代码审查#测试
Editor brief · 编辑速览

AI 编程助手擅长发现可疑代码,但「发现问题」与「验证问题」是两回事;引入另一个模型同意不等于证据,代码必须跑起来才能确认。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Coding Agent 很擅长找出可疑代码。

给它一个代码仓库,它会愉快地花上一个小时追踪调用链、阅读测试、核对配置,然后给你列出一堆看起来有问题的地方。

麻烦的地方从这之后才开始。

假设 Agent 告诉我某段代码路径可能让应用程序处于非法状态。

这时候我真正知道的是什么?

我知道模型发现了某些值得检查的东西。

它可能是一个真正的 bug。也可能是在别处漏掉了某个 guard、理解错了代码的调用方式、假设了错误的配置,或者只是为一件根本不会发生的事给出了一个听起来很合理的解释。

我越来越不愿意把这两件事——发现一个可能的问题和证明问题确实存在——当作同一件工作来处理。

去问另一个模型并不是什么好答案。

如果 Claude 发现了一个 bug,另一个模型也同意 Claude 的看法,这确实有用。我可能会更早地去调查它。

但「同意」仍然不等于「证据」。

如果可能的话,我希望这个断言能经受住那些不在乎任何模型怎么想的东西的检验。

运行代码,复现行为,写一个因为被声称的原因而失败的测试,检查实际的配置。看日志,看依赖版本,看 Git 历史,看任何能直接回答这个问题的东西。

有时候这很容易。

如果 Agent 说某个函数在特定输入下会抛异常,那就用那个输入调用它。

有时候很难。架构问题和并发 bug 就是典型的例子。你可能只能验证这个断言的一部分,或者发现要复现它需要一些你无法确认的假设。

「无法验证」本身是有用的信息。

我宁愿把一个可疑的断言悬而不决,也不愿意因为一个模型听起来很自信就把它变成一个结论。

这也是我不认为静态分析和 Coding Agent 是竞争关系的原因。

当我们已经知道要找什么、并且能精确描述它的时候,静态工具非常好用。

Agent 有趣的地方在于它能注意到没人想过要写规则去捕获的东西。

这才是我想从它那里得到的。

让它去挖掘一个陌生的代码仓库,然后带着奇怪的问题回来。

然后让这些问题自己去争取进入 bug 列表的资格。

代码 Agent 能编写和检查的代码越多,这个区别就越重要。生成另外一千行代码已经非常便宜。仔细检查关于那一千行代码的某个微妙断言是否成立,则完全不是。

所以当一个 Agent 告诉我它找到了一个 bug,我想要的下一个问题不是:

「你有多自信?」

而是:

「我们怎么证明它?」

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
79% 的企业员工绕过 AI 治理政策
下一篇
混合搜索实战:关键词+语义+Rerank 提升文档问答精度