前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9473
  • OpenAI 发布数百个数学难题的解答成果
  • 29款LLM谄媚度基准测试:前沿模型稳住了,小模型全面溃败
  • Anthropic开放Claude最强版本用于安全测试:已发现10万漏洞
  • 谷歌 EmbeddingGemma 2:7.4 亿参数多模态嵌入模型,手机端 191MB 即可运行
  • 无 API 桌面应用远程控制方案:用 CDP 桥接手机与 Claude Code
  • AI功能按调用计费:多数设计在浪费预算
  • Simon Willison 点评 EmbeddingGemma 2:开源权重是嵌入模型唯一理智选择
  • Mistral Large 4预览发布:参数破万亿
  • Google发布EmbeddingGemma 2:开源多模态嵌入模型
  • Google 开源 EmbeddingGemma 2:740M 参数端侧向量模型,191MB 内存跑离线 RAG
  • 间接提示注入攻击链解析与防御架构
  • Whisper 口述转文字 WER 从 8.5% 降至 2.5% 的实战总结
  • 用 AgentCore + OpenClaw 构建持久记忆的个人 AI 助手
  • Google开源EmbeddingGemma 2:7.4亿参数多模态向量模型
  • Mistral Large 4:1.05万亿参数多模态MoE模型预览
  • Vercel AI Gateway 新增置信度触发降级策略
  • QA 工程师自建工具链:验证 AI 编程 Agent 的实际工作成果
  • 一个 MCP 服务器给 Claude Code 接入 200+ 图像视频生成模型
  • Agentic AI 需要元过滤器而非传统 Guardrails:安全架构新思路
  • 2026 开发者调查:AI 编程助手日活高但信任度低
  • GitLab AI Gateway 高危漏洞让我重新审视自建 Agent 权限控制
  • Mistral Large 4 发布:剑指闭源与开源竞品
  • Mistral Large 4:万亿参数主打安全合规
  • Stack Overflow 2026 开发者调查报告发布
  • Mistral Large 4 公开预览:1万亿参数、月底开源
  • Google Gemini 免费版大幅缩限:Flash Lite 限免,Pro/Deep Think 需付费
  • 上线 LLM 功能不死机的工程检查清单
  • AI代理能识别工具失效但仍持续调用,核心问题在于判断与行为的断裂
  • 给Claude Code开发Mod插件:实现额度用量条与项目待办面板
  • LLM 访问控制与监控的实战避坑指南
  • 企业 RAG 实战:混合搜索与重排序的核心差异
  • 日本开发者给 Claude Code 的 Awwwards 级前端 prompt
  • Reflection发布Beam:非中国最强开源模型,编程推理对标GLM
  • Codex CLI vs Claude Code:相同任务实测成本公开
  • Google Docs原生支持Markdown,AI Agent协作成亮点
  • Meta、微软要求员工少用Claude节省成本
  • DeepSeek Harness:24 万 stars 的插件化 AI 工具链
  • 如何给AI编程助手提供正确上下文
  • 12GB显卡跑125B大模型:Strata引擎开源
  • AI 指令遵循失效的深层原因:语义理解≠可靠执行
  • ML 系统上线前的设计审计五问
  • 本地 AI Agent 组织化管理:带预算与汇报链的开源框架
  • LangGraph 替代指南:六大框架实际解决的不同痛点
  • llama-server 推测解码时 logprobs 为假值
  • Reflection AI 开源 Beam:23B 活跃参数的 MoE 编程模型
  • Agent CLI 真实故障:会话消失、幽灵项目、重复条目
  • 发版日 CI 暴露绿灯测试掩盖的五大问题
  • 已加载 47 / 9473
8.0
热点
AI SCORE
编程提效2026-10-07 01:12

QA 工程师自建工具链:验证 AI 编程 Agent 的实际工作成果

dev.to · AI#AI编程#质量保障#Agent
Editor brief · 编辑速览

作者作为 QA 工程师每日使用 Devin,发现 Agent 常报"测试通过"但实际未通过,于是构建本地验证工具链读取 session 文件和工具调用状态做事实核查。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

AI 编程智能体有一项特别擅长的、但并非写代码的本事:断言。"测试通过了。""文件已更新。""修复已推送。"如果你真正用智能体做过实际工作,就会知道这些声明有时候……过于乐观了。

我是一名 QA 工程师,每天都在用 Devin。某天我厌倦了手动核对智能体的声明是否与现实相符,于是做了一个 QA 工程师该做的事:写了一套测试工具。然后是评估套件。然后是策略层。然后是决策层。二十个本地优先工具下来,整套系统跑在一台内存受限的笔记本上,没有任何遥测数据流出本机。

这是现有工具的简要说明、背后的原因以及我学到的东西。

差距所在:智能体断言,QA 验证

触发点很简单。一次智能体会话报告"已修复,全部绿灯"——而磁盘上的文件却给出了相反的答案。没有恶意;智能体是从自己的叙事出发做报告,而不是从客观事实出发。经典的 QA 问题:声明和状态是两个不同的产物,只有其中一个才是证据。

让一切成为可能的洞见:智能体 CLI 已经在本地写好了结构化的遥测数据——会话文件、工具调用状态、token 使用量。证据一直就在磁盘上。我只是需要停止相信故事,开始读取日志。

五个工具,一条流水线

工具按顺序组合:理解 → 验证 → 测量 → 控制 → 判断。

devin-internals-spec — 理解。在信任工具输出之前,你需要了解契约:文件格式、退出码以及运行时本身的行为规则。这就是规范层——下游所有内容都据此读取。

devin-qa-pack — 验证。对实际智能体工作进行 QA 审计:文件 diff 是否存在、测试是否运行过、commit 是否存在、push 是否落地、验证命令是否执行。声明对照 tool_call_state 检查,而不是对照智能体的叙事。47 个测试用例,在 Ubuntu 和 Windows 上 CI。这就是一切开始的地方。

devin-evals — 测量。一旦验证工作正常,你就可以问更难的问题:在这个类型的任务上,智能体表现如何?黄金任务、评分量规、跨会话的回归追踪。

devin-bridge — 控制。意图和执行之间的策略门控——基于 ACP 的控制,带有 --devin-only 模式,强制"此会话只做它被限定范围内的操作"。

poordjaevin — 判断。这是我最引以为傲的部分。接收任务描述,输出一个校准后的置信度分数:我应该信任这次委托吗?校准过程是个有趣的故事——判断器通过在真实会话数据上迭代改进,将 ECE 从 0.170 降到了 0.071。(ECE = 期望校准误差:当判断器说"80% 置信"时,它应该大约 80% 的时间是正确的。大多数置信度分数做不到这一点。现在我的基本做到了。)它还是一个真正的 MCP server——poordjaevin serve——所以智能体可以在飞行中咨询它。

"本地优先"实际上为你买了什么

每个工具都遵循相同的契约:读取本地智能体状态、写入本地产物、暴露稳定的 CLI、在可选基础设施缺失时优雅降级。不需要必选的守护进程、不需要 SaaS 仪表盘、不需要遥测。

devin-history — 跨会话记忆:在所有过去的会话上进行可搜索的 SQLite(7+ 条可 grep 的智能体考古命令)

devin-metrics — 遥测数据聚合,获取随时间推移的质量信号

devin-memory + devin-search + devin-graph — 记忆存储、检索,以及基于会话、项目和决策的知识图谱

devin-doctor — 跨 Windows/Linux 的环境诊断

devin-backup — 快照 + 验证 + 恢复智能体状态

devin-janitor + devin-redact — 清理和密钥删除,让状态可以安全迁移

devin-office — 有趣的那个:一个实时电路板仪表盘,从本地存储渲染真实会话、子智能体和工具调用。纯视觉、只读、零遥测——也是制作很棒演示 GIF 的素材。

构建这整套系统的三个教训

**1. 智能体自身的遥测数据是一个尚未开发的 QA 数据源。**会话文件和工具调用状态是大多数人忽略的结构化证据。读取它们能将"信任智能体"变成"验证智能体"——而验证才是让大规模委托变得安全的东西。

**2. 校准 > 置信度。**一个自信地犯错判断器比没有判断器更糟糕。ECE 的迭代(0.170 → 0.071)需要真实的标注结果,而不是调 prompt。如果你构建任何类型的 AI 决策层,请明确测量校准度。

**3. Devin-only 模式比集成更重要。**每个工具都可以独立工作,只需存在智能体 CLI 即可。Obsidian、Slack、MCP——都是可选的。生态必须在一个只有 Devin 安装的锁定企业盒子中存活下来,因为很多真实工作就是在那里发生的。

试试看 / 拆解它

所有内容均采用 MIT 许可证,跨平台,有英语和葡萄牙语(巴西)文档:

Profile/catalog: github.com/Icaro0310

Website: icaro0310.github.io

从这里开始:devin-qa-pack(验证器)或 poordjaevin(校准后的判断器——pip install poordjaevin / uv tool install poordjaevin)

留给评论区的一个真诚问题:如果你在真实工作中运行 AI 智能体——Copilot、Devin、Cursor、Claude Code——你现在如何验证它们的声明?手动抽查?CI 门控?还是什么都不做?我猜"什么都不做"是最常见的答案,而这套系统的诞生部分源于我意识到自己的答案竟然就是这个,这让我感到恐惧。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Vercel AI Gateway 新增置信度触发降级策略
下一篇
一个 MCP 服务器给 Claude Code 接入 200+ 图像视频生成模型