前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9369
  • 长文档JSON提取超时?先做好输入分片而非调大timeout
  • PostgreSQL pgvector混合搜索实战:向量相似度+全文关键词融合
  • 新版Claude不再需要"Think Step by Step":Osmani提示指南解读
  • CodeSmith三区架构:解决prefix drift导致Token重计费问题
  • 像读流水线一样读Transformer Block
  • Cloudflare OS:面向 AI 原生的企业工作台开源
  • AI 编程工具正在泄露凭据:Cursor、Claude Code、Copilot 和 MCP 均有风险
  • prompt-shelf:在 Claude Code 里暂存草稿、临时想法和常用 prompt
  • Agenshive:AI agent 专属 Q&A 平台,用执行验证替代投票
  • 评审容量已成交付新瓶颈:打字快不等于交付快
  • AI Agent 让 CI 成为瓶颈,加速流水线是错误解法
  • Claude Code Mods 沙箱机制深度解析
  • MCP 协议安全:Agent 工具调用的运行时攻击面
  • Node.js多LLM提供商集成实战:统一输出契约与回退策略
  • Google RRSI 方法:防止自改进 AI Agent 记忆测试任务
  • DeepSeek Harness v0.2支持Claude Code Mods兼容层
  • MCP协议深度解析:AI工具集成标准现状与局限
  • 生产级LLM Gateway四个关键设计决策
  • MCP JSON 配置优化:同步一次节省 98% Discovery Token
  • Agent 静默失败代价 2500-8000 美元:用权威系统交叉验证代替执行日志
  • Agent 静默失败导致数千美元损失:如何用外部核查机制堵漏
  • Grok Build 真实用户体验:宣传与实际的落差
  • 两个面向AI Agent的x402 API:页面质量检测与成本计算
  • AI幻觉报告泛滥,谷歌暂停开源漏洞奖励计划
  • Rust成为微软内部一级语言,与C++/C#并列
  • 生产级Agentic RAG系统实战课程
  • Claude-Mem:让AI编程工具跨会话持久记忆
  • Google Gemini 调整分层策略:免费用户只能用量最小的 Flash-Lite
  • 积分系统设计中没人会纳入预算的工程细节
  • Agenthof:用控制面让 AI Agent 的每次调用都有审计可查
  • Claude Code Mods 发布:Agent 变成可扩展平台
  • ThinkingBox:Benchmark 专门捕获 AI Agent「说完成但没做完」
  • 5 个 JSON Schema 将 AI 编程智能体的输出质量管起来
  • DeepSeek Harness v0.2 发布官方桌面客户端
  • Redis 作者新项目 DwarfStar:消费级硬件运行 DeepSeek V4
  • Chalkboard:用可视化面板追踪 AI Agent 修改过程的 Electron 工具
  • Agent PR 合并率 90% 仍可能掩盖工程工作流弱点
  • AI API 定价的隐藏成本:system prompt token 开销常被低估
  • MacBook Pro外接iPhone加速LLM推理:预填充最高提效44%
  • MCP 传输协议对比:stdio 与远程 HTTP 怎么选
  • 远程 MCP 服务器的 OAuth 2.1 认证完整指南
  • Agent报告完成但数据库未写入:分布式一致性的典型陷阱
  • Kiro Workflows:多 Agent 编排的声明式工作流框架
  • 我用AI当助产士:程序员用LLM记录分析分娩全程
  • Nocturne:可自编辑记忆的 Agent,支持遗忘策略与召回验证
  • 零依赖 Pre-commit 守卫:防止 Cursor/Claude Code 破坏整洁架构
  • Claude官方指南:如何充分释放Opus 5.5在Claude和Claude Code中的性能
  • Claude Code 接入第三方模型作子代理,省 Token 新思路
  • OpenAPI 规范一键转 MCP Server 的具体映射方法
  • 编码 Agent 权限安全:黑名单漏过 46/75 提示注入,能力边界放过 3 成
  • AI编程代理成本实测:token单价低不等于任务成本低
  • 已加载 51 / 9369
8.0
热点
AI SCORE
编程提效2026-10-04 17:27

Agent 静默失败导致数千美元损失:如何用外部核查机制堵漏

dev.to · AI#Agent#自动化#质量保障
Editor brief · 编辑速览

工作流系统报错不抛异常导致静默失败,作者设计 Matrix 方案:读取权威系统(邮箱、数据库)验证「执行日志」声称的结果是否真实,共三种判定:矛盾、确认、不确定。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

那些数字不是我的。它们来自社区里一位帮人善后的顾问。他还说了一句扎心的话:诊断时间是收不了费的,你自己扛。

这个月有三个帖子,说的是同一类问题:

一个工作流连续 28 次失败,三天后才有人去看。一个评分工作流连续六周把每条线索都打成零分。一个 Agent 跟客户说"我看到您被扣费了",实际上两次查询都返回了 403——运行状态却是 COMPLETED。

这些没有一条是红色的。这就是全部问题所在。你的错误工作流是在异常时触发的,而这些根本不抛异常。

你现在实际在为什么买单

发现时间:48 小时到 3 周。通常是客户告诉你的。诊断时间:6–15 小时翻执行记录,无法计费。事故本身的损失:$2,500–8,000。

每一次事故。按每年四次算,就是 $10,000–32,000,外加 60 小时没法收钱的工时。

Matrix 拿到运行声称的结果——"邮件已发送"、"记录已更新"——然后去读权威系统来验证是否真的发生了。不是运行自己写的执行日志,而是真正的邮箱。

三种判定:矛盾、确认、不确定。每种判定都附有证据。

三种检查中有两种不需要访问任何外部资源:

声明说调用了工具但实际上从未调用过——没有调用本身就是证据。查询返回了 403,然后运行却陈述了如果查询成功会显示什么。调用完成了,结果是被拒绝。大多数包装器会把这种情况吞掉。

第三种需要一个连接的邮箱:工具被调用了,返回了 200,但记录并不在那里。

为什么"不确定"很重要

如果 Matrix 无法证明这条追踪是完整的,或者某个工具的名字它不认识,它会拒绝判定,而不是把你的正常工作流说成骗子。在紧要关头,一个对自己的不确定性过于乐观的监控没有任何价值。

Gmail 是唯一的外部适配器。它抓不到"调用正确但参数错误"的情况——收件人格式正确但收件人错了,真正发了邮件,Gmail 也认可。而且如果某段文字从未被发送出去,里面包含的虚假声明也没有任何结果可以回头对照。

一行代码粘贴到 Cursor 或 Claude Code,它就会自己完成配置。或者手动调用四次,支持 TypeScript 或 Python。

matrixverify.dev — 免费,已有 20+ 用户,我宁愿它被人用坏也不想被人无视。

乐意拿你的一条执行记录跑一下,告诉你在里面发现了什么,包括没发现什么的情况。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Agent 静默失败代价 2500-8000 美元:用权威系统交叉验证代替执行日志
下一篇
Grok Build 真实用户体验:宣传与实际的落差