前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8649
  • Agent失控:OpenAI与Anthropic的沙箱逃逸事件
  • AI推理强大不代表适合工作流:架构决策的反思
  • Pipe语言:将AI操作设计为一等公民的新范式
  • MCP 错误通道设计缺陷导致成本倍增的诊断
  • 手动重新输入 LLM 代码能有效规避认知债务
  • 让 Prompt 质量衰退无处遁形:evalgate CI 工具
  • Agent 架构设计:IP 变化下的寻址方案
  • AI API 已弃用陷阱与稳定性应对
  • 树莓派 NAT 环境下 Agent 的远程访问架构
  • AI 搜索优化框架:审计 360 站点的四层模型
  • 多租户 AI 聊天系统的架构演进:硬编码到 BYOK
  • AI 模型网关融资热背后的多模型架构趋势
  • AI agents为达目标会撒谎和欺骗——安全风险深度分析
  • 单 API 密钥多模型网关
  • 阿里千问3.8-Max:2.4万亿参数MoE模型发布
  • 语义缓存:40 行代码省半费用
  • AI Agent 安全防护:模型窃取与密钥泄露风险
  • 代码库 AI 检索的性能边界:向量 vs 图谱实测
  • 企业级 AI Agent 的真实成本:从演示到生产
  • 8月AI模型周榜:千问3.8-Max跻身前五,国产模型齐头并进
  • Agent 验证陷阱:200 状态码掩盖的错误答案
  • PNG渲染黑化六次修复:测量优于猜测
  • 长期运行AI Agent的上下文债务问题
  • 2025年AI Agent五大趋势:端侧与协作新范式
  • 用 LangGraph 打造个人 AI 智能助手:文件搜索工程实践
  • LLM推理冷启动问题深度解读
  • Cogent VR-1:企业安全推理模型正式发布
  • AI Agent平台选型:购买vs自研决策框架
  • 多Agent自主编程流水线:SideButton Portal
  • AI时代开发瓶颈转移:从编码到审查
  • GPT-Live低延迟语音AI系统:六月从零到一
  • Agent本地化浪潮——三个改变部署形态的项目
  • Mistral 7B推理成本降400倍:$4/月VPS完整部署方案
  • LobeChat 开源项目深度评测:多模型支持和部署方案
  • MCP 和 Skills 架构对比:AI Agent 集成最佳实践
  • 深度调试案例:五层根本原因分析一个神秘 Bug
  • MCP Agent 生产化:Docker + Kubernetes + 可观测性完整方案
  • AI 代理开发如何改变程序员工作流:从编码转向审查
  • Kimi K3 发布:百万 token 长上下文与强编程能力
  • 开源自媒体工具链:跨 10+ 平台内容发布全自动化
  • Qwen3.8-Max:2.4T参数如何改变开发工具选择
  • IBM 报告:AI 攻击占数据泄露 1/4,防御需加速漏洞修复
  • LLM 总成本对比:自托管 Llama vs 云 API 真实成本
  • AI 编码助手的设计系统赋能:从通用到专业
  • 网络爬虫工程实战:反爬虫对抗的完整方案
  • Rust 高性能 AI 代码审查工具:系统编程最佳实践
  • Ops Agent 的安全漏洞:提示注入即远程代码执行
  • 80% 降价反而成本上升:AI 账单的 Jevons 悖论
  • Google Gemini Robotics 2发布,人形机器人控制API开放
  • Qwen3.8-27B仅需17GB显存运行验证
  • 通义千问 3.8-Max 模型通过 OpenAI 兼容 API 可用
  • 已加载 51 / 8649
8.0
热点
AI SCORE
技术实践2026-08-03 16:02

Agent 验证陷阱:200 状态码掩盖的错误答案

dev.to · AI#Agent#可观测性#质量保证
Editor brief · 编辑速览

揭示 agent 可观测性的盲点:日志和 evals 无法验证运行时答案正确性;通过实验证明约束检查将准确率从 69% 提升至 100%。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Agent 返回了 200 OK,但答案真的对吗?

我构建 agentic AI 系统已经有一段时间了,最让我忍不住写点东西的是:我们整个技术栈在告诉我们 agent 做了什么上非常出色,但在告诉我们它是否做对了这一点上几乎毫无用处。

可观测性工具会给你追踪信息——每次 tool 调用和每个 token,这对于在出问题后弄清楚发生了什么非常有帮助。Evals 会根据你过去某个时刻运行的测试集给你一个分数。但在生产环境中,在那一刻,当你的 agent 返回一个自信满满、格式良好、符合 schema 的 200 响应时,整个流程中没有任何东西在检查这个响应内部的答案是否实际正确。一个 200 可能包裹着一个自信但错误的答案,而你的仪表板仍然会闪起绿灯。

我做了个小实验来看这到底有多糟。我拿了一个便宜的、弱小的模型,让它处理一个真实的结构化任务,而我能够检查答案。它的正确率约为 69%,但看起来正确的频率要高得多。然后我给每个输出包装了一个有根据的检查,询问它是否真正满足约束条件,而不仅仅是看起来满足,之后重新运行那些失败的。正确率爬升到了 100%。我一直在琢磨的部分是,模型从未变得更聪明,验证做了所有的工作。

所以我一直回归到的观点是,一致性不等于正确性。一个 schema 有效、流畅、记录良好的答案仍然可能完全错误,而现代 agent 栈中几乎没有什么东西能够在它发生时注意到这一点。

我一直在思考运行时认证层会是什么样子——一个位于"记录了 200"和"通过了我们的离线 evals"之间的东西,回答一个似乎没人在问的问题:这个特定的输出,就在现在,实际上是否正确?

如果你在生产环境中运行 agent,我真的很想知道你是如何处理这个问题的,或者你是否大多只是学会了与绿灯仪表板相处。


Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
8月AI模型周榜:千问3.8-Max跻身前五,国产模型齐头并进
下一篇
PNG渲染黑化六次修复:测量优于猜测