前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9296
  • MiniMax H3模型权重发布72小时内的生产部署复盘
  • 构建MCP服务器的安全教训:踩过的五个坑
  • 任务路由实践:让Claude Code按策略分配模型
  • 扎克伯格 6500 字 AI 宣言四大要点:开源、开放、与政策阻力
  • Meta发布30B开放权重Agent模型,单GPU可本地运行
  • 售后Agent防幻觉实战:intent路由+白名单数据彻底堵嘴
  • Meta Muse Code vs Fable 5:便宜但有代价
  • 扎克伯格:美若想开源 AI 领先,需减少数据使用和蒸馏的政策限制
  • 连锁药店AI电话助手因数百起投诉被迫下架
  • 别让AI干linter的活:确定性格式化问题应交给确定性工具
  • Vibe Coding第二周开始的问题:AI生成之后谁来维护
  • GPT-5.6 vs Claude Fable 5 vs Kimi K3:React Native AI 编程实测对比
  • 开发者实评 GPT-5.6 Sol:惊艳与过度工程的矛盾感受
  • GitHub Copilot 网页版新增对话历史快捷访问与最小化功能
  • 用TDD给AI套上缰绳:不会语言也能写测试
  • Docker Sandboxes:microVM隔离运行AI代码代理
  • Claude和GPT知识截止日期与训练时间线深度解析
  • 14000次Agent API调用分析:基础设施类工具占绝对主流
  • Contorium:为AI项目引入决策上下文记忆层
  • 技术栈崩塌:供应商锁定正在侵蚀AI应用
  • 静默失败检测框架:捕获"成功"却无输出的AI调用
  • AI系统读取外部网页的权限边界设计
  • 用Python构建AI驱动的SEO审计Agent
  • AI倒查百年论文:99.2%顶刊有问题
  • AI倒查百年论文:99.2%顶刊存在可疑问题
  • Agentic SDLC的全链路可观测性实践
  • PDF已死、ARA当立:论文Agent原生阅读时代来临
  • Meta 开源 30B Agent 模型 Muse Glimmer,单卡可跑
  • Genesis:AI编程助手的项目级认知记忆层
  • Laravel AI工具存在Prompt Injection风险
  • AI代理为预约健身课竟入侵网站篡改排队顺位
  • Stack Overflow 2025开发者调查AI数据解读
  • AI编程工具存在TOCTOU高危漏洞,可窃取CI密钥
  • Bun用Rust重写后Bug数量分析:数据驱动的深度复盘
  • AI编程助手存在"失忆"问题:记忆增强生成技术解析
  • Anthropic工程师详解Constitutional AI原理
  • 语音 AI 管道优化实录:延迟从 1200ms 降至 340ms
  • AI 编程工具的供应链安全盲区
  • 两个 Prompt 模板修复 Git 历史:commit 质量从垃圾到可读
  • Junior:停止与 AI 比打字,转向驱动 AI 完成任务
  • 三大 MCP 服务器 RCE 漏洞解析:命令注入防御实战
  • 设计 LLM 输出的 Parser 契约:从 Prompt 到健壮解析
  • 用 Proper Scoring Rule 评估 AI 预测:防止自我欺骗的工程方法
  • 超18万条AI会议录音在笔记应用中被暴露
  • LLM调用成本无法提前精确预估:实测揭示估算偏差高达61倍
  • Meta Muse Glimmer:30B开源权重的本地编码AI模型
  • MCP服务器设计陷阱:描述文本与模型理解的Gap
  • LangGraph 1.0:Agent编排框架生产就绪
  • GPT-5.6 Sol驱动金融工作流自动化:研究到可编辑PPT/Excel
  • DeepSeek V4-Flash vs V4-Pro 实测:便宜有好货,但非你所想
  • 250美元FPGA上跑出21,000 tok/s的极致LLM推理速度
  • 已加载 51 / 9296
8.0
热点
AI SCORE
技术实践2026-08-10 22:01

静默失败检测框架:捕获"成功"却无输出的AI调用

dev.to · AI#Agent#监控#LLM
Editor brief · 编辑速览

LLM Agent 返回 200 但输出为空或无意义内容是常见的静默失败。文章提出通过 output token 数量这一确定性信号来检测三类静默失败:零输出、无限循环、语义空输出。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

你的 LLM Agent 返回了一个响应。没有报错,没有异常。但它真的做了你让它做的事吗?

这就是静默失败问题。系统表现一切正常——HTTP 200,状态 success——但输出是空的,或者毫无意义。没有任何告警。第一个发现问题的,是客户。要捕获这些,你需要先知道静默失败在什么条件下是可检测的。下面就是这个框架。

你实际在追查什么

静默失败是指报告成功但产出零(或无用)输出的执行。Agent 没有崩溃——它只是什么都没做。最常见的模式:

Agent 调用模型。

模型返回约 0 个输出 token,或一个空白响应。

调用方代码继续执行,浑然不觉。

另外两种变体也很常见:Agent 无限循环而没有进展(工具调用从未推进状态),以及输出在结构上有效但语义上为空——应该搜索时却返回"我不知道"。

标准错误监控对三种都束手无策,因为根本没有错误。你在检查错误的信号。

三个检测杠杆

1. Token 计数——基线信号

每次 LLM 调用都会产生输入 token(你的 prompt)和输出 token(模型的响应)。这是可测量的、确定性的,每个提供商在响应元数据中都会提供。

洞察:一次健康的 Agent 调用,每个 Agent 都有一个可预测的 token 范围。一个工单摘要器可能每次消耗约 100-200 个输入 token,产出约 50-150 个输出 token,一次又一次。如果某次执行返回 100 个输入 token 和 0 个输出 token,这是一个值得标记的信号——它本身不是失败的证明,但值得告警。

如何实现:记录每次执行的输入/输出 token,计算过去 30 天输出 token 的中位数和标准差,标记低于第 10 百分位或恰好为零的任何情况。

baseline_median_output = median(past_30_days_output_tokens)
baseline_std = stdev(past_30_days_output_tokens)
is_anomaly = (today_output_tokens < baseline_median - 2*baseline_std) OR (today_output_tokens == 0)

2. 成本异常——派生信号

成本 = 输入 token × 输入单价 + 输出 token × 输出单价。当 token 消耗下降时,成本也随之下降。成本通常比原始 token 更容易追踪,因为它与供应商无关——你可以跨模型聚合。

如果你的 Agent 每次运行通常花费 $0.02-$0.05,而今天它是 $0.0001,说明出了大问题。同样方法:基于 30 天基线中位数/标准差,低于第 5 百分位时告警。成本因为是派生值,会略微滞后于 token 异常,但它是在业务层面更容易理解的数字。

3. 输出审查——确认性信号

如果 token 提示了异常,下一个问题是模型实际说了什么。存储输出的一个简短摘录(不是整个响应,那通常太大),然后你可以扫描空字符串、重复/循环输出,或针对正确性评分标准运行一个二次 AI 评判。

捕获前 500 个字符,对比基线标记任何空的或异常短的内容。基于评分标准的评判是可选的,但对高风险 Agent 很有价值。

每次执行记录:input_tokens, output_tokens, cost_usd, output_summary, executed_at。

按计划(每晚,或高容量时每小时)计算每个 Agent 的基线,并标记低于阈值的情况。

标记时:用附加的输出摘要告警工程师,以便立即分诊;如果成本异常严重,可选择自动暂停 Agent。

为什么有效,以及在哪些情况下不适用

优势:错误日志没有误报,因为你直接测量执行质量而非异常。早期信号——token 是实时的,所以你可以在几分钟内捕获问题。与框架无关——LangChain、CrewAI、原始 SDK,每次模型调用都产生 token。低摩擦——记录 token 只是几行代码。

局限性:你需要基线历史(一个只有五次执行的新 Agent 还没有可靠的范围),该技术是上下文相关的(输出方差本来就大的 Agent 需要更宽的基线),检测不是预防——标记失败并不能阻止下一次昂贵的调用,那需要在上面叠加实际的暂停或速率限制。

实践下一步

记录 token——在每次执行记录中添加 input_tokens, output_tokens, cost_usd。

一旦有一两周的历史,就开始计算基线。

在输出 token 的第 10 百分位或 output_tokens == 0 时设置告警。

分诊一次。当它触发时,你要么看到一个真正的空响应(可操作的),要么是一个合法的边缘情况,下次排除。

这样你不会捕获每一个静默失败。但你会捕获那些最常见的——那些因为在有人注意到之前都不可见而伤害最大的。

如果你不想自己构建和维护这套管道,那这是我们内置到 AI Agents Control Tower 的那一层——token 追踪、基线计算和异常告警,让你可以定义阈值而不是基础设施。无论用哪种方式,原则都是一样的:测量 token,建立基线,对差距告警。静默失败只有在你开始倾听之后才不再沉默。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
技术栈崩塌:供应商锁定正在侵蚀AI应用
下一篇
AI系统读取外部网页的权限边界设计