前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9467
  • GitLab AI Gateway 高危漏洞让我重新审视自建 Agent 权限控制
  • Mistral Large 4 发布:剑指闭源与开源竞品
  • Mistral Large 4:万亿参数主打安全合规
  • Stack Overflow 2026 开发者调查报告发布
  • Mistral Large 4 公开预览:1万亿参数、月底开源
  • Google Gemini 免费版大幅缩限:Flash Lite 限免,Pro/Deep Think 需付费
  • 上线 LLM 功能不死机的工程检查清单
  • AI代理能识别工具失效但仍持续调用,核心问题在于判断与行为的断裂
  • 给Claude Code开发Mod插件:实现额度用量条与项目待办面板
  • LLM 访问控制与监控的实战避坑指南
  • 企业 RAG 实战:混合搜索与重排序的核心差异
  • 日本开发者给 Claude Code 的 Awwwards 级前端 prompt
  • Reflection发布Beam:非中国最强开源模型,编程推理对标GLM
  • Codex CLI vs Claude Code:相同任务实测成本公开
  • Google Docs原生支持Markdown,AI Agent协作成亮点
  • Meta、微软要求员工少用Claude节省成本
  • DeepSeek Harness:24 万 stars 的插件化 AI 工具链
  • 如何给AI编程助手提供正确上下文
  • 12GB显卡跑125B大模型:Strata引擎开源
  • AI 指令遵循失效的深层原因:语义理解≠可靠执行
  • ML 系统上线前的设计审计五问
  • 本地 AI Agent 组织化管理:带预算与汇报链的开源框架
  • LangGraph 替代指南:六大框架实际解决的不同痛点
  • llama-server 推测解码时 logprobs 为假值
  • Reflection AI 开源 Beam:23B 活跃参数的 MoE 编程模型
  • Agent CLI 真实故障:会话消失、幽灵项目、重复条目
  • 发版日 CI 暴露绿灯测试掩盖的五大问题
  • 退款重复处理:分布式事件幂等性实战分析
  • Vercel如何用AI自动化Inbound流程
  • Anthropic推出云端Cowork:AI推理全上云,本地只做文件访问
  • 自建 SearXNG 为 LLM Agent 省钱:缓存 + 限流 + 引文校验
  • GLM 5.3 登陆 Amazon Bedrock:753B 编程专家模型
  • 前端后端错误追踪关联实战:用 trace_id 串联浏览器异常与 API 失败
  • LoreConvo:为 AI 编程工具注入会话记忆,告别每次从零开始
  • DevFest 演讲实录:如何客观评估 AI 辅助开发体验
  • Together Link:一条命令让Claude Code用上Kimi K3、GLM 5.3等开源模型
  • PewDiePie用OpenAI数据微调本地模型反被封号
  • MCP协议存在Agent间恶意Prompt传播风险
  • 某MCP服务器启动前消耗18000 tokens:问题与解决方案
  • Reflection AI开源501B MoE模型Beam,专攻代码生成
  • Google展示生产级AI数据层实战:语义搜索+RAG+AlloyDB集成
  • Reflection AI发布Beam:主打企业AI工厂概念
  • Meta和微软削减Claude预算,转向自研AI工具
  • 笔记本即可运行的 AI 安全检测,效果逼近 350 亿参数模型
  • Reka 发布 Rho-1:统一处理文本/图像/视频/机器人控制的 19B 多模态模型
  • OpenAI在欧盟对ChatGPT和Codex启用文本水印
  • OpenAI文本水印欧盟强制落地,全球API用户可自主选择
  • Claude Code 登陆 AWS GovCloud,支持受监管工作负载
  • AWS SageMaker 为编程 Agent 上线 AI 推理优化技能
  • 团队引入 Agentic Coding 的实战方法论
  • 团队引入 Agentic Coding 的实战方法论
  • 已加载 51 / 9467
8.0
热点
AI SCORE
技术实践2026-10-06 13:45

ML 系统上线前的设计审计五问

dev.to · AI#机器学习#工程实践#数据质量
Editor brief · 编辑速览

19 年经验总结:训练数据溯源、泄露检测、分布漂移等五个必问问题,附具体检查方法。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

大多数 ML 失败并非模型本身的失败,而是设计上的失败——而且只要知道往哪里看,几乎总能在上线前被发现。

没人检查过的训练-服务偏差。评估集与生产环境不符。反馈循环会悄悄污染下一次重训练。成本和延迟预算没人记录。我见过这些因素毁掉过拥有完美模型的系统。在 19+ 年的软件交付和 AI 研究评审经验后,我现在对每个 ML 设计都进行同样的五道关卡审查后才让它上线。下面就是这套流程。

Gate 1:数据——溯源、泄漏、漂移

问三个问题。每个训练样本从何而来,你能证明吗?未来信息或测试集中的信息有没有可能泄漏到训练中?当真实世界偏离训练分布时会发生什么?

这里典型的杀手是评估泄漏:那个"准确率 99%"的分类器在上线第一天就失效了,因为评估集是从训练数据中意外抽取的。这种事发生得比任何人承认的都多。要把书面数据溯源声明和泄漏检查作为合并(merge)前置条件,而不是可选项。

Gate 2:评估——指标是否匹配任务?

模型可以在指标上拿到高分,却仍然无法完成它的工作。当生产决策对不同方向的错误有不同的成本时,离线准确率毫无意义——一个针对准确率优化的欺诈模型,在欺诈罕见时会乐意批准所有交易。

对于每个模型,写下:模型实际驱动什么决策,每种方向的错误成本是多少,我们的评估集是否像生产流量?如果答案模糊,设计就没准备好。

Gate 3:运营——延迟、成本、降级

直到第一个用户投诉,才有人记录延迟预算。直到第一张云账单,才有人计算预测成本。对于每个模型,记录:p95 延迟预算、预期容量下每 1,000 次预测的成本,以及模型宕机或太慢时会发生什么。"页面崩了"不是降级策略——缓存最后一次好的预测、降级到更简单的模型,或者明确地快速失败。

对于 Agentic 系统,这个关卡重要 10 倍:每个不必要的工具调用都在燃烧 token 并膨胀每个下游上下文窗口。成本纪律始于调用纪律。

Gate 4:安全——对抗性输入与访问控制

谁能向这个模型输入内容,他们能让它做什么?覆盖基础项:输入验证、速率限制、模型端点及其训练数据的访问控制。对于 LLM 支持的系统,添加 prompt 注入审查——把 Agent 可以调用的每个工具视为一种特权,按特权的方式限制其作用域。我把 Agent 建模为 IAM 主体:唯一身份、最小权限角色、会话范围的凭证。

Gate 5:问责制——谁对决策负责?

当模型出错时——它会的——谁负责,修复路径是什么?每个生产 ML 系统都需要指定负责人、回滚计划,以及对已知故障模式的书面策略。"模型决定的"不是问责结构。

把这五个关卡转化为团队在设计评审时填写的一页纸:

Data: provenance documented? leakage check passed? drift monitors planned?

Evaluation: metric matches the mission? eval set production-representative?

Operations: latency budget, cost per prediction, fallback behavior defined?

Security: inputs validated? access scoped? agent tools least-privilege?

Accountability: named owner? rollback plan? known failure modes written down?

任何空白答案都阻止上线。这只需要一小时,但能捕获那些在复盘中总被描述为"事后看来显而易见"的失败。

Karmendra Pandey 是 TEKsystems AI & ML 部门的 Practice Architect。他在 AWS 上构建生产代理 AI 系统,并在 PREreview 上对 AI 研究进行同行评审。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
AI 指令遵循失效的深层原因:语义理解≠可靠执行
下一篇
本地 AI Agent 组织化管理:带预算与汇报链的开源框架