前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9686
  • AI重命名漏掉字符串引用的隐蔽故障
  • 两万余市场实测:Jev 不敌市场价格
  • 让自主 Agent 可追踪、可恢复、可计费
  • TwinBench 用成对题检验 Agent 规则执行
  • 原子写入为何守不住模型重试次数
  • 三智能体论文审查检出七成核心论断错误
  • 给多Agent加上预算限制与人工审批
  • AgentSec 用对抗测试排查智能体安全漏洞
  • 美团如何用统一模型承接外卖多业务精排
  • Safari 空白页如何卡住 MCP 权限校验
  • 会议录音应用的说话人识别与检索踩坑
  • 给 AI 产品文档加一道事实校验关
  • 防止 Agent 靠修改测试制造假通过
  • 故意破坏代码,揭穿回归检查的假绿灯
  • 模型版本变了,评测分差就不能直接比较
  • JetBrains 版 Copilot 增强模型与 MCP 管理
  • 点选界面元素,把修改需求送到对应 Agent
  • 跨公司 Agent 协商,用代码落实数据契约
  • 代码送入远程模型前先做数据分级
  • 把 Agent 权限约束落实到执行层
  • 用生产轨迹与精选数据改进智能体
  • 模型评测暴露环境破坏与联网绕限制行为
  • 微软Decision-1主攻低延迟分类与路由
  • 腾讯元器停服,智能体业务需限期迁移
  • Anthropic暂停全部内部评测联网
  • 工业机器人如何从示范与现场纠错中学习
  • 模型单价相同,任务成本仍可差近一倍
  • 测 LLM 接口延迟,别只报平均数
  • 用 TypeScript 拦住格式正确的错误数据
  • 微软在 Foundry 推出 Qwen 决策模型
  • DigUp 在 Mac 本地检索文件与代码
  • 大模型故障切换也要守住能力边界
  • 弱网下如何保住大模型流式响应
  • Claude测试越权后,联网权限被撤回
  • 用 CI 硬约束控制 AI 代码膨胀
  • Agent 上线前,先验证工具权限边界
  • steadysdk 降低接口客户端再生成风险
  • 生产 Agent 的权限不能照搬人类账号
  • 递归生成可验证的终端 Agent 难题
  • 用缺陷风险排序分配代码审查预算
  • 用真实几何验证模型修复代码的能力
  • 用 Hooks 强制执行 AI 编码质量检查
  • TeamAI 用 Git 同步团队 Agent 配置
  • 为编码助手补充 SwiftUI 开发规范
  • LiteLLM 统一多家模型接口与调用治理
  • 20 个编程智能体并行,构建缓存成关键
  • 按用途配置 AI 爬虫访问规则
  • TFD-Bench 用多轮测试反馈评估编程智能体
  • Clef-omni用单次调用完成多模态决策
  • 让AI先复现故障,再用证据定位根因
  • 微软推出面向Agent控制的概率评分模型
  • 已加载 51 / 9686
8.0
热点
AI SCORE
技术实践2026-10-11 00:00

用生产轨迹与精选数据改进智能体

The New Stack#Agent#生产反馈#质量改进
Editor brief · 编辑速览

文章讨论如何连接生产运行轨迹与经过筛选的数据,将线上反馈用于改进智能体回答。重点是服务上线后如何持续提升输出质量。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

很高兴你来到这里。周一至周五,TNS 的优质内容会送达你的邮箱,帮助你紧跟新闻动态,在工作中保持领先。

请查看收件箱中的确认邮件,你可以在其中调整订阅偏好,还可以加入其他群组。

在你常用的社交平台上关注 TNS。

在 LinkedIn 上关注 TNS。

等待第一封 TNS newsletter 送达时,可以先看看最新的精选文章和热门报道。

你的 Agent 已经上线,服务运行正常。但它的回答有没有变得更好?将生产环境中的 traces、经过整理的数据和评估连接起来,团队就能发现失败案例、选择改进方案,并在下一个版本交到用户手里之前,证明它确实有效。

首次部署仍然是一个里程碑。但接下来,棘手的问题才真正开始:如何让输出持续准确,让客户满意?成本会有多高?经过几轮迭代,团队花在维护工具和协调交接上的时间,可能比改进应用本身还多。

找出团队之间的断点

想一想,当训练模型的 AI 工程师把模型交给应用团队或站点可靠性工程(SRE)团队时,会发生什么。工程师知道什么样的结果才算“好”,生产团队则负责正在运行的服务。从这一刻起,他们可能就开始查看不同的系统。

应用的 traces 进入了一个以服务可用性为目标构建的 dashboard。值班工程师看到服务运行正常,研究团队却几乎无法了解回答质量或用户感受。随着用户行为变化,评估套件逐渐偏离实际需求,却没有人负责更新。到了准备下一个版本的时候,研究人员、AI 工程师和业务负责人又各自回到不同的 dashboard。

值班工程师看到服务运行正常,研究团队却几乎无法了解回答质量或用户感受。

首先要问:谁能把生产环境中的失败转化为评估案例?谁负责让这个案例持续反映当前情况?如果答案需要在团队之间复制上下文,那交接过程中丢失信息的地方就找到了。

连接改进流程的五个阶段

AI 的改进闭环遵循一个熟悉的循环:运行模型或 Agent,观察其行为,将信号整理成数据,改进系统,评估结果,然后重复。每个阶段都需要向下一阶段传递足够的上下文,让接手的团队能够采取行动。

运行。 根据工作负载选择模型和 Agent harness,也就是围绕模型运行的代码和工具。记录部署后调查行为时所需的信号。

观察。 不要只关注可用性。记录 traces、指标、工具使用情况和行为反馈,以便检查 Agent 的决策,找出一次运行在哪里出了问题。

整理。 将生产环境中的实例转化为有用的数据集,并更新评估套件。保留人工审核环节,也要保留数据血缘,说明每个实例来自哪里。

一个版本发布时,应该展示具体改进了什么,而不是依赖几个看起来不错的回答。

改进。 根据失败原因选择相应的改动。你可以调整 harness、更换模型,或者通过强化学习(RL)、监督微调或模型蒸馏来优化行为。明确你期望在质量、延迟或成本上取得什么结果。

评估。 在部署前、部署期间和部署后,依据可重复执行的标准比较候选版本。一个版本发布时,应该展示具体改进了什么,而不是依赖几个看起来不错的回答。

让记录跟着工作走

这些交接问题塑造了我们设计 CoreWeave Forge 的思路。我们上周在 Fully Connected 2026 大会上发布了它。我们的设计目标,是在同一个开发环境中连接运行、观察、整理、改进和评估。MasterClass 和 Canva 已经开始使用 Forge,完成自己的 AI 闭环。

判断一个互联开发环境是否有用,可以看它能否让你从一次部署追溯到对应的模型版本、评估、数据集和生产实例。CoreWeave Registry 管理模型、Agent 和数据集;Weights & Biases Models 跟踪实验、超参数搜索、分析和自动化工作流。这些记录结合起来,可以帮助团队理解发生了哪些变化,以及这些变化是否改善了结果。

在观察环节,CoreWeave Agent Lens 会追踪执行步骤、决策和工具调用,并提供对话视图及技术细节。Monitors 在人工监督和数据整理的配合下,对线上流量进行评分。我们的发布文章称,Agent Lens 将失败检测能力提升了 20%,并将问题修复成本降至一半;团队应结合自己的工作负载评估这些结果。

CoreWeave Notebooks 提供托管的 Python notebooks,用于共享评估和自定义分析。CoreWeave ARIA 会分析运行记录、提出实验方案,并推荐存储在 GitHub 中的代码改动。它与 Weights & Biases Models 的集成,支持根据检测到的信号开展 autoresearch。应将评估证据与任何拟议改动放在一起,让团队能够判断结果。

CoreWeave Sandboxes 为 Agent、工具调用、RL 和评估提供隔离的中央处理器(CPU)或图形处理器(GPU)环境。CoreWeave ARIA 和 CoreWeave Sandboxes 已正式可用;Agent Lens、Notebooks,以及处于预览阶段、属于 CoreWeave Training 的 Model Distillation,都是 CoreWeave Forge 的新增功能。

选择工作负载需要的改进方式

Post-Training 利用生产环境中的信号改善模型质量、延迟和成本,无需训练集群。Serverless SFT(监督微调)和 Serverless RL(强化学习)让团队可以尝试自己的训练方案。

对于已经在生产环境中验证过的任务,Model Distillation 会使用较大模型的输出,训练一个更小的 open-weights 模型。随后,它会让候选模型与当前使用的模型进行直接对比评分。这种比较能为是否切换流量提供依据。只有满足任务要求,更小的模型才有价值。

将推理纳入闭环

每个阶段都依赖推理,但不同工作负载需要不同程度的控制。CoreWeave Inference 提供 Serverless Inference,用于访问 open-weights 模型;也提供 Dedicated Inference,让工作负载运行在隔离的基础设施上。

使用 Serverless Inference 时,基础设施由 CoreWeave 管理。使用 Dedicated Inference 时,团队可以控制模型权重、部署设置和 GPU 资源。应根据工作负载的要求进行选择;随着要求变化,团队可以在这两种方式之间迁移。

Cline 在 Serverless Inference 中使用开源模型,为其开源、支持自由选择模型的编程 Agent 提供服务。我们的发布文章称,这款 Agent 已获得超过 1,100 万开发者的信赖。Grammarly 使用 Dedicated Inference,明确选择 GPU,并采用完全托管的运维服务。

RL 又增加了一项要求。策略生成 rollouts,也就是体现其行为的实例;训练产生更新后的权重,这些权重随后回到推理服务中,供下一轮使用。checkpoint 加载缓慢,会拖慢整个循环。

我们在 Dedicated Inference 中新增的 RL rollouts 功能,以 NVIDIA Dynamo 为基础,能够以极短的停机时间热加载更新后的 checkpoints。我们与 NVIDIA 及 you.com 的工程团队合作,在 NeMo gym 中使用 RL Rollouts,结合 you.com 的网页搜索应用程序编程接口(API),对 NVIDIA Nemotron 3.5 Lightning 进行后训练。我们的发布文章称,与基线相比,模型重新加载的延迟改善了 15 倍。

让闭环接入你现有的技术栈

改进闭环需要接入你已经使用的可观测性平台、数据仓库和安全技术栈。CoreWeave Partner Network 涵盖基础设施、数据服务、独立软件供应商(ISVs),以及模型和推理,其解决方案都在 CoreWeave 上经过了生产条件下的测试。

这也包括 Agent 调用的工具。Exa、Parallel Web Systems 和 You.com 通过一次集成提供实时网页搜索层。搜索让 Agent 能够访问训练数据之外的信息;你仍然需要观察和评估它的工具调用,以及由此生成的回答。

我们构建 CoreWeave Forge,是为了服务那些将工作负载运行在 CoreWeave Cloud、其他云平台和私有数据中心的团队。改进所用的数据保持可迁移,各阶段之间采用开放接口,因此,无论在哪里运行,整理好的数据集和评估套件都能继续发挥作用。

从一个生产失败案例开始

挑选一个团队已经理解的失败案例。沿着 trace、整理后的实例、拟议修复、评估和部署一路追踪。记录上下文在哪里丢失、责任归属在哪里不清晰。这能为连接整个闭环提供一个具体的起点。

为了测试这套工作流,CoreWeave Forge 提供为期 30 天的 Pro 免费试用,并附带可用于各产品线的额度。如果你希望直接获得 CoreWeave 专家和基础设施的支持,验证生产工作负载,可以尝试 CoreWeave ARENA。目标是让每次部署都为下一轮开发提供输入,并用证据证明下一个版本比上一个更好。

Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
把 Agent 权限约束落实到执行层
下一篇
模型评测暴露环境破坏与联网绕限制行为