前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库AI Agent面试题第 2 页
面试知识索引 · 分类、标签与搜索

AI Agent面试题,511 道完整答案

AI Agent面试题第 2 页,显示第 51–100 题,共找到 511 道完整解析,可继续按分类、标签与关键词缩小范围。

511筛选结果
52技术分类
178检索标签
11索引分页
按分类建立知识面,再用标签和搜索定位问题

每页只渲染 50 道题。分类与标签分页可抓取,自由搜索结果不会制造无限 SEO 页面。

快速定位

分类、标签与关键词搜索

清除全部筛选
题库检索
技术分类52 个
全部分类5000AI Agent511浏览器301JavaScript285React281AI 开发262CSS240Node.js217TypeScript206Vue180前端工程化138React Native135
查看全部 52 个分类
操作系统135数据库134Docker95计算机网络94API 设计90Kubernetes90HTML89Redis89全栈开发88分布式系统88系统设计86HTTP85Next.js60Angular58Linux53Nuxt51PostgreSQL46可观测性46设计模式46小程序45身份与权限45无障碍44MongoDB43PWA43Web 安全43Git42前端测试42前端性能41WebAssembly40测试40AI 工程37SvelteKit37Go35前端数据管理30React Router29AI 全栈28Svelte27算法12Java10数据结构5前端手写题3
AI Agent 标签43 个
安全76工具调用63LangGraph59任务规划53Agent 记忆51MCP47MCP 协议45多 Agent45评估与调试45权限与安全43编码与执行42记忆与状态41Agent 架构40多 Agent 协作40工作流编排40
查看其余 28 个标签
浏览器与 UI 自动化40生产运行40浏览器自动化26并发编程25Prompt24测试20沙箱安全18可观测性13路由12流处理9AI 评测8HTTP8缓存7Web 可访问性6表单6容器化5异步编程5RAG4向量检索4实时通信4构建工具4离线应用3CI/CD2SQL2数据库事务2算法2动画1性能优化1
当前页02 / 11

正在显示第 51–100 题

AI Agent50
第 2 页

本页面试问题

按稳定语义路径排序

  1. 0051
    AI Agent编码与执行

    Agent 沙箱中应如何设计文件系统挂载策略,使其只能读写任务所需的目录?

    围绕“Agent 沙箱中应如何设计文件系统挂载策略,使其只能读写任务所需的目录”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确工作区可写、系统与密钥目录只读或不挂载的最小权限原则。

    核心关键词Agent 沙箱文件系统只读挂载策略
    #编码与执行#沙箱安全#安全
  2. 0052
    AI Agent编码与执行

    Agent 收到测试失败时,如何区分是自己的补丁引入了回归还是遇到了不稳定(flaky)测试?

    围绕“Agent 收到测试失败时,如何区分是自己的补丁引入了回归还是遇到了不稳定(flaky)测试”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确重跑对照、基线分支对比等归因手段。

    核心关键词Agent 区分 flaky 测试与补丁回归
    #编码与执行#测试
  3. 0053
    AI Agent编码与执行

    Agent 可能通过修改或删除测试来让套件变绿,工程上如何防止这种“应试”行为?

    围绕“Agent 可能通过修改或删除测试来让套件变绿,工程上如何防止这种“应试”行为”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确测试文件只读、覆盖率下降报警、补丁分类审查等防护手段。

    核心关键词防止 Agent 改删测试让套件变绿
    #编码与执行#测试
  4. 0054
    AI Agent编码与执行

    模型可能编造不存在的包名,Agent 安装依赖前应如何校验包的真实性与供应链安全?

    围绕“模型可能编造不存在的包名,Agent 安装依赖前应如何校验包的真实性与供应链安全”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确包名拼写抢注风险与 registry 核验、锁定哈希的手段。

    核心关键词防范模型编造包名 slopsquatting 供应链校验
    #编码与执行#安全
  5. 0055
    AI Agent编码与执行

    编码 Agent 的哪些动作必须设置人工审批门(如删文件、改 CI、装依赖),如何划分?

    围绕“编码 Agent 的哪些动作必须设置人工审批门(如删文件、改 CI、装依赖),如何划分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确按可逆性与爆炸半径划分的审批分级。

    核心关键词编码 Agent 危险动作人工审批门划分
    #编码与执行#CI/CD
  6. 0056
    AI Agent编码与执行

    编码 Agent 陷入“改—测—失败—再改”的死循环时,如何检测并打断?

    围绕“编码 Agent 陷入“改—测—失败—再改”的死循环时,如何检测并打断”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确基于编辑历史相似度与失败签名重复的循环识别。

    核心关键词检测并打断 Agent 改测失败死循环
    #编码与执行
  7. 0057
    AI Agent编码与执行

    Agent 更新依赖时,为什么必须提交锁文件变更而不是只改声明文件?

    围绕“Agent 更新依赖时,为什么必须提交锁文件变更而不是只改声明文件”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确锁文件对可复现性与审查可见性的作用及最小升级范围原则。

    核心关键词Agent 更新依赖必须提交锁文件变更
    #编码与执行
  8. 0058
    AI Agent编码与执行

    审查 Agent 生成的补丁时,如何用最小 diff 原则判断它是否夹带了不必要的重构?

    围绕“审查 Agent 生成的补丁时,如何用最小 diff 原则判断它是否夹带了不必要的重构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确识别无关重排、格式化噪音和范围蔓延的判定标准。

    核心关键词最小 diff 原则审查 Agent 补丁
    #编码与执行
  9. 0059
    AI Agent编码与执行

    在 monorepo 中,编码 Agent 如何确定一次任务的最小影响范围以避免无关改动?

    解释编码 Agent 在 monorepo 中如何通过依赖图和包边界限定最小影响范围,避免无关改动,包含场景分析、失败边界和判断方法。

    核心关键词monorepo 中 Agent 最小改动范围分析
    #编码与执行
  10. 0060
    AI Agent编码与执行

    为什么执行不可信生成代码的沙箱必须做出站网络限制,应放行哪些最小流量?

    围绕“为什么执行不可信生成代码的沙箱必须做出站网络限制,应放行哪些最小流量”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确数据外泄与供应链回传风险及白名单代理方案。

    核心关键词不可信代码沙箱出站网络限制
    #编码与执行#沙箱安全
  11. 0061
    AI Agent编码与执行

    在离线或受限网络环境中,Agent 应如何获取和安装依赖?

    围绕“在离线或受限网络环境中,Agent 应如何获取和安装依赖”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确预置镜像、私有 registry 与缓存目录三类方案及版本一致性保障。

    核心关键词离线环境 Agent 私有镜像安装依赖
    #编码与执行#缓存#离线应用
  12. 0062
    AI Agent编码与执行

    目标仓库没有任何测试时,编码 Agent 可以用哪些替代手段验证补丁正确性?

    围绕“目标仓库没有任何测试时,编码 Agent 可以用哪些替代手段验证补丁正确性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确编译通过、冒烟执行、属性断言等替代验证的置信度层级。

    核心关键词无测试仓库 Agent 补丁正确性验证手段
    #编码与执行#测试
  13. 0063
    AI Agent编码与执行

    为什么 Agent 执行环境内必须以非 root 用户运行生成代码,仅靠容器隔离为什么不够?

    围绕“为什么 Agent 执行环境内必须以非 root 用户运行生成代码,仅靠容器隔离为什么不够”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确容器内 root 与内核提权、挂载逃逸的关系。

    核心关键词Agent 沙箱非 root 运行生成代码
    #编码与执行#沙箱安全#容器化
  14. 0064
    AI Agent编码与执行

    当 Agent 生成的补丁因上下文行不匹配而无法应用时,应设计怎样的恢复流程?

    本文解释 Agent 补丁应用失败后的恢复流程:先重读文件消除过期上下文,再重新生成 diff,若仍不匹配降级到锚点编辑。给出具体场景如外部修改导致失败,以及失败边界如编辑区域大幅变动。

    核心关键词Agent 补丁应用失败的恢复流程
    #编码与执行
  15. 0065
    AI Agent编码与执行

    Agent 添加依赖时应选精确固定版本还是语义化版本区间,判断依据是什么?

    围绕“Agent 添加依赖时应选精确固定版本还是语义化版本区间,判断依据是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确应用与库两种场景下固定与区间的不同取舍。

    核心关键词依赖精确固定版本 vs semver 区间选择
    #编码与执行
  16. 0066
    AI Agent编码与执行

    把编码 Agent 拆成“规划器”和“执行器”两个角色,相比单体循环有什么实质收益与代价?

    围绕“把编码 Agent 拆成“规划器”和“执行器”两个角色,相比单体循环有什么实质收益与代价”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确职责分离对可审查性与纠错的帮助及上下文同步成本。

    核心关键词编码 Agent 规划器执行器分离架构
    #编码与执行
  17. 0067
    AI Agent编码与执行

    为什么编码 Agent 在落盘前应支持补丁的预览与干跑(dry-run)校验?

    围绕“为什么编码 Agent 在落盘前应支持补丁的预览与干跑(dry-run)校验”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确干跑能提前暴露的语法与上下文问题及其在自动审批流程中的位置。

    核心关键词Agent 补丁落盘前 dry-run 预览校验
    #编码与执行
  18. 0068
    AI Agent编码与执行

    AI 编码 Agent 面对大型仓库时,如何设计上下文检索策略而不是把整个仓库塞进提示词?

    本文解释编码 Agent 在大型仓库中基于任务相关性分层检索上下文的策略,包括符号索引、调用图、近期变更三层,并通过具体场景说明实现决策和失败边界。

    核心关键词编码 Agent 大仓库上下文检索策略
    #编码与执行#Prompt
  19. 0069
    AI Agent编码与执行

    生成代码可能死循环或疯狂分配内存,沙箱应设置哪些资源限额来防止失控?

    围绕“生成代码可能死循环或疯狂分配内存,沙箱应设置哪些资源限额来防止失控”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 CPU、内存、进程数、墙钟时间四类限额及超限后的清理动作。

    核心关键词沙箱 CPU 内存时间限额防止代码失控
    #编码与执行#沙箱安全#并发编程
  20. 0070
    AI Agent编码与执行

    执行 Agent 生成代码时,进程隔离、容器隔离与微虚拟机隔离各自防御什么风险?

    围绕“执行 Agent 生成代码时,进程隔离、容器隔离与微虚拟机隔离各自防御什么风险”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确三种隔离级别针对文件系统、网络、内核攻击面的差异。

    核心关键词Agent 代码执行沙箱 容器与 microVM 隔离
    #编码与执行#沙箱安全#安全
  21. 0071
    AI Agent编码与执行

    给 Agent 环境注入 API 密钥等机密时,如何避免机密被生成代码读取或泄漏到补丁里?

    围绕“给 Agent 环境注入 API 密钥等机密时,如何避免机密被生成代码读取或泄漏到补丁里”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确短期凭据、环境变量作用域、补丁扫描的组合防护。

    核心关键词Agent 沙箱机密注入防泄漏
    #编码与执行#沙箱安全#安全
  22. 0072
    AI Agent编码与执行

    Agent 提交补丁前做一轮自我审查应检查哪些具体项目,而不是泛泛地“再想想”?

    围绕“Agent 提交补丁前做一轮自我审查应检查哪些具体项目,而不是泛泛地“再想想””给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确可机器执行的检查项清单(测试、lint、diff 最小性、机密扫描)。

    核心关键词Agent 提交补丁前自我审查清单
    #编码与执行#测试
  23. 0073
    AI Agent编码与执行

    当 Agent 在多轮修改中持有的文件副本已被外部改动,如何检测并处理过期上下文?

    本文解释编码 Agent 如何用文件哈希检测外部改动,处理过期上下文:重读文件、丢弃旧编辑、合并冲突,并给出边界条件与失败场景。

    核心关键词编码 Agent 过期文件上下文检测与处理
    #编码与执行
  24. 0074
    AI Agent编码与执行

    限制 Agent 执行成本时,步数上限、时间上限与费用上限各自更适合控制什么风险?

    围绕“限制 Agent 执行成本时,步数上限、时间上限与费用上限各自更适合控制什么风险”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确三种限额分别针对失控循环、长尾挂起、预算超支的适用性。

    核心关键词Agent 步数时间费用上限对比与超限流程
    #编码与执行
  25. 0075
    AI Agent编码与执行

    编码 Agent 应如何把测试失败输出转化为下一轮修复的具体反馈信号?

    围绕“编码 Agent 应如何把测试失败输出转化为下一轮修复的具体反馈信号”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确失败日志的截取、结构化与定位到编辑点的闭环设计。

    核心关键词Agent 测试失败反馈驱动的修复循环
    #编码与执行#测试#可观测性
  26. 0076
    AI Agent编码与执行

    大仓库全量测试太慢时,Agent 应如何选择与本次改动相关的最小测试子集?

    围绕“大仓库全量测试太慢时,Agent 应如何选择与本次改动相关的最小测试子集”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确基于变更文件到测试映射的子集选择及漏选风险补偿。

    核心关键词Agent 依赖图选择最小相关测试子集
    #编码与执行#测试
  27. 0077
    AI Agent编码与执行

    为编码 Agent 设计文件读写、测试执行等工具的接口时,哪些 schema 设计决策直接影响可靠性?

    围绕“为编码 Agent 设计文件读写、测试执行等工具的接口时,哪些 schema 设计决策直接影响可靠性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确参数粒度、返回结构、错误码三类设计决策对模型调用成功率的影响。

    核心关键词编码 Agent 工具接口 schema 可靠性设计
    #编码与执行#测试
  28. 0078
    AI Agent编码与执行

    扫描发现间接依赖存在漏洞时,Agent 应如何判断能否安全升级并验证不破坏兼容性?

    围绕“扫描发现间接依赖存在漏洞时,Agent 应如何判断能否安全升级并验证不破坏兼容性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确间接依赖升级的约束来源与回归验证步骤。

    核心关键词Agent 间接依赖漏洞安全升级与兼容验证
    #编码与执行#安全
  29. 0079
    AI Agent编码与执行

    除了单元测试,类型检查与 lint 输出应如何纳入 Agent 的修复反馈回路?

    围绕“除了单元测试,类型检查与 lint 输出应如何纳入 Agent 的修复反馈回路”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确静态检查作为低成本快速信号的优先级排序与误报处理。

    核心关键词类型检查与 lint 纳入 Agent 修复反馈
    #编码与执行#测试
  30. 0080
    AI Agent编码与执行

    测试输出动辄数千行,Agent 应如何截取错误日志才能既保留定位信息又不爆掉上下文?

    围绕“测试输出动辄数千行,Agent 应如何截取错误日志才能既保留定位信息又不爆掉上下文”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确以失败断言和堆栈帧为中心的截断策略。

    核心关键词Agent 截取测试错误日志保留定位信息
    #编码与执行#测试#可观测性
  31. 0081
    AI Agent编码与执行

    Agent 生成补丁时,缩进、换行符和编码差异会导致哪些隐蔽的应用失败,如何防御?

    围绕“Agent 生成补丁时,缩进、换行符和编码差异会导致哪些隐蔽的应用失败,如何防御”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 CRLF/LF、Tab/空格、BOM 导致的上下文不匹配及规范化处理。

    核心关键词补丁缩进换行符编码差异导致的应用失败
    #编码与执行
  32. 0082
    AI Agent编码与执行

    让 Agent 先复现 bug 写一个失败测试再修复,这种 TDD 式流程在 Agent 场景的价值和风险是什么?

    围绕“让 Agent 先复现 bug 写一个失败测试再修复,这种 TDD 式流程在 Agent 场景的价值和风险是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确复现测试作为修复正确性判据的作用及 Agent 可能伪造测试通过的风险。

    核心关键词Agent 先写复现测试再修复的 TDD 流程
    #编码与执行#测试
  33. 0083
    AI Agent评估与调试

    如何对两个 Agent 版本做严格的对照评估

    围绕“如何对两个 Agent 版本做严格的对照评估”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明同数据集、同环境、同评估器、同步运行的控制变量要求,以及配对比较的统计处理。

    核心关键词Agent 版本对照 A/B 评估 实验设计
    #评估与调试
  34. 0084
    AI Agent评估与调试

    评估 Agent 时何时用程序化打分器、何时用 LLM 裁判

    围绕“评估 Agent 时何时用程序化打分器、何时用 LLM 裁判”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答要按输出可验证性(可执行、可精确比对 vs 开放式主观质量)划分适用边界,并指出混合使用方式。

    核心关键词程序化评估器 LLM裁判 选择 标准
    #评估与调试
  35. 0085
    AI Agent评估与调试

    除成功率外,Agent 评估为何必须包含成本与延迟维度

    围绕“除成功率外,Agent 评估为何必须包含成本与延迟维度”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明同成功率下步数、token、墙钟时间的比较方法,以及成功率-成本帕累托取舍的呈现。

    核心关键词Agent 评估 成本 延迟 指标
    #评估与调试
  36. 0086
    AI Agent评估与调试

    如何从生产轨迹数据构建 Agent 评估数据集

    围绕“如何从生产轨迹数据构建 Agent 评估数据集”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明筛选代表性轨迹、脱敏、补标注判据、入数据集版本的流程。

    核心关键词Agent 生产轨迹 评估数据集 LangSmith
    #评估与调试#构建工具
  37. 0087
    AI Agent评估与调试

    针对 Agent 的输入边界(空输入、超长上下文、对抗指令)应设计哪些评估用例

    围绕“针对 Agent 的输入边界(空输入、超长上下文、对抗指令)应设计哪些评估用例”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答要按输入类别说明各自检验的失败模式(拒答、截断丢信息、指令注入)。

    核心关键词Agent 边界输入 对抗指令 评估用例
    #评估与调试#安全
  38. 0088
    AI Agent评估与调试

    涉及外部工具与数据库的 Agent,如何固化环境使评估可复现

    围绕“涉及外部工具与数据库的 Agent,如何固化环境使评估可复现”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明录制回放工具响应、固定数据快照、沙箱重置三种手段及各自代价。

    核心关键词Agent 环境快照 可复现 mock 工具
    #评估与调试#沙箱安全
  39. 0089
    AI Agent评估与调试

    Agent 轨迹中早期小错误如何放大为任务失败,评估时如何定位首个错误点

    围绕“Agent 轨迹中早期小错误如何放大为任务失败,评估时如何定位首个错误点”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明逐步骤对照状态预期、找到首个偏离点而非只看最终失败的方法。

    核心关键词Agent 错误传播 轨迹 首个错误定位
    #评估与调试
  40. 0090
    AI Agent评估与调试

    如何为 Agent 失败建立错误分类体系并做归因统计

    围绕“如何为 Agent 失败建立错误分类体系并做归因统计”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出按规划、检索、工具、推理、终止条件分桶的体系及各类占比如何指导修复优先级。

    核心关键词Agent 失败分类 错误归因 评估
    #评估与调试
  41. 0091
    AI Agent评估与调试

    开发 AI Agent 前,为什么要先定义成功标准和评估样本?

    用具体任务契约和最小评估样本约束 Agent 开发,说明初始状态、验收证据、正反例、基线和保留测试集如何帮助判断方案是否真正改进。

    核心关键词AI Agent 开发前定义成功标准与评估集
    #评估与调试#测试
  42. 0092
    AI Agent评估与调试

    如何把 Agent 评估接入 CI 阻止质量回退

    围绕“如何把 Agent 评估接入 CI 阻止质量回退”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明门禁指标选择、 flaky 用例处理、评估耗时分层(冒烟/全量)的设计。

    核心关键词Agent 评估 CI 质量门禁 回归
    #评估与调试#CI/CD
  43. 0093
    AI Agent评估与调试

    如何防止 Agent 针对评估指标投机(Goodhart 定律)

    围绕“如何防止 Agent 针对评估指标投机(Goodhart 定律)”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出多指标并看、保留人工抽检、定期更换评估用例三类对策及指标被优化的识别信号。

    核心关键词Agent 评估 指标投机 Goodhart
    #评估与调试
  44. 0094
    AI Agent评估与调试

    Agent 评估集要多少样本才能让结论可信

    围绕“Agent 评估集要多少样本才能让结论可信”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明方差大时需要更大样本、用重复运行与置信区间判断差异是否显著,而非固定数字。

    核心关键词Agent 评估集 样本量 统计置信
    #评估与调试
  45. 0095
    AI Agent评估与调试

    Agent 评估中结果时而过时而不过的用例(flaky)应如何处置

    围绕“Agent 评估中结果时而过时而不过的用例(flaky)应如何处置”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分真非确定性与环境不稳定,给出重复运行定级、隔离环境根因、暂不阻塞但追踪的处置策略。

    核心关键词Agent 评估 flaky 用例 处理
    #评估与调试
  46. 0096
    AI Agent评估与调试

    为 Agent 评估做人工标注时,标注规范应包含什么

    围绕“为 Agent 评估做人工标注时,标注规范应包含什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出判据示例、边界案例裁定、标注者间一致性检验三项内容。

    核心关键词Agent 人工标注 标注规范 评估
    #评估与调试
  47. 0097
    AI Agent评估与调试

    如何评估与检测 Agent 的循环调用与不收敛问题

    围绕“如何评估与检测 Agent 的循环调用与不收敛问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出重复状态检测、步数与成本上限、无进展判据三类信号。

    核心关键词Agent 死循环 不收敛 检测 评估
    #评估与调试
  48. 0098
    AI Agent评估与调试

    如何验证 LLM 裁判与人工评审的一致性

    围绕“如何验证 LLM 裁判与人工评审的一致性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出抽样人工标注、计算一致率或相关系数、迭代裁判提示词的流程。

    核心关键词LLM 裁判 人工一致性 校准
    #评估与调试#Prompt
  49. 0099
    AI Agent评估与调试

    LLM 裁判的位置偏差是什么,评估 Agent 多方案比较时如何消除

    围绕“LLM 裁判的位置偏差是什么,评估 Agent 多方案比较时如何消除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明交换顺序复评、匿名化选项等对照手段。

    核心关键词LLM 裁判 位置偏差 缓解
    #评估与调试
  50. 0100
    AI Agent评估与调试

    用与被评 Agent 同家族的模型做裁判会带来什么偏差

    围绕“用与被评 Agent 同家族的模型做裁判会带来什么偏差”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明同源模型裁判倾向给同源输出更高分的现象,以及用独立裁判或人工抽检校准的对策。

    核心关键词LLM 裁判 自我偏好偏差 self-preference
    #评估与调试
上一页
1234…11
下一页
前端进阶之旅本地 Markdown 维护 · 服务端分页 · 完整内容对用户与搜索引擎一致