前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库AI 开发 · 模型与应用评测面试题
面试知识索引 · 分类、标签与搜索

AI 开发 · 模型与应用评测面试题,36 道完整答案

AI 开发 · 模型与应用评测面试题第 1 页,显示第 1–36 题,共找到 36 道完整解析,可继续按分类、标签与关键词缩小范围。

36筛选结果
52技术分类
178检索标签
1索引分页
按分类建立知识面,再用标签和搜索定位问题

每页只渲染 50 道题。分类与标签分页可抓取,自由搜索结果不会制造无限 SEO 页面。

快速定位

分类、标签与关键词搜索

清除全部筛选
题库检索
技术分类52 个
全部分类5000AI 开发262AI Agent511浏览器301JavaScript285React281CSS240Node.js217TypeScript206Vue180前端工程化138React Native135
查看全部 52 个分类
操作系统135数据库134Docker95计算机网络94API 设计90Kubernetes90HTML89Redis89全栈开发88分布式系统88系统设计86HTTP85Next.js60Angular58Linux53Nuxt51PostgreSQL46可观测性46设计模式46小程序45身份与权限45无障碍44MongoDB43PWA43Web 安全43Git42前端测试42前端性能41WebAssembly40测试40AI 工程37SvelteKit37Go35前端数据管理30React Router29AI 全栈28Svelte27算法12Java10数据结构5前端手写题3
AI 开发 标签25 个
全部标签模型与应用评测36向量检索59向量与嵌入47RAG41知识库数据37AI 评测36RAG 检索31微调与数据31大模型基础29Prompt28提示与上下文设计27多模态应用24安全11离线应用11测试9
查看其余 10 个标签
性能优化5可观测性4构建工具4缓存4工具调用3Agent 记忆2容器化1数据库事务1流处理1路由1
当前页01 / 1

正在显示第 1–36 题

AI 开发36
第 1 页

本页面试问题

按稳定语义路径排序

  1. 0001
    AI 开发模型与应用评测

    新 UI 或新助手上线首周效果应先跑 A/A 或延长观察来区分新奇效应吗?

    围绕“新 UI 或新助手上线首周效果应先跑 A/A 或延长观察来区分新奇效应吗”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用 A/A 校验埋点和分配系统,并用分层首访/回访时间曲线判断效应是否衰减。

    核心关键词A/A测试 新奇效应 首因效应 在线实验
    #模型与应用评测#AI 评测#测试
  2. 0002
    AI 开发模型与应用评测

    LLM 功能灰度 A/B 实验的主指标和护栏指标应怎样在实验前冻结?

    围绕“LLM 功能灰度 A/B 实验的主指标和护栏指标应怎样在实验前冻结”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分北极星效果、延迟成本安全等护栏,并预设停止规则,防止事后挑指标。

    核心关键词A/B实验 主指标 护栏指标 LLM灰度
    #模型与应用评测#AI 评测
  3. 0003
    AI 开发模型与应用评测

    标注预算有限时主动学习的不确定性采样应在什么时候停止?

    围绕“标注预算有限时主动学习的不确定性采样应在什么时候停止”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用验证集边际收益、类别覆盖和剩余风险决定停止,而非固定轮数。

    核心关键词主动学习 不确定性采样 标注预算 停止条件
    #模型与应用评测#AI 评测
  4. 0004
    AI 开发模型与应用评测

    越狱鲁棒性评测与常规准确率评测应放在同一个离线分数里吗?

    围绕“越狱鲁棒性评测与常规准确率评测应放在同一个离线分数里吗”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须主张分开报告攻击成功率、误伤率和功能保持率,避免安全加固被平均指标抵消。

    核心关键词越狱鲁棒性 对抗评测 准确率 离线边界
    #模型与应用评测#AI 评测#离线应用
  5. 0005
    AI 开发模型与应用评测

    Agent 工具调用任务离线评测应记录哪些轨迹字段才能复盘失败原因?

    围绕“Agent 工具调用任务离线评测应记录哪些轨迹字段才能复盘失败原因”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须包括计划、工具参数、返回观察、重试与终止状态,并区分最终成败与过程合规。

    核心关键词Agent评测 工具调用 轨迹记录 失败诊断
    #模型与应用评测#工具调用#AI 评测
  6. 0006
    AI 开发模型与应用评测

    上线前怎样用标注指南和 Cohen/Fleiss kappa 判断标签定义是否足够清楚?

    围绕“上线前怎样用标注指南和 Cohen/Fleiss kappa 判断标签定义是否足够清楚”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须把低 kappa 归因到类别定义、边界样本或标注者训练,并说明是否继续放量标注。

    核心关键词标注指南 Cohen kappa Fleiss kappa 标注一致性
    #模型与应用评测#AI 评测
  7. 0007
    AI 开发模型与应用评测

    摘要生成离线评测为什么不能只凭 BLEU 或 ROUGE 判定上线?

    本题解析 BLEU/ROUGE 在摘要评测中的本质局限,说明其对同义改写、事实错误和流畅性的盲区,并给出与人工侧写互补的最小设计。

    核心关键词BLEU ROUGE 生成评测 人工相关性 局限性
    #模型与应用评测#AI 评测#离线应用
  8. 0008
    AI 开发模型与应用评测

    风控概率输出部署前为什么既要看区分度也要看 Brier 分数和校准曲线?

    本问题讨论风险概率输出为何不能只看排序指标;区分度与校准是两个维度。通过Brier分数和校准曲线发现概率绝对值系统偏移,对定价和限额的影响;并给出具体工程场景和边界条件。

    核心关键词概率校准 Brier分数 reliability曲线 风控模型评估
    #模型与应用评测#AI 评测
  9. 0009
    AI 开发模型与应用评测

    怎样把混淆矩阵转换成可比较不同模型的期望误分类成本?

    本题解释混淆矩阵如何通过乘以误分类成本转换为期望成本,并考虑类别先验变化进行重加权,用于模型比较,强调成本不对称性和先验调整。

    核心关键词混淆矩阵 期望成本 误分类代价 模型评估
    #模型与应用评测#AI 评测
  10. 0010
    AI 开发模型与应用评测

    团队评测算力有限时怎样设计分层 CI:快速 smoke、夜间全量和人工抽检?

    围绕“团队评测算力有限时怎样设计分层 CI:快速 smoke、夜间全量和人工抽检”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答要按变更风险路由到不同评测层级,并说明全量集抽样刷新与人工抽检比例。

    核心关键词评测预算 CI分层 smoke test 人工抽检
    #模型与应用评测#AI 评测#路由
  11. 0011
    AI 开发模型与应用评测

    招聘筛选模型中 demographic parity 与 equal opportunity 冲突时应怎样向业务解释?

    围绕“招聘筛选模型中 demographic parity 与 equal opportunity 冲突时应怎样向业务解释”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明群体通过率平等与合格组召回平等通常不可兼得,并落到受保护属性、基准率和决策后果。

    核心关键词公平性 demographic parity equal opportunity 评测解释
    #模型与应用评测#AI 评测
  12. 0012
    AI 开发模型与应用评测

    特征工程阶段怎样识别“用了未来才知道的信息”导致的标签泄漏?

    围绕“特征工程阶段怎样识别“用了未来才知道的信息”导致的标签泄漏”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用特征可得时间、快照表和因果链审查特征,并区分合法滞后特征与结算后字段。

    核心关键词特征泄漏 未来信息 标签泄漏 point-in-time
    #模型与应用评测#AI 评测
  13. 0013
    AI 开发模型与应用评测

    为什么公开开发集之外还要保留隐藏测试集来评估 prompt 或模型版本?

    围绕“为什么公开开发集之外还要保留隐藏测试集来评估 prompt 或模型版本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释反复看同一套样例导致的评测过拟合,并给出可见/隐藏集合的更新纪律。

    核心关键词金标集 隐藏测试集 过拟合防护 prompt迭代
    #模型与应用评测#Prompt#AI 评测
  14. 0014
    AI 开发模型与应用评测

    开放问答的事实性评测应如何把“未回答”与“编造答案”分开计分?

    围绕“开放问答的事实性评测应如何把“未回答”与“编造答案”分开计分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须拆分支持证据充足性、答案可验证性和 abstention 成本,避免高拒答率拿高分。

    核心关键词事实性评测 幻觉 拒答计分 开放问答
    #模型与应用评测#AI 评测
  15. 0015
    AI 开发模型与应用评测

    类别不均衡的文本分类为什么常同时报宏平均 F1 和微平均 F1?

    围绕“类别不均衡的文本分类为什么常同时报宏平均 F1 和微平均 F1”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明少数类是否会被样本量多数类淹没,并说明宏/微平均各自对应的业务损失。

    核心关键词类别不均衡 宏平均F1 微平均F1 评测指标
    #模型与应用评测#AI 评测
  16. 0016
    AI 开发模型与应用评测

    排序系统在线评估中 interleaving 相比全量 A/B 何时更灵敏,何时不可用?

    围绕“排序系统在线评估中 interleaving 相比全量 A/B 何时更灵敏,何时不可用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明同次展示混合两模型可降低用户方差,但受位置展示和不可混合约束限制。

    核心关键词interleaving 排序实验 在线评估 敏感性对比
    #模型与应用评测#AI 评测
  17. 0017
    AI 开发模型与应用评测

    多语言助手评测为什么要按语言和资源水平分层,而不是只报混合准确率?

    围绕“多语言助手评测为什么要按语言和资源水平分层,而不是只报混合准确率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须识别高资源语言占比拉高总分,并给低资源语言最低可接受门槛。

    核心关键词多语言评测 低资源偏差 语言分层 公平性
    #模型与应用评测#AI 评测
  18. 0018
    AI 开发模型与应用评测

    每天盯实验结果并在显著时提前停会怎样放大假阳性,应如何控制?

    围绕“每天盯实验结果并在显著时提前停会怎样放大假阳性,应如何控制”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明重复窥视使名义 p 值失效,并采用预设 horizon、alpha spending 或始终有效区间。

    核心关键词多重比较 序贯检验 假阳性 控制策略
    #模型与应用评测#AI 评测
  19. 0019
    AI 开发模型与应用评测

    模型替换只要求不差于旧系统时应如何设定非劣效界值而不是追求显著更优?

    围绕“模型替换只要求不差于旧系统时应如何设定非劣效界值而不是追求显著更优”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须由可接受业务退化定 delta,并报告单侧置信区间是否越界。

    核心关键词非劣效实验 等效性检验 margin 设定
    #模型与应用评测#AI 评测
  20. 0020
    AI 开发模型与应用评测

    离线评测集怎样证明覆盖了线上真实流量而不是只覆盖好标注的样本?

    围绕“离线评测集怎样证明覆盖了线上真实流量而不是只覆盖好标注的样本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较来源、意图、长度、语言、难度切片与线上日志,并说明重加权是否改变主结论。

    核心关键词离线评测集 代表性 流量分布 覆盖偏差
    #模型与应用评测#AI 评测#离线应用
  21. 0021
    AI 开发模型与应用评测

    离线人工评分更高但线上留存下降时,应按什么顺序诊断指标错位?

    围绕“离线人工评分更高但线上留存下降时,应按什么顺序诊断指标错位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须依次查样本分布、judge 与真实效用差异、延迟成本、交互入口变化和护栏退化。

    核心关键词离线在线不一致 指标错位 诊断流程
    #模型与应用评测#AI 评测#离线应用
  22. 0022
    AI 开发模型与应用评测

    多模型偏好投票为什么用 Bradley-Terry/Elo 聚合而不是直接数胜率?

    围绕“多模型偏好投票为什么用 Bradley-Terry/Elo 聚合而不是直接数胜率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明传递性、对手强度不同和置信区间对排名稳定性的影响。

    核心关键词成对偏好 Bradley-Terry Elo 模型排行 评测聚合
    #模型与应用评测#AI 评测
  23. 0023
    AI 开发模型与应用评测

    罕见事件检测为什么优先看 PR-AUC 而不是 ROC-AUC?

    本题说明ROC在极度不平衡下因负例基数过大导致FPR失真,用具体欺诈场景对比两种曲线差异,并指出PR-AUC的局限:依赖正例患病率,不可跨数据集比较,适合在离线选型时优先参考。

    核心关键词PR-AUC ROC-AUC 罕见事件 评测指标对比
    #模型与应用评测#AI 评测#离线应用
  24. 0024
    AI 开发模型与应用评测

    在欺诈拦截里怎样用精确率、召回率和单次误伤成本决定分类阈值?

    围绕“在欺诈拦截里怎样用精确率、召回率和单次误伤成本决定分类阈值”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出以期望损失最小化定阈值的方法,并区分阈值优化与模型排序能力。

    核心关键词精确率 召回率 成本敏感 分类阈值 欺诈检测
    #模型与应用评测#AI 评测
  25. 0025
    AI 开发模型与应用评测

    程序化弱监督标签进入训练前需要估计哪些噪声参数?

    围绕“程序化弱监督标签进入训练前需要估计哪些噪声参数”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须估计各标注源的覆盖率、准确率、相关性和极性冲突,并决定是否只用于训练不用于测试。

    核心关键词弱监督 程序化标注 标签噪声 评测参数估计
    #模型与应用评测#AI 评测#测试
  26. 0026
    AI 开发模型与应用评测

    同一语义指令改写成不同 prompt 后输出波动很大,离线评测应怎样量化鲁棒性?

    围绕“同一语义指令改写成不同 prompt 后输出波动很大,离线评测应怎样量化鲁棒性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用语义保持改写集报告均值、最差组和方差,而不是只报单 prompt 分数。

    核心关键词prompt敏感性 扰动鲁棒性 语义保持改写 评测
    #模型与应用评测#Prompt#AI 评测
  27. 0027
    AI 开发模型与应用评测

    RAG 评测为什么要分别报告上下文命中率、引用忠实度和最终答案正确率?

    围绕“RAG 评测为什么要分别报告上下文命中率、引用忠实度和最终答案正确率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须定位失败在检索召回、引用支撑还是生成推理三段之一,并说明端到端分数不可单独诊断。

    核心关键词RAG评测 context precision faithfulness 答案正确率
    #模型与应用评测#RAG#AI 评测
  28. 0028
    AI 开发模型与应用评测

    用户之间会互相影响的推荐实验为什么不能按请求随机,而要按用户或集群随机?

    围绕“用户之间会互相影响的推荐实验为什么不能按请求随机,而要按用户或集群随机”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明处理泄漏和网络干扰会污染对照组,并用聚类稳健方差或更高层随机化。

    核心关键词随机化单位 用户级实验 集群随机 干扰偏差
    #模型与应用评测#AI 评测
  29. 0029
    AI 开发模型与应用评测

    回归预测中 MAE、RMSE 和 MAPE 在零值、异常值场景下如何选型?

    围绕“回归预测中 MAE、RMSE 和 MAPE 在零值、异常值场景下如何选型”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须依据误差平方惩罚、绝对误差解释性和接近零爆炸边界选择,并说明是否改用 sMAPE/分位数损失。

    核心关键词MAE RMSE MAPE 回归评测 异常值 零值场景
    #模型与应用评测#AI 评测
  30. 0030
    AI 开发模型与应用评测

    搜索召回评测中 MRR、Recall@k 和 nDCG@k 分别适合什么目标边界?

    本题考查搜索召回评测中 MRR、Recall@k、nDCG@k 的目标边界。核心结论:MRR 是只取首个正解的倒排名,Recall@k 是覆盖度而非排序质量,nDCG@k 是多级相关性下的位置衰减分数。k 截断决定应用场景。

    核心关键词MRR Recall@k nDCG@k 检索排序 评测指标边界
    #模型与应用评测#AI 评测
  31. 0031
    AI 开发模型与应用评测

    安全评测怎样同时衡量有害请求拦截率和合理请求过度拒答率?

    围绕“安全评测怎样同时衡量有害请求拦截率和合理请求过度拒答率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须构造对抗集与良性近边界集并分别报告,避免只提高拒绝率显得更安全。

    核心关键词安全评测 过度拒答 over-refusal 有害请求拦截
    #模型与应用评测#AI 评测
  32. 0032
    AI 开发模型与应用评测

    实验平台显示 50/50 分流却出现样本比例失衡 SRM 时第一步检查什么?

    围绕“实验平台显示 50/50 分流却出现样本比例失衡 SRM 时第一步检查什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须先检查随机化、埋点丢失、机器人过滤和资格后筛选,再谈指标结论。

    核心关键词样本比例失衡 SRM 分流偏差 诊断
    #模型与应用评测#AI 评测
  33. 0033
    AI 开发模型与应用评测

    BERTScore 或向量余弦相似度在哪些生成场景会高估答案质量?

    围绕“BERTScore 或向量余弦相似度在哪些生成场景会高估答案质量”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须识别语义接近但事实相反、数字错误、漏关键约束等失败边界。

    核心关键词BERTScore 语义相似度 生成评测 高估事实性
    #模型与应用评测#AI 评测#向量检索
  34. 0034
    AI 开发模型与应用评测

    整体指标提升但关键行业切片变差时应怎样设计分层评测报告?

    围绕“整体指标提升但关键行业切片变差时应怎样设计分层评测报告”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须预先冻结切片维度并报告每片样本量、指标和置信区间,避免整体平均掩盖退化。

    核心关键词分层评测 数据切片 关键群体 回归诊断
    #模型与应用评测#AI 评测
  35. 0035
    AI 开发模型与应用评测

    需求预测或舆情分类做离线评估为什么不能随机切分时间样本?

    围绕“需求预测或舆情分类做离线评估为什么不能随机切分时间样本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明未来特征、季节漂移和重复实体穿越切分点的风险,并给出滚动原点验证边界。

    核心关键词时间切分 数据泄漏 随机切分 离线评估
    #模型与应用评测#AI 评测#离线应用
  36. 0036
    AI 开发模型与应用评测

    大模型评测发现分数异常高时如何排查训练集与测试集污染?

    围绕“大模型评测发现分数异常高时如何排查训练集与测试集污染”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出 n-gram/嵌入近邻、答案串泄露和时间戳交叉的排查路径,并区分逐字重复与模板同构。

    核心关键词训练测试污染 数据泄漏 基准污染 去重
    #模型与应用评测#AI 评测#测试
上一页
1
下一页
前端进阶之旅本地 Markdown 维护 · 服务端分页 · 完整内容对用户与搜索引擎一致