前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库第 12 页
面试知识索引 · 分类、标签与搜索

5000 道程序员面试题,每题都有完整答案

程序员面试题库第 12 页,收录第 551–600 题,共 5000 道完整解析,覆盖前端、JavaScript、React、Vue、Node.js、AI Agent、网络、数据库与系统设计。

5,000完整问题
52技术分类
178检索标签
100索引分页
按分类建立知识面,再用标签和搜索定位问题

每页只渲染 50 道题。分类与标签分页可抓取,自由搜索结果不会制造无限 SEO 页面。

快速定位

分类、标签与关键词搜索

题库检索
技术分类52 个
全部分类5000AI Agent511浏览器301JavaScript285React281AI 开发262CSS240Node.js217TypeScript206Vue180前端工程化138React Native135
查看全部 52 个分类
操作系统135数据库134Docker95计算机网络94API 设计90Kubernetes90HTML89Redis89全栈开发88分布式系统88系统设计86HTTP85Next.js60Angular58Linux53Nuxt51PostgreSQL46可观测性46设计模式46小程序45身份与权限45无障碍44MongoDB43PWA43Web 安全43Git42前端测试42前端性能41WebAssembly40测试40AI 工程37SvelteKit37Go35前端数据管理30React Router29AI 全栈28Svelte27算法12Java10数据结构5前端手写题3
热门标签178 个
并发编程448缓存355性能优化340安全336异步编程292类型系统215构建工具211容器化184流处理177表单157SQL148HTTP141路由140离线应用121网络协议111
查看其余 163 个标签
测试109数据库事务95实时通信92Web 可访问性90动画79可观测性77Agent 记忆75向量检索66工具调用66LangGraph59Prompt56任务规划53排障与运维53数据库索引52浏览器自动化51Flexbox50值与类型50GraphQL49事务与并发49构建与镜像49DNS 与 TLS48工程协作与交付48AI 评测47CSS Grid47Express 服务47MCP47副作用与同步47向量与嵌入47文件与多媒体47流与二进制47传输与协议46列表与性能46可维护代码46响应式原理46容器运行46指标日志追踪46数据建模与运维46文件与 I/O46表单与输入46MCP 协议45RAG45Vite 与模块构建45Webpack45内存与虚拟化45原生集成45多 Agent45工作负载与发布45应用与性能45数据处理45模块与工具链45组件与模板45缓存与数据结构45网络与运维45评估与调试45身份认证与授权45运行时与开发45Web 系统方案44一致性与容错44侦听与生命周期44分布式使用44原生组件与交互44可访问交互44消息与异步处理44渲染与调度44索引与执行计划44组件设计44缓存与代理44进程与并发44层叠与选择器43攻击面与防御43文档数据库43权限与安全43离线与渐进增强43语义与文档43请求与通信 API43Worker 与线程协作42事件系统42存储与离线数据42服务架构42服务端与流式渲染42服务端工程42泛型设计42版本控制42类型收窄42类型运算42组件与端到端42编码与执行42进程与线程42DOM 与文档操作41Flex 布局41HTTP 语义41NestJS 架构41REST 与接口契约41SQL 查询41加载与交互性能41动画与视觉41类型工程41记忆与状态41运行时与调度41Agent 架构40WebAssembly 集成40单元与集成测试40多 Agent 协作40工作流编排40模块与语言机制40浏览器与 UI 自动化40生产运行40函数与作用域39响应式设计39性能与并发39类型系统基础39Grid 布局38数组与集合38盒模型与排版38Hooks 与复用37应用开发37推理与成本37状态共享37知识库数据37模型与应用评测36对象与原型35状态与渲染35语言与并发35异步与 Promise34Effect32RAG 检索31React 性能31响应式与性能31微调与数据31TanStack Query30全栈边界30数据与缓存30大模型基础29路由与数据流29事件循环28流式交互28提示与上下文设计27数据与服务端27组件与依赖注入27组件与响应式27多模态应用24应用与渲染24Hydration22沙箱安全22状态管理18算法18CI/CD13语言与运行时10React Server Components6搜索与排序4实用函数实现3链表栈队列3图算法2字符串算法2树与遍历2索引与高级结构2Kubernetes1作用域与函数1动态规划1异步与浏览器1手写与交互性能1数组与双指针1相等比较1
当前页12 / 100

正在显示第 551–600 题

AI 开发50
第 12 页

本页面试问题

按稳定语义路径排序

  1. 0551
    AI 开发向量与嵌入

    评估检索系统的 recall@k 怎么计算,分母应该是什么?

    围绕“评估检索系统的 recall@k 怎么计算,分母应该是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 k 内命中的相关文档数占全部相关文档数的比例及多相关文档场景的分母口径。

    核心关键词recall@k 召回率 检索评估 计算
    #向量与嵌入#向量检索
  2. 0552
    AI 开发向量与嵌入

    向量检索后再接一个重排序模型(reranker)解决了什么、引入了什么成本?

    围绕“向量检索后再接一个重排序模型(reranker)解决了什么、引入了什么成本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 ANN 召回用粗粒度双向量、reranker 用交叉编码器精排提升相关性但增加延迟,需放大召回候选数。

    核心关键词reranker 重排序 向量检索 两阶段
    #向量与嵌入#向量检索
  3. 0553
    AI 开发向量与嵌入

    为什么有些向量数据库返回的相似度分数不在 0 到 1 之间,如何解释?

    本文解释向量库中相似度分数超0-1范围的原因,区分余弦、内积和L2距离的值域,通过归一化状态和度量定义说明负分及大于1的来源,给出工程判断准则。

    核心关键词相似度分数 范围 余弦 距离 解释
    #向量与嵌入#向量检索
  4. 0554
    AI 开发向量与嵌入

    RAG 检索中如何为相似度分数设定过滤阈值而不误伤召回?

    本题说明RAG检索相似度阈值不能靠拍脑袋设定,需根据分数分布分位数或验证集校准,同时与top-k截断配合,区分分数过滤与数量保证,并注意不同嵌入向量库的分数尺度,防止误伤召回。

    核心关键词相似度阈值 过滤 RAG 检索 设置
    #向量与嵌入#RAG#向量检索
  5. 0555
    AI 开发向量与嵌入

    用大模型自动生成检索评估问题再自动判相关性,有哪些系统性偏差?

    围绕“用大模型自动生成检索评估问题再自动判相关性,有哪些系统性偏差”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确生成问题偏向文档表层表述、LLM 裁判对自身风格偏好导致高估。

    核心关键词合成评估数据 LLM 偏差 检索评估
    #向量与嵌入#向量检索
  6. 0556
    AI 开发向量与嵌入

    为什么表格和代码直接切块做嵌入检索效果差,有什么改进手段?

    围绕“为什么表格和代码直接切块做嵌入检索效果差,有什么改进手段”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确结构信息在纯文本嵌入中丢失、需按结构单元切分或转为描述性文本。

    核心关键词表格 代码 嵌入检索 切块 改进
    #向量与嵌入#向量检索
  7. 0557
    AI 开发向量与嵌入

    RAG 答案漏掉明显相关的文档,为什么首先要怀疑 top-k 和检索阶段而非生成模型?

    围绕“RAG 答案漏掉明显相关的文档,为什么首先要怀疑 top-k 和检索阶段而非生成模型”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确检索未召回时生成无法补救、应先在检索层验证文档是否进入候选。

    核心关键词top-k 召回遗漏 RAG 诊断
    #向量与嵌入#RAG#向量检索
  8. 0558
    AI 开发向量与嵌入

    跨语言检索场景下,先把查询翻译成文档语言再嵌入,和直接用多语言嵌入相比各有什么优劣?

    围绕“跨语言检索场景下,先把查询翻译成文档语言再嵌入,和直接用多语言嵌入相比各有什么优劣”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确翻译引入错误传播但可利用强单语模型、多语言嵌入简单但对齐质量受模型限制。

    核心关键词查询翻译 多语言嵌入 跨语言检索 对比
    #向量与嵌入#向量检索
  9. 0559
    AI 开发模型与应用评测

    新 UI 或新助手上线首周效果应先跑 A/A 或延长观察来区分新奇效应吗?

    围绕“新 UI 或新助手上线首周效果应先跑 A/A 或延长观察来区分新奇效应吗”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用 A/A 校验埋点和分配系统,并用分层首访/回访时间曲线判断效应是否衰减。

    核心关键词A/A测试 新奇效应 首因效应 在线实验
    #模型与应用评测#AI 评测#测试
  10. 0560
    AI 开发模型与应用评测

    LLM 功能灰度 A/B 实验的主指标和护栏指标应怎样在实验前冻结?

    围绕“LLM 功能灰度 A/B 实验的主指标和护栏指标应怎样在实验前冻结”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分北极星效果、延迟成本安全等护栏,并预设停止规则,防止事后挑指标。

    核心关键词A/B实验 主指标 护栏指标 LLM灰度
    #模型与应用评测#AI 评测
  11. 0561
    AI 开发模型与应用评测

    标注预算有限时主动学习的不确定性采样应在什么时候停止?

    围绕“标注预算有限时主动学习的不确定性采样应在什么时候停止”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用验证集边际收益、类别覆盖和剩余风险决定停止,而非固定轮数。

    核心关键词主动学习 不确定性采样 标注预算 停止条件
    #模型与应用评测#AI 评测
  12. 0562
    AI 开发模型与应用评测

    越狱鲁棒性评测与常规准确率评测应放在同一个离线分数里吗?

    围绕“越狱鲁棒性评测与常规准确率评测应放在同一个离线分数里吗”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须主张分开报告攻击成功率、误伤率和功能保持率,避免安全加固被平均指标抵消。

    核心关键词越狱鲁棒性 对抗评测 准确率 离线边界
    #模型与应用评测#AI 评测#离线应用
  13. 0563
    AI 开发模型与应用评测

    Agent 工具调用任务离线评测应记录哪些轨迹字段才能复盘失败原因?

    围绕“Agent 工具调用任务离线评测应记录哪些轨迹字段才能复盘失败原因”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须包括计划、工具参数、返回观察、重试与终止状态,并区分最终成败与过程合规。

    核心关键词Agent评测 工具调用 轨迹记录 失败诊断
    #模型与应用评测#工具调用#AI 评测
  14. 0564
    AI 开发模型与应用评测

    上线前怎样用标注指南和 Cohen/Fleiss kappa 判断标签定义是否足够清楚?

    围绕“上线前怎样用标注指南和 Cohen/Fleiss kappa 判断标签定义是否足够清楚”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须把低 kappa 归因到类别定义、边界样本或标注者训练,并说明是否继续放量标注。

    核心关键词标注指南 Cohen kappa Fleiss kappa 标注一致性
    #模型与应用评测#AI 评测
  15. 0565
    AI 开发模型与应用评测

    摘要生成离线评测为什么不能只凭 BLEU 或 ROUGE 判定上线?

    本题解析 BLEU/ROUGE 在摘要评测中的本质局限,说明其对同义改写、事实错误和流畅性的盲区,并给出与人工侧写互补的最小设计。

    核心关键词BLEU ROUGE 生成评测 人工相关性 局限性
    #模型与应用评测#AI 评测#离线应用
  16. 0566
    AI 开发模型与应用评测

    风控概率输出部署前为什么既要看区分度也要看 Brier 分数和校准曲线?

    本问题讨论风险概率输出为何不能只看排序指标;区分度与校准是两个维度。通过Brier分数和校准曲线发现概率绝对值系统偏移,对定价和限额的影响;并给出具体工程场景和边界条件。

    核心关键词概率校准 Brier分数 reliability曲线 风控模型评估
    #模型与应用评测#AI 评测
  17. 0567
    AI 开发模型与应用评测

    怎样把混淆矩阵转换成可比较不同模型的期望误分类成本?

    本题解释混淆矩阵如何通过乘以误分类成本转换为期望成本,并考虑类别先验变化进行重加权,用于模型比较,强调成本不对称性和先验调整。

    核心关键词混淆矩阵 期望成本 误分类代价 模型评估
    #模型与应用评测#AI 评测
  18. 0568
    AI 开发模型与应用评测

    团队评测算力有限时怎样设计分层 CI:快速 smoke、夜间全量和人工抽检?

    围绕“团队评测算力有限时怎样设计分层 CI:快速 smoke、夜间全量和人工抽检”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答要按变更风险路由到不同评测层级,并说明全量集抽样刷新与人工抽检比例。

    核心关键词评测预算 CI分层 smoke test 人工抽检
    #模型与应用评测#AI 评测#路由
  19. 0569
    AI 开发模型与应用评测

    招聘筛选模型中 demographic parity 与 equal opportunity 冲突时应怎样向业务解释?

    围绕“招聘筛选模型中 demographic parity 与 equal opportunity 冲突时应怎样向业务解释”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明群体通过率平等与合格组召回平等通常不可兼得,并落到受保护属性、基准率和决策后果。

    核心关键词公平性 demographic parity equal opportunity 评测解释
    #模型与应用评测#AI 评测
  20. 0570
    AI 开发模型与应用评测

    特征工程阶段怎样识别“用了未来才知道的信息”导致的标签泄漏?

    围绕“特征工程阶段怎样识别“用了未来才知道的信息”导致的标签泄漏”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用特征可得时间、快照表和因果链审查特征,并区分合法滞后特征与结算后字段。

    核心关键词特征泄漏 未来信息 标签泄漏 point-in-time
    #模型与应用评测#AI 评测
  21. 0571
    AI 开发模型与应用评测

    为什么公开开发集之外还要保留隐藏测试集来评估 prompt 或模型版本?

    围绕“为什么公开开发集之外还要保留隐藏测试集来评估 prompt 或模型版本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释反复看同一套样例导致的评测过拟合,并给出可见/隐藏集合的更新纪律。

    核心关键词金标集 隐藏测试集 过拟合防护 prompt迭代
    #模型与应用评测#Prompt#AI 评测
  22. 0572
    AI 开发模型与应用评测

    开放问答的事实性评测应如何把“未回答”与“编造答案”分开计分?

    围绕“开放问答的事实性评测应如何把“未回答”与“编造答案”分开计分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须拆分支持证据充足性、答案可验证性和 abstention 成本,避免高拒答率拿高分。

    核心关键词事实性评测 幻觉 拒答计分 开放问答
    #模型与应用评测#AI 评测
  23. 0573
    AI 开发模型与应用评测

    类别不均衡的文本分类为什么常同时报宏平均 F1 和微平均 F1?

    围绕“类别不均衡的文本分类为什么常同时报宏平均 F1 和微平均 F1”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明少数类是否会被样本量多数类淹没,并说明宏/微平均各自对应的业务损失。

    核心关键词类别不均衡 宏平均F1 微平均F1 评测指标
    #模型与应用评测#AI 评测
  24. 0574
    AI 开发模型与应用评测

    排序系统在线评估中 interleaving 相比全量 A/B 何时更灵敏,何时不可用?

    围绕“排序系统在线评估中 interleaving 相比全量 A/B 何时更灵敏,何时不可用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明同次展示混合两模型可降低用户方差,但受位置展示和不可混合约束限制。

    核心关键词interleaving 排序实验 在线评估 敏感性对比
    #模型与应用评测#AI 评测
  25. 0575
    AI 开发模型与应用评测

    多语言助手评测为什么要按语言和资源水平分层,而不是只报混合准确率?

    围绕“多语言助手评测为什么要按语言和资源水平分层,而不是只报混合准确率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须识别高资源语言占比拉高总分,并给低资源语言最低可接受门槛。

    核心关键词多语言评测 低资源偏差 语言分层 公平性
    #模型与应用评测#AI 评测
  26. 0576
    AI 开发模型与应用评测

    每天盯实验结果并在显著时提前停会怎样放大假阳性,应如何控制?

    围绕“每天盯实验结果并在显著时提前停会怎样放大假阳性,应如何控制”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明重复窥视使名义 p 值失效,并采用预设 horizon、alpha spending 或始终有效区间。

    核心关键词多重比较 序贯检验 假阳性 控制策略
    #模型与应用评测#AI 评测
  27. 0577
    AI 开发模型与应用评测

    模型替换只要求不差于旧系统时应如何设定非劣效界值而不是追求显著更优?

    围绕“模型替换只要求不差于旧系统时应如何设定非劣效界值而不是追求显著更优”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须由可接受业务退化定 delta,并报告单侧置信区间是否越界。

    核心关键词非劣效实验 等效性检验 margin 设定
    #模型与应用评测#AI 评测
  28. 0578
    AI 开发模型与应用评测

    离线评测集怎样证明覆盖了线上真实流量而不是只覆盖好标注的样本?

    围绕“离线评测集怎样证明覆盖了线上真实流量而不是只覆盖好标注的样本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较来源、意图、长度、语言、难度切片与线上日志,并说明重加权是否改变主结论。

    核心关键词离线评测集 代表性 流量分布 覆盖偏差
    #模型与应用评测#AI 评测#离线应用
  29. 0579
    AI 开发模型与应用评测

    离线人工评分更高但线上留存下降时,应按什么顺序诊断指标错位?

    围绕“离线人工评分更高但线上留存下降时,应按什么顺序诊断指标错位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须依次查样本分布、judge 与真实效用差异、延迟成本、交互入口变化和护栏退化。

    核心关键词离线在线不一致 指标错位 诊断流程
    #模型与应用评测#AI 评测#离线应用
  30. 0580
    AI 开发模型与应用评测

    多模型偏好投票为什么用 Bradley-Terry/Elo 聚合而不是直接数胜率?

    围绕“多模型偏好投票为什么用 Bradley-Terry/Elo 聚合而不是直接数胜率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明传递性、对手强度不同和置信区间对排名稳定性的影响。

    核心关键词成对偏好 Bradley-Terry Elo 模型排行 评测聚合
    #模型与应用评测#AI 评测
  31. 0581
    AI 开发模型与应用评测

    罕见事件检测为什么优先看 PR-AUC 而不是 ROC-AUC?

    本题说明ROC在极度不平衡下因负例基数过大导致FPR失真,用具体欺诈场景对比两种曲线差异,并指出PR-AUC的局限:依赖正例患病率,不可跨数据集比较,适合在离线选型时优先参考。

    核心关键词PR-AUC ROC-AUC 罕见事件 评测指标对比
    #模型与应用评测#AI 评测#离线应用
  32. 0582
    AI 开发模型与应用评测

    在欺诈拦截里怎样用精确率、召回率和单次误伤成本决定分类阈值?

    围绕“在欺诈拦截里怎样用精确率、召回率和单次误伤成本决定分类阈值”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出以期望损失最小化定阈值的方法,并区分阈值优化与模型排序能力。

    核心关键词精确率 召回率 成本敏感 分类阈值 欺诈检测
    #模型与应用评测#AI 评测
  33. 0583
    AI 开发模型与应用评测

    程序化弱监督标签进入训练前需要估计哪些噪声参数?

    围绕“程序化弱监督标签进入训练前需要估计哪些噪声参数”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须估计各标注源的覆盖率、准确率、相关性和极性冲突,并决定是否只用于训练不用于测试。

    核心关键词弱监督 程序化标注 标签噪声 评测参数估计
    #模型与应用评测#AI 评测#测试
  34. 0584
    AI 开发模型与应用评测

    同一语义指令改写成不同 prompt 后输出波动很大,离线评测应怎样量化鲁棒性?

    围绕“同一语义指令改写成不同 prompt 后输出波动很大,离线评测应怎样量化鲁棒性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用语义保持改写集报告均值、最差组和方差,而不是只报单 prompt 分数。

    核心关键词prompt敏感性 扰动鲁棒性 语义保持改写 评测
    #模型与应用评测#Prompt#AI 评测
  35. 0585
    AI 开发模型与应用评测

    RAG 评测为什么要分别报告上下文命中率、引用忠实度和最终答案正确率?

    围绕“RAG 评测为什么要分别报告上下文命中率、引用忠实度和最终答案正确率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须定位失败在检索召回、引用支撑还是生成推理三段之一,并说明端到端分数不可单独诊断。

    核心关键词RAG评测 context precision faithfulness 答案正确率
    #模型与应用评测#RAG#AI 评测
  36. 0586
    AI 开发模型与应用评测

    用户之间会互相影响的推荐实验为什么不能按请求随机,而要按用户或集群随机?

    围绕“用户之间会互相影响的推荐实验为什么不能按请求随机,而要按用户或集群随机”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明处理泄漏和网络干扰会污染对照组,并用聚类稳健方差或更高层随机化。

    核心关键词随机化单位 用户级实验 集群随机 干扰偏差
    #模型与应用评测#AI 评测
  37. 0587
    AI 开发模型与应用评测

    回归预测中 MAE、RMSE 和 MAPE 在零值、异常值场景下如何选型?

    围绕“回归预测中 MAE、RMSE 和 MAPE 在零值、异常值场景下如何选型”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须依据误差平方惩罚、绝对误差解释性和接近零爆炸边界选择,并说明是否改用 sMAPE/分位数损失。

    核心关键词MAE RMSE MAPE 回归评测 异常值 零值场景
    #模型与应用评测#AI 评测
  38. 0588
    AI 开发模型与应用评测

    搜索召回评测中 MRR、Recall@k 和 nDCG@k 分别适合什么目标边界?

    本题考查搜索召回评测中 MRR、Recall@k、nDCG@k 的目标边界。核心结论:MRR 是只取首个正解的倒排名,Recall@k 是覆盖度而非排序质量,nDCG@k 是多级相关性下的位置衰减分数。k 截断决定应用场景。

    核心关键词MRR Recall@k nDCG@k 检索排序 评测指标边界
    #模型与应用评测#AI 评测
  39. 0589
    AI 开发模型与应用评测

    安全评测怎样同时衡量有害请求拦截率和合理请求过度拒答率?

    围绕“安全评测怎样同时衡量有害请求拦截率和合理请求过度拒答率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须构造对抗集与良性近边界集并分别报告,避免只提高拒绝率显得更安全。

    核心关键词安全评测 过度拒答 over-refusal 有害请求拦截
    #模型与应用评测#AI 评测
  40. 0590
    AI 开发模型与应用评测

    实验平台显示 50/50 分流却出现样本比例失衡 SRM 时第一步检查什么?

    围绕“实验平台显示 50/50 分流却出现样本比例失衡 SRM 时第一步检查什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须先检查随机化、埋点丢失、机器人过滤和资格后筛选,再谈指标结论。

    核心关键词样本比例失衡 SRM 分流偏差 诊断
    #模型与应用评测#AI 评测
  41. 0591
    AI 开发模型与应用评测

    BERTScore 或向量余弦相似度在哪些生成场景会高估答案质量?

    围绕“BERTScore 或向量余弦相似度在哪些生成场景会高估答案质量”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须识别语义接近但事实相反、数字错误、漏关键约束等失败边界。

    核心关键词BERTScore 语义相似度 生成评测 高估事实性
    #模型与应用评测#AI 评测#向量检索
  42. 0592
    AI 开发模型与应用评测

    整体指标提升但关键行业切片变差时应怎样设计分层评测报告?

    围绕“整体指标提升但关键行业切片变差时应怎样设计分层评测报告”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须预先冻结切片维度并报告每片样本量、指标和置信区间,避免整体平均掩盖退化。

    核心关键词分层评测 数据切片 关键群体 回归诊断
    #模型与应用评测#AI 评测
  43. 0593
    AI 开发模型与应用评测

    需求预测或舆情分类做离线评估为什么不能随机切分时间样本?

    围绕“需求预测或舆情分类做离线评估为什么不能随机切分时间样本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明未来特征、季节漂移和重复实体穿越切分点的风险,并给出滚动原点验证边界。

    核心关键词时间切分 数据泄漏 随机切分 离线评估
    #模型与应用评测#AI 评测#离线应用
  44. 0594
    AI 开发模型与应用评测

    大模型评测发现分数异常高时如何排查训练集与测试集污染?

    围绕“大模型评测发现分数异常高时如何排查训练集与测试集污染”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出 n-gram/嵌入近邻、答案串泄露和时间戳交叉的排查路径,并区分逐字重复与模板同构。

    核心关键词训练测试污染 数据泄漏 基准污染 去重
    #模型与应用评测#AI 评测#测试
  45. 0595
    AI 开发大模型基础

    为什么大语言模型做多步算术和长数字运算容易出错?

    围绕“为什么大语言模型做多步算术和长数字运算容易出错”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖从 token 化破坏数字结构与无计算执行能力解释错误成因,给出工具外置方案。

    核心关键词LLM 算术能力弱 原因 为何出错
    #大模型基础
  46. 0596
    AI 开发大模型基础

    束搜索(beam search)和随机采样在文本生成上各适合什么场景?

    围绕“束搜索(beam search)和随机采样在文本生成上各适合什么场景”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要比较高置信度搜索的重复倾向与采样的多样性收益。

    核心关键词束搜索 与 随机采样 文本生成区别
    #大模型基础
  47. 0597
    AI 开发大模型基础

    让大模型先推理再作答(思维链)为什么能提升复杂题准确率,代价是什么?

    围绕“让大模型先推理再作答(思维链)为什么能提升复杂题准确率,代价是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明中间推理步骤对多步任务的收益与 token 成本、错误传播风险。

    核心关键词思维链 权衡 生成质量与成本
    #大模型基础
  48. 0598
    AI 开发大模型基础

    为什么大模型用自信的语气陈述错误内容,语气能否作为可信度信号?

    围绕“为什么大模型用自信的语气陈述错误内容,语气能否作为可信度信号”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明生成流畅性与事实正确性解耦的原因及对产品设计的影响。

    核心关键词LLM 自信但错误 语气可信度
    #大模型基础
  49. 0599
    AI 开发大模型基础

    把全部资料塞进上下文和按需检索注入,面对大知识库应如何取舍?

    围绕“把全部资料塞进上下文和按需检索注入,面对大知识库应如何取舍”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖从成本、延迟、召回准确率对比两种信息供给策略的适用规模。

    核心关键词长上下文 塞入资料 与 检索增强 取舍
    #大模型基础#RAG#安全
  50. 0600
    AI 开发大模型基础

    什么是大模型的上下文窗口,它如何限制一次请求能处理的内容?

    回答重点:上下文窗口同时约束输入与输出 token 总额,超过会产生 400 错误或停止生成;通过具体多轮对话场景说明历史、提示词和输出如何竞争有限空间,并解释溢出与精度衰减的边界。

    核心关键词LLM context window 上下文窗口 限制
    #大模型基础#Prompt
上一页
1…1011121314…100
下一页
前端进阶之旅本地 Markdown 维护 · 服务端分页 · 完整内容对用户与搜索引擎一致