线上更换嵌入模型前应该怎么做 A/B 或离线对比验证?
围绕“线上更换嵌入模型前应该怎么做 A/B 或离线对比验证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确全量重嵌入后离线召回对比加小流量灰度、分数分布不可直接跨模型比较。
AI 开发 · 离线应用面试题第 1 页,显示第 1–11 题,共找到 11 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
围绕“线上更换嵌入模型前应该怎么做 A/B 或离线对比验证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确全量重嵌入后离线召回对比加小流量灰度、分数分布不可直接跨模型比较。
围绕“向量索引应该全量离线重建还是支持在线增量插入,怎么决策”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确数据变更频率与索引类型(IVF 需重训聚类、HNSW 可增量)决定策略。
围绕“用 PCA 给已生成的嵌入降维会损失多少检索质量,什么时候值得做”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确线性降维对最近邻结构的保真有限、适合存储瓶颈场景且需离线验证召回。
围绕“越狱鲁棒性评测与常规准确率评测应放在同一个离线分数里吗”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须主张分开报告攻击成功率、误伤率和功能保持率,避免安全加固被平均指标抵消。
围绕“Agent 工具调用任务离线评测应记录哪些轨迹字段才能复盘失败原因”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须包括计划、工具参数、返回观察、重试与终止状态,并区分最终成败与过程合规。
本题解析 BLEU/ROUGE 在摘要评测中的本质局限,说明其对同义改写、事实错误和流畅性的盲区,并给出与人工侧写互补的最小设计。
围绕“离线评测集怎样证明覆盖了线上真实流量而不是只覆盖好标注的样本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较来源、意图、长度、语言、难度切片与线上日志,并说明重加权是否改变主结论。
围绕“离线人工评分更高但线上留存下降时,应按什么顺序诊断指标错位”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须依次查样本分布、judge 与真实效用差异、延迟成本、交互入口变化和护栏退化。
本题说明ROC在极度不平衡下因负例基数过大导致FPR失真,用具体欺诈场景对比两种曲线差异,并指出PR-AUC的局限:依赖正例患病率,不可跨数据集比较,适合在离线选型时优先参考。
围绕“同一语义指令改写成不同 prompt 后输出波动很大,离线评测应怎样量化鲁棒性”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须用语义保持改写集报告均值、最差组和方差,而不是只报单 prompt 分数。
围绕“需求预测或舆情分类做离线评估为什么不能随机切分时间样本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明未来特征、季节漂移和重复实体穿越切分点的风险,并给出滚动原点验证边界。