RAG 检索中如何为相似度分数设定过滤阈值而不误伤召回?
本题说明RAG检索相似度阈值不能靠拍脑袋设定,需根据分数分布分位数或验证集校准,同时与top-k截断配合,区分分数过滤与数量保证,并注意不同嵌入向量库的分数尺度,防止误伤召回。
AI 开发 · RAG面试题第 1 页,显示第 1–41 题,共找到 41 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
本题说明RAG检索相似度阈值不能靠拍脑袋设定,需根据分数分布分位数或验证集校准,同时与top-k截断配合,区分分数过滤与数量保证,并注意不同嵌入向量库的分数尺度,防止误伤召回。
围绕“RAG 答案漏掉明显相关的文档,为什么首先要怀疑 top-k 和检索阶段而非生成模型”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确检索未召回时生成无法补救、应先在检索层验证文档是否进入候选。
围绕“RAG 评测为什么要分别报告上下文命中率、引用忠实度和最终答案正确率”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须定位失败在检索召回、引用支撑还是生成推理三段之一,并说明端到端分数不可单独诊断。
围绕“把全部资料塞进上下文和按需检索注入,面对大知识库应如何取舍”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖从成本、延迟、召回准确率对比两种信息供给策略的适用规模。
本文解释lost in the middle现象的机制,即位置偏置导致中间信息召回下降,并通过一个RAG场景展示对策:将关键证据前置或后置,同时给出边界如超长多跳和指令冲突时的局限。
围绕“在低延迟场景下,为何选择微调而非检索增强生成?请从推理开销和上下文长度约束角度分析”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖判断时要说明微调在固定上下文长度下的确定性响应优势。
围绕“RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出文档 ID、起止偏移、页码、章节路径等定位字段及跨分块还原原文的方法。
围绕“爬取的 HTML 入库前清洗时,应该剔除哪些元素又必须保留哪些结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出剔除导航/脚本/广告与保留标题层级/表格/代码块的具体取舍标准。
围绕“知识库文档中纯图片承载的关键信息(如架构图),在解析阶段应如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明纯文本管道的盲区及三种补偿手段(alt 文本、OCR、视觉模型描述)。
围绕“RAG 知识库解析 PDF 时,为什么提取出的文本会丢失多栏排版和表格结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 PDF 按绘制指令而非语义结构存储文本导致阅读顺序错乱的原因。
围绕“RAG 分块时为什么要设置 chunk overlap(重叠),重叠过大有什么副作用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答重叠如何保护跨边界语义、以及重叠带来的重复内容与索引膨胀代价。
围绕“RAG 中如何确定文本分块(chunk)的大小,过大和过小分别会导致什么检索问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确块大小对召回语义完整性与嵌入精度的双向影响。
围绕“RAG 如何让生成答案带引用来源,上下文组装阶段需要给每个文档块附加什么信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答块级来源标识注入与提示模型引用编号的机制。
围绕“父子分块或重叠分块的 RAG 系统在组装上下文时如何去重合并,避免同一内容重复占用 token”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答按父文档聚合或相邻块合并的具体做法。
围绕“RAG 组装上下文时如何在有限 token 预算内分配系统提示、历史对话和检索文档,超预算时应优先砍哪部分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出优先级排序与截断策略的判断。
围绕“LangChain 的 ContextualCompressionRetriever 如何只保留文档中与问题相关的部”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答长文档召回后抽取相关片段以降低噪声与 token 成本。
围绕“RAG 系统选择嵌入(embedding)模型时应依据哪些维度,为什么嵌入模型换了必须重建索引”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答向量空间一致性要求及语言、维度、领域匹配等选择标准。
围绕“RAG 为什么需要向量检索与关键词检索(BM25)混合,单靠向量检索在哪类查询上会系统性失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须指出专有名词、编号、精确字符串等向量检索失效场景。
围绕“RAG 中 HyDE(假设文档嵌入)检索的原理是什么,为什么它对短问题比长问题更有帮助”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答先生成假想答案再嵌入检索的机制及短查询受益原因。
围绕“文档频繁更新的 RAG 系统如何做增量索引,如何避免删除文档的旧向量仍被召回”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确按文档 ID 的 upsert/删除与索引一致性问题。
围绕“RAG 处理 Markdown 或代码文档时为什么需要结构化感知分块,直接用字符切分会破坏什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确标题层级/代码块边界被破坏的后果及按结构切分的做法。
围绕“RAG 检索前用元数据过滤(如租户、时间、文档类型)为什么应在向量搜索阶段下推而不是召回后再过滤”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确后置过滤导致 top-k 有效结果不足的问题及过滤下推的做法。
围绕“RAG 中最大边际相关性(MMR)检索如何解决 top-k 结果内容重复的问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明相关性-多样性平衡公式思路及 lambda 参数含义。
围绕“LangChain 的 MultiQueryRetriever 通过生成多个查询变体提升召回,它的适用场景和成本代价”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 LLM 生成改写查询再合并去重的机制及延迟成本。
围绕“多租户 RAG 系统如何利用元数据过滤保证租户间数据不串,仅靠 prompt 声明租户为什么不可靠”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答检索层强制过滤的必要性及 prompt 层约束可被绕过的问题。
围绕“RAG 检索结果为空或全部低于阈值时系统应如何兜底,直接把所有问题交给 LLM 自由回答有什么风险”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答阈值判空、拒答或降级策略及幻觉风险控制。
围绕“RAG 检索质量差但定位发现源头在 PDF 解析阶段,乱码、栏序错乱会如何传导到分块与嵌入”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确解析错误经分块放大为噪声块的传导链。
围绕“用户提问用词和文档措辞差异大导致 RAG 召回失败,除了换嵌入模型还有哪些检索侧手段”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答查询改写、混合检索、假设文档嵌入等检索侧方案。
围绕“RAG 中的查询改写(query rewriting)解决什么问题,为什么多轮对话里直接用用户原话检索会失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确指代/省略导致的检索意图缺失及改写为独立查询的做法。
围绕“LangChain 的 RecursiveCharacterTextSplitter 按什么优先级切分文本,为什么比”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明分隔符层级回退机制及其对语义完整性的作用。
围绕“RAG 流水线中重排应放在召回之后、上下文组装之前,为什么先用大 top-k 召回再重排比直接小 k 检索效果好”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答召回-重排两阶段分工与候选数设置。
围绕“RAG 已经有向量相似度排序了,为什么还需要重排(rerank)阶段,交叉编码器比双编码器强在哪”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确查询-文档交互建模带来的精度提升及不能全库使用的原因。
围绕“如何用检索级指标(recall@k、MRR)单独评估 RAG 的检索质量,而不是只看最终回答好不好”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答构造带标准答案的查询集并分层归因评估的方法。
围绕“RAG 中的语义分块(semantic chunking)是如何工作的,相比固定长度分块适合什么场景”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答基于嵌入相似度检测语义边界的机制与适用条件。
围绕“RAG 检索时设置相似度分数阈值有什么用,为什么不同嵌入模型间阈值不能直接复用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答阈值过滤无关召回的用途及分数分布依赖模型的原因。
围绕“RAG 中 step-back 提问(先生成更抽象的问题再检索)适合解决哪类具体查询检索不到背景知识的问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答具体细节问题缺乏上位概念匹配的机制与适用边界。
围绕“多跳问题(需要多份文档联合回答)在 RAG 中为什么要做子问题分解检索,单次检索失败的原因是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答复合问题向量无法同时匹配多主题的机制及分解-合并流程。
围绕“包含大量表格的文档做 RAG 时应如何分块,为什么表格按字符切开会导致检索失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答表格结构保持(整表为块或 HTML/Markdown 序列化)的判断。
围绕“文档时效性强的 RAG 场景(如政策、新闻)如何在检索中处理时间衰减,避免旧文档压过新文档”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答时间元数据过滤或时间衰减打分的方案选择。
围绕“RAG 分块按 token 切分和按字符切分有什么本质区别,为什么生产上更推荐 token 切分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答 token 计数与嵌入模型上下文窗口对齐的原因。
围绕“RAG 检索的 top-k 设多大合适,k 过大对 LLM 回答质量有什么负面影响”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答召回率与上下文噪声/成本之间的权衡及调 k 的实验方法。