LangChain 的 RecursiveCharacterTextSplitter 按什么优先级切分文本,为什么比固定长度切分更适合 RAG?
围绕“LangChain 的 RecursiveCharacterTextSplitter 按什么优先级切分文本,为什么比”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明分隔符层级回退机制及其对语义完整性的作用。
AI 开发面试题第 6 页,显示第 251–262 题,共找到 262 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
围绕“LangChain 的 RecursiveCharacterTextSplitter 按什么优先级切分文本,为什么比”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明分隔符层级回退机制及其对语义完整性的作用。
围绕“RAG 流水线中重排应放在召回之后、上下文组装之前,为什么先用大 top-k 召回再重排比直接小 k 检索效果好”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答召回-重排两阶段分工与候选数设置。
围绕“RAG 已经有向量相似度排序了,为什么还需要重排(rerank)阶段,交叉编码器比双编码器强在哪”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确查询-文档交互建模带来的精度提升及不能全库使用的原因。
围绕“如何用检索级指标(recall@k、MRR)单独评估 RAG 的检索质量,而不是只看最终回答好不好”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答构造带标准答案的查询集并分层归因评估的方法。
围绕“RAG 中的语义分块(semantic chunking)是如何工作的,相比固定长度分块适合什么场景”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答基于嵌入相似度检测语义边界的机制与适用条件。
围绕“RAG 检索时设置相似度分数阈值有什么用,为什么不同嵌入模型间阈值不能直接复用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答阈值过滤无关召回的用途及分数分布依赖模型的原因。
围绕“RAG 中 step-back 提问(先生成更抽象的问题再检索)适合解决哪类具体查询检索不到背景知识的问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答具体细节问题缺乏上位概念匹配的机制与适用边界。
围绕“多跳问题(需要多份文档联合回答)在 RAG 中为什么要做子问题分解检索,单次检索失败的原因是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答复合问题向量无法同时匹配多主题的机制及分解-合并流程。
围绕“包含大量表格的文档做 RAG 时应如何分块,为什么表格按字符切开会导致检索失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答表格结构保持(整表为块或 HTML/Markdown 序列化)的判断。
围绕“文档时效性强的 RAG 场景(如政策、新闻)如何在检索中处理时间衰减,避免旧文档压过新文档”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答时间元数据过滤或时间衰减打分的方案选择。
围绕“RAG 分块按 token 切分和按字符切分有什么本质区别,为什么生产上更推荐 token 切分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答 token 计数与嵌入模型上下文窗口对齐的原因。
围绕“RAG 检索的 top-k 设多大合适,k 过大对 LLM 回答质量有什么负面影响”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答召回率与上下文噪声/成本之间的权衡及调 k 的实验方法。