RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息?
围绕“RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出文档 ID、起止偏移、页码、章节路径等定位字段及跨分块还原原文的方法。
AI 开发面试题第 5 页,显示第 201–250 题,共找到 262 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
围绕“RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出文档 ID、起止偏移、页码、章节路径等定位字段及跨分块还原原文的方法。
围绕“引用中展示的来源链接经常 404,知识库入库时应如何处理来源 URL 才能保证长期可引用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出保存原始 URL、归档快照、规范化永久链接三层策略。
围绕“技术文档入库时,为什么代码块必须作为整体保留而不能被普通分块逻辑切开”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明代码语义边界与函数/类对齐的切分策略。
围绕“同一内容来自多个来源(官网与镜像站)被重复收录,去重时应保留哪一份的元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出按来源权威性、更新时间、可引用 URL 稳定性选择主副本的规则。
围绕“去重应该发生在嵌入计算之前还是之后,两个顺序各浪费或节省什么成本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出先文本去重省嵌入费用、后向量去重能发现语义重复的成本收益判断。
围绕“文档删除后,答案缓存、查询日志、微调数据集中残留的该文档内容如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出缓存失效、日志脱敏、派生数据集再生成三类派生数据的清理责任。
围绕“源文档删除后,为什么只删文档记录不够,还要保证其所有分块和向量一并清除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明孤儿分块仍会被检索命中造成已删内容泄露,给出按文档 ID 级联删除方案。
围绕“企业知识库要求删除操作可审计,数据侧需要记录哪些信息又不违反删除本意”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明记录操作者、时间、文档标识而不再留存内容本身的审计设计。
围绕“知识库需要保留文档历史版本时,应为每个版本单独建块建向量还是只保留最新版本加版本元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比全版本可检索与仅最新可检索两种方案在存储、召回噪声上的取舍。
围绕“多来源文档入库后出现乱码,如何定位是编码声明错误还是解析器选择错误”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出乱码诊断顺序:字节编码探测、声明与实际不一致、解析器回退。
围绕“知识库入库时用内容哈希做完全重复检测,为什么规范化步骤必须先于哈希计算”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明空白、大小写、换行差异会导致同一内容哈希不同,给出规范化清单。
围绕“批量文档解析时页眉页脚和免责声明反复出现,应在解析层还是分块层去除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须论证在解析层基于位置与重复频率剔除样板文本优于分块后处理。
围绕“爬取的 HTML 入库前清洗时,应该剔除哪些元素又必须保留哪些结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出剔除导航/脚本/广告与保留标题层级/表格/代码块的具体取舍标准。
围绕“知识库文档中纯图片承载的关键信息(如架构图),在解析阶段应如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明纯文本管道的盲区及三种补偿手段(alt 文本、OCR、视觉模型描述)。
围绕“知识库增量更新时,如何用最少成本判断一个源文档自上次同步后是否真的变了”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较 mtime、ETag、内容哈希三级检测的可靠性递进关系。
围绕“文档只改了一个段落,为什么增量更新往往需要重切整个文档而不是只替换那一个分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明改动导致后续分块边界漂移使按位置替换失效,给出受影响范围界定方法。
围绕“一个回答综合了多个分块的内容,如何判定每个句子分别引用了哪些分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明生成时内联标注与生成后相似度回标两种归因方案及各自误差来源。
围绕“文档库中大量只差几个字的文章,为什么精确哈希失效而需要 SimHash 或 MinHash”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释局部敏感哈希把相似内容映射到相近签名的原理及阈值选择。
围绕“文档解析流水线中单个文件解析失败时,应该跳过、重试还是整批中止”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出失败隔离、记录坏文件清单、人工补录的管道设计决策。
围绕“RAG 知识库解析 PDF 时,为什么提取出的文本会丢失多栏排版和表格结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 PDF 按绘制指令而非语义结构存储文本导致阅读顺序错乱的原因。
围绕“员工离职或调岗后,其在知识库中可见文档的权限变更多快必须生效,技术上如何保证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明元数据即时过滤优于重建索引的原因及缓存失效处理。
围绕“多租户知识库中,权限过滤应该放在向量检索之前、之中还是之后”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比预过滤、索引内过滤、后过滤三方案在召回数量正确性与性能上的差异。
围绕“文件夹授权给用户后,其中新增文档和已有文档的权限如何继承,知识库侧要避免什么坑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明检索期动态解析继承优于入库期静态展开(避免授权变更漏更新)。
围绕“扫描版 PDF 进入知识库前,为什么必须走 OCR 而不是直接文本提取”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分原生文字层与位图图像两种 PDF 内容形态并给出判断方法。
围绕“用语义相似度做知识库去重时,阈值设高了漏删、设低了误删,如何确定和验证阈值”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出抽样人工标注、按分数分布选拐点、保留双向引用的验证流程。
围绕“知识库删除采用软删除标记还是物理删除,合规要求彻底删除时应选哪种”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明软删除对向量索引与备份中残留数据的合规风险及彻底清除范围。
围绕“DOCX 与 PPTX 入库解析的主要差异是什么,为什么不能共用同一段提取逻辑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明段落流式文档与分页视觉文档在语义单元上的本质差异。
围绕“增量同步任务中途失败,如何避免知识库停留在部分更新的不一致状态”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出批次幂等、游标断点续传、校验后提交的恢复设计。
围绕“知识库中的表格应该序列化成什么形式才能让嵌入模型正确理解行列关系”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较 Markdown 表、逐行展开、行列拼接三种序列化对检索的影响。
围绕“知识库同步频率设为分钟级还是天级,这个决策应该由哪些因素驱动”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出由内容变更率、查询对时效敏感度、重建成本三者决定的判断框架。
围绕“同一文档的新旧版本同时存在于知识库,检索时答案互相矛盾,如何从数据侧根治”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明按版本号或生效时间过滤及旧版本及时失效的机制。
围绕“RAG 分块时为什么要设置 chunk overlap(重叠),重叠过大有什么副作用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答重叠如何保护跨边界语义、以及重叠带来的重复内容与索引膨胀代价。
围绕“RAG 中如何确定文本分块(chunk)的大小,过大和过小分别会导致什么检索问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确块大小对召回语义完整性与嵌入精度的双向影响。
围绕“RAG 如何让生成答案带引用来源,上下文组装阶段需要给每个文档块附加什么信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答块级来源标识注入与提示模型引用编号的机制。
围绕“父子分块或重叠分块的 RAG 系统在组装上下文时如何去重合并,避免同一内容重复占用 token”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答按父文档聚合或相邻块合并的具体做法。
围绕“RAG 组装上下文时如何在有限 token 预算内分配系统提示、历史对话和检索文档,超预算时应优先砍哪部分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出优先级排序与截断策略的判断。
围绕“LangChain 的 ContextualCompressionRetriever 如何只保留文档中与问题相关的部”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答长文档召回后抽取相关片段以降低噪声与 token 成本。
围绕“RAG 系统选择嵌入(embedding)模型时应依据哪些维度,为什么嵌入模型换了必须重建索引”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答向量空间一致性要求及语言、维度、领域匹配等选择标准。
围绕“RAG 为什么需要向量检索与关键词检索(BM25)混合,单靠向量检索在哪类查询上会系统性失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须指出专有名词、编号、精确字符串等向量检索失效场景。
围绕“RAG 中 HyDE(假设文档嵌入)检索的原理是什么,为什么它对短问题比长问题更有帮助”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答先生成假想答案再嵌入检索的机制及短查询受益原因。
围绕“文档频繁更新的 RAG 系统如何做增量索引,如何避免删除文档的旧向量仍被召回”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确按文档 ID 的 upsert/删除与索引一致性问题。
围绕“RAG 处理 Markdown 或代码文档时为什么需要结构化感知分块,直接用字符切分会破坏什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确标题层级/代码块边界被破坏的后果及按结构切分的做法。
围绕“RAG 检索前用元数据过滤(如租户、时间、文档类型)为什么应在向量搜索阶段下推而不是召回后再过滤”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确后置过滤导致 top-k 有效结果不足的问题及过滤下推的做法。
围绕“RAG 中最大边际相关性(MMR)检索如何解决 top-k 结果内容重复的问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明相关性-多样性平衡公式思路及 lambda 参数含义。
围绕“LangChain 的 MultiQueryRetriever 通过生成多个查询变体提升召回,它的适用场景和成本代价”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 LLM 生成改写查询再合并去重的机制及延迟成本。
围绕“多租户 RAG 系统如何利用元数据过滤保证租户间数据不串,仅靠 prompt 声明租户为什么不可靠”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答检索层强制过滤的必要性及 prompt 层约束可被绕过的问题。
围绕“RAG 检索结果为空或全部低于阈值时系统应如何兜底,直接把所有问题交给 LLM 自由回答有什么风险”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答阈值判空、拒答或降级策略及幻觉风险控制。
围绕“RAG 检索质量差但定位发现源头在 PDF 解析阶段,乱码、栏序错乱会如何传导到分块与嵌入”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确解析错误经分块放大为噪声块的传导链。
围绕“用户提问用词和文档措辞差异大导致 RAG 召回失败,除了换嵌入模型还有哪些检索侧手段”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答查询改写、混合检索、假设文档嵌入等检索侧方案。
围绕“RAG 中的查询改写(query rewriting)解决什么问题,为什么多轮对话里直接用用户原话检索会失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确指代/省略导致的检索意图缺失及改写为独立查询的做法。