知识库重建期间如何保证线上检索不中断且不会查到新旧混合的数据?
围绕“知识库重建期间如何保证线上检索不中断且不会查到新旧混合的数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明双索引构建加原子指针切换的方案及旧索引下线时机。
AI 开发 · 知识库数据面试题第 1 页,显示第 1–37 题,共找到 37 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
围绕“知识库重建期间如何保证线上检索不中断且不会查到新旧混合的数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明双索引构建加原子指针切换的方案及旧索引下线时机。
围绕“多个文档共用的章节(如统一的安装说明)被去重删掉后,检索上下文反而缺失怎么办”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明改用引用指针代替物理复制的方案及检索时展开引用的做法。
围绕“多个文档引用同一段共享内容,删除其中一个文档时如何避免误删仍被其他文档引用的分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出引用计数或归属关系建模,仅在引用归零时物理删除分块。
围绕“分块后级别做去重与文档级去重各自的适用场景和副作用是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比两种粒度对召回冗余与误删共享段落(如法律条文引用)的影响。
围绕“为支撑去重、增量更新、版本、引用、权限五类能力,分块入库时的元数据最小集合应包含哪些字段”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须汇总文档 ID、内容哈希、版本、偏移位置、ACL 五类字段并说明各支撑哪项能力。
围绕“引用标注到文档级、段落级还是句子级,粒度选择对可信度和系统复杂度各有什么影响”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比三种粒度在用户信任、定位成本、幻觉核查上的差异。
围绕“RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出文档 ID、起止偏移、页码、章节路径等定位字段及跨分块还原原文的方法。
围绕“引用中展示的来源链接经常 404,知识库入库时应如何处理来源 URL 才能保证长期可引用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出保存原始 URL、归档快照、规范化永久链接三层策略。
围绕“技术文档入库时,为什么代码块必须作为整体保留而不能被普通分块逻辑切开”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明代码语义边界与函数/类对齐的切分策略。
围绕“同一内容来自多个来源(官网与镜像站)被重复收录,去重时应保留哪一份的元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出按来源权威性、更新时间、可引用 URL 稳定性选择主副本的规则。
围绕“去重应该发生在嵌入计算之前还是之后,两个顺序各浪费或节省什么成本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出先文本去重省嵌入费用、后向量去重能发现语义重复的成本收益判断。
围绕“文档删除后,答案缓存、查询日志、微调数据集中残留的该文档内容如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出缓存失效、日志脱敏、派生数据集再生成三类派生数据的清理责任。
围绕“源文档删除后,为什么只删文档记录不够,还要保证其所有分块和向量一并清除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明孤儿分块仍会被检索命中造成已删内容泄露,给出按文档 ID 级联删除方案。
围绕“企业知识库要求删除操作可审计,数据侧需要记录哪些信息又不违反删除本意”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明记录操作者、时间、文档标识而不再留存内容本身的审计设计。
围绕“知识库需要保留文档历史版本时,应为每个版本单独建块建向量还是只保留最新版本加版本元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比全版本可检索与仅最新可检索两种方案在存储、召回噪声上的取舍。
围绕“多来源文档入库后出现乱码,如何定位是编码声明错误还是解析器选择错误”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出乱码诊断顺序:字节编码探测、声明与实际不一致、解析器回退。
围绕“知识库入库时用内容哈希做完全重复检测,为什么规范化步骤必须先于哈希计算”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明空白、大小写、换行差异会导致同一内容哈希不同,给出规范化清单。
围绕“批量文档解析时页眉页脚和免责声明反复出现,应在解析层还是分块层去除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须论证在解析层基于位置与重复频率剔除样板文本优于分块后处理。
围绕“爬取的 HTML 入库前清洗时,应该剔除哪些元素又必须保留哪些结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出剔除导航/脚本/广告与保留标题层级/表格/代码块的具体取舍标准。
围绕“知识库文档中纯图片承载的关键信息(如架构图),在解析阶段应如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明纯文本管道的盲区及三种补偿手段(alt 文本、OCR、视觉模型描述)。
围绕“知识库增量更新时,如何用最少成本判断一个源文档自上次同步后是否真的变了”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较 mtime、ETag、内容哈希三级检测的可靠性递进关系。
围绕“文档只改了一个段落,为什么增量更新往往需要重切整个文档而不是只替换那一个分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明改动导致后续分块边界漂移使按位置替换失效,给出受影响范围界定方法。
围绕“一个回答综合了多个分块的内容,如何判定每个句子分别引用了哪些分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明生成时内联标注与生成后相似度回标两种归因方案及各自误差来源。
围绕“文档库中大量只差几个字的文章,为什么精确哈希失效而需要 SimHash 或 MinHash”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释局部敏感哈希把相似内容映射到相近签名的原理及阈值选择。
围绕“文档解析流水线中单个文件解析失败时,应该跳过、重试还是整批中止”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出失败隔离、记录坏文件清单、人工补录的管道设计决策。
围绕“RAG 知识库解析 PDF 时,为什么提取出的文本会丢失多栏排版和表格结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 PDF 按绘制指令而非语义结构存储文本导致阅读顺序错乱的原因。
围绕“员工离职或调岗后,其在知识库中可见文档的权限变更多快必须生效,技术上如何保证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明元数据即时过滤优于重建索引的原因及缓存失效处理。
围绕“多租户知识库中,权限过滤应该放在向量检索之前、之中还是之后”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比预过滤、索引内过滤、后过滤三方案在召回数量正确性与性能上的差异。
围绕“文件夹授权给用户后,其中新增文档和已有文档的权限如何继承,知识库侧要避免什么坑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明检索期动态解析继承优于入库期静态展开(避免授权变更漏更新)。
围绕“扫描版 PDF 进入知识库前,为什么必须走 OCR 而不是直接文本提取”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分原生文字层与位图图像两种 PDF 内容形态并给出判断方法。
围绕“用语义相似度做知识库去重时,阈值设高了漏删、设低了误删,如何确定和验证阈值”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出抽样人工标注、按分数分布选拐点、保留双向引用的验证流程。
围绕“知识库删除采用软删除标记还是物理删除,合规要求彻底删除时应选哪种”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明软删除对向量索引与备份中残留数据的合规风险及彻底清除范围。
围绕“DOCX 与 PPTX 入库解析的主要差异是什么,为什么不能共用同一段提取逻辑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明段落流式文档与分页视觉文档在语义单元上的本质差异。
围绕“增量同步任务中途失败,如何避免知识库停留在部分更新的不一致状态”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出批次幂等、游标断点续传、校验后提交的恢复设计。
围绕“知识库中的表格应该序列化成什么形式才能让嵌入模型正确理解行列关系”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较 Markdown 表、逐行展开、行列拼接三种序列化对检索的影响。
围绕“知识库同步频率设为分钟级还是天级,这个决策应该由哪些因素驱动”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出由内容变更率、查询对时效敏感度、重建成本三者决定的判断框架。
围绕“同一文档的新旧版本同时存在于知识库,检索时答案互相矛盾,如何从数据侧根治”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明按版本号或生效时间过滤及旧版本及时失效的机制。