跨语言检索场景下,先把查询翻译成文档语言再嵌入,和直接用多语言嵌入相比各有什么优劣?
围绕“跨语言检索场景下,先把查询翻译成文档语言再嵌入,和直接用多语言嵌入相比各有什么优劣”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确翻译引入错误传播但可利用强单语模型、多语言嵌入简单但对齐质量受模型限制。
向量检索专题面试题第 2 页,显示第 51–66 题,共找到 66 道完整解析,可继续按分类、标签与关键词缩小范围。
按稳定语义路径排序
围绕“跨语言检索场景下,先把查询翻译成文档语言再嵌入,和直接用多语言嵌入相比各有什么优劣”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确翻译引入错误传播但可利用强单语模型、多语言嵌入简单但对齐质量受模型限制。
围绕“BERTScore 或向量余弦相似度在哪些生成场景会高估答案质量”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须识别语义接近但事实相反、数字错误、漏关键约束等失败边界。
围绕“网络分区恢复后,两侧都接受了写的系统如何合并冲突”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确需要 LWW、向量时钟比对或 CRDT 等收敛策略。
围绕“向量时钟如何检测两个并发写是冲突的”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确两向量互不支配即判定并发冲突。
围绕“去重应该发生在嵌入计算之前还是之后,两个顺序各浪费或节省什么成本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出先文本去重省嵌入费用、后向量去重能发现语义重复的成本收益判断。
围绕“源文档删除后,为什么只删文档记录不够,还要保证其所有分块和向量一并清除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明孤儿分块仍会被检索命中造成已删内容泄露,给出按文档 ID 级联删除方案。
围绕“知识库需要保留文档历史版本时,应为每个版本单独建块建向量还是只保留最新版本加版本元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比全版本可检索与仅最新可检索两种方案在存储、召回噪声上的取舍。
围绕“多租户知识库中,权限过滤应该放在向量检索之前、之中还是之后”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比预过滤、索引内过滤、后过滤三方案在召回数量正确性与性能上的差异。
围绕“知识库删除采用软删除标记还是物理删除,合规要求彻底删除时应选哪种”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明软删除对向量索引与备份中残留数据的合规风险及彻底清除范围。
围绕“RAG 系统选择嵌入(embedding)模型时应依据哪些维度,为什么嵌入模型换了必须重建索引”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答向量空间一致性要求及语言、维度、领域匹配等选择标准。
围绕“RAG 为什么需要向量检索与关键词检索(BM25)混合,单靠向量检索在哪类查询上会系统性失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须指出专有名词、编号、精确字符串等向量检索失效场景。
围绕“文档频繁更新的 RAG 系统如何做增量索引,如何避免删除文档的旧向量仍被召回”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确按文档 ID 的 upsert/删除与索引一致性问题。
围绕“RAG 检索前用元数据过滤(如租户、时间、文档类型)为什么应在向量搜索阶段下推而不是召回后再过滤”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确后置过滤导致 top-k 有效结果不足的问题及过滤下推的做法。
围绕“RAG 已经有向量相似度排序了,为什么还需要重排(rerank)阶段,交叉编码器比双编码器强在哪”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确查询-文档交互建模带来的精度提升及不能全库使用的原因。
围绕“多跳问题(需要多份文档联合回答)在 RAG 中为什么要做子问题分解检索,单次检索失败的原因是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答复合问题向量无法同时匹配多主题的机制及分解-合并流程。
围绕“WebAssembly SIMD 相对标量版本在什么条件下才有加速收益”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明可向量化的数据并行循环才受益、检测支持与回退的必要性,不列指令清单。