前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库AI 开发面试题第 5 页
面试知识索引 · 分类、标签与搜索

AI 开发面试题,262 道完整答案

AI 开发面试题第 5 页,显示第 201–250 题,共找到 262 道完整解析,可继续按分类、标签与关键词缩小范围。

262筛选结果
52技术分类
178检索标签
6索引分页
按分类建立知识面,再用标签和搜索定位问题

每页只渲染 50 道题。分类与标签分页可抓取,自由搜索结果不会制造无限 SEO 页面。

快速定位

分类、标签与关键词搜索

清除全部筛选
题库检索
技术分类52 个
全部分类5000AI 开发262AI Agent511浏览器301JavaScript285React281CSS240Node.js217TypeScript206Vue180前端工程化138React Native135
查看全部 52 个分类
操作系统135数据库134Docker95计算机网络94API 设计90Kubernetes90HTML89Redis89全栈开发88分布式系统88系统设计86HTTP85Next.js60Angular58Linux53Nuxt51PostgreSQL46可观测性46设计模式46小程序45身份与权限45无障碍44MongoDB43PWA43Web 安全43Git42前端测试42前端性能41WebAssembly40测试40AI 工程37SvelteKit37Go35前端数据管理30React Router29AI 全栈28Svelte27算法12Java10数据结构5前端手写题3
AI 开发 标签25 个
向量检索59向量与嵌入47RAG41知识库数据37AI 评测36模型与应用评测36RAG 检索31微调与数据31大模型基础29Prompt28提示与上下文设计27多模态应用24安全11离线应用11测试9
查看其余 10 个标签
性能优化5可观测性4构建工具4缓存4工具调用3Agent 记忆2容器化1数据库事务1流处理1路由1
当前页05 / 6

正在显示第 201–250 题

AI 开发50
第 5 页

本页面试问题

按稳定语义路径排序

  1. 0201
    AI 开发知识库数据

    RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息?

    围绕“RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出文档 ID、起止偏移、页码、章节路径等定位字段及跨分块还原原文的方法。

    核心关键词引用位置 偏移量 原文映射 分块元数据
    #知识库数据#RAG
  2. 0202
    AI 开发知识库数据

    引用中展示的来源链接经常 404,知识库入库时应如何处理来源 URL 才能保证长期可引用?

    围绕“引用中展示的来源链接经常 404,知识库入库时应如何处理来源 URL 才能保证长期可引用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出保存原始 URL、归档快照、规范化永久链接三层策略。

    核心关键词来源链接 404 稳定性 引用持久
    #知识库数据
  3. 0203
    AI 开发知识库数据

    技术文档入库时,为什么代码块必须作为整体保留而不能被普通分块逻辑切开?

    围绕“技术文档入库时,为什么代码块必须作为整体保留而不能被普通分块逻辑切开”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明代码语义边界与函数/类对齐的切分策略。

    核心关键词代码块 分块 完整性 技术文档
    #知识库数据
  4. 0204
    AI 开发知识库数据

    同一内容来自多个来源(官网与镜像站)被重复收录,去重时应保留哪一份的元数据?

    围绕“同一内容来自多个来源(官网与镜像站)被重复收录,去重时应保留哪一份的元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出按来源权威性、更新时间、可引用 URL 稳定性选择主副本的规则。

    核心关键词跨来源重复 合并 元数据权威性
    #知识库数据#容器化
  5. 0205
    AI 开发知识库数据

    去重应该发生在嵌入计算之前还是之后,两个顺序各浪费或节省什么成本?

    围绕“去重应该发生在嵌入计算之前还是之后,两个顺序各浪费或节省什么成本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出先文本去重省嵌入费用、后向量去重能发现语义重复的成本收益判断。

    核心关键词去重时机 嵌入成本 管道顺序优化
    #知识库数据#向量检索
  6. 0206
    AI 开发知识库数据

    文档删除后,答案缓存、查询日志、微调数据集中残留的该文档内容如何处理?

    围绕“文档删除后,答案缓存、查询日志、微调数据集中残留的该文档内容如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出缓存失效、日志脱敏、派生数据集再生成三类派生数据的清理责任。

    核心关键词删除残留 缓存 日志 派生数据清理
    #知识库数据#缓存#可观测性
  7. 0207
    AI 开发知识库数据

    源文档删除后,为什么只删文档记录不够,还要保证其所有分块和向量一并清除?

    围绕“源文档删除后,为什么只删文档记录不够,还要保证其所有分块和向量一并清除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明孤儿分块仍会被检索命中造成已删内容泄露,给出按文档 ID 级联删除方案。

    核心关键词删除传播 分块清理 向量删除 级联
    #知识库数据#向量检索
  8. 0208
    AI 开发知识库数据

    企业知识库要求删除操作可审计,数据侧需要记录哪些信息又不违反删除本意?

    围绕“企业知识库要求删除操作可审计,数据侧需要记录哪些信息又不违反删除本意”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明记录操作者、时间、文档标识而不再留存内容本身的审计设计。

    核心关键词删除审计 操作日志 合规 最小留存
    #知识库数据#可观测性
  9. 0209
    AI 开发知识库数据

    知识库需要保留文档历史版本时,应为每个版本单独建块建向量还是只保留最新版本加版本元数据?

    围绕“知识库需要保留文档历史版本时,应为每个版本单独建块建向量还是只保留最新版本加版本元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比全版本可检索与仅最新可检索两种方案在存储、召回噪声上的取舍。

    核心关键词文档版本管理 历史版本 存储设计
    #知识库数据#向量检索
  10. 0210
    AI 开发知识库数据

    多来源文档入库后出现乱码,如何定位是编码声明错误还是解析器选择错误?

    围绕“多来源文档入库后出现乱码,如何定位是编码声明错误还是解析器选择错误”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出乱码诊断顺序:字节编码探测、声明与实际不一致、解析器回退。

    核心关键词文档乱码 编码检测 charset 解析器
    #知识库数据
  11. 0211
    AI 开发知识库数据

    知识库入库时用内容哈希做完全重复检测,为什么规范化步骤必须先于哈希计算?

    围绕“知识库入库时用内容哈希做完全重复检测,为什么规范化步骤必须先于哈希计算”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明空白、大小写、换行差异会导致同一内容哈希不同,给出规范化清单。

    核心关键词内容哈希 精确去重 文本规范化步骤
    #知识库数据
  12. 0212
    AI 开发知识库数据

    批量文档解析时页眉页脚和免责声明反复出现,应在解析层还是分块层去除?

    围绕“批量文档解析时页眉页脚和免责声明反复出现,应在解析层还是分块层去除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须论证在解析层基于位置与重复频率剔除样板文本优于分块后处理。

    核心关键词页眉页脚 样板文本 去除 解析 分块
    #知识库数据
  13. 0213
    AI 开发知识库数据

    爬取的 HTML 入库前清洗时,应该剔除哪些元素又必须保留哪些结构?

    围绕“爬取的 HTML 入库前清洗时,应该剔除哪些元素又必须保留哪些结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出剔除导航/脚本/广告与保留标题层级/表格/代码块的具体取舍标准。

    核心关键词HTML 清洗 正文提取 保留标题结构 RAG
    #知识库数据#RAG
  14. 0214
    AI 开发知识库数据

    知识库文档中纯图片承载的关键信息(如架构图),在解析阶段应如何处理?

    围绕“知识库文档中纯图片承载的关键信息(如架构图),在解析阶段应如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明纯文本管道的盲区及三种补偿手段(alt 文本、OCR、视觉模型描述)。

    核心关键词图片信息 解析 图文混排 知识库 RAG
    #知识库数据#RAG
  15. 0215
    AI 开发知识库数据

    知识库增量更新时,如何用最少成本判断一个源文档自上次同步后是否真的变了?

    围绕“知识库增量更新时,如何用最少成本判断一个源文档自上次同步后是否真的变了”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较 mtime、ETag、内容哈希三级检测的可靠性递进关系。

    核心关键词增量更新 变更检测 内容哈希 ETag
    #知识库数据#缓存
  16. 0216
    AI 开发知识库数据

    文档只改了一个段落,为什么增量更新往往需要重切整个文档而不是只替换那一个分块?

    围绕“文档只改了一个段落,为什么增量更新往往需要重切整个文档而不是只替换那一个分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明改动导致后续分块边界漂移使按位置替换失效,给出受影响范围界定方法。

    核心关键词增量更新 重切分块 边界漂移影响
    #知识库数据
  17. 0217
    AI 开发知识库数据

    一个回答综合了多个分块的内容,如何判定每个句子分别引用了哪些分块?

    围绕“一个回答综合了多个分块的内容,如何判定每个句子分别引用了哪些分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明生成时内联标注与生成后相似度回标两种归因方案及各自误差来源。

    核心关键词多来源归因 句子级引用 分块归属
    #知识库数据
  18. 0218
    AI 开发知识库数据

    文档库中大量只差几个字的文章,为什么精确哈希失效而需要 SimHash 或 MinHash?

    围绕“文档库中大量只差几个字的文章,为什么精确哈希失效而需要 SimHash 或 MinHash”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释局部敏感哈希把相似内容映射到相近签名的原理及阈值选择。

    核心关键词近似去重 SimHash MinHash 文档相似
    #知识库数据
  19. 0219
    AI 开发知识库数据

    文档解析流水线中单个文件解析失败时,应该跳过、重试还是整批中止?

    围绕“文档解析流水线中单个文件解析失败时,应该跳过、重试还是整批中止”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出失败隔离、记录坏文件清单、人工补录的管道设计决策。

    核心关键词解析失败 容错 降级策略 数据管道
    #知识库数据
  20. 0220
    AI 开发知识库数据

    RAG 知识库解析 PDF 时,为什么提取出的文本会丢失多栏排版和表格结构?

    围绕“RAG 知识库解析 PDF 时,为什么提取出的文本会丢失多栏排版和表格结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 PDF 按绘制指令而非语义结构存储文本导致阅读顺序错乱的原因。

    核心关键词PDF 解析 多栏排版 表格结构丢失 RAG
    #知识库数据#RAG
  21. 0221
    AI 开发知识库数据

    员工离职或调岗后,其在知识库中可见文档的权限变更多快必须生效,技术上如何保证?

    围绕“员工离职或调岗后,其在知识库中可见文档的权限变更多快必须生效,技术上如何保证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明元数据即时过滤优于重建索引的原因及缓存失效处理。

    核心关键词权限变更 生效延迟 离职 访问回收
    #知识库数据#缓存#安全
  22. 0222
    AI 开发知识库数据

    多租户知识库中,权限过滤应该放在向量检索之前、之中还是之后?

    围绕“多租户知识库中,权限过滤应该放在向量检索之前、之中还是之后”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比预过滤、索引内过滤、后过滤三方案在召回数量正确性与性能上的差异。

    核心关键词权限过滤 向量检索 前置过滤 后置过滤
    #知识库数据#向量检索#安全
  23. 0223
    AI 开发知识库数据

    文件夹授权给用户后,其中新增文档和已有文档的权限如何继承,知识库侧要避免什么坑?

    围绕“文件夹授权给用户后,其中新增文档和已有文档的权限如何继承,知识库侧要避免什么坑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明检索期动态解析继承优于入库期静态展开(避免授权变更漏更新)。

    核心关键词权限继承 目录层级 新增文档 授权陷阱
    #知识库数据#安全
  24. 0224
    AI 开发知识库数据

    扫描版 PDF 进入知识库前,为什么必须走 OCR 而不是直接文本提取?

    围绕“扫描版 PDF 进入知识库前,为什么必须走 OCR 而不是直接文本提取”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分原生文字层与位图图像两种 PDF 内容形态并给出判断方法。

    核心关键词扫描 PDF OCR 文本提取 知识库
    #知识库数据
  25. 0225
    AI 开发知识库数据

    用语义相似度做知识库去重时,阈值设高了漏删、设低了误删,如何确定和验证阈值?

    围绕“用语义相似度做知识库去重时,阈值设高了漏删、设低了误删,如何确定和验证阈值”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出抽样人工标注、按分数分布选拐点、保留双向引用的验证流程。

    核心关键词语义去重 相似度阈值 验证方法
    #知识库数据
  26. 0226
    AI 开发知识库数据

    知识库删除采用软删除标记还是物理删除,合规要求彻底删除时应选哪种?

    围绕“知识库删除采用软删除标记还是物理删除,合规要求彻底删除时应选哪种”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明软删除对向量索引与备份中残留数据的合规风险及彻底清除范围。

    核心关键词软删除 物理删除 合规要求
    #知识库数据#向量检索
  27. 0227
    AI 开发知识库数据

    DOCX 与 PPTX 入库解析的主要差异是什么,为什么不能共用同一段提取逻辑?

    围绕“DOCX 与 PPTX 入库解析的主要差异是什么,为什么不能共用同一段提取逻辑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明段落流式文档与分页视觉文档在语义单元上的本质差异。

    核心关键词DOCX PPTX 解析差异 结构化文档解析
    #知识库数据#流处理
  28. 0228
    AI 开发知识库数据

    增量同步任务中途失败,如何避免知识库停留在部分更新的不一致状态?

    围绕“增量同步任务中途失败,如何避免知识库停留在部分更新的不一致状态”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出批次幂等、游标断点续传、校验后提交的恢复设计。

    核心关键词同步失败 部分更新 一致性事务
    #知识库数据#数据库事务
  29. 0229
    AI 开发知识库数据

    知识库中的表格应该序列化成什么形式才能让嵌入模型正确理解行列关系?

    围绕“知识库中的表格应该序列化成什么形式才能让嵌入模型正确理解行列关系”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较 Markdown 表、逐行展开、行列拼接三种序列化对检索的影响。

    核心关键词表格序列化 Markdown 表 嵌入 行列关系
    #知识库数据
  30. 0230
    AI 开发知识库数据

    知识库同步频率设为分钟级还是天级,这个决策应该由哪些因素驱动?

    围绕“知识库同步频率设为分钟级还是天级,这个决策应该由哪些因素驱动”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出由内容变更率、查询对时效敏感度、重建成本三者决定的判断框架。

    核心关键词同步频率 数据新鲜度 成本权衡
    #知识库数据
  31. 0231
    AI 开发知识库数据

    同一文档的新旧版本同时存在于知识库,检索时答案互相矛盾,如何从数据侧根治?

    围绕“同一文档的新旧版本同时存在于知识库,检索时答案互相矛盾,如何从数据侧根治”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明按版本号或生效时间过滤及旧版本及时失效的机制。

    核心关键词版本冲突 检索矛盾 旧版本清理
    #知识库数据
  32. 0232
    AI 开发RAG 检索

    RAG 分块时为什么要设置 chunk overlap(重叠),重叠过大有什么副作用?

    围绕“RAG 分块时为什么要设置 chunk overlap(重叠),重叠过大有什么副作用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答重叠如何保护跨边界语义、以及重叠带来的重复内容与索引膨胀代价。

    核心关键词RAG chunk overlap 重叠 副作用
    #RAG 检索#RAG
  33. 0233
    AI 开发RAG 检索

    RAG 中如何确定文本分块(chunk)的大小,过大和过小分别会导致什么检索问题?

    围绕“RAG 中如何确定文本分块(chunk)的大小,过大和过小分别会导致什么检索问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确块大小对召回语义完整性与嵌入精度的双向影响。

    核心关键词RAG chunk size 分块大小 权衡
    #RAG 检索#RAG
  34. 0234
    AI 开发RAG 检索

    RAG 如何让生成答案带引用来源,上下文组装阶段需要给每个文档块附加什么信息?

    围绕“RAG 如何让生成答案带引用来源,上下文组装阶段需要给每个文档块附加什么信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答块级来源标识注入与提示模型引用编号的机制。

    核心关键词RAG 引用来源 上下文标注
    #RAG 检索#RAG#安全
  35. 0235
    AI 开发RAG 检索

    父子分块或重叠分块的 RAG 系统在组装上下文时如何去重合并,避免同一内容重复占用 token?

    围绕“父子分块或重叠分块的 RAG 系统在组装上下文时如何去重合并,避免同一内容重复占用 token”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答按父文档聚合或相邻块合并的具体做法。

    核心关键词RAG 上下文去重 合并 重叠 chunk
    #RAG 检索#RAG
  36. 0236
    AI 开发RAG 检索

    RAG 组装上下文时如何在有限 token 预算内分配系统提示、历史对话和检索文档,超预算时应优先砍哪部分?

    围绕“RAG 组装上下文时如何在有限 token 预算内分配系统提示、历史对话和检索文档,超预算时应优先砍哪部分”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出优先级排序与截断策略的判断。

    核心关键词RAG 上下文窗口 token 预算 截断策略
    #RAG 检索#RAG
  37. 0237
    AI 开发RAG 检索

    LangChain 的 ContextualCompressionRetriever 如何只保留文档中与问题相关的部分,它解决的是什么具体问题?

    围绕“LangChain 的 ContextualCompressionRetriever 如何只保留文档中与问题相关的部”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答长文档召回后抽取相关片段以降低噪声与 token 成本。

    核心关键词ContextualCompressionRetriever 上下文压缩
    #RAG 检索#RAG
  38. 0238
    AI 开发RAG 检索

    RAG 系统选择嵌入(embedding)模型时应依据哪些维度,为什么嵌入模型换了必须重建索引?

    围绕“RAG 系统选择嵌入(embedding)模型时应依据哪些维度,为什么嵌入模型换了必须重建索引”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答向量空间一致性要求及语言、维度、领域匹配等选择标准。

    核心关键词RAG embedding 模型选择 重建索引原因
    #RAG 检索#RAG#向量检索
  39. 0239
    AI 开发RAG 检索

    RAG 为什么需要向量检索与关键词检索(BM25)混合,单靠向量检索在哪类查询上会系统性失败?

    围绕“RAG 为什么需要向量检索与关键词检索(BM25)混合,单靠向量检索在哪类查询上会系统性失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须指出专有名词、编号、精确字符串等向量检索失效场景。

    核心关键词RAG 混合检索 必要性 失败场景
    #RAG 检索#RAG#向量检索
  40. 0240
    AI 开发RAG 检索

    RAG 中 HyDE(假设文档嵌入)检索的原理是什么,为什么它对短问题比长问题更有帮助?

    围绕“RAG 中 HyDE(假设文档嵌入)检索的原理是什么,为什么它对短问题比长问题更有帮助”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答先生成假想答案再嵌入检索的机制及短查询受益原因。

    核心关键词RAG HyDE 假设文档 检索原理
    #RAG 检索#RAG
  41. 0241
    AI 开发RAG 检索

    文档频繁更新的 RAG 系统如何做增量索引,如何避免删除文档的旧向量仍被召回?

    围绕“文档频繁更新的 RAG 系统如何做增量索引,如何避免删除文档的旧向量仍被召回”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确按文档 ID 的 upsert/删除与索引一致性问题。

    核心关键词RAG 增量索引 文档更新 删除旧向量
    #RAG 检索#RAG#向量检索
  42. 0242
    AI 开发RAG 检索

    RAG 处理 Markdown 或代码文档时为什么需要结构化感知分块,直接用字符切分会破坏什么?

    围绕“RAG 处理 Markdown 或代码文档时为什么需要结构化感知分块,直接用字符切分会破坏什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确标题层级/代码块边界被破坏的后果及按结构切分的做法。

    核心关键词RAG Markdown 代码 结构化分块 保结构
    #RAG 检索#RAG
  43. 0243
    AI 开发RAG 检索

    RAG 检索前用元数据过滤(如租户、时间、文档类型)为什么应在向量搜索阶段下推而不是召回后再过滤?

    围绕“RAG 检索前用元数据过滤(如租户、时间、文档类型)为什么应在向量搜索阶段下推而不是召回后再过滤”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确后置过滤导致 top-k 有效结果不足的问题及过滤下推的做法。

    核心关键词RAG 元数据过滤 下推到向量搜索
    #RAG 检索#RAG#向量检索
  44. 0244
    AI 开发RAG 检索

    RAG 中最大边际相关性(MMR)检索如何解决 top-k 结果内容重复的问题?

    围绕“RAG 中最大边际相关性(MMR)检索如何解决 top-k 结果内容重复的问题”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明相关性-多样性平衡公式思路及 lambda 参数含义。

    核心关键词RAG MMR 最大边际相关性 多样性
    #RAG 检索#RAG
  45. 0245
    AI 开发RAG 检索

    LangChain 的 MultiQueryRetriever 通过生成多个查询变体提升召回,它的适用场景和成本代价是什么?

    围绕“LangChain 的 MultiQueryRetriever 通过生成多个查询变体提升召回,它的适用场景和成本代价”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确 LLM 生成改写查询再合并去重的机制及延迟成本。

    核心关键词MultiQueryRetriever 多查询变体 提升召回
    #RAG 检索#RAG
  46. 0246
    AI 开发RAG 检索

    多租户 RAG 系统如何利用元数据过滤保证租户间数据不串,仅靠 prompt 声明租户为什么不可靠?

    围绕“多租户 RAG 系统如何利用元数据过滤保证租户间数据不串,仅靠 prompt 声明租户为什么不可靠”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答检索层强制过滤的必要性及 prompt 层约束可被绕过的问题。

    核心关键词RAG 多租户 数据隔离 metadata filter
    #RAG 检索#RAG#Prompt
  47. 0247
    AI 开发RAG 检索

    RAG 检索结果为空或全部低于阈值时系统应如何兜底,直接把所有问题交给 LLM 自由回答有什么风险?

    围绕“RAG 检索结果为空或全部低于阈值时系统应如何兜底,直接把所有问题交给 LLM 自由回答有什么风险”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答阈值判空、拒答或降级策略及幻觉风险控制。

    核心关键词RAG 无检索结果 兜底 幻觉风险
    #RAG 检索#RAG
  48. 0248
    AI 开发RAG 检索

    RAG 检索质量差但定位发现源头在 PDF 解析阶段,乱码、栏序错乱会如何传导到分块与嵌入?

    围绕“RAG 检索质量差但定位发现源头在 PDF 解析阶段,乱码、栏序错乱会如何传导到分块与嵌入”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确解析错误经分块放大为噪声块的传导链。

    核心关键词RAG PDF 解析 乱码 分栏 传导影响
    #RAG 检索#RAG
  49. 0249
    AI 开发RAG 检索

    用户提问用词和文档措辞差异大导致 RAG 召回失败,除了换嵌入模型还有哪些检索侧手段?

    围绕“用户提问用词和文档措辞差异大导致 RAG 召回失败,除了换嵌入模型还有哪些检索侧手段”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答查询改写、混合检索、假设文档嵌入等检索侧方案。

    核心关键词RAG 词汇不匹配 查询文档措辞差异 召回手段
    #RAG 检索#RAG
  50. 0250
    AI 开发RAG 检索

    RAG 中的查询改写(query rewriting)解决什么问题,为什么多轮对话里直接用用户原话检索会失败?

    围绕“RAG 中的查询改写(query rewriting)解决什么问题,为什么多轮对话里直接用用户原话检索会失败”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要明确指代/省略导致的检索意图缺失及改写为独立查询的做法。

    核心关键词RAG 查询改写 多轮对话 指代消解
    #RAG 检索#RAG
上一页
1…3456
下一页
前端进阶之旅本地 Markdown 维护 · 服务端分页 · 完整内容对用户与搜索引擎一致