前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库第 67 页
面试知识索引 · 分类、标签与搜索

5000 道程序员面试题,每题都有完整答案

程序员面试题库第 67 页,收录第 3301–3350 题,共 5000 道完整解析,覆盖前端、JavaScript、React、Vue、Node.js、AI Agent、网络、数据库与系统设计。

5,000完整问题
52技术分类
178检索标签
100索引分页
按分类建立知识面,再用标签和搜索定位问题

每页只渲染 50 道题。分类与标签分页可抓取,自由搜索结果不会制造无限 SEO 页面。

快速定位

分类、标签与关键词搜索

题库检索
技术分类52 个
全部分类5000AI Agent511浏览器301JavaScript285React281AI 开发262CSS240Node.js217TypeScript206Vue180前端工程化138React Native135
查看全部 52 个分类
操作系统135数据库134Docker95计算机网络94API 设计90Kubernetes90HTML89Redis89全栈开发88分布式系统88系统设计86HTTP85Next.js60Angular58Linux53Nuxt51PostgreSQL46可观测性46设计模式46小程序45身份与权限45无障碍44MongoDB43PWA43Web 安全43Git42前端测试42前端性能41WebAssembly40测试40AI 工程37SvelteKit37Go35前端数据管理30React Router29AI 全栈28Svelte27算法12Java10数据结构5前端手写题3
热门标签178 个
并发编程448缓存355性能优化340安全336异步编程292类型系统215构建工具211容器化184流处理177表单157SQL148HTTP141路由140离线应用121网络协议111
查看其余 163 个标签
测试109数据库事务95实时通信92Web 可访问性90动画79可观测性77Agent 记忆75向量检索66工具调用66LangGraph59Prompt56任务规划53排障与运维53数据库索引52浏览器自动化51Flexbox50值与类型50GraphQL49事务与并发49构建与镜像49DNS 与 TLS48工程协作与交付48AI 评测47CSS Grid47Express 服务47MCP47副作用与同步47向量与嵌入47文件与多媒体47流与二进制47传输与协议46列表与性能46可维护代码46响应式原理46容器运行46指标日志追踪46数据建模与运维46文件与 I/O46表单与输入46MCP 协议45RAG45Vite 与模块构建45Webpack45内存与虚拟化45原生集成45多 Agent45工作负载与发布45应用与性能45数据处理45模块与工具链45组件与模板45缓存与数据结构45网络与运维45评估与调试45身份认证与授权45运行时与开发45Web 系统方案44一致性与容错44侦听与生命周期44分布式使用44原生组件与交互44可访问交互44消息与异步处理44渲染与调度44索引与执行计划44组件设计44缓存与代理44进程与并发44层叠与选择器43攻击面与防御43文档数据库43权限与安全43离线与渐进增强43语义与文档43请求与通信 API43Worker 与线程协作42事件系统42存储与离线数据42服务架构42服务端与流式渲染42服务端工程42泛型设计42版本控制42类型收窄42类型运算42组件与端到端42编码与执行42进程与线程42DOM 与文档操作41Flex 布局41HTTP 语义41NestJS 架构41REST 与接口契约41SQL 查询41加载与交互性能41动画与视觉41类型工程41记忆与状态41运行时与调度41Agent 架构40WebAssembly 集成40单元与集成测试40多 Agent 协作40工作流编排40模块与语言机制40浏览器与 UI 自动化40生产运行40函数与作用域39响应式设计39性能与并发39类型系统基础39Grid 布局38数组与集合38盒模型与排版38Hooks 与复用37应用开发37推理与成本37状态共享37知识库数据37模型与应用评测36对象与原型35状态与渲染35语言与并发35异步与 Promise34Effect32RAG 检索31React 性能31响应式与性能31微调与数据31TanStack Query30全栈边界30数据与缓存30大模型基础29路由与数据流29事件循环28流式交互28提示与上下文设计27数据与服务端27组件与依赖注入27组件与响应式27多模态应用24应用与渲染24Hydration22沙箱安全22状态管理18算法18CI/CD13语言与运行时10React Server Components6搜索与排序4实用函数实现3链表栈队列3图算法2字符串算法2树与遍历2索引与高级结构2Kubernetes1作用域与函数1动态规划1异步与浏览器1手写与交互性能1数组与双指针1相等比较1
当前页67 / 100

正在显示第 3301–3350 题

AI 开发37PWA13
第 67 页

本页面试问题

按稳定语义路径排序

  1. 3301
    PWA离线与渐进增强

    navigator.serviceWorker.register 的 scope 参数和 Service-Worker-Allowed 响应头各自起什么作用?

    围绕“navigator.serviceWorker.register 的 scope 参数和 Service-Worke”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖区分脚本路径、scope 参数与响应头三者的优先级关系。

    核心关键词register scope Service-Worker-Allowed
    #离线与渐进增强#离线应用#HTTP
  2. 3302
    PWA离线与渐进增强

    Service Worker 为什么不能直接访问 DOM,离线场景下如何与页面通信?

    围绕“Service Worker 为什么不能直接访问 DOM,离线场景下如何与页面通信”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖解释线程模型限制与 postMessage 通信方式。

    核心关键词Service Worker DOM 通信 postMessage
    #离线与渐进增强#离线应用#并发编程
  3. 3303
    PWA离线与渐进增强

    为什么建议对 Service Worker 脚本本身设置很短的 HTTP 缓存或使用 no-cache?

    围绕“为什么建议对 Service Worker 脚本本身设置很短的 HTTP 缓存或使用 no-cache”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖解释脚本被长缓存导致更新延迟的机制,不讲 SW 内部资源缓存。

    核心关键词Service Worker 脚本 HTTP缓存 max-age
    #离线与渐进增强#缓存#离线应用
  4. 3304
    PWA离线与渐进增强

    ServiceWorkerGlobalScope.skipWaiting() 解决了什么问题,直接使用有什么风险?

    围绕“ServiceWorkerGlobalScope.skipWaiting() 解决了什么问题,直接使用有什么风险”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明跳过等待期的收益与新旧 SW 混跑的资源不一致风险,不讲 clients.claim。

    核心关键词skipWaiting 作用 风险
    #离线与渐进增强#离线应用#并发编程
  5. 3305
    PWA离线与渐进增强

    Stale-While-Revalidate 策略如何实现,为什么它适合列表页这类场景?

    围绕“Stale-While-Revalidate 策略如何实现,为什么它适合列表页这类场景”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明先返缓存再后台更新的流程与一致性代价。

    核心关键词Stale While Revalidate 实现原理 适用场景
    #离线与渐进增强#缓存#离线应用
  6. 3306
    PWA离线与渐进增强

    PWA 如何用 StorageManager.estimate() 监控缓存占用,浏览器在什么情况下会主动清除站点存储?

    围绕“PWA 如何用 StorageManager.estimate() 监控缓存占用,浏览器在什么情况下会主动清除站点存”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明配额查询与 LRU 驱逐策略及 persistent 申请,不讲缓存清理代码。

    核心关键词StorageManager estimate 配额 存储驱逐
    #离线与渐进增强#缓存#离线应用
  7. 3307
    PWA离线与渐进增强

    什么时候应该注销 Service Worker,unregister() 之后缓存会一起清除吗?

    围绕“什么时候应该注销 Service Worker,unregister() 之后缓存会一起清除吗”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明注销的适用场景及缓存需手动清除的事实,不讲注册流程。

    核心关键词Service Worker unregister 注销 清缓存
    #离线与渐进增强#缓存#离线应用
  8. 3308
    PWA离线与渐进增强

    浏览器如何检测 Service Worker 脚本有更新,byte 比较和 24 小时检查规则是什么?

    围绕“浏览器如何检测 Service Worker 脚本有更新,byte 比较和 24 小时检查规则是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明更新触发时机与字节级比较规则。

    核心关键词Service Worker 更新检测 24小时 update
    #离线与渐进增强#离线应用#并发编程
  9. 3309
    PWA离线与渐进增强

    部署了新代码但用户仍看到旧页面,从 Service Worker 角度列出最可能的原因清单?

    围绕“部署了新代码但用户仍看到旧页面,从 Service Worker 角度列出最可能的原因清单”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕系统性列举缓存名未变、waiting 未激活、HTTP 缓存脚本等原因,不深入单点。

    核心关键词Service Worker 不更新 排查
    #离线与渐进增强#缓存#离线应用
  10. 3310
    PWA离线与渐进增强

    PWA 缓存如何设计版本化命名,保证发布新版本时旧缓存被安全替换?

    围绕“PWA 缓存如何设计版本化命名,保证发布新版本时旧缓存被安全替换”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖给出命名约定与 activate 清理配合的发布流程,不讲具体策略选择。

    核心关键词缓存版本命名 版本迁移
    #离线与渐进增强#缓存#离线应用
  11. 3311
    PWA离线与渐进增强

    新版 Service Worker 进入 waiting 状态后,如何设计「发现新版本,点击刷新」的更新提示?

    围绕“新版 Service Worker 进入 waiting 状态后,如何设计「发现新版本,点击刷新」的更新提示”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖描述注册对象监听与页面提示、确认后激活的流程。

    核心关键词Service Worker waiting 更新提示 postMessage
    #离线与渐进增强#离线应用#并发编程
  12. 3312
    PWA离线与渐进增强

    Web App Manifest 中哪些字段影响 PWA 的可安装性,display 各取值有什么区别?

    围绕“Web App Manifest 中哪些字段影响 PWA 的可安装性,display 各取值有什么区别”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖列出安装判定相关字段与 display 模式差异,不讲 Service Worker。

    核心关键词Web App Manifest 可安装 display
    #离线与渐进增强#离线应用#并发编程
  13. 3313
    PWA离线与渐进增强

    Service Worker 的 scope 为什么决定它能控制哪些页面,如何影响 PWA 的目录结构部署?

    围绕“Service Worker 的 scope 为什么决定它能控制哪些页面,如何影响 PWA 的目录结构部署”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖解释注册路径与 scope 的匹配规则及部署到子目录的后果。

    核心关键词Service Worker scope 作用域 控制页面
    #离线与渐进增强#离线应用#并发编程
  14. 3314
    AI 开发知识库数据

    知识库重建期间如何保证线上检索不中断且不会查到新旧混合的数据?

    围绕“知识库重建期间如何保证线上检索不中断且不会查到新旧混合的数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明双索引构建加原子指针切换的方案及旧索引下线时机。

    核心关键词原子切换 蓝绿部署 零停机重建
    #知识库数据#构建工具
  15. 3315
    AI 开发知识库数据

    多个文档共用的章节(如统一的安装说明)被去重删掉后,检索上下文反而缺失怎么办?

    围绕“多个文档共用的章节(如统一的安装说明)被去重删掉后,检索上下文反而缺失怎么办”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明改用引用指针代替物理复制的方案及检索时展开引用的做法。

    核心关键词共享章节 去重误删 上下文保护
    #知识库数据
  16. 3316
    AI 开发知识库数据

    多个文档引用同一段共享内容,删除其中一个文档时如何避免误删仍被其他文档引用的分块?

    围绕“多个文档引用同一段共享内容,删除其中一个文档时如何避免误删仍被其他文档引用的分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出引用计数或归属关系建模,仅在引用归零时物理删除分块。

    核心关键词级联删除 共享分块 引用计数
    #知识库数据
  17. 3317
    AI 开发知识库数据

    分块后级别做去重与文档级去重各自的适用场景和副作用是什么?

    围绕“分块后级别做去重与文档级去重各自的适用场景和副作用是什么”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比两种粒度对召回冗余与误删共享段落(如法律条文引用)的影响。

    核心关键词分块去重 文档级去重 粒度权衡
    #知识库数据
  18. 3318
    AI 开发知识库数据

    为支撑去重、增量更新、版本、引用、权限五类能力,分块入库时的元数据最小集合应包含哪些字段?

    围绕“为支撑去重、增量更新、版本、引用、权限五类能力,分块入库时的元数据最小集合应包含哪些字段”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖回答需要围绕必须汇总文档 ID、内容哈希、版本、偏移位置、ACL 五类字段并说明各支撑哪项能力。

    核心关键词分块元数据 字段设计 去重 权限 引用
    #知识库数据#安全
  19. 3319
    AI 开发知识库数据

    引用标注到文档级、段落级还是句子级,粒度选择对可信度和系统复杂度各有什么影响?

    围绕“引用标注到文档级、段落级还是句子级,粒度选择对可信度和系统复杂度各有什么影响”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比三种粒度在用户信任、定位成本、幻觉核查上的差异。

    核心关键词引用粒度 段落级 句子级 可信度
    #知识库数据
  20. 3320
    AI 开发知识库数据

    RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息?

    围绕“RAG 回答要标注引用位置到原文段落,分块入库时必须保存哪些位置信息”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出文档 ID、起止偏移、页码、章节路径等定位字段及跨分块还原原文的方法。

    核心关键词引用位置 偏移量 原文映射 分块元数据
    #知识库数据#RAG
  21. 3321
    AI 开发知识库数据

    引用中展示的来源链接经常 404,知识库入库时应如何处理来源 URL 才能保证长期可引用?

    围绕“引用中展示的来源链接经常 404,知识库入库时应如何处理来源 URL 才能保证长期可引用”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出保存原始 URL、归档快照、规范化永久链接三层策略。

    核心关键词来源链接 404 稳定性 引用持久
    #知识库数据
  22. 3322
    AI 开发知识库数据

    技术文档入库时,为什么代码块必须作为整体保留而不能被普通分块逻辑切开?

    围绕“技术文档入库时,为什么代码块必须作为整体保留而不能被普通分块逻辑切开”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明代码语义边界与函数/类对齐的切分策略。

    核心关键词代码块 分块 完整性 技术文档
    #知识库数据
  23. 3323
    AI 开发知识库数据

    同一内容来自多个来源(官网与镜像站)被重复收录,去重时应保留哪一份的元数据?

    围绕“同一内容来自多个来源(官网与镜像站)被重复收录,去重时应保留哪一份的元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出按来源权威性、更新时间、可引用 URL 稳定性选择主副本的规则。

    核心关键词跨来源重复 合并 元数据权威性
    #知识库数据#容器化
  24. 3324
    AI 开发知识库数据

    去重应该发生在嵌入计算之前还是之后,两个顺序各浪费或节省什么成本?

    围绕“去重应该发生在嵌入计算之前还是之后,两个顺序各浪费或节省什么成本”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出先文本去重省嵌入费用、后向量去重能发现语义重复的成本收益判断。

    核心关键词去重时机 嵌入成本 管道顺序优化
    #知识库数据#向量检索
  25. 3325
    AI 开发知识库数据

    文档删除后,答案缓存、查询日志、微调数据集中残留的该文档内容如何处理?

    围绕“文档删除后,答案缓存、查询日志、微调数据集中残留的该文档内容如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须列出缓存失效、日志脱敏、派生数据集再生成三类派生数据的清理责任。

    核心关键词删除残留 缓存 日志 派生数据清理
    #知识库数据#缓存#可观测性
  26. 3326
    AI 开发知识库数据

    源文档删除后,为什么只删文档记录不够,还要保证其所有分块和向量一并清除?

    围绕“源文档删除后,为什么只删文档记录不够,还要保证其所有分块和向量一并清除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明孤儿分块仍会被检索命中造成已删内容泄露,给出按文档 ID 级联删除方案。

    核心关键词删除传播 分块清理 向量删除 级联
    #知识库数据#向量检索
  27. 3327
    AI 开发知识库数据

    企业知识库要求删除操作可审计,数据侧需要记录哪些信息又不违反删除本意?

    围绕“企业知识库要求删除操作可审计,数据侧需要记录哪些信息又不违反删除本意”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明记录操作者、时间、文档标识而不再留存内容本身的审计设计。

    核心关键词删除审计 操作日志 合规 最小留存
    #知识库数据#可观测性
  28. 3328
    AI 开发知识库数据

    知识库需要保留文档历史版本时,应为每个版本单独建块建向量还是只保留最新版本加版本元数据?

    围绕“知识库需要保留文档历史版本时,应为每个版本单独建块建向量还是只保留最新版本加版本元数据”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比全版本可检索与仅最新可检索两种方案在存储、召回噪声上的取舍。

    核心关键词文档版本管理 历史版本 存储设计
    #知识库数据#向量检索
  29. 3329
    AI 开发知识库数据

    多来源文档入库后出现乱码,如何定位是编码声明错误还是解析器选择错误?

    围绕“多来源文档入库后出现乱码,如何定位是编码声明错误还是解析器选择错误”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出乱码诊断顺序:字节编码探测、声明与实际不一致、解析器回退。

    核心关键词文档乱码 编码检测 charset 解析器
    #知识库数据
  30. 3330
    AI 开发知识库数据

    知识库入库时用内容哈希做完全重复检测,为什么规范化步骤必须先于哈希计算?

    围绕“知识库入库时用内容哈希做完全重复检测,为什么规范化步骤必须先于哈希计算”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明空白、大小写、换行差异会导致同一内容哈希不同,给出规范化清单。

    核心关键词内容哈希 精确去重 文本规范化步骤
    #知识库数据
  31. 3331
    AI 开发知识库数据

    批量文档解析时页眉页脚和免责声明反复出现,应在解析层还是分块层去除?

    围绕“批量文档解析时页眉页脚和免责声明反复出现,应在解析层还是分块层去除”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须论证在解析层基于位置与重复频率剔除样板文本优于分块后处理。

    核心关键词页眉页脚 样板文本 去除 解析 分块
    #知识库数据
  32. 3332
    AI 开发知识库数据

    爬取的 HTML 入库前清洗时,应该剔除哪些元素又必须保留哪些结构?

    围绕“爬取的 HTML 入库前清洗时,应该剔除哪些元素又必须保留哪些结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出剔除导航/脚本/广告与保留标题层级/表格/代码块的具体取舍标准。

    核心关键词HTML 清洗 正文提取 保留标题结构 RAG
    #知识库数据#RAG
  33. 3333
    AI 开发知识库数据

    知识库文档中纯图片承载的关键信息(如架构图),在解析阶段应如何处理?

    围绕“知识库文档中纯图片承载的关键信息(如架构图),在解析阶段应如何处理”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明纯文本管道的盲区及三种补偿手段(alt 文本、OCR、视觉模型描述)。

    核心关键词图片信息 解析 图文混排 知识库 RAG
    #知识库数据#RAG
  34. 3334
    AI 开发知识库数据

    知识库增量更新时,如何用最少成本判断一个源文档自上次同步后是否真的变了?

    围绕“知识库增量更新时,如何用最少成本判断一个源文档自上次同步后是否真的变了”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较 mtime、ETag、内容哈希三级检测的可靠性递进关系。

    核心关键词增量更新 变更检测 内容哈希 ETag
    #知识库数据#缓存
  35. 3335
    AI 开发知识库数据

    文档只改了一个段落,为什么增量更新往往需要重切整个文档而不是只替换那一个分块?

    围绕“文档只改了一个段落,为什么增量更新往往需要重切整个文档而不是只替换那一个分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明改动导致后续分块边界漂移使按位置替换失效,给出受影响范围界定方法。

    核心关键词增量更新 重切分块 边界漂移影响
    #知识库数据
  36. 3336
    AI 开发知识库数据

    一个回答综合了多个分块的内容,如何判定每个句子分别引用了哪些分块?

    围绕“一个回答综合了多个分块的内容,如何判定每个句子分别引用了哪些分块”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明生成时内联标注与生成后相似度回标两种归因方案及各自误差来源。

    核心关键词多来源归因 句子级引用 分块归属
    #知识库数据
  37. 3337
    AI 开发知识库数据

    文档库中大量只差几个字的文章,为什么精确哈希失效而需要 SimHash 或 MinHash?

    围绕“文档库中大量只差几个字的文章,为什么精确哈希失效而需要 SimHash 或 MinHash”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要解释局部敏感哈希把相似内容映射到相近签名的原理及阈值选择。

    核心关键词近似去重 SimHash MinHash 文档相似
    #知识库数据
  38. 3338
    AI 开发知识库数据

    文档解析流水线中单个文件解析失败时,应该跳过、重试还是整批中止?

    围绕“文档解析流水线中单个文件解析失败时,应该跳过、重试还是整批中止”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出失败隔离、记录坏文件清单、人工补录的管道设计决策。

    核心关键词解析失败 容错 降级策略 数据管道
    #知识库数据
  39. 3339
    AI 开发知识库数据

    RAG 知识库解析 PDF 时,为什么提取出的文本会丢失多栏排版和表格结构?

    围绕“RAG 知识库解析 PDF 时,为什么提取出的文本会丢失多栏排版和表格结构”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明 PDF 按绘制指令而非语义结构存储文本导致阅读顺序错乱的原因。

    核心关键词PDF 解析 多栏排版 表格结构丢失 RAG
    #知识库数据#RAG
  40. 3340
    AI 开发知识库数据

    员工离职或调岗后,其在知识库中可见文档的权限变更多快必须生效,技术上如何保证?

    围绕“员工离职或调岗后,其在知识库中可见文档的权限变更多快必须生效,技术上如何保证”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明元数据即时过滤优于重建索引的原因及缓存失效处理。

    核心关键词权限变更 生效延迟 离职 访问回收
    #知识库数据#缓存#安全
  41. 3341
    AI 开发知识库数据

    多租户知识库中,权限过滤应该放在向量检索之前、之中还是之后?

    围绕“多租户知识库中,权限过滤应该放在向量检索之前、之中还是之后”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须对比预过滤、索引内过滤、后过滤三方案在召回数量正确性与性能上的差异。

    核心关键词权限过滤 向量检索 前置过滤 后置过滤
    #知识库数据#向量检索#安全
  42. 3342
    AI 开发知识库数据

    文件夹授权给用户后,其中新增文档和已有文档的权限如何继承,知识库侧要避免什么坑?

    围绕“文件夹授权给用户后,其中新增文档和已有文档的权限如何继承,知识库侧要避免什么坑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明检索期动态解析继承优于入库期静态展开(避免授权变更漏更新)。

    核心关键词权限继承 目录层级 新增文档 授权陷阱
    #知识库数据#安全
  43. 3343
    AI 开发知识库数据

    扫描版 PDF 进入知识库前,为什么必须走 OCR 而不是直接文本提取?

    围绕“扫描版 PDF 进入知识库前,为什么必须走 OCR 而不是直接文本提取”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须区分原生文字层与位图图像两种 PDF 内容形态并给出判断方法。

    核心关键词扫描 PDF OCR 文本提取 知识库
    #知识库数据
  44. 3344
    AI 开发知识库数据

    用语义相似度做知识库去重时,阈值设高了漏删、设低了误删,如何确定和验证阈值?

    围绕“用语义相似度做知识库去重时,阈值设高了漏删、设低了误删,如何确定和验证阈值”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出抽样人工标注、按分数分布选拐点、保留双向引用的验证流程。

    核心关键词语义去重 相似度阈值 验证方法
    #知识库数据
  45. 3345
    AI 开发知识库数据

    知识库删除采用软删除标记还是物理删除,合规要求彻底删除时应选哪种?

    围绕“知识库删除采用软删除标记还是物理删除,合规要求彻底删除时应选哪种”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明软删除对向量索引与备份中残留数据的合规风险及彻底清除范围。

    核心关键词软删除 物理删除 合规要求
    #知识库数据#向量检索
  46. 3346
    AI 开发知识库数据

    DOCX 与 PPTX 入库解析的主要差异是什么,为什么不能共用同一段提取逻辑?

    围绕“DOCX 与 PPTX 入库解析的主要差异是什么,为什么不能共用同一段提取逻辑”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明段落流式文档与分页视觉文档在语义单元上的本质差异。

    核心关键词DOCX PPTX 解析差异 结构化文档解析
    #知识库数据#流处理
  47. 3347
    AI 开发知识库数据

    增量同步任务中途失败,如何避免知识库停留在部分更新的不一致状态?

    围绕“增量同步任务中途失败,如何避免知识库停留在部分更新的不一致状态”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出批次幂等、游标断点续传、校验后提交的恢复设计。

    核心关键词同步失败 部分更新 一致性事务
    #知识库数据#数据库事务
  48. 3348
    AI 开发知识库数据

    知识库中的表格应该序列化成什么形式才能让嵌入模型正确理解行列关系?

    围绕“知识库中的表格应该序列化成什么形式才能让嵌入模型正确理解行列关系”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须比较 Markdown 表、逐行展开、行列拼接三种序列化对检索的影响。

    核心关键词表格序列化 Markdown 表 嵌入 行列关系
    #知识库数据
  49. 3349
    AI 开发知识库数据

    知识库同步频率设为分钟级还是天级,这个决策应该由哪些因素驱动?

    围绕“知识库同步频率设为分钟级还是天级,这个决策应该由哪些因素驱动”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖必须给出由内容变更率、查询对时效敏感度、重建成本三者决定的判断框架。

    核心关键词同步频率 数据新鲜度 成本权衡
    #知识库数据
  50. 3350
    AI 开发知识库数据

    同一文档的新旧版本同时存在于知识库,检索时答案互相矛盾,如何从数据侧根治?

    围绕“同一文档的新旧版本同时存在于知识库,检索时答案互相矛盾,如何从数据侧根治”给出直接结论、机制拆解、可复现验证、常见误区与追问,重点覆盖需要说明按版本号或生效时间过滤及旧版本及时失效的机制。

    核心关键词版本冲突 检索矛盾 旧版本清理
    #知识库数据
上一页
1…6566676869…100
下一页
前端进阶之旅本地 Markdown 维护 · 服务端分页 · 完整内容对用户与搜索引擎一致