前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9291
  • 用skilleval给Agent技能写自动化测试
  • 多租户Chatbot成本可视化的工程选型:OpenAI兼容API vs 原生API
  • 调查:五分之一美国工作者将任务委托给AI
  • 程序员视角:快速识别AI生成的网站
  • 认证聊天机器人流式后端的测试策略
  • GLM 5.3发布:基于5.2后训练刷新,编程评测开源SOTA
  • Code Agent运行机制详解:ReAct循环的工程实现
  • SharePoint 认证绕过漏洞 CVE-2026-55040 PoC 已公开
  • Node.js 长文本摘要:结构化输出校验与分块策略
  • 千问办公公测:GLM-5.3 与 DeepSeek V4 Pro 可直接选用
  • DeepSeek Harness 引发 Node.js 安装潮
  • GPT-5.6推理token按输出计费:成本估算可能偏差4倍
  • 开源模型评测工具:上线前用测试用例验证便宜模型
  • Anthropic缓存命中率低:实际节省分析
  • 多模态 LLM 生产级成本优化:视觉输入压缩与路由策略
  • SpaceX 60亿美元收购 Anysphere:Origin git平台才是真正的标的
  • DeepSeek 峰谷定价实战:Spring Boot 调度模式压榨成本
  • 昇腾 0 Day 适配小红书 dots3-note:全模态+投机解码
  • LabLLM:Mac 原生 App 从零训练小型语言模型
  • CLI-Anything:用标准接口让所有软件获得AI Agent原生支持
  • 长上下文没有杀死RAG:成本、延迟、可靠性三大陷阱
  • 一条YAML微调8B模型:4GB显存本地即可
  • 上下文已成平台能力:内部平台团队的新责任
  • 别信"完成了":强制AI Agent在报告前重新拉取真实状态
  • AI通过律师资格考试却不会比大小:理解AI的「参差不齐前沿」
  • Codex自动化研究:CUDA内核232倍加速实战
  • MCP令牌压缩91%:JSON Schema优化实践
  • Anthropic红队:多Agent冲突可升级为对抗行为
  • AI内容检测工具本质是玄学:连美国宪法都被误判为机器生成
  • Agent权限设计:批准前应展示被拒绝的替代方案
  • 新手用 Node.js 做内置聊天机器人:OpenAI 兼容接口是更优起点
  • 免费AI模型的危险命令如何通过许可证机制化险为夷
  • AI模型路由:为何单一LLM无法应对所有工作负载
  • 利用32k上下文窗口进行全仓库代码审查
  • MCP 协议 16 个月增长 970 倍:AI 应用的 USB-C 时刻来临
  • 2026 年开发者调研:Claude Code 登顶最受喜爱 AI 编程工具,Copilot 失势
  • ToolJet 开源版:拖拽构建内部工具/仪表盘/AI Agent
  • Cursor vs Copilot 2026:独立开发者选哪个更值
  • 2026年8月AI编程工具定价横评:14款工具日更比价
  • AI 时代瓶颈转移:理解代码比生成代码更难
  • Claude Code 2.1.233: Linux Bash 进程内存上限功能上线
  • TypeScript 多 Agent 系统实战:Orchestrator 与 Pipeline 模式解析
  • AI Agent 缺的不是记忆,而是执行收据
  • 用 LLM 构建 SLO 燃烧率告警处理 Agent
  • AI辅助移植25万行遗留气象模拟代码至GPU
  • Nature综述:AI药物发现现状、技术路径与未来挑战
  • Anthropic披露Claude生成内容水印技术细节
  • AI不是超越数学家,而是超越记忆
  • 中国廉价LLM API背后的GPU数学:为何$0.35/M成为可能
  • Windows MSYS2 幽灵路径 Bug:文件悄悄写入 C:\c\ 目录
  • Meta开源Muse Glimmer:300亿参数本地运行
  • 已加载 51 / 9291
8.0
热点
AI SCORE
技术实践2026-08-16 11:01

长上下文没有杀死RAG:成本、延迟、可靠性三大陷阱

dev.to · AI#RAG#LLM架构#工程实践
Editor brief · 编辑速览

两年实践表明将全部内容塞进上下文成本极高且延迟严重,检索增强仍是工程首选方案;文章拆解了成本/延迟/可靠性三个核心障碍。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

当模型开始一次性读取一百万个 token 时,所有人都宣称 RAG 已死。"把所有东西都丢进上下文就行了。"两年后,检索反而比以往任何时候都更加核心。以下是这场炒作错在了哪里。

这是当前应用 AI 领域最有价值的辩论之一,因为搞错了会浪费金钱并损害产品。巨型上下文窗口可以取代检索这一直觉非常直观——但大多数情况下是错误的。

诱人的论点

长上下文模型可以接受庞大的输入——整本书、整个代码库。于是推理就变成了:既然可以直接把所有东西交给模型让它自己整理,为什么还要费力构建检索管道去获取相关的片段呢?架构更简单,不需要向量数据库,不会有分块的麻烦。表面上很有说服力。

为什么"把所有东西都丢进去"会失败

三堵墙,而且你会很快撞上每一堵。

成本。 每次调用都是按 token 付费的。将大量上下文塞进每个请求比检索少量相关段落要昂贵得多。在任何实际的量级上,"把所有东西都丢进上下文"都是一个预算灾难。

延迟。 需要处理的 token 越多,响应就越慢。每个查询都使用巨大的上下文会让你的产品变得迟钝,这种迟钝用户能立即感受到。

注意力退化。 模型不会均匀地关注一个巨大的上下文——它们可靠地追踪开头和结尾,而在中间变得模糊。如果把关键事实埋在一百万个 token 的中间,模型可能会有效地忽略它。更多的上下文可能通过在噪声中淹没信号来产生更差的答案。

还有一个问题是新鲜度:你的知识在不断变化,而你无法将一个不断增长、持续更新的语料库塞进一个固定的窗口。检索允许你更新一个文档并让系统立即反映这一点。这正是我设计 AI 系统时的思考方式——获取相关的,而不是每次都拖拽所有东西。

它们是伙伴,不是竞争对手

成熟的看法不是"RAG 对比长上下文"——而是两者兼顾,各司其职。检索将一个庞大且不断变化的知识库缩小到重要的段落;然后长上下文窗口为模型提供空间来推理这些段落加上对话加上指令,而无需你斤斤计较。更大的窗口并没有杀死检索——它们通过解除过度压缩输入内容的压力,使检索变得更加有效。

更大的上下文窗口是一个更好的工作空间,而不是决定把什么带进房间的替代品。检索是你选择的方式;上下文是你推理的地方。任何告诉你长上下文会终结 RAG 的人都是在优化架构简单性,而忽略了成本、延迟以及注意力实际的行为方式。最好的系统是聪明地检索,然后很好地利用宽裕的上下文。

关于如何构建这些系统的更多内容,请访问 www.divyakush.com。

正确解释 RAG:检索如何保持 LLM 的诚实——合作伙伴中检索这一半的深入解析。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
CLI-Anything:用标准接口让所有软件获得AI Agent原生支持
下一篇
一条YAML微调8B模型:4GB显存本地即可