前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8739
  • Claude Opus 5.5发布:性能持平Fable 5.1,定价直降40%
  • GitHub Copilot上线Claude Opus 5.5,支持长时Agent任务
  • GitHub Copilot 新增 GPT-6 Sol/Luna 模型选项
  • Claude Opus 5.5 智能/性能/价格深度分析
  • Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型
  • Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能
  • Anthropic 发布 Claude Opus 5.5:强化网络安全防护,遏制越狱行为
  • Claude Opus 5.5 正式发布:832 分成社区热议
  • 生产级 AI 语音 Agent 架构:WebSocket 与延迟优化实战
  • Permission Envelope:让 AI 权限自动过期的安全控制机制
  • llm-typesafe插件支持Jev模型二元判断
  • Python AI Agent 上线前必读:测试、可观测性与零成本方案
  • Cloudflare Worker Previews:为 Agent 每次变更提供隔离预览环境
  • NVIDIA Isaac ROS 5.0 发布:加速 Agentic 机器人开源开发
  • Meta Muse macOS 应用零日漏洞遭修复
  • 小米6天烧2000万训练开源模型MiMo,跃居开放模型榜首
  • LLM应用输入输出Guardrails实战指南
  • Claude发现libheif堆缓冲区溢出:HEIC图片供应链安全研究
  • 多模型调度与反馈闭环:基元律动CTO谈Agent持续进化
  • 阮一峰科技周刊第413期:再见了React Native
  • 用Python/ChromaDB/Gemini搭建轻量级RAG实战
  • 生产环境中降低LLM成本的七种实战方法
  • AI驱动开发反思:过度规格化反而拖累AI编程
  • AMD ROCm:AI Agent正在降低GPU编程门槛
  • 小米MiMo-V2.6-Pro登顶开源权重模型榜首,300万美元预训练
  • 四Agent并行:状态文件是保持一致性的关键
  • 长任务前何时压缩上下文:Claude Code实战经验
  • 5美元/月自建Qwen2.5 72B推理服务:vLLM+AWQ量化部署指南
  • Prompt缓存失效的根因:工作流在悄悄破坏精确前缀匹配
  • NVIDIA SoL-Pi:编码Agent的Token流量降低49%的Auto-Research框架
  • Grok 4.7 发布:更大基座、同价位,编程与 Agent 任务升级
  • vibe coding 两小时后质量崩塌的根因分析
  • 用 git 在多设备间同步 Claude Code 和 Codex 会话
  • 小米 MiMo-V2.6-Pro 开源:科研任务效率提升 10 倍
  • 评估Agent代码补丁前先清点测试面
  • 阿里云栖大会:Qwen4训练中,全模态模型新版本亮相
  • Qwen4.5后参数扩展至5-10T,Qwen4和视频模型均在训练
  • 阿里云栖大会正式发布Qwen4
  • 凌晨3点LLM路由崩溃排查:上游回收引发的级联故障
  • Hugging Face Transformers现已支持运行llama.cpp量化模型
  • Jev:按输入计费的决策模型,输出免费
  • Langflow OSS 认证 RCE 漏洞 CVE-2026-17633
  • 小米 MiMo-V2.6 开源:AA 指数最高开源模型
  • xAI发布Grok 4.7:编程强化模型,百万词元2美元起
  • Meta AI 助手 Muse 存在关键 0-day 漏洞,ClickFix 攻击可劫持
  • AWS发布Strands Harness:开源Agent框架,Token成本降28%
  • Spec-Driven 开发:摆脱 Vibe Coding 的工程化实践
  • AI 编程助手 CSS 好看但上生产就崩的根因与修复
  • Agent 诊断结果上线前如何验证:分离决策与执行
  • OpenAI 成立数学顾问组,AI 已解决逾百开放难题
  • Grok Build vs Claude Code:记忆能力实战对比测评
  • 已加载 51 / 8739
8.0
热点
AI SCORE
编程提效2026-09-22 16:28

用Python/ChromaDB/Gemini搭建轻量级RAG实战

dev.to · AI#RAG#向量数据库#Python
Editor brief · 编辑速览

以数据结构PDF为测试文档,详解RAG pipeline各阶段原理:语义分块、embedding、向量化检索、生成。强调理解为何这样做而非仅会拼接。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

大语言模型的表现令人印象深刻,但它们有一个盲点:只能根据训练时学到的内容来回答问题。

如果向它提问关于某个特定 PDF、公司内部手册或专业教科书的问题,它可能会猜测、泛化,或者直接承认不知道。

检索增强生成(RAG)通过赋予 LLM 在回答前先查阅资料的能力来弥补这一缺陷——把闭卷考试变成开卷考试。

在 Valentius Kryptix 实习期间,我构建了一个轻量级 RAG 系统来验证这个想法,以一份《数据结构与算法》PDF 作为测试文档。

我不想把 RAG 当作一个黑盒子来使用,而是希望理解流程中每个阶段存在的原因——不仅仅是把它们连接起来。

🔍 核心洞察:检索只有在"相关性"被语义化定义而非字面定义时才能生效。

对"队列操作"进行关键词搜索可能会失败,因为文档可能用"入队和出队函数"来表述同样的概念。

这就是嵌入(embeddings)的用武之地。系统使用 Sentence Transformers 库的 all-MiniLM-L6-v2 模型,将文档和用户的问题都转换成向量,这些向量捕捉的是含义而非措辞本身。

将这些向量存储在 ChromaDB 中,使得即使词语不完全匹配,也能找到概念上相关的内容。

这个项目最有启发性的部分并非流程本身,而是比较模型在有检索和无检索时的行为表现。

「队列上有哪些操作?」

不带 RAG 时,Gemini 根据通用的训练知识作答——精神上正确,但与实际参考材料脱节。

带 RAG 时,同样的问题返回了基于特定文档的答案,正确地呈现了:

• Enqueue • Dequeue • Peek/Front • Rear • isFull • isEmpty

这种并排对比以一种阅读 RAG 相关资料永远无法达到的方式,让检索的价值变得直观可感。

💡 更大的启示:RAG 系统实际上是两种截然不同技术之间的桥梁——一种擅长查找信息的向量数据库,另一种擅长解释信息的语言模型。

单独使用时,文档问答哪个都做不好;合在一起,则能互补彼此的弱点。

这篇文章是对这一设计洞察的简短反思。完整构建——包括完整的五步工作流、代码和实现细节——详见原文。

📖 阅读完整文章:https://valentiuskryptix.com/how-to-build-a-retrieval-augmented-generation-rag-system-in-just-5-steps/

如需进一步操作,你可以考虑屏蔽此人或举报滥用行为

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
阮一峰科技周刊第413期:再见了React Native
下一篇
生产环境中降低LLM成本的七种实战方法