前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8394
  • AI代码审查工具Benchmark半年重排:CodeRabbit跌至第五
  • 欧盟AI Act水印合规指南:部署方而非模型方的硬性义务
  • Qwen 3.8 27B 本地跑通指南:从 Spring Boot 调用
  • 2026 生产级 AI 代理指南:评测体系、成本优化、工具栈
  • 从零构建AI文本检测器:数据集、训练、部署与RLVR
  • 10天搭起印度多语言 AI 语音导师:55ms 延迟问题实战复盘
  • 用大模型深度推理构建 Python 自动化 Debug Agent
  • 让LLM输出可靠结构化数据的工程实践
  • Tool-Calling LLM微调完整指南:Qwen3+LoRA端到端实战
  • 深度解析Agentic AI:四个核心支柱与工程实现路径
  • 索尼PS5 Pro PSSR 2.0:AI少干活,画质反而更好
  • 25个MCP服务器安全扫描:它们能对你的机器做什么
  • 多AI智能体协作时代,如何高效审查代码
  • RAG工作原理深度拆解:检索如何让大模型保持诚实
  • GenAI输出必须自带结构化证据链,否则是失职
  • 提示词即代码:Evals是Prompt的单元测试
  • PyTorch 2.13: FlexAttention+FSDP2驱动的新性能栈
  • 小模型在分类场景的工程胜利:阈值路由降本99%
  • 英伟达推5000亿美元AI算力融资平台
  • 与AI协作更像领导力而非写代码
  • 小数据grep、大数据向量:AI检索架构选择指南
  • LLM Prompt结构技巧:稳定内容前置可节省78%成本
  • DeepSeek开源Agent Harness:插件化架构突破35k星
  • Agent本质:一个有品味的有界循环
  • 结构化输出是契约而非请求
  • 评估 AI 健康检查脚本:看它能揪出多少真实故障
  • 别存储信任,推导信任:Agent文档的可验证信任模型
  • LLM复杂编程实战:多步骤Agent流程设计与自审最佳实践
  • AI Agent集群部署的三大隐形难题:寻址、发现与信任
  • Debian 社区投票决定AI/LLM贡献规范
  • Kilo Code:代码审查前动态决定启用0/1/6个AI Agent
  • OpenCut 开源视频编辑器重写:新增 MCP Server 与插件架构
  • Qwen 3.8 新变体曝光:35BA3B
  • DeepSeek V4 Flash实操测试:50个真实PR任务表现相近
  • AI编程的真正瓶颈:不是写代码,是定义做什么
  • AI测试幻象:LLM自写自测引入的确认偏差陷阱
  • 美国男子在法庭文件中隐藏AI提示注入,妄图操控自动化审查
  • 多Agent编程编排器踩坑:Supervisor总是选择零工人
  • Lean形式化验证创始人访谈:证明bug不存在而非仅发现
  • OpenAI 预览 GPT-5.6 Ultrafast 模式:响应速度提升 14 倍
  • Anthropic官方指南:Claude Code六招省token成本
  • 李飞飞 World Labs 发布机器人仿真引擎:单任务生成数千变体
  • Claude水印功能引发退订潮,程序员转向Cursor/Grok
  • 为AI陪伴应用构建可复现的Agent化测试方法
  • 用双 prompt 监控免费模型端点的行为漂移
  • 用标准库构建探针:诊断免费 Token 的延迟和截断问题
  • CPU 本地语音转文本驱动编码 Agent:Parakeet TDT 方案
  • 用免费模型作只读金丝雀:写入前验证AI调用安全性
  • Framer 3.0:AI Agent进入Canvas,支持Claude Code/Cursor通过MCP接入
  • 至知研究院:拆权重解释大模型,成本仅需训练数据的1%
  • 用临时服务器验证AI生成的HTTP接口
  • 已加载 51 / 8394
8.0
热点
AI SCORE
编程提效2026-08-15 18:30

小数据grep、大数据向量:AI检索架构选择指南

dev.to · AI#RAG#检索系统#架构
Editor brief · 编辑速览

作者根据实践经验总结:小规模、需精确调试的Agent记忆用grep;大规模、多语言用户搜索用混合向量检索。两者架构取舍值得参考。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Retrieval 在我们的技术栈中出现了两次,而这两种场景采用了截然不同的架构。Agent 记忆——几百条精挑细选的笔记——基于文件和 grep 实现。用户侧搜索——数万条多语言记录——则采用混合 Embedding 构建。两者的分界线值得明明白白说清楚,因为行业现状是无论什么场景都去买一个向量数据库。

Agent 的记忆体量小、内容精炼、且阅读者本身已经具备推理能力。每条笔记都在索引文件中带有一行描述;Agent 读取这 40 行的索引,判断哪些相关,然后打开两到三个文件。调试就是打开 Agent 刚才读过的那个文件。修正就是编辑一段话。当我们把这套语料改成 Embedding 来做原型时,检索变成了一个概率分布,我们需要去"审问"它才能知道结果;更新需要重新 Embedding;而且没人能回答事故中最关键的问题:它为什么读了那个?

Embedding 何时值得

在 40000 条混合了韩语、英语、越南语的记录上做搜索,是另一种完全不同的场景。用户输入"cheap spa near the river",记录里写的是"riverside massage, budget"。关键词匹配会漏掉;向量可以捕获。但纯稠密检索在我们的评估集上输给了混合方案,所以实际运行的是混合方案:

const kw = bm25(query, 40);              // exact terms, names, numbers
const dn = cosine(embed(query), 40);     // paraphrase, cross-lingual
const pool = dedupe([...kw, ...dn]);
const ranked = await llmRerank(query, pool.slice(0, 30));  // one cheap model call
return ranked.slice(0, 8);               // what actually enters the context

在一个从真实搜索日志构建的 400 条标注查询集上,Recall@20 分别是:关键词单独 0.71,稠密单独 0.76,带重排序的混合方案 0.90。那次重排序调用成本不到一分钱,而且比任何换 Embedding 模型都更有效地解决了最后一公里的问题。

Chunking 才是质量真正的所在

固定的 512 token 窗口会把表格和它们的表头拆散、把答案和问题拆散。我们按文档结构、标题和列表边界来分块,每块都携带它的来源路径和字节偏移量,这样模型引用的任何内容都能一键跳转到它出自的那个句子。一个不能溯源的检索系统,就是一个延迟很低的谣言制造机。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
与AI协作更像领导力而非写代码
下一篇
LLM Prompt结构技巧:稳定内容前置可节省78%成本