前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9321
  • Agent上下文满了该丢什么:长对话记忆管理实战
  • Warp推出Factories:一站式AI软件开发工厂基础设施
  • AI Agent试点到生产:成本暴涨700倍的教训
  • Cursor发布Origin功能:AI编程上下文管理
  • TryHackMe 提示词注入 CTF 实战攻略
  • 面向 Agent 的运维队列:失败自动转Ticket
  • 四个静默失败的 CI 检查:它们都是绿的,但什么都没做
  • AI 编码工具会读取 .env:本地 DLP 代理 Anonmyz 在prompt边界截流
  • Google 开源 SAM:零配置的 AI Agent P2P 发现与调用网络
  • Cursor Skills完全指南:格式规范与跨Agent迁移实测
  • OpenAI Codex Skills规范详解:目录结构与官方文档未记载的细节
  • 用Gitea自建Claude Code内部插件市场,团队Skill统一分发
  • Claude Skills规范深度解读:从格式到团队协作
  • 2026年LLM应用架构实战:摆脱if/else链式判断
  • Anthropic CEO:AI天然趋向集中,开源只是转移权力
  • 微软 Copilot 隐藏参数漏洞可被利用窃取密码
  • LangChain 揭示:Agent 效果不佳时换模型是误区,换 Harness 才是关键
  • 三阶段工作流让 AI Agent 保持精准:Research-Plan-Implement
  • 小米MiMo桌面应用即将上线,AI编程助手6月已开源
  • Agent成熟度记分卡:追踪AI Agent可靠性的五个核心维度
  • 模型趋同时代:系统架构比选模型更重要
  • 代码审核功能默认关闭的教训
  • 程序员用 Claude 为 Windows 专用 HP 打印机编写 macOS 驱动
  • NIST AI风险管理框架生产级RAG实战
  • Codex自动探索优化技能:研究-测试-评判闭环
  • AI协作UML编辑器:代码臭味一目了然
  • AI API成本降低95%的实战经验
  • 不同模型Tokenizer成本差异的技术解析
  • 我用低价模型替代OpenAI:生产迁移实录
  • Anthropic单token成本是Vercel均值4.4倍,使用量却占65%
  • career-ops: 在AI编程CLI里做求职管理
  • CI守护失效实录:4个静默失败的检查
  • 不同分词器对中文token计数差异高达20%
  • Claude Code 2.1.234安全升级清单发布
  • LLM 调用成本减半:模型路由与缓存实战
  • AI厂商公开的使用数据可信吗?斯坦福研究者质疑透明度
  • Claude Code引入/design命令:终端内生成UI稿
  • Azure DevOps MCP 服务器 prompt 注入漏洞:AI Agent 如何绕过安全防线窃取数据
  • Ray AI严重漏洞CVE-2025-62593已被主动利用
  • 缺失数据无法被检测:遗漏类错误的技术盲区
  • 我们删掉了向量数据库和图数据库,二者皆删
  • 四大国产模型实战PK: DeepSeek/Qwen/Kimi/GLM真实客户工作对比
  • System Prompt不是安全边界: 重新审视AI应用的信任模型
  • DynamoDB原生向量搜索上线
  • 阿里Qwen:被严重低估的开源模型家族
  • AI代码助手横评:Cursor、Copilot等实用对比
  • MIT深度分析:AI递归自我改进或许不会来得那么快
  • Haystack 3.0管道接入TealTiger治理引擎
  • AI编程代理的脚手架到底有没有用
  • 延迟加载工具schema省21%成本,但有一类任务反而亏了
  • AI基准测试崩溃:Dan Luu揭示评估体系系统性失效
  • 已加载 51 / 9321
8.0
热点
AI SCORE
观点评论2026-08-18 20:35

模型趋同时代:系统架构比选模型更重要

dev.to · AI#架构设计#RAG#AI工程
Editor brief · 编辑速览

前沿模型能力差距缩小,工程优势从模型选择转向RAG、编排、评估、反馈回路等「无聊的底层管道」建设。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

过去几年,工程领域的对话始终被一个问题主导:哪个模型最好?团队为基准测试争论不休,每次新版本发布就立刻更换 API key,把模型选择当作决定产品质量的关键因素。那个时代正在终结。最近一场讨论——为什么下一个技术优势将来自系统而非模型——精准地捕捉到了这一转变:当前沿模型的能力趋于收敛,持久优势转移到模型周围的层级——检索、编排、评估、反馈循环,以及将原始智能转化为可靠产品的那些不起眼的底层组件。如果你现在在构建软件,这种观念重构应该改变你分配工程时间的方式。

模型正在成为商品层

回顾过去十八个月的任何能力基准测试,一个模式浮现出来:顶级模型之间的差距在不断缩小,而同一模型家族六个月前的版本与今天的版本之间的差距却在不断扩大。无论你通过选择"最佳"模型获得什么优势,都会在下一个发布周期中消散——通常只需几周。与此同时,供应商之间的切换成本持续下降,因为 API 越来越趋同。

真正不会消散的是你在模型周围构建的系统。在正确时刻呈现正确上下文的检索管道。在用户发现之前捕捉回归的评估工具。降级逻辑、缓存策略、防护栏、数据飞轮。这些都在不断积累。你的竞争对手明天就能采用你的模型,但他们无法在一夜之间复制你两年积累的系统设计。

十年前工程师学到的教训

这一切实际上并非新事。谷歌的研究人员在 2015 年就对此提出过警告,那篇现已成为经典的论文关于机器学习系统中的隐藏技术债务,表明学习代码本身只是庞大系统图中央的一个小黑框,周围环绕着配置、数据验证、服务基础设施和监控。模型从来都不是困难的部分,系统才是。大型语言模型没有推翻这一发现——反而放大了它,因为提示、上下文窗口和非确定性输出引入了全新类别的纠缠和静默故障。

实际含义对于围绕模型选择组建的团队来说并不舒适。如果你的生产风险中有百分之九十存在于模型之外,那么你的工程注意力也应该有百分之九十投入在那里。

真正的杠杆在哪里

那么"投资系统"在日常中究竟意味着什么?在我审查大量 AI 代码库的经验中,最高效的工作集中在几个地方:

评估先于优化。无法衡量输出质量的团队最终只能凭感觉争论。几百个标注样本和一个自动化评估循环,胜过任何数量的提示调整,因为它们能告诉你某个改变是否真的有帮助。

上下文工程优先于提示工程。答案质量的最主要驱动因素通常是哪些信息到达了模型,而不是你问得多有礼貌。检索质量、分块策略和源数据的新鲜度都值得进行真正的设计审查。

优雅降级。超时、格式错误的输出和速率限制是必然的,不是边缘情况。能够智能重试、回退到更便宜的模型、或明显失败的系统,赢得用户信任,这是任何基准分数都买不到的。

反馈捕获。每个用户纠错都是训练信号。记录、结构化并将用户反馈路由回评估的产品,构建了随使用扩大而加深的护城河。

注意这些都不需要前沿研究。它们需要的是优秀工程师已经在实践的相同原则——测试、可观测性、增量设计——只不过应用到一个随机组件上。

系统的人这一面

每个 AI 系统中还有一个很少出现在架构图中的组件:操作它的人。哈佛商学院的 Karim Lakhani 教授说得很好:AI 不会取代人类,但使用 AI 的人类会取代不使用 AI 的人类。翻译成工程术语,获胜的组织是那些将开发者、审核员和领域专家编织到闭环中的——标注边缘案例、审计输出、持续教系统什么是"好"。一个 brilliant 的模型落入没有审核文化的团队,会大规模产生自信的垃圾。而一个仅仅 decent 的模型嵌入设计良好的社会技术闭环中,每周都在改进。

从周一开始要做的不同的事

不再问"我们应该使用哪个模型?"作为开场问题。转而问:我们如何知道输出质量下降?我们的上下文从哪里来,有多陈旧?当 API 在凌晨 2 点失败时会发生什么?谁来审核系统出错的案例,这些知识去向何方?把这四个问题回答好,模型就会成为它注定要成为的——一个更难复制的事物内部的可替换部件。优势从来不在权重里。它在连接中,而连接是你要去构建的。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Agent成熟度记分卡:追踪AI Agent可靠性的五个核心维度
下一篇
代码审核功能默认关闭的教训