前沿模型能力差距缩小,工程优势从模型选择转向RAG、编排、评估、反馈回路等「无聊的底层管道」建设。
过去几年,工程领域的对话始终被一个问题主导:哪个模型最好?团队为基准测试争论不休,每次新版本发布就立刻更换 API key,把模型选择当作决定产品质量的关键因素。那个时代正在终结。最近一场讨论——为什么下一个技术优势将来自系统而非模型——精准地捕捉到了这一转变:当前沿模型的能力趋于收敛,持久优势转移到模型周围的层级——检索、编排、评估、反馈循环,以及将原始智能转化为可靠产品的那些不起眼的底层组件。如果你现在在构建软件,这种观念重构应该改变你分配工程时间的方式。
回顾过去十八个月的任何能力基准测试,一个模式浮现出来:顶级模型之间的差距在不断缩小,而同一模型家族六个月前的版本与今天的版本之间的差距却在不断扩大。无论你通过选择"最佳"模型获得什么优势,都会在下一个发布周期中消散——通常只需几周。与此同时,供应商之间的切换成本持续下降,因为 API 越来越趋同。
真正不会消散的是你在模型周围构建的系统。在正确时刻呈现正确上下文的检索管道。在用户发现之前捕捉回归的评估工具。降级逻辑、缓存策略、防护栏、数据飞轮。这些都在不断积累。你的竞争对手明天就能采用你的模型,但他们无法在一夜之间复制你两年积累的系统设计。
这一切实际上并非新事。谷歌的研究人员在 2015 年就对此提出过警告,那篇现已成为经典的论文关于机器学习系统中的隐藏技术债务,表明学习代码本身只是庞大系统图中央的一个小黑框,周围环绕着配置、数据验证、服务基础设施和监控。模型从来都不是困难的部分,系统才是。大型语言模型没有推翻这一发现——反而放大了它,因为提示、上下文窗口和非确定性输出引入了全新类别的纠缠和静默故障。
实际含义对于围绕模型选择组建的团队来说并不舒适。如果你的生产风险中有百分之九十存在于模型之外,那么你的工程注意力也应该有百分之九十投入在那里。
那么"投资系统"在日常中究竟意味着什么?在我审查大量 AI 代码库的经验中,最高效的工作集中在几个地方:
评估先于优化。无法衡量输出质量的团队最终只能凭感觉争论。几百个标注样本和一个自动化评估循环,胜过任何数量的提示调整,因为它们能告诉你某个改变是否真的有帮助。
上下文工程优先于提示工程。答案质量的最主要驱动因素通常是哪些信息到达了模型,而不是你问得多有礼貌。检索质量、分块策略和源数据的新鲜度都值得进行真正的设计审查。
优雅降级。超时、格式错误的输出和速率限制是必然的,不是边缘情况。能够智能重试、回退到更便宜的模型、或明显失败的系统,赢得用户信任,这是任何基准分数都买不到的。
反馈捕获。每个用户纠错都是训练信号。记录、结构化并将用户反馈路由回评估的产品,构建了随使用扩大而加深的护城河。
注意这些都不需要前沿研究。它们需要的是优秀工程师已经在实践的相同原则——测试、可观测性、增量设计——只不过应用到一个随机组件上。
每个 AI 系统中还有一个很少出现在架构图中的组件:操作它的人。哈佛商学院的 Karim Lakhani 教授说得很好:AI 不会取代人类,但使用 AI 的人类会取代不使用 AI 的人类。翻译成工程术语,获胜的组织是那些将开发者、审核员和领域专家编织到闭环中的——标注边缘案例、审计输出、持续教系统什么是"好"。一个 brilliant 的模型落入没有审核文化的团队,会大规模产生自信的垃圾。而一个仅仅 decent 的模型嵌入设计良好的社会技术闭环中,每周都在改进。
不再问"我们应该使用哪个模型?"作为开场问题。转而问:我们如何知道输出质量下降?我们的上下文从哪里来,有多陈旧?当 API 在凌晨 2 点失败时会发生什么?谁来审核系统出错的案例,这些知识去向何方?把这四个问题回答好,模型就会成为它注定要成为的——一个更难复制的事物内部的可替换部件。优势从来不在权重里。它在连接中,而连接是你要去构建的。