为有开发经验的程序员梳理 AI 工程学习路径:LLM 基础→提示词→API→RAG→Agent→评估安全,附成本估算和 5 级项目阶梯。
所以你打开 X,看到早餐前就有 47 款新 AI 工具上线了,现在你感觉好像所有人都收到了什么通知就你没有。好消息是:根本没有什么通知。只是座 hype 大山,几个故意用错的流行词,以及一套你可以按合理顺序学习的真正技能。
我为像我一样已经能交付代码、想从"我用 ChatGPT 写正则"进阶到"我构建人们真正使用的 AI 功能"的开发者整理了这份路线图。每个阶段都建立在前一个阶段之上,凡涉及真钱的地方我都加了成本估算,因为凌晨三点收到意外 API 账单没有比这更能毁掉一个副业项目的了。
端起你的咖啡(或一杯对 token 友好的能量饮料),我们开始吧。
AI 工程主要是集成和可靠性,而不是从零训练模型。
路径:LLM 基础 → 提示词工程 → API → RAG → 智能体 → 评测与安全 → 生产环境。
几乎全部内容你都可以用免费层级、本地模型和廉价 API 模型以 $0 到约 $15 USD 完成。
边学边做:最后有一个 5 层项目阶梯,从"简单 API 应用"到"智能体构建智能体"。
工具每月都在变,概念不会。先学概念,把工具当作例子。
在我们开始学习之前,先回答这个显而易见的问题:这个工作是什么?剧透:不是"在黑屋子里训练神经网络",而是"让模型在一个真实产品里可靠地运行,不让公司破产"。
AI 工程师的日常通常是以下工作的混合:
注意列表里没有的是什么:发明新的模型架构。那是研究工作。这份路线图关注的是工程方面,如果你已经能构建后端和前端,你离目标比你以为的更近。
在进入基础知识之前,先快速过一遍词汇表。这些是你在每个 AI 对话、推文和职位描述中都会看到的术语。你现在还不需要掌握它们,只需要知道它们是什么,这样你就不用假装听懂地点头(我们都干过这事)。
还有几个你之后会遇到的热词。我们后面会回过头来讲,但现在先记住名字就好:
把第 0 阶段当作地图图例:你不需要死记硬背,但知道这些符号的含义后,剩下的旅程会轻松很多。
目标:理解现代 AI 系统实际上是如何在底层工作的,这样你就不再把它们当作魔法(或像一个非常自信的实习生)。
自己试试:你不需要花任何钱就能玩转这些概念。像 Ollama 这样的工具让你可以在本机上运行开源模型,Hugging Face 是浏览和发现数千个开源模型的地方。
不要试图一次坐下来记住所有这些。随着后面阶段让每个概念逐步清晰,再回来翻这张列表。
这是后续一切的基础,但大多数开发者低估了它。"不过是给聊天机器人写点文字",他们这么说,然后花三天调试一个只有 70% 时间能用的提示词。
一个好的思维转换:提示词工程是关于你如何问,上下文工程是关于模型能看到什么。随着你的应用增长,后者开始比前者更重要。
一个简单的经验法则:如果你改了一个提示词却无法判断它是变好还是变坏了,那你还没有遇到提示词问题,你遇到的是评测问题。我们会在第 6 阶段解决这个问题。
是时候停止在 UI 里聊天,开始从代码调用模型了。这是 AI 不再是玩具、变成你技术栈中另一个服务的阶段(一个偶尔在你要求 JSON 时用莎士比亚英语回答的服务)。
💰 预估成本:如果你使用 Haiku 或 GPT-4o-mini 这样的廉价模型,大约 $5-15 USD 的 API 积分。🆓 免费选项:用 Ollama 在本地运行开源模型,或使用文章末尾"免费 API 和资源"部分列出的免费层级。
建议练习:构建一个小脚本,接收一段乱糟糟的文本(一封邮件、一个支持工单、一条评论),返回一个包含你关心的字段的已验证 JSON 对象。它在一个下午内覆盖了认证、结构化输出、错误处理和成本追踪。
如何不给 LLM 微调的情况下给它"记忆"或外部知识。不是在你的数据上重新训练模型,而是在查询时获取相关片段,连同问题一起交给它。这和让人记住整个图书馆而不是让他们使用索引的区别。
💰 预估成本:使用本地技术栈接近 $0,使用 text-embedding-3-small 只需几分钱,适合小型项目。
建议练习:基于一组 Markdown 文件构建一个「与文档对话」应用。当它答错时(肯定会错的),判断问题是出在检索还是生成。这个调试习惯比任何教程都更有价值。
这是 LLM 从「回答问题」转向「执行行动」的阶段。它读取目标、选择工具、查看结果、决定下一步做什么。这也是炒作最嘈杂的阶段,所以我们要脚踏实地。
[ ] 真正的 AI 智能体 vs. 营销噱头:一个套了花哨名字的聊天机器人不等于 AI 智能体。学会区分二者。
[ ] AI 智能体工具:AI 智能体可以调用的函数和服务(搜索、数据库、API、文件系统)。这直接建立在你第 3 阶段学到的函数调用之上。
[ ] 模式:ReAct、规划、多步工具调用,以及带护栏的循环。
[ ] 错误处理:无限循环、失控的成本,以及工具在执行中途失败时会发生什么。
目前可用的 AI 智能体(作为参考):
编码 AI 智能体:Claude Code 和 Cursor。使用它们,但也要阅读它们的工作原理。
本地 vs. 远程 AI 智能体:有些运行在你的机器上,有些运行在云端。了解其中的权衡(隐私、成本、能力)很重要。
开源和实验性 AI 智能体:OpenClaw 和 Hermes,如果你想折腾不那么成熟的东西。
Cline:运行在编辑器内的 AI 智能体。
选一个框架以免精力分散:
[ ] LangGraph(Python):业界用于复杂 AI 智能体最广泛的框架。
[ ] Vercel AI SDK(TypeScript):如果你更想留在 Web 技术栈。
简单说一下 LangChain 生态。可以把构建过程想象成建工厂:
LangChain 适合线性流程(A → B → C),比如简单的 RAG 流水线。LangGraph 则增加了循环、分支和共享状态,这是 AI 智能体实现自我修正所需要的。下一阶段我们会遇到 LangSmith。
一个简单规则:如果你的流程是一条直线,LangChain 就够了。如果你的应用需要记住步骤、循环或做决策,请用 LangGraph。
建议练习:构建一个拥有两三个工具、对迭代次数有硬限制并设置成本上限的 AI 智能体。然后故意尝试把它搞坏。
这是区分原型和生产级系统的关键。在笔记本上能跑的演示很好用。系统能在真实用户到来时继续运行(无论他们是有意还是无意地试图破坏它),这才是真正的工作。
[ ] 系统性输出评估:构建一组测试用例,用真实标准衡量质量,这样你才能判断一个改动是让情况变好还是变坏。
[ ] 日志记录与链路追踪:记录每次 LLM 调用(输入、输出、延迟、token),这样当问题发生时,你可以精确看到问题出在哪里。
[ ] 提示词注入:攻击者如何在用户输入或检索内容中隐藏指令以劫持你的模型,以及如何缓解。这对于接受动态输入的应用至关重要。
[ ] 生产环境成本管理:缓存,以及在任务允许时回退到更便宜的模型。
可用工具(作为参考):
[ ] Langfuse:开源,有免费云端套餐,用于链路追踪。
[ ] Promptfoo:免费开源,用于自动化评估。
[ ] LangSmith:一个用于调试、评估和监控 LLM 应用的平台。它与框架无关,所以可以配合 LangChain、LangGraph 或你自己的定制代码使用。它的多轮评估功能让你可以评判整个对话而不是单次回复。
可观测性什么时候变成不可妥协的?当你从原型转向生产的那一刻。如果你为真实用户构建,你需要对应用的行为有可见性,而链路追踪是获取这种可见性最快的方式。
建议练习:拿你之前构建的 AI 智能体或 RAG 应用,编写 15-20 个测试用例(包括一些对抗性的,比如提示词注入尝试),然后每次修改提示词时自动运行它们。
这是万事俱备的阶段。你已经掌握了基础、提示词、API、RAG、AI 智能体和评估。现在你要把这一切接入一个真正的产品——真正的用户、真正的延迟、真正的账单。
[ ] 为 LLM 调用设计后端结构:把模型调用集中在一个定义良好的层中(提示词、重试、超时、成本追踪),而不是散落在代码库各处。
[ ] 实时流式响应到前端:没人想盯着一个加载动画等 15 秒。让答案在生成的同时展示出来。
[ ] 智能缓存:不要为相同(或非常相似)的请求付两次钱,尤其是对于重复的推荐或常见问题。
[ ] 降级策略:如果主模型故障或变慢会发生什么?准备一个备用模型、优雅的降级模式或清晰的错误信息。
上线前的检查清单:
你知道每次请求的成本吗?如果一夜之间用量增长 10 倍会怎样?
你的调用是否都有链路追踪,这样你才能调试上周二的错误答案?
你用真实用户风格的输入测试过提示词注入吗?
模型不可用时是否有超时和降级方案?
如果以上四个问题都能回答「是」,恭喜:你不再只是在玩 AI 了,你是在真正地交付 AI。
建议练习:从你已有的项目中选一个功能,在它后面加一个 AI 驱动的版本,用功能开关隔离。先交付给自己,观察一周的链路追踪和成本,然后决定是否对外开放。
阅读很棒,但 AI 工程是靠实践学习的(也是靠看着你的第一个 AI 智能体自信地做错事)。以下是一份项目阶梯。每个难度层级大致对应上面的阶段,你可以边学边爬。
层级 1:调用语言模型 API 并用简单界面包装
构建调用 LLM API 并用基础 UI 或 CLI 包装的小应用。(第 1-3 阶段)
AI 收据解析器 — 将杂乱的收据文字或照片转换为干净的、经过验证的 JSON,包含供应商、日期、商品明细和总计。
AI 提交信息生成器 — 读取 git diff,以你团队的风格生成清晰的提交信息。
AI 语气改写器 — 将同一封邮件改写成友好、正式或「请不要再抄送全公司」的版本。
层级 2:给模型接入你自己的数据让它带着来源回答。(第 4 阶段)
AI 代码库问答 — 关于代码库提问(「我们在哪里处理认证?」),得到指向相关文件的答案。
AI 个人知识搜索 — 按语义而非关键词搜索你的笔记、书签和 PDF。
AI 客服回复建议器 — 使用你的文档和已解决的工单草拟回复,附上 AI 智能体可以验证的引用来源。
层级 3:使用工具、做决策、循环执行直到任务完成的模型。(第 5 阶段)
AI 研究助手 — 接收问题、搜索多个来源、交叉验证,生成一份带参考资料的简短报告。
AI Bug 分类 AI 智能体 — 读取新 issue,复现或分类,打标签,并指出可能的代码区域。
AI 个人财务整理器 — 对交易进行分类、标记异常扣款,并用通俗语言解释月度消费模式。
层级 4:企业级 AI 系统
多用户、可观测、安全且成本可控。原型在这里成长为真正的产品。(第 6-7 阶段)
AI 网关 — 一个集中层,跨模型路由请求、缓存结果、执行速率限制和按团队预算控制,并记录所有操作。
AI 合同审查流水线 — 处理数千份文档,提取条款,标记风险,将不确定的案例路由给人工处理,并保留完整的审计轨迹。
多租户 AI 客服平台 — 为多个客户提供隔离的数据、per-tenant 评估、提示词版本控制,以及针对提示词注入的安全防护。
前沿领域。系统中的智能体可以创建、测试和改进其他智能体或工具。这一层尚有诸多粗糙之处,应将其视为实验性探索,而非已解决的问题。
自扩展智能体 智能体发现自己缺少某个工具时,自行编写集成代码、进行测试,并将其添加到自己的工具箱中(需人工审批)。
Eval 驱动的 Prompt 优化器 一个系统,运行你的测试套件、提出 Prompt 修改建议、测量结果,并仅保留有效的改进。
智能体工厂 给它一个规格说明("一个监控发票的智能体"),它就会生成、测试并部署一个配备正确工具和护栏的专用智能体。
每一个 3 层及以上的项目,都默默依赖你在 1 层和 2 层中培养的习惯:验证输出、追踪成本、检查答案是否真的正确。
你无需信用卡即可开始学习这些东西。以下是可以免费(或几乎免费)获取模型访问权限的地方。需要提醒的是:免费层级经常变动,因此在基于某个免费层构建之前,请务必查看当前的限制和条款。
提供免费访问的模型 API:
如何明智地使用免费层级:
如果你读到了这里,现在你已经拥有了完整的地图:从"什么是 Token?"到上线一个具备追踪、缓存和备用方案的 AI 功能。这片领域非常广阔,没有人能在一个周末学完(如果有人这么说,他一定是在卖课)。
循序渐进,但不要等到"准备好了"才动手。 在每个层级都做一个小项目。读 RAG 的文章和构建一个 RAG 应用是两种完全不同的体验。
概念优先,工具其次。 这篇文章中的工具会发生变化,有些明年可能就不在了。但 Token、上下文、检索、工具使用和评估这些核心概念依然会存在。
量化一切。 成本、质量、延迟。如果你无法量化它,那只是在凭感觉编程(很有趣,但不是策略)。
保持一点怀疑精神。 每周都有新的"革命性"框架。问问它解决的是什么问题,以及你是否真的需要那个问题。
选一个阶段,打开终端,这周做点小的。 它很可能会以某种奇怪的方式坏掉——而这恰恰就是你学习的方式。
有没有漏掉某个对你有帮助的工具、概念或资源?欢迎在评论区留言,我很乐意补充。如果这个路线图对你有帮助,请分享给那个一直说"我真的该学学 AI"的朋友。🚀