AI Engineering 学习路线:Chip Huyen 四级能力阶梯,从单条提示词到生产部署
【免费下载链接】aie-book[WIP] Resources for AI engineers. Also contains supporting materials for the book AI Engineering (Chip Huyen, 2025)项目地址: https://gitcode.com/GitHub_Trending/ai/aie-book
打开《AI Engineering》,10个章节从基础模型原理一路铺到生产部署,先读哪个成了问题。本文结合 aie-book 仓库,不按章节顺序,而是用能跑通、能评估、能调优、能上生产四级,帮你规划学习路线。
📖 学习前的准备
- 会基础 Python、能调用 LLM API,不需要懂训练原理。
- 了解 HTTP/JSON 基本交互,能读懂请求响应。
- 没有机器学习背景也可以:第2章用白话解释了 Transformer 与采样。
- 手边有一个真实业务场景(客服问答、文档摘要都行),各层动手任务都围绕它做。
🗺️ 能力路线图
四级按依赖递进:L1 对模型行为的理解是 L2 评估的地基,L2 的评估集是 L3 调优的尺子,L3 的提示词与 RAG 积累是 L4 架构的内容。
L1 能跑通:理解基础模型行为
- 推荐章节:第1章 + 第2章——第1章回答"该不该建、怎么规划";第2章讲清模型输出为什么是概率性的(采样机制),是后面所有技巧的前提。
- 动手任务:用同一条提示词连续调用 LLM API 三次,记录输出差异。
- 完成标志:能一句话说清"为什么同样提示词输出不同",并能为你的场景圈定 2-3 个候选模型。
L2 能评估:搭起评估体系
- 依赖 L1:不理解"模型输出为什么不稳定",评估只是几个数字。
- 推荐章节:第3章 + 第4章——全书用两章讲评估,因为 AI 应用落地的最大瓶颈就是缺可靠的评估体系。第3章讲单条输出怎么评(精确指标、相似度、AI 评判者),第4章讲选模型与整条流水线设计。
- 动手任务:攒 20-50 条真实输入做评估集,写 2-3 条打分标准,用一个强模型当 AI judge(让另一个模型给你的应用输出打分)跑一轮评分。
- 完成标志:能独立跑完评估集,并在输出质量下降时说得出该先看哪个指标。
L3 能调优:提示词与上下文工程
- 依赖 L2:没有评估集,提示词好坏全凭感觉。
- 推荐章节:第5章 + 第6章——提示词是成本最低的调优手段;当模型自身知识不够时,RAG(检索增强生成,先查资料再回答)把外部知识带进上下文窗口,Agent 则是 RAG 的进阶形态。
- 动手任务:为同一任务写零样本、少样本、分步思考三版提示词,用 L2 的评估集对比;再拿几份文档跑通最小 RAG 流程(切块→向量检索→生成)。
- 完成标志:能说出一版提示词比另一版好多少、好在哪;RAG 的回答能指出检索到了哪段资料。
L4 能上生产:架构、成本与反馈
- 依赖 L3:没有提示词和 RAG 的积累,生产架构就是空壳。
- 推荐章节:第7章 + 第9章 + 第10章(第8章选读)——第7章的重点是"何时不该微调",第9章管延迟与成本,第10章给完整的生产架构和用户反馈闭环。
- 动手任务:给自己的项目写一份"RAG 还是微调"决策文档;参考书中生产架构画自己的架构图,至少标出 1 个 guardrail(输出护栏,拦截不安全内容)和 1 个缓存。
- 完成标志:架构图含上下文构建、输入输出护栏、模型网关、缓存、监控五块,并能说清各延迟优化手段的成本量级。
🧭 路径选择指南
- 如果你是后端/全栈转 AI:从 L1 直接跳到 L3,你习惯"API 调用 + 数据流",RAG 架构和你熟的检索系统同构。
- 如果你是纯前端:先做 L1 的三次对比任务,建立"模型不确定"的直觉再碰提示词,避免瞎调。
- 如果你有传统 ML 经验:读完第1章"AI 工程 vs ML 工程"一节直接进 L2,评估指标的差异才是你最大的坑。
⚠️ 高频误区与避坑
- 输出不满意先调微调参数 → 正确:先验证提示词和 RAG 能不能解决,微调成本更高、迭代更慢。
- 看公开 benchmark 榜单选模型 → 正确:用自己的评估集选,公开榜单很可能已泄漏进训练数据,不代表你的场景。
- 把 AI judge 分数当唯一依据反复对比版本 → 正确:搭配精确评估(功能正确性)和人工抽检,因为评判者本身会漂移。
- 按顺序从第1章读到第10章 → 正确:按能力层读,第3-4章尽量提前,否则后续调优全靠猜。
✅ 动手实验清单
- 构建 LLM API 的"三次调用对比输出"脚本(对应 L1)
- 构建 30 条真实业务输入评估集,跑一轮 AI judge 打分(对应 L2)
- 对比零样本/少样本/分步思考三版提示词的输出差异(对应 L3)
- 产出"RAG vs 微调"决策文档与生产架构图(对应 L4)
📚 配套文档索引
- ToC.md:全书 10 章结构与小节,规划阅读范围前查它。
- chapter-summaries.md:每章官方摘要,快速判断某章是否值得精读。
- prompt-examples.md:Brex、Cursor 等公司的生产提示词模板,可直接抄改。
- resources.md:按章节整理的 1200+ 参考链接,需要深挖时查。
- study-notes.md:社区读书笔记,RAG 与微调章推荐对照看。
🎯 能力验收自检
- 能够一句话说清"同样提示词、不同输出"背后的概率性原因
- 能够为一个新任务写出 2-3 条打分标准并完成一轮 AI judge 评分
- 能够用评估集证明提示词 v2 优于 v1,并说明原因
- 能够构建"先检索、再回答、能指出来源"的 RAG 回答
- 能够回答自己项目的"RAG 还是微调"问题,并给出两条具体理由
《AI Engineering》的价值不在 10 个章节,而在它给了你一套"把基础模型适配到真实问题"的判断框架。今天先做掉 L1 的小任务——同一条提示词跑三次看差异,四级阶梯就从这一步开始。
【免费下载链接】aie-book[WIP] Resources for AI engineers. Also contains supporting materials for the book AI Engineering (Chip Huyen, 2025)项目地址: https://gitcode.com/GitHub_Trending/ai/aie-book
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考