☰
#想做 AI Agent 开发,新手到底该先学哪些东西?
2026/10/7 8:23:23 网站建设 项目流程

摘要:很多新手想学 AI Agent 开发,却不知道该从哪下手——先学 LangChain 还是先学 RAG?要不要先啃大模型原理?本文拆解 AI Agent 开发岗的真实 JD 要求,结合多个高星开源学习项目的路径设计,给出一条从零到能做项目的清晰路线。核心观点:Agent 开发最难的从来不是写代码,而是从“确定性编程”切换到“概率性编程”的思维转变。

一、先说一个大多数新手都会踩的坑

我做技术辅导这几年,发现一个规律:新手学 Agent 开发,90% 的人一上来就走错了路。

有的人先去啃 Transformer 论文,看了两周注意力机制,结果连一次大模型 API 都没调过;有的人直接跳到 LangChain 教程,跑通了 Demo,但面试官一问“Function Calling 的闭环怎么走的”就卡住了;还有人先花一个月学 RAG,向量数据库装了一堆,却不知道 Agent 和 RAG 到底是什么关系。

这些路径有一个共同的错误:跳过了最重要的第一步——理解 Agent 到底是什么,以及你为什么要用它。

Datawhale 维护的 Agent-Learning-Hub 里有一句话说得特别到位:“理解 agent 的基本循环:observe → think → act → observe。明白什么时候不该用 agent——任务可预测、流程稳定、普通脚本能解决时,agent 反而增加不确定性。”

所以在学任何技术之前,你需要先回答一个问题:我的场景为什么需要 Agent,而不是普通 workflow?这个问题回答不清楚,后面学再多框架都是空中楼阁。

二、先看清 JD:Agent 开发岗到底要什么

在你决定学什么之前,先看看市场要什么。我拆了 2026 年多份 AI Agent 开发岗的真实 JD,发现硬性要求高度趋同:Python + LangChain/LangGraph + RAG + Tool Calling + 向量库 + Docker/K8s。

一份北京地区 AI Agent 算法工程师的 JD 写得更具体:“了解智能体关键技术栈,包括但不限于:任务规划与编排(Task Planning & Orchestration)、工具调用(Function Calling / MCP)、上下文工程与长上下文管理(Context Engineering)、多层记忆机制(Short/Long-term Memory)、检索增强生成(RAG)、多 Agent 通信与协作”。

把这些要求翻译成新手能理解的能力层级:

能力层级具体要求对应学习阶段
基础层Python 编程 + API 调用 + 基础后端第 1-2 周
核心层Prompt 工程 + 工具调用 + Agent 循环第 3-6 周
进阶层RAG + 记忆机制 + 多步推理第 7-10 周
工程层框架实战 + 评估 + 部署第 11-12 周

注意:JD 里反复出现的 LangChain/LangGraph 是框架,不是基础。新手最常见的错误就是先学框架,跳过底层原理。正确的顺序是:先理解 Agent 的核心循环,再用框架加速开发。

三、新手学习路线:四个阶段,三个月

阶段零:思维转变(1-2 天,但不做不行)

在写第一行 Agent 代码之前,你需要先完成一个思维切换。

传统开发是确定性的:输入 A,经过固定的逻辑,输出 B。代码出了问题,断点调试一路跟下去就行。Agent 开发不一样。你给模型一个目标,它自己决定调哪个工具、传什么参数、下一步做什么。输出是非确定性的,同样的输入可能走完全不同的路径。

这就是从“确定性编程”到“概率性编程”的转变。你不是在写一套固定的 if-else,而是在设计一个能自主决策的系统。

这个阶段的具体任务很简单:读完两篇官方文章——Anthropic 的《Building effective agents》和 OpenAI 的《A practical guide to building agents》,然后写一页短笔记,回答“我的场景为什么需要 Agent,而不是普通 workflow”。

阶段一:最小 Agent 循环(第 1-2 周)

这是整个学习路径中最关键的一步。你需要亲手搭建一个不依赖任何框架的最小 Agent 循环。

Datawhale 的 Learning Todo List 把这个阶段拆得很细:

  • 会用一个 LLM API 完成普通对话调用
  • 会让模型输出结构化 JSON
  • 会定义一个工具函数(search、calculator、read_file)
  • 会解析模型的 tool call / function call
  • 会执行工具,并把工具结果喂回模型
  • 会给 Agent 循环加最大步数、超时和错误处理

产出目标:一个 50-150 行的最小 Agent,能选择工具、执行工具、返回最终答案。

为什么强调“不依赖框架”?因为如果你一上来就用 LangChain,你调通了 Demo 但不知道内部发生了什么。面试官问“工具调用失败怎么处理”“上下文超了怎么办”,你只能含糊回答“框架应该处理了吧”。

GitHub 上有一个叫agent-from-scratch的教学项目说得很形象:“学操作系统,就该写一个迷你 OS 来理解它;学数据库,就该写一个迷你数据库。学 Agent 开发,如果只是用现成框架搭一搭,就很难真正落地。”

阶段二:工具调用 + RAG + 记忆(第 3-6 周)

有了最小 Agent 循环之后,开始给它“赋能”。

工具调用进阶:不只是简单的 search 和 calculator,要学会把真实的业务 API、数据库查询、文件操作包装成工具。关键理解是:模型不执行函数,它只负责选工具、填参数,真正的执行是你的后端代码。

RAG 知识库:这是让 Agent 基于私有数据回答的关键。核心流程是“检索 → 增强 → 生成”:用户提问时先去知识库里搜相关资料,再把资料和问题一起交给大模型。你需要掌握文档切片、向量化、向量数据库选型、混合检索这些工程细节。

记忆机制:Agent 需要记住上下文才能处理长任务和多轮对话。短期记忆用滑动窗口或摘要压缩管理当前会话;长期记忆用向量数据库存储用户偏好和历史行为。

推荐的实践项目:做一个“个人知识问答 Agent”——把你自己积累的笔记、文档灌进去,让它能回答关于你知识库的问题。这个项目足够简单,但覆盖了 RAG 和记忆的核心链路。

阶段三:框架实战 + 多步推理(第 7-10 周)

到了这个阶段,你需要用框架来加速开发了。

LangChain → LangGraph 的演进逻辑:LangChain 是链式工作流,方向是单向的,不能向回流或者循环。但随着 AI 深入到业务,很多场景需要循环——比如 Agent 调了一个工具发现结果不对,要回头重新规划。这时候就需要用图结构来表示业务,于是 LangGraph 应运而生。

学 LangGraph 的关键是理解它的核心抽象:

  • State:全局状态,贯穿整个流程
  • Node:节点,每个节点是一个函数,接收状态、返回修改后的状态
  • Edge:边,定义节点之间的跳转关系

用一句话总结:LangChain 让你快速上线,LangGraph 让你深度定制。

多步推理:学习 ReAct 模式(Thought → Action → Observation 循环)和 Plan-and-Execute 模式(先规划后执行)。推荐做一个“多工具助手”项目——比如一个能查天气、算汇率、管理待办事项的 Agent,体验多步工具调用的完整闭环。

阶段四:工程化收尾(第 11-12 周)

Demo 能跑不代表能上线。生产环境的 Agent 需要面对死循环、幻觉、误调用等故障。

你需要补齐的工程化能力:

  • 可观测性:用 LangFuse 或 LangSmith 追踪每次调用的完整链路
  • 成本优化:模型路由、缓存、上下文压缩
  • 安全护栏:输入过滤防注入、输出审核、危险操作人工确认
  • 服务化部署:用 FastAPI 包装成服务,Docker 部署

最终产出:一个完整的、能讲清楚技术决策的 Agent 项目。

四、一个建议:动手写一个 Agent,而不是只用框架搭

大多数新手学习 Agent 的方式是:看教程 → 跑 Demo → 换个场景再跑一遍。学完三个月,简历上写着“熟悉 LangChain”,但面试官问“Agent 的核心循环怎么实现的”,答不上来。

有一个更好的方式:先手写一个 Agent,再用框架复现。

GitHub 上有几个非常适合新手手写 Agent 的开源项目。agent-from-scratch用约 3700 行可通读的 Python 代码,把 Agent 拆成乐高积木式的基础部件——模型调用、工具协议、执行上下文、记忆、RAG、沙箱与多智能体编排,每一步都能追到源码。另一个项目ai-agents-from-zero提供了从概念篇到实战项目篇的完整教程,覆盖 LangChain / LangGraph / MCP / RAG / 提示词,对标大模型应用开发工程师岗位。

手写一遍的价值在于:你会真正理解 Agent 的每一步在做什么。模型怎么决定下一步、工具怎么被描述和执行、上下文怎么持续、错误怎么回传——这些细节,框架帮你隐藏了,但面试官会追问。

五、新手最容易犯的五个错误

错误一:先学大模型原理,再学应用开发。你不是要做研究员。Agent 开发岗 80% 的考察点是工程化能力,不是算法推导。大模型原理了解基本概念就够了,不需要会手推注意力公式。

错误二:直接跳到 LangChain,跳过底层原理。框架是加速器,不是基础。先手写一个最小 Agent 循环,再用框架复现,你的理解深度完全不同。

错误三:只学 RAG,不学 Agent。RAG 是 Agent 的一个工具,不是终点。面试官会问“你的 Agent 怎么决定什么时候调 RAG、什么时候不调”。

错误四:学完不练,只看教程。Agent 开发是实践学科。每学一个概念,就要动手写代码验证。理论学习与代码实践的比例建议 3:7。

错误五:追求完美,不敢发布。先做一个能跑的丑东西,再迭代优化。不要花三周设计一个完美的架构,结果一行代码没写。

六、面试速查表

考点一句话答案追问方向
Agent 核心循环observe → think → act → observe什么场景不该用 Agent?
Function Calling模型选工具填参数,后端执行并回传结果工具调用失败怎么兜底?
ReAct vs Plan-and-ExecuteReAct 边想边做,Plan 先规划后执行什么场景用哪种?
RAG 核心流程检索 → 增强 → 生成切片策略怎么选?
短期记忆 vs 长期记忆短期用滑动窗口,长期用向量库上下文超了怎么压缩?
LangChain vs LangGraphChain 单向,Graph 支持循环和状态为什么需要图结构?
多 Agent 协作Manager-Worker、专家小组模式怎么避免上下文污染?
工程化可观测性 + 评估 + 安全护栏怎么量化 Agent 效果?

七、最后说一句真心话

回到最开始的问题:想做 AI Agent 开发,新手到底该先学哪些东西?

答案不是某个框架,也不是某个模型。答案是你先要完成一次思维转变——从“写死逻辑”到“设计规则,让模型自己决策”。然后再按顺序补齐:最小 Agent 循环 → 工具调用 → RAG 和记忆 → 框架实战 → 工程化。

你不需要成为大模型专家,也不需要数学功底多深。你需要的是:能调 API、会写 Python、理解工程逻辑,然后亲手跑通一条完整的 Agent 链路。

在 Agent 领域,当前更值得投入的方向是 Claude Code 这类 coding agents、Agent harness engineering(工具协议、权限、状态、反馈、评测),以及 Skills / MCP / A2A 这些连接标准。老式的角色扮演多 Agent 框架可以了解,但不应该成为主线。

最有效的学习路径不是收藏 100 篇教程,而是今天就去调一次大模型 API,写一个 50 行的最小 Agent。

如果这篇文章对你有帮助,欢迎点赞收藏。也欢迎在评论区分享你的学习困惑和踩坑经历,一起交流。

标签:#AI Agent #新手入门 #学习路线 #Function Calling #LangGraph #RAG #大模型应用开发 #面试

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询