一年从零入门大模型:给小白的AI学习收藏指南
2026/9/16 7:33:42 网站建设 项目流程

本文分享了作者从零开始学习AI和大模型的完整历程,包括克服数学障碍、啃英文书籍、搭建模型等经验。作者建议初学者从深度学习入手,推荐《深度学习的数学》等实用资料,并强调设定小目标、坚持学习的重要性。文末附上作者筛选的核心学习资源及评价,适合想入门AI的小白参考。

2025年1月 DeepSeek 横空出世,大家都在讨论”这个模型参数量多大“,”上下文窗口够不够“,我看着这些陌生的术语,一个词都插不上。更扎心的是,那时候我连”参数“和”上下文“到底指什么都不知道。

那一刻我意识到:AI 已经不是未来趋势了,它就是现在。而我,还站在门外。

对于一个毕业 10 多年、从未学过人工智能的人来说,这个念头既兴奋又让人发怵。但转念一想——如果 AI 是普通人难得一遇的机会,那最好的入场时间,就是现在。

于是 2025 年初,我下了决心:用一年时间,从零开始学 AI,找到自己的方向。

不知从哪里入门

刚开始和所有人一样,上网搜”AI 怎么学“,结果大部分推荐的是吴恩达的视频课。看完了他的《提示词工程》,对怎么使用 AI 有了粗浅的认识,但完全不成体系。

当时最大的困惑是:AI 的知识体系太庞大了。机器学习、深度学习、大语言模型、强化学习——这些词到底什么关系?花了些功夫终于搞清楚:现在流行的大模型,本质上是深度学习的一部分。于是我决定,从深度学习开始啃。

网上有人推荐李沐的《动手学深度学习》,B 站有配套视频。兴冲冲翻开书,看到数学基础那章的时候,直接傻眼——满屏的偏导符号,对于一个毕业 10 多年没碰过公式的人来说,跟天书差不多。李沐讲得虽然好,但数学推导默认你是有基础的,跳跃性很大。当时真的想合上书放弃了。

后来找到一本日本人写的《深度学习的数学》,这本书救了我。它最大的特点是每章最后一节会用 Excel 把深度学习的概念从头模拟一遍——梯度下降不再是抽象的公式,而是一行行看得见的数字变化。我对着书把梯度下降的推导翻来覆去看了好几遍,总算通了。

春节学习第一本英文技术书

学到这里的时候,国外刚出了一本《Hands on Large Language Model》,吴恩达也推荐了。当时国内没有中文版,硬着头皮开始看人生中第一本全英文技术书。

那段时间刚好是春节假期。每天晚上安顿小孩睡觉后,一边翻书一边查单词,大概学了一个月才看完。说实话,这本书用了很多漂亮的图,但讲得不算细,代码基本都是直接调接口,加上全英文,看完之后对大模型训练、微调的理解还很模糊。

但我得到了一个意料之外的收获:我不再害怕英文资料了。 一个月下来,记住了大量大模型领域的英文术语,这为后面直接看英文论文、听英文课程铺平了路。另一个收获是在做书中实验时,第一次接触了 Google Colab——可以免费白嫖 GPU,对于没有硬件的人来说简直是福音。

记得上次在春节这样努力学习还是高三,虽然大模型知识没学多少,但是把“英文”这道心理门槛拆掉了。后面的学习资源,有很多都是英文的,看到也不会发怵了。

午休时啃完《动手学习深度学习》

接下来重新挑战《动手学深度学习》。反思了一下,之前没坚持下去的真正原因是:没有目标,看到哪儿算哪儿,很容易就停了。

这次给自己定了一个目标:每天至少看完一节。平时上班没时间,主要利用中午午休和晚上小孩睡觉后学习。遇到卷积神经网络那章,看了几遍都看不明白,上网搜到了台湾大学李宏毅的《深度学习》视频。李宏毅讲得清楚又有趣,尤其是卷积那块,把复杂的操作讲得很直观。从那以后,我的学习模式固定了下来:先看书,不懂的地方再去找李宏毅的对应章节。

从 3 月初到 5 月初,两个月终于把《动手学深度学习》啃完了。

为了加深对 Transformer 的理解,还找了一篇博客《Transformers Laid Out》跟着实操。这篇文章从初学者视角讲解《Attention Is All You Need》论文中每个部分的含义,并用 PyTorch 一步步带你把 Transformer 编码实现。最后代码虽然跑通了,但过程报了不少错——感觉作者写完了代码但没有充分调试。不过瑕不掩瑜,这篇文章对 Transformer 原理的讲解是目前我看过最清晰的。

这段时间最大的心得:设定一个很小的、能坚持的每日目标,养成习惯后,更容易坚持下去

动手造轮子,搭建大模型

在图灵书的微信群里看到《从零构建大模型》中文版,正好接上了我的进度。如果要我推荐一本大模型入门书,目前这本排第一。

作者用 PyTorch 带着你从模型实现、预训练到微调,像搭积木一样从零完成自己的大模型。即使没有深度学习的数学基础,也能顺着逻辑看明白。大概一个月看完,基本上摸清了大模型的核心脉络。

7 月份,微博上一个叫九原客的博主推荐了斯坦福公开课 CS336(Language Modeling from Scratch)。这门课的目标是引导学生从零开发自己的语言模型,获得全面理解。印象最深的是听了一节课,作业就要从零实现一个大模型,包括 BPE 分词——光这一个作业估计要写大半个月。最后参考了一些网友的实现才把第一个作业写完。

这门课和工程结合得特别紧,学完并完成全部作业的话收获会非常大。但说实话,投入时间也真的很大,后来还是没能坚持到底。

用了一个月搭出一个自己的大模型,哪怕它很简陋,但那种掌控感是看多少书都给不了的。

第一次微调模型

对大模型原理有了底之后,开始尝试实战——用微调让模型根据需求自动生成测试用例。选用的是 LLaMA-Factory 框架,网上教程很多,上手比预想的简单。

但真正跑起来后,问题来了:数据量太少,最终效果并不好。

虽然结果不尽如人意,但完整走了一遍微调的流程,从准备数据集、配置参数到看 loss 曲线下降,那种亲身参与的感觉还是很不一样。

拿到第一个Coursera证书

8 月接下来的十来天,用豆包搭建了工作流,了解到 RAG 这个概念,然后学完了 DeepLearning.AI 上的 RAG 课程,拿到了人生第一个 Coursera 证书。这门课老师讲得很清楚,结合课程中的小实验,对 RAG 会有比较全面的理解——多亏了之前啃完那本英文书,这次全英文的课程基本能听懂了。

之后又学了 Hugging Face 的微调课程,但这门课后来没更新,只学了两章,作业提交了也没有回应。

从 9 月一直到 11 月底,学习基本停滞了。

原因很现实:一是没有找到明确的学习方向,不知道接下来该学什么;二是工作忙起来后,之前每天一节的节奏一断,就很难再接上。这种停滞期,可能是自学者最难熬的阶段——不是学不会,而是不知道往哪走。

坚持不放弃

直到今年 1 月,才重新捡起节奏,学完了 DeepLearning.AI 上的强化学习课程,拿到了第二张 Coursera 证书。说实话,这门课讲得一般,课程实验的重点不是很突出,但对强化学习的基本概念有了入门级的理解。
最近一段时间,重心转移到了 AI Agent 上——除了一直在用 Cursor,最近用得比较多的 Claude Code、还用了下Open Code 和 Hermes,从学 AI 是怎么工作转变到用 AI 来工作,通过这段时间的尝试,前进的方向也开始有了一点轮廓。


以下是我这一年来筛选过的核心学习资料,附上我的真实评价:

  1. 《深度学习的数学》

如果你的数学和我一样早就还给了老师,这本书比任何视频课都管用。它不假设你有任何基础,每章用 Excel 把抽象的公式变成看得见的数字。我就是靠它把梯度下降真正看懂的。

  1. 《Hands on Large Language Model》

全英文,图画得很漂亮但写得不难。

  1. 《动手学深度学习》+ B 站李沐视频

系统、全面,适合作为深度学习的入门教材。但数学部分默认你有基础,不懂的地方可以用下面李宏毅视频补。

  1. 深度学习:台湾大学李宏毅

当你某个概念看书看不懂的时候,去找李宏毅的对应章节。他讲得清楚、幽默。

  1. Transformers Laid Out

从初学者视角用 PyTorch 带你实现 Transformer,对《Attention Is All You Need》论文的每个部分拆解得很清楚。代码部分有些 bug 需要自己调,但作为理解 Transformer 的辅助材料非常出色。

  1. 《从零构建大模型》

如果你只想买一本书来了解大模型怎么造,买这本。像搭积木一样带着你从零完成模型实现、预训练和微调,不需要数学基础也能顺着逻辑看明白。

  1. 斯坦福 CS336:Language Modeling from Scratch

引导学生从零完整开发语言模型,和工程结合很紧。作业量大(一个作业可能写大半个月),适合有大块时间和一定基础的人。

  1. 安德烈·卡帕西:深入探索大语言模型

AI 大神卡帕西以 DeepSeek 为例,整整 3 个半小时深入讲解 LLM 和强化学习原理。

  1. DeepLearning.AI 的 RAG 课程

老师讲得很清楚,课程附带小实验,学完对 RAG 会有比较全面的理解,学完还能拿一张 Coursera 证书。


以上就是我这一年走过的路。如果你也是一个非科班出身、数学不太好、但很想学 AI 的人,希望我的经历能让你少走一点弯路。

最后

2026 年一晃已经过半,AI 大模型的热潮不仅没有降温,反而持续升温!

金融行业用大模型做风控、医疗依靠 AI 解析影像,电商、制造、教育各行各业,都在把 AI 融入日常业务。曾经热闹的 “百模大战”,早就告别单纯比拼模型参数,正式进入落地应用时代

现在企业疯狂紧缺一类人才:懂业务、懂 AI、能做出可上线项目的大模型开发工程师,岗位缺口大,薪资待遇十分可观。

风口再好,不如手握高薪 offer 实在。行情火热,普通人、程序员该怎样从零入门大模型,抓住这波机会?

今天整理好【2026 最新版】AI 大模型全套免费学习资源,覆盖零基础入门、项目实战、理论知识、大厂面试,从基础一路进阶。所有资料分类归档,没有多余杂料,无套路免费分享给想要入局 AI 赛道的程序员与零基础小白!

👇👇扫码免费领取全部内容👇👇

1、大模型系统化完整学习路线

2、大模型经典书籍&文档

3、AI 大模型最新行业研究报告

4、企业级实战项目 + 完整配套源码

5、大厂大模型面试真题汇总

6、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询