简介:这是一份基于MIT公开课整理的线性代数学习笔记,覆盖从方程组几何解释、矩阵消元、LU分解、四个基本子空间,到投影与最小二乘、Gram-Schmidt正交化、特征值与特征向量、SVD等核心专题,内容循序渐进,适合正在学习线性代数、准备考研或需要巩固数学基础的理工科学生对照课程同步复习。资源为单个PDF文件,压缩包大小约506KB,便携易读,可配合MIT课程视频使用。已有1073人学习下载。笔记以要点归纳为主,兼顾公式推导与几何直观,能帮助读者快速抓住知识主线,并在后续学习中作为框架性的速查资料。 很多人学线性代数是被教材劝退的——满页的定理、证明和行列式展开,背完就忘,更不知道这些符号到底能干什么。我大学时也深受其苦,直到后来在MIT公开课里遇见Gilbert Strang的线性代数(18.06),才第一次觉得这门课不是用来折磨人的,而是用来解释世界的。Strang教授用一套极其清晰的几何视角,把矩阵、向量空间、特征值这些东西讲成了有因果的故事。也因为如此,我后来在整理自己的线性代数笔记PDF时,才能把视频、讲义和自己的推导真正融成一套知识系统。这篇博文就来聊聊这份笔记背后的学习路径:这门课为什么值得反复看,核心知识框架该怎么搭,我是怎么把视频课整理成可复用的PDF笔记,以及那些只有踩过坑才会注意到的细节。适合正在被线代折磨的学生,以及需要回头补数学基础的工程师和数据从业者参考。
1. Strang的讲法,为什么能让普通人真正听进去
1.1 课程逻辑是“先几何,后计算”,而不是“先定义,后定理”
传统教材往往从行列式讲起,一上来就是代数余子式、克拉默法则,学了半天还不知道行列式到底在描述什么。Strang完全反着来,他在课程前几讲的中心始终是 Ax=b:一个二元方程组,每个方程就是平面上的一条直线,解是两条直线的交点;放到三维,每个方程是一个平面,解可能是平面交出的直线或点。这种讲法让线性方程组第一次有了画面感,而不是一堆待机械消元的数字。
更关键的是,Strang不断切换视角:除了“行视角”,还要你用“列视角”看矩阵乘法,把Ax理解为A各列的线性组合。这一个转折看似简单,实际上是把学生从“算数思维”拽进“空间思维”的钥匙。理解了列组合,后面列空间、零空间、秩这些概念就有了天然的落脚点。我笔记里专门用两页纸对比这两种视角,后来每次复习都有新的体会。
1.2 全程贯穿“矩阵分解”这条主线,越到后面越清晰
Strang课程的另一个高明之处,是把整门课浓缩成几个重要的矩阵分解。我在笔记开篇就列了一张表,之后每学一个阶段就回来看一眼这张表:
| 分解形式 | 名称 | 核心含义 |
|---|---|---|
| A=LU | 消元分解 | 把高斯消元的全部过程记录成下三角和上三角矩阵 |
| A=QR | 正交化分解 | 把矩阵的列规范为一组正交基 |
| S=QΛQ^T | 对称矩阵谱分解 | 对称矩阵可以通过正交特征向量对角化 |
| A=UΣV^T | 奇异值分解 | 任意矩阵都可以拆成旋转-拉伸-旋转 |
为什么分解这么重要?因为矩阵的本质是线性变换,分解就是把一个复杂的复合变换拆成若干个简单步骤。消元不是“为了算而算”,它是在把A的信息结构化成L和U;特征值分解把A^k变成Λ^k,一次复杂的矩阵幂运算立刻变成标量幂运算,矩阵的长期行为一目了然;SVD则是课程的压轴,把一切矩阵都纳入同一个框架。
1.3 这堂课配套的资源体系,也值得认真利用
MIT的OpenCourseWare网站提供了18.06的完整视频、讲义、作业题和往届考试题。视频大概34讲,每讲约50分钟。我的建议是:不要一口气刷完,最好按“看一讲、记一讲笔记、做一讲习题”的节奏推进。Strang的课讲得流畅,很容易让人产生“全听懂了”的错觉,但真正动手做题时才会发现漏洞。后面第4章我会详细说这个坑。
2. 这份笔记里,我反复标注最多的几个核心概念
2.1 四大子空间:线性代数真正的地图
Strang在课程中段会画一张非常重要的“地图”:任何m×n矩阵A都定义了四个基本子空间。我笔记里这一页的折痕最重,因为它几乎串联起后半门课的所有内容。
| 子空间 | 定义 | 维度 | 它回答的核心问题 |
|---|---|---|---|
| 列空间 C(A) | A各列的线性组合 | r | b在什么情况下能被A表示? |
| 零空间 N(A) | Ax=0的全部解 | n-r | 解的“自由度”有多大? |
| 行空间 C(A^T) | A各行的线性组合 | r | A的行向量张成了什么空间? |
| 左零空间 N(A^T) | A^T y=0的全部解 | m-r | 哪些左乘向量会被A压扁? |
这四个子空间两两正交,维度又满足漂亮的守恒关系:列空间维数等于行空间维数等于秩,零空间和列空间的维度加起来正好等于列数。这种“秩-零化度定理”在信息论、控制论和数据科学里反复出现。我建议读者在做笔记时,一定要亲手画一张“四格图”把四个子空间的位置关系画出来,这比抄十遍定义都有用。
2.2 投影与最小二乘:从纯数学迈向真实应用
很多初学者学到投影就卡住了,因为投影看起来“只是把向量摔到平面上”。但实际上,它是整个应用数学的枢纽。当Ax=b无解(也就是b不在列空间里)时,退而求其次,我们希望找一个x,让Ax尽可能接近b。这个“尽可能接近”的数学语言就是:把b投影到列空间上,然后求解投影后的方程。
投影矩阵是P=A(A^T A)^(-1)A^T。这个公式我在笔记里单独用红框标了出来,因为后面一大串内容都建立在它上面:最小二乘解满足A^T Ax=A^T b,回归分析里拟合一条直线 y=ax+b,本质上就是做一次最小二乘投影;数据科学里做线性模型,底层也是这套机制。理解了投影,你再看机器学习里的损失函数和正规方程,就不会觉得那是天外飞仙了。
2.3 特征值与对角化:判断矩阵长期行为的“体检报告”
特征值这块传统的学法很容易变成“求根训练”:解det(A-λI)=0,算出几个λ,然后就结束了。Strang强调的是,特征值必须和特征向量放在一起理解:Ax=λx的意思是,在x这个方向上,A只做缩放,不改变方向。特征值就是那个缩放倍数。
真正让特征值有威力的是对角化:如果能找到n个线性无关的特征向量,那么A=SΛS^(-1),从而A^k=SΛ^k S^(-1)。这个式子解释了马尔可夫矩阵为什么最终会趋于稳态,Fibonacci数列为什么可以用矩阵幂求出通项,也解释了差分方程和微分方程解的长期形态。我在笔记里专门把“可对角化的条件”单列了一节:重特征值可能导致特征向量不够,这时候矩阵不可对角化。很多人只记公式不记条件,考试一遇到重根就翻车。
2.4 SVD:把矩阵拆给所有现代应用看
SVD是18.06课程真正的压轴。Strang在前面的课里积累了大量直觉,最后用A=UΣV^T一锤定音:任何矩阵,不管是不是方阵,不管是否满秩,都可以分解成正交矩阵U、对角阵Σ和正交矩阵V^T的乘积。它的几何含义是:先旋转,再沿坐标轴拉伸,再旋转。
重要性怎么强调都不过分。PCA主成分分析本质上是对数据矩阵做SVD,然后取最大的几个奇异值对应的方向;图像压缩可以丢弃小奇异值来逼近原图;推荐系统里的潜在因子模型也和SVD思想一脉相承。特征值分解只对可对角化方阵有效,SVD却对任意矩阵都有效,这就是它能在工程和机器学习界“通吃”的原因。
3. 把一套公开课视频变成PDF笔记的完整流程
3.1 第一遍看视频:手写草稿,拒绝完美主义
很多人一开始就想着用LaTeX边听课边排版,结果手忙脚乱,讲课内容反而没听进去。我的做法是:第一遍观看时只用普通纸笔,快速记录推导链条和关键例题,字迹潦草也没关系,重点是跟上Strang的思路。遇到听不懂的地方,我会在页边画一个大问号,然后继续往下听,不纠结。
这种“草稿笔记”的价值在于捕捉课堂推导的原始过程。比如Strang讲消元时,不是直接给你A=LU,而是从实际的消元步骤中推导出L和U的形式;如果你只抄结论,就会错过“为什么L的对角线全是1”这种关键细节。手写能逼着你的大脑跟着推导走,而不是当打字员。
3.2 第二遍整理:按主题重组,而不是按视频顺序平铺
第一遍笔记全部看完之后,我开始第二遍整理。这里有一个重要思路:不要按Lecture 1、Lecture 2的顺序平铺,而要按主题重组。我最终PDF的目录大致分为:线性方程组与消元、向量空间与子空间、正交性与最小二乘、特征值与矩阵分解、SVD与现代应用。这样整理之后,复习时是在“找概念”,而不是“翻视频回忆”。
工具链上,我用的方案是Markdown + LaTeX数学公式 + Pandoc导出PDF。具体是这样:用VS Code写Markdown,数学公式用LaTeX语法,插图先用GeoGebra验证几何关系,再导出为SVG或PDF插入文档,最后用Pandoc转换成带书签的PDF。如果你不用Markdown,直接用Overleaf写LaTeX也可以,但是学习成本会高一些。个人更推荐Markdown起步,因为门槛低,而且公式和文字能分离,后期想改成博客也非常方便。
3.3 作图与可视化:把抽象关系变成“一眼就懂”的图
线代笔记的质量高低,很多时候取决于图。Strang讲课板书里画满了子空间关系图,我整理笔记时也做了大量图,其中最有价值的有三张:四个子空间的关系图、投影几何示意图、SVD的旋转-拉伸-旋转示意图。图不是装饰,而是另一种表达方式——文字描述“零空间和行空间正交补”可能要写三行,但一张图就能让人记住。
如果你不熟悉TikZ绘图,用GeoGebra先画好再导出图片也行。我的经验是,画图不要一上来就追求三维渲染,先严格理解二维情形。比如画投影,先在平面上画一条直线和一个向量,标出投影向量和误差向量,然后问自己:误差向量为什么垂直于平面?这个问题想明白,投影矩阵公式就再也忘不掉了。
3.4 给PDF做好目录、书签和关键词索引
到这里,一份笔记还只是“内容完整”,要想让它变成可以反复查阅的工具,还需要做三件事:第一,每个章节的标题要同时标出主题和对应的Lecture编号,比如“四大子空间(对应Lecture 10-12)”;第二,导出PDF时一定要生成层级分明的书签,一级目录是主题,二级是小节,三级是常见错误或典型例题;第三,在文末做一个关键词索引,把“秩”“列空间”“正交”“可对角化”等词出现的位置整理出来。
这一步看起来琐碎,但它决定了你的笔记是“写完就吃灰”,还是“每次用都顺手”。我自己的这个PDF现在仍然保留在电脑里,工作里遇到矩阵分解或最小二乘的问题,直接打开书签搜索,几分钟就能定位到相关定义和例子。
4. 刷完视频整理了笔记,我还是踩过的几个坑
4.1 被行变换的计算带偏,忘了消元只是手段
踩坑表现:刷完前几讲之后,我一度觉得线性代数就是“高斯消元大赛”,做题时闷头化简矩阵,算得飞快,但别人一问“秩是什么”“主元个数和零空间维度什么关系”就答不上来。问题的根源在于,消元是获得信息的手段,而信息本身是主元个数、秩、可逆性,以及A=LU这个结构性分解。如果只练操作、不问目的,后面的子空间理论就变成了无源之水。
我的纠偏办法是:每做完一道消元题,强迫自己回答三个问题——矩阵的秩是多少?有几个主元?零空间的维数是多少?一开始很别扭,慢慢就会发现,这三个问题其实是一件事的不同侧面。这个过程也让笔记里的“秩与零化度”那节变得非常扎实。
4.2 特征值当成求根游戏,没把特征向量当回事
第二坑是在特征值章节。我一度只要解出det(A-λI)=0的根就觉得自己会了,结果做马尔可夫矩阵的课后题时直接懵了:特征值1算出来了,可是稳态向量怎么求?其实就是把λ=1代回(A-λI)x=0,解出对应的特征向量。这个操作不复杂,但如果脑子里没有“特征值-特征向量是一对”的概念,就根本想不到。
另一个容易忽略的是重特征值带来的退化问题。单位矩阵的所有特征值都是1,但它有无数个特征向量;而某些矩阵虽然特征值不重复但特征向量也不一定直观。我在笔记里做了一张小表,分别列出可对角化、不可对角化、对称矩阵三种情况,配合例题理解。这样再遇到相似矩阵、Jordan标准型这些内容时,就有心理准备了。
4.3 跳过SVD,等真正用的时候再回来补课
说实话,我第一遍刷完这门课时,SVD部分理解得很浅。当时觉得“奇异值分解不就是特征值分解的推广吗”,没有花心思琢磨U和V的列向量到底代表什么。结果后来看PCA和压缩感知相关的内容,发现满篇都是SVD,才不得不回头重新学。
这轮复习我意识到,SVD和特征值虽然形式上接近,但用途完全不同。V的列是A^T A的特征向量,U的列是AA^T的特征向量,Σ里的奇异值分别是它们特征值的平方根。理解了这层关系,SVD就不再是三个矩阵的随机组合,而是一套把“行空间-零空间”和“列空间-左零空间”全部连起来的大统一工具。现在如果让我提一条建议,我会说:特征值学完之后,一定要趁热打铁把SVD吃透,别给未来的自己留作业。
4.4 只刷视频不做题,尤其是跳过MIT的原版作业
最后一个坑最早出现,也最隐蔽。Strang讲课太流畅了,加上字幕和暂停功能,很容易让人产生“我听懂了”的错觉。我第一遍刷到第20讲左右时,感觉一切尽在掌握,随手翻开一道课后题却发现根本不知道从哪里下手,越基础的题越容易卡住。
后来我强制自己回到MIT OCW网站,把配套的Problem Sets按每两周一套的节奏做完了。这些题目质量极高,既有基础计算,也有不少需要动脑的概念题。做题时我给自己立了规矩:不看解析,不边看答案边写步骤;错题整理进笔记PDF,并在目录里单独标注“易错”。回头看,真正让线性代数在脑子里生根的,不是视频,而是这些硬碰硬的练习。
5. 笔记完成之后,我是怎么让它继续增值的
5.1 把每一讲压缩成“一句话要点”,用于随时自测
整理完PDF后,我在每章开头加了一段“一句话要点”。比如第7讲的要点是“Ax=0的关键是把自由变量当作参数,主元变量随之确定”;第21讲是“特征向量在变换前后方向不变,特征值就是那个方向的伸缩倍数”。复习的时候,我先看这句话,然后合上笔记,试着用自己的话把这一讲展开讲清楚。如果能讲明白,说明这章基本过关;如果讲不出来,就回去翻对应的例题和图。
这个方法最初是我用来做“考前速览”的,后来发现它比任何思维导图都更能暴露知识漏洞。它把笔记从“信息存储”变成了“自我测试工具”,一本PDF也就真正活了起来。
5.2 把高频错题和关键定义做成Anki卡片
另一件让我受益的事,是把笔记里的高频错题、关键定义、易混结论做成了Anki间隔重复卡片。每天花10到15分钟过一遍,内容不多,但坚持下来效果惊人。卡片不要直接抄定义,最好自己做成填空题或“判断对错”的形式。比如“任意矩阵都能做特征值分解——对还是错”,答案是否定的,必须加上“可对角化方阵”这个条件。这种主动回忆比反复阅读笔记有效得多。
5.3 后续延伸:线代这棵树的枝叶往哪里长
学完18.06之后,这张知识地图的很多枝杈都值得继续探索。想做机器学习的同学,可以接着看PCA、矩阵分解在推荐系统里的应用、神经网络里的反向传播如何依赖矩阵求导;这些内容的核心底座就是最小二乘、特征值、SVD。想做科学计算和工程仿真的,可以进入数值线性代数,学习条件数、迭代法、大规模稀疏矩阵求解,你会发现Strang一直强调的“矩阵分解思维”正是数值计算的灵魂。想搞信号处理和图像处理的,则可以从线性变换的角度重看傅里叶变换,Strang在复数矩阵与快速傅里叶变换那一讲其实已经埋下了种子。
我到现在还留着这份笔记PDF,偶尔写代码遇到矩阵分解的疑问,会直接打开查一查。学线性代数最值钱的不是记住了多少公式,而是脑子里存了一幅空间图像,以及一套“先看结构、再上计算”的思考方式。希望你也愿意花时间亲手做一份这样的笔记,它会在你日后很多意想不到的地方,悄悄帮上忙。
本文还有配套的精品资源,点击获取