☰
[新手小白也能学会] 00-深度学习简介
2026/9/27 22:59:20 网站建设 项目流程

摘要:本文系统讲解深度学习的基础知识,从人工智能、机器学习与深度学习三者的包含关系切入,回顾机器学习固定五步流程及其处理图像、文本的局限,引出深度学习以人工神经网络为架构、自动提取特征的核心定义。随后拆解神经网络(ANN)的输入层、隐藏层、输出层结构,说明神经元加权求和与激活函数的作用,并介绍张量、全连接层、黑盒特性及反向传播训练原理。接着总结深度学习的四大特点,梳理 CNN、RNN、Transformer 等常见模型及其在图像、文本处理中的应用,最后给出应用场景、发展历史与知识速查表,帮助读者建立完整的深度学习知识框架。

目录

一、什么是深度学习

1.1 人工智能、机器学习与深度学习的关系

1.2 先回顾:机器学习是怎么工作的

流程固定:核心五步

数据预处理:标准化与归一化

三大任务(按实际使用频率)

局限:处理图像、文本能力较弱

1.3 深度学习的核心定义

1.4 深度学习 vs 传统机器学习

二、神经网络(ANN):深度学习的骨架

2.1 三种层:输入层、隐藏层、输出层

2.2 隐藏层:每个神经元只做两件事

2.3 关于"深度":层数与神经元个数

2.4 全连接层在哪里

2.5 底层数据结构:张量,且输入必须是二维

2.6 为什么说深度学习是黑盒

2.7 拓展:神经网络是怎么训练的——反向传播(课堂补充)

三、深度学习的特点

四、常见深度学习模型:图像与文本怎么处理

4.1 图像 → CNN(计算机视觉 CV)

4.2 文本 → RNN(自然语言处理 NLP)

4.3 其他模型要点

4.4 深度学习计算框架

五、应用场景

六、发展历史

6.1 人工智能发展历史

6.2 深度学习发展历史

七、知识速查表


一、什么是深度学习

1.1 人工智能、机器学习与深度学习的关系

三者是包含关系:

人工智能(Artificial Intelligence, AI) └── 机器学习(Machine Learning, ML) └── 深度学习(Deep Learning, DL)

概念定义
人工智能(AI)让机器表现出智能行为的科学与工程,目标是让机器"仿智"
机器学习(ML)实现人工智能的一种途径,让计算机从数据中学习规律,而无需显式编程
深度学习(DL)机器学习的一个子集,基于人工神经网络,通过多层非线性变换自动学习数据的特征

深度学习是机器学习的子集,所以要理解深度学习"深"在哪、新在哪,得先看机器学习是怎么工作的。

1.2 先回顾:机器学习是怎么工作的

流程固定:核心五步

机器学习的处理流程是固定的:

获取数据 → 数据预处理 → 特征工程 → 模型训练 → 模型评估与预测

其中特征工程由人来完成——这是机器学习最依赖人工经验的环节,也是它和深度学习最核心的区别。

数据预处理:标准化与归一化

预处理最常见的操作是把不同量纲的特征缩放到接近的范围,两种常用方法:

方法英文公式效果
标准化Standardization(Z-score)z = (x − μ) / σ变换成均值 0、标准差 1 的分布,形状不变
归一化Normalization(Min-Max)x' = (x − min) / (max − min)把数据压缩到 [0, 1] 区间

两个统计量:

  • 均值 μ:所有数加起来除以个数,代表"平均水平"。如[2, 4, 6]的均值为4。
  • 标准差 σ:衡量数据的波动程度,即每个数离均值平均有多远。σ 大说明数据忽高忽低,σ 小说明数据都挤在均值附近。

为什么要做缩放:不同特征量纲差异很大(如年龄范围 0~100,收入可达几十万),大数值特征会"压住"小数值特征、主导训练过程;缩放后各特征公平参与,模型收敛更快更稳定。

经验:数据近似正态分布或存在异常值时用标准化;需要固定范围(如图像像素 0~255 → 0~1)时用归一化。

三大任务(按实际使用频率)
任务英文说明使用频率
分类Classification预测离散类别(如垃圾邮件 / 正常邮件)大概率用
回归Regression预测连续数值(如房价、温度)也会用
聚类Clustering无监督,把相似样本自动分组很少用,一般只在项目初期做样本相似性分析,且不会从 0 开始造轮子,直接用现成工具
局限:处理图像、文本能力较弱

机器学习处理图像、文本这类非结构化数据的能力较弱——图像是高维的像素矩阵,文本是离散的符号序列,人工很难设计出有效的特征。这正是要引入深度学习的原因:能不能让算法自己学特征?

1.3 深度学习的核心定义

深度学习(Deep Learning)是机器学习的分支,是一种以人工神经网络为架构、对数据进行特征学习的算法。"深度"指网络中使用多层结构。

核心思想:通过模仿人脑的神经网络来处理和分析复杂的数据,从大量数据中自动提取复杂特征,擅长处理高维数据,如图像、语音和文本。

核心要点:

  1. 基于人工神经网络:模仿人脑神经元结构构建计算模型
  2. 深度:网络中使用多层结构
  3. 逐层抽象:每层通过非线性变换处理数据,逐渐提取更复杂、更抽象的特征
  4. 端到端学习:从原始数据直接到最终结果,无需人工设计特征

1.4 深度学习 vs 传统机器学习

两种流程放在一起看,区别一目了然:

机器学习: 输入 → 人工特征提取 → 分类 → 输出 深度学习: 输入 → 算法自动特征提取 + 分类 → 输出
对比维度传统机器学习深度学习
特征提取依赖人工设计特征,并进行特征提取不需要人工,依赖算法自动提取特征
处理流程输入 → 人工特征提取 → 分类 → 输出输入 → 自动特征提取 + 分类 → 输出
数据需求相对较少通常需要大量标注数据
计算资源要求较低需要强大的计算资源(如 GPU)
可解释性相对较好可解释性差,被称为"黑箱"
擅长领域结构化数据、简单任务高维数据(图像、语音、文本)

关键区别:传统机器学习算法依赖人工设计特征,并进行特征提取;

而深度学习方法不需要人工,而是依赖算法自动提取特征。

深度学习通过模仿人脑的神经网络来处理和分析复杂的数据,从大量数据中自动提取复杂特征,尤其擅长处理高维数据(图像、语音、文本)。这也是深度学习被看做黑盒子、可解释性差的原因(为什么会变成黑箱,第二章 2.6 节展开)。

深度学习的架构是人工神经网络,那么神经网络长什么样?下面把它拆开看。

二、神经网络(ANN):深度学习的骨架

2.1 三种层:输入层、隐藏层、输出层

ANN(Artificial Neural Network,人工神经网络)由三种层组成:

输入层 ──→ 隐藏层(一层或多层) ──→ 输出层 (特征数) (神经元 + 激活函数) (由任务决定)

层神经元个数由什么决定作用
输入层特征数(如鸢尾花 4 个特征 → 4 个神经元)只接收数据,不做计算
隐藏层人为设定(经验值)特征提取的核心,逐层抽象
输出层任务目标(二分类 1 个,多分类 = 类别数,回归 = 预测值个数)给出最终结果

2.2 隐藏层:每个神经元只做两件事

  1. 加权求和:z = w₁x₁ + w₂x₂ + … + wₙxₙ + b(w 是权重 weight,b 是偏置 bias)
  2. 激活函数:a = f(z),如 ReLU、Sigmoid

为什么必须有激活函数:如果只有加权求和(线性运算),无论叠多少层,整体仍等价于一层线性变换;加入非线性激活函数后,网络才能拟合复杂的非线性关系。

举例:输入x = [1, 2],权重w = [0.5, 0.4],偏置b = 0.1,则z = 0.5×1 + 0.4×2 + 0.1 = 1.4,经 ReLU 激活后输出a = max(0, 1.4) = 1.4。

2.3 关于"深度":层数与神经元个数

  • 网络的深度 = 隐藏层的层数(输入层和输出层不计入)。
  • 隐藏层越多,网络越"深",能提取的特征越抽象。
  • 课程约定:每个隐藏层的神经元至少 2 个——只有 1 个神经元的隐藏层等价于感知机,网络结构失去意义。
  • 开发经验:隐藏层神经元数按"前层多、后层逐层递减"的漏斗形设置,效果通常较好;具体数值没有公式,靠经验调参。

2.4 全连接层在哪里

全连接层(Fully Connected Layer,又称 Dense Layer / 稠密层)指前一层的每个神经元都与后一层的每个神经元相连的层:

  • 最朴素的 ANN(如多层感知机 MLP):整个网络全是全连接层。
  • CNN 中:全连接层在网络末端——前面卷积层、池化层负责提特征(保留空间结构),最后展平(Flatten)后接全连接层负责"综合所有特征做分类"。
  • RNN 中:全连接层也在末端——词嵌入层 → 循环网络层 → 全连接层输出结果。
  • 缺点:全连接意味着参数量最大,n个输入、m个输出需要n×m + m个参数,所以 CNN 里它总是放在最后"收口"。

2.5 底层数据结构:张量,且输入必须是二维

  • 深度学习框架底层的统一数据结构是张量(Tensor):0 维是标量、1 维是向量、2 维是矩阵、3 维及以上统称张量。
  • 张量中只能存放数值——所以文本、类别标签等都必须先转成数值才能进入网络。
  • ANN 的输入是二维张量:(样本数 × 特征数)。而图像天然是三维的(高 × 宽 × 通道),所以:
    • 要么先展平(Flatten)成向量再进全连接网络(会丢失空间结构);
    • 要么先用 CNN 提取特征、保留空间信息,再进全连接层——这就是 CNN 存在的意义(第四章展开)。

2.6 为什么说深度学习是黑盒

  • 深度学习模型内部的参数动辄百万千万,人无法逐个解读每个参数的含义,模型内部的运作机制相对不透明,因此被称为"黑箱",可解释性差。理解模型为什么做出特定决策比较困难,这对某些应用场景是一个挑战。
  • 更根本的问题:连"为什么 4 层比 3 层效果好"这类结构问题,目前也没有数学公式能解释。只有少数研究者尝试用数学工具(如神经正切核 NTK 等理论)去解释,业界仍以经验调参为主。

结构看懂了,下一个问题自然是:网络里成千上万个参数(w、b)是怎么定下来的?答案是训练——反向传播。

2.7 拓展:神经网络是怎么训练的——反向传播

以最简单的单参数模型y = wx + b为例,训练一共有四个步骤,循环往复:

① 前向传播(Forward):拿当前的参数算出预测值。

② 计算损失(Loss):用损失函数衡量预测值 ŷ 与真实值 y 的差距,如均方误差L = (ŷ − y)²。

③ 反向传播(Backpropagation):拿着结果反推——从损失出发,利用链式法则,逆向算出损失对每个参数的梯度(∂L/∂w、∂L/∂b)。梯度含义:参数往这个方向动一点,损失会怎么变。

④ 更新参数(权重):新参数 = 上一次的参数 − 学习率 × 梯度(梯度下降法,Gradient Descent),即:

w ← w − η · (∂L/∂w) b ← b − η · (∂L/∂b)

这就是"参数是在上一次的基础上加(减)一个修正量"——每次只修正一小步(步长由学习率 η 控制),而不是凭空重算。

数值示例:真实规律y = 4,输入x = 2,初始参数w = 1, b = 0,学习率η = 0.1:

步骤计算结果
前向传播ŷ = 1×2 + 0ŷ = 2
损失L = (2 − 4)²L = 4
求梯度∂L/∂w = 2(ŷ−y)·x = −8;∂L/∂b = 2(ŷ−y) = −4梯度都是负的
更新参数w = 1 − 0.1×(−8) = 1.8;b = 0 − 0.1×(−4) = 0.4w=1.8, b=0.4
再来一遍ŷ = 1.8×2 + 0.4 = 4.0L = 0,损失归零

为什么要循环:深度网络中参数动辄成千上万个,反向传播每轮把所有参数的梯度一次性算出并全部更新;更新完再用数据跑一遍"前向 + 反向",如此反复(数据完整过一遍叫一个epoch),直到损失不再明显下降,训练结束。

一句话总结:前向传播算损失,反向传播算梯度,梯度下降更新参数。

三、深度学习的特点

看完结构与训练方式,深度学习的四个特点就顺理成章了:

  • 多层非线性变换:模型由多个层次组成,每一层都应用非线性激活函数对输入数据进行变换(2.2 节)。较低层级捕捉简单特征(边缘、颜色等),更高层级识别更复杂的模式(物体、面部等)。
  • 自动特征提取:能自动从原始数据中学习有用的特征,不需要人工特征工程(对比 1.2 节机器学习的人工特征工程)。
  • 大数据和计算能力:通常需要大量标注数据和强大的计算资源(如 GPU)。大数据 + 高性能计算使深度学习在图像识别、自然语言处理等领域取得显著突破。
  • 可解释性差:内部运作机制不透明,被称为"黑箱"(2.6 节已展开)。
层级捕捉的特征
较低层级简单的特征(如边缘、颜色等)
更高层级更复杂的模式(如物体或面部识别)

四、常见深度学习模型:图像与文本怎么处理

传统机器学习处理图像、文本的能力较弱(1.2 节),深度学习针对不同数据类型发展出了专门的模型。先看总表,再逐个展开最常用的两个。

模型英文全称简称主要应用
卷积神经网络Convolutional Neural NetworksCNN图像识别、计算机视觉(CV)
循环神经网络Recurrent Neural NetworksRNN序列数据、自然语言处理(NLP)
自编码器AutoencodersAE数据降维、特征学习、异常检测
生成对抗网络Generative Adversarial NetworksGAN图像生成、数据增强
TransformerTransformer—自然语言处理、大模型基础
深度强化学习Deep Reinforcement LearningDRL游戏 AI、机器人控制
图神经网络Graph Neural NetworksGNN图结构数据、社交网络

4.1 图像 → CNN(计算机视觉 CV)

CV(Computer Vision,计算机视觉)领域使用CNN(Convolutional Neural Networks,卷积神经网络):

输入层 → 隐藏层(卷积层 → 池化层 → … → Flatten → 全连接层) → 输出层
  • 卷积层:用卷积核在图像上滑动,自动提取局部特征(边缘、纹理等),并保留图像的空间结构。用于图像分类、目标检测、图像分割等任务。
  • 池化层:缩小特征图尺寸,减少参数数量,提高计算效率。
  • 全连接层:位于网络末端,综合特征完成分类(呼应 2.4 节)。

图像的两种排布:HWC 与 CHW

排布顺序使用场景
HWC高(Height)× 宽(Width)× 通道(Channel)图像读取与存储的常见格式(如 OpenCV、PIL 读进来的图像),RGB 图通道为 3
CHW通道 × 高 × 宽PyTorch 等框架内部计算的格式(批量形式为 NCHW),送入网络前需要转换

图像张量是三维(HWC),而 ANN 只吃二维输入(2.5 节),这正是 CNN 要先卷积提特征、再 Flatten 进全连接层的原因。

4.2 文本 → RNN(自然语言处理 NLP)

NLP(Natural Language Processing,自然语言处理)领域使用RNN(Recurrent Neural Networks,循环神经网络):

输入层 → 词嵌入层(Embedding) → 循环网络层 → 全连接层 → 输出层
  • 词嵌入层:把文字(词)映射成低维数值向量——因为张量只能存数值(2.5 节),文本必须先数值化。
  • 循环网络层:具有"记忆功能",处理输入数据的时间依赖性;但标准 RNN 难以捕捉长期依赖关系(后来由 LSTM、GRU、Transformer 逐步解决)。
  • 全连接层:末端输出结果。

序列数据与依赖关系

  • 序列数据(Sequence Data):有先后顺序、前后相互关联的数据,如文本(词序)、语音、股价、传感器读数。
  • 时间依赖 / 长期依赖:当前的输出不仅取决于当前输入,还依赖之前出现过的信息。例如"我今天去银行,取了____",必须结合前文才能填出"钱"。
  • 梯度下降法(Gradient Descent)(课堂提到的"梯度"):训练时沿损失下降最快的方向更新参数,w ← w − η·∇L——已在 2.7 节反向传播中详细讲过,这里不再重复。
  • 语音的处理:声音信号先转成频谱图(Spectrogram)——横轴时间、纵轴频率的图像化序列特征——再作为序列数据输入 RNN。

4.3 其他模型要点

  • 自编码器(AE):由编码器(把输入压缩成低维表示)和解码器(从低维表示重建原始输入)两部分组成,无监督学习。
  • GAN:包含生成器(制造以假乱真的样本)和判别器(区分真假样本),二者对抗训练。现在热度已不高,图像生成领域逐渐被扩散模型(Diffusion Model,如 Stable Diffusion)取代,但原理仍值得学习。
  • Transformer:摒弃递归结构,采用自注意力机制(self-attention),可并行处理整个序列,在机器翻译、文本摘要等任务中表现出色,是 BERT、GPT 等大模型的基础。

4.4 深度学习计算框架

框架现状
PyTorch当前学界与工业界主流,接口接近 Python,上手容易
TensorFlow热度已明显下降(口语说"过时"),存量项目仍在使用
  • 两个框架底层都是张量运算,学会一个后另一个迁移成本很低。
  • Transformer 架构是后续大模型的基础,必须掌握。

五、应用场景

应用领域具体场景
计算机视觉图像分类、目标检测、人脸识别、图像生成
自然语言处理机器翻译、文本分类、情感分析、问答系统
自动驾驶环境感知、路径规划、决策控制
推荐系统个性化推荐、广告投放、内容分发
多模态与智能体图文理解与生成(文生图、视觉问答)、AI Agent(任务规划与工具调用)
医疗健康医学影像分析、疾病诊断、药物发现
工业与制造业质量检测、预测性维护、智能机器人
语音与音频处理语音识别、语音合成、音乐生成

此外,深度学习还广泛应用于智能安防、智能零售、智慧教育、智能家居、智能汽车等领域。

具体展开:

  • 计算机视觉(Computer Vision, CV)
    • 图像分类:将图像分为不同类别。如社交媒体自动标注照片、医疗影像病变检测。
    • 目标检测(Object Detection):在图像或视频中定位并分类多个对象。如自动驾驶中的行人检测、监控视频入侵检测。
    • 面部识别:分析面部特征进行身份验证。如手机解锁、安防监控。
    • 图像生成:基于输入生成新图像,如风格转换、超分辨率、老旧照片修复。
  • 自然语言处理(Natural Language Processing, NLP)(课堂在此补充了梯度、序列数据、长期依赖,见 4.2 节)
    • 机器翻译:一种语言自动翻译成另一种。如 Google 翻译、实时语音翻译。
    • 情感分析:分析文本情感倾向。如社交媒体监控、产品评论分析。
    • 文本生成:生成符合语法与语义的文本。如自动写作助手、新闻生成。
    • 语音识别:语音转文字。如智能助手、自动字幕。
    • 聊天机器人(Chatbot):理解用户输入并生成合理回应。如客服机器人、GPT 类模型。
  • 推荐系统(Recommendation Systems)
    • 电影、音乐推荐:根据历史评分与行为推荐。如 Netflix、Spotify。
    • 电商推荐:根据购买与浏览习惯推荐商品。如亚马逊、淘宝。
    • 社交媒体推荐:分析社交行为推荐内容或好友。如 Facebook、Instagram。

六、发展历史

6.1 人工智能发展历史

阶段时间主要特征标志性事件
符号主义20 世纪 50-70 年代专家系统占主导1950:图灵提出"图灵测试",并设计国际象棋程序
1962:IBM 的 Arthur Samuel 跳棋程序战胜人类高手(第一次浪潮)
统计主义20 世纪 80 年代-2000 年主要用统计模型解决问题1995:Cortes 和 Vapnik 提出支持向量机(SVM)
1997:IBM 深蓝战胜国际象棋世界冠军卡斯帕罗夫(第二次浪潮)
神经网络21 世纪初期神经网络、深度学习流派2012:AlexNet——深度学习在 CV 领域的开山之作
2016:Google AlphaGo 战胜李世石(第三次浪潮)
大规模预训练模型2017-至今大规模预训练模型2017:NLP 的 Transformer 框架出现
2018:BERT 和 GPT 出现
2022:ChatGPT 出现,进入大模型 AIGC 阶段

6.2 深度学习发展历史

阶段时间主要进展
早期探索1940s-1980s1943:McCulloch 和 Pitts 模仿生物神经系统构建计算模型(M-P 神经元)
1957:Frank Rosenblatt 提出感知器(Perceptron),能做简单二分类
1960 年代末:出现多层感知器(MLP),但受限于计算能力和数据量,应用受限
挑战与瓶颈1980s-1990s1986:Rumelhart、Hinton、Williams 发表反向传播(Backpropagation, BP)算法,使多层神经网络能通过梯度下降优化参数、解决复杂非线性问题
因计算资源限制,且对图像、语音等复杂数据处理能力较弱,深度学习未广泛应用;SVM、决策树等传统方法成为主流
复兴与突破2000s-2010s2006:Hinton 团队提出深度置信网络(DBN),引入无监督预训练,标志深度学习复兴
2012:Krizhevsky 等设计的AlexNet在 ImageNet(ILSVRC)竞赛中夺冠,将 Top-5 错误率从 26.2% 降至 15.3%,标志深度学习在 CV 领域的成功
2014:Goodfellow 提出生成对抗网络(GAN),开启生成模型新时代
2015:何恺明等提出ResNet(残差网络),解决梯度消失 / 爆炸问题,使训练上百层的网络成为可能
爆发期2016-至今2016:AlphaGo 战胜李世石,深度强化学习进入公众视野
2017:Transformer 框架出现,奠定预训练语言模型基础
2018:BERT 和 GPT 出现
2022:ChatGPT 出现,进入大模型 AIGC 阶段

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询