面试-为什么现在大模型不用dropout
2026/7/22 4:22:38 网站建设 项目流程

一、先搞懂:Dropout 基础原理(传统小模型时代)

1. 核心机制

Dropout 2012年由Hinton提出,训练阶段以固定概率随机把神经元激活置0;推理阶段全部神经元启用,并做尺度缩放保证输出均值不变(Inverted Dropout)。

2. 两大作用(小模型刚需)

  1. 打破神经元共适应:防止少量神经元绑定、死记训练噪声,强迫网络学习通用特征;
  2. 隐式集成效果:每个batch训练一个稀疏子网络,最终等价大量子网络投票,降低方差、缓解过拟合。

3. 传统Transformer用法(BERT/GPT2)

早期模型会在4个位置加dropout:

  • Embedding输入层dropout
  • Attention权重dropout(DropAttn)
  • Attention输出残差后dropout
  • MLP输出残差后dropout
    典型配置:p=0.1~0.3,BERT-base标准0.1。

二、现在主流LLM(Llama2/3、Mistral、GPT3+)预训练几乎删掉Dropout的6大核心原因

1. 根本前提:大模型预训练几乎不存在过拟合,Dropout“无病吃药”

(1)数据规模天然是最强正则

现代LLM预训练数据是万亿token级别,单epoch训练(每个文本样本只看一遍,极少重复):

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询