1. 为什么“数学期望”不是平均数的简单复读机?
很多人第一次接触数学期望,是在高中概率课上看到那个公式:$E(X) = \sum x_i p_i$ 或 $E(X) = \int_{-\infty}^{+\infty} x f(x)dx$。老师说:“这就是加权平均。”学生点头,抄下公式,考试前默写三遍,考完就忘——因为没真正理解它在现实世界里“长什么样”。
我带过七届统计学入门班,发现一个稳定现象:能熟练算出泊松分布期望是$\lambda$、正态分布期望是$\mu$的学生,面对一道题“某工厂每天故障次数服从参数为2.3的泊松分布,每故障一次损失850元,求日均损失期望值”,仍有近四成会卡壳。他们不是不会乘法,而是没意识到:期望是一个可线性操作的‘确定性映射’,它把随机性压缩成一个可决策的数字,但这个压缩过程有严格边界和隐含前提。
这正是数学期望最常被误读的核心:它不是对“过去发生过的数据”的总结(那是样本均值),而是对“未来所有可能结果按其发生概率加权后”的理论中心位置。就像你不会用“上周我家猫跳上窗台3次、没跳上2次”来预测明天它跳上去的概率,而是基于它肌肉力量、窗台高度、阳光角度等建模出一个概率分布,再算出“长期来看,它每天平均会成功跳上多少次”——这个“长期平均”,就是期望。
关键词“数学期望”“常见分布”“期望计算”“推导”背后,实际指向三个层次的问题:
- 第一层是机械计算:套公式、积分、求和,这是工具层面;
- 第二层是结构理解:为什么离散型用求和、连续型用积分?为什么二项分布期望是$np$而不用从定义硬积?这涉及测度论的简化表达,但从业者不需要懂勒贝格积分,只需要知道“概率质量函数(PMF)是离散点上的‘重量’,概率密度函数(PDF)是连续区间上的‘单位长度重量’”;
- 第三层是决策锚点:保险精算师用期望算保费,游戏策划用期望平衡道具掉落率,供应链经理用期望定安全库存——这些场景中,期望值直接变成KPI或约束条件,一旦推导逻辑出错,后续所有优化都是空中楼阁。
所以本文不从定义出发,而是从四个真实场景切入:
- 一个骰子掷100次,点数之和的期望是多少?(看似简单,但暴露独立同分布叠加的本质)
- 某App用户次日留存率服从Beta(2,5),求其期望留存率及95%置信区间?(揭示先验分布与期望的关系)
- 工厂设备寿命服从Weibull分布,维修成本与使用时长非线性相关,如何算期望总成本?(打破“期望只能线性传递”的迷思)
- 面试官问:“如果抛一枚不均匀硬币,正面概率p未知,你抛了10次得7次正面,p的期望估计是多少?”(直击贝叶斯估计与频率学派的根本分歧)
这些不是习题集里的标准题,而是我在给金融科技公司做风控模型、给教育APP做AB测试分析、给制造业客户做设备健康管理时,真实遇到的卡点。接下来,我们一层层剥开期望的皮,看看它里面到底是什么结构。
2. 从骰子到流水线:独立同分布(i.i.d.)下的期望叠加原理
先看最经典的例子:掷一个公平六面骰子,定义随机变量$X$为点数,则$X$的分布为
$$ P(X=k) = \frac{1}{6},\quad k=1,2,3,4,5,6 $$
按定义,期望为
$$ E(X) = \sum_{k=1}^6 k \cdot \frac{1}{6} = \frac{1+2+3+4+5+6}{6} = 3.5 $$
这个计算毫无难度。但真正关键的问题是:如果掷100次,记总点数为$S_{100} = X_1 + X_2 + \dots + X_{100}$,那么$E(S_{100})$是多少?
绝大多数初学者会脱口而出:“3.5 × 100 = 350”。这答案正确,但理由常被说错。常见错误回答是:“因为平均每次是3.5,所以100次就是350”。这混淆了大数定律的结论(样本均值收敛于期望)和期望的线性性质(可加性)。前者是极限行为,后者是确定性代数规则。
2.1 期望线性性的严格来源:不依赖独立性,只依赖可加性
期望的线性性是指:对任意两个随机变量$X,Y$(无论是否独立、是否相关),只要它们的期望存在,就有
$$ E(aX + bY) = aE(X) + bE(Y),\quad a,b\in\mathbb{R} $$
这个性质的根源在于积分(或求和)本身的线性性。以离散情形为例:
$$ E(X+Y) = \sum_{x,y} (x+y) P(X=x,Y=y) = \sum_{x,y} x P(X=x,Y=y) + \sum_{x,y} y P(X=x,Y=y) $$
而
$$ \sum_{x,y} x P(X=x,Y=y) = \sum_x x \sum_y P(X=x,Y=y) = \sum_x x P(X=x) = E(X) $$
同理第二项为$E(Y)$。注意:这里完全没有用到“X与Y独立”这个条件。相关性只影响方差,不影响期望的可加性。
提示:这是实务中最大的认知陷阱。很多工程师在建模多源误差叠加时,误以为“如果传感器A和B的测量误差相关,就不能直接加期望”,其实完全可加;真正受影响的是总误差的波动范围(即方差),而非其中心位置。
2.2 独立同分布(i.i.d.)带来的指数级简化:从100维联合分布到1维边缘分布
回到掷骰子问题。若$X_1,\dots,X_{100}$是i.i.d.,则$S_{100}$的分布是100个均匀分布的卷积,其PMF极其复杂(需计算所有和为s的整数解个数)。但求$E(S_{100})$时,我们根本不需要知道$S_{100}$的完整分布:
$$ E(S_{100}) = E\left(\sum_{i=1}^{100} X_i\right) = \sum_{i=1}^{100} E(X_i) = 100 \times E(X_1) = 350 $$
这个推导只用了两次线性性:一次是对求和号,一次是对标量乘法。i.i.d.的作用,是让所有$E(X_i)$都等于同一个值$E(X_1)$,从而把100项求和压缩成单次计算。如果骰子每天换一个(即非同分布),比如第i天骰子点数期望为$3.5 + 0.1i$,那结果就是$\sum_{i=1}^{100} (3.5 + 0.1i) = 350 + 0.1 \times \frac{100 \times 101}{2} = 855$——依然只需线性性,但不能“偷懒”用单一值代替。
2.3 实务陷阱:你以为的“独立”可能并不存在
我在给一家智能仓储系统做分拣效率建模时,曾犯过一个典型错误。系统有10个并行分拣口,每个口每小时处理订单数近似服从Poisson(λ=12)。我直接算总处理能力期望为$10 \times 12 = 120$单/小时。上线后发现实际日均只有约105单,且波动极大。
排查发现:当某个分拣口因机械故障停机时,系统会自动将它的订单重分配给其他在线口。这导致各口负载负相关——一个口低,其他口必然高。虽然单个口的边际分布仍是Poisson(12),但联合分布已非独立。此时$E(\sum X_i) = \sum E(X_i) = 120$依然成立(线性性保真),但方差远小于独立情形,且实际运行中因重分配延迟,部分订单超时作废,使得可观测的“有效处理量”期望值下降。
注意:期望的线性性永远成立,但“用单个单元期望推断系统能力”需要验证独立性假设。在物理系统中,资源竞争、故障传播、调度策略都会引入相关性,此时必须建模联合分布或用蒙特卡洛模拟,不能仅靠期望叠加。
3. 四大常见分布的期望推导:不只是套公式,而是看透构造逻辑
教科书常列一张表:二项分布$E(X)=np$,泊松分布$E(X)=\lambda$,正态分布$E(X)=\mu$,指数分布$E(X)=1/\lambda$。但如果你只记住结果,遇到变形题就会懵。比如:“某服务器请求到达服从Poisson过程,平均每小时5次,每次服务时间服从均值为10分钟的指数分布,求单位时间完成请求数的期望?”——这需要同时理解Poisson过程的到达率与指数分布的服务率如何耦合。
真正的掌握,在于理解每个分布的生成机制(generative process)和核心参数的物理意义。下面逐个拆解,全部给出从定义出发的推导,并标注每一步的实务含义。
3.1 二项分布:n次伯努利试验的“成功计数器”
定义:$X \sim \text{Bin}(n,p)$,表示n次独立伯努利试验中成功的次数,每次成功概率为p。
推导路径一(定义法):
$$ E(X) = \sum_{k=0}^n k \binom{n}{k} p^k (1-p)^{n-k} $$
利用组合恒等式$k \binom{n}{k} = n \binom{n-1}{k-1}$,得
$$ E(X) = \sum_{k=1}^n n \binom{n-1}{k-1} p^k (1-p)^{n-k} = np \sum_{j=0}^{n-1} \binom{n-1}{j} p^j (1-p)^{n-1-j} = np $$
最后一步的求和式恰为$(p+(1-p))^{n-1}=1$,即二项分布的全概率和为1。
推导路径二(指示变量法,强烈推荐):
令$X_i$为第i次试验的指示变量:$X_i = 1$(成功),$X_i = 0$(失败),则$X = X_1 + X_2 + \dots + X_n$。由于$P(X_i=1)=p$,故$E(X_i) = 1 \cdot p + 0 \cdot (1-p) = p$。由线性性:
$$ E(X) = \sum_{i=1}^n E(X_i) = np $$
实务心得:指示变量法是解决“计数类期望”的万能钥匙。例如,“某网页有100个按钮,每个按钮点击率独立为0.02,求平均每页点击数”,直接设$X_i$为第i个按钮是否被点击,$E(X) = 100 \times 0.02 = 2$。比硬套二项分布简洁十倍,且无需假设“按钮间完全独立”——只要每个$E(X_i)$可估,线性性就成立。
3.2 泊松分布:二项分布在n大p小下的极限形态
定义:$X \sim \text{Pois}(\lambda)$,$P(X=k) = e^{-\lambda} \frac{\lambda^k}{k!},\ k=0,1,2,\dots$
推导(定义法):
$$ E(X) = \sum_{k=0}^\infty k e^{-\lambda} \frac{\lambda^k}{k!} = e^{-\lambda} \sum_{k=1}^\infty \frac{\lambda^k}{(k-1)!} = e^{-\lambda} \lambda \sum_{j=0}^\infty \frac{\lambda^j}{j!} = e^{-\lambda} \lambda e^{\lambda} = \lambda $$
关键步骤是令$j=k-1$,并认出$\sum \lambda^j/j! = e^\lambda$。
为什么是$\lambda$?看它的出身:
泊松分布是二项分布$\text{Bin}(n,p)$在$n \to \infty, p \to 0$且$np \to \lambda$时的极限。既然二项分布期望是$np$,其极限自然为$\lambda$。这解释了$\lambda$的实质:单位时间/空间内事件发生的平均次数。例如,客服热线每小时呼入$\lambda=15$通,不是说“一定15通”,而是长期观测下,每小时平均15通——这个“平均”,就是期望值。
实务陷阱:泊松分布要求事件“稀疏且独立”。某电商大促期间,用户下单呈现脉冲式(秒杀开始瞬间涌入),此时用泊松拟合会导致期望估计严重偏低。应改用复合泊松或Hawkes过程。
3.3 正态分布:对称性与线性变换的完美结合
定义:$X \sim N(\mu,\sigma^2)$,PDF为$f(x) = \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}}$
推导(变量替换法):
$$ E(X) = \int_{-\infty}^{\infty} x \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}} dx $$
令$z = \frac{x-\mu}{\sigma}$,则$x = \mu + \sigma z$,$dx = \sigma dz$,代入得
$$ E(X) = \int_{-\infty}^{\infty} (\mu + \sigma z) \frac{1}{\sqrt{2\pi}} e^{-z^2/2} dz = \mu \int_{-\infty}^{\infty} \frac{1}{\sqrt{2\pi}} e^{-z^2/2} dz + \sigma \int_{-\infty}^{\infty} z \frac{1}{\sqrt{2\pi}} e^{-z^2/2} dz $$
第一项是$\mu \times 1 = \mu$(标准正态全概率为1);第二项被积函数是奇函数,在对称区间积分为0。故$E(X)=\mu$。
核心洞察:$\mu$是位置参数,$\sigma$是尺度参数。任何正态分布都可由标准正态$Z \sim N(0,1)$经线性变换$X = \mu + \sigma Z$得到。而$E(\mu + \sigma Z) = \mu + \sigma E(Z) = \mu$,因为$E(Z)=0$(由对称性直接得出)。这说明:正态分布的期望,就是其对称中心的位置。实务中,若你怀疑数据服从正态但均值偏移,直接看直方图峰值位置即可粗估$\mu$,无需复杂拟合。
3.4 指数分布:无记忆性决定的“等待时间期望”
定义:$X \sim \text{Exp}(\lambda)$,PDF为$f(x) = \lambda e^{-\lambda x},\ x \geq 0$
推导(分部积分法):
$$ E(X) = \int_0^\infty x \lambda e^{-\lambda x} dx $$
令$u = x$, $dv = \lambda e^{-\lambda x} dx$,则$du = dx$, $v = -e^{-\lambda x}$,得
$$ E(X) = \left[ -x e^{-\lambda x} \right]_0^\infty + \int_0^\infty e^{-\lambda x} dx = 0 + \left[ -\frac{1}{\lambda} e^{-\lambda x} \right]0^\infty = \frac{1}{\lambda} $$
(注:$\lim{x \to \infty} x e^{-\lambda x} = 0$,由洛必达法则)
为什么是$1/\lambda$?看它的故事:
指数分布描述“事件首次发生所需等待时间”,$\lambda$是单位时间发生率(如每分钟故障率0.05次)。直观上,平均等待时间自然是“1次故障需要等多久”,即$1 / 0.05 = 20$分钟。这与$E(X)=1/\lambda$完全一致。更深刻的是,无记忆性($P(X>s+t|X>s)=P(X>t)$)保证了:无论你已经等了多久,剩余等待时间的期望永远是$1/\lambda$。这解释了为何老设备“越用越容易坏”的直觉与指数分布矛盾——真实设备故障率随老化上升,应改用Weibull分布。
实务对比:某云服务SLA承诺“平均故障间隔时间(MTBF)≥10000小时”,若按指数分布,则$\lambda = 1/10000$每小时,年故障率$=1 - e^{-\lambda \times 8760} \approx 0.58$,即每年近60%概率宕机一次。这显然不合理,说明SLA中的“平均”是经验统计值,其底层分布并非指数,而是更复杂的混合分布。
4. 非标准场景下的期望计算:当“套公式”彻底失效时
前述四大分布是教科书基石,但现实问题往往更“野”。比如,你想知道“用户从注册到首购的平均时长”,但数据有大量未完成转化的右删失(censored)样本;或者“某算法推荐的点击率期望”,但点击行为受用户历史、上下文、曝光位置多重影响,无法用单一分布刻画。这时,必须跳出“找分布-套公式”思维,回归期望的本质定义。
4.1 删失数据下的期望:生存分析视角
假设你收集了1000名新用户数据,记录他们从注册到首购的天数。其中:
- 700人在30天内完成首购,时间记为$t_i$;
- 300人30天后仍未购买,时间记为“>30”(右删失)。
若直接用700个$t_i$的均值,会严重低估真实期望(因为删失样本中,有人可能在31天、100天后才买)。正确方法是用Kaplan-Meier估计器先拟合生存函数$S(t) = P(T > t)$,再通过
$$ E(T) = \int_0^\infty S(t) dt $$
计算期望。对于离散时间(如按天),近似为
$$ E(T) \approx \sum_{k=0}^M S(k) $$
其中$M$是最大观测时间。
我在为某在线教育平台做用户LTV建模时,就遇到此问题。课程购买周期长达1年,但项目周期仅3个月,大量用户处于“已注册未付费”状态。用K-M估计,得到首购时间期望为82天,而简单均值仅为41天——偏差整整一倍。这直接影响了获客成本(CAC)回收周期的判断。
4.2 条件期望:把“不确定”变成“可控制”
很多时候,我们不关心无条件期望$E(Y)$,而关心在给定某些信息下的期望$E(Y|X=x)$。例如:
- 给定用户年龄$x$,其月均消费$Y$的期望是多少?
- 给定服务器CPU使用率$x$,其1小时内宕机概率$Y$的期望是多少?
这本质上是回归问题:$E(Y|X=x)$是$Y$关于$X$的最佳预测(最小化均方误差)。若假设$Y|X=x \sim N(\beta_0 + \beta_1 x, \sigma^2)$,则$E(Y|X=x) = \beta_0 + \beta_1 x$。但实务中,我们常直接用机器学习模型(如XGBoost、神经网络)拟合条件期望函数,而不预设分布形式。
关键洞见:条件期望是决策的基石。比如,风控模型输出的“违约概率”本质就是$E(\text{违约}| \text{用户特征})$;推荐系统预估的“点击率”是$E(\text{点击}| \text{用户+物品+上下文})$。这些值直接用于排序、阈值判定、资源分配。
实务技巧:用“分箱+组内均值”快速估算条件期望。例如,将用户年龄每10岁分一箱,计算每箱用户的平均月消费。虽粗糙,但可作为基线模型,或用于验证复杂模型的合理性。我常用此法在模型上线前做快速归因:若30-40岁组的均值显著高于模型预测,说明模型在此区间存在系统性偏差。
4.3 变换后的期望:非线性函数的期望不能“套进去”
这是最高频的错误。已知$X \sim N(0,1)$,求$E(e^X)$。很多人想当然写$e^{E(X)} = e^0 = 1$,但正确答案是$e^{1/2} \approx 1.648$。原因:期望不满足非线性函数的交换律,即$E(g(X)) \neq g(E(X))$,除非g是线性函数。
通用解法是用分布的矩生成函数(MGF):若$M_X(t) = E(e^{tX})$存在,则$E(g(X))$可通过MGF或其导数获得。对正态分布,$M_X(t) = e^{\mu t + \sigma^2 t^2 / 2}$,故$E(e^X) = M_X(1) = e^{\mu + \sigma^2/2} = e^{0.5}$。
更普适的方法是Jensen不等式判别方向:若$g$是凸函数(如$e^x, x^2$),则$E(g(X)) \geq g(E(X))$;若凹函数(如$\log x, \sqrt{x}$),则$E(g(X)) \leq g(E(X))$。这能帮你快速检验答案合理性。例如,已知用户停留时长$T$期望为120秒,求$E(\log T)$,因$\log$凹,故$E(\log T) \leq \log 120 \approx 4.79$,若模型输出5.2,必有误。
5. 期望的实务边界:什么时候不该用期望做决策?
数学期望是强大工具,但滥用会引发灾难。2008年金融危机中,许多CDO(担保债务凭证)模型过度依赖违约率的期望值,却忽略尾部风险(即极端违约事件),最终崩盘。这提醒我们:期望只是分布的一个切片,它抹平了所有波动信息。
5.1 期望的“盲区”:方差、偏度、峰度同等重要
考虑两个投资选项:
- A:稳赚100万元;
- B:99%概率赚1亿元,1%概率亏99亿元。
计算期望:$E(A)=100$万,$E(B)=0.99 \times 10000 - 0.01 \times 990000 = 9900 - 9900 = 0$万。按期望,A远优于B。但若你是个人投资者,B的1%破产风险不可承受;若你是主权基金,B的长期复利优势可能更大。期望无法回答“风险偏好”问题,它只回答“长期重复无数次后的平均收益”。
实务中,我坚持用三指标评估:
- 中心趋势:期望(或中位数,对偏态分布更稳健);
- 离散程度:标准差(或分位差,如90%-10%分位数间距);
- 分布形状:偏度(衡量不对称性)、峰度(衡量尖峰厚尾)。
例如,某广告投放ROI数据偏度为3.2(右偏),说明多数投放ROI集中在低值,但有少量极高ROI案例拉高了期望。此时,用中位数(如1.8)比期望(如3.5)更能代表“典型投放效果”。
5.2 期望与效用:人的决策不是数学家的积分
经济学中,期望效用理论指出:人最大化的是$E(u(X))$,而非$E(X)$,其中$u(\cdot)$是效用函数,通常为凹函数(反映风险厌恶)。例如,对财富$w$,常用$u(w) = \log w$。此时,$E(\log w)$比$E(w)$更能刻画理性选择。
我在设计一款理财APP的风险测评问卷时,就嵌入了效用思想。不直接问“你能承受多大亏损”,而是给用户两组选项:
- A:确定获得10万元;
- B:50%概率获得25万元,50%概率获得0元。
多数人选A,说明其效用函数在该区间呈凹性。通过多组选择,可反推出个体效用曲线,进而为其匹配资产组合——这比用“风险承受能力评分”粗暴分级科学得多。
5.3 当期望不存在时:柯西分布的警示
并非所有分布都有期望。经典反例是柯西分布,PDF为$f(x) = \frac{1}{\pi(1+x^2)}$。其期望积分
$$ E(X) = \int_{-\infty}^{\infty} x \frac{1}{\pi(1+x^2)} dx $$
发散(因被积函数渐近于$1/x$,积分不收敛)。这意味着:无论你取多多样本,样本均值都不会收敛到某个固定值,而是永远在随机游走。
实务启示:当你发现数据的样本均值随样本量增加剧烈波动,且直方图呈现“尖峰+厚尾”(如金融收益率、网络延迟),应警惕柯西类分布。此时,用中位数、截尾均值(trimming)或M估计替代期望,否则所有基于期望的推断都将失效。
最后分享一个血泪教训:某CDN厂商用“平均响应时间”作为SLA指标,结果被黑客利用慢速攻击(slowloris)制造大量超长尾延迟,拉高平均值至2秒,但95%请求仍在50ms内完成。后来改为“P95响应时间≤200ms”,问题立刻暴露并解决。选择哪个统计量,本质是选择你愿意为哪种用户负责。