∫π每天一道数学题
← 返回概率统计
概率统计 · 第 8 讲 · 2026-09-16 · 约 10 分钟

第8讲 期望与方差——随机变量的数字特征

期望是加权平均,衡量「中心位置」;方差是波动程度,衡量「分散程度」。它们把随机变量的全部信息浓缩成两个数字,是概率论中最有力的概括工具。

从一个朴素的问题开始

有两个射手,甲和乙。他们的成绩如下:

  • 甲:8, 9, 10, 7, 11(平均 9 环)
  • 乙:5, 9, 9, 9, 13(平均也是 9 环)

两个人的平均分相同,都是 9 环。但你直觉上会觉得——甲的成绩更稳定,乙的成绩波动更大。

如何用数学语言精确描述「平均」和「稳定」?这就是数学期望和方差要解决的问题。

数学期望的定义

数学期望(简称期望)是随机变量所有可能取值的加权平均,权重就是每个值出现的概率。

对于离散型随机变量 XX,其分布列为 P(X=xi)=piP(X = x_i) = p_i(i=1,2,…i = 1, 2, \ldots),则 XX 的数学期望定义为:

E(X)=∑ixi⋅pi=x1p1+x2p2+⋯(1)E(X) = \sum_{i} x_i \cdot p_i = x_1 p_1 + x_2 p_2 + \cdots \qquad (1)

期望反映了随机变量取值的「平均水平」或「中心位置」。

期望的例子

还是摸球问题:袋子里有 3 个红球、2 个白球,从中任取 2 个,XX 为红球个数。

分布列为:

XX012
PP110\dfrac{1}{10}35\dfrac{3}{5}310\dfrac{3}{10}

期望为:

E(X)=0×110+1×35+2×310=0+0.6+0.6=1.2E(X) = 0 \times \dfrac{1}{10} + 1 \times \dfrac{3}{5} + 2 \times \dfrac{3}{10} = 0 + 0.6 + 0.6 = 1.2

这意味着:如果反复进行这样的摸球试验,红球个数的平均值会趋近于 1.2。

期望的直观意义

期望不是一个「一定会出现的值」。比如上面的例子,XX 只能取 0, 1, 2,但期望是 1.2,介于 1 和 2 之间。期望是长时期的平均值——如果你做足够多的重复试验,样本均值会收敛到期望。

这叫做大数定律:当试验次数 n→∞n \to \infty 时,样本均值 X1+X2+⋯+Xnn\dfrac{X_1 + X_2 + \cdots + X_n}{n} 依概率收敛到期望 E(X)E(X)。

再看一个更贴近生活的例子:你买了一张彩票,中奖概率是 1%,奖金是 1000 元。买一张彩票的「期望收益」是多少?

令 XX 为收益,则 P(X=1000)=0.01P(X = 1000) = 0.01,P(X=0)=0.99P(X = 0) = 0.99。

E(X)=1000×0.01+0×0.99=10 元E(X) = 1000 \times 0.01 + 0 \times 0.99 = 10 \text{ 元}

但要注意,彩票本身要花钱买,假设 2 元一张,那么净收益的期望是 10−2=810 - 2 = 8 元——不对,这里的 10 元是「中奖时的奖金」,而不是「净收益」。期望是加权平均,不是每次都能得到的值。 你买一张彩票,要么中 1000 元,要么 0 元,不可能得到 10 元。但如果你买 100 张,平均下来大约能中 1 张,总收入 1000 元,平均每张 10 元——这才体现了期望的「长期平均」含义。

示意图

两个分布的期望与方差对比

左图:两个分布期望相同(都在 5),但右图方差更大(更分散)

期望的性质

期望有一些非常好的运算性质,这些性质让复杂的期望计算变得简单。

性质 1:常数的期望

E(c)=c(2)E(c) = c \qquad (2)

常数的期望就是常数本身。

性质 2:线性性

E(aX+b)=a⋅E(X)+b(3)E(aX + b) = a \cdot E(X) + b \qquad (3)

这是期望最重要的性质——线性性。它告诉我们:对随机变量做线性变换,期望也做同样的线性变换。

这个性质的应用场景非常广:

  • 如果 XX 表示一次试验的结果,那么 aX+baX + b 表示变换后的结果,期望就是 aE(X)+baE(X) + b
  • 比如工资 = 底薪 3000 + 提成 10% × 销售额,销售额的期望是 50000,那么工资的期望就是 3000+0.1×50000=80003000 + 0.1 \times 50000 = 8000

性质 3:和的期望

E(X+Y)=E(X)+E(Y)(4)E(X + Y) = E(X) + E(Y) \qquad (4)

期望的和等于和的期望,不需要 XX 和 YY 独立。这条性质比线性性更通用——它适用于任意两个随机变量,不管它们是否相关。

这个性质的一个推论:如果 X1,X2,…,XnX_1, X_2, \ldots, X_n 是 nn 次独立重复试验中某事件发生的次数,且每次成功的概率为 pp,那么 X=X1+X2+⋯+XnX = X_1 + X_2 + \cdots + X_n,且 E(Xi)=pE(X_i) = p,所以 E(X)=npE(X) = np。这正是二项分布期望的推导!

方差的定义

期望告诉我们「平均值」,但没有告诉我们数据的「分散程度」。两个分布可以期望相同,但一个很集中,一个很分散。

方差就是刻画分散程度的数字。

对于离散型随机变量 XX,其期望为 E(X)=μE(X) = \mu,则 XX 的方差定义为:

D(X)=∑i(xi−μ)2⋅pi(5)D(X) = \sum_{i} (x_i - \mu)^2 \cdot p_i \qquad (5)

方差反映的是:每个取值与期望的偏离程度的加权平均。

方差的直观理解

方差越大,说明数据越分散;方差越小,说明数据越集中。

用射手的例子来说:

  • 甲:8, 9, 10, 7, 11,期望 9,方差 = (8−9)2+(9−9)2+(10−9)2+(7−9)2+(11−9)25=1+0+1+4+45=2\dfrac{(8-9)^2 + (9-9)^2 + (10-9)^2 + (7-9)^2 + (11-9)^2}{5} = \dfrac{1+0+1+4+4}{5} = 2
  • 乙:5, 9, 9, 9, 13,期望 9,方差 = (5−9)2+(9−9)2+(9−9)2+(9−9)2+(13−9)25=16+0+0+0+165=6.4\dfrac{(5-9)^2 + (9-9)^2 + (9-9)^2 + (9-9)^2 + (13-9)^2}{5} = \dfrac{16+0+0+0+16}{5} = 6.4

乙的方差更大,说明乙的成绩波动更剧烈。

方差的计算公式

方差的定义式(5)有时计算不太方便,我们常用下面这个等价公式:

D(X)=E(X2)−[E(X)]2(6)D(X) = E(X^2) - [E(X)]^2 \qquad (6)

这个公式的证明很简单:

E[(X−μ)2]=E(X2−2μX+μ2)=E(X2)−2μE(X)+μ2=E(X2)−2μ2+μ2=E(X2)−μ2E[(X - \mu)^2] = E(X^2 - 2\mu X + \mu^2) = E(X^2) - 2\mu E(X) + \mu^2 = E(X^2) - 2\mu^2 + \mu^2 = E(X^2) - \mu^2

即 D(X)=E(X2)−[E(X)]2D(X) = E(X^2) - [E(X)]^2。

用公式(6)计算:

  • E(X2)=∑xi2⋅piE(X^2) = \sum x_i^2 \cdot p_i
  • [E(X)]2=μ2[E(X)]^2 = \mu^2

两者相减就是方差。

方差的性质

性质 1:平移不变性

D(X+b)=D(X)(7)D(X + b) = D(X) \qquad (7)

给随机变量加上一个常数,只是把分布平移,不改变分散程度,所以方差不变。

性质 2:缩放性

D(aX)=a2⋅D(X)\q (8)D(aX) = a^2 \cdot D(X) \q (8)

给随机变量乘以一个常数,分散程度按平方倍放大(或缩小)。

性质 3:方差公式

综合性质 1 和 2:

D(aX+b)=a2⋅D(X)(9)D(aX + b) = a^2 \cdot D(X) \qquad (9)

期望与方差的具体分布

两点分布 B(1,p)B(1, p)

P(X=1)=pP(X = 1) = p,P(X=0)=1−pP(X = 0) = 1-p。

期望:E(X)=1⋅p+0⋅(1−p)=pE(X) = 1 \cdot p + 0 \cdot (1-p) = p。

方差:D(X)=E(X2)−[E(X)]2=p−p2=p(1−p)D(X) = E(X^2) - [E(X)]^2 = p - p^2 = p(1-p)。

二项分布 B(n,p)B(n, p)

利用期望的线性性,把 XX 分解为 nn 个独立的伯努利试验之和:

E(X)=E(X1+X2+⋯+Xn)=E(X1)+E(X2)+⋯+E(Xn)=npE(X) = E(X_1 + X_2 + \cdots + X_n) = E(X_1) + E(X_2) + \cdots + E(X_n) = np D(X)=D(X1)+D(X2)+⋯+D(Xn)=n⋅p(1−p)D(X) = D(X_1) + D(X_2) + \cdots + D(X_n) = n \cdot p(1-p)

所以二项分布的期望是 npnp,方差是 np(1−p)np(1-p)。

这两个公式在考试中经常直接使用,不需要每次都从定义推导。

深入理解

期望与方差的决策应用

期望和方差不只是数字,它们在决策中有着重要的作用。

例子:投资决策

你有两个投资机会:

  • 项目 A:预期收益 10 万元,方差 4 万元²
  • 项目 B:预期收益 10 万元,方差 16 万元²

两个项目的期望收益相同,但项目 A 的方差更小,意味着收益更稳定。风险厌恶型的投资者会选择项目 A;风险偏好型的投资者可能会选择项目 B——因为方差大,波动大,虽然风险也大,但有机会获得更高的收益。

这说明:期望和方差是互补的指标——期望告诉我们「平均赚多少」,方差告诉我们「波动有多大」。一个完整的决策需要同时考虑这两个指标。

期望和方差的几何意义

如果把随机变量的分布看作一个概率分布的「形状」,那么期望就是这个形状的「重心」,方差是这个形状的「宽度」。

期望越大,重心越靠右;方差越大,形状越宽(越扁平)。

这也就是为什么二项分布 B(n,p)B(n, p) 的期望 npnp 是分布的中心位置,而方差 np(1−p)np(1-p) 控制着分布的宽窄:pp 越接近 0 或 1,方差越小,分布越集中;p=0.5p = 0.5 时方差最大,分布最分散。

标准差:方差的「开根号」

方差的单位是随机变量单位的平方,有时候不太直观。所以我们定义标准差 σ(X)=D(X)\sigma(X) = \sqrt{D(X)},它的单位和 XX 一样,更容易理解。

比如射手甲的方差是 2,标准差是 2≈1.41\sqrt{2} \approx 1.41 环,意味着他的成绩大约在 9±1.419 \pm 1.41 环的范围内波动。

在高中数学体系里的位置

期望和方差是概率统计的核心内容,也是整个专题的收官之笔。

思想延伸:期望和方差体现了「用两个数字概括整个分布」的统计思想——把复杂的信息压缩成简洁的数字特征。这是统计学的基本方法,也是从高中走向大学数学的重要桥梁。

运算练兵场:期望和方差的计算是概率统计板块运算量最大的部分,涉及分布列、排列组合、代数运算,是高考解答题的主要考点。

高考地位:期望和方差是高考必考内容,几乎每年都有大题(12 分),背景可以是生产质量检验、体育比赛、经济效益等实际应用问题。题目设计注重考查学生对概念的理解和综合运用能力。

易错点:

  1. 期望和方差的公式混淆——期望是加权平均,方差是偏离平方的加权平均,不要搞混
  2. 忽视方差的性质——比如 D(aX+b)=a2D(X)D(aX+b) = a^2 D(X),a2a^2 容易漏掉
  3. 混淆期望和方差的应用场景——期望看「平均水平」,方差看「稳定程度」,决策时要同时考虑

思考与拓展

  1. 二项分布 B(n,p)B(n, p) 的期望是 npnp,方差是 np(1−p)np(1-p)。当 nn 固定、pp 变化时,方差什么时候最大?什么时候最小?
  2. 一个袋子里有 NN 个球,其中 MM 个红球。从中不放回地抽取 nn 个,令 XX 为红球个数(超几何分布)。求 E(X)E(X) 和 D(X)D(X)。(提示:把 XX 写成 nn 个指示变量的和)
  3. 某工厂生产的产品合格率为 95%。从产品中随机抽取 10 件,令 XX 为合格品数。求 E(X)E(X) 和 D(X)D(X)。如果合格率提高到 98%,期望和方差会怎样变化?
  4. 甲、乙两人独立投篮,命中率分别是 0.6 和 0.7。各投 5 次,求两人投中次数之差 Y=X甲−X乙Y = X_{\text{甲}} - X_{\text{乙}} 的期望和方差。

一句话总结

期望是加权平均,衡量中心位置;方差是偏离平方的加权平均,衡量波动程度;二项分布的期望是 np,方差是 np(1-p)。两个数字概括了整个分布的灵魂。

— Y. · 2026-09-16