∫π每天一道数学题
← 返回概率统计
概率统计 · 第 9 讲 · 2026-09-17 · 约 10 分钟

第9讲 正态分布——自然界最常见的分布

为什么身高、考试成绩、测量误差都服从同一种分布?因为正态分布是自然界最普遍的秘密语言。

从一个朴素的问题开始

你量过全班同学的身高吗?把所有人的身高数据画成一张图,会发生什么?

大概长这样:最矮的和最高的都很少,中间身高的最多,往两边逐渐减少,形成一个「中间高、两边低」的钟形曲线。

这不是巧合。考试成绩的分布、机器零件尺寸的误差分布、人的体重分布……几乎所有自然现象都呈现出这种形态。正态分布是自然界最常见的分布,它就像一个隐形的模式,悄悄藏在各种数据背后。

正态分布的定义

一般地,如果随机变量 XX 的概率密度函数为:

f(x)=12π σexp⁡ ⁣(−(x−μ)22σ2),x∈R(1)f(x) = \dfrac{1}{\sqrt{2\pi}\,\sigma} \exp\!\left(-\dfrac{(x-\mu)^2}{2\sigma^2}\right), \qquad x \in \mathbb{R} \qquad (1)

其中 μ\mu 和 σ\sigma(σ>0\sigma > 0)是常数,那么称 XX 服从正态分布(normal distribution),记作 X∼N(μ,σ2)X \sim N(\mu, \sigma^2)。

f(x)f(x) 的图像叫做正态曲线,也就是我们常说的「钟形曲线」。

示意图

正态分布与3σ原则

正态曲线关于 x=μx=\mu 对称,3σ3\sigma 原则告诉你:绝大部分数据落在均值附近

μ\mu 和 σ\sigma 的意义

公式 (1)(1) 中有两个参数,各自控制曲线的不同特征。

μ\mu 决定位置。它是分布的均值,也是曲线最高点的横坐标。曲线关于直线 x=μx = \mu 对称——左边和右边完全镜像。把 μ\mu 变大,整条曲线向右平移;把 μ\mu 变小,曲线向左平移。形状不变,只是位置变了。

σ\sigma 决定胖瘦。它是分布的标准差。σ\sigma 越大,曲线越「胖」、越扁平——数据越分散,远离均值的可能性越大;σ\sigma 越小,曲线越「瘦」、越尖锐——数据越集中在均值附近。

举个例子:两个班级的数学成绩都近似正态分布,A 班的平均分是 75 分、标准差是 5 分,B 班的平均分也是 75 分、标准差是 15 分。A 班大部分同学的分数集中在 70–80 分之间,而 B 班的分数分布更广,从 45 分到 105 分都有可能。两班的中心一样,但 B 班的成绩差异更大。

深入理解

正态曲线的几个关键特征

正态曲线有几个非常重要的性质,记住它们能帮你快速理解正态分布:

  1. 关于 x=μx = \mu 对称:曲线左半部分和右半部分完全镜像。因此 P(X<μ)=P(X>μ)=12P(X < \mu) = P(X > \mu) = \dfrac{1}{2}。
  2. 在 x=μx = \mu 处取得最大值:最大值是 12π σ\dfrac{1}{\sqrt{2\pi}\,\sigma}。注意最大值的大小和 σ\sigma 有关——σ\sigma 越小,曲线越尖,最高点越高。
  3. 曲线与 xx 轴围成的面积为 1:这是概率密度函数的基本要求。也就是说: ∫−∞+∞f(x) dx=1\int_{-\infty}^{+\infty} f(x)\,dx = 1
  4. 曲线向左右无限延伸:理论上正态分布取到任意实数都有可能,只是越远离均值,概率越小。但在实际中,距离均值超过 3σ3\sigma 的事件几乎不可能发生。
  5. 拐点在 x=μ±σx = \mu \pm \sigma:曲线在这两点由凹变凸,这是正态曲线形状变化的关键位置。

3σ原则——正态分布的实用法则

3σ原则是正态分布在实践中最重要的结论之一。它告诉我们:

P(μ−σ<X≤μ+σ)≈0.6827(2)P(\mu - \sigma < X \le \mu + \sigma) \approx 0.6827 \qquad (2) P(μ−2σ<X≤μ+2σ)≈0.9545(3)P(\mu - 2\sigma < X \le \mu + 2\sigma) \approx 0.9545 \qquad (3) P(μ−3σ<X≤μ+3σ)≈0.9973(4)P(\mu - 3\sigma < X \le \mu + 3\sigma) \approx 0.9973 \qquad (4)

也就是说:

  • 约 68.3% 的数据落在 (μ−σ, μ+σ)(\mu - \sigma,\, \mu + \sigma) 内
  • 约 95.4% 的数据落在 (μ−2σ, μ+2σ)(\mu - 2\sigma,\, \mu + 2\sigma) 内
  • 约 99.7% 的数据落在 (μ−3σ, μ+3σ)(\mu - 3\sigma,\, \mu + 3\sigma) 内

这被称为3σ原则(或68–95–99.7 法则)。

一个直观的理解是:正态分布下,偏离均值超过 3 个标准差的事件几乎不会发生。比如一个人的身高偏离平均值超过 3 个标准差,那他就非常罕见——现实中几乎不会遇到。

反过来:如果你发现一组数据中出现了"超出 μ±3σ\mu \pm 3\sigma 的值",那就值得警惕了——可能是数据记录有误,或者这组数据根本不是正态分布。

标准正态分布

当 μ=0\mu = 0、σ=1\sigma = 1 时,正态分布叫做标准正态分布,记作 N(0,1)N(0, 1)。它的密度函数特别简洁:

ϕ(x)=12πe−x2/2\phi(x) = \dfrac{1}{\sqrt{2\pi}} e^{-x^2/2}

任何一个正态分布 N(μ,σ2)N(\mu, \sigma^2) 都可以转化为标准正态分布——这个过程叫做标准化:

Z=X−μσ∼N(0,1)Z = \dfrac{X - \mu}{\sigma} \sim N(0, 1)

标准化的意义在于:不管原始数据的均值和标准差是多少,我们都可以把它们全部统一到同一个标准尺度上来比较。考试成绩就是这样——不同考试的满分和难度不同,但通过标准化,可以比较不同考试的成绩处于什么水平。

正态分布估计二项分布(简介)

前面几讲学过,二项分布 B(n,p)B(n, p) 描述的是 nn 次独立重复试验中成功次数的分布。当 nn 很大、pp 不接近 0 也不接近 1 时,二项分布的形状非常接近正态分布。具体来说:

B(n,p)≈N ⁣(np,  np(1−p))B(n, p) \approx N\!\left(np,\; np(1-p)\right)

这个结论叫做棣莫弗–拉普拉斯定理,是概率论历史上第一个中心极限定理。

举个例子:抛一枚均匀硬币 100 次,正面次数 X∼B(100,0.5)X \sim B(100, 0.5)。根据上述近似,XX 近似服从 N(50,25)N(50, 25),即均值 50、标准差 5。所以 P(40≤X≤60)≈P(−2≤Z≤2)≈0.9544P(40 \le X \le 60) \approx P(-2 \le Z \le 2) \approx 0.9544——也就是说,100 次抛硬币中,正面次数在 40 到 60 之间的概率约 95.4%。

高中阶段一般不要求严格证明这个定理,但知道这个近似关系很有用——当你算二项分布的概率太麻烦时,可以用正态分布来近似。

在高中数学体系里的位置

正态分布是整个概率统计板块的压轴内容,它在三个维度上都很重要。

思想延伸:正态分布体现了"局部不确定、整体有规律"的概率思想,也揭示了独立随机因素叠加会产生稳定分布这一深刻原理——这正是中心极限定理的核心。学懂了正态分布,你就理解了为什么统计推断如此有力。

运算练兵场:正态分布的考查重点不是复杂的计算,而是对 3σ 原则和标准化的理解与运用。题目通常会给出具体参数(比如某次考试分数 X∼N(100,100)X \sim N(100, 100)),然后让你用 3σ 原则估算某个区间的概率,或者求百分位数。关键是读懂题意、正确判断区间对应几个标准差。

综合题常客:高考中正态分布常作为解答题的一部分出现,和统计图表、假设检验等内容结合考查。近年来考题越来越重视实际应用背景,比如产品质量控制、考试成绩分析等场景。

易错点:

  1. 混淆 N(μ,σ2)N(\mu, \sigma^2) 的写法:第二个参数是方差 σ2\sigma^2,不是标准差 σ\sigma。比如 N(100,100)N(100, 100) 表示 μ=100\mu=100,σ2=100\sigma^2=100,即 σ=10\sigma=10。
  2. 3σ 原则的区间记混:68% 对应 1σ,95% 对应 2σ,99.7% 对应 3σ,要记牢。
  3. 忽略对称性:正态曲线关于均值对称,很多概率可以通过对称性快速计算,不要硬算。

思考与拓展

  1. 某次考试分数 X∼N(100,400)X \sim N(100, 400)(即 μ=100\mu=100,σ=20\sigma=20)。求分数在 80 分到 120 分之间的概率。
  2. 已知 X∼N(0,1)X \sim N(0, 1),且 P(X≤1.96)=0.975P(X \le 1.96) = 0.975。求 P(∣X∣>1.96)P(|X| > 1.96)。
  3. 工厂生产某种零件,长度 X∼N(10,0.01)X \sim N(10, 0.01)(单位:cm)。规定长度在 [9.85,10.15][9.85, 10.15] cm 之内为合格品。从一批产品中随机抽取 1000 件,大约有多少件是合格品?
  4. 用正态分布近似二项分布 B(100,0.3)B(100, 0.3),求 P(25≤X≤35)P(25 \le X \le 35) 的近似值(提示:μ=30\mu = 30,σ≈4.58\sigma \approx 4.58)。

一句话总结

正态分布由两个参数完全确定——μ\mu 定位置、σ\sigma 定胖瘦,3σ 原则告诉我们绝大部分数据落在均值附近三个标准差的范围内,这是自然界最优雅的规律之一。

— Y. · 2026-09-17